用镜头序号,别用秒数:提示词里的时间表达

猫斯卡编辑部 | 最后更新日期

AI 短剧提示词里写「0–3 秒做什么、3–6 秒做什么」,模型往往把它当小说时间轴,而不是镜头指令。正确做法是用镜头序号切分动作,一镜一运镜,让模型按分镜表说话。

为什么「秒数」是坏指令

很多人写视频提示词的第一反应是按时间码排:

0–3 秒:女主推门进入办公室,镜头从背后推近;3–6 秒:她看到桌上的文件,特写手部;6–9 秒:抬头,眼神震惊。

这种写法对人类剪辑师是清楚的,但对视频生成模型有三个问题:

  1. 模型不读秒。它理解的是一段连续的视觉描述,不是精确到秒的剪辑点,「0–3 秒」经常被忽略或平均化。
  2. 动作被压扁。多个动作挤在一段时间里,模型倾向于挑最显眼的那个做,其余丢帧或糊掉。
  3. 运镜叠加。你在同一段时间里既写「推近」又写「特写」又写「抬头」,模型会把推拉摇移叠在一个镜头里,画面晃、脸崩。

系统在教模型用分镜表语言说话,而不是写小说。

分镜表的基本单位是「镜头」,不是「秒」。一个镜头里只发生一件主要的事,只用一种运镜。

镜头序号写法:三段式结构

把一段约 10 秒的场块,按镜头序号拆开。复杂影视化场景推荐三段论:

段落作用写什么
总体设定交代场景与基调地点、时间、光影、色调、视觉风格、画质兜底
镜头 1 / 镜头 2 / 镜头 3 …每个镜头独立成行主体、动作细节、运镜方式、景别
约束包防止翻车的硬规则面部稳定、无水印、不串戏、风格锚定

改写上面的例子:

总体:现代办公室内景,午后冷白光,都市写实风格,画质清晰,面部稳定。

镜头 1:女主背对镜头推门进入,中景,镜头缓慢跟拍她走向办公桌。

镜头 2:桌面文件的特写,一只手入画拿起文件,镜头静止。

镜头 3:女主抬头,近景,眼神骤然收紧,镜头静止,微推。

约束:无水印、无 Logo;人物以参考图为准,文字不描写服装外观;动作低缓连续。

注意三点:

  • 一镜一运镜。镜头 1 是「跟拍」,镜头 2 是「静止」,镜头 3 是「微推」,每个镜头只挂一种运镜。
  • 用镜头序号,不用绝对秒数。不写「0–3 秒」,让模型自己按镜头顺序分配时长。
  • 动作低缓连续。优先走、看、转头、抬手这类连续动作,少写「猛地转身」「一拳砸桌」这类高爆发动作——后者最容易崩。

简单场景用一段式

不是每场都要三段。动作单一、人物少、没有运镜变化的场(比如人物站着说一句话),一段式就够:

夜晚街边路灯下,男主侧身站立,点烟,火苗照亮半张脸,都市写实,中景静止镜头,画质清晰,面部稳定,无水印。

判断标准很简单:这场戏里如果有两个以上动作节拍或景别变化,就拆镜头;只有一个,就一段写完。

符号规范:台词、音效、BGM

镜头里出现声音元素时,用固定符号标记,不要混在正文里:

元素符号示例
台词{}{你以为你赢了?}
音效<><门被猛地推开>
BGM()(低频紧张弦乐渐起)

写法示例:

镜头 2:男主抬眼直视镜头,近景静止,{你以为你赢了?},<手指关节轻叩桌面>,(低频弦乐持续)。

符号化的好处是模型能把声音和画面分开处理,不会把台词内容当成画面里要出现的文字。

强制兜底包:每场都要带的几条

不管场景简单还是复杂,约束包里有几条是每场都建议带上的:

  • 画质清晰、面部稳定、无水印、无 Logo;
  • 有参考图的人物,禁止再用文字描写服装 / 外观,以参考图为准,文字只写动作、表情、伤情;
  • 多人场景加「无双胞胎、无分身、无多余手指」;
  • 非写实画风加风格锚定(如「统一九十年代日漫质感,不混入写实」);
  • 本场只出现本场剧本里的人物与道具,禁止串戏。

有参考图的人物,禁止再用文字描写服装外观——文字只写动作、表情、伤情。

这条是角色一致性的硬约束,和「用镜头序号」是配套的:前者管「人长什么样」,后者管「人在镜头里做什么」,两件事不要混在一句话里。

常见翻车与修正

翻车写法问题修正
0–5 秒男主从走廊走到门口,5–10 秒推门进入,镜头一直推近并环绕秒数被忽略;推近+环绕叠加拆成镜头 1 跟拍走廊、镜头 2 推门静止中景
镜头里女主穿着红色风衣快步走过,表情愤怒有参考图还写服装,容易和参考打架删掉「红色风衣」,只留「快步走过,表情愤怒」
一个镜头:男主转身、拔枪、射击、弹壳飞出,镜头快速推拉动作过多+运镜混乱拆成三个镜头,每个镜头一个动作、一种运镜
画面像电影《某某》的质感具体 IP 名可能触发版权拦截改成技法描述:「低饱和冷调,手持轻微晃动感」

边界要讲清楚

镜头序号是工程规范,不是魔法。有几件事它做不到:

  • 不是时间码精剪。镜头序号告诉模型「按顺序拍这几个镜头」,但不保证每个镜头精确到几秒,最终成片的节奏仍需要后期剪辑调整。
  • 不做跨场自动续写。每个场块是独立单元,当前不支持把上一场的最后一帧自动续到下一场。
  • 提示词里的参考代号靠规范引导,不做二次硬拼。写完后仍要人工确认参考图、角色绑定、道具纳入是否齐全。

把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。镜头序号、符号规范、兜底包,都是把「模型容易自由发挥的地方」钉死,让导演的分镜意图能落到每一帧上。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com