用镜头序号,别用秒数:提示词里的时间表达
AI 短剧提示词里写「0–3 秒做什么、3–6 秒做什么」,模型往往把它当小说时间轴,而不是镜头指令。正确做法是用镜头序号切分动作,一镜一运镜,让模型按分镜表说话。
为什么「秒数」是坏指令
很多人写视频提示词的第一反应是按时间码排:
0–3 秒:女主推门进入办公室,镜头从背后推近;3–6 秒:她看到桌上的文件,特写手部;6–9 秒:抬头,眼神震惊。
这种写法对人类剪辑师是清楚的,但对视频生成模型有三个问题:
- 模型不读秒。它理解的是一段连续的视觉描述,不是精确到秒的剪辑点,「0–3 秒」经常被忽略或平均化。
- 动作被压扁。多个动作挤在一段时间里,模型倾向于挑最显眼的那个做,其余丢帧或糊掉。
- 运镜叠加。你在同一段时间里既写「推近」又写「特写」又写「抬头」,模型会把推拉摇移叠在一个镜头里,画面晃、脸崩。
系统在教模型用分镜表语言说话,而不是写小说。
分镜表的基本单位是「镜头」,不是「秒」。一个镜头里只发生一件主要的事,只用一种运镜。
镜头序号写法:三段式结构
把一段约 10 秒的场块,按镜头序号拆开。复杂影视化场景推荐三段论:
| 段落 | 作用 | 写什么 |
|---|---|---|
| 总体设定 | 交代场景与基调 | 地点、时间、光影、色调、视觉风格、画质兜底 |
| 镜头 1 / 镜头 2 / 镜头 3 … | 每个镜头独立成行 | 主体、动作细节、运镜方式、景别 |
| 约束包 | 防止翻车的硬规则 | 面部稳定、无水印、不串戏、风格锚定 |
改写上面的例子:
总体:现代办公室内景,午后冷白光,都市写实风格,画质清晰,面部稳定。
镜头 1:女主背对镜头推门进入,中景,镜头缓慢跟拍她走向办公桌。
镜头 2:桌面文件的特写,一只手入画拿起文件,镜头静止。
镜头 3:女主抬头,近景,眼神骤然收紧,镜头静止,微推。
约束:无水印、无 Logo;人物以参考图为准,文字不描写服装外观;动作低缓连续。
注意三点:
- 一镜一运镜。镜头 1 是「跟拍」,镜头 2 是「静止」,镜头 3 是「微推」,每个镜头只挂一种运镜。
- 用镜头序号,不用绝对秒数。不写「0–3 秒」,让模型自己按镜头顺序分配时长。
- 动作低缓连续。优先走、看、转头、抬手这类连续动作,少写「猛地转身」「一拳砸桌」这类高爆发动作——后者最容易崩。
简单场景用一段式
不是每场都要三段。动作单一、人物少、没有运镜变化的场(比如人物站着说一句话),一段式就够:
夜晚街边路灯下,男主侧身站立,点烟,火苗照亮半张脸,都市写实,中景静止镜头,画质清晰,面部稳定,无水印。
判断标准很简单:这场戏里如果有两个以上动作节拍或景别变化,就拆镜头;只有一个,就一段写完。
符号规范:台词、音效、BGM
镜头里出现声音元素时,用固定符号标记,不要混在正文里:
| 元素 | 符号 | 示例 |
|---|---|---|
| 台词 | {} | {你以为你赢了?} |
| 音效 | <> | <门被猛地推开> |
| BGM | () | (低频紧张弦乐渐起) |
写法示例:
镜头 2:男主抬眼直视镜头,近景静止,{你以为你赢了?},<手指关节轻叩桌面>,(低频弦乐持续)。
符号化的好处是模型能把声音和画面分开处理,不会把台词内容当成画面里要出现的文字。
强制兜底包:每场都要带的几条
不管场景简单还是复杂,约束包里有几条是每场都建议带上的:
- 画质清晰、面部稳定、无水印、无 Logo;
- 有参考图的人物,禁止再用文字描写服装 / 外观,以参考图为准,文字只写动作、表情、伤情;
- 多人场景加「无双胞胎、无分身、无多余手指」;
- 非写实画风加风格锚定(如「统一九十年代日漫质感,不混入写实」);
- 本场只出现本场剧本里的人物与道具,禁止串戏。
有参考图的人物,禁止再用文字描写服装外观——文字只写动作、表情、伤情。
这条是角色一致性的硬约束,和「用镜头序号」是配套的:前者管「人长什么样」,后者管「人在镜头里做什么」,两件事不要混在一句话里。
常见翻车与修正
| 翻车写法 | 问题 | 修正 |
|---|---|---|
| 0–5 秒男主从走廊走到门口,5–10 秒推门进入,镜头一直推近并环绕 | 秒数被忽略;推近+环绕叠加 | 拆成镜头 1 跟拍走廊、镜头 2 推门静止中景 |
| 镜头里女主穿着红色风衣快步走过,表情愤怒 | 有参考图还写服装,容易和参考打架 | 删掉「红色风衣」,只留「快步走过,表情愤怒」 |
| 一个镜头:男主转身、拔枪、射击、弹壳飞出,镜头快速推拉 | 动作过多+运镜混乱 | 拆成三个镜头,每个镜头一个动作、一种运镜 |
| 画面像电影《某某》的质感 | 具体 IP 名可能触发版权拦截 | 改成技法描述:「低饱和冷调,手持轻微晃动感」 |
边界要讲清楚
镜头序号是工程规范,不是魔法。有几件事它做不到:
- 不是时间码精剪。镜头序号告诉模型「按顺序拍这几个镜头」,但不保证每个镜头精确到几秒,最终成片的节奏仍需要后期剪辑调整。
- 不做跨场自动续写。每个场块是独立单元,当前不支持把上一场的最后一帧自动续到下一场。
- 提示词里的参考代号靠规范引导,不做二次硬拼。写完后仍要人工确认参考图、角色绑定、道具纳入是否齐全。
把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。镜头序号、符号规范、兜底包,都是把「模型容易自由发挥的地方」钉死,让导演的分镜意图能落到每一帧上。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com