AI 短剧镜头提示词验收清单:导演交分镜前要核对的 12 项
提示词崩,多半不是模型不行,而是写得不可执行。把它当成分镜表来写:主体唯一、动作可拍、运镜单一、参考图与文字不打架,再套上兜底约束,出片稳定性会明显提升。
先把提示词当成一份分镜表,而不是一段文案
很多 AI 短剧翻车,问题不在模型档位,而在提示词本身同时塞了三件互相打架的事:描写人物长相、描写服装、又丢了一张定妆参考图。模型不知道听谁的,于是换脸、换装、串戏。
可执行的镜头提示词,是一份给模型看的分镜表,不是一段小说。 它回答的是「这一镜拍谁、在哪、做什么、怎么动、什么风格、哪些不许发生」,而不是「这个人物有多美、气氛有多虐」。
下面这份 12 项验收清单,按导演交分镜前的核对顺序排列。每一项都可以单独打勾,任何一项不达标,都值得回去改词而不是直接出片。
一、主体与动作:这一镜到底在拍谁
1. 主体是否唯一且可指认
一镜之内只允许一个视觉焦点。群像戏要拆镜,不要在同一段里让 A 转身、B 冲进来、C 摔杯子同时发生。
核对方法:把提示词里出现的人物名圈出来,如果超过一个人有动作动词,就拆。
2. 动作是否细化到肢体,并量化程度
「她很生气」是情绪,不是动作;「她右手攥紧衣角,指节发白,下唇微颤」才是可拍的动作。
| 小说腔 | 分镜表语言 |
|---|---|
| 他震惊地看着她 | 他瞳孔微缩,握杯的手停在半空,两秒后缓缓放下 |
| 两人激烈争吵 | 她前倾半步,食指戳向对方面门;对方后仰,肩膀绷紧 |
| 气氛紧张 | 两人对视,无人说话,背景烛火轻晃 |
原则:优先低缓、连续的小动作,减少高爆发动态。挥拳、奔跑、旋转这类大幅度动作最容易崩,能切镜就切镜。
3. 有参考图的人物,文字是否还在描写外貌
这是最常犯、也最致命的一条。
有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。
如果定妆图里她穿的是红衣,你又在提示词里写「白色长裙」,模型会在两套指令之间摇摆,结果就是换装、变色、甚至换脸。文字只负责图里没有的信息:这一镜她在哭、嘴角有血、头发被雨打湿。
二、环境与光影:把世界观钉死
4. 场景是否结构化到「内外 / 地点 / 日夜」
不要写「一个很有感觉的地方」。要写「内景,老旧茶馆,午后,光柱从木格窗斜射进来,桌面浮尘可见」。
场景信息越具体,模型自由发挥的空间越小,串戏概率越低。
5. 光影与色调是否一句话说清
光影决定质感,色调决定统一度。每场至少给一个明确的光位和一个主色调:
- 光位:侧逆光 / 顶光 / 窗光 / 霓虹混合光 / 烛光低位
- 色调:暖琥珀 / 冷青蓝 / 低饱和灰绿 / 高对比黑白
不要堆「电影感、氛围感、高级感」这类模型无法执行的形容词。
三、运镜:一镜一运镜
6. 是否只指定了一种运镜
一镜一运镜,禁止单镜内推拉摇移叠加。
错误写法:「镜头缓缓推近,然后环绕半圈,再拉远」——这是三个镜头,模型会糊成一团。
正确写法:二选一。要推就只写推,要环绕就只写环绕。
7. 是否用镜头序号,而不是绝对秒数
多镜头段落用「镜头 1 / 镜头 2 / 镜头 3」标号,不要写「0–3 秒推近,3–5 秒切特写」。
原因有两个:一是不同模型对秒数的理解差异很大;二是秒数一旦和实际生成时长对不上,整段节奏全乱。镜头序号是给模型看结构,不是给剪辑台看时间码。
8. 复杂场景是否走了三段式
简单场景一段写完即可。复杂的影视化场景,用三段式结构:
- 总体设定:场景、时间、光影、色调、风格,一次性交代
- 镜头 1 / 2 / 3……:每个镜头单独写主体、动作、景别、运镜
- 约束包:画质、面部稳定、无水印、风格锚定等统一兜底
这样做的好处是:总体信息不重复,镜头之间不串戏,约束条件集中管理。
四、约束与兜底:模型最容易忽略的部分
9. 是否带了强制兜底包
每段提示词结尾都应该有一组约束,至少包含:
- 画质要求(清晰、无压缩噪点)
- 面部稳定(五官不漂移、不融化)
- 无水印、无 Logo、无字幕
- 多人场景加「无双胞胎、无分身、无多余手指」
- 非写实画风加「风格锚定,不滑向写实」
这些东西看起来琐碎,但它们是模型在最后一步最容易偷懒的地方。
10. 台词、音效、BGM 是否用了规范符号
不要把台词混在叙述里。用统一符号标记,方便下游识别:
| 类型 | 符号 | 示例 |
|---|---|---|
| 台词 | {} | {你终于来了。} |
| 音效 | <> | <茶杯碎裂声> |
| BGM | () | (低沉弦乐渐起) |
规范符号的价值在于:它让提示词的结构对模型可读,而不是一堆混在一起的中文。
11. 是否只引用了本场素材,没有串戏
提示词生成时,只给本场的场景图、道具图、人物定妆图,禁止把其他集的素材带进来。
这听起来理所当然,但实际操作中,上一场的道具、上一集的服装、甚至别的剧的角色,都可能因为素材管理混乱被误绑。开拍前过一遍参考图映射表,顺序是:场景图 → 本场道具图 → 人物定妆图。有图才占槽位,没图就标「仅文字」,不要硬凑。
12. 是否做了合规清洗
交付给模型之前,剥离具体的影视作品名、IP 角色名、真人明星姓名。保留技法和美学描述(比如「九十年代日漫质感」「港式霓虹光影」),但不要写「像某某电影的某某镜头」。
如果参考图被识别为疑似真人照片,不要硬拍。改用平台绘制链路重新出定妆图,再绑定拍摄——否则下游可能直接拦截,或者出来一张怎么看都像某位明星的脸,法务风险很高。
一份可以直接用的自检流程
写完一段提示词,按这个顺序过一遍,通常不超过两分钟:
- 主体唯一吗?
- 动作是肢体动作还是情绪形容词?
- 有参考图的人物,我有没有手贱又写了服装外貌?
- 场景写到内外 / 地点 / 日夜了吗?
- 光影和色调各有一句吗?
- 运镜是不是只有一种?
- 多镜头用序号了吗?
- 复杂场景走三段式了吗?
- 兜底约束加了吗?
- 台词音效用规范符号了吗?
- 参考图只绑了本场吗?
- 有没有留下 IP 名或真人姓名?
十二项全过,再点生成。
这套规范解决什么,不解决什么
它解决的是提示词层面的可执行性问题:让模型知道拍什么、怎么拍、什么不能做。它不解决的是模型本身的能力上限——如果某个档位在多人互动、复杂肢体接触上就是会崩,再规范的提示词也只能降低概率,不能消灭崩片。
所以专业流程里,同一场多拍几条 take、改词再拍、择优使用,仍然是必要环节。提示词规范降低的是返工率,不是消灭返工。
系统在教模型用分镜表语言说话,而不是写小说。但最终判断这条 take 能不能用的,仍然是导演和监制。
---
关于猫斯卡:猫斯卡(Maosika)是 AI 竖屏短剧生产操作系统,提供从创意评估、剧本写作、角色定妆、场块切分到多模态出片的全链路生产流程。上述镜头提示词规范已固化在猫斯卡的视频拍摄链路中:剧本自动切为约 10 秒场块,每场绑定场景图、道具图、人物定妆图,按八大要素与三段式结构生成可编辑的工程化提示词,并支持改词重拍、换图重拍与多 take 择优。了解更多请访问 www.maosika.com。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com