复杂场景的三段式提示词:总体设定、镜头序列、约束包
复杂场景别用一段长提示词硬塞。把它拆成总体设定、镜头序列、约束包三段,先定环境基调,再按镜头序号写动作与运镜,最后兜底画质与一致性,模型更稳,返工更少。
为什么一段式提示词在复杂场景里容易崩
简单场景——一个人站在窗前说话、一个背影走在走廊里——一段提示词够用。但一旦场景里出现多人、多动作、多机位切换、光影变化、道具交互,一段式写法就会出问题:模型不知道哪句是环境、哪句是动作、哪句是兜底要求,经常把运镜叠在一起、把动作顺序打乱、把约束当成画面内容画出来。
三段式提示词是把片场的分镜表逻辑搬进提示词:先告诉模型「这是哪里、什么时间、什么气氛」,再按镜头序号一条一条写「谁在做什么、镜头怎么动」,最后用一个独立段落把画质、稳定性、禁忌项打包兜底。三段各司其职,互不打架。
三段式的结构
三段之间用空行隔开,不要用花哨的分隔符。模型对空行分段的识别最稳定。
| 段落 | 作用 | 写什么 | 不要写什么 |
|---|---|---|---|
| 第一段:总体设定 | 锚定整场的环境与基调 | 场景地点、时间、天气、光影、色调、整体视觉风格、在场人物与位置关系 | 具体动作、台词、镜头运动 |
| 第二段:镜头序列 | 按镜头序号写动作与运镜 | 镜头1/2/3……每个镜头的主体、动作细节、景别、单一运镜、台词与音效 | 绝对秒数(如「0–3秒」)、一个镜头里叠多个运镜 |
| 第三段:约束包 | 兜底画质与一致性 | 画质要求、面部稳定、无水印Logo、多人场景防双胞胎、风格锚定、参考图约束 | 新的动作或剧情信息 |
第一段:总体设定
总体设定只回答一个问题:观众推开这扇门,第一眼看到的是什么样的空间?
要写的内容:
- 空间:内景还是外景、具体地点(如「老旧派出所审讯室」「山顶悬崖边的青石平台」)。
- 时间与光线:日夜、光源方向、色温倾向(如「深夜,头顶一盏日光灯,冷白光,墙面发绿」)。
- 色调与气氛:整体色调倾向、空气感(如「潮湿、压抑,阴影浓重」)。
- 人物站位:谁在场、大致位置关系(如「男主坐在铁椅上,背对门口;女警站在桌后,手里夹着文件」)。
- 视觉风格锚点:画风路径已经在系统侧注入,这里只补本场特有的风格偏移(如「轻微手持纪实感」)。
这一段不要出现「镜头推近」「她转身」这类动作或运镜指令。动作归第二段管。
一个反例:「深夜审讯室,冷白灯光,男主坐在椅子上,镜头慢慢推近他的脸,他突然抬头……」——这里把环境、动作、运镜搅在一起,模型会分不清优先级。
第二段:镜头序列
镜头序列是三段里最核心的一段。它的写法直接决定成片的可控程度。
用镜头序号,不用绝对秒数
写「镜头1」「镜头2」「镜头3」,不要写「0–3秒」「3–6秒」。原因有两个:一是不同模型对时长的理解差异很大,秒数约束经常失效;二是镜头序号天然对应剪辑台上的clip顺序,后期调整时改序号比改秒数清晰得多。
一镜一运镜
每个镜头只给一个运镜指令。「推」「拉」「摇」「移」「跟」「固定」,选一个。禁止写「镜头先推近再横摇到门口」——单镜内叠加运镜是AI视频崩坏的高频原因,模型会在两种运动之间拉扯,画面容易抖、糊、变形。
如果确实需要从A运动到B,拆成两个镜头。
动作要细化、要量化
「他很生气」是小说语言,不是分镜语言。要写成肢体细节加程度:
- ❌「他很生气,拍了桌子」
- ✅「他右手猛地拍在桌面上,指节发白,上身前倾,眉头紧锁,牙关咬紧」
程度量化是给模型一个动作幅度的锚点:「微微点头」和「狠狠点头」是两种完全不同的画面,「缓缓站起」和「猛地站起」也是。优先写低缓连续动作,减少高爆发动态——后者在当前视频模型里更容易出现肢体崩坏。
台词、音效、BGM 的符号规范
- 台词用花括号:
{你到底是谁派来的} - 音效用尖括号:
<铁门哐当关上> - BGM 用圆括号:(低频弦乐持续铺底)
这些符号不是装饰,是给下游渲染链路的标记,让它知道哪段要对口型、哪段要配音效、哪段是音乐层。
一个镜头序列的示例骨架
`` 镜头1:中景,固定机位。男主坐在铁椅上,双手交叉放在桌面,指尖微微收紧,目光低垂。{我没什么好说的。} 镜头2:近景,缓慢推近。女警站在桌后,把文件轻轻摊开,抬眼直视男主,嘴角没有表情。<纸张摩擦桌面> 镜头3:特写,固定。男主的瞳孔轻微收缩,喉结上下动了一下,右手食指在桌面上极轻地敲了两下。(心跳声渐起) ``
注意三个镜头的运镜:固定、推近、固定,没有叠加。动作都是可执行的肢体细节,没有形容词堆砌。
第三段:约束包
约束包是兜底段,每场都要有,而且写法相对固定。它不创造新内容,只负责防止常见崩坏。
标准约束包包含:
- 画质兜底:高清、细节清晰、无模糊、无噪点异常。
- 面部稳定:人物面部五官稳定,不畸变,不漂移。
- 无水印无Logo:画面中不出现任何文字水印、平台标识、乱码字符。
- 多人场景防分身:当场景里有两个及以上人物时,明确写「多人区分明显,不出现双胞胎脸、不出现多余肢体、不出现重复人物」。
- 风格锚定:非写实画风要在这里重申风格锚点,防止模型在复杂动作下漂移回写实。
- 参考图约束:有参考图的人物,文字不再描写服装与外貌,只写动作、表情、伤情。
约束包要放在最后。放在前面或中间,模型可能把约束词当成画面内容的一部分去生成(比如真的在画面里画出「无水印」三个字)。
什么时候用三段式,什么时候用一段式
不是所有场景都需要三段式。判断标准很简单:
| 场景复杂度 | 推荐写法 | 典型场景 |
|---|---|---|
| 单人、单一动作、单一景别 | 一段式 | 人物特写说台词、空镜、背影走路 |
| 2–3人、有对话或道具交互、1–2个镜头 | 一段式或简化两段 | 两人对坐谈话、递东西、开门 |
| 多人、多动作节拍、多机位切换、光影复杂 | 三段式 | 对峙、打斗、群像、追逐、情绪爆发戏 |
硬规则是:只要你发现自己在一段提示词里写了超过两个运镜、或者超过三个动作节拍,就该拆三段。
几个常见的返工原因
- 总体设定里塞了动作:模型会把动作当成环境的一部分反复执行,导致人物在镜头1就开始做镜头3的事。
- 镜头序列里用了绝对秒数:不同模型对时长的换算不一致,经常出现镜头2的内容跑到镜头1的时间里。
- 一镜多运镜:推+摇、跟+升这类组合是画面抖动和变形的高发区。
- 约束包写在中间:模型把「无水印」「面部稳定」当成画面元素处理。
- 动作写得太抽象:「他很激动」「气氛紧张」这类词模型无法执行,必须翻译成肢体和光影。
这套写法的边界
三段式是工程化的提示词结构,它解决的是「模型能不能按你想的顺序和方式执行」的问题,不解决「你想的东西本身好不好看」的问题。审美判断——这个镜头该不该推、这句台词该不该给特写、这场戏的节奏对不对——仍然在导演和编剧手里。
另外,约10秒的场块是工程启发式,不是时间码精剪。超长场会被再拆,但仍可能出现偏长的块;精剪与串场成片需要后续剪辑环节完成。当前的产品单元是「单场多模态参考 → 单段成片」,不做跨场自动续写或延长视频的产品化工作流。
系统在教模型用分镜表语言说话,而不是写小说。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com