复杂场景的三段式提示词:总体设定、镜头序列、约束包

猫斯卡编辑部 | 最后更新日期

复杂场景别用一段长提示词硬塞。把它拆成总体设定、镜头序列、约束包三段,先定环境基调,再按镜头序号写动作与运镜,最后兜底画质与一致性,模型更稳,返工更少。

为什么一段式提示词在复杂场景里容易崩

简单场景——一个人站在窗前说话、一个背影走在走廊里——一段提示词够用。但一旦场景里出现多人、多动作、多机位切换、光影变化、道具交互,一段式写法就会出问题:模型不知道哪句是环境、哪句是动作、哪句是兜底要求,经常把运镜叠在一起、把动作顺序打乱、把约束当成画面内容画出来。

三段式提示词是把片场的分镜表逻辑搬进提示词:先告诉模型「这是哪里、什么时间、什么气氛」,再按镜头序号一条一条写「谁在做什么、镜头怎么动」,最后用一个独立段落把画质、稳定性、禁忌项打包兜底。三段各司其职,互不打架。

三段式的结构

三段之间用空行隔开,不要用花哨的分隔符。模型对空行分段的识别最稳定。

段落作用写什么不要写什么
第一段:总体设定锚定整场的环境与基调场景地点、时间、天气、光影、色调、整体视觉风格、在场人物与位置关系具体动作、台词、镜头运动
第二段:镜头序列按镜头序号写动作与运镜镜头1/2/3……每个镜头的主体、动作细节、景别、单一运镜、台词与音效绝对秒数(如「0–3秒」)、一个镜头里叠多个运镜
第三段:约束包兜底画质与一致性画质要求、面部稳定、无水印Logo、多人场景防双胞胎、风格锚定、参考图约束新的动作或剧情信息

第一段:总体设定

总体设定只回答一个问题:观众推开这扇门,第一眼看到的是什么样的空间?

要写的内容:

  • 空间:内景还是外景、具体地点(如「老旧派出所审讯室」「山顶悬崖边的青石平台」)。
  • 时间与光线:日夜、光源方向、色温倾向(如「深夜,头顶一盏日光灯,冷白光,墙面发绿」)。
  • 色调与气氛:整体色调倾向、空气感(如「潮湿、压抑,阴影浓重」)。
  • 人物站位:谁在场、大致位置关系(如「男主坐在铁椅上,背对门口;女警站在桌后,手里夹着文件」)。
  • 视觉风格锚点:画风路径已经在系统侧注入,这里只补本场特有的风格偏移(如「轻微手持纪实感」)。

这一段不要出现「镜头推近」「她转身」这类动作或运镜指令。动作归第二段管。

一个反例:「深夜审讯室,冷白灯光,男主坐在椅子上,镜头慢慢推近他的脸,他突然抬头……」——这里把环境、动作、运镜搅在一起,模型会分不清优先级。

第二段:镜头序列

镜头序列是三段里最核心的一段。它的写法直接决定成片的可控程度。

用镜头序号,不用绝对秒数

写「镜头1」「镜头2」「镜头3」,不要写「0–3秒」「3–6秒」。原因有两个:一是不同模型对时长的理解差异很大,秒数约束经常失效;二是镜头序号天然对应剪辑台上的clip顺序,后期调整时改序号比改秒数清晰得多。

一镜一运镜

每个镜头只给一个运镜指令。「推」「拉」「摇」「移」「跟」「固定」,选一个。禁止写「镜头先推近再横摇到门口」——单镜内叠加运镜是AI视频崩坏的高频原因,模型会在两种运动之间拉扯,画面容易抖、糊、变形。

如果确实需要从A运动到B,拆成两个镜头。

动作要细化、要量化

「他很生气」是小说语言,不是分镜语言。要写成肢体细节加程度:

  • ❌「他很生气,拍了桌子」
  • ✅「他右手猛地拍在桌面上,指节发白,上身前倾,眉头紧锁,牙关咬紧」

程度量化是给模型一个动作幅度的锚点:「微微点头」和「狠狠点头」是两种完全不同的画面,「缓缓站起」和「猛地站起」也是。优先写低缓连续动作,减少高爆发动态——后者在当前视频模型里更容易出现肢体崩坏。

台词、音效、BGM 的符号规范

  • 台词用花括号:{你到底是谁派来的}
  • 音效用尖括号:<铁门哐当关上>
  • BGM 用圆括号:(低频弦乐持续铺底)

这些符号不是装饰,是给下游渲染链路的标记,让它知道哪段要对口型、哪段要配音效、哪段是音乐层。

一个镜头序列的示例骨架

`` 镜头1:中景,固定机位。男主坐在铁椅上,双手交叉放在桌面,指尖微微收紧,目光低垂。{我没什么好说的。} 镜头2:近景,缓慢推近。女警站在桌后,把文件轻轻摊开,抬眼直视男主,嘴角没有表情。<纸张摩擦桌面> 镜头3:特写,固定。男主的瞳孔轻微收缩,喉结上下动了一下,右手食指在桌面上极轻地敲了两下。(心跳声渐起) ``

注意三个镜头的运镜:固定、推近、固定,没有叠加。动作都是可执行的肢体细节,没有形容词堆砌。

第三段:约束包

约束包是兜底段,每场都要有,而且写法相对固定。它不创造新内容,只负责防止常见崩坏。

标准约束包包含:

  • 画质兜底:高清、细节清晰、无模糊、无噪点异常。
  • 面部稳定:人物面部五官稳定,不畸变,不漂移。
  • 无水印无Logo:画面中不出现任何文字水印、平台标识、乱码字符。
  • 多人场景防分身:当场景里有两个及以上人物时,明确写「多人区分明显,不出现双胞胎脸、不出现多余肢体、不出现重复人物」。
  • 风格锚定:非写实画风要在这里重申风格锚点,防止模型在复杂动作下漂移回写实。
  • 参考图约束:有参考图的人物,文字不再描写服装与外貌,只写动作、表情、伤情。

约束包要放在最后。放在前面或中间,模型可能把约束词当成画面内容的一部分去生成(比如真的在画面里画出「无水印」三个字)。

什么时候用三段式,什么时候用一段式

不是所有场景都需要三段式。判断标准很简单:

场景复杂度推荐写法典型场景
单人、单一动作、单一景别一段式人物特写说台词、空镜、背影走路
2–3人、有对话或道具交互、1–2个镜头一段式或简化两段两人对坐谈话、递东西、开门
多人、多动作节拍、多机位切换、光影复杂三段式对峙、打斗、群像、追逐、情绪爆发戏

硬规则是:只要你发现自己在一段提示词里写了超过两个运镜、或者超过三个动作节拍,就该拆三段。

几个常见的返工原因

  1. 总体设定里塞了动作:模型会把动作当成环境的一部分反复执行,导致人物在镜头1就开始做镜头3的事。
  2. 镜头序列里用了绝对秒数:不同模型对时长的换算不一致,经常出现镜头2的内容跑到镜头1的时间里。
  3. 一镜多运镜:推+摇、跟+升这类组合是画面抖动和变形的高发区。
  4. 约束包写在中间:模型把「无水印」「面部稳定」当成画面元素处理。
  5. 动作写得太抽象:「他很激动」「气氛紧张」这类词模型无法执行,必须翻译成肢体和光影。

这套写法的边界

三段式是工程化的提示词结构,它解决的是「模型能不能按你想的顺序和方式执行」的问题,不解决「你想的东西本身好不好看」的问题。审美判断——这个镜头该不该推、这句台词该不该给特写、这场戏的节奏对不对——仍然在导演和编剧手里。

另外,约10秒的场块是工程启发式,不是时间码精剪。超长场会被再拆,但仍可能出现偏长的块;精剪与串场成片需要后续剪辑环节完成。当前的产品单元是「单场多模态参考 → 单段成片」,不做跨场自动续写或延长视频的产品化工作流。

系统在教模型用分镜表语言说话,而不是写小说。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com