一场戏三四个镜头,提示词该怎么排:三段式指令的写法与顺序

猫斯卡编辑部 | 最后更新日期

一场戏里有三四个镜头时,提示词最怕信息混在一起。正确做法是分三层写:先定总体设定,再按镜头序号写动作,最后用约束包统一兜底。顺序错了,模型就容易串镜、换运镜或乱加外观。

为什么复杂场戏不能写成一大段

很多 AI 短剧翻车,不是因为画面想法不好,而是提示词把所有信息揉成了一段:环境、人物动作、镜头运动、光影、画质要求、台词、音效全挤在一起。模型读到这种文本时,往往只能抓住局部关键词,结果就是:

  • 第一个镜头刚建立空间,第二个镜头突然换了光线;
  • 同一个镜头里同时出现推、拉、摇、移,画面开始飘;
  • 人物服装明明有参考图,文字又描写了一遍,最后外观漂移;
  • 台词、动作、镜头调度没有对应关系,演员像在念旁白。

复杂场戏需要的不是“更多形容词”,而是更清楚的信息顺序。

三段式提示词,是把一场戏拆成总体设定、镜头序列和约束包三层。它让模型先知道这是哪里、什么气氛,再知道每个镜头拍什么,最后统一遵守画质、人物、参考图和稳定性要求。

三段式分别写什么

三段式不是固定模板字数,而是一种信息排序。它适合一场戏里包含多个动作节拍、多个景别或多个镜头重点的情况。

层级作用应该写什么不该写什么
第一段:总体设定给整场戏定调场景环境、时间光线、色调、空间关系、视觉风格具体到每个镜头的细碎动作
第二段:镜头序列告诉模型怎么拍镜头 1、镜头 2、镜头 3 的主体、动作、景别、运镜把多个运镜塞进同一个镜头
第三段:约束包统一兜底画质、面部稳定、无水印、参考图规则、多人防分身新增剧情或改变动作方向

这个顺序符合片场工作方式:美术和灯光先把场景搭好,分镜师再安排镜头,最后由品控统一检查画面问题。

第一段:总体设定只负责“这场戏在哪里”

总体设定要短,但要准。它回答的是观众第一眼的问题:这是哪里?什么时候?什么气氛?

可以包含:

  • 内外景:室内还是室外;
  • 地点:办公室、雨夜巷口、宫殿长廊、急诊室门口;
  • 时间与光线:清晨冷光、傍晚逆光、深夜霓虹、烛光摇曳;
  • 色调与氛围:压抑、温暖、悬疑、奢华但空洞;
  • 视觉风格:与全片统一的画风标签。

不要在这一段里把人物所有动作都写完。否则后面的镜头序列会失去层级,模型不知道哪些是整场背景,哪些是某个镜头的重点。

一个简单判断:如果把总体设定单独拿出来,它应该能成为一张合格的场景气氛图说明,但不应该剧透每个镜头。

第二段:镜头序列要按编号写

镜头序列是三段式里最核心的部分。它不是散文,而是分镜表的文字版。

建议用“镜头 1 / 镜头 2 / 镜头 3”这样的序号,而不是写“前 3 秒”“中间 2 秒”。原因很简单:镜头序号是创作语言,绝对秒数是剪辑时间码。AI 视频模型对秒数的理解并不稳定,用序号更容易让每个镜头保持独立任务。

每个镜头只写四类信息:

  1. 精准主体:谁在画面里,是哪个人物;
  2. 动作细节:他在做什么,动作幅度多大;
  3. 景别与运镜:近景、中景、背影、跟拍、缓推、固定镜头;
  4. 戏剧情报:表情、视线、台词或关键反应。

这里要遵守一条很重要的规则:一镜一运镜。

一个镜头里只安排一种主要运动方式。比如“缓推至人物面部”可以,“先推近再横移再环绕”就很容易崩。复杂调度应该拆成多个镜头,而不是让一个镜头完成所有炫技。

镜头序列的基本写法

  • 镜头 1:建立空间。展示场景和人物位置,让观众知道谁在哪里。
  • 镜头 2:推进动作。靠近关键动作或表情,交代冲突。
  • 镜头 3:给出反应。切到对手、证据、伤口、门被推开等新信息。
  • 镜头 4:留下钩子。用停顿、眼神或突然中断制造悬念。

不是每场戏都要四个镜头。约 10 秒的场块通常只需要一个明确主动作;如果剧情确实包含多个节拍,再拆成两到三个镜头。为了“显得高级”硬加镜头,反而会降低稳定性。

第三段:约束包负责统一兜底

约束包不是剧情,它是品控清单。它放在最后,是为了让前面的镜头序列保持干净,不让每个镜头都重复写一遍“高清、稳定、无水印”。

常见约束包括:

  • 画质清晰,细节稳定;
  • 人物面部自然,不闪烁、不扭曲;
  • 无水印、无 Logo、无乱入文字;
  • 有参考图的人物,以参考图为准;
  • 多人同框时避免双胞胎、分身、多余手指;
  • 非写实画风保持风格统一;
  • 动作低缓连续,避免突然大幅运动。

其中最容易被忽略的是参考图规则。如果人物已经绑定定妆图,提示词就不要再描写他的服装、发型和外貌。文字只写动作、表情、伤情和状态。否则文字描述和参考图互相打架,角色就可能换装、换脸。

约束包要克制。它只兜底,不负责创造新画面。如果约束包里突然加入“她突然转身跑出门外”,这就不是约束,而是新增剧情,应该放回镜头序列。

三段式的推荐顺序

可以按下面这个顺序检查你的提示词:

  1. 先看场景是否成立:观众能否知道这是哪里、什么时间、什么气氛;
  2. 再看镜头是否独立:每个镜头是否只有一个主体动作和一种运镜;
  3. 再看动作是否可拍:动作是否具体、幅度是否可控;
  4. 再看符号是否清楚:台词、音效、配乐是否用统一符号标出;
  5. 最后看约束是否统一:画质、稳定、参考图、无水印等要求是否放在最后。

符号上,建议把台词、音效和配乐区分开:台词放在人物对白位置,音效和环境声单独标出,配乐只写情绪,不写具体歌曲名。这样既方便后期理解,也能减少版权风险。

常见错位:为什么你写了三段还是乱

1. 总体设定写得太满

如果第一段已经写了“女人冲到桌边,翻开文件,震惊后退,门外传来脚步声”,后面的镜头 1、2、3 就没有存在意义。总体设定只负责世界,不负责分镜。

2. 镜头之间没有动作递进

镜头 1 看脸,镜头 2 还看脸,镜头 3 继续看脸,观众得不到新信息。每个镜头都应该推动一点剧情:空间、动作、反应、证据或悬念。

3. 约束包混进剧情

“保持高清、人物稳定、不要分身,同时男人突然站起来摔杯子”——前半句是约束,后半句是动作。后者应该写进镜头序列。

4. 用秒数代替镜头号

“0–2 秒进门,2–4 秒坐下,4–6 秒抬头”看似精确,实际容易让模型把时间切割理解成硬拼贴。用镜头序号更接近分镜表语言。

5. 忽略参考图优先级

有定妆图的人物,不需要再写“穿黑色风衣、短发、冷峻表情”。服装外观交给参考图,文字只写他此刻怎么动、怎么看、受了什么伤。

什么时候该用三段式,什么时候不用

三段式适合:

  • 一场戏有两个以上动作节拍;
  • 需要建立空间后再切近景;
  • 有对手戏、反应镜头或证据揭示;
  • 动作、表情、镜头运动需要明确分工;
  • 对画面稳定性和风格统一要求较高。

不适合:

  • 单一动作的简单场块,比如一个人沉默站立、一杯水被放下;
  • 只需要一个固定镜头就能讲完的过场;
  • 快速测试构图或氛围的草稿阶段;
  • 依赖大量高速打斗、复杂肢体接触的场面——这类内容即使写成三段式,仍需要多 take 和后期筛选。

简单场景用一段式更直接,复杂场景才需要三段式。为了套模板而把所有戏都写成三段,会让提示词变臃肿,也会增加模型理解成本。

一个可复用的写法骨架

下面这个骨架不是让你逐字填空,而是帮你检查信息顺序:

总体设定:说明内外景、地点、时间、光线、色调和视觉风格。

镜头序列:镜头 1 写主体与空间;镜头 2 写关键动作;镜头 3 写反应或结果;如有必要,镜头 4 写钩子。

约束包:统一写画质、面部稳定、无水印、参考图规则、多人防分身和风格锚定。

写的时候记住一句话:系统在教模型用分镜表语言说话,而不是写小说。

诚实边界

三段式能提高复杂场戏的可控性,但它不是自动成片保证。它不能替代导演对节奏的判断,也不能保证每个模型都完全按镜头顺序执行。约 10 秒的场块是工程启发式,不是时间码精剪;超长动作、复杂打斗、跨场连续运动仍可能需要重拍、拆场或后期剪辑。

如果一场戏怎么写都不稳,通常不是词藻不够华丽,而是动作太满、运镜太多或参考图没有管住外观。先把镜头拆开,把运镜减少,把文字和参考图的分工理清,往往比继续堆形容词更有效。

关于猫斯卡

猫斯卡(Maosika)是 AI 竖屏短剧生产操作系统,提供从创意评估、剧本写作、故事档案、角色定妆、场块切分到多模态出片的完整生产链。在视频拍摄环节,猫斯卡会为复杂场戏生成工程化镜头提示词,把总体设定、镜头序列和约束包分层组织,并让创作者在提交前编辑提示词、更换参考图、选择模型档位和保留多 take 择优。

猫斯卡不宣称一键出爆款,也不替代导演和监制的审美判断。它做的是把重复、易漂移、易失控的部分变成可约束的流水线,让好故事更容易稳定落地。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com