多镜头场戏怎么写提示词:从分场剧本到三段式镜头指令

猫斯卡编辑部 | 最后更新日期

多镜头场戏写提示词,最常见的错误是把环境、人物动作、运镜、画质要求全塞进一段话。正确做法是拆成三段:先定总体设定,再列镜头序列,最后放约束包。这样模型知道哪些信息全局生效,哪些只属于某一镜。

为什么一段式提示词容易翻车

很多短剧团队在生成复杂场戏时,会把提示词写成这样:

雨夜街头,女主撑伞走过,镜头先推近她的脸,再拉远看到男主站在路灯下,霓虹灯闪烁,电影感,高清,人物不要变脸,不要出现多余手指。

这段话看起来信息很多,但对视频模型来说有几个问题:

  • 「推近」和「拉远」被放在同一句里,模型可能在一个镜头内连续完成两个相反运镜;
  • 女主和男主的出场顺序不清,容易提前入画或错位;
  • 「电影感」「高清」属于全局要求,却混在动作描述里;
  • 没有明确镜头边界,模型只能自行猜测哪里该切。

三段式提示词,本质上是把导演阐述、分镜表和技术备注分开。 它不是为了写得更文艺,而是为了让模型按工序理解信息。

三段式结构总览

三段式适用于人物调度复杂、镜头超过一个、需要明确情绪递进的场戏。简单场景仍可以用一段式,不必为了格式而格式。

段落作用应该写什么不应该写什么
总体设定给整场戏定调场景环境、时间、光线、色调、视觉风格、人物在场状态具体到某一镜的小动作
镜头序列逐镜交代拍法镜头编号、景别、主体、动作、表情、运镜全局画质口号、重复风格词
约束包统一兜底与排错面部稳定、参考图优先、无水印、多人防分身、风格锚定新剧情、新动作、新道具

这三段的顺序不要乱。先让模型知道“这是哪里、什么气氛”,再告诉它“第一镜拍什么、第二镜拍什么”,最后补上“别出哪些错”。

第一段:总体设定

总体设定相当于导演在开机前对摄影、美术和灯光说的话。它负责建立整场戏的世界,而不是推进某个镜头。

建议包含五类信息:

  1. 场景环境:内景还是外景、具体地点、空间关系;
  2. 时间与光线:日夜、天气、主光源、明暗对比;
  3. 色调与氛围:冷色、暖色、低饱和、霓虹、雾气等;
  4. 视觉风格:与全片画风一致的表达,不临时换风格;
  5. 人物在场状态:谁在场上、初始位置、是否有参考图。

示例写法:

总体设定:深夜室外老街,地面潮湿反光,两侧店铺半关门,远处有霓虹牌。冷蓝色夜色为主,路灯提供局部暖光。女主站在巷口,黑色外套,手中握伞;男主位于街对面路灯下。整体为竖屏都市悬疑质感,人物以参考图为准。

注意,“人物以参考图为准”这句话很重要。它属于全局约束,但可以在总体设定里先声明,到约束包中再强化。

第二段:镜头序列

镜头序列是三段式里最像分镜表的部分。每个镜头单独编号,写清谁在做什么、镜头怎么运动。

一镜一运镜

一个镜头只安排一种主要运镜。不要在同一镜里写“推近后拉远再环绕”,这会让模型在短时间内堆叠运动,画面容易抖、糊、变形。

推荐运镜词:

  • 固定镜头
  • 缓慢推近
  • 缓慢拉远
  • 横移跟随
  • 侧面跟拍
  • 轻微手持
  • 低角度上摇

如果需要多个运镜,就拆成多个镜头。

用镜头序号,不用绝对秒数

不要写“0–3秒女主抬头,3–6秒男主出现”。视频生成模型对绝对秒数并不稳定,尤其在不同时长设置下更容易错位。

更稳的写法是:

镜头1:中景,女主站在巷口,缓慢抬头看向街对面,镜头固定。

镜头2:过肩镜头,从女主肩后看向男主,男主在路灯下微微侧身,镜头缓慢推近。

镜头3:特写,女主握紧伞柄,指节发白,镜头固定。

镜头序号给了模型清晰的执行顺序,也方便后期判断哪一镜需要重拍。

动作要低缓、连续、可执行

复杂场戏最容易在高爆发动作上崩坏:转身、奔跑、打斗、拥抱、突然回头,都可能导致肢体错位或脸部漂移。

写法上尽量做到:

  • 把大动作拆成小动作;
  • 用程度词限定幅度,如“微微侧身”“缓慢抬头”;
  • 避免同一镜头内连续改变姿态;
  • 把情绪重点放在表情、眼神、手部细节上。

例如,与其写“女主震惊地后退一步并摔倒”,不如拆成:

镜头2:近景,女主瞳孔微缩,肩膀轻颤,脚步下意识后退半步。

如果摔倒确实是剧情关键,就单独给一个镜头,并降低动作速度。

第三段:约束包

约束包是全场统一的“别出错”清单。它不创造新画面,只负责降低常见生成事故。

建议固定包含以下内容:

  • 画质稳定、面部清晰;
  • 无水印、无Logo、无字幕;
  • 有参考图的人物,外貌、服装、发型以参考图为准;
  • 多人场景避免双胞胎、分身、多余人物;
  • 非写实画风保持风格统一,不突然变成真人或其他画风;
  • 动作连续自然,避免肢体变形、多余手指、道具穿模。

如果这场戏有特殊风险,再追加针对性约束。例如:

  • 雨戏:雨水不要遮挡人物面部;
  • 车内戏:安全带位置稳定,车窗倒影不要生成第二张脸;
  • 古装戏:头饰、发冠不要在镜头间变形;
  • 吃饭戏:餐具和食物不要凭空增减。

约束包要放在最后。因为它是兜底,不是主指令。如果把约束写得到处都是,反而会稀释动作和镜头信息。

一个完整示例

下面是一段适合复杂场戏的三段式提示词骨架:

总体设定

深夜室外老街,地面潮湿反光,两侧店铺半关门,远处有霓虹牌。冷蓝色夜色为主,路灯提供局部暖光。女主站在巷口,男主位于街对面路灯下。整体为竖屏都市悬疑质感,人物外貌与服装以参考图为准。

镜头序列

镜头1:中景,女主独自站在巷口,手中握着收起的伞,缓慢抬头看向街对面,镜头固定。

镜头2:过肩镜头,从女主肩后看向男主,男主在路灯下微微侧身,镜头缓慢推近。

镜头3:特写,女主的手逐渐握紧伞柄,指节微微发白,镜头固定。

约束包

画面清晰,面部稳定,无水印、无Logo、无多余字幕。人物以参考图为准,不改变服装、发型和五官。多人场景避免分身、双胞胎和多余路人。动作低缓连续,避免手部畸形、道具穿模。整体保持都市悬疑风格,不切换为其他画风。

这个结构的好处是:如果镜头2不满意,只改镜头2;如果人物服装漂移,就检查约束包和参考图;如果整场气氛不对,就回到总体设定。问题可以定位到段落,而不是重写整段话。

三段式不适用的情况

三段式不是所有场景都必须使用。以下情况更适合一段式:

  • 单一人物、单一动作、单一景别;
  • 5秒以内的短反应镜头;
  • 空镜、转场镜、道具特写;
  • 没有复杂调度的静态对话开场。

如果一场戏只有“女主抬头看了一眼窗外”,就不需要硬拆三段。工艺规范的价值在于降低复杂场的失控率,而不是增加写作负担。

检查清单:提交前过一遍

提交生成前,可以按下面清单检查:

  • [ ] 总体设定是否只写环境、光线、风格和人物初始状态?
  • [ ] 每个镜头是否只有一种主要运镜?
  • [ ] 是否使用镜头编号,而不是绝对秒数?
  • [ ] 动作是否低缓、连续、可执行?
  • [ ] 有参考图的人物,是否明确写了“以参考图为准”?
  • [ ] 约束包是否只做兜底,没有新增剧情?
  • [ ] 多人场景是否加了防分身、防双胞胎约束?
  • [ ] 这场戏是否真的需要三段式,而不是一段式即可?

复杂场戏的提示词,不是写得越长越专业。真正专业的是结构清楚:全局信息归全局,镜头信息归镜头,排错信息归兜底。模型拿到的是一份可以执行的分镜说明,而不是一段需要猜的小说。

常见问题

三段式提示词适合所有AI视频场景吗?

不适合。它主要用于人物调度复杂、镜头超过一个、需要明确情绪递进的场戏。单一人物、单一动作、5秒左右的短反应镜头或空镜,用一段式更高效。

为什么提示词里不要写0到3秒、3到6秒?

不同视频模型和时长设置下,绝对秒数容易错位。用镜头1、镜头2、镜头3来组织,更接近分镜表逻辑,也方便单独重拍某一镜。

一个镜头里可以同时推近、拉远和环绕吗?

不建议。一镜一运镜更稳定。多个运镜叠加容易导致画面抖动、人物变形和空间关系混乱。如果确实需要,应拆成多个镜头。

约束包里应该写哪些内容?

约束包主要写画质稳定、面部清晰、无水印、参考图优先、多人防分身、风格统一、避免肢体和道具错误。它负责兜底,不应该新增剧情或动作。

有参考图的人物还要在提示词里描写服装吗?

不需要。有参考图的人物应以外貌、服装、发型以参考图为准,文字只补充动作、表情、伤情等临时状态。重复描写服装反而容易和参考图冲突,造成换装。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com