多镜头场戏怎么写提示词:从分场剧本到三段式镜头指令
多镜头场戏写提示词,最常见的错误是把环境、人物动作、运镜、画质要求全塞进一段话。正确做法是拆成三段:先定总体设定,再列镜头序列,最后放约束包。这样模型知道哪些信息全局生效,哪些只属于某一镜。
为什么一段式提示词容易翻车
很多短剧团队在生成复杂场戏时,会把提示词写成这样:
雨夜街头,女主撑伞走过,镜头先推近她的脸,再拉远看到男主站在路灯下,霓虹灯闪烁,电影感,高清,人物不要变脸,不要出现多余手指。
这段话看起来信息很多,但对视频模型来说有几个问题:
- 「推近」和「拉远」被放在同一句里,模型可能在一个镜头内连续完成两个相反运镜;
- 女主和男主的出场顺序不清,容易提前入画或错位;
- 「电影感」「高清」属于全局要求,却混在动作描述里;
- 没有明确镜头边界,模型只能自行猜测哪里该切。
三段式提示词,本质上是把导演阐述、分镜表和技术备注分开。 它不是为了写得更文艺,而是为了让模型按工序理解信息。
三段式结构总览
三段式适用于人物调度复杂、镜头超过一个、需要明确情绪递进的场戏。简单场景仍可以用一段式,不必为了格式而格式。
| 段落 | 作用 | 应该写什么 | 不应该写什么 |
|---|---|---|---|
| 总体设定 | 给整场戏定调 | 场景环境、时间、光线、色调、视觉风格、人物在场状态 | 具体到某一镜的小动作 |
| 镜头序列 | 逐镜交代拍法 | 镜头编号、景别、主体、动作、表情、运镜 | 全局画质口号、重复风格词 |
| 约束包 | 统一兜底与排错 | 面部稳定、参考图优先、无水印、多人防分身、风格锚定 | 新剧情、新动作、新道具 |
这三段的顺序不要乱。先让模型知道“这是哪里、什么气氛”,再告诉它“第一镜拍什么、第二镜拍什么”,最后补上“别出哪些错”。
第一段:总体设定
总体设定相当于导演在开机前对摄影、美术和灯光说的话。它负责建立整场戏的世界,而不是推进某个镜头。
建议包含五类信息:
- 场景环境:内景还是外景、具体地点、空间关系;
- 时间与光线:日夜、天气、主光源、明暗对比;
- 色调与氛围:冷色、暖色、低饱和、霓虹、雾气等;
- 视觉风格:与全片画风一致的表达,不临时换风格;
- 人物在场状态:谁在场上、初始位置、是否有参考图。
示例写法:
总体设定:深夜室外老街,地面潮湿反光,两侧店铺半关门,远处有霓虹牌。冷蓝色夜色为主,路灯提供局部暖光。女主站在巷口,黑色外套,手中握伞;男主位于街对面路灯下。整体为竖屏都市悬疑质感,人物以参考图为准。
注意,“人物以参考图为准”这句话很重要。它属于全局约束,但可以在总体设定里先声明,到约束包中再强化。
第二段:镜头序列
镜头序列是三段式里最像分镜表的部分。每个镜头单独编号,写清谁在做什么、镜头怎么运动。
一镜一运镜
一个镜头只安排一种主要运镜。不要在同一镜里写“推近后拉远再环绕”,这会让模型在短时间内堆叠运动,画面容易抖、糊、变形。
推荐运镜词:
- 固定镜头
- 缓慢推近
- 缓慢拉远
- 横移跟随
- 侧面跟拍
- 轻微手持
- 低角度上摇
如果需要多个运镜,就拆成多个镜头。
用镜头序号,不用绝对秒数
不要写“0–3秒女主抬头,3–6秒男主出现”。视频生成模型对绝对秒数并不稳定,尤其在不同时长设置下更容易错位。
更稳的写法是:
镜头1:中景,女主站在巷口,缓慢抬头看向街对面,镜头固定。
镜头2:过肩镜头,从女主肩后看向男主,男主在路灯下微微侧身,镜头缓慢推近。
镜头3:特写,女主握紧伞柄,指节发白,镜头固定。
镜头序号给了模型清晰的执行顺序,也方便后期判断哪一镜需要重拍。
动作要低缓、连续、可执行
复杂场戏最容易在高爆发动作上崩坏:转身、奔跑、打斗、拥抱、突然回头,都可能导致肢体错位或脸部漂移。
写法上尽量做到:
- 把大动作拆成小动作;
- 用程度词限定幅度,如“微微侧身”“缓慢抬头”;
- 避免同一镜头内连续改变姿态;
- 把情绪重点放在表情、眼神、手部细节上。
例如,与其写“女主震惊地后退一步并摔倒”,不如拆成:
镜头2:近景,女主瞳孔微缩,肩膀轻颤,脚步下意识后退半步。
如果摔倒确实是剧情关键,就单独给一个镜头,并降低动作速度。
第三段:约束包
约束包是全场统一的“别出错”清单。它不创造新画面,只负责降低常见生成事故。
建议固定包含以下内容:
- 画质稳定、面部清晰;
- 无水印、无Logo、无字幕;
- 有参考图的人物,外貌、服装、发型以参考图为准;
- 多人场景避免双胞胎、分身、多余人物;
- 非写实画风保持风格统一,不突然变成真人或其他画风;
- 动作连续自然,避免肢体变形、多余手指、道具穿模。
如果这场戏有特殊风险,再追加针对性约束。例如:
- 雨戏:雨水不要遮挡人物面部;
- 车内戏:安全带位置稳定,车窗倒影不要生成第二张脸;
- 古装戏:头饰、发冠不要在镜头间变形;
- 吃饭戏:餐具和食物不要凭空增减。
约束包要放在最后。因为它是兜底,不是主指令。如果把约束写得到处都是,反而会稀释动作和镜头信息。
一个完整示例
下面是一段适合复杂场戏的三段式提示词骨架:
总体设定
深夜室外老街,地面潮湿反光,两侧店铺半关门,远处有霓虹牌。冷蓝色夜色为主,路灯提供局部暖光。女主站在巷口,男主位于街对面路灯下。整体为竖屏都市悬疑质感,人物外貌与服装以参考图为准。
镜头序列
镜头1:中景,女主独自站在巷口,手中握着收起的伞,缓慢抬头看向街对面,镜头固定。
镜头2:过肩镜头,从女主肩后看向男主,男主在路灯下微微侧身,镜头缓慢推近。
镜头3:特写,女主的手逐渐握紧伞柄,指节微微发白,镜头固定。
约束包
画面清晰,面部稳定,无水印、无Logo、无多余字幕。人物以参考图为准,不改变服装、发型和五官。多人场景避免分身、双胞胎和多余路人。动作低缓连续,避免手部畸形、道具穿模。整体保持都市悬疑风格,不切换为其他画风。
这个结构的好处是:如果镜头2不满意,只改镜头2;如果人物服装漂移,就检查约束包和参考图;如果整场气氛不对,就回到总体设定。问题可以定位到段落,而不是重写整段话。
三段式不适用的情况
三段式不是所有场景都必须使用。以下情况更适合一段式:
- 单一人物、单一动作、单一景别;
- 5秒以内的短反应镜头;
- 空镜、转场镜、道具特写;
- 没有复杂调度的静态对话开场。
如果一场戏只有“女主抬头看了一眼窗外”,就不需要硬拆三段。工艺规范的价值在于降低复杂场的失控率,而不是增加写作负担。
检查清单:提交前过一遍
提交生成前,可以按下面清单检查:
- [ ] 总体设定是否只写环境、光线、风格和人物初始状态?
- [ ] 每个镜头是否只有一种主要运镜?
- [ ] 是否使用镜头编号,而不是绝对秒数?
- [ ] 动作是否低缓、连续、可执行?
- [ ] 有参考图的人物,是否明确写了“以参考图为准”?
- [ ] 约束包是否只做兜底,没有新增剧情?
- [ ] 多人场景是否加了防分身、防双胞胎约束?
- [ ] 这场戏是否真的需要三段式,而不是一段式即可?
复杂场戏的提示词,不是写得越长越专业。真正专业的是结构清楚:全局信息归全局,镜头信息归镜头,排错信息归兜底。模型拿到的是一份可以执行的分镜说明,而不是一段需要猜的小说。
常见问题
三段式提示词适合所有AI视频场景吗?
不适合。它主要用于人物调度复杂、镜头超过一个、需要明确情绪递进的场戏。单一人物、单一动作、5秒左右的短反应镜头或空镜,用一段式更高效。
为什么提示词里不要写0到3秒、3到6秒?
不同视频模型和时长设置下,绝对秒数容易错位。用镜头1、镜头2、镜头3来组织,更接近分镜表逻辑,也方便单独重拍某一镜。
一个镜头里可以同时推近、拉远和环绕吗?
不建议。一镜一运镜更稳定。多个运镜叠加容易导致画面抖动、人物变形和空间关系混乱。如果确实需要,应拆成多个镜头。
约束包里应该写哪些内容?
约束包主要写画质稳定、面部清晰、无水印、参考图优先、多人防分身、风格统一、避免肢体和道具错误。它负责兜底,不应该新增剧情或动作。
有参考图的人物还要在提示词里描写服装吗?
不需要。有参考图的人物应以外貌、服装、发型以参考图为准,文字只补充动作、表情、伤情等临时状态。重复描写服装反而容易和参考图冲突,造成换装。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com