AI 短剧多人场景的双胞胎问题与分身兜底
多人场景的「双胞胎」问题,本质是模型在同一张参考池里分不清谁是谁。解法不是换模型,而是在分场、参考图绑定、提示词兜底和重拍四个环节同时加约束。
什么是 AI 短剧里的「双胞胎」问题
「双胞胎」是剧组对一类 AI 视频翻车的俗称:两个本该不同的角色出现在同一场里,脸长得像、衣服互换、肢体黏连,甚至一个人凭空多出半张脸、多只手。它不是偶发 bug,而是多人同框时模型注意力被摊薄后的必然结果。
故事档案是一份贯穿全剧的结构化设定记录,包含人物身份、当前状态、人物关系、每条伏线的开启与收束状态、按集出场表和分批剧情纪要。档案能保证剧本里谁是谁,但到了视频侧,如果参考图和提示词没有把「谁站在哪、穿什么、做什么」钉死,模型就会自己补全——补出来的往往是两张近似的脸。
为什么多人场景更容易翻车
单角色场景里,模型只需要盯住一张定妆图。多人场景里,它要同时处理:
- 多张人物参考图之间的身份区分
- 人物与场景、道具的前后遮挡
- 多个人物的动作方向不能打架
- 镜头运动时每个人的脸都要稳住
任何一环没约束到位,模型就会用「平均脸」或「平均服装」兜底,于是出现换脸、撞脸、多手。
第一层解法:分场阶段就把人群拆开
最有效的兜底,是在剧本切成场块时就避免让过多角色挤在同一块里。
| 做法 | 说明 |
|---|---|
| 控制同场人数 | 能 2 人讲清楚的戏,不塞 4 人;群演从主演名单里剥离,不占定妆槽位 |
| 按动作节拍拆场 | 一场超过约 200 字正文,按动作、空段、句号再拆成约 10 秒的场块 |
| 把群戏切成正反打 | 对话戏拆成「A 的反应」「B 的回应」两个单场,比一个全景稳得多 |
| 避免高爆发群动 | 多人同时跑、打、摔,模型最容易黏肢体;改成逐个动作的分镜 |
高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的。多人戏尤其如此。
第二层解法:参考图占位要讲纪律
参考图映射是 AI 短剧一致性的核心机制,多人场景里它的纪律更严。
每场自动构建的参考素材表按固定顺序占位:场景图 → 本场道具图 → 人物定妆图。有图才占槽位,无图标明「仅文字」,不强行编造绑定。
多人场景要额外注意三件事:
- 有参考图的人物,禁止再用文字描写服装 / 外观。文字只写动作、表情、伤情。一旦文字和参考图打架,模型就会在两套描述之间取平均,脸和衣服立刻漂移。
- 手动绑定角色称呼。剧本里写「警官」,要手动绑到档案里「李强」的定妆图;剧本里写「那个女人」,要明确指到具体角色,别让模型猜。
- 道具纳入 / 排除要手控。多人场里无关道具会挤占参考槽位,把本场用不到的道具排除掉,把焦点留给人物。
一致性靠资产,不靠运气。多人场里参考图就是资产,纪律就是护栏。
第三层解法:提示词里的「分身兜底包」
系统在教模型用分镜表语言说话,而不是写小说。多人场景的镜头提示词遵循八大要素:精准主体、动作细节、场景环境、光影色调、镜头运镜、视觉风格、画质、约束条件。复杂影视化场景走三段论:总体设定 → 分镜 1/2/3… → 约束包。
其中「约束包」就是多人场景的兜底位,必须显式写进提示词:
- 多人区分兜底:明确写出几个人、各自的服装颜色或身份标签(以参考图为准)、站位左右关系
- 双胞胎 / 分身兜底:强制要求「不同角色面部特征必须明显区分,禁止出现相似脸、复制脸、多余肢体」
- 画质兜底:面部稳定、无水印 Logo、手部清晰
- 动作原则:肢体细化 + 程度量化,优先低缓连续动作,减少高爆发动态崩坏
- 一镜一运镜:单镜内禁止推拉摇移叠加,避免运动中脸糊
举个反例和正例:
❌ 「两个人在房间里吵架,很激烈,镜头很有张力。」
✅ 「室内客厅,暖黄顶光。镜头 1:中景,左侧穿深色衬衫的男性(参考图 A)拍桌站起,眉头紧皱;右侧穿浅色连衣裙的女性(参考图 B)后退半步,双手抱臂。固定机位。约束:两人面部必须明显区分,禁止相似脸与多余肢体,面部稳定,画质清晰。」
前者是小说,后者是分镜表。模型吃分镜表,不吃形容词。
第四层解法:多 take 择优,而不是一次过
没有成片自动打分或自动择优重拍引擎。多人场景尤其要接受「第一条大概率不能用」的现实。
标准拍摄路径是:确认参考图齐全 → 生成视频提示词 → 人工阅读并编辑 → 选模型档位与分辨率 → 提交出片 → 回看历史 takes 择优。同一场块进行中不并行提交,避免重复扣费与状态混乱;改了词或换了图再点生成,才算新的 take——和片场「改分镜说明再拍」是一个逻辑。
多人场的重拍优先级建议:
- 先看脸有没有串,串了就检查参考图绑定和「有图不写外观」是否被违反
- 再看肢体有没有黏,黏了就把动作幅度再调低、把人数再拆
- 最后看运镜和情绪,这些是锦上添花
边界:这些情况目前做不到
诚实讲清楚边界,比夸口更能建立信任:
- 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。
- 约 10 秒的场块是工程启发式,不是时间码精剪。 超长群戏仍可能出现偏长的块,精剪与串场成片需要后续剪辑环节。
- 当前不做跨场自动续写 / 延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」,多人长镜头需要拆成多场再接。
- 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——多人场走纯文字,翻车概率显著上升,专业流程应该先定妆再开拍。
把重复的部分交给流水线
多人场景的双胞胎问题,没有银弹模型可以一键解决。它靠的是一整套工业顺序:先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优。
在工艺解剖档位下,猫斯卡把上面这套顺序固化进了生产链:剧本自动切成约 10 秒场块、按「场景 → 道具 → 人物」顺序绑定参考图、多人场景在提示词约束包里强制注入双胞胎 / 分身兜底、同场保留历史 takes 供择优。人在关键节点做确认与审美判断——审词、绑角色、选 take,机器负责把确认过的方向落到每一场。
把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com