AI 短剧角色换脸:从定妆到开拍的一致性工程拆解
AI 短剧里同一个人上一场是圆脸、下一场变尖脸,根因不是模型差,而是每场戏都在用文字重新「想」这个人长什么样。真正的解法是把长相从提示词里拿出去,交给定妆资产管。
换脸的本质:提示词在和参考图打架
很多团队以为换脸是视频模型不稳定,其实大多数翻车发生在开拍之前。
典型流程是这样的:编剧写「李明穿着黑色风衣走进办公室」,美术出了一张李明的定妆图,但到了第 8 场,提示词里又写了一遍「黑色风衣、短发、冷峻面容」。模型拿到两套指令——参考图一套、文字一套——它会在两者之间折中,结果就是脸悄悄变了。
角色一致性靠资产,不靠运气。 这句话的意思是:人物长什么样,只在定妆环节决定一次;进入拍摄后,文字提示词只负责动作、表情、伤情,绝不重复描写服装和外貌。
一条铁律:有参考图的人物,禁止文字描写外观
这是工业流程里最硬的一条规则,也是区分「玩具」和「生产工具」的分界线:
有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。
为什么必须这么做?因为 AI 视频模型对文字描述的权重并不低。你在提示词里写「穿着红色裙子」,即使参考图里是蓝色裙子,模型也会尝试融合——融合的结果往往就是脸跟着变。
正确的做法是把提示词拆成两部分:
- 参考图负责的部分:脸型、五官、发型、服装、体型、年龄感
- 文字负责的部分:站在哪里、做什么动作、什么表情、受了什么伤、光线如何
这两部分一旦划清,换脸概率会大幅下降。
从定妆到开拍的四步一致性链路
换脸问题不能在「拍」这一步解决,它是一条链路,任何一环松了都会漏。
第一步:角色阵容先锁版,再出图
很多团队的顺序反了:先写几集剧本,觉得人物差不多了就开始拍,拍到一半发现主角名字还在变、身份还在改。
正确顺序是:
- 创意简报锁版(含主角人物弧光)
- 角色阵容确认:姓名、身份、性格、视觉字段齐全
- 主角与简报对齐校验
- 才进入立绘出图
阵容没锁就出图,后面改一次设定,前面所有定妆作废,等于白做。
第二步:定妆图两段式生成,可人工覆盖
定妆不是「扔一段描述给模型等图」。专业流程分两段:
- 文本润色:用选定画风的人物手册,把档案里的人物描述润色成可出图的提示词;性别是硬规则,不随模型发挥。这一步人可以覆盖。
- 图像生成:拼最终提示词出图,支持参考图,落库为可回看的历史版本。
关键是:视频侧只消费状态已完成且文件可读的立绘。半成品、模糊图、文件损坏的图,不能拿去绑参考——否则模型拿到的是噪声,脸一定飘。
第三步:每场自动构建参考素材表,顺序固定
开拍前,每场戏需要一张参考素材表,顺序是固定的:
| 优先级 | 素材类型 | 作用 |
|---|---|---|
| 1 | 场景图 | 交代空间,且严禁出现人物 |
| 2 | 本场道具图 | 控制视觉焦点,无关道具排除 |
| 3 | 人物定妆图 | 锁定长相与服装 |
有图才占槽位,无图标明「仅文字」,不强行编造绑定。这张表的意义是:模型在生成这一场时,第一眼看到的是「这个人长这样」,而不是「这个人可能长这样」。
第四步:时代造型路由,处理穿越与闪回
穿越、闪回、回忆杀是换脸重灾区。同一个人物在古代是长发束冠,在现代是短发西装,如果系统不分场景统一取一张定妆图,要么穿错衣服,要么脸被拉扯。
工程化解法是按场景地点关键词判定现代 / 古代,取人物定妆图时优先匹配对应造型。这不是人脸嵌入校验,而是规则选图——最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。
三个最常见的翻车点与对应修法
翻车点 1:剧本里的称呼和档案对不上
剧本写「警官」,档案里叫「李强」,系统不知道这是同一个人,就不会绑李强的定妆图,结果这一场变成了随机脸。
修法:支持手动角色绑定,把剧本称呼映射到档案人物。客串、泛指角色(如「路人甲」)要从可绘制主演名单里剥离,避免挤占定妆槽位。
翻车点 2:道具挤占参考槽位
一场戏里如果塞了太多道具参考图,人物定妆图的权重会被稀释,模型「看不清」主角长什么样。
修法:道具按集提取剧本原始称呼,全剧合并成 catalog;每场手动纳入 / 排除道具,只留本场真正出现的。
翻车点 3:提示词里偷偷写了外貌
即使绑了参考图,提示词里一句「年轻英俊的男子」就可能让模型往「年轻」方向拉,和定妆图的中年设定冲突。
修法:提示词生成时只给本场素材,禁止串戏;本场剧本正文是最高优先级撰写依据,但系统在生成镜头提示词时,对已有参考图的人物自动剥离外貌描写。创作者审词时仍应再确认一遍。
必须承认的边界
讲完解法,也要讲清楚哪些做不到,否则就是在卖幻想。
- 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量。
- 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差,所以专业流程应该先定妆再开拍。
- 提示词里的参考代号靠规范引导,不做二次硬拼。 创作者审词时仍应确认参考代号齐全。
- 约 10 秒的场块是工程启发式,不是时间码精剪。 超长场会再拆,但精剪与串场成片仍需后续剪辑环节。
- 没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里,系统提供的是多 take 与改词重拍的工具。
猫斯卡固化了哪一步
猫斯卡是一条从想法到成片的 AI 竖屏短剧生产操作系统,不是单个文生视频按钮。在角色一致性这件事上,它把上面这套链路固化进了产品:
- 创意简报锁版后才能进入角色阵容确认,阵容不齐、视觉字段不完整不能进下一阶段;
- 定妆图走两段式工艺,视频侧只消费已完成的立绘;
- 每场自动按「场景 → 道具 → 人物」顺序构建参考素材表;
- 生成镜头提示词时,对已有参考图的人物自动剥离服装与外貌描写,文字只留动作、表情、伤情;
- 支持手动角色绑定、道具纳入 / 排除、历史版本换图、时代造型路由。
它没有试图用一次生成替代剧组;它用工程手段强制执行了短剧工业里已经被验证的质量控制顺序——先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
如果你正在搭自己的 AI 短剧生产线,可以从「有参考图就不写外观」这条铁律开始试,这是成本最低、见效最快的一步。
常见问题
为什么 AI 生成短剧时同一个角色会换脸?
大多数换脸不是模型不稳定,而是提示词和参考图在打架。每一场都用文字重新描写人物的服装和外貌,模型会在文字描述和参考图之间折中,结果脸就变了。
解决换脸最有效的一条规则是什么?
有参考图的人物,禁止再用文字描写服装和外观。参考图负责脸型、五官、发型、服装、体型;文字只负责动作、表情、伤情、光线和场景。
定妆图需要做到什么程度才能开拍?
定妆图必须是状态已完成且文件可读的立绘。半成品、模糊图、损坏的文件不能拿去绑参考,否则模型拿到的是噪声,脸一定会飘。阵容和设定要先锁版再出图。
穿越和闪回场景怎么避免同一个人换脸?
按场景地点关键词判定现代或古代,取人物定妆图时优先匹配对应造型。这是规则选图,不是人脸嵌入校验,最终观感仍取决于立绘质量和提示词是否遵守「有图不写外观」。
不做定妆直接用纯文字拍行不行?
可以,系统允许跳过参考图走纯文字路径,但质量通常更差。专业流程应该先定妆再开拍,缺图时系统会提醒,但不会强制阻止。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com