AI 短剧角色换脸:从定妆到开拍的一致性工程拆解

猫斯卡编辑部 | 最后更新日期

AI 短剧里同一个人上一场是圆脸、下一场变尖脸,根因不是模型差,而是每场戏都在用文字重新「想」这个人长什么样。真正的解法是把长相从提示词里拿出去,交给定妆资产管。

换脸的本质:提示词在和参考图打架

很多团队以为换脸是视频模型不稳定,其实大多数翻车发生在开拍之前。

典型流程是这样的:编剧写「李明穿着黑色风衣走进办公室」,美术出了一张李明的定妆图,但到了第 8 场,提示词里又写了一遍「黑色风衣、短发、冷峻面容」。模型拿到两套指令——参考图一套、文字一套——它会在两者之间折中,结果就是脸悄悄变了。

角色一致性靠资产,不靠运气。 这句话的意思是:人物长什么样,只在定妆环节决定一次;进入拍摄后,文字提示词只负责动作、表情、伤情,绝不重复描写服装和外貌。

一条铁律:有参考图的人物,禁止文字描写外观

这是工业流程里最硬的一条规则,也是区分「玩具」和「生产工具」的分界线:

有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。

为什么必须这么做?因为 AI 视频模型对文字描述的权重并不低。你在提示词里写「穿着红色裙子」,即使参考图里是蓝色裙子,模型也会尝试融合——融合的结果往往就是脸跟着变。

正确的做法是把提示词拆成两部分:

  • 参考图负责的部分:脸型、五官、发型、服装、体型、年龄感
  • 文字负责的部分:站在哪里、做什么动作、什么表情、受了什么伤、光线如何

这两部分一旦划清,换脸概率会大幅下降。

从定妆到开拍的四步一致性链路

换脸问题不能在「拍」这一步解决,它是一条链路,任何一环松了都会漏。

第一步:角色阵容先锁版,再出图

很多团队的顺序反了:先写几集剧本,觉得人物差不多了就开始拍,拍到一半发现主角名字还在变、身份还在改。

正确顺序是:

  1. 创意简报锁版(含主角人物弧光)
  2. 角色阵容确认:姓名、身份、性格、视觉字段齐全
  3. 主角与简报对齐校验
  4. 才进入立绘出图

阵容没锁就出图,后面改一次设定,前面所有定妆作废,等于白做。

第二步:定妆图两段式生成,可人工覆盖

定妆不是「扔一段描述给模型等图」。专业流程分两段:

  1. 文本润色:用选定画风的人物手册,把档案里的人物描述润色成可出图的提示词;性别是硬规则,不随模型发挥。这一步人可以覆盖。
  2. 图像生成:拼最终提示词出图,支持参考图,落库为可回看的历史版本。

关键是:视频侧只消费状态已完成且文件可读的立绘。半成品、模糊图、文件损坏的图,不能拿去绑参考——否则模型拿到的是噪声,脸一定飘。

第三步:每场自动构建参考素材表,顺序固定

开拍前,每场戏需要一张参考素材表,顺序是固定的:

优先级素材类型作用
1场景图交代空间,且严禁出现人物
2本场道具图控制视觉焦点,无关道具排除
3人物定妆图锁定长相与服装

有图才占槽位,无图标明「仅文字」,不强行编造绑定。这张表的意义是:模型在生成这一场时,第一眼看到的是「这个人长这样」,而不是「这个人可能长这样」。

第四步:时代造型路由,处理穿越与闪回

穿越、闪回、回忆杀是换脸重灾区。同一个人物在古代是长发束冠,在现代是短发西装,如果系统不分场景统一取一张定妆图,要么穿错衣服,要么脸被拉扯。

工程化解法是按场景地点关键词判定现代 / 古代,取人物定妆图时优先匹配对应造型。这不是人脸嵌入校验,而是规则选图——最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。

三个最常见的翻车点与对应修法

翻车点 1:剧本里的称呼和档案对不上

剧本写「警官」,档案里叫「李强」,系统不知道这是同一个人,就不会绑李强的定妆图,结果这一场变成了随机脸。

修法:支持手动角色绑定,把剧本称呼映射到档案人物。客串、泛指角色(如「路人甲」)要从可绘制主演名单里剥离,避免挤占定妆槽位。

翻车点 2:道具挤占参考槽位

一场戏里如果塞了太多道具参考图,人物定妆图的权重会被稀释,模型「看不清」主角长什么样。

修法:道具按集提取剧本原始称呼,全剧合并成 catalog;每场手动纳入 / 排除道具,只留本场真正出现的。

翻车点 3:提示词里偷偷写了外貌

即使绑了参考图,提示词里一句「年轻英俊的男子」就可能让模型往「年轻」方向拉,和定妆图的中年设定冲突。

修法:提示词生成时只给本场素材,禁止串戏;本场剧本正文是最高优先级撰写依据,但系统在生成镜头提示词时,对已有参考图的人物自动剥离外貌描写。创作者审词时仍应再确认一遍。

必须承认的边界

讲完解法,也要讲清楚哪些做不到,否则就是在卖幻想。

  1. 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量。
  2. 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差,所以专业流程应该先定妆再开拍。
  3. 提示词里的参考代号靠规范引导,不做二次硬拼。 创作者审词时仍应确认参考代号齐全。
  4. 约 10 秒的场块是工程启发式,不是时间码精剪。 超长场会再拆,但精剪与串场成片仍需后续剪辑环节。
  5. 没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里,系统提供的是多 take 与改词重拍的工具。

猫斯卡固化了哪一步

猫斯卡是一条从想法到成片的 AI 竖屏短剧生产操作系统,不是单个文生视频按钮。在角色一致性这件事上,它把上面这套链路固化进了产品:

  • 创意简报锁版后才能进入角色阵容确认,阵容不齐、视觉字段不完整不能进下一阶段;
  • 定妆图走两段式工艺,视频侧只消费已完成的立绘;
  • 每场自动按「场景 → 道具 → 人物」顺序构建参考素材表;
  • 生成镜头提示词时,对已有参考图的人物自动剥离服装与外貌描写,文字只留动作、表情、伤情;
  • 支持手动角色绑定、道具纳入 / 排除、历史版本换图、时代造型路由。

它没有试图用一次生成替代剧组;它用工程手段强制执行了短剧工业里已经被验证的质量控制顺序——先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

如果你正在搭自己的 AI 短剧生产线,可以从「有参考图就不写外观」这条铁律开始试,这是成本最低、见效最快的一步。

常见问题

为什么 AI 生成短剧时同一个角色会换脸?

大多数换脸不是模型不稳定,而是提示词和参考图在打架。每一场都用文字重新描写人物的服装和外貌,模型会在文字描述和参考图之间折中,结果脸就变了。

解决换脸最有效的一条规则是什么?

有参考图的人物,禁止再用文字描写服装和外观。参考图负责脸型、五官、发型、服装、体型;文字只负责动作、表情、伤情、光线和场景。

定妆图需要做到什么程度才能开拍?

定妆图必须是状态已完成且文件可读的立绘。半成品、模糊图、损坏的文件不能拿去绑参考,否则模型拿到的是噪声,脸一定会飘。阵容和设定要先锁版再出图。

穿越和闪回场景怎么避免同一个人换脸?

按场景地点关键词判定现代或古代,取人物定妆图时优先匹配对应造型。这是规则选图,不是人脸嵌入校验,最终观感仍取决于立绘质量和提示词是否遵守「有图不写外观」。

不做定妆直接用纯文字拍行不行?

可以,系统允许跳过参考图走纯文字路径,但质量通常更差。专业流程应该先定妆再开拍,缺图时系统会提醒,但不会强制阻止。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com