AI 生成的短剧角色总是换脸,到底怎么解决

猫斯卡编辑部 | 最后更新日期

AI 短剧角色换脸,根本原因是每场戏都在重新想象这个人长什么样。解法是先出定妆图,拍摄时只引用定妆资产,并禁止用文字再描写有参考图人物的服装和外貌。

换脸不是模型问题,是流程问题

很多团队一遇到角色脸变,第一反应是换模型、调参数、加权重。但在短剧生产里,换脸的根因通常不在模型档位,而在拍摄前的资产链路没走通:人物没有一份被锁定的定妆图,每场戏的提示词都在用文字重新描述长相,模型自然每场都重新画一张脸。

角色一致性依赖定妆资产链路,不是人脸嵌入校验。 这句话的意思是:稳定的角色靠的是「先有图、再引用图」的工业顺序,而不是指望模型记住你上一场写过的「高鼻梁、丹凤眼、黑色风衣」。

换脸的三个典型成因

1. 没有定妆图,全靠文字描写

这是最常见的情况。剧本里写着「女主穿着白色连衣裙,长发披肩」,每一场提示词都把这段外貌描述塞进去。模型对「白色连衣裙」「长发」的理解每次都有细微差别,十场下来就像十个演员。

2. 有参考图,但提示词里又写了外观

这是最隐蔽、也最致命的一种。你给了参考图,但提示词里仍然写「穿着红色外套、短发、戴眼镜」。文字描述和参考图同时存在时,下游模型会在两者之间摇摆,结果就是:有时跟图,有时跟文字,有时两者各取一半——脸就漂了。

3. 参考图顺序混乱,人物被场景或道具盖过

AI 视频对参考图的注意力分配是有顺序的。如果一场戏里场景图、道具图、人物图的占位顺序乱掉,或者塞了太多无关参考,人物面容的权重就会被稀释,表现出来就是「长得有点像,但不是同一个人」。

工业解法:定妆 → 锁图 → 禁写外观

解决换脸的核心流程只有三步,顺序不能反:

  1. 先定妆:在开拍之前,为每个角色出一套定妆立绘,确认面容、发型、服装、气质,落库为可回看的历史版本。
  2. 每场绑定参考图:拍摄某一场时,把该场出场角色的定妆图绑定为参考,按「场景图 → 道具图 → 人物定妆图」的固定顺序占位,有图才占槽位,无图标明仅文字。
  3. 提示词里禁止再描写外观:有参考图的人物,文字部分只写动作、表情、伤情;服装、发型、面容一律交给参考图。

第三条是硬约束。猫斯卡(Maosika)在生成镜头提示词时执行这条规则:有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。 这条规则直接针对「文字与参考图打架」这一最常见的翻车点。

穿越 / 闪回题材的特殊处理

穿越、重生、闪回类短剧,同一个角色在不同时代有不同造型。如果所有场次都引用同一张定妆图,古装戏里出现现代装、现代戏里冒出古装发饰,观感上同样是「换脸」。

处理方式是时代造型路由:按场景的地点、时代关键词判定是现代还是古代,取人物定妆图时优先匹配对应造型版本。也就是说,一个角色可以有多套定妆(现代装、古装、受伤妆、晚宴装等),每场戏按剧情自动取用对应的那一张,而不是全场共用一张。

一致性靠资产,不靠运气

把上面的逻辑收束成一句话:一致性靠资产,不靠运气。

做法结果
每场用文字重新描写人物外貌十场十个样,必然换脸
有参考图但提示词里又写外观文字与图打架,随机漂移
先定妆、每场绑图、禁写外观面容由资产锁死,稳定可控
穿越题材按时代路由造型图不同时代同一人,不串造型

这套逻辑在猫斯卡的链路里被固化为几个硬门禁:角色阵容确认阶段强校验视觉字段完整、立绘状态必须为已完成且文件可读才会被视频侧消费、开拍前做齐套校验提醒缺失的参考图。人在关键节点做确认(定妆过不过、绑哪张图),机器负责把确认过的资产落到每一场的提示词里。

必须承认的边界

这套流程能解决绝大多数换脸问题,但有几条边界需要提前讲清楚,否则预期会错位:

  • 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差,所以专业流程应该先定妆再开拍。
  • 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 最终观感仍取决于立绘本身的质量,以及提示词是否真的遵守了「有图不写外观」。
  • 约 10 秒的场块是工程启发式,不是时间码精剪。 超长动作场仍可能出现面部微漂移,精修与串场成片需要后续剪辑环节兜底。
  • 当前不做跨场自动续写 / 延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」,跨场连贯靠分场独立出片后剪辑串联。

猫斯卡的定位是可规模化生产的 AI 短剧操作系统——把专业流程固化进产品,而不是宣称无需人类、零失误出片。把重复、易漂移、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com