AI 短剧角色为什么每集都在换脸:从「文字描写」到「参考资产」的工艺切换
AI 短剧角色每集换脸,根因是你还在用文字描写一个已经有脸的人。模型每读一次「英俊男主」就重新画一次。解法是把人物变成定妆资产,拍摄时只引用、不重写。
换脸不是模型问题,是流程问题
很多团队把角色换脸归因于「模型不行」,于是反复换模型、换参数、加 LoRA、堆提示词。结果是:第 1 集像 A,第 5 集像 B,第 12 集干脆变成第三个人。
问题不在模型,在于你让模型每一场都在重新想象这个人长什么样。
传统剧组不会在每个镜头前重新选角。演员定妆后,妆发、服装、造型照片进组,摄影、灯光、美术都以这套定妆为准。AI 短剧要做到不换脸,必须复刻这个动作——先定妆,再开拍,拍摄时只引用,不重写。
一致性靠资产,不靠运气。
文字描写是换脸的源头
看一个典型的翻车路径:
- 剧本写「冷峻的男主走进会议室」
- 第 3 集提示词写「三十岁左右,西装,短发,眼神锐利」
- 第 8 集提示词写「成熟男性,黑色西装,神情严肃」
- 模型每次都根据这些词重新生成一张脸
文字是模糊的。「冷峻」「锐利」「成熟」在每一次生成里都会落到不同的五官上。即使你把描写复制粘贴一百遍,模型也不会把它理解成「同一个人」——它理解的是「符合这些形容词的某个人」。
只要外貌还停留在文字层,换脸就是必然。
从「写人物」到「引用人物」
正确的工艺切换只有一句话:
有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。
这是 AI 短剧一致性链路里最硬的一条规则。它做了三件事:
| 旧做法(换脸) | 新做法(不换脸) |
|---|---|
| 每场提示词重写外貌 | 外貌只存在于定妆图里 |
| 模型根据形容词想象脸 | 模型根据参考图还原脸 |
| 服装、发型每场漂移 | 服装、发型锁在定妆资产 |
| 文字与参考图打架 | 文字让位给参考图 |
切换之后,提示词里关于人物的部分会变得很短:不是「男主,三十岁,黑色西装,短发,剑眉星目」,而是「男主走到桌前,皱眉,把文件摔下」。外貌由参考图承担,文字只负责调度。
定妆资产是怎么建起来的
不换脸的前提是有一套可被引用的定妆资产。它不是一张随手抽的卡,而是一条工艺链的产物:
- 画风先选定。 人物立绘、场景、道具、视频提示词共用同一风格路径,避免「人物是日漫、视频变写实」的断层。
- 档案描述润色为出图提示词。 用该画风的人物手册,把人物档案里的身份、气质、材质翻译成可出图的描述,这一步可人工覆盖。
- 出图、落库、可回看历史版本。 定妆不是一次性的,选不中的图留档,后续可回退、可替换。
- 阵容硬门禁。 主角齐全、视觉字段完整、与简报对齐,才能进入开拍;不过关不往下走。
这套流程的关键不是「画得好看」,而是画完之后,这张图成为全剧唯一的人物视觉来源。
每场戏怎么绑参考图
有了定妆资产,下一步是让每一场戏都正确地引用它。工业级的做法是为每场自动构建一张参考素材表,顺序固定:
`` 场景图 → 本场道具图 → 人物定妆图 ``
几个容易被忽略但直接决定成败的细节:
- 有图才占槽位。 没有图的项标明「仅文字」,不强行编造绑定。
- 空镜纪律。 场景图里严禁出现人物,否则模型会把场景里的路人当成角色参考。
- 手动角色绑定。 剧本里写「警官」,要绑到档案里「李强」的定妆;称呼不一致是串脸的高发区。
- 道具纳入 / 排除。 无关道具会挤占参考槽位,要能手动剔除。
- 时代造型路由。 穿越、闪回题材按场景判定现代 / 古代,取对应造型的定妆图,而不是默认拿现代装去拍古代戏。
开拍前还应有一次齐套校验:缺场景、缺人物、缺道具参考时,弹出清单提醒先去绘制。允许跳过走纯文字路径——但专业流程应该先定妆再开拍,因为纯文字路径的一致性通常更差。
提示词只写动作,不写脸
参考图绑定之后,提示词的写法要跟着变。工程化的镜头提示词包含八大要素:精准主体、动作细节、场景环境、光影色调、镜头运镜、视觉风格、画质、约束条件。
注意,外貌不在这八大要素里——因为外貌已经由参考图承担。
一个对比:
❌ 男主,二十八岁,剑眉,黑色高定西装,冷峻地走进会议室,把文件摔在桌上,镜头推进。
✅ 男主推门走进会议室,把文件摔在桌上,眉头紧锁,镜头缓推。
第二种写法把外貌全部删掉,只留动作和表情。模型拿到参考图后,会让「这张脸」去做这些动作,而不是根据形容词新造一张脸。
配套的纪律还包括:
- 一镜一运镜,不在一个镜头里叠加推拉摇移
- 用镜头序号,不写绝对秒数
- 多人场景加双胞胎 / 分身兜底约束
- 动作优先低缓连续,减少高爆发动态导致的面部崩坏
系统在教模型用分镜表语言说话,而不是写小说。
为什么换了图还是会漂
即使做对了上面所有步骤,角色仍可能轻微漂移。常见原因有三个:
- 立绘质量本身不够稳。 参考图角度过偏、光影过重、五官模糊,模型可提取的锚点就少。定妆阶段应优先选正面、光线均匀、五官清晰的图。
- 提示词里还残留外貌描写。 哪怕只是「英俊」「憔悴」这类词,都可能和参考图打架。审词时要把这些词清掉。
- 跨场没有统一资产。 每集单独传图、单独命名,模型不会知道这是同一个人。必须让全剧指向同一份定妆档案。
需要诚实说明的是:角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。没有任何流程能保证 100% 一致,但多 take 择优 + 改词重拍能把漂移控制在可接受范围。
这套工艺在猫斯卡上是怎么固化的
猫斯卡把上面的流程固化成了一条从定妆到开拍的强制链路:
- 17 套画风手册,选定后人物、场景、道具、视频共用同一风格路径
- 人物立绘走「文本润色 → 出图 → 落库」两段式工艺,支持人工覆盖与历史版本回退
- 每场自动构建「场景 → 道具 → 人物」参考素材表,支持手动角色绑定、道具纳入排除、时代造型路由
- 提示词生成执行「有参考图的人物不写外观」规则,文字只调度动作、表情、伤情
- 开拍前齐套校验,缺图提醒,允许跳过但明确告知质量风险
- 同场多 take 历史,改词或换图后重拍择优
需要说清边界:猫斯卡没有成片自动打分或自动择优重拍引擎,质量终审在创作者和监制手里;参考图不是强制门禁,缺图可以跳过;约 10 秒的场块是工程启发式,不是时间码精剪。它做的是把专业剧组「先定妆、再开拍、拍摄只引用」的纪律,变成产品里绕不开的步骤。
猫斯卡的定位是可规模化生产的 AI 短剧操作系统——把专业流程固化进产品,而不是宣称无需人类、零失误出片。
把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
常见问题
为什么我每场都把人物描写复制粘贴,AI 还是换脸?
因为文字描写每次都会让模型重新想象一个符合形容词的人,而不是还原同一个人。「冷峻」「锐利」「成熟」没有唯一对应的五官。要让模型认出同一个人,必须用定妆参考图,并且在提示词里删掉外貌描写,只写动作、表情、伤情。
定妆图要怎么选才不容易漂?
优先选正面、光线均匀、五官清晰、没有过重阴影或极端角度的图。参考图越干净,模型能提取的面部锚点越多。侧脸、低头、强光影的图作为主定妆,漂移概率会明显升高。
剧本里同一个人有好几种称呼,怎么防止串脸?
用手动角色绑定,把剧本里的「警官」「他」「李队」等称呼统一绑到档案里「李强」的同一张定妆图上。称呼不一致是 AI 短剧串脸的高发区,不能指望模型自己猜。
穿越或闪回戏,古装和现代装怎么不串?
需要为同一人物建立不同造型的定妆资产,并让系统按场景的时代关键词路由到对应造型。不能拿现代装定妆去拍古代戏,也不能让模型根据文字临时换装。
如果某场戏实在没有定妆图,能直接拍吗?
可以走纯文字路径,但一致性通常更差,专业流程应该先补定妆再开拍。系统会在开拍前提醒缺图,是否跳过由创作者决定,但要有质量下降的预期。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com