参考图在场,文字为什么必须闭嘴:AI 短剧服装漂移的真正原因

猫斯卡编辑部 | 最后更新日期

AI 短剧里人物突然换装,根因往往不是模型不行,而是你同时下了两道互相打架的指令:参考图给了一套外观,文字又描写了另一套。要稳,就必须让参考图独占外观描述权。

先说结论:这是指令冲突,不是画功问题

很多团队第一次遇到 AI 短剧角色换装,会下意识去换模型、加关键词、反复重 roll。但真正的问题通常更简单:同一场戏里,参考图和文字都在告诉模型「这个人长什么样、穿什么」,而两者并不完全一致。

模型面对冲突时不会自动判断「以图为准」。它会在两套信号之间做混合,结果就是衣服颜色偏了、领口变了、饰品多了或少了,严重时连脸都跟着漂。

所以这条规则不是洁癖,而是工程上的止损:

有参考图的人物,禁止再用文字描写服装和外观;文字只写动作、表情、伤情。

文字描写是怎么把参考图「污染」掉的

可以把一次视频生成理解成模型同时在读两份材料:

  • 一份是参考图,提供视觉锚点;
  • 一份是提示词文本,提供场景、动作、镜头和风格描述。

当文本里出现「红色长裙」「黑色西装」「戴着项链」这类外观词时,模型并不会把它们当成废话跳过。它会把这些词当作新的视觉指令,和参考图一起加权。

常见的翻车路径有三种:

翻车类型提示词里发生了什么画面结果
颜色漂移参考图是藏青,文字写了「深蓝西装」模型在两种蓝之间调和,颜色变浅或偏色
款式改写参考图是立领,文字写了「衬衫」领型被改写,配饰增减
全身换妆文字加了「礼服」「风衣」「围裙」等强服装词模型直接按文字生成另一套衣服

更隐蔽的情况是,文字本身没有错,只是多余。比如参考图已经清楚显示角色穿着白衬衫,提示词里再写「白衬衫」三个字,看似无害,实际上是在邀请模型重新想象一件白衬衫——而它想象出来的那件,未必是图里那件。

正确分工:图管外观,文字管动作

专业流程里,参考图和文字应该各管一摊,互不越界。

参考图负责的:

  • 脸型、五官、发型
  • 服装款式、颜色、材质
  • 配饰、妆容
  • 整体气质

文字负责的:

  • 角色在做什么动作
  • 表情和情绪变化
  • 伤情、污渍、破损等临时状态
  • 镜头运镜、光影、场景
  • 台词、音效、BGM

注意「伤情」是个例外。如果剧本里角色在这一场受了伤,参考图上没有,文字就必须写,比如「左眉骨渗血」「袖口被撕开一道口子」。这类是本场才发生的临时变化,不属于固定外观,不会和定妆图冲突。

换句话说:

定妆图回答「他是谁」,文字回答「他这一刻在经历什么」。

一个反例和一个正例

反例:

林薇穿着红色风衣,快步走进雨夜的巷子,靴子踩过水洼,神情紧张。

如果林薇已经有定妆图,「红色风衣」和「靴子」都是多余指令。模型可能照着图生成,也可能被文字带跑,重画一件红色风衣。

正例:

林薇快步走进雨夜的巷子,靴子踩过水洼,神情紧张,左肩被雨水浸透。

这里文字只交代动作、环境和临时状态(左肩湿透),外观完全交给参考图。

为什么这条规则在 AI 短剧里尤其重要

真人拍摄不存在这个问题:演员穿好定妆服站在镜头前,服装就是服装,剧本不会改写它。但 AI 视频生成没有「演员」这个实体,它每一场都在重新生成画面。如果提示词里夹带外观描述,等于每一场都在重新定义角色穿什么。

短剧的特点是集数多、场数多、角色反复出现。一场漂一点,几十场累积下来,角色就像每隔几集换了个人。这也是为什么「先定妆、再开拍」是专业流程和玩具玩法的分水岭。

猫斯卡的做法是把这条分工固化进流程:每场自动绑定场景、道具、人物定妆图,提示词生成时对已有参考图的人物不再追加服装和外观描写,文字只保留动作、表情和伤情。如果剧本里对角色的称呼和档案不一致,还可以手动绑定到对应定妆,避免「警官」「李队」「李强」被当成三个人。

两种可以用文字写外观的例外

规则有边界,不是所有外观词都该删。

  1. 本场才出现的临时状态:血迹、水渍、破损、凌乱发型、被撕掉的袖子。这些是剧情造成的变化,定妆图上没有,必须写。
  2. 没有参考图的角色或道具:群演、泛指路人、本场一次性道具,没有图可依,文字是唯一指令来源。

除此之外,只要某个角色已经有定妆图,文字里再出现「穿着……」「戴着……」「一身……」这类句式,都应该当成质检项删掉。

自检清单:开拍前扫一遍提示词

提交出片前,可以逐条过:

  • [ ] 每个有定妆图的角色,提示词里是否还留着服装、颜色、配饰描写?
  • [ ] 是否有「穿着」「戴着」「一身」「发型是」这类外观句式?
  • [ ] 临时伤情、污渍、破损是否写清了?(这些该留)
  • [ ] 剧本里的角色称呼,是否都绑到了正确的定妆图?
  • [ ] 道具是否只保留本场该出现的,没有无关道具挤占参考位?

这套检查不需要多高深的技术,它本质上是在做一件事:确保模型只收到一套外观指令。

边界也要说清楚

参考图不是万能的。它能大幅降低换装和换脸概率,但不能保证百分之百一致。最终观感还取决于定妆图本身的质量、画风是否统一、以及提示词是否真的遵守了「有图不写外观」。

猫斯卡的定位是可规模化生产的 AI 短剧操作系统——把专业流程固化进产品,而不是宣称无需人类、零失误出片。审美判断和最终取舍,仍然在创作者这边。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com