为什么有了参考图就不能再用文字描写服装
AI 短剧角色换脸换装,根子不在模型差,而在你既给了定妆参考图,又在提示词里写了她穿什么。两套指令打架,模型只能临场二选一,翻车是必然。
这不是玄学,是指令优先级问题
很多导演第一次用 AI 拍竖屏短剧,会习惯性在提示词里把人物外貌、服装、发型再写一遍——觉得写得越细越稳。结果恰恰相反:参考图和文字外观描述同时存在时,模型收到的是两份互相竞争的视觉指令。
参考图说「她穿米白色风衣、齐肩短发、左耳一颗小耳钉」;文字说「她穿着黑色西装、长发披肩」。模型没有「以图为准」的内置常识,它会按自己的注意力权重在两套描述之间做插值。插值的结果,就是你看到的那些经典翻车:
- 脸是对的,衣服颜色在风衣和西装之间漂移
- 发型一会儿齐肩一会儿披肩,同一场里前后两秒不一致
- 耳钉时有时无,配饰凭空出现或消失
- 多人场景里两个人的服装元素互相串
一致性靠资产,不靠运气。 定妆图一旦确认,它就是这个角色在这个造型下的唯一视觉真相。文字再去描写外观,等于在片场开拍前临时给演员换了一套衣服,却没通知摄影和美术。
「有参考图的人物,禁止再用文字描写服装 / 外观」
这是一条可以直接写进剧组工作手册的硬规则。它的完整表述是:
有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。
这条规则针对的就是 AI 视频最经典的翻车场景:文字描述与参考图打架,导致换装、换脸、配饰漂移。
它背后的逻辑可以拆成三层:
- 参考图是高密度信号。 一张定妆图里包含的服装剪裁、面料质感、颜色层次、发型细节、配饰位置,是几百字文字都描述不完的。让模型直接看图,比让它读文字再「想象」要可靠得多。
- 文字是噪音源。 当文字和图描述的是同一件事,模型不会自动判定「图更权威」,它会把两者都当作有效输入做混合。
- 文字的本职工作在别处。 动作怎么走、表情是冷笑还是崩溃、脸上有没有新添的伤痕——这些是图给不了、必须靠文字说清的,也是文字该把 token 预算花在的地方。
片场里怎么落地这条纪律
规则说起来简单,真正在生产线上执行,需要几个配套动作。
参考图的占位顺序
每场戏自动构建参考素材表,顺序是固定的:场景图 → 本场道具图 → 人物定妆图。有图才占槽位,无图标明「仅文字」,不强行编造绑定。
这个顺序不是随便排的。场景先定,人物才能落在对的空间里;道具其次,避免演员手里凭空多东西或少东西;最后才是人物定妆。槽位顺序本身就在告诉模型「这一层的视觉由谁负责」。
手动绑定与道具管控
剧本里的称呼和档案里的角色名常常对不上——剧本写「那个警官」,档案里叫「李强」。这时候需要手动角色绑定,把剧本里的指代替换正确的定妆资产,否则模型会凭空生成一个「警官」形象,和你定好的李强毫无关系。
道具同理。不是剧本里提到的每样东西都要出现在画面里,道具的纳入 / 排除应该由美术和导演决定,避免无关道具挤占参考槽位、分散模型注意力。
时代造型的特殊处理
穿越、闪回、回忆题材里,同一个角色在古代和现代有不同造型。这时候靠时代造型路由:按场景地点的关键词判定是现代还是古代,取人物定妆图时优先匹配对应造型。但要注意,这是规则选图,不是人脸嵌入校验——最终观感仍然取决于你两套定妆图本身的质量,以及提示词有没有老老实实遵守「有图不写外观」。
提示词生成时只给本场素材
生成某一场的镜头提示词时,只喂这一场需要的参考图和剧本正文,禁止串戏。把别的集数、别的场次的人物图混进来,等于给模型递了多余的时尚选项,漂移概率直线上升。本场剧本正文是最高优先级撰写依据,其余都是配角。
文字该写什么,不该写什么
一张对照表说清楚:
| 维度 | 有参考图时 | 没参考图时 |
|---|---|---|
| 服装款式、颜色、面料 | ❌ 不写,图负责 | ✅ 必须写清楚 |
| 发型、发色、配饰 | ❌ 不写,图负责 | ✅ 必须写清楚 |
| 面部特征、身材 | ❌ 不写,图负责 | ✅ 必须写清楚 |
| 动作、走位、肢体 | ✅ 重点写 | ✅ 重点写 |
| 表情、情绪、眼神 | ✅ 重点写 | ✅ 重点写 |
| 伤情、污渍、临场状态 | ✅ 重点写(图上没有) | ✅ 重点写 |
| 台词、音效、BGM | ✅ 按符号规范写 | ✅ 按符号规范写 |
简单记:图管「长什么样」,字管「在干什么」。 两者各司其职,不抢活。
几个常见的误区
误区一:「我写的和图是一致的,多写一遍加固一下不好吗?」
不好。你以为是加固,模型读到的是「第二份独立指令」。哪怕文字和图 99% 一致,那 1% 的措辞偏差(比如你写「深红色长裙」,图里其实是酒红色)就足以让模型在颜色上做插值。而且多写一遍占用 token,挤压了真正需要写的动作和表情的空间。
误区二:「我这场有伤情 / 衣服破了,所以得把服装再写一遍。」
不需要。你只需要写增量:「左臂衣袖被划破,露出伤口」。基础服装仍然交给参考图,文字只描述图上没有的、这场新发生的变化。
误区三:「模型不行才会这样,换个更强的模型就不用守这规矩。」
这是对生成模型工作原理的误解。只要模型是「图文联合注意力」的架构,图文冲突就永远存在。更强的模型可能插值得更「聪明」,但不会自动学会「图的优先级高于文字」——这是产品层和流程层要强制的纪律,不是模型层能替你解决的。
诚实边界
这条规则也有它的适用范围,说清楚才不误导人:
- 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差,所以专业流程应该先定妆再开拍。
- 提示词里的参考代号靠规范引导,不做二次硬拼。 创作者审词时仍应确认参考代号齐全、没有多余的外观描述漏网。
- 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量,以及提示词是否真的遵守了「有图不写外观」。
把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
---
*猫斯卡(Maosika)是 AI 竖屏短剧生产操作系统,把专业剧组的工艺顺序——先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优——固化进了产品。在猫斯卡的视频链路里,「有参考图的人物禁止再用文字描写外观」是一条写进镜头提示词生成逻辑的硬约束,道具师视角的道具提取、场记视角的场次对齐、选角导演视角的角色绑定,都是为了让参考图和文字各管各的,不打架。*
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com