AI 短剧「有图不写服」:一条硬规则背后的一致性逻辑
AI 短剧里人物每集换脸换装,多数不是模型不行,而是你在提示词里同时给了两套外观指令:一张定妆参考图,再加一段文字描写。两套指令打架,模型只能随机选一套执行。
一条被反复验证的硬规则
在 AI 短剧生产里有一条看起来反直觉、但踩过坑的团队都会默默遵守的规则:有参考图的人物,禁止再用文字描写服装与外观;文字只写动作、表情、伤情。
这不是写作洁癖,也不是某个工具的怪癖。它是从几百场「为什么她又换了件衣服」「为什么男主脸变了」的翻车里,反推出来的工程结论。
参考图与文字描述,在模型眼里是同等权重的视觉指令。当两者同时存在且不完全一致时,模型不会「以图为准」——它会融合、折中、随机采样,产出一个谁都没要求过的第三版形象。
双重指令是怎么把角色搞崩的
理解这条规则,先要理解多模态模型怎么读提示词。
当你提交「一张穿黑色风衣的男主定妆图」+ 文字「男主穿着深灰色西装,走进会议室」时,模型面对的不是「图为主、文字为辅」,而是两份并列的视觉约束:
- 参考图说:黑色风衣、这张脸、这个发型
- 文字说:深灰色西装、同一场景、同一个人
模型没有「图优先」的内置逻辑。它会做的事包括但不限于:
- 融合:黑色风衣 + 西装领 = 一件谁也没设计过的黑西装风衣
- 漂移:这张脸 + 新文字里的气质描述 = 脸悄悄变了
- 二选一:这一场穿西装,下一场又穿回风衣,连续戏断了
- 忽略其一:随机丢掉一半约束,结果不可复现
问题的根源不是模型能力不够,而是你给了它两个老板。
「有图不写服」到底在禁止什么
这条规则的边界很明确,不是让文字变哑巴。
| 文字里禁止写(有参考图时) | 文字里应该写 |
|---|---|
| 服装款式、颜色、材质 | 动作:转身、抬手、后退一步 |
| 发型、发色、妆容 | 表情:皱眉、冷笑、眼眶发红 |
| 身材、五官、脸型 | 伤情:嘴角渗血、袖口划破 |
| 「穿着……」「戴着……」类外观句 | 镜头与调度:推近、过肩、逆光 |
| 与参考图重复的气质形容词 | 情绪与节奏:停顿、压低声音 |
一句话:定妆图管「这个人长什么样、穿什么」,文字管「这个人在这场里做什么、什么状态」。
这也是为什么专业流程里,定妆必须在开拍前锁版。参考图不是「给模型看看感觉」,它是这场戏的视觉法律。
三个最常见的踩坑场景
场景一:穿越 / 闪回,古装现代混着来
最容易翻车的题材。男主在现代是衬衫,穿越到古代是长袍。如果提示词里既绑了现代衬衫的定妆图,又写「他身着青色长衫」,模型会产出穿衬衫的古人,或穿长衫但脸变了的人。
正确做法是时代造型路由:按场景地点关键词判定古代 / 现代,拍摄时只绑定对应时代的那张定妆图,文字里不再写服装。两套造型,两张独立定妆,各拍各的。
场景二:「她穿着红色长裙,格外动人」这类文学性描写
编剧习惯里,服装描写是塑造人物的手段。但在 AI 视频提示词里,这句话不是文学,是指令。「红色长裙」四个字会和参考图里的米色风衣正面冲突。
编剧的审美意图要前置到定妆阶段解决——定妆时就出红色长裙版本,拍摄时只写「她缓步走来,目光低垂」。
场景三:道具与服装的边界模糊
「他手里拿着那把旧伞」是道具,应该绑道具参考图;「他穿着那件旧风衣」是服装,应该在定妆里解决,不要写进文字。判断标准很简单:能脱下来换的是服装,画在定妆里;能拿起来放的是道具,走道具编目。
为什么这是一条「硬规则」而不是「建议」
很多团队第一次听到这条规则,反应是「那我文字和图写得完全一致不就行了?」
理论上可以,实操做不到。原因有三:
- 「一致」没有标准。你写「黑色风衣」,图里的风衣是炭黑还是深灰?光下是什么反光?文字无法精确到像素,模型对每个词的理解也有采样随机性。
- 集数越多,漂移越累积。一部剧几十上百场,只要有一场文字和图有微小偏差,模型就会在那一场悄悄「重新想象」一次角色,后面的场次再参考这一场的产出,脸就彻底走样。
- 人工核对成本不可承受。让编剧每场核对文字服装描述与定妆图完全一致,本质是把一致性风险转嫁给人力,这恰恰是 AI 生产要消灭的浪费。
所以工程上的解法不是「写得更准」,而是从源头消除冲突源:有图,就不写。
把视觉权威交还给资产链路
这条规则背后是一个更大的生产原则:一致性靠资产,不靠运气。
传统剧组里,服装师、妆发师在开机前就定好造型,拍的时候演员穿着那身衣服来,不存在「编剧在剧本里写了件别的衣服,演员当场换」的事。AI 短剧也应该如此:
- 定妆阶段解决「穿什么、长什么样」,出图、确认、锁版
- 道具阶段解决「手里拿什么、场景里有什么」,单独出图、编目
- 拍摄阶段提示词只调度动作、表情、运镜、光影,不碰外观
这也是为什么猫斯卡把「有图不写服」做成了提示词生成时的强制约束——不是不信任创作者,而是把已经被验证过的片场纪律,固化进流水线。系统在生成每场镜头提示词时,只消费本场绑定的参考图映射,文字侧自动剥离有图人物的外观描写,从机制上杜绝双重指令。
边界与例外
诚实说,这条规则也有它的适用范围:
- 没有定妆图的群演 / 泛指角色,文字仍需写外观,但这类角色不应挤占主演的定妆槽位
- 纯文字路径(跳过参考图)下,文字当然要写服装——但质量通常更差,专业流程不推荐
- 伤情、破损、污渍等临时状态属于「当前状态」,不是服装本身,文字里写是合理的(如「袖口被划破」「左肩渗血」),定妆图不需要为此重做
- 角色一致性依赖定妆资产链路,不是人脸嵌入校验。立绘质量本身不行,光靠「不写服装」救不回来
把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
---
*猫斯卡(Maosika)是 AI 竖屏短剧生产操作系统,把「先定妆、再分场、镜头指令不碰外观」这套片场纪律固化进从剧本到成片的全链路。工具不替代导演的眼睛,但替你守住每一场都不再重新发明角色的那条底线。*
常见问题
为什么 AI 视频里有参考图还会换脸换装?
因为提示词里同时存在参考图和文字外观描述时,模型把两者视为并列指令,会融合、漂移或随机二选一,而不是默认以图为准。消除冲突的唯一工程解法是:有参考图的人物,文字里不再描写服装与外貌。
那有参考图之后,提示词里还能写什么?
写动作(转身、抬手)、表情(皱眉、冷笑)、伤情(嘴角渗血、袖口划破)、镜头运镜(推近、过肩)、光影与情绪节奏。服装、发型、五官、身材全部交给定妆图。
穿越剧古代现代两套造型怎么办?
每个时代做独立定妆,拍摄时按场景关键词路由到对应造型的参考图,文字里不写服装。不要试图用一张定妆图 + 文字切换服装,这是最容易翻车的写法。
我把文字和参考图写得完全一致不就行了?
实操做不到。「一致」没有像素级标准,模型对词语的理解有采样随机性,集数一多漂移必然累积。工程解法是从源头消除冲突源——有图就不写,而不是写得更准。
伤情、衣服破损这种临时变化也要画进定妆吗?
不用。伤情、破损、污渍属于人物的「当前状态」,不是服装本身,文字里写是合理的。只有稳定的外观(服装、发型、五官)才需要锁在定妆资产里。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com