参考图怎么用才有效:场景、道具、人物的绑定顺序
AI 短剧里参考图失效,多半不是图的问题,是绑定顺序错了。正确做法是场景→道具→人物依次占位,有图才占槽,并且让文字在有图时彻底退出外观描写。
为什么参考图经常「不好使」
很多团队第一次用 AI 拍短剧,会把所有能找到的图一股脑塞进去:人物立绘、场景概念图、随手找的道具参考、甚至几张风格 moodboard。结果出来的视频反而更乱——人物这一场穿红、下一场穿黑,场景里凭空多出一把椅子,道具时有时无。
问题不在参考图本身,而在两件事:
- 槽位顺序没定,模型不知道哪张图在约束什么;
- 文字和图在打架,提示词里又写了一遍服装和外貌,等于让模型在两套指令里二选一。
参考图绑定本质上是在给模型排优先级:谁管环境,谁管物件,谁管脸和衣服。顺序错了,再多图也是噪音。
固定顺序:场景 → 道具 → 人物
工业上可验证的绑定顺序是固定的,每场戏自动构建参考素材表时按这个顺序占位:
| 顺序 | 参考类型 | 管什么 | 不管什么 |
|---|---|---|---|
| 1 | 场景图 | 空间、内外、日夜、光线基调 | 人物长相、服装 |
| 2 | 道具图 | 本场出现的关键物件形态 | 人物、环境风格 |
| 3 | 人物定妆图 | 脸、发型、服装、整体造型 | 动作、表情、伤情变化 |
这个顺序不是随意排的。场景先打底,模型才知道人物站在哪、光从哪来;道具在中间,避免被人物图里的细节盖掉;人物放最后,是因为人物一致性最脆弱,需要在环境和物件都锁定之后再压上去。
有图才占槽位,没有就标「仅文字」,不要强行编一张不存在的参考塞进去。 空槽位比错槽位安全——错槽位会让模型把道具图当人物、把场景图当服装参考,翻车更离谱。
场景图:空镜纪律
场景图的第一条硬规矩:场景图里严禁出现人物。
原因很直接。一旦场景图里有人,模型会把这个人当成「本场应该出现的角色」,要么抢戏,要么和你真正的人物定妆融合,造出一个谁都不是的脸。场景图应该是一张干净的空镜:内景还是外景、什么地点、白天还是夜晚、光线调性、大致陈设。
场次信息(内/外、地点、日夜)最好从剧本结构化解析出来,不要靠人手再填一遍表——手填容易和剧本正文对不上,导致场景图和戏里写的是两个地方。
道具图:以拍戏视角提取,而不是美术视角罗列
道具不是越多越好。专业做法是让「道具师」按剧本里的原始称呼,把这一场真正会出现、会被演员拿起或被镜头带到的道具提出来,全剧再合并成一份道具编目,避免某集出现过的东西到下集「失忆」。
绑定时有两个实用动作:
- 手动纳入 / 排除:剧本里一笔带过、镜头根本不会带到的道具,可以排除,避免挤占参考槽位;反过来,某场戏里剧情没写但视觉上必须出现的关键物件(比如桌上的合同、手里的钥匙),可以手动加进来。
- 同名下替换版本:同一个道具在历史版本里可能出了好几版图,拍摄时可以挑最贴合这一场气氛的那张,而不是被默认图锁死。
道具图的目标是让模型知道「这东西长什么样」,不是让它决定剧情。
人物定妆图:有图就别再写外观
这是整条链路里最关键、也最容易被违反的一条规则:
有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。
AI 短剧里经典的「换脸」「换装」翻车,绝大多数是因为提示词里既贴了人物定妆图,又写了「身穿黑色风衣、眼神冷峻」之类的外观描述。模型面对两套信号,会随机挑一套听——有时听图的,有时听文字的,于是同一场戏里人物两套衣服来回切。
正确分工是:
- 脸、发型、服装、体型 → 全部交给定妆参考图;
- 动作、表情、眼神方向、受伤状态、情绪变化 → 由文字提示词负责。
文字一旦退出外观描写,一致性会立刻上一个台阶。这不是技巧,是纪律。
两个容易被忽略的绑定细节
手动角色绑定,处理称呼漂移
剧本里同一个人可能被写成「警官」「李队」「李强」「那个男人」。如果不做手动绑定,模型可能把这些称呼当成不同角色,各长一张脸。正确做法是把剧本里的指代表述手动绑到档案里同一个人物的定妆图上,所有称呼共用一张脸。
时代造型路由,处理穿越 / 闪回
穿越、重生、回忆题材里,同一个人物在古代和现代造型完全不同。系统会按场景地点的关键词判定这一场是现代还是古代,取人物定妆图时优先匹配对应时代的造型版本。不要让古装戏里的角色套着现代西装出场,也不要让现代戏里的人物突然顶一个古装发髻。
开拍前的齐套校验
生成镜头提示词之前,应该先过一遍齐套检查:这一场涉及的场景、人物、道具,哪些有参考图、哪些还没有。缺的会弹出清单,引导先去把定妆画完再开拍。
当然,参考图不是强制门禁。你可以选择跳过、走纯文字路径——但要清楚,纯文字路径下人物一致性和道具稳定性通常会明显变差,专业流程里应该先定妆再开拍,跳过只适用于试拍、走位、看个大致气氛的场景。
一句话收口
参考图绑定的本质,是把「这一场戏里视觉上谁说了算」这件事,从模型的随机想象,变成一条有优先级的资产链:场景打底、道具锚定物件、人物定妆锁脸和衣服,文字只负责动作和情绪。一致性靠资产,不靠运气。
---
猫斯卡是 AI 竖屏短剧生产操作系统,在参考图这一环固化了「场景→道具→人物」的固定绑定顺序、空镜纪律、有图不写外观的硬约束,以及开拍前的齐套校验;审美判断与定妆质量仍然在创作者这边。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com