AI 短剧参考图绑定:让模型先看见世界,再看见人

猫斯卡编辑部 | 最后更新日期

参考图真正决定的是模型“先看见什么”。先给世界,再给物件,最后给人;顺序反了,人物会抢场景,道具体量会失控,脸也更容易漂。

参考图绑定,本质是在给模型排“视线优先级”

很多人以为参考图越多越稳,于是一场戏里塞满人物特写、道具近景、氛围图、剧照。结果反而更容易出现:人物脸变了、衣服换了、道具时有时无、场景像另一个地方。

问题不在图多,而在模型没有拿到清楚的视觉优先级。

参考图绑定顺序,是把一场戏的视觉信息按“世界—物件—人物”逐层交给模型。

这个顺序不是界面操作习惯,而是在模拟剧组开拍前的准备逻辑:先确定这场戏发生在哪里,再确认场上有哪些关键物件,最后让演员穿着已定好的造型进入空间。

为什么必须是场景 → 道具 → 人物

可以把三类参考图理解成三层视觉语境:

顺序参考类型它解决什么放错后的典型问题
1场景图告诉模型空间、光线、内外景、日夜人物像贴在背景上,场景风格漂移
2道具图告诉模型本场关键物件是什么道具乱入、消失、形态不稳定
3人物定妆图告诉模型谁在场、穿什么、长什么样换脸、换装、人物与场景争夺注意力

场景先入位,是因为它决定光线、透视和氛围。道具第二,是因为它必须落在这个空间里,而不是漂浮在画面中。人物最后,是因为人物是动作主体,但不应该压过空间逻辑。

如果先塞人物图,模型很容易把人物脸部和服装当成最强视觉锚点,背景反而被弱化成“随便一个地方”。这就是为什么有些镜头人物看似清楚,但整场戏没有空间感。

场景图:只负责世界,不要抢人

场景参考图最容易犯的错,是图里本身有人。

空镜纪律很重要:场景图严禁出现人物。

因为一旦场景图里有人,模型会收到两个互相冲突的信号:这是背景,还是这是本场角色?它可能把图里的人当成角色参考,导致五官、服装、年龄被污染。

合格的场景图应该回答这些问题:

  • 这是内景还是外景;
  • 地点是什么,例如办公室、宫殿、医院走廊;
  • 是白天、夜晚、黄昏还是雨夜;
  • 光线方向和色调是什么;
  • 空间纵深和主要陈设是什么。

场景从剧本里解析为“内 / 外|地点|日夜”,比手动填一堆标签更稳,因为它直接来自戏剧情境,而不是后期补写的美术说明。

道具图:只绑定本场真正需要出现的物件

道具不是全剧 catalog 里有什么就全塞进去。每场戏只应该绑定本场会被看见、被使用、被强调的道具。

道具提取最好以拍戏视角进行:道具师按剧本原始称呼把这集需要的物件提出来,例如“离婚协议书”“玉佩”“录音笔”,而不是把它们改写成模型可能误解的抽象词。

道具绑定要注意三件事:

  1. 有图才占槽位。 没有道具图就标明仅文字,不要硬绑一张不相干的图。
  2. 可手动纳入或排除。 某件道具虽然在全剧道具库里,但本场不出现,就不要挤占参考位。
  3. 同名道具可替换历史版本。 如果玉佩在前期和后期形态不同,应选择对应剧情阶段的版本。

道具排在人物之前,是为了让模型先知道“桌上有什么、手里拿什么”,再让人物去接触它。否则人物动作可能很完整,但道具会随机变形。

人物定妆图:最后绑定,且文字不要再描写外观

人物参考图应该放在最后,但它的约束最强。

这里有一条必须记住的规则:

有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。

这是减少换装、换脸最有效的机制之一。

很多翻车镜头不是图不好,而是提示词一边给了人物定妆图,一边又写“她穿着红色长裙,长发披肩”。如果图里是白色外套,文字和参考图就开始打架;模型每一次生成都可能在两套指令之间摇摆。

正确写法是把人物外观交给定妆图,文字只负责戏:

  • 她猛地抬头;
  • 他攥紧文件,指节发白;
  • 她嘴角带伤,眼神变冷;
  • 他后退半步,撞到椅背。

服装、发型、脸型、年龄感,都应该在定妆阶段解决,而不是在每场提示词里重新描述一遍。

手动绑定:解决剧本称呼和档案姓名不一致

短剧剧本里经常出现“警官”“前妻”“那个男人”“顾总”等称呼,但角色档案里可能是正式姓名。如果不做绑定,模型可能把这些称呼当成新角色。

手动角色绑定就是把剧本中的称呼对应到已定妆的人物资产。例如:

剧本写法绑定到档案角色
警官李强
顾总顾晏辰
前妻苏晚
蒙面人神秘人 A

这一步对客串、替身、蒙面角色、穿越前后同一人物尤其重要。

穿越和闪回题材还要考虑时代造型。系统可以按场景地点关键词判断现代或古代,并优先匹配对应造型图。但最终观感仍取决于立绘是否准确,以及提示词是否遵守“有图不写外观”。

开拍前:先做齐套校验,不要带着缺图硬拍

生成镜头提示词前,应该先检查本场参考素材是否齐全:

  • 场景图是否已有;
  • 本场关键道具是否有图;
  • 出场人物是否都有定妆;
  • 剧本称呼是否都绑定到了正确角色;
  • 是否有无关道具被误纳入。

缺图时,专业流程应先回到美术链路补齐,再进入拍摄。系统可以提醒缺失项,但参考图不是强制门禁;创作者也可以跳过,走纯文字路径。只是这种路径通常更难保持一致性,不适合作为常规生产方式。

一条可直接照抄的绑定检查顺序

每场戏开拍前,可以按下面顺序检查:

  1. 这场戏在哪里? 绑定一张无人物的场景图。
  2. 这场戏会看到哪些关键物件? 只绑定本场出现的道具。
  3. 谁在场? 绑定对应人物定妆图。
  4. 剧本称呼是否对得上? 把“警官”“顾总”等指代替绑到角色。
  5. 提示词是否还在重复外观? 删除服装、发型、脸型描写,只留动作、表情、伤情。
  6. 是否有无关图占槽位? 排除不相关道具和人物。

这六步做完,再去生成镜头提示词,稳定性通常会比“把所有图丢进去”高很多。

边界:顺序不能替代好立绘和好提示词

参考图顺序能减少冲突,但不能解决所有问题。

  • 如果定妆图本身五官不稳,后续镜头仍可能漂;
  • 如果道具图画得不清楚,模型会自由发挥;
  • 如果场景图里有人,污染仍然可能发生;
  • 如果提示词继续描写有参考图人物的外观,换脸和换装风险会回来;
  • 约 10 秒的场块是工程启发式,不是时间码精剪,长场仍可能需要后续剪辑。

所以,正确说法不是“按顺序绑图就不会翻车”,而是:顺序让参考图各司其职,减少模型在多个视觉指令之间乱选。

一致性靠资产,不靠运气。猫斯卡把这套顺序固化在拍摄链路里:每场自动按场景图、道具图、人物定妆图的顺序构建参考素材表,并在开拍前做齐套校验;但审美判断和最终取舍仍在创作者手里。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com