AI 短剧场景为什么会「漂移」:从定妆到分场的资产纪律
AI 短剧场景漂移,本质是把「场景」当成了每集现写的文字描述,而不是像人物一样先定妆、再引用。解法是给场景建立可复用的视觉资产,并在拍摄时禁止文字再去改写它。
场景漂移不是「模型画错了」,是流程漏了一道锁
很多团队第一次做 AI 短剧,会把精力全放在人物不换脸上:主角先出定妆图,每场绑参考,提示词里反复强调「同一人」。结果人物稳住了,场景却开始飘——同一间客厅,第 2 集成了冷色调极简风,第 5 集沙发换了方向,第 8 集墙上突然多了一幅不存在的画。
观众不会用「一致性」这种词来吐槽,他们只会觉得「这剧看起来很便宜」。
场景漂移是指:同一处剧本地点,在不同集、不同场块之间,其空间结构、陈设、色调、光线方向出现无剧情依据的变化。
它和人物换脸是同一种病,只是病灶换了位置:人物有定妆链路兜底,场景往往没有。
三类漂移,对应三个没做的动作
| 漂移类型 | 观众看到的现象 | 根因 | 没做的动作 |
|---|---|---|---|
| 结构漂移 | 客厅 L 型变一字型、门窗位置变了 | 提示词每次重写空间布局 | 没有锁定一张场景立绘作为唯一参考 |
| 陈设漂移 | 沙发颜色变了、桌上多了花瓶、挂画换了 | 模型自由发挥填充细节 | 没有把「本场道具」从「场景固定陈设」里拆出来 |
| 光影漂移 | 日戏拍成夜戏、暖光变冷光 | 镜头提示词里的光影描述和场景设定打架 | 没有把日夜 / 内外作为结构化字段,而让模型猜 |
表里三类问题,归结到一句话:场景没有被当作资产,而是被当作描述。
人物之所以能稳,是因为流程里有「定妆图 → 每场绑定 → 文字不再描写外观」这条纪律。场景要稳,也必须走同一条路。
场景立绘:给地点也拍一张「定妆照」
人物定妆大家都懂:先出一张立绘,确认脸、发型、服装、气质,之后所有场次都引用这张图。
场景定妆的逻辑完全一样:
- 一场景一张立绘,剧本里出现的每个关键地点(主角家客厅、公司办公室、医院走廊、古代书房)都单独出图。
- 空镜纪律:场景图里严禁出现人物。人物一旦入画,后续绑参考时模型会把「人物站位」也当成场景的一部分,导致换演员就换布局。
- 从剧本结构化解析地点,不靠手填表格。场次信息里的「内 / 外 | 地点 | 日夜」是硬字段,日戏夜戏、内景外景不交给模型临场判断。
- 画风统一:人物、场景、道具共用同一条风格路径,避免「人物是日漫、场景变写实」的断层。
场景立绘确认后,它就是这个地点在整部剧里的唯一视觉真相。后续所有写到这个地点的场次,都引用这张图,而不是每次重新写「一个现代简约的客厅,有落地窗和灰色沙发」。
参考图映射:场景、道具、人物各占各的槽
场景定妆只是第一步,真正决定会不会漂移的是每场戏的参考图怎么排。
工程化的做法是,每场自动构建一张参考素材表,顺序固定:
场景图 → 本场道具图 → 人物定妆图
这个顺序不是随便排的,它解决的是「谁压过谁」的问题:
- 场景图排第一:告诉模型「这间房长这样,别重新设计」。
- 道具图排中间:本场剧本里出现的、会被演员拿在手上或放在桌上的关键物件(手机、合同、玉佩、刀),单独出图、单独绑定,和场景的固定陈设分开。
- 人物定妆图排最后:告诉模型「谁在这间房里」。
这里有一条和人物侧完全对称的硬纪律,值得单独拎出来:
有参考图的场景,禁止再用文字描写空间结构与固定陈设;以参考图为准,文字只写人物动作、表情、道具互动和光影氛围。
违反这条的典型翻车:提示词里写了「一个暖色调的温馨客厅,墙上挂着全家福」,但场景参考图是冷色调极简风、墙上没挂画——模型会在两者之间和稀泥,结果就是哪头都不像。
道具师视角:把「会动的东西」从场景里拆出来
陈设漂移最常见的诱因,是把「本场出现的道具」混进了「场景的固定装修」。
举个例子:第 3 集客厅桌上有一份离婚协议书,第 7 集同一张桌上有一束花。如果协议书和花都被写进场景描述,模型会认为它们是客厅的一部分,从此每集桌上都长协议书、都开花。
正确做法是用「道具师」的视角处理:
- 按集提取剧本里的道具原始称呼,全剧合并成一份道具目录,不丢集。
- 道具单独出立绘,单独绑定到具体场次。
- 每场支持手动纳入 / 排除道具——这集出现的才绑,没出现的不占参考槽位。
- 场景立绘只管「不动的东西」:墙、地、窗、固定家具、硬装。
把「会动的」和「不会动的」拆开,场景才不会被每集的剧情道具污染。
场块粒度:别让一整集的场景描述挤在一个提示词里
场景漂移还有一个容易被忽略的放大器:场块太粗。
如果一集 1–2 分钟的内容被当成「一个大场景」丢给模型,提示词里要同时交代客厅、门口、厨房三个位置,模型只能在一张图里硬塞,或者自己编一个折中空间。
工程化的切分是把剧本切成约 10 秒一个的视频场块,每场独立提示词、独立参考图、独立成片:
- 正文超过约 200 字就按动作节拍再拆。
- 群演和泛指角色从主演定妆名单里剥离,不挤占参考槽位。
- 用户看到的是「第 3 集 → 场 1、场 2、场 3……」,像剪辑台上的 clip 列表,而不是一整集一个大黑盒。
粒度对了,每个场块只需要描述「这个 10 秒里,谁在这间房的哪个位置做什么」,场景本身不需要再被介绍一遍——因为参考图已经替它说了。
镜头提示词里,光影是唯一允许「改写」场景的维度
场景立绘锁定了结构和陈设,但有一件事它锁不住:光。
同一场客厅,日戏是自然光从落地窗进来,夜戏是暖黄台灯加窗外冷色,争吵戏可能是顶光硬阴影。光影是剧情语言,必须允许随场次变化。
所以在提示词的八大要素里,光影色调是唯一可以、也应该在场次层面重新指定的维度。但要注意两件事:
- 只写光,不写空间。「暖黄台灯光,人物侧脸半明半暗」是合法的;「一个暖黄色调的温馨客厅」是非法的——后者会让模型重新想象客厅。
- 一镜一运镜,不要在单个镜头里堆「先推再摇后拉」,动作越复杂、光影越跳脱,场景结构越容易被带歪。
系统在教模型用分镜表语言说话,而不是写小说。
诚实边界:场景稳到什么程度,取决于你做了多少
讲完解法,也要把做不到的地方说清楚:
- 参考图不是强制门禁。缺场景图时系统会提醒,但允许跳过走纯文字路径——这种情况下场景漂移几乎是必然的,专业流程应该先定妆再开拍。
- 约 10 秒的场块是工程启发式,不是时间码精剪。超长场会再拆,但仍可能出现偏长的块,精剪与串场需要后续剪辑环节。
- 角色与场景一致性依赖定妆资产链路,不是人脸或几何嵌入校验。最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。
- 当前不做跨场自动续写 / 延长视频的产品化工作流,产品单元是「单场多模态参考 → 单段成片」。
一致性靠资产,不靠运气。场景和人物一样,先定妆、再引用、不重写——这三条做到了,同一个客厅就不会拍出三个样子。
---
猫斯卡是 AI 竖屏短剧生产操作系统,把「场景立绘 → 参考图映射 → 场块切分 → 镜头提示词」这条链路固化进了产品:17 套画风手册统一美术语言,每场按「场景 → 道具 → 人物」顺序绑定参考,有参考图的场景禁止文字再描写外观,剧本自动切为约 10 秒场块独立出片。把重复、易漂移、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
常见问题
为什么我给场景写了很详细的文字描述,出来还是每次都不一样?
因为文字描述每次都被模型重新「想象」一遍,没有任何机制保证两次想象的结果相同。稳定的做法是出一张场景立绘作为唯一参考,后续场次只引用这张图,文字不再重复描写空间结构和固定陈设。
场景图里能不能带人物?
不建议。场景立绘应该是空镜,人物一旦入画,模型会把人物的站位、姿势甚至服装颜色当成场景的一部分,后续换演员或换动作时容易连带改变场景布局。
每集桌上的道具不一样,怎么避免被模型当成场景的一部分?
把「会动的」道具从「不动的」场景里拆出来:场景立绘只管硬装和固定家具,道具按集单独出图、单独绑定到具体场次,没出现的道具不要占参考槽位。
日戏和夜戏用同一张场景立绘会不会冲突?
不会。场景立绘锁定的是结构和陈设,光影是在场次层面的提示词里单独指定的。只写光的方向、色温和强度,不要重写空间描述,就能在同一场景里打出不同的戏剧光。
场块切多细才合适?
目标粒度约 10 秒一个场块,正文软上限约 200 字。超过就按动作节拍、空段、句号再拆。粒度越细,每个场块的参考图和提示词越聚焦,场景越不容易漂移。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com