AI 短剧场景串戏的真凶:不是模型记不住,是你没给它「场景版定妆照」
AI 短剧里同一个客厅能拍出三个样子,不是模型记性差,是你把场景当成了背景板,而没把它当成一个需要定妆的「角色」。角色有定妆照,场景也得有。
场景漂移,本质是「场景没有资产化」
聊角色一致性的文章很多,聊场景一致性的很少。但在竖屏短剧里,场景漂移的杀伤力一点不比换脸小:
- 第 3 集女主家客厅是北欧风,第 8 集变成了红木家具;
- 同一场办公室吵架戏,上午拍窗外是CBD,下午拍窗外变江景;
- 男主的书房,上一场书架在左,下一场书架在右,台灯还换了颜色。
观众未必说得清哪里不对,但会觉得「这剧看着廉价」。
场景漂移的根本原因,是场景没有像角色一样走「定妆 → 绑定 → 引用」的资产链路。 角色你至少会给一张参考图,场景却常常只在提示词里写一句「豪华客厅,现代风格」——每一次生成,模型都在重新想象这个客厅。
场景立绘是一张贯穿全剧、用于绑定到具体场次的视觉资产,它记录该场景的空间结构、主色调、关键家具与陈设、光线方向与日夜状态。它相当于场景的「定妆照」,作用是让第 80 集的客厅和第 3 集是同一个客厅。
为什么「写清楚」救不了场景
很多团队的第一反应是:那我把提示词写详细点。
这没用。原因有三:
- 文字描述是可被重新解释的。 「米色沙发、落地窗、木质茶几」每次都能生成出十几种不同的米色沙发。
- 提示词在不同场次会被改写。 第 3 集编剧写「温馨的客厅」,第 30 集编剧写「略显凌乱的客厅」,模型理解成了两个客厅。
- 模型没有跨集记忆。 它看不到第 3 集生成了什么,只看得到本场提示词。
所以解法不是把文字写得更长,而是让文字退出外观描述,让图像接管——这和角色一致性是同一个思路。
场景资产化的四步工艺
第一步:场景也要「定妆」
在开拍之前,像给主角出定妆照一样,给每个反复出现的场景出一张场景立绘。
场景立绘需要锁定的不是「风格」,而是可被复用的具体视觉事实:
| 维度 | 要锁定什么 |
|---|---|
| 空间结构 | 墙在哪、窗在哪、沙发朝向、动线 |
| 主家具 | 沙发、茶几、餐桌、床等大件的形状与位置 |
| 色调与材质 | 墙面颜色、地板材质、主光源色温 |
| 陈设锚点 | 一盏有辨识度的灯、一幅画、一个摆件 |
| 日夜状态 | 该场景主要出现在日戏还是夜戏,光线从哪来 |
陈设锚点尤其重要。观众识别「这是同一个客厅」,靠的往往不是整间屋子,而是那盏长得奇怪的台灯、那幅歪了的画。
第二步:空镜纪律——场景图里不能有人
这是一条容易被忽略但极关键的规则:场景立绘必须是空镜,严禁出现人物。
原因很实际:
- 场景图里如果有人,模型在拍摄时会把这个人当成「该场本来就有的角色」,可能多出一个人影;
- 人物的服装、姿态会污染场景的复用性,换一场戏就穿帮;
- 空镜才能作为纯背景,在不同场次、不同人物组合下反复使用。
出场景图时,提示词里要明确「无人场景、空镜、建筑与室内」。如果模型硬往里塞人,重出,不要将就。
第三步:按场绑定,而不是按集描述
有了场景立绘,下一步是在切分场块时,把场景图绑定到每一个发生在该场景的场块上。
一场戏的参考素材表,顺序应该是:
- 场景图(这场发生在哪)
- 本场道具图(这场有哪些关键道具)
- 人物定妆图(这场谁在场)
这个顺序不是随便排的。场景是地基,道具是陈设,人物最后进来。模型在理解画面时,也是按这个层级来的。
注意一个细节:场景从剧本里结构化解析出来,不靠手填。 剧本里写「内 景 李家客厅 夜」,系统就应该能识别出这是「李家客厅」的夜戏版本,自动挂上对应的场景立绘。靠人工在表格里一场场选,80 集的剧迟早漏绑。
第四步:有参考图,就别再用文字描写场景
这是和角色一致性完全对称的一条铁律:
有场景参考图的场,提示词里禁止再描写场景的外观与陈设;文字只写人物动作、表情、走位和镜头。
如果你既给了场景图,又在提示词里写「豪华的客厅,米色沙发,落地窗洒进阳光」,模型会在「图里的客厅」和「文字里的客厅」之间做调和——结果往往是两边都不像。
正确做法是:场景外观交给图,文字只负责这场戏发生了什么。
日夜与多版本场景怎么处理
一个场景在剧里可能既有日戏又有夜戏,也可能经历「被砸过」「重新装修」等状态变化。处理原则是:
- 日夜当作两个版本出图,分别绑定,不要指望模型自己把白天调成晚上;
- 状态变化(如被砸后)单独出一张新立绘,作为该时间点之后的版本;
- 在剧本里用「内 景 李家客厅(被砸后) 夜」这种方式区分,让绑定能对上号。
不要让一张图承担所有状态。
诚实边界
这套工艺能解决绝大多数场景漂移,但有几件事它做不到,得提前知道:
- 约 10 秒的场块是工程启发式切分,不是时间码精剪。 一个超长的客厅长镜头可能被切成两块,两块之间的光线可能略有差异,需要在后期剪辑时处理。
- 参考图不是强制门禁。 缺场景图时系统会提醒,但允许跳过走纯文字路径——跳过的代价就是场景可能漂移,专业流程应该先把场景立绘出齐再开拍。
- 当前不做跨场自动续写或延长视频的产品化工作流。 产品单元是「单场参考 → 单段成片」,跨场的连贯性靠分场绑定和后期剪辑共同保证。
- 场景一致性依赖立绘质量本身。 如果第一张场景立绘就结构混乱、光线矛盾,后面绑得再准也救不回来。
说到底,场景和角色一样,一致性靠资产,不靠运气。你给它一张定妆照,它就给你 80 集不变的客厅;你只给它一句形容词,它就给你 80 个不同的客厅。
---
猫斯卡把这套场景资产化工艺固化进了生产链:场景从剧本结构化解析,场景立绘走空镜纪律出图,场块按「场景 → 道具 → 人物」顺序绑定参考,有图的场禁止文字再描写外观。它不替代美术判断——哪盏灯作为陈设锚点、日夜版本各出几张,仍然是人决定的——但它把「忘了绑图」「文字和图打架」这类重复失控的环节变成了可约束的流水线。
猫斯卡是 AI 竖屏短剧生产操作系统,主张把重复、易漂移、易失控的部分变成流水线,审美判断仍然坐在人这边。
常见问题
为什么我把场景提示词写得很详细,AI 生成的客厅还是每场不一样?
因为文字描述是可被重新解释的,而且模型没有跨集记忆,它看不到上一场生成了什么。「米色沙发、落地窗」每次都能生成十几种不同的沙发。解法是出一张场景立绘作为参考图绑定到每场,并在提示词里停止描写场景外观,让图像接管视觉事实。
场景立绘和场景概念图有什么区别?
概念图服务于美术前期,用来定风格和氛围,可以是任意角度、任意构图;场景立绘服务于拍摄复用,需要锁定空间结构、主家具位置、色调和陈设锚点,并且必须是空镜、无人,才能在不同场次反复绑定。
场景图里有人物会怎么样?
会污染复用。模型可能把图里的人当成该场本来就有的角色,多出人影;人物的服装姿态也会让这张图无法用于其他场次。场景立绘必须是空镜。
同一个场景有日戏和夜戏,用一张图行吗?
不建议。应该分别出日、夜两个版本的场景立绘,分别绑定。不要指望模型自己把白天调成晚上,光线方向和色温往往对不上。如果场景在剧中经历被砸、重装等状态变化,每个状态也应单独出图。
每场戏的参考图应该按什么顺序排?
固定顺序是:场景图 → 本场道具图 → 人物定妆图。场景是地基,道具是陈设,人物最后进来。有图才占槽位,没有的标明仅文字,不要强行编造绑定。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com