AI 视频场景串戏:同一个客厅拍出三个样子
AI 短剧场景串戏,根因不是模型「记性差」,而是每一场都在重新想象这个空间长什么样。解法是把场景当成和角色一样的定妆资产:先出图、再绑定、提示词里禁止再用文字重写外观。
为什么同一个客厅会拍出三个样子
场景漂移(scene continuity drift)是 AI 竖屏短剧最常见的翻车类型之一:第 1 集客厅是白墙落地窗,第 3 集变成红木家具中式风,第 5 集沙发颜色又换了。观众未必能说清哪里不对,但会本能觉得「廉价」「出戏」。
这不是模型能力问题,是生产流程问题。传统剧组里,场景有美术指导出气氛图、道具师按集陈设、场记逐场记录;AI 生成链路里如果没有对应的资产纪律,每一次生成都等于让模型凭空「再设计一次房间」。
场景串戏的四类典型根因:
| 类型 | 表现 | 根因 |
|---|---|---|
| 文字漂移 | 每场提示词都在重新描写客厅 | 没有场景参考图,纯靠文字描述 |
| 风格漂移 | 人物是日漫、场景变写实 | 人物、场景、道具走了不同画风路径 |
| 道具漂移 | 沙发、挂画、台灯时有时无 | 道具没被提取成独立资产,混在场景描述里 |
| 时代漂移 | 穿越戏现代古代场景混用造型 | 没有按场次时代路由对应立绘 |
核心机制一句话:一致性靠资产,不靠运气。 只要场景还是「每段提示词里现写的一段形容词」,串戏就是必然。
场景资产化:先定妆,再开拍
传统流程里场景和角色一样要「定妆」——气氛图、平面图、关键道具陈设图在开机前就锁了。AI 短剧生产要解决串戏,必须把这个顺序搬过来。
第一步:场景立绘独立出图
场景图必须满足一条硬纪律:空镜纪律——场景立绘里严禁出现人物。
原因很实际:如果场景图里已经有一个「人」,视频生成时模型会把这个人和剧本里的角色叠加,容易出现鬼影、多余人影、或者角色被场景图里的人「带跑」。场景图只负责交代空间、材质、光线、陈设,人物交给角色定妆链路。
场景从剧本里结构化解析为「内/外 | 地点 | 日夜」,不靠手填表格。一个剧本里出现「客厅」「李家客厅」「李宅·客厅」三种写法,应该归并到同一个场景资产,而不是出三张不同的图。
第二步:画风统一路径
人物立绘、场景立绘、道具立绘、视频提示词必须共用同一条风格路径。选定一套画风后,场景图用这套画风的场景/道具手册出图,人物用这套画风的人物手册出图,视频提示词只注入这套画风的视频风格标签。
这直接堵死「人物是日漫、视频变写实」的断层。17 套内置画风手册(覆盖都市写实、古装写实、九十年代日漫、国风工笔、仙侠古风、3D 国漫、黏土定格、赛博国风等方向)每套都同时包含人物、场景、道具、视频四套子手册,目的就是让资产在同一条视觉语言里生产。
第三步:道具从场景里剥离成独立资产
串戏的一大隐藏原因是把道具写在场景描述里。「客厅里有一张棕色皮沙发、墙上挂着黑白照片、茶几上有个青瓷花瓶」——这段文字如果塞在场景提示词里,模型每次生成对这三样东西的还原度都不一样。
工业化做法是让「道具师」以拍戏视角,按剧本原始称呼把每集出现的道具提出来,全剧合并成道具编目(catalog),每件道具独立出立绘。拍摄某场时,场景图负责空间,本场出现的道具图按槽位绑定,剩下的交给提示词调度。
参考图映射:场景图永远是第一优先级
资产准备好之后,关键是每场戏怎么用。AI 短剧最核心的一致性机制是参考图映射——每场自动构建一张参考素材表,顺序固定:
场景图 → 本场道具图 → 人物定妆图
这个顺序不是随便排的。场景图占第一槽位,等于告诉模型:「这个空间长什么样,以这张图为准,不要重新设计。」道具图占第二槽位,告诉模型本场有哪些物件、长什么样。人物定妆图占最后槽位,告诉模型谁在场、长什么样。
配套一条最高优先级的硬规则:
有参考图的人物,禁止再用文字描写服装/外观;以参考图为准,文字只写动作、表情、伤情。
这条规则对场景同样成立:有场景参考图的场次,提示词里不要再用大段形容词描写空间。 文字只写本场发生的动作、机位、光线变化。再写一遍「宽敞明亮的现代客厅,白色沙发落地窗」,反而是在和参考图打架——模型不知道该听图还是听文字,串戏就从这里开始。
几个落地细节:
- 有图才占槽位,无图标明「仅文字」,不强行编造绑定。缺图会提醒,但允许跳过走纯文字路径——只是质量通常更差,所以专业流程应该先定妆再开拍。
- 支持道具手动纳入/排除,避免无关道具挤占参考槽位。比如客厅场只需要茶几上的那份离婚协议,不需要把全剧所有道具都塞进来。
- 时代造型路由:穿越/闪回题材按场景地点关键词判定现代/古代,取人物定妆图时优先匹配对应造型;场景图同理,「现代客厅」和「古代厅堂」是两套独立资产。
- 可在同类同名下替换为历史版本中的另一张图,美术迭代时不需要重出全剧资产。
场块切分:别让一集一个大提示词背锅
很多团队做 AI 短剧的习惯是「一集写一大段提示词,一次生成」。这恰恰是场景串戏的温床:一段 1–2 分钟的视频里,模型要同时记住场景、人物、道具、动作、运镜,上下文越长,空间细节越容易漂。
工业化做法是把剧本自动切成视频场块,目标粒度约 10 秒/场,正文软上限约 200 字,超过就按动作节拍、空段、句号再拆。用户看到的不是「第 3 集一个大视频」,而是「第 3 集 → 场 1、场 2、场 3……」,每场独立提示词、独立参考图、独立成片与历史 takes。
这对场景一致性有两个直接好处:
- 每场只绑定本场需要的参考图。客厅吵架场只绑客厅图 + 本场道具 + 在场角色定妆,不会把卧室、办公室的图串进来。
- 提示词生成时只给本场素材,禁止串戏。本场剧本正文是最高优先级撰写依据,其他场的信息不进入本场提示词。
约 10 秒是工程启发式,不是时间码精剪;超长场会再拆,但仍可能出现偏长的块,精剪与串场成片需要后续剪辑环节。这是需要提前认知的边界。
提示词纪律:教模型用分镜表语言说话
场景串戏很多时候不是没图,而是提示词在「帮倒忙」。工程化镜头提示词有一套明确纪律,直接影响场景还原度:
八大要素结构:精准主体、动作细节、场景环境、光影色调、镜头运镜、视觉风格、画质、约束条件。
其中「场景环境」这一项,在有场景参考图时应该极简——只写本场相对于定妆图的变化(比如「窗帘拉开,夜晚」「茶几上多了一份文件」),不要重写整个空间。
其他几条和场景相关的纪律:
- 一镜一运镜:禁止单镜内推拉摇移叠加,机位越复杂,场景越容易在运动中变形。
- 动作原则:优先低缓连续动作,减少高爆发动态崩坏——人物在客厅里走动比打斗更容易保持场景稳定。
- 强制兜底包:画质、面部稳定、无水印 Logo;多人场景加双胞胎/分身兜底。
- 复杂度分流:简单场景一段式;复杂影视化场景走三段论(总体设定 → 镜头 1/2/3… → 约束包)。
- 用镜头序号,不用绝对秒数(禁止写「0–3s」),避免模型按时间轴重新想象空间。
一句话总结:系统在教模型用分镜表语言说话,而不是写小说。 小说里可以花一百字描写客厅,分镜表里场景只写「内景·李家客厅·夜」,剩下的交给美术——这个分工在 AI 链路里同样成立。
开拍前齐套校验:别静默硬生成
专业流程在生成视频提示词之前,会做一次齐套校验:检查本场缺失的场景/人物/道具参考,弹出清单引导先去绘制。这是提醒式的制片助理,不是静默硬生成——缺了客厅图就直接拍,等于默认接受串戏。
允许跳过走纯文字路径,但应该是有意的、知情的选择,不是流程漏洞。
诚实边界
在场景一致性这件事上,有几个边界需要说清楚:
- 没有成片自动打分或自动择优重拍引擎。 场景有没有漂、漂得能不能接受,终审在创作者和监制手里,系统提供的是多 take 与改词重拍的工具。
- 参考图不是强制门禁。 缺图会提醒,但允许跳过——质量通常更差,所以专业流程应该先定妆再开拍。
- 约 10 秒的场块是工程启发式,不是时间码精剪。 仍可能出现偏长的块,精剪与串场成片需要后续剪辑环节。
- 当前不做跨场自动续写/延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」,跨场转场靠后期。
- 场景一致性依赖定妆资产链路,不是像素级嵌入校验。 最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。
猫斯卡固化了哪一步
猫斯卡作为 AI 竖屏短剧生产操作系统,把上面这套场景资产化流程固化进了产品链路:剧本解析后自动提取场景与道具,场景立绘走空镜纪律与统一画风路径,每场按「场景图→道具图→人物定妆图」构建参考素材表,场块切到约 10 秒粒度,提示词按八大要素与「有图不写外观」的硬规则生成,开拍前做齐套校验,出片后支持同场多 take 择优与改词重拍。
它没有试图用一次生成替代剧组;它用工程手段强制执行了短剧工业里已经被验证的质量控制顺序——先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
猫斯卡的定位是可规模化生产的 AI 短剧操作系统——把专业流程固化进产品,而不是宣称无需人类、零失误出片。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com