AI 短剧画面为什么每镜都在重画:一致性漂移的四层资产账

猫斯卡编辑部 | 最后更新日期

AI 短剧里角色换脸、场景串味、道具失踪,本质不是模型一次抽风,而是每生成一镜都在重新「想象」资产。解法是把角色、场景、道具、风格变成可引用、可校验、可回退的资产账。

先说结论:漂移不是偶发 bug,是资产没有被锁定

很多团队把 AI 短剧的一致性问题理解成「这一镜没抽好,重抽一次」。但只要你把成片逐镜拆开看,会发现问题往往不是随机的:主角的衣领每场都变,办公室一会儿现代一会儿轻奢,关键证据上一场是文件袋,下一场变成了 U 盘。

这些问题的共同点是:每一镜都在重新发明画面里的东西。

传统剧组不会这样拍戏。演员进组先定妆,场景先搭好,道具由道具组编号管理,美术风格由视觉总监统一。镜头可以重拍,但不会每次重拍都换一个演员、换一间办公室、换一件证物。

AI 短剧要稳定,也必须先补这堂「资产管理课」。

什么是一致性漂移

一致性漂移,是指同一部短剧在不同镜头、不同集数之间,角色外貌、场景空间、道具形态或美术风格出现非剧情需要的变化。

它和「画面不好看」不是一回事。漂移的核心不是审美问题,而是身份问题:观众能不能确认「这个人还是刚才那个人」「这个地方还是刚才那个地方」「这件东西还是推动剧情的那件东西」。

在竖屏短剧里,漂移的伤害尤其直接。因为单集时长短、信息密度高,观众没有时间替你解释「这可能是同一个人,只是画风变了」。一旦脸、衣服、空间或关键道具不稳定,代入感会立刻断掉。

四层资产账:角色、场景、道具、风格

把一致性问题看成一本账,会比笼统说「保持一致」清楚得多。

资产层常见漂移观众感知工业对应
角色资产换脸、换装、发型变化、年龄飘忽「主角怎么变了?」定妆照、造型表
场景资产空间结构变化、装修风格跳变、日夜混乱「这是同一个地方吗?」场景板、置景方案
道具资产关键证物变形、物品消失、颜色材质变化「证据怎么换了?」道具清单、道具特写
风格资产人物日漫、视频写实;光影忽冷忽暖「不像同一部剧」视觉风格手册

这四层不能混在一起解决。角色一致性靠定妆,场景一致性靠场景图,道具一致性靠道具编目,风格一致性靠统一画风路径。任何一层缺失,都会在镜头里暴露。

第一层:角色资产——先定妆,再开拍

角色漂移最常见,也最伤。原因很简单:如果没有一张被锁定的定妆图,模型每次看到「年轻女主」「黑衣总裁」「中年警官」这类文字,都会重新生成一个符合描述的人。

文字描述只能给出类型,不能给出身份。

稳定的角色链路应该是:

  1. 在故事档案里确认人物身份、性格、关系和当前状态;
  2. 根据选定画风生成人物定妆图;
  3. 阵容确认通过后,定妆图进入可引用资产库;
  4. 每场戏根据出场人物绑定对应定妆图;
  5. 有参考图的人物,不再用文字重复描写服装和外貌。

最后一条尤其关键。很多团队以为提示词写得越细越稳,于是在每镜提示词里继续写「女主穿白色西装、长发、红唇」。如果参考图里她穿的是黑色外套,文字和参考图就会打架,模型只能在两套指令之间折中,结果就是换装、换脸或细节崩坏。

正确做法是:参考图负责外观,文字只负责动作、表情、伤情和调度。

第二层:场景资产——空镜必须是空镜

场景漂移经常被忽视,但它会让一部剧显得「很 AI」。上一镜办公室是冷色调玻璃幕墙,下一镜变成暖色木质书柜;上一镜医院走廊狭长,下一镜突然像酒店大堂。

场景要稳定,首先要有独立的场景参考图,而不是从人物图里「顺便」截背景。

这里有一条片场规则很有用:场景图严禁出现人物。

原因有两个:

  • 人物一旦进入场景图,后续生成时可能被误识别为本场角色,造成多余人物或分身;
  • 场景图的任务是交代空间、材质、光线和氛围,不是替演员站位。

场景信息最好从剧本结构里直接解析,比如「内 / 外 | 地点 | 日夜」。这样同一场所不会因为编剧写法不同而被系统当成两个地方:「总裁办公室」「陆总办公室」「陆氏集团办公室」如果剧情上是同一空间,就应该归到同一场景资产。

第三层:道具资产——关键道具必须有编号意识

短剧非常依赖道具推进剧情:合同、亲子鉴定、录音笔、病历、玉佩、钥匙、手机截图。道具一旦漂移,不只是穿帮,而是剧情逻辑会断。

道具管理要像道具师拍戏,而不是像模型看图说话。

稳定做法包括:

  • 按剧本原始称呼提取道具,不随意改名;
  • 全剧合并成道具目录,避免同一物品在不同集变成不同东西;
  • 关键道具生成独立参考图;
  • 每场只纳入本场真正出现的道具,避免无关物品挤占参考槽位;
  • 允许手动排除误提取道具,防止模型把无关名词视觉化。

道具不是越多越好。一场戏的参考图如果堆满无关物品,模型反而不知道什么是重点。真正的专业流程,是让镜头里的视觉焦点和剧情焦点一致。

第四层:风格资产——人物、场景、视频必须走同一条画风路径

还有一种漂移很隐蔽:单看每个镜头都不差,但连起来不像同一部剧。人物立绘是一种质感,场景是另一种质感,视频生成时又变成第三种光影。

这通常是因为风格没有被当成资产统一管理。

成熟做法是选定一套画风手册后,让人物立绘、场景立绘、道具立绘和视频提示词共用同一条风格路径。画风手册至少要覆盖人物面容锚点、材质、气质、视图一致性,以及场景、道具和视频风格标签。

这不是为了限制创作,而是为了避免「人物是日漫、视频变写实」的断层。竖屏短剧的沉浸感,很大程度来自观众默认眼前所有画面属于同一个世界。

为什么「多写提示词」不能解决漂移

提示词很重要,但它不是一致性的替代品。

如果底层没有资产引用,提示词再长也只是在反复描述。描述会被模型重新解释,参考图才是更直接的视觉约束。两者冲突时,漂移就会发生。

可以把它理解成分镜表和定妆照的关系:

  • 分镜表告诉摄影师这场怎么拍;
  • 定妆照告诉所有人这个角色长什么样;
  • 你不能只靠分镜表里的文字,就让每个部门自动还原同一个演员。

所以,镜头提示词应该写动作、运镜、光影、场景氛围和约束条件,而不是把角色外貌、服装、道具颜色每镜重写一遍。

工程化镜头提示词怎么减少漂移

一套稳定的视频提示词,通常包含八个要素:

  1. 精准主体;
  2. 动作细节;
  3. 场景环境;
  4. 光影色调;
  5. 镜头运镜;
  6. 视觉风格;
  7. 画质;
  8. 约束条件。

其中有几条规则对一致性特别重要:

  • 一镜一运镜:不要在单个镜头里叠加推、拉、摇、移,动作越复杂越容易崩;
  • 用镜头序号,不用绝对秒数:让模型按分镜结构理解画面,而不是按时间码硬切;
  • 多人场景加分身兜底:减少同一张脸复制成多个人;
  • 非写实题材加风格锚定:避免画风在镜头中间滑向写实;
  • 本场只给本场素材:禁止把别的场景、别的道具、别的角色信息串进来。

一句话说,系统要教模型用分镜表语言说话,而不是写小说。

从「整集生成」到「场块管理」

一致性差的另一个根源,是把一整集当成一次生成任务。集数越长,模型需要同时维持的角色、空间、道具和动作越多,漂移概率越高。

更稳的生产方式,是把剧本切成约 10 秒的视频场块。每个场块有自己的:

  • 剧本正文;
  • 场景参考图;
  • 本场道具参考图;
  • 出场人物定妆图;
  • 镜头提示词;
  • 成片版本与历史 takes。

这就像剪辑台上的 clip 列表。你不是在等一条巨大的视频自己变完美,而是在管理一个个可检查、可重拍、可替换的镜头单元。

需要说明的是,约 10 秒的场块是工程启发式,不是时间码精剪。超长场会继续拆,但仍可能出现偏长的块;精剪、串场和完整成片节奏,仍然需要后续剪辑环节。

开拍前的齐套检查

专业流程和玩具式生成的差别, often 出现在开拍前。

如果某场戏缺场景图、人物定妆图或关键道具图,系统应该明确提醒,而不是静默硬生成。创作者可以选择跳过,走纯文字路径,但要知道:纯文字路径通常更不稳定,专业流程应当先补齐资产再开拍。

开拍前至少检查四件事:

检查项要确认什么
角色本场出场人物是否都有可用定妆图
场景内 / 外、地点、日夜是否对应正确场景图
道具剧情关键道具是否已绘制并纳入本场
风格人物、场景、道具、视频是否共用同一画风路径

这一步看似慢,实际是在减少后期反复重拍。

重拍不是重来,而是保留资产、改变指令

片场里的重拍,不是每天换一批演员重新搭景,而是在同一套资产基础上调整表演、机位和调度。AI 短剧也应该如此。

如果一个场块不满意,应该能区分:

  • 是提示词动作不对;
  • 是参考图绑定不对;
  • 是角色定妆本身需要换版本;
  • 是场景或道具图缺失;
  • 还是模型档位、时长、分辨率设置需要调整。

同一场保留历史 takes,改词后再生成才是新版本。这样创作者才能像导演看回放一样,多 take 择优,而不是每次都从零开始。

猫斯卡固化了哪一步

猫斯卡是 AI 竖屏短剧生产操作系统。它没有试图用一次生成替代剧组,而是把短剧工业里已经被验证的质量顺序固化下来:先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优。

在一致性这件事上,它主要固化的是「资产账」:

  • 用故事档案管理人物身份、关系、当前状态和伏线;
  • 用 17 套画风手册统一人物、场景、道具和视频风格路径;
  • 每场按「场景图 → 道具图 → 人物定妆图」的顺序构建参考素材;
  • 有参考图的人物,禁止再用文字描写服装和外观;
  • 开拍前检查缺失资产,提醒先定妆再开拍;
  • 每场保留独立提示词、参考图映射和历史 takes。

但边界也要说清楚:猫斯卡没有成片自动打分或自动择优重拍引擎,质量终审仍在创作者和监制手里;参考图不是强制门禁,缺图可以跳过,但纯文字路径通常质量更差;角色一致性依赖定妆资产链路,不是人脸嵌入校验,最终观感仍取决于立绘质量和提示词是否遵守规范。

它适合把重复、易漂移、易失控的部分变成可约束流水线;审美判断、表演取舍和最终剪辑,仍然坐在人这边。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com