AI 视频一致性全解:角色、场景、道具为什么会漂

猫斯卡编辑部 | 最后更新日期

AI 视频里角色、场景、道具会漂,根本原因是每场都在重新想象。解法不是换更强模型,而是先定妆建档,再让拍摄只引用资产、不凭空描写外观。

一致性问题不是画质问题,是生产顺序问题

很多团队第一次做 AI 短剧,会把「角色长得不一样」「场景上一场是现代办公室下一场变欧式古堡」「主角手里的文件袋突然变成信封」归因为模型不够好。换了模型、加了参数,问题照旧。

AI 视频一致性,是指同一部剧里,人物外貌、服装造型、场景空间、关键道具在不同集、不同场、不同镜头之间保持可识别的稳定。 它不是单帧出图像不像的问题,而是跨数十上百个视频片段能否拼成一部「同一部剧」的问题。

漂移的根因可以归成三类,每一类都对应流程里的一个缺口:

漂移类型典型表现根因
角色漂移换脸、换装、发型突变、年龄跳变没有锁定的定妆资产;提示词里又用文字重写了外观
场景漂移空间结构变了、装修风格跳了、日夜错位场景没有独立立绘;每场靠文字即兴生成
道具漂移关键物品变形、消失、被替换道具没有编目;参考图槽位被无关内容挤占

高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的。一致性靠资产,不靠运气。

角色为什么会换脸:文字和参考图在打架

角色漂移最常见的触发点,是提示词里同时存在两套指令:一套是参考图里那张脸,另一套是文字里写的「穿着黑色风衣、神情冷峻的中年男人」。模型在两者之间权衡,每场权重略偏一点,十场之后就成了另一个人。

定妆要先于开拍

正确顺序是:在写剧本之后、生成任何视频之前,先完成角色阵容与视觉确认,为每个主要角色出定妆立绘,并落库为可回看、可替换的历史版本。视频侧只消费状态已完成、文件可读的立绘,不拿半成品去绑参考。

这一步有硬门禁:阵容齐全、姓名合法、视觉字段完整、主角与创意简报对齐,不过关不能进入下一阶段。

「有图不写外观」是一条铁律

解决角色漂移最有效的一条纪律,可以直接写进任何 AI 短剧工作流:

有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。

这条规则直接掐掉了文字与参考图的冲突源。服装、发型、脸型、年龄感交给定妆图;提示词只负责告诉模型这个人在这一场里在做什么、什么情绪、受了什么伤。

穿越和闪回要做时代造型路由

穿越、闪回、回忆杀是角色漂移的重灾区,因为同一个人在不同时代需要不同造型。解法是按场景地点关键词判定现代 / 古代,取人物定妆图时优先匹配对应造型版本,而不是让模型自己猜「这个场景他该穿哪件」。

手动绑定处理称呼漂移

剧本里同一个角色可能被写成「警官」「李队」「李强」「那个男人」。如果不做绑定,模型会把它们当成四个不同的人去生成。需要支持手动把剧本里的指代替换词绑到档案里的同一个角色定妆上。

场景为什么会串味:空镜没有独立资产

场景漂移常被忽略,因为它不像换脸那么刺眼,但观众会本能地感到「这地方不对」。

场景图要独立出,且严禁出现人物

场景应该作为独立资产先出立绘,而不是在每场视频生成时让模型顺带画出来。有一条很关键的纪律:场景图严禁出现人物。一旦场景图里带人,后续把它当空镜参考时,模型会把图里那个人的轮廓、服装、位置也当成「场景的一部分」复刻出来,直接和本场演员撞车。

场次信息从剧本结构化解析

场次的「内 / 外 | 地点 | 日夜」应该从剧本里解析出来,而不是靠人工再填一张表。解析结果直接决定取哪张场景图、用什么光影,避免「剧本写的是夜外景,提示词却写成日内」这种低级漂移。

空镜纪律比风格描述更重要

很多人试图用「温馨的、暖色调的、现代简约的」这类风格词去锁场景,效果很差。风格词是软约束,一张确定的场景立绘是硬约束。先有硬约束,再叠风格标签。

道具为什么会失忆:没有编目就会丢

道具漂移有两种:一种是「关键道具变了样」(上一集是玉佩,这一集变铜牌),另一种是「道具凭空出现或消失」(手里本该有刀,突然空着手)。

道具要以「道具师」视角按集提取

正确做法是从剧本里按集提取道具,用拍戏视角保留剧本原始称呼,全剧合并成编目(catalog),不丢集。也就是说,不是让模型「凭印象记得有个玉佩」,而是明确告诉它:第 3 集第 2 场出现「玉佩」,第 7 集第 5 场再次出现「玉佩」,它们是同一个道具,共用一张参考图。

参考图槽位有顺序、有上限

每场绑定多张参考图,顺序固定:场景图 → 本场道具图 → 人物定妆图。有图才占槽位,无图标明「仅文字」,不强行编造绑定。槽位有上限,所以道具要支持手动纳入 / 排除——本场无关的道具不要塞进去挤占位置,避免模型把注意力分到错误的东西上。

内容权威归剧本,不归画风手册

如果剧本写「主角拿着一部老式翻盖手机」,而所选画风手册的世界观是古代仙侠,应该以剧本描述为准。手册管画法,不管拒画。这避免了「画风把道具吃掉」导致的道具失忆。

场块切分:把一部剧拆成可控单元

即使定妆、场景、道具都齐了,如果一次性让模型生成一整集,一致性仍然会崩。因为长生成里模型的注意力会随时间衰减,前半集记住的脸,后半集就忘了。

约 10 秒一个场块

剧本应该被自动切成视频场块,目标粒度约 10 秒 / 场,正文软上限约 200 字,超过再按动作节拍、空段、句号等规则拆。用户看到的不是「第 3 集一个大视频」,而是「第 3 集 → 场 1、场 2、场 3……」,每场独立提示词、独立参考图、独立成片与历史 takes。

这相当于剪辑台上的 clip 列表:每一段足够短,模型在单段内有足够注意力守住资产;段与段之间靠同一份定妆和场景图衔接。

群演和泛指角色要剥离

剧本里的「围观群众」「保镖们」「服务员」这类泛指角色,不应占用主演的定妆槽位,否则会挤占真正需要一致性的主角参考位。群演从可绘制主演名单里剥离,由模型按文字生成即可。

镜头提示词:教模型用分镜表说话,而不是写小说

一致性问题很大一部分是提示词写法造成的。小说式的提示词(「他缓缓转过身,眼中闪过一丝复杂的情绪,回忆如潮水般涌来……」)给模型留了太多发挥空间,每场发挥得不一样,人就漂了。

八大要素

工程化的镜头提示词包含八个要素:精准主体、动作细节、场景环境、光影色调、镜头运镜、视觉风格、画质、约束条件。其中「约束条件」就是一致性的锚点,包括兜底包:画质、面部稳定、无水印 Logo;多人场景加双胞胎 / 分身兜底;非写实必须风格锚定。

几条硬规矩

  • 一镜一运镜:禁止单镜内推拉摇移叠加,一动到底最容易崩脸。
  • 用镜头序号,不用绝对秒数:写「镜头 1 / 镜头 2」,不写「0–3s」,因为生成时长不精确,秒数锚点会错位。
  • 动作低缓连续:优先低缓连续动作,减少高爆发动态崩坏;肢体细化、程度量化,比「他激动地大喊」更稳。
  • 只给本场素材:提示词生成时只看本场的剧本、本场的参考图,禁止串戏——上一场的道具、角色、场景不要带进来。
  • 合规清洗:交付前剥离特定影视作品 / IP 名称,保留技法与美学描述,降低下游版权拦截风险。

系统在教模型用分镜表语言说话,而不是写小说。

开拍前的齐套校验:别让缺失静默发生

生产级流程和玩具脚本的一个分水岭,是缺东西时会不会静默硬生成。

生成提示词前,应该先检查缺失的场景 / 人物 / 道具参考,弹出清单引导先去绘制。允许跳过走纯文字路径——但这是提醒式的制片助理,不是静默硬生成。跳过意味着你明确接受「这一场质量通常更差」的后果。

同样的生产级可靠性还包括:视频任务走独立队列车道,与剧本写作、立绘任务隔离并发槽位;同一场块进行中禁止并行提交,避免重复扣费与状态混乱;僵死任务超时回收,失败可感知、可重试。这不是玩具脚本,是可运营的生产队列。

必须讲清的边界

一致性不是靠某个开关「一键解决」的,以下几条边界在选型时必须心里有数:

  1. 没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里,系统提供的是多 take 与改词重拍的工具,哪条 take 脸最稳、哪条需要重拍,要人判断。
  2. 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差,所以专业流程应该先定妆再开拍。
  3. 约 10 秒的场块是工程启发式,不是时间码精剪。 超长场会再拆,但仍可能出现偏长的块;精剪与串场成片需要后续剪辑环节。
  4. 当前不做跨场自动续写 / 延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」,长镜头连贯叙事仍要靠剪辑拼接。
  5. 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。
  6. 参考图被识别为疑似真人照片时,应改用平台绘制链路、不加真人参考图后重绘再拍。 直接拿真人照片当参考,既不稳,也有合规风险。

工艺怎么固化进产品

猫斯卡是一条从想法到成片的自动生产链,不是单个文生视频按钮。在一致性这件事上,它把上面这套工艺固化成了几个具体环节:

  • 故事档案建档:人物身份、稳定性格、当前状态、人物关系、伏线状态、按集出场表、道具视觉描述全部结构化记录,不靠模型记性,靠结构化档案。
  • 17 套画风手册:每套包含人物出图手册、场景 / 道具手册、视频风格标签,选定后人物立绘、场景立绘、道具立绘、视频提示词共用同一风格路径,避免「人物是日漫、视频变写实」的断层。
  • 两段式立绘工艺:先用该画风的人物手册加性别硬规则把档案描述润色成出图提示词(可人工覆盖),再拼提示词出图,落库为可回看的历史版本。
  • 参考图自动映射:每场按「场景 → 道具 → 人物」顺序构建参考素材表,支持手动角色绑定、道具纳入 / 排除、历史版本替换、时代造型路由。
  • 工程化镜头提示词:按八大要素、一镜一运镜、镜头序号、强制兜底包、动作低缓连续等规范生成,生成参数偏保守,取稳定可控。
  • 多 take 择优:每场独立成片与历史 takes,改词 / 换图后再拍才是新 take,和片场「改分镜说明再拍」一致。

需要明确的是,猫斯卡没有试图用一次生成替代剧组;它用工程手段强制执行了短剧工业里已经被验证的质量控制顺序——先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

猫斯卡的定位是可规模化生产的 AI 短剧操作系统——把专业流程固化进产品,而不是宣称无需人类、零失误出片。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com