AI 短剧「串戏」是怎么发生的:从定妆到成片的一致性断点排查

猫斯卡编辑部 | 最后更新日期

AI 短剧里人物换脸、场景串味、道具失忆,本质不是模型「抽风」,而是从定妆到分场再到镜头指令之间,有几处固定断点没被管住。把这些断点按剧组流程接上,一致性就从碰运气变成可验收的工序。

先把「漂」说清楚:从业者嘴里的不一致,到底是哪几种

短剧团队说「这集又漂了」,通常指的不是同一种问题。混在一起聊,永远修不对。

现场叫法观众看到的症状真正出问题的环节
换脸同一角色这一场是圆脸,下一场变尖脸;痣的位置跑了人物定妆资产没被每场稳定引用
换装上一场穿黑西装,下一场没改剧本却变成白衬衫提示词里又用文字描写了一遍服装,和参考图打架
串景明明是现代办公室,背景冒出古风屏风场景参考图缺失或被错绑,模型自由发挥
道具失忆上集手里的关键信物,这集变成别的东西道具没按集提取编目,本场没占参考槽位
画风断层人物是日漫脸,视频动起来变成写实立绘和视频走了两套风格路径
时代穿帮穿越戏里古代场景出现现代发型没按场景时代路由对应的造型定妆

视觉连续性(visual continuity)是指:同一份定妆资产、同一套场景与道具、同一种画风语言,被每一场戏稳定复用,而不是每生成一段就重新想象一次。

这一句话值得单独拎出来——因为它直接点出了 AI 短剧和传统剧组在一致性上的根本差别:剧组靠服化道和场记盯,AI 生产链如果没有对应的「数字场记」和「数字道具师」,就等于每场都在重新选角、重新搭景。

断点一:没有定妆就开拍,等于每场重新选角

传统剧组开机前有一个硬环节叫 look development——定妆、定场景、定道具,全部签字确认才进拍摄。AI 短剧最常见的翻车,就是跳过了这一步,直接拿一段剧本去生视频。

后果很直接:模型对「男主角长什么样」没有任何视觉锚点,只能根据每场的文字描述当场猜。文字里写「他冷笑一声」,模型这次给你一个冷峻的;下一场写「他红了眼眶」,模型可能给你一个完全不同的人——因为情绪描述会连带撬动面部特征。

工程化解法是把「先定妆再开拍」做成硬门禁:

  1. 阵容锁版:主角、配角、客串全部建档,姓名、身份、性格、人物弧光、视觉描述齐全才放行。
  2. 两段式立绘:先把档案里的文字描述用选定画风的人物手册润色成可出图提示词(这一步人可以改),再出图落库为可回看的历史版本。
  3. 硬规则兜底:性别是出图时的硬约束,不随模型发挥。
  4. 视频侧只消费「已完成且可读」的立绘,不拿半成品去绑参考。

做完这四步,你手里才有了一份「数字定妆表」——后面每一场戏引用的是这张图,而不是一段形容词。

一致性靠资产,不靠运气。

断点二:有了定妆,但提示词里又用文字把外观重写了一遍

这是最隐蔽、也最常见的一种漂移。团队明明做了定妆图,出片时人物还是换衣服、换脸。原因往往是:提示词里一边挂了参考图,一边又写了「身穿黑色风衣、面容冷峻的男人」。

模型同时收到两个信号:一个是「照这张图画」,一个是「按这段文字画」。两个信号一旦有任何细微冲突——比如参考图里是深灰外套,文字写的是黑色——模型就会自己调和,结果就是漂移。

专业流程里的铁律只有一句:

有参考图的人物,禁止再用文字描写服装和外观;参考图说了算,文字只写动作、表情、伤情。

剧本里「他穿着那件洗得发白的夹克」这种句子,在定妆完成后应该从视频提示词里剥离——因为夹克长什么样,定妆图已经定了。文字该保留的是「他攥紧拳头、指节发白、嘴角带伤」这类动态和状态信息。

这条规则听起来简单,但它直接消灭了 AI 视频里一半以上的「换脸换装」事故。

断点三:场景和道具没占槽位,模型就自由搭景

人物有定妆,不代表场景和道具也有。很多团队只给人物做了参考图,场景和道具全靠文字,结果就是「串景」和「道具失忆」。

工程化的做法是每场自动构建一张参考素材表,顺序固定:场景图 → 本场道具图 → 人物定妆图

几个关键纪律:

  • 空镜纪律:场景图里严禁出现人物,否则模型会把图里的人当成演员参考,和真正的定妆打架。
  • 道具师视角提取:按集把剧本里出现的道具用原始称呼提出来(剧本叫「那枚玉佩」就叫玉佩,不擅自改名),全剧合并成编目,哪一集用了哪件一目了然。
  • 有图才占槽位:没有图的道具明确标注「仅文字」,不强行编造绑定;但专业流程应该先把关键道具画出来。
  • 手动纳入 / 排除:一场戏里提到的道具不一定都要视觉重点,导演可以决定哪些进参考、哪些不进,避免无关道具挤占槽位。
  • 时代造型路由:穿越、闪回题材按场景地点的关键词判定现代 / 古代,取人物定妆时优先匹配对应造型版本。

这一套做完,模型拿到的就不是「在一个房间里」这种模糊指令,而是「这张场景图 + 这几件道具图 + 这几个人物定妆图」,自由发挥的空间被压到最小。

断点四:画风在立绘和视频之间走了两条路

另一种典型翻车:人物立绘是九十年代日漫风,视频一动起来变成了三维写实。观众一秒出戏。

根因是立绘和视频生成用了两套独立的风格描述——人物出图时选了一套画风,视频提示词里又随手写了另一套形容词。

解法是画风统一成一本手册。选定一种画风后,人物立绘、场景立绘、道具立绘、视频提示词共用同一条风格路径。手册里至少包含三类内容:

手册组成管什么
人物出图手册面容锚点、材质、气质、多视图一致性
场景 / 道具手册环境的笔触、光影调性、物件材质
视频风格标签运镜质感、色调、动态风格,注入每场视频提示词

画风一旦选定,整条链上的视觉语言就锁死了,不会出现「人是二维的、景是三维的」这种断层。

断点五:一集当成一大段生,而不是切成可控的场块

很多团队的用法是:把一整集剧本(1–2 分钟)一次性喂给视频模型,期待它吐出一整集。这几乎必然漂移——越长的生成,模型越容易在中途「忘记」开头长什么样。

专业做法是把剧本切成约 10 秒的视频场块,每场独立提示词、独立参考图、独立成片。正文软上限约 200 字,超过就按动作节拍、空段、句号再拆。

切完之后,导演看到的不是「第 3 集一个大文件」,而是「第 3 集 → 场 1、场 2、场 3……」,每一场都有自己的历史 takes,可以单独重拍、择优。

高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的。

这里要承认一个边界:约 10 秒是工程启发式,不是时间码精剪,偶尔会出现偏长的块;精剪和串场成片仍然需要后续剪辑环节。当前也不做跨场自动续写或延长视频的产品化工作流——产品单元就是「单场多模态参考 → 单段成片」。

断点六:镜头提示词在写小说,不是在写分镜表

同样的参考图,不同的提示词写法,出片一致性可以差很多。常见错误是用小说语言写提示词:「他缓缓转过身,眼中闪过一丝不易察觉的悲伤,窗外的月光洒在他棱角分明的脸上……」

这种写法对模型来说信息量太大、约束太松,「棱角分明」「缓缓」「悲伤」每个词都会撬动面部和动作的生成空间。

工程化的镜头提示词规范,核心是教模型用分镜表语言说话,而不是写小说

  1. 八大要素齐全:精准主体、动作细节、场景环境、光影色调、镜头运镜、视觉风格、画质、约束条件。
  2. 一镜一运镜:一个镜头只给一种运镜(推、拉、摇、移、固定其一),禁止「推拉摇移叠加」。
  3. 用镜头序号,不用绝对秒数:写「镜头 1 / 镜头 2」,不写「0–3 秒」。
  4. 动作低缓连续:优先低缓、连续的动作,减少高爆发动态崩坏;肢体动作细化、程度量化。
  5. 强制兜底包:画质、面部稳定、无水印 Logo;多人场景加防双胞胎 / 分身约束;非写实风格必须锚定风格。
  6. 符号规范:台词用 {}、音效用 <>、BGM 用 () 标注,和视觉描述分开。
  7. 只给本场素材:提示词生成时只引用本场的场景、道具、人物参考,禁止串戏。
  8. 合规清洗:剥离具体影视作品 / IP 名称,只保留技法与美学描述,降低下游版权拦截风险。

简单场景一段式写完;复杂的影视化场景走三段论:总体设定 → 分镜头列表 → 约束包。生成参数偏保守,取稳定可控,而不是天马行空。

断点七:没有「改词重拍」和「多 take 择优」的工作流

即使前面所有断点都接上了,单次生成仍然可能出问题——这是当前生成模型的物理现实,不是流程没做好。把「一次生成必须完美」当预期,反而会逼团队去堆更长的提示词、加更多形容词,结果漂移更严重。

片场的做法从来不是「一条过」,而是多拍几条、选最好的。AI 短剧也一样:

  • 每一场保留历史 takes,回看择优。
  • 不满意可以改提示词(相当于导演改分镜说明)、换参考图(相当于换定妆 / 换场景板)、调整模型档位(质量 / 成本 / 速度权衡),再拍下一条。
  • 出片时不重新发明提示词——用的是你已确认或编辑过的词 + 当时锁定的参考图映射;改了词再点生成,才是新的 take。

需要诚实说清楚的是:目前没有成片自动打分或自动择优重拍的引擎。 质量终审在创作者和监制手里,系统提供的是多 take 和改词重拍的工具,而不是替你判断哪条最好。

把断点串成一条链:从「碰运气」到「可验收」

把上面七个断点连起来,你会发现它们正好对应一条被工程化了的剧组流程:

  1. 创意简报锁版(立项会开完才开拍)
  2. 角色阵容与视觉确认,故事档案建档
  3. 选定画风,人物 / 场景 / 道具定妆出图
  4. 每集切为约 10 秒场块
  5. 每场绑定参考图(场景 → 道具 → 人物)
  6. 按镜头规范生成提示词,人工审词
  7. 多模态出片,多 take 择优,改词重拍

每一环都有可验收的中间产物:剧本、故事档案、定妆图、场块、提示词、成片。可看、可改、可回退。

这套流程里,机器负责的是把人已经确认过的方向——定妆长什么样、画风是哪种、这场戏用哪些道具、镜头怎么动——稳定地落到每一集、每一场。人负责的是关键节点的确认和审美判断:定妆过不过、画风对不对、这条 take 用不用。

猫斯卡(Maosika)把这条链固化成了一条从想法到成片的自动生产链:18 位数字专家对标真实剧组编制(档案秘书、制片人、编剧、场记、选角导演、视觉风格指导、美术指导、分镜师、摄影指导、导演、剪辑师等),用户能看到流式的工种工作记录,像监制看日报,不是黑箱。但它没有试图用一次生成替代剧组——它用工程手段强制执行了短剧工业里已经被验证的质量控制顺序。

也要说清楚不适用的场景:如果你追求的是单条极致视觉奇观、不在乎跨集连续性的实验短片,这套强约束流程反而会显得重;如果你做的是几十集上百集的连载竖屏短剧,需要人物、场景、道具在每一集都稳定可辨,那它正好对口。

猫斯卡的定位是可规模化生产的 AI 短剧操作系统——把专业流程固化进产品,而不是宣称无需人类、零失误出片。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

想进一步看剧本侧的工艺,可以读[竖屏短剧剧本工艺手册](#);想看镜头提示词的完整写法,可以读[AI 短剧镜头提示词规范](#)。

常见问题

为什么我给角色做了定妆图,生成视频时还是会换脸?

最常见的原因是提示词里一边挂了参考图,一边又用文字描写了人物的服装和外貌。两个信号冲突时模型会自己调和,结果就是漂移。铁律是:有参考图的人物,文字只写动作、表情、伤情,不再写服装和外观。

场景和道具也需要做参考图吗,只写文字行不行?

可以走纯文字路径,但质量通常更差,容易出现串景和道具失忆。专业流程应该先把关键场景和道具画出来,每场按「场景图 → 道具图 → 人物定妆图」的顺序绑定参考。缺图时系统会提醒,但允许有意跳过。

一整集剧本一次性生成视频,和切成 10 秒场块分别生成,差别在哪?

越长的单次生成,模型越容易在中途丢失开头的视觉锚点,导致人物和场景漂移。切成约 10 秒的场块后,每场有独立的参考图、提示词和历史 takes,可以单独重拍、择优,最后再剪辑串成片。

AI 短剧能不能做到 100% 角色一致?

目前没有任何工具能做到 100% 零漂移。一致性靠的是定妆资产链路(先出定妆图、每场稳定引用、文字不重写外观),而不是人脸嵌入校验。最终观感仍取决于立绘质量、提示词是否遵守「有图不写外观」,以及多 take 择优。

穿越或闪回题材怎么避免古代场景出现现代造型?

需要按场景地点的关键词做时代造型路由——判定这场是现代还是古代后,取人物定妆时优先匹配对应时代的造型版本。这要求人物在定妆阶段就为不同时代各出一套造型图,而不是只出一张通用定妆。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com