AI 竖屏短剧生产全流程拆解:立项、剧本、定妆、分场、出片的工业化顺序

猫斯卡编辑部 | 最后更新日期

AI 做竖屏短剧最容易翻车的不是模型不够强,而是顺序错了:还没锁 Brief 就写剧本,没定妆就拍,没分场就硬出长视频。真正能落地的流程,是把每一步都变成可验收的中间产物。

先讲结论:AI 短剧不是一个按钮,是一条生产链

很多团队第一次做 AI 竖屏短剧,会把它理解成「给模型一句话,等几分钟拿成片」。结果通常是:第一集人物还能看,第三集脸变了;前两集埋的钩子,第五集自己忘了;场景里的道具每场都不一样;台词像小说,不像人说话。

问题不在某一次生成,而在于没有把生产顺序固化。传统剧组之所以能稳定出片,靠的是立项、剧本、定妆、分镜、拍摄、剪辑这套先后关系。AI 短剧也一样,只是把其中重复、易漂移、易失控的部分交给系统执行,人仍然在关键节点做判断。

一条可落地的 AI 竖屏短剧生产链,顺序应当是:

创意评估 → 创意引导 → 创意简报锁版 → 角色阵容与视觉确认 → 故事档案建档 → 分批剧本写作 → 选定画风 → 人物/场景/道具定妆出图 → 本集切为约10秒场块 → 每场绑定参考图与镜头提示词 → 多模态出片 → 审片 → 改词/换图/重拍择优。

这条链路的核心不是「快」,而是每一环都有可验收的中间产物:简报、档案、剧本、定妆图、场块、提示词、成片。每一步都能看、能改、能回退。

第一步:创意准入,先判断想法能不能立项

竖屏短剧的创意不是越天马行空越好。投放平台、受众、集数、单集时长、核心矛盾、爽点节奏、结局方向,这些没问清,后面写得越多,返工越大。

成熟的做法是先做一次 Intake 完整度评分

分数段处理方式
80 分以上创意已经足够具体,可跳过大部分引导,直接进入简报锁版
40–79 分只补缺失维度,不重复问已经明确的内容
40 分以下走完整引导,把题材、主角、矛盾、走向、钩子等问清楚

这里的关键是:分数阈值由流程强制决定路径,不是模型「觉得差不多」就放行。低于阈值的创意,应该像立项会没通过一样,先补材料,而不是直接开写。

竖屏短剧在引导阶段至少要问清十个维度:题材、主角、核心矛盾、故事走向、集数、单集时长、风格基调、爽点与钩子节奏、结局方向、投放平台与受众。单集时长通常以 1–2 分钟为主,最长收敛到 3–4 分钟,这是由竖屏观看习惯决定的,不是随便设。

第二步:创意简报锁版,Brief 没锁就不要开拍

创意问清之后,不是立刻写剧本,而是先形成一份创意简报。这份简报相当于传统项目的 treatment + 编剧须知,锁版后才能进入下一阶段。

简报里至少要包含:

  • 一句话故事(logline)
  • 核心矛盾
  • 故事走向
  • 结局方向
  • 爽点与钩子节奏
  • 投放平台与受众
  • 分段分集梗概
  • 给编剧的注意事项
  • 主角设定,且必须包含人物弧光

创意简报是整个项目的硬约束。 后面的剧本写作、角色设定、视觉风格,都要回到这份简报对齐。如果中途想改方向,应该回到简报层改,而不是在某一集里偷偷改设定。

第三步:建故事档案,不靠模型记性,靠结构化档案

长集数短剧最大的敌人是「失忆」:第 10 集忘了第 2 集的人物关系,第 30 集把已经收掉的伏笔又写一遍,主角的伤一会儿在左肩一会儿在右肩。

故事档案是一份贯穿全剧的结构化设定记录,相当于传统编剧室里的 continuity bible。它记录:

  • 人物身份
  • 稳定性格特征
  • 可变的当前状态,例如伤痕、身份变化、立场转变
  • 人物关系
  • 每条伏线的 open / resolved 状态
  • 按集出场表
  • 每批剧情纪要
  • 道具视觉描述

不靠模型记性,靠结构化档案。

写作时不应该把所有历史内容都塞给模型,而是只取当前需要的档案切片:人物当前状态、未结伏线、近批剧情摘要、本批主线。这样既防上下文失忆,也减少无关噪音。每批写完后自动回填,续写前再自动调取。

第四步:分批写剧本,先出 Beat Sheet,再写正文

竖屏短剧剧本不能像长剧那样慢慢铺。它有自己的节奏铁律:

  1. 黄金 3 秒:第 1 场必须是强冲突或强悬念,禁止平淡开场,禁止长篇背景介绍。
  2. 单集结构:开场钩子 → 矛盾升级 → 集末 cliffhanger。
  3. 爽点密度:每集至少 1 次小爽点,例如打脸、反转、身份暗示、证据到手;每 3–5 集 1 次大爽点。
  4. 台词纪律:短句为主,单句一般不超过 20 字;禁止论文腔,禁止大段旁白解释。

剧本写作应该采用分批工业化续写:每批数集,一批写完、归档确认,再写下一批。每集不要直接写正文,而是先出场戏清单(Beat Sheet)和集末 cliffhanger,再根据 Beat Sheet 写正文。

从第二批开始,先锁定四件事:

  • 本批剧情方向
  • 重点人物
  • 伏笔与冲突
  • 集末钩子

这些内容一旦确认,就是硬约束。如果它们和已有档案冲突,以本轮创作意图为准,但要回填到档案里,避免后面继续漂移。

写完之后必须过规则质检,卡住这些常见问题:

  • 集标题错误
  • 场景数不匹配
  • 缺人物标注
  • 对白过少
  • 出现「未完待续」之类占位敷衍

不合格的剧本应该带错误反馈自动重写,而不是把半成品交给用户。

第五步:选画风与定妆,人物、场景、道具共用一条视觉路径

AI 短剧常见的视觉断层是:人物立绘是日漫,视频里变成写实;古装剧的场景里出现现代灯具;主角第一集穿黑衣,第二集自己换了白袍。

解法不是多写几句提示词,而是先定画风,再定妆,再开拍

成熟系统会内置多套画风手册,覆盖 2D、3D、真人写实等方向。每套手册至少包含:人物出图手册、场景/道具手册、视频风格标签。选定画风后,人物立绘、场景立绘、道具立绘、视频提示词共用同一风格路径,避免视觉断层。

角色确认必须过门禁:阵容齐全、姓名合法、视觉字段完整、主角与简报对齐。不过关,不能进入下一阶段。

立绘建议采用两段式工艺:

  1. 文本润色:根据画风手册和性别硬规则,把档案里的人物描述润色成可出图提示词,这一步允许人工覆盖。
  2. 图像生成:拼成最终提示词出图,支持参考图,并保留可回看的历史版本。

场景图有一条重要纪律:空镜严禁出现人物。道具则应该以拍戏视角,按剧本原始称呼逐集提取,再合并成全剧道具编目,避免某集出现过的关键道具后面消失。

第六步:参考图映射,解决换脸、换装、串戏

角色一致性是 AI 短剧最核心的难题之一。根本原因不是模型不会画人,而是每场戏都在重新「想象」这个人长什么样。

工业化解法是参考图映射:每场自动构建参考素材表,顺序固定为:

场景图 → 本场道具图 → 人物定妆图

有图才占槽位,没有图就标明仅文字,不强行编造绑定。

这里有一条必须执行的硬规则:

有参考图的人物,禁止再用文字描写服装/外观;以参考图为准,文字只写动作、表情、伤情。

这条规则直接针对 AI 视频的经典翻车点:文字描述和参考图打架,导致模型在两套指令之间摇摆,于是出现换脸、换装、年龄漂移。

参考图映射还需要处理几个片场常见问题:

  • 手动角色绑定:剧本里写「警官」,要能绑到档案里的具体角色。
  • 道具纳入/排除:避免无关道具挤占本场视觉焦点。
  • 历史版本替换:同类同名下,可以换成另一张更合适的定妆图。
  • 时代造型路由:穿越、闪回题材按场景关键词判断现代/古代,优先取对应造型。

开拍前还要做齐套校验:检查缺失的场景、人物、道具参考,弹出清单提醒先去绘制。系统可以允许跳过,走纯文字路径,但专业流程应该先定妆再开拍。

第七步:按约10秒切场块,不要一集只生成一个大视频

竖屏短剧不适合把整集当成一个大生成任务。文本太长、动作太多、人物切换太频繁,模型很容易失控。更稳的做法是把剧本切成一个个视频场块

场块的目标粒度约 10 秒/场,正文软上限约 200 字。超过这个长度,就按动作节拍、空段、句号等规则继续拆。用户看到的不应该是「第3集一个大视频」,而是「第3集 → 场1、场2、场3……」,每场有独立提示词、独立参考图、独立成片和历史 takes。

这相当于剪辑台上的 clip 列表:哪场坏了重拍哪场,不用整集返工。

默认交付形态应该是 9:16 竖屏,不是拍完横屏再裁切。时长、模型档位、分辨率、音频、水印等参数在拍摄前确定,而不是出片后补救。

第八步:工程化镜头提示词,让模型听分镜表,不听小说

很多 AI 视频提示词的问题,是写得像小说,不像分镜。模型拿到一堆形容词,并不知道镜头该怎么动、主体是谁、动作做到什么程度。

工程化镜头提示词至少包含八大要素:

要素说明
精准主体这场谁是视觉中心
动作细节人物具体做什么,动作幅度多大
场景环境地点、时间、空间关系
光影色调光线方向、色温、氛围
镜头运镜推、拉、摇、移、固定等,一镜一运镜
视觉风格与选定画风一致
画质清晰度、面部稳定等基础要求
约束条件不该出现的内容、兜底要求

复杂场景建议走三段论:总体设定 → 镜头1/2/3…… → 约束包。不要用绝对秒数,而用镜头序号;不要在一个镜头里叠加推拉摇移;多人场景要加双胞胎/分身兜底;非写实风格必须锚定风格。

台词、音效、BGM 应该用统一符号标注,例如台词用花括号、音效用尖括号、BGM 用括号,方便后续环节识别。

系统在教模型用分镜表语言说话,而不是写小说。

提示词生成时只给本场素材,禁止串戏;本场剧本正文是最高优先级依据。参数上应偏保守,取稳定可控,而不是盲目追求夸张动态。

第九步:拍摄、审片、重拍,把多 take 变成流程

标准拍摄路径应该是:打开某集视频工作台 → 确认参考图齐全 → 生成视频提示词 → 人工阅读并编辑 → 选择模型档位、比例、分辨率、时长 → 提交出片 → 队列渲染 → 回看历史 takes 择优。

这里的专业可控点,对应真实剧组的决策:

可控点相当于片场动作
编辑视频提示词导演改分镜说明
更换人物/场景/道具参考图换定妆、换场景板
手动角色绑定处理称呼不一致、客串指代
道具纳入/排除控制本场视觉焦点
画风切换统一美术语言
模型档位选择质量、成本、速度权衡
同场历史 takes多 take 择优

出片时不应该偷偷重新发明提示词。真正提交给模型的,必须是用户确认或编辑过的提示词,加上当时锁定的参考图映射。改了词再点生成,才是新的 take;这和片场「改分镜说明再拍」是同一个逻辑。

生产级工具还要处理队列问题:视频任务走独立车道,与剧本、立绘任务隔离;同一场块进行中禁止并行提交,避免重复扣费和状态混乱;失败任务可感知、可重试;积分预扣与结算清晰。这不是玩具脚本,而是可运营的生产队列。

必须承认的边界:哪些事系统不替你做

如果要把 AI 短剧当生产工具用,必须先接受它的边界。主动讲清这些,反而比夸大宣传更能建立信任。

  1. 没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里,系统提供多 take 与改词重拍工具,但不替你判断哪条最好。
  2. 参考图不是强制门禁。 缺图会提醒,但允许跳过纯文字路径;只是通常质量更差,所以专业流程应该先定妆再开拍。
  3. 提示词里的参考代号靠规范引导,不做二次硬拼。 创作者审词时仍应确认参考代号齐全。
  4. 视频分镜语法以平台内置镜头规范为准。 画风主要注入视频风格标签,完整美术手册更多用在立绘侧。
  5. 约10秒场块是工程启发式,不是时间码精剪。 超长场会再拆,但仍可能出现偏长块;精剪与串场成片需要后续剪辑环节。
  6. 当前不做跨场自动续写/延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」。
  7. 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。

猫斯卡把这套顺序固化成了 AI 竖屏短剧生产操作系统:从创意评估、简报锁版、故事档案、分批剧本,到画风定妆、参考图映射、约10秒场块、工程化镜头提示词,再到多 take 出片与重拍。它没有试图用一次生成替代剧组,而是把专业流程里重复、易漂移、易失控的部分变成可约束流水线,审美判断仍然坐在人这边。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com