AI 竖屏短剧生产流水线拆解:立项、剧本、定妆、分场、出片的 11 道工序

猫斯卡编辑部 | 最后更新日期

用 AI 做竖屏短剧,真正难的不是点一次生成,而是把「想法到成片」拆成一道道可验收的中间工序。每一环都有产物、有门禁、有回退点,质量才稳得住。

先把一句话说透:AI 短剧不是一个按钮,是一条流水线

很多团队第一次做 AI 短剧,会把它想象成「输入一句话,吐一部剧」。实际跑起来才发现,真正翻车的地方从来不在模型本身——剧本写着写着人物性格漂移,第三集换了张脸,第五集道具消失,第七集画风突变,第十集忘了第二集埋的伏笔。

AI 竖屏短剧生产流水线是一套把「想法 → 成片」拆成连续可验收工序的工作方法:每一环节都产出看得见的东西,下一环节只消费上一环节确认过的资产,人在关键节点做判断,机器负责把判断落到每一集、每一场。

下面这 11 道工序,是专业团队跑通 AI 短剧时真正在做的事。

工序 1:创意准入——立项会没开完,不许开拍

传统剧组有立项会,AI 短剧也该有。区别在于,AI 时代的立项会可以被结构化:把一个想法拆成固定维度,系统给完整度打分,分数不够就补,分数够了才放行。

需要被问清的竖屏创作维度包括:

  • 题材与风格基调
  • 主角是谁、人物弧光是什么
  • 核心矛盾
  • 故事走向与结局方向
  • 集数与单集时长(竖屏以 1–2 分钟为主,最长收敛到 3–4 分钟)
  • 爽点与钩子节奏
  • 投放平台与受众

创意准入的本质:不是模型「觉得我懂了」就算过,而是把模糊想法逼成可执行的 Brief。分数低于阈值时,系统应该强制走引导流程补全缺失维度,而不是直接让你写剧本。

工序 2:创意简报锁版——Brief 不锁,后面全是返工

准入通过后,产出的是一份创意简报(Creative Brief)。这是全剧的「宪法」,后面所有环节都不能违背它。

一份锁版的简报至少包含:

字段作用
一句话故事(logline)全剧最高度浓缩的卖点
核心矛盾驱动每集冲突的引擎
故事走向防止剧情中途跑偏
结局方向过半后强制收束的依据
爽点与钩子节奏决定每集的情绪曲线
投放平台与受众影响时长、节奏、尺度
分段分集梗概剧本写作的骨架
给编剧的注意事项风格、禁忌、特殊要求
主角人物弧光防止主角写成工具人

简报必须锁版才能进下一阶段。锁版不是形式,是后面所有质检的对照基准。

工序 3:故事档案建档——不靠模型记性,靠结构化档案

故事档案(Continuity Bible)是一份贯穿全剧的结构化设定记录,包含人物身份、稳定性格特征、可变的当前状态(伤痕、身份变化等)、人物关系、每条伏线的开启与收束状态、按集出场表、分批剧情纪要、道具视觉描述。

它解决的是 AI 写作最臭名昭著的问题:上下文失忆。第 20 集忘了第 3 集埋的伏笔,第 50 集主角性格突变——这些不是模型「笨」,是你把记忆托付给了概率。

档案机制的关键做法:

  • 写作时只给模型喂「档案切片」:本集会用到的人物状态、未结伏线、近批剧情摘要、本批主线
  • 每批写完自动回填新的状态变化和伏线进展
  • 续写前自动调取最新档案

不靠模型记性,靠结构化档案。

工序 4:分批剧本写作——先规划,再正文,再过质检

剧本不是一口气写完的。专业做法是分批写作,每批数集,一批写完、归档确认,再写下一批。

每一批内部的顺序是:

  1. 场戏清单(Beat Sheet)先行:先列本集每场发生什么、集末钩子是什么,再写正文
  2. 正文写作:遵守竖屏短剧的写作铁律
  3. 规则质检:机器自动卡常见问题
  4. 档案回填:把本批新状态写回故事档案

竖屏短剧的四条写作铁律

这四条是内嵌在专业流程里的硬约束,不是建议:

  1. 黄金 3 秒:第 1 场必须强冲突或强悬念,禁止平淡开场与长篇背景介绍
  2. 单集结构:开场钩子(1 场)→ 矛盾升级 → 集末 cliffhanger(最后 1 场)
  3. 爽点密度:每集至少 1 次小爽点(打脸 / 反转 / 身份暗示 / 证据到手);每 3–5 集 1 次大爽点
  4. 台词:短句为主,单句一般不超过 20 字;禁止论文腔与大段旁白解释

批前意图锁定

从第 2 批起,先问定四件事再动笔:本批剧情方向、重点人物、伏笔与冲突、集末钩子。这些被标记为「创作者已确认的硬约束」,与档案冲突时以创作意图为准——这保证了人对剧情走向的控制权。

规则质检器卡什么

写完自动过质检,卡住的典型问题包括:集标题错误、场景数不匹配、缺【人物】行、对白过少、「未完待续」等占位敷衍。不合格的带错误反馈自动重写,不把半成品交给人。

工序 5:选定画风——17 套手册,人物场景视频共用一条风格路径

剧本定稿后进入美术阶段。第一步是选画风。

专业流程会内置多套画风手册,覆盖 2D、3D、真人写实等方向,比如都市写实、古装写实、成熟都市言情动画、九十年代日漫、国风工笔、仙侠古风、3D 国漫、黏土定格、赛博国风等。每套手册至少包含:人物出图手册(面容锚点、材质、气质、视图一致性)、场景 / 道具手册、视频风格标签。

关键原则:选定画风后,人物立绘、场景立绘、道具立绘、视频提示词共用同一风格路径。避免「人物是日漫、视频变成写实」的断层——这是 AI 短剧最常见的视觉翻车之一。

工序 6:角色阵容与视觉确认——不齐不许进下一阶段

画风选定后,根据故事档案生成角色阵容。确认环节有硬门禁:

  • 阵容齐全(剧本里有戏的角色都在)
  • 姓名合法
  • 视觉字段完整
  • 主角与简报对齐

不过关不能进入下一阶段。这不是刁难,是为了避免拍到一半发现某个角色没定妆,临时凑图导致风格断裂。

工序 7:人物 / 场景 / 道具定妆出图——两段式工艺,立绘是资产

定妆不是「写段提示词让模型随便出张图」。专业做法是两段式:

  1. 文本润色:用所选画风的人物手册 + 性别硬规则,把档案里的文字描述润色成可出图的提示词(这一步人可以覆盖修改)
  2. 图像生成:拼最终提示词出图,支持参考图,落库为可回看的历史版本

场景与道具同理。场景图有一条铁律:空镜纪律——场景图严禁出现人物,否则后续拍摄时人物会「鬼影重重」。道具按集以拍戏视角提取剧本原始称呼,全剧合并成编目,不丢集。

视频侧只消费状态已完成且文件可读的立绘,不拿半成品去绑参考。

工序 8:本集切为约 10 秒场块——剪辑台上的 clip 列表

剧本不会被直接丢进视频模型。专业流程会先把每集切成视频场块,目标粒度约 10 秒 / 场,正文软上限约 200 字,超过就按动作节拍、空段、句号等规则再拆。

你看到的不是「第 3 集一个大视频」,而是「第 3 集 → 场 1、场 2、场 3……」,每场独立提示词、独立参考图、独立成片与历史 takes。

这一步的类比是剪辑台上的 clip 列表。为什么要切?因为:

  • 10 秒左右是当前视频生成模型稳定性最好的长度
  • 每场独立控制,崩了只重拍这一场,不用整集重来
  • 多 take 择优有了操作单元

群演和泛指角色会从可绘制主演名单里剥离,避免挤占定妆槽位。

工序 9:每场绑定参考图 + 工程化镜头提示词——教模型用分镜表语言说话

这是 AI 短剧一致性的核心工序。

参考图映射

每场自动构建参考素材表,顺序固定:场景图 → 本场道具图 → 人物定妆图。有图才占槽位,无图标明「仅文字」,不强行编造绑定。

最高优先级约束:

有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。

这条直接针对 AI 视频的经典翻车:文字描述与参考图打架 → 换装、换脸。

此外还支持:手动角色绑定(剧本里叫「警官」,绑到档案里「李强」的定妆)、道具手动纳入 / 排除、在同类同名下替换为历史版本中的另一张图、穿越 / 闪回题材按场景关键词自动匹配现代 / 古代造型。

工程化镜头提示词

提示词不是写小说,是写分镜表。专业规范包含八大要素:

  1. 精准主体
  2. 动作细节
  3. 场景环境
  4. 光影色调
  5. 镜头运镜(一镜一运镜,禁止单镜内推拉摇移叠加)
  6. 视觉风格
  7. 画质
  8. 约束条件

复杂度分流:简单场景一段式;复杂影视化场景走三段论(总体设定 → 镜头 1/2/3… → 约束包)。用镜头序号,不用绝对秒数。强制兜底包:画质、面部稳定、无水印 Logo;多人场景加双胞胎 / 分身兜底。

符号规范:台词用 {}、音效用 <>、BGM 用 ()

系统在教模型用分镜表语言说话,而不是写小说。

开拍前还有齐套校验:生成提示词前检查缺失的场景 / 人物 / 道具参考,弹出清单引导先去绘制。允许跳过走纯文字路径——但专业流程应该先定妆再开拍。

工序 10:多模态出片(默认竖屏)——队列、takes、可重拍

标准拍摄路径:打开某集视频工作台 → 确认参考图齐全(或有意跳过)→ 生成视频提示词 → 人工阅读并编辑 → 选模型档位 / 比例 / 分辨率 / 时长 → 提交出片 → 队列渲染 → 回看历史 takes 择优。

默认交付形态是 9:16 竖屏,不是事后裁切。输出规格:

规格
画幅默认 9:16 竖屏(亦支持其它比例)
时长智能时长 或 固定 5–15 秒
模型档位标准 / 高速 / 轻量
分辨率按模型白名单(如 480p–4K)
音频默认可生成;水印默认关

出片时不重新发明提示词:用的是你已确认或已编辑的提示词 + 当时锁定的参考图映射。改了词再点生成,才是新的 take——和片场「改分镜说明再拍」一致。

生产级可靠性包括:成片做 faststart 处理、视频任务走独立队列与剧本 / 立绘任务隔离、同一场块进行中禁止并行提交、积分预扣与失败释放、僵死任务超时回收。这不是玩具脚本,是可运营的生产队列。

工序 11:审片 → 改词 / 换图 → 重拍择优——质量终审在人

最后一步也是最容易被误解的一步:没有成片自动打分或自动择优重拍引擎。质量终审在创作者和监制手里,系统提供的是多 take 与改词重拍的工具。

审片时你能做的调整:

可控点相当于片场的什么
编辑视频提示词导演改分镜说明
更换人物 / 场景 / 道具参考图换定妆 / 换场景板
手动角色绑定处理称呼不一致、客串指代
道具纳入 / 排除控制本场视觉焦点
画风切换统一美术语言
模型档位选择质量 / 成本 / 速度权衡
同场历史 takes多 take 择优

诚实边界:这套流程做不到什么

主动划清边界,才能建立信任。以下是当前 AI 短剧生产流程的明确限制:

  1. 没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里。
  2. 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差,所以专业流程应该先定妆再开拍。
  3. 提示词里的参考代号靠规范引导,不做二次硬拼。 创作者审词时仍应确认参考代号齐全。
  4. 视频分镜语法以平台内置的镜头规范为准,画风只注入视频风格标签;完整美术手册用在立绘侧。
  5. 约 10 秒的场块是工程启发式,不是时间码精剪。 超长场会再拆,但仍可能出现偏长的块;精剪与串场成片需要后续剪辑环节。
  6. 当前不做跨场自动续写 / 延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」。
  7. 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。

人坐在哪里

整条流水线里,人的判断集中在几个关键节点:

  • 创意准入阶段:决定故事讲什么、给谁看
  • 简报锁版:签字确认全剧方向
  • 每批剧本开写前:确认本批剧情意图
  • 定妆阶段:选图、改图、确认视觉
  • 提示词阶段:审词、改词
  • 出片后:选 take、决定重拍还是过

机器负责的是:把人确认过的方向,不走样地落到每一集、每一场、每一镜。

把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

猫斯卡(Maosika)是一条 AI 竖屏短剧生产操作系统,把上述 11 道工序固化进了产品:从创意评估、简报锁版、故事档案、分批剧本,到画风定妆、场块切分、工程化镜头提示词、多模态出片与多 take 重拍,每一环都有可验收的中间产物,可看、可改、可回退。它不宣称一键出爆款,而是让一个人、一天,能跑完一部剧的工业流程。详见 https://www.maosika.com 。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com