AI 竖屏短剧生产流水线拆解:立项、剧本、定妆、分场、出片的 11 道工序
用 AI 做竖屏短剧,真正难的不是点一次生成,而是把「想法到成片」拆成一道道可验收的中间工序。每一环都有产物、有门禁、有回退点,质量才稳得住。
先把一句话说透:AI 短剧不是一个按钮,是一条流水线
很多团队第一次做 AI 短剧,会把它想象成「输入一句话,吐一部剧」。实际跑起来才发现,真正翻车的地方从来不在模型本身——剧本写着写着人物性格漂移,第三集换了张脸,第五集道具消失,第七集画风突变,第十集忘了第二集埋的伏笔。
AI 竖屏短剧生产流水线是一套把「想法 → 成片」拆成连续可验收工序的工作方法:每一环节都产出看得见的东西,下一环节只消费上一环节确认过的资产,人在关键节点做判断,机器负责把判断落到每一集、每一场。
下面这 11 道工序,是专业团队跑通 AI 短剧时真正在做的事。
工序 1:创意准入——立项会没开完,不许开拍
传统剧组有立项会,AI 短剧也该有。区别在于,AI 时代的立项会可以被结构化:把一个想法拆成固定维度,系统给完整度打分,分数不够就补,分数够了才放行。
需要被问清的竖屏创作维度包括:
- 题材与风格基调
- 主角是谁、人物弧光是什么
- 核心矛盾
- 故事走向与结局方向
- 集数与单集时长(竖屏以 1–2 分钟为主,最长收敛到 3–4 分钟)
- 爽点与钩子节奏
- 投放平台与受众
创意准入的本质:不是模型「觉得我懂了」就算过,而是把模糊想法逼成可执行的 Brief。分数低于阈值时,系统应该强制走引导流程补全缺失维度,而不是直接让你写剧本。
工序 2:创意简报锁版——Brief 不锁,后面全是返工
准入通过后,产出的是一份创意简报(Creative Brief)。这是全剧的「宪法」,后面所有环节都不能违背它。
一份锁版的简报至少包含:
| 字段 | 作用 |
|---|---|
| 一句话故事(logline) | 全剧最高度浓缩的卖点 |
| 核心矛盾 | 驱动每集冲突的引擎 |
| 故事走向 | 防止剧情中途跑偏 |
| 结局方向 | 过半后强制收束的依据 |
| 爽点与钩子节奏 | 决定每集的情绪曲线 |
| 投放平台与受众 | 影响时长、节奏、尺度 |
| 分段分集梗概 | 剧本写作的骨架 |
| 给编剧的注意事项 | 风格、禁忌、特殊要求 |
| 主角人物弧光 | 防止主角写成工具人 |
简报必须锁版才能进下一阶段。锁版不是形式,是后面所有质检的对照基准。
工序 3:故事档案建档——不靠模型记性,靠结构化档案
故事档案(Continuity Bible)是一份贯穿全剧的结构化设定记录,包含人物身份、稳定性格特征、可变的当前状态(伤痕、身份变化等)、人物关系、每条伏线的开启与收束状态、按集出场表、分批剧情纪要、道具视觉描述。
它解决的是 AI 写作最臭名昭著的问题:上下文失忆。第 20 集忘了第 3 集埋的伏笔,第 50 集主角性格突变——这些不是模型「笨」,是你把记忆托付给了概率。
档案机制的关键做法:
- 写作时只给模型喂「档案切片」:本集会用到的人物状态、未结伏线、近批剧情摘要、本批主线
- 每批写完自动回填新的状态变化和伏线进展
- 续写前自动调取最新档案
不靠模型记性,靠结构化档案。
工序 4:分批剧本写作——先规划,再正文,再过质检
剧本不是一口气写完的。专业做法是分批写作,每批数集,一批写完、归档确认,再写下一批。
每一批内部的顺序是:
- 场戏清单(Beat Sheet)先行:先列本集每场发生什么、集末钩子是什么,再写正文
- 正文写作:遵守竖屏短剧的写作铁律
- 规则质检:机器自动卡常见问题
- 档案回填:把本批新状态写回故事档案
竖屏短剧的四条写作铁律
这四条是内嵌在专业流程里的硬约束,不是建议:
- 黄金 3 秒:第 1 场必须强冲突或强悬念,禁止平淡开场与长篇背景介绍
- 单集结构:开场钩子(1 场)→ 矛盾升级 → 集末 cliffhanger(最后 1 场)
- 爽点密度:每集至少 1 次小爽点(打脸 / 反转 / 身份暗示 / 证据到手);每 3–5 集 1 次大爽点
- 台词:短句为主,单句一般不超过 20 字;禁止论文腔与大段旁白解释
批前意图锁定
从第 2 批起,先问定四件事再动笔:本批剧情方向、重点人物、伏笔与冲突、集末钩子。这些被标记为「创作者已确认的硬约束」,与档案冲突时以创作意图为准——这保证了人对剧情走向的控制权。
规则质检器卡什么
写完自动过质检,卡住的典型问题包括:集标题错误、场景数不匹配、缺【人物】行、对白过少、「未完待续」等占位敷衍。不合格的带错误反馈自动重写,不把半成品交给人。
工序 5:选定画风——17 套手册,人物场景视频共用一条风格路径
剧本定稿后进入美术阶段。第一步是选画风。
专业流程会内置多套画风手册,覆盖 2D、3D、真人写实等方向,比如都市写实、古装写实、成熟都市言情动画、九十年代日漫、国风工笔、仙侠古风、3D 国漫、黏土定格、赛博国风等。每套手册至少包含:人物出图手册(面容锚点、材质、气质、视图一致性)、场景 / 道具手册、视频风格标签。
关键原则:选定画风后,人物立绘、场景立绘、道具立绘、视频提示词共用同一风格路径。避免「人物是日漫、视频变成写实」的断层——这是 AI 短剧最常见的视觉翻车之一。
工序 6:角色阵容与视觉确认——不齐不许进下一阶段
画风选定后,根据故事档案生成角色阵容。确认环节有硬门禁:
- 阵容齐全(剧本里有戏的角色都在)
- 姓名合法
- 视觉字段完整
- 主角与简报对齐
不过关不能进入下一阶段。这不是刁难,是为了避免拍到一半发现某个角色没定妆,临时凑图导致风格断裂。
工序 7:人物 / 场景 / 道具定妆出图——两段式工艺,立绘是资产
定妆不是「写段提示词让模型随便出张图」。专业做法是两段式:
- 文本润色:用所选画风的人物手册 + 性别硬规则,把档案里的文字描述润色成可出图的提示词(这一步人可以覆盖修改)
- 图像生成:拼最终提示词出图,支持参考图,落库为可回看的历史版本
场景与道具同理。场景图有一条铁律:空镜纪律——场景图严禁出现人物,否则后续拍摄时人物会「鬼影重重」。道具按集以拍戏视角提取剧本原始称呼,全剧合并成编目,不丢集。
视频侧只消费状态已完成且文件可读的立绘,不拿半成品去绑参考。
工序 8:本集切为约 10 秒场块——剪辑台上的 clip 列表
剧本不会被直接丢进视频模型。专业流程会先把每集切成视频场块,目标粒度约 10 秒 / 场,正文软上限约 200 字,超过就按动作节拍、空段、句号等规则再拆。
你看到的不是「第 3 集一个大视频」,而是「第 3 集 → 场 1、场 2、场 3……」,每场独立提示词、独立参考图、独立成片与历史 takes。
这一步的类比是剪辑台上的 clip 列表。为什么要切?因为:
- 10 秒左右是当前视频生成模型稳定性最好的长度
- 每场独立控制,崩了只重拍这一场,不用整集重来
- 多 take 择优有了操作单元
群演和泛指角色会从可绘制主演名单里剥离,避免挤占定妆槽位。
工序 9:每场绑定参考图 + 工程化镜头提示词——教模型用分镜表语言说话
这是 AI 短剧一致性的核心工序。
参考图映射
每场自动构建参考素材表,顺序固定:场景图 → 本场道具图 → 人物定妆图。有图才占槽位,无图标明「仅文字」,不强行编造绑定。
最高优先级约束:
有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。
这条直接针对 AI 视频的经典翻车:文字描述与参考图打架 → 换装、换脸。
此外还支持:手动角色绑定(剧本里叫「警官」,绑到档案里「李强」的定妆)、道具手动纳入 / 排除、在同类同名下替换为历史版本中的另一张图、穿越 / 闪回题材按场景关键词自动匹配现代 / 古代造型。
工程化镜头提示词
提示词不是写小说,是写分镜表。专业规范包含八大要素:
- 精准主体
- 动作细节
- 场景环境
- 光影色调
- 镜头运镜(一镜一运镜,禁止单镜内推拉摇移叠加)
- 视觉风格
- 画质
- 约束条件
复杂度分流:简单场景一段式;复杂影视化场景走三段论(总体设定 → 镜头 1/2/3… → 约束包)。用镜头序号,不用绝对秒数。强制兜底包:画质、面部稳定、无水印 Logo;多人场景加双胞胎 / 分身兜底。
符号规范:台词用 {}、音效用 <>、BGM 用 ()。
系统在教模型用分镜表语言说话,而不是写小说。
开拍前还有齐套校验:生成提示词前检查缺失的场景 / 人物 / 道具参考,弹出清单引导先去绘制。允许跳过走纯文字路径——但专业流程应该先定妆再开拍。
工序 10:多模态出片(默认竖屏)——队列、takes、可重拍
标准拍摄路径:打开某集视频工作台 → 确认参考图齐全(或有意跳过)→ 生成视频提示词 → 人工阅读并编辑 → 选模型档位 / 比例 / 分辨率 / 时长 → 提交出片 → 队列渲染 → 回看历史 takes 择优。
默认交付形态是 9:16 竖屏,不是事后裁切。输出规格:
| 项 | 规格 |
|---|---|
| 画幅 | 默认 9:16 竖屏(亦支持其它比例) |
| 时长 | 智能时长 或 固定 5–15 秒 |
| 模型档位 | 标准 / 高速 / 轻量 |
| 分辨率 | 按模型白名单(如 480p–4K) |
| 音频 | 默认可生成;水印默认关 |
出片时不重新发明提示词:用的是你已确认或已编辑的提示词 + 当时锁定的参考图映射。改了词再点生成,才是新的 take——和片场「改分镜说明再拍」一致。
生产级可靠性包括:成片做 faststart 处理、视频任务走独立队列与剧本 / 立绘任务隔离、同一场块进行中禁止并行提交、积分预扣与失败释放、僵死任务超时回收。这不是玩具脚本,是可运营的生产队列。
工序 11:审片 → 改词 / 换图 → 重拍择优——质量终审在人
最后一步也是最容易被误解的一步:没有成片自动打分或自动择优重拍引擎。质量终审在创作者和监制手里,系统提供的是多 take 与改词重拍的工具。
审片时你能做的调整:
| 可控点 | 相当于片场的什么 |
|---|---|
| 编辑视频提示词 | 导演改分镜说明 |
| 更换人物 / 场景 / 道具参考图 | 换定妆 / 换场景板 |
| 手动角色绑定 | 处理称呼不一致、客串指代 |
| 道具纳入 / 排除 | 控制本场视觉焦点 |
| 画风切换 | 统一美术语言 |
| 模型档位选择 | 质量 / 成本 / 速度权衡 |
| 同场历史 takes | 多 take 择优 |
诚实边界:这套流程做不到什么
主动划清边界,才能建立信任。以下是当前 AI 短剧生产流程的明确限制:
- 没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里。
- 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差,所以专业流程应该先定妆再开拍。
- 提示词里的参考代号靠规范引导,不做二次硬拼。 创作者审词时仍应确认参考代号齐全。
- 视频分镜语法以平台内置的镜头规范为准,画风只注入视频风格标签;完整美术手册用在立绘侧。
- 约 10 秒的场块是工程启发式,不是时间码精剪。 超长场会再拆,但仍可能出现偏长的块;精剪与串场成片需要后续剪辑环节。
- 当前不做跨场自动续写 / 延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」。
- 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。
人坐在哪里
整条流水线里,人的判断集中在几个关键节点:
- 创意准入阶段:决定故事讲什么、给谁看
- 简报锁版:签字确认全剧方向
- 每批剧本开写前:确认本批剧情意图
- 定妆阶段:选图、改图、确认视觉
- 提示词阶段:审词、改词
- 出片后:选 take、决定重拍还是过
机器负责的是:把人确认过的方向,不走样地落到每一集、每一场、每一镜。
把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
猫斯卡(Maosika)是一条 AI 竖屏短剧生产操作系统,把上述 11 道工序固化进了产品:从创意评估、简报锁版、故事档案、分批剧本,到画风定妆、场块切分、工程化镜头提示词、多模态出片与多 take 重拍,每一环都有可验收的中间产物,可看、可改、可回退。它不宣称一键出爆款,而是让一个人、一天,能跑完一部剧的工业流程。详见 https://www.maosika.com 。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com