AI 竖屏短剧全流程拆解:立项、剧本、定妆、分场、出片的工业顺序

猫斯卡编辑部 | 最后更新日期

AI 短剧做不下去,通常不是模型不行,而是顺序错了:没锁 brief 就写剧本,没定妆就出视频,没分场就堆长提示词。专业流程的关键是每一步都有可验收的中间产物,能改、能回退。

先把顺序定对:AI 短剧不是一次生成,是一条生产链

很多团队第一次做 AI 竖屏短剧,会把它理解成「给模型一句话,等它吐成片」。结果往往是:前几集人物长得不一样,中间剧情失忆,道具每场换样,最后只能靠人工硬剪救场。

AI 竖屏短剧的生产链,本质是把传统剧组的关键工序重排成一条可约束的流水线。 人在关键节点做判断,机器负责把已经确认的方向稳定地落到每一集、每一场。

完整链路可以拆成六段:

  1. 创意评估与引导:判断想法是否完整,缺什么补什么。
  2. 创意简报锁版:把 logline、核心矛盾、结局方向、爽点节奏写成可执行 brief。
  3. 角色阵容与故事档案:先定人物弧光、关系、伏线,再开始写正文。
  4. 分批剧本写作:先出每场戏的 beat sheet,再写台词,写完过规则质检。
  5. 定妆与资产准备:人物、场景、道具分别出图,形成可复用的视觉资产。
  6. 分场出片与重拍:每集切成约 10 秒场块,每场绑定参考图和镜头提示词,多 take 择优。

高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的。

第一段:创意准入——别让「半个想法」直接进剧本

短剧立项最常见的坑,是一句话听起来很炸,但落到剧本时缺主角动机、缺矛盾升级路径、缺集末钩子。写到第 5 集开始跑偏,再回头改,成本已经很高。

工业化做法是先给创意做一次完整度评估。可以把它理解成一个 0–100 分的立项会评分:

分数段意味着什么应该怎么做
≥80题材、主角、矛盾、走向、受众都清楚直接锁 brief,进入剧本阶段
40–79有核心卖点,但缺关键维度只补缺失项,不重走全流程
<40只有情绪或梗,没有戏剧骨架走完整引导,把十个维度问清楚

竖屏短剧在引导阶段至少要问清十件事:题材、主角、核心矛盾、故事走向、集数、单集时长、风格基调、爽点与钩子节奏、结局方向、投放平台与受众。单集时长通常以 1–2 分钟为主,最长收敛到 3–4 分钟

这一步的目标不是「让 AI 替你想创意」,而是逼创作者把模糊的想法变成可执行的 brief。brief 不锁版,后面所有环节都会漂移。

第二段:创意简报锁版——开拍前的「合同」

创意简报(Creative Brief)是整个项目的硬约束。它不是写给老板看的 PPT,而是写给后续每一道工序的执行说明。

一份能直接进生产的简报,至少要包含这些字段:

  • 一句话故事(logline):谁,在什么处境下,要解决什么矛盾,代价是什么。
  • 核心矛盾:主角想要什么,谁或什么在阻止他。
  • 故事走向与结局方向:甜宠 / 逆袭 / 复仇 / 悬疑反转,结局是 HE、BE 还是开放式。
  • 爽点与钩子节奏:每集小爽点的类型,每 3–5 集的大爽点位置。
  • 投放平台与受众:决定节奏密度、台词尺度、开场强度。
  • 分段分集梗概:不是完整剧本,是每集的戏剧功能。
  • 给编剧的注意事项:不能碰的设定、必须保留的名场面。
  • 主角人物弧光:开场是什么人,结尾变成什么人,中间靠什么事件推动。

主角字段必须包含人物弧光。 没有弧光的主角,写到中后期会变成「事件搬运工」:剧情在发生,但人没有变化,观众追不下去。

第三段:故事档案——不靠模型记性,靠结构化档案

长篇短剧最大的敌人是「失忆」:第 30 集忘了第 5 集埋的伏线,第 50 集把配角名字写错,主角的伤突然好了又突然出现。

故事档案是一份贯穿全剧的结构化设定记录,相当于传统编剧室里的 continuity bible。它记录:

  • 人物身份与稳定性格特征
  • 可变的当前状态:伤痕、身份变化、情绪阶段
  • 人物关系图谱
  • 每条伏线的 open / resolved 状态
  • 按集出场表
  • 每批剧情纪要
  • 道具视觉描述

写剧本时,不要把「全剧所有内容」一次性塞给模型,而是只给当前批次需要的档案切片:本批涉及的人物状态、未结伏线、近几集摘要、本批主线。这样既防上下文失忆,也防无关信息干扰。

每批写完,档案要自动回填;续写前,再自动调取最新状态。这就是「不靠记性,靠账本」。

第四段:分批剧本——先规划场戏,再写台词

竖屏短剧的剧本不是散文,是高度结构化的产品。单集的节奏错了,后面镜头再精美也救不回来。

竖屏剧本的四条铁律

  1. 黄金 3 秒:第 1 场必须是强冲突或强悬念,禁止平淡开场和长篇背景介绍。
  2. 单集结构:开场钩子(1 场)→ 矛盾升级 → 集末 cliffhanger(最后 1 场)。
  3. 爽点密度:每集至少 1 次小爽点(打脸 / 反转 / 身份暗示 / 证据到手);每 3–5 集 1 次大爽点。
  4. 台词纪律:短句为主,单句一般不超过 20 字;禁止论文腔和大段旁白解释。

「先场戏清单,后正文」的工艺

每一集不要直接写正文,而是先出 场戏清单(Beat Sheet):这一集有几场,每场的戏剧功能是什么,集末钩子是什么。清单确认后,再展开成对白和动作。

长剧要分批写,每批数集。从第 2 批开始,先锁定四件事再动笔:

  • 本批剧情方向
  • 重点人物
  • 伏笔与冲突
  • 集末钩子

这些被标记为「创作者已确认的硬约束」,如果和已有档案冲突,以最新创作意图为准——这就是「人在关键节点拍板」的体现。

规则质检:不合格的半成品不要交付

剧本写完不能直接用,要过规则质检器,卡住这些典型问题:

  • 集标题错误
  • 场景数和清单不匹配
  • 缺人物标注行
  • 对白过少,全是旁白
  • 用「未完待续」之类占位敷衍

不合格的剧本带错误反馈自动重写;多次不过的,需要人工介入调整设定,而不是硬交。

第五段:定妆与视觉资产——一致性靠资产,不靠运气

AI 视频里「角色换脸」「服装每场变」「场景风格漂移」的根本原因,是模型每次都在重新想象这个人、这个地方长什么样。

解法不是「写更长的提示词」,而是先建立可复用的视觉资产,再让拍摄环节只引用资产

先选画风,再出所有图

画风不是「随便挑个滤镜」,而是一套完整的视觉手册。成熟系统通常内置多套画风手册,覆盖 2D、3D、真人写实等方向,每套至少包含:

  • 人物出图手册:面容锚点、材质、气质、多视图一致性
  • 场景 / 道具手册
  • 视频风格标签

选定画风后,人物立绘、场景立绘、道具立绘、视频提示词要共用同一条风格路径,避免「人物是日漫、视频变成写实」的断层。

两段式立绘工艺

  1. 文本润色:用画风手册 + 性别硬规则,把档案里的人物描述润成可出图的提示词,创作者可以人工覆盖。
  2. 图像生成:拼最终提示词出图,支持参考图,落库为可回看的历史版本。

角色确认是硬门禁:阵容齐全、姓名合法、视觉字段完整、主角和简报对齐,才能进入下一阶段。

场景与道具的纪律

  • 场次从剧本里结构化解析为「内 / 外 | 地点 | 日夜」,不靠手填表格。
  • 场景图严禁出现人物——空镜就是空镜,否则后续绑参考时会串戏。
  • 道具按集提取,用拍戏视角按剧本原始称呼整理,全剧合并成目录,不丢集。

第六段:分场出片——把每集切成约 10 秒的可控单元

这是 AI 短剧和传统长视频生成思路差别最大的地方。不要让模型一次生成「第 3 集」,而是把每集切成多个视频场块,目标粒度约 10 秒 / 场,正文软上限约 200 字,超过就按动作节拍再拆。

创作者看到的不是一个大文件,而是「第 3 集 → 场 1、场 2、场 3……」,每场都有独立的提示词、参考图、成片和历史 takes。这就像剪辑台上的 clip 列表。

参考图映射:解决换脸的核心机制

每场自动构建一张参考素材表,顺序固定:场景图 → 本场道具图 → 人物定妆图。有图才占槽位,无图标明「仅文字」,不强行编造绑定。

这里有一条必须执行的硬规则:

有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。

文字描述和参考图打架,是 AI 视频「换装、换脸」的头号原因。参考图已经决定了这个人长什么样、穿什么,文字再写一遍「红色连衣裙、长发」,模型就会在两套指令之间摇摆。

开拍前还要做齐套校验:缺哪些场景 / 人物 / 道具参考,先弹出清单。允许跳过走纯文字路径,但通常质量会更差——专业流程应该先定妆再开拍。

工程化镜头提示词:教模型用分镜表语言说话

镜头提示词不是写小说,是写给「虚拟剧组」的分镜说明。成熟的规范至少包含八大要素:

要素说明
精准主体谁在画面里,是哪个人物
动作细节具体在做什么,动作幅度多大
场景环境在哪里,内 / 外,日夜
光影色调光源方向、色温、氛围
镜头运镜推 / 拉 / 摇 / 移 / 固定,一镜一运镜
视觉风格沿用选定画风的标签
画质清晰度、面部稳定等兜底项
约束条件不要出现什么,如无水印、无分身

几个关键纪律:

  • 一镜一运镜:禁止一个镜头里同时推拉摇移叠加。
  • 用镜头序号,不用绝对秒数:写「镜头 1 / 镜头 2」,不写「0–3 秒」。
  • 复杂场景走三段论:总体设定 → 分镜 1/2/3 → 约束包。
  • 台词、音效、BGM 用符号区分:台词 {}、音效 <>、BGM ()
  • 只给本场素材:禁止把别场的人物、道具串进来。

一句话:系统在教模型用分镜表语言说话,而不是写小说。

多 take 择优:改词再拍,和片场一样

标准拍摄路径是:

  1. 打开某集视频工作台
  2. 确认参考图齐全(或有意跳过)
  3. 生成视频提示词
  4. 人工阅读并编辑提示词
  5. 选模型档位、比例、分辨率、时长
  6. 提交出片,队列渲染
  7. 回看历史 takes,择优或改词重拍

默认交付是 9:16 竖屏,不是事后横裁竖;时长支持智能时长或固定 5–15 秒;音频默认可生成。

创作者能控制的关键节点,和真实剧组一一对应:

可控点相当于片场的什么
编辑视频提示词导演改分镜说明
更换人物 / 场景 / 道具参考图换定妆 / 换场景板
手动角色绑定处理称呼不一致、客串指代
道具纳入 / 排除控制本场视觉焦点
画风切换统一美术语言
模型档位选择质量 / 成本 / 速度权衡
同场历史 takes多 take 择优

出片时不会偷偷重写提示词。改了词再点生成,才是新的 take——和片场「改分镜再拍」是一个逻辑。

生产级可靠性:能不能当工具用,看这些细节

从「能出片」到「能批量生产」,中间差的是队列和状态管理。专业团队要关注这些:

  • 成片做 faststart 处理,以实测时长落库,不只信厂商回传。
  • 视频任务走独立队列,和剧本、立绘任务隔离并发槽位。
  • 同一场块进行中禁止并行提交,避免重复扣费和状态混乱。
  • 积分预扣与结算,失败自动释放。
  • 僵死任务超时回收,失败可感知、可重试。

这不是玩具脚本,是可运营的生产队列。

诚实边界:这些事,当前流程做不到

讲清楚不做什么,和讲清楚能做什么同样重要。

  1. 没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里,系统提供多 take 与改词重拍的工具。
  2. 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差。
  3. 提示词里的参考代号靠规范引导,不做二次硬拼。 创作者审词时仍应确认参考代号齐全。
  4. 约 10 秒的场块是工程启发式,不是时间码精剪。 超长场会再拆,但仍可能偏长,精剪与串场需要后续剪辑环节。
  5. 当前不做跨场自动续写 / 延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」。
  6. 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。

猫斯卡的定位是可规模化生产的 AI 短剧操作系统——把专业流程固化进产品,而不是宣称无需人类、零失误出片。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

如果你正在搭自己的 AI 短剧生产线,可以先从「锁 brief → 建档案 → 先定妆 → 再分场」这四个动作开始。顺序一对,后面的效率问题才有解。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com