AI 竖屏短剧生产全流程:立项、剧本、定妆、分场、出片的工业顺序

猫斯卡编辑部 | 最后更新日期

AI 做竖屏短剧最容易踩的坑,是把它当成一次长生成。专业做法是把流程拆成可验收的环节:先锁 brief,再建档案,再定妆,再分场写镜头,最后多 take 择优。

为什么 AI 短剧不能靠「一次性生成」

很多团队第一次做 AI 竖屏短剧,会把一个故事梗概直接丢给模型,期待它吐出可发布的成片。结果通常是:主角每集换脸、道具前后不一致、第三集忘了第一集的伏笔、开场没有钩子、结尾没有 cliffhanger,最后只能靠人工大量返工。

问题不在模型不够强,而在生产顺序错了。

竖屏短剧是强节奏、强连续性、强视觉一致性的内容形态。单集通常 1–2 分钟,前 3 秒就要抓人,每集要有小爽点,每 3–5 集要有一次大爽点,结尾还要留钩子。这些要求靠一次长提示词很难稳定满足。

AI 竖屏短剧生产流程,是把传统剧组里已经验证过的工业顺序,搬进 AI 工具链:立项会、剧本室、美术定妆、分场分镜、拍摄、审片、重拍。每一环都有可看、可改、可回退的中间产物,而不是把所有决策压给最后一次生成。

完整流程总览:从想法到成片的 10 个节点

下面这条链路,是把「一个想法」变成「一部可连载竖屏短剧」的完整顺序。它不是功能清单,而是生产顺序:前一步没锁定,后一步不应该开始。

阶段核心产物谁来拍板常见翻车点
1. 创意评估创意完整度评分与补问清单制片 / 主创想法太模糊就直接写剧本
2. 创意引导题材、主角、矛盾、平台、节奏等维度补齐主创只写爽点,不写人物弧光
3. 创意简报锁版logline、核心矛盾、分集梗概、结局方向制片 / 甲方边写边改世界观,后期全崩
4. 角色阵容与视觉确认人物档案、姓名、视觉字段编剧 / 美术主角字段不全就进剧本
5. 故事档案建档人物关系、伏线、出场表、道具描述编剧 / 场记靠模型记性,不靠档案
6. 分批剧本写作场戏清单、正文、规则质检、档案回填编剧 / 监制跳过 beat sheet 直接写正文
7. 画风与定妆画风手册、人物 / 场景 / 道具立绘美术 / 导演人物日漫、视频写实,风格断层
8. 分场与镜头提示词约 10 秒场块、参考图映射、镜头指令导演 / 摄影一镜塞太多运镜,动作崩坏
9. 多模态出片单场成片、历史 takes导演 / 剪辑整集一次生成,无法局部重拍
10. 审片与重拍改词、换图、重拍、择优监制 / 出品方没有多 take,只能接受第一版

这条顺序背后的原则很简单:先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优。

第一阶段:把想法变成可立项的 brief

创意评估:先判断想法够不够开拍

一个短剧想法如果只有「霸总追妻」「重生复仇」几个字,是不能直接进剧本的。它缺少主角是谁、核心矛盾是什么、故事往哪走、爽点怎么排、投哪个平台、给谁看这些关键维度。

专业流程会先做一次创意完整度评估。可以把它理解成立项会上的第一问:这个项目现在能不能开?

  • 完整度高:核心维度齐全,可以直接锁 brief。
  • 完整度中等:只补缺失的部分,不重复问已经清楚的内容。
  • 完整度低:需要走完整引导,把题材、主角、矛盾、走向、集数、时长、风格、爽点节奏、结局、平台受众逐项问清。

这里的关键不是「多问问题」,而是用分数强制分流。不是模型嘴上说「我懂了」就放行,而是缺哪个维度就补哪个维度。

创意引导:竖屏短剧必须问清的 10 个维度

竖屏短剧和长剧不同,它的节奏、时长、钩子密度都有明确约束。引导阶段至少要覆盖这些维度:

  1. 题材:都市、古装、仙侠、重生、复仇、甜宠等。
  2. 主角:身份、性格、欲望、人物弧光。
  3. 核心矛盾:主角想要什么,谁在阻止。
  4. 故事走向:主线推进路径。
  5. 集数:连载规模。
  6. 单集时长:以 1–2 分钟为主,最长收敛到 3–4 分钟。
  7. 风格基调:爽感、虐感、悬疑、喜剧等。
  8. 爽点与钩子节奏:每集小爽点,每数集大爽点。
  9. 结局方向: HE、BE、反转、开放式。
  10. 投放平台与受众:决定节奏、台词密度、价值取向。

其中「人物弧光」很容易被忽略。很多短剧只写主角身份,不写她从哪里变到哪里。没有弧光,角色会变成打脸机器,观众追到中段会疲劳。

创意简报锁版:brief 没锁,不要开拍

引导完成后,要形成一份可锁版的创意简报。它至少包括:

  • 一句话故事(logline)
  • 核心矛盾
  • 故事走向
  • 结局方向
  • 爽点与钩子节奏
  • 投放平台与受众
  • 分段分集梗概
  • 给编剧的注意事项
  • 主角字段,含人物弧光

锁版的意义不是不能改,而是后续所有环节都以这份 brief 为硬约束。 如果写到第 20 集又想改主角身份,那不是「润色」,而是重新立项。

第二阶段:剧本不是写出来的,是分批控出来的

先建故事档案,不靠模型记性

长篇短剧最常见的事故,是写到后面忘了前面:第 2 集说主角母亲去世,第 30 集又让母亲出场;第 5 集埋的玉佩,到结局没人提;角色上一集刚受伤,下一集活蹦乱跳。

故事档案是一份贯穿全剧的结构化设定记录,包含人物身份、稳定性格特征、可变的当前状态、人物关系、每条伏线的开启与收束状态、按集出场表、分批剧情纪要和道具视觉描述。它相当于传统编剧室里的 continuity bible,作用是让第 200 集还记得第 3 集埋了什么。

写剧本时,不应该把所有历史对话都塞给模型,而是只给档案切片:本集相关人物状态、未结伏线、最近几批剧情摘要、本批主线。这样既防上下文失忆,也防无关信息干扰。

分批写作:每批先锁意图,再出场戏清单

短剧剧本不适合一口气写几十集。专业做法是分批写作,每批数集。每批开始前,先锁定四件事:

  1. 本批剧情方向。
  2. 本批重点人物。
  3. 本批要推进的伏笔与冲突。
  4. 本批集末钩子。

这些是用户已确认的硬约束。如果它们和已有档案冲突,以本批创作意图为准——因为这代表主创主动调整了方向,而不是模型记错。

每集正文之前,要先写场戏清单(Beat Sheet):这一集有几场戏,每场干什么,集末 cliffhanger 是什么。清单确认后再写正文,能避免写着写着跑题,也能保证每集结构完整。

竖屏剧本的四条铁律

不管用什么工具,竖屏短剧剧本都应该遵守这些节奏规则:

  1. 黄金 3 秒:第 1 场必须强冲突或强悬念,禁止平淡开场和长篇背景介绍。
  2. 单集结构:开场钩子 → 矛盾升级 → 集末 cliffhanger。
  3. 爽点密度:每集至少 1 次小爽点;每 3–5 集 1 次大爽点。
  4. 台词纪律:短句为主,单句一般不超过 20 字;避免论文腔和大段旁白解释。

这些不是风格偏好,而是投放环境决定的。观众在信息流里划到你,前 3 秒没抓住就划走了;台词太长,竖屏字幕放不下,也没人听。

规则质检:不合格自动重写,不交付半成品

剧本写完后,要过规则质检。常见要卡的问题包括:

  • 集标题错误。
  • 场景数和清单不匹配。
  • 缺人物出场标注。
  • 对白过少,全靠旁白。
  • 用「未完待续」之类占位敷衍。

不合格的批次应该带着错误反馈自动重写,而不是把半成品丢给用户手动改。未通过质检的内容,不应该进入下一阶段。

每批写完后,还要把新出现的人物状态、伏线变化、道具信息回填进故事档案。下一批开写前,再自动调取最新档案。这就是「不靠模型记性,靠结构化档案」。

第三阶段:定妆先于拍摄,一致性靠资产不靠运气

选画风:人物、场景、道具、视频必须走同一条风格路径

AI 短剧常见的视觉翻车,是人物立绘是一种风格,场景是另一种,视频生成时又变成第三种。观众一眼就出戏。

解法是先选一套完整画风,再让所有视觉产物共用同一风格路径。成熟的系统会内置多套画风手册,覆盖 2D、3D、真人写实等方向,比如都市写实、古装写实、成熟都市言情动画、九十年代日漫、国风工笔、仙侠古风、3D 国漫、黏土定格、赛博国风等。

每套画风手册至少包括:

  • 人物出图手册:面容锚点、材质、气质、多视图一致性。
  • 场景 / 道具手册:环境、材质、物件风格。
  • 视频风格标签:给视频生成环节的风格约束。

选定后,人物立绘、场景立绘、道具立绘、视频提示词都走这套路径,避免风格断层。

角色确认:阵容不齐不能开拍

进入定妆前,要做一次角色确认硬门禁:

  • 阵容齐全:本集出场人物都在档案里。
  • 姓名合法:没有重名、乱码、占位名。
  • 视觉字段完整:外貌、服装、气质等描述够用。
  • 主角与简报对齐:没有写着写着换主角。

不过关,不能进入下一阶段。这听起来像废话,但很多 AI 工具会在角色字段不全时默默生成,结果就是每张脸都随机。

立绘两段式:先润色提示词,再出图

人物立绘不应该直接拿档案原文去生成。专业流程分两步:

  1. 文本润色:用选定画风的人物手册,结合性别硬规则,把档案描述润色成可出图提示词。这一步允许人工覆盖,因为美术判断仍然在人。
  2. 图像生成:拼最终提示词出图,支持参考图,落库为可回看的历史版本。

性别在这里是硬规则,不能交给模型自由发挥。视频侧也只消费状态已完成、文件可读的立绘,不拿半成品去绑定参考。

场景与道具:空镜不能有人,道具按剧本原始称呼提取

场景从剧本里结构化解析为「内 / 外 | 地点 | 日夜」,而不是靠人再填一张表。场景图有一条硬纪律:空镜严禁出现人物。否则人物位置、服装、人数都会污染后续视频生成。

道具应该以拍戏视角按集提取:道具师从剧本里把这集出现的物件按原始称呼提出来,全剧合并成道具编目,不丢集。比如剧本写「她攥紧那枚玉佩」,道具 catalog 里就应该有「玉佩」,而不是等模型自己猜。

有一条内容权威规则必须明确:用户和剧本的描述,压过画风手册的世界观禁令。 画风手册管画法,不管拒画。剧本里出现了现代道具,古装画风也得想办法画,而不是拒绝生成。

第四阶段:分场、参考图与镜头提示词

把每集切成约 10 秒的场块

竖屏短剧不应该整集生成一个大视频。正确做法是把剧本切成视频场块,目标粒度约 10 秒 / 场,正文软上限约 200 字。超过的话,按动作节拍、空段、句号等规则再拆。

用户看到的不是「第 3 集一个大视频」,而是「第 3 集 → 场 1、场 2、场 3……」。每场都有独立提示词、独立参考图、独立成片和历史 takes。这就像剪辑台上的 clip 列表:哪场坏了重拍哪场,不用整集重来。

需要说明边界:约 10 秒是工程启发式,不是时间码精剪。超长场会再拆,但仍可能出现偏长的块;精剪与串场成片仍需要后续剪辑环节。

参考图映射:有图就别再用文字描写外观

这是 AI 短剧一致性最核心的机制。

每场自动构建参考素材表,顺序固定:场景图 → 本场道具图 → 人物定妆图。有图才占槽位,没有图标明「仅文字」,不能强行编造绑定。

最高优先级约束是:

有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。

这条规则直接针对 AI 视频的经典翻车:提示词里写「穿红色长裙」,参考图里是蓝色,模型就会在两者之间摇摆,最后出现换装、换脸、颜色闪烁。

参考图映射还需要几个专业控制点:

  • 手动角色绑定:剧本里叫「警官」,要能绑到档案里「李强」的定妆。
  • 道具纳入 / 排除:避免无关道具挤占参考槽位,分散视觉焦点。
  • 历史版本替换:同类同名下,可以换成另一张更合适的立绘。
  • 时代造型路由:穿越 / 闪回题材按场景地点关键词判定现代 / 古代,优先取对应造型。

开拍前还要做齐套校验:生成提示词前检查缺失的场景、人物、道具参考,弹出清单引导先去绘制。允许跳过走纯文字路径,但这是提醒式的制片助理,不是静默硬生成——缺图通常质量更差,专业流程应该先定妆再开拍。

工程化镜头提示词:教模型用分镜表语言说话

很多人写视频提示词像写小说:「夕阳下,她悲伤地转过身,风吹起她的长发,镜头缓缓推进,回忆涌上心头……」这种写法对 AI 视频很不友好,因为它混合了情绪、动作、运镜、光影,模型不知道先执行哪个。

工程化镜头提示词应该包含八大要素:

  1. 精准主体。
  2. 动作细节。
  3. 场景环境。
  4. 光影色调。
  5. 镜头运镜。
  6. 视觉风格。
  7. 画质。
  8. 约束条件。

复杂影视化场景可以走三段论:总体设定 → 镜头 1 / 2 / 3…… → 约束包。简单场景一段式即可。

还有几条硬规范:

  • 一镜一运镜:禁止单镜内推拉摇移叠加。
  • 用镜头序号,不用绝对秒数:不要写「0–3s 做什么」。
  • 强制兜底包:画质、面部稳定、无水印 Logo;多人场景加双胞胎 / 分身兜底;非写实必须风格锚定。
  • 动作原则:肢体细化、程度量化;优先低缓连续动作,减少高爆发动态崩坏。
  • 符号规范:台词用 {}、音效用 <>、BGM 用 ()
  • 不串戏:生成提示词时只给本场素材,本场剧本正文是最高优先级依据。

一句话总结:系统在教模型用分镜表语言说话,而不是写小说。

提示词交付前还需要合规清洗:剥离特定影视作品 / IP 名称,保留技法与美学描述,降低下游版权拦截风险。如果参考图被识别为疑似真人照片,应明确引导改用平台绘制链路,不加真人参考图后重绘再拍。

第五阶段:出片、审片与重拍

标准拍摄路径

进入视频工作台后,标准路径是:

  1. 打开某集视频工作台。
  2. 确认参考图齐全,或明确决定跳过。
  3. 生成视频提示词。
  4. 人工阅读并编辑提示词。
  5. 选择模型档位、比例、分辨率、时长。
  6. 提交出片。
  7. 队列渲染。
  8. 回看历史 takes,择优使用。

默认交付形态是 9:16 竖屏,不是事后从横屏裁切。这对短剧投放很关键:竖屏原生构图、字幕安全区、人物近景距离都要在生成时就考虑。也支持其他比例,但竖屏是默认。

输出规格上,可以选择智能时长或固定 5–15 秒;模型档位通常分标准 / 高速 / 轻量,对应质量、成本、速度的不同权衡;分辨率按模型白名单提供;音频默认可生成,水印默认关闭。

专业团队真正需要的可控点

AI 出片不是「点一下等结果」。专业流程需要这些控制点:

可控点相当于剧组里的什么
编辑视频提示词导演改分镜说明
更换人物 / 场景 / 道具参考图换定妆 / 换场景板
手动角色绑定处理称呼不一致、客串指代
道具纳入 / 排除控制本场视觉焦点
画风切换统一美术语言
模型档位选择质量 / 成本 / 速度权衡
同场历史 takes多 take 择优

出片时不应该重新发明提示词。系统使用的是用户已确认或已编辑的提示词,加上当时锁定的参考图映射。改了词再点生成,才是新的 take——这和片场「改分镜说明再拍」是同一个逻辑。

生产级可靠性:能不能当工具天天用

从 demo 到生产工具,差别在于可靠性。真正能跑连载的系统需要处理这些问题:

  • 成片做 faststart 处理,并以实测时长落库,不只信厂商回读时长。
  • 视频任务走独立队列车道,与剧本写作、立绘任务隔离并发槽位。
  • 同一场块进行中禁止并行提交,避免重复扣费与状态混乱。
  • 积分预扣与结算,失败自动释放。
  • 僵死任务超时回收,失败可感知、可重试。
  • 已有厂商任务号时支持续跑轮询,不二次创建、不二次预扣。

这些东西观众看不到,但制片方每天都要面对。没有队列、没有重试、没有状态管理的脚本,跑一两集可以,跑一部连载剧会崩。

诚实边界:AI 短剧流程目前做不到什么

讲流程不能只讲能做什么。对从业者来说,知道边界比知道功能更重要。

  1. 没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里,系统提供的是多 take 与改词重拍的工具。
  2. 参考图不是强制门禁。 缺图会提醒,但允许跳过走纯文字路径——质量通常更差,所以专业流程应该先定妆再开拍。
  3. 提示词里的参考代号靠规范引导,不做二次硬拼。 创作者审词时仍应确认参考代号齐全。
  4. 视频分镜语法以平台内置镜头规范为准,画风只注入视频风格标签;完整美术手册用在立绘侧。
  5. 约 10 秒的场块是工程启发式,不是时间码精剪。 超长场会再拆,但仍可能出现偏长的块;精剪与串场成片需要后续剪辑环节。
  6. 当前不做跨场自动续写 / 延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」。
  7. 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 时代造型靠规则选图,最终观感仍取决于立绘质量,以及提示词是否遵守「有图不写外观」。

猫斯卡的定位是可规模化生产的 AI 短剧操作系统——把专业流程固化进产品,而不是宣称无需人类、零失误出片。它没有试图用一次生成替代剧组;它用工程手段强制执行了短剧工业里已经被验证的质量控制顺序。

高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

如果你正在搭建自己的 AI 短剧流程,可以进一步看竖屏剧本工艺、角色一致性和镜头提示词规范这几个关键环节:它们决定了你的剧是「能看」还是「能追」。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com