AI 竖屏短剧全流程拆解:立项、剧本、定妆、分场、出片的 11 个验收点
AI 做短剧最怕的不是慢,而是顺序错:还没锁 Brief 就写剧本,还没定妆就出片,最后换脸、串戏、道具失忆一起爆。正确做法是把流程拆成一串可验收的中间产物,每一步过了再往下走。
为什么多数 AI 短剧不是「做不出来」,而是「做不下去」
很多团队第一次用 AI 做竖屏短剧,卡点不在模型,而在流程:创意还没说清就开始写,人物还没定妆就开拍,剧本是一整坨长文本直接喂给视频,出了问题不知道该改词、换图还是重拍。
工业化生产的核心不是「一次生成」,而是每一环都有可看、可改、可回退的中间产物。下面这 11 个节点,就是把一部 AI 竖屏短剧从想法推到成片的完整验收链。
故事档案是一份贯穿全剧的结构化设定记录,包含人物身份、当前状态、人物关系、每条伏线的开启与收束状态、按集出场表和分批剧情纪要。它相当于传统编剧室里的 continuity bible,作用是让第 200 集还记得第 3 集埋了什么。
节点 1:创意准入——先打分,再决定引导多深
不是每个想法都需要走完整的十步引导。一个成熟的立项材料,和一句「我想做个霸总复仇」需要的补全深度完全不同。
合理的做法是对创意做 0–100 的完整度评分,按分数分流:
- 80 分以上:核心维度齐全,可跳过大部分引导,直接进入简报锁版
- 40–79 分:只补缺失的维度,不重复问已经说清的事
- 40 分以下:走完整引导,把题材、主角、矛盾、走向、集数、时长、风格、爽点节奏、结局、平台受众全部问透
这个分数是系统硬约束,不是模型嘴上说「够了」就放行。类比传统剧组,就是立项会开完、Brief 锁版,才允许进编剧室。
节点 2:创意简报锁版——没签字的东西不算数
引导结束后产出一份锁版的创意简报,固化这些字段:
| 字段 | 说明 |
|---|---|
| 一句话故事(logline) | 用一句话讲清谁、在什么处境下、要完成什么 |
| 核心矛盾 | 推动全剧的根本冲突,不是单集小打小闹 |
| 故事走向 | 主线的大方向,避免中途跑偏 |
| 结局方向 | 悲剧 / 喜剧 / 开放式,先定调再写 |
| 爽点与钩子节奏 | 打脸、反转、身份揭晓的排布密度 |
| 投放平台与受众 | 决定时长、节奏、台词尺度 |
| 分段分集梗概 | 把全剧拆成可执行的段落 |
| 给编剧的注意事项 | 红线、偏好、必须避开的雷区 |
| 主角人物弧光 | 开场状态 → 终局状态的变化弧线 |
简报没锁版,不允许进入下一阶段。这一步看似慢,实则省掉后面 80% 的返工。
节点 3:角色阵容与视觉确认
在写正文之前,先把「谁在这部剧里」定下来。角色确认要过四道硬门禁:
- 阵容齐全:主角、主要配角、关键反派都在名单里
- 姓名合法:没有重名、没有占位名(如「某女」「霸总」)
- 视觉字段完整:年龄、气质、外形关键词齐备
- 主角与简报对齐:角色设定不能和锁版简报冲突
不过关就不能往下走。这一步的产出是一份可被后续所有环节引用的角色表,而不是散落在提示词里的形容词。
节点 4:故事档案建档——不靠记性,靠结构
建档是 AI 短剧和传统 AI 写作最大的区别。模型的上下文是会「忘」的,但结构化档案不会。
档案里至少要记录:
- 人物身份与稳定性格特征
- 可变的当前状态(伤痕、身份变化、情绪阶段)
- 人物关系图
- 每条伏线的 open / resolved 状态
- 按集出场表
- 每批剧情纪要
- 道具视觉描述
写作时模型只吃「档案切片」:本集会出场的人物状态、未结的伏线、近批剧情摘要、本批主线。既防上下文失忆,也防无关信息污染。每批写完自动回填,续写前自动调取——不靠模型记性,靠结构化档案。
节点 5:分批剧本写作——先规划,再正文
竖屏短剧的剧本不是一口气写完一百集,而是分批写作,每批数集。每一批内部有严格的顺序:
- 场戏清单(Beat Sheet)先行:每场一句话讲清动作节拍,最后一场明确 cliffhanger
- 再写正文:按清单展开,不允许边想边写导致节奏失控
- 规则质检:写完过质检器
- 档案回填:合格后把本批新增的人物状态、伏线、道具写回档案
从第 2 批起,先问定四件事再动笔:本批剧情方向、重点人物、伏笔与冲突、集末钩子。这些被标记为「已确认的硬约束」,即使和旧档案冲突,也以最新创作意图为准——这就是「批前意图锁定」。
竖屏剧本的四条写作铁律
这四条是内嵌在写作规则里的,不是建议:
- 黄金 3 秒:第 1 场必须强冲突或强悬念,禁止平淡开场和长篇背景介绍
- 单集结构:开场钩子(1 场)→ 矛盾升级 → 集末 cliffhanger(最后 1 场)
- 爽点密度:每集至少 1 次小爽点;每 3–5 集 1 次大爽点
- 台词:短句为主,单句一般不超过 20 字;禁止论文腔与大段旁白解释
质检器卡什么
写完自动过规则质检,卡住这些常见敷衍:
- 集标题错误
- 场景数与清单不匹配
- 缺【人物】行
- 对白过少、全是旁白
- 出现「未完待续」之类占位文字
不合格带错误反馈自动重写,最多 6 次;未通过质检的半成品不会交付。
节点 6:选定画风——17 套手册,一套管到底
剧本定稿后选画风。内置 17 套画风手册,覆盖 2D、3D、真人写实等方向(都市写实、古装写实、成熟都市言情动画、九十年代日漫、国风工笔、仙侠古风、3D 国漫、黏土定格、赛博国风等)。
每套手册至少包含三部分:
| 组成 | 作用 |
|---|---|
| 人物出图手册 | 面容锚点、材质、气质、多视图一致性 |
| 场景 / 道具手册 | 环境与物件的视觉语言 |
| 视频风格标签 | 喂给视频生成的风格锚点 |
关键是:选定画风后,人物立绘、场景立绘、道具立绘、视频提示词共用同一条风格路径。这直接避免了「人物是日漫、视频变成写实」的经典断层。
节点 7:人物 / 场景 / 道具定妆出图
定妆是两段式工艺:
- 文本润色:用选定画风的人物手册 + 性别硬规则,把档案里的文字描述润成可出图的提示词(这一步人工可覆盖)
- 图像生成:拼最终提示词出图,支持参考图,落库为可回看的历史版本
三条纪律必须守住:
- 空镜纪律:场景图严禁出现人物
- 性别硬规则:出图时性别不随模型发挥
- 视频侧只消费状态已完成且文件可读的立绘,不拿半成品去绑参考
道具按集以「道具师」视角提取剧本里的原始称呼,全剧合并成 catalog,不丢集。
节点 8:本集切为约 10 秒场块
剧本不是一整集扔给视频模型,而是自动切成视频场块,目标粒度约 10 秒 / 场,正文软上限约 200 字;超过就按动作节拍、空段、句号再拆。
用户看到的不是「第 3 集一个大视频」,而是「第 3 集 → 场 1、场 2、场 3……」——每场独立提示词、独立参考图、独立成片与历史 takes。这相当于剪辑台上的 clip 列表。
群演和泛指角色从可绘制主演名单里剥离,避免挤占定妆槽位。切得不满意可以整集重新切分。
约 10 秒的场块是工程启发式,不是时间码精剪。超长场会再拆,但仍可能出现偏长的块;精剪与串场成片需要后续剪辑环节。
节点 9:每场绑定参考图 + 工程化镜头提示词
这是 AI 短剧一致性最核心的一步。每场自动构建参考素材表,顺序固定:
场景图 → 本场道具图 → 人物定妆图
有图才占槽位,无图标明「仅文字」,不强行编造绑定。
最高优先级约束
有参考图的人物,禁止再用文字描写服装 / 外观;以参考图为准,文字只写动作、表情、伤情。
这条规则直接针对 AI 视频的经典翻车:文字描述和参考图打架 → 换装、换脸。
此外支持:
- 手动角色绑定:剧本里叫「警官」,绑到档案里「李强」的定妆
- 道具纳入 / 排除:避免无关道具挤占参考槽位
- 替换历史版本图:在同类同名下换另一张定妆
- 时代造型路由:穿越 / 闪回按场景关键词判定现代 / 古代,优先取对应造型
镜头提示词的八大要素
生成的提示词不是小说描写,而是工程化的分镜语言,包含八大要素:
- 精准主体
- 动作细节
- 场景环境
- 光影色调
- 镜头运镜
- 视觉风格
- 画质
- 约束条件
配套规范:
- 简单场景一段式;复杂影视化场景走三段论(总体设定 → 镜头 1/2/3… → 约束包)
- 一镜一运镜,禁止单镜内推拉摇移叠加
- 用镜头序号,不用绝对秒数(禁止写「0–3s」)
- 强制兜底包:画质、面部稳定、无水印 Logo;多人场景加双胞胎 / 分身兜底
- 动作优先低缓连续,减少高爆发动态崩坏
- 符号规范:台词
{}、音效<>、BGM() - 只给本场素材,禁止串戏;本场剧本正文是最高优先级依据
一句话:系统在教模型用分镜表语言说话,而不是写小说。
开拍前还要做齐套校验:缺场景 / 人物 / 道具参考时弹出清单,引导先去绘制。允许跳过走纯文字路径——但这是提醒式的制片助理,不是静默硬生成。
节点 10:多模态出片(默认竖屏)
标准拍摄路径:
- 打开某集视频工作台
- 确认参考图齐全(或有意跳过)
- 生成视频提示词
- 人工阅读并编辑
- 选模型档位(标准 / 高速 / 轻量)、比例、分辨率、时长
- 提交出片,队列渲染
- 回看历史 takes 择优
输出规格默认是 9:16 竖屏,不是事后裁切——这是默认交付形态。时长支持智能时长或固定 5–15 秒,分辨率按模型档位白名单(480p–4K),音频默认可生成,水印默认关。
出片时不重新发明提示词:用的是你已确认或已编辑的提示词 + 当时锁定的参考图映射。改了词再点生成,才是新的 take——和片场「改分镜说明再拍」是一个逻辑。
你能控制的专业节点
| 可控点 | 相当于片场的什么 |
|---|---|
| 编辑视频提示词 | 导演改分镜说明 |
| 更换人物 / 场景 / 道具参考图 | 换定妆 / 换场景板 |
| 手动角色绑定 | 处理称呼不一致、客串指代 |
| 道具纳入 / 排除 | 控制本场视觉焦点 |
| 画风切换 | 统一美术语言 |
| 模型档位选择 | 质量 / 成本 / 速度权衡 |
| 同场历史 takes | 多 take 择优 |
生产级可靠性
- 成片做 faststart 处理,以实测时长落库
- 视频任务走独立队列车道,与剧本、立绘任务隔离并发槽位
- 同一场块进行中禁止并行提交,避免重复扣费与状态混乱
- 积分预扣与结算,失败自动释放
- 僵死任务超时回收,失败可感知、可重试
这不是玩具脚本,是可运营的生产队列。
节点 11:审片 → 改词 / 换图 → 重拍择优
最后一环是审片和迭代。这里要讲清楚一个边界:
没有成片自动打分或自动择优重拍引擎。 质量终审在创作者和监制手里,系统提供的是多 take 与改词重拍的工具。
审片发现问题时,按问题类型决定改哪里:
- 人物脸 / 服装不对 → 换定妆图,或检查提示词是否又写了外观描写
- 场景不对 → 换场景参考图,或调整环境描述
- 动作崩坏 → 简化动作、降低动态幅度,重写本场动作细节
- 节奏不对 → 回到剧本调整场块切分,而不是在视频侧硬救
- 风格漂移 → 检查画风手册是否被覆盖,或在提示词里加强风格锚定
高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的。
七个必须承认的边界
诚实划边界不是减分项,是建立信任的唯一方式:
- 没有成片自动打分或自动择优重拍引擎,质量终审在人
- 参考图不是强制门禁,缺图会提醒但允许跳过——质量通常更差,专业流程应该先定妆再开拍
- 提示词里的参考代号靠规范引导,不做二次硬拼,创作者审词时仍应确认代号齐全
- 视频分镜语法以平台内置的镜头规范为准,画风只注入视频风格标签;完整美术手册用在立绘侧
- 约 10 秒的场块是工程启发式,不是时间码精剪,精剪与串场成片需要后续剪辑环节
- 当前不做跨场自动续写 / 延长视频的产品化工作流,产品单元是「单场多模态参考 → 单段成片」
- 角色一致性依赖定妆资产链路,不是人脸嵌入校验;时代造型靠规则选图,最终观感仍取决于立绘质量和提示词是否遵守「有图不写外观」
猫斯卡没有试图用一次生成替代剧组;它用工程手段强制执行了短剧工业里已经被验证的质量控制顺序——先故事与连续性,再定妆,再分场,再镜头指令,再多 take 择优。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
如果你正在评估一条能规模化跑起来的 AI 短剧生产线,可以看看猫斯卡(https://www.maosika.com)是怎么把这 11 个验收点固化进产品的——它的定位是 AI 竖屏短剧生产操作系统,不是单个文生视频按钮。
常见问题
AI 做一部竖屏短剧,应该先写剧本还是先定人物画风?
正确顺序是:创意准入 → 简报锁版 → 角色阵容确认 → 故事档案建档 → 分批剧本 → 选定画风 → 定妆出图 → 分场 → 镜头提示词 → 出片。剧本和人物档案先于画风和定妆,定妆先于拍摄。跳过任何一步都会在后面返工。
为什么 AI 生成的短剧总是换脸、衣服变来变去?
根本原因是每场戏都在「重新想象」这个人长什么样。解法是先出定妆图,拍摄时把定妆图作为参考绑定到每场,并且在提示词里禁止再用文字描写有参考图人物的服装和外观——文字只写动作、表情、伤情。
竖屏短剧的剧本和长视频剧本有什么不一样?
竖屏短剧有四条硬规则:第 1 场必须强冲突或强悬念(黄金 3 秒);单集结构是开场钩子 → 矛盾升级 → 集末 cliffhanger;每集至少 1 次小爽点,每 3–5 集 1 次大爽点;台词短句为主,单句一般不超过 20 字,禁止论文腔和大段旁白。
AI 短剧一集应该切多长的场块?
目标粒度是约 10 秒 / 场,正文软上限约 200 字,超过会按动作节拍再拆。这是工程启发式,不是时间码精剪;偏长的块仍可能出现,精剪和串场成片需要后续剪辑环节。
用 AI 拍短剧能不能完全不用人管?
不能。系统能把重复、易漂移、易失控的部分变成可约束流水线,但质量终审、审美判断、改词换图的决策、多 take 择优都在人这边。没有任何工具能自动判断「这条好不好」,也不应该有。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com