什么是场块?为什么 AI 短剧按约 10 秒切而不是整集生成

猫斯卡编辑部 | 最后更新日期

场块是把一集竖屏短剧按动作节拍切成约 10 秒一段的独立拍摄单元,每段绑定自己的参考图、提示词与成片。不整集生成,是因为整集生成意味着整集失控——你没法只重拍坏的那 10 秒。

场块是什么

场块(Scene Block)是 AI 竖屏短剧生产流程里,把一集剧本按叙事动作节拍切分成的、独立可拍摄的视频单元,目标粒度约 10 秒。每个场块拥有自己独立的参考图映射、镜头提示词、成片版本与历史 takes,相当于剪辑台上的一条 clip。

它不是时间码精剪,而是工程启发式切分:系统从结构化剧本里按动作节拍、空段、句号等信号拆段,正文软上限约 200 字,超长会再拆。用户看到的不是「第 3 集一个大视频」,而是「第 3 集 → 场 1、场 2、场 3……」。

一场块里包含什么

组成作用
本场剧本正文最高优先级的拍摄依据
参考图映射表按「场景图 → 道具图 → 人物定妆图」顺序占位,有图才占槽位
镜头提示词按八大要素(主体、动作、环境、光影、运镜、风格、画质、约束)生成
模型档位与参数标准 / 高速 / 轻量,分辨率、时长、画幅
历史 takes同场多版成片,供择优或对比

为什么不整集生成

整集生成看起来省事,实际是把所有风险打包进一次黑箱调用。竖屏短剧单集通常 1–2 分钟,整集生成会同时踩中三个坑。

1. 一致性崩盘

一段 60–90 秒的视频里,主角要换好几个景、换好几个动作、和好几个对手对戏。模型在长生成里会逐步「重新想象」人物外观——这就是换脸、换装、道具失忆的根源。切成约 10 秒的块,每块只绑定本场的定妆参考图,并且遵守一条硬规则:有参考图的人物,禁止再用文字描写服装外观;文字只写动作、表情、伤情。 人物长相由资产锁死,不靠模型记忆。

2. 错一处要重来

整集生成只要第 40 秒人物崩了、或者道具穿帮,你只能整条重跑——时间、算力、预算全部重付。场块机制下,坏的是场 5,就只重拍场 5;前面几场的好 take 保留。这和真人剧组「这一条没过,再来一条」是同一个逻辑,只不过重来的粒度从整场缩小到了 10 秒。

3. 镜头语言没法控

整集生成的提示词里,你很难在不同时间段表达不同的运镜——写「先推再摇再拉」,模型通常会糊成一团乱晃。场块机制强制一镜一运镜,禁止单镜内叠加推拉摇移;用镜头序号而不是绝对秒数来组织。系统在教模型用分镜表语言说话,而不是写小说。

场块切分的具体规则

切分不是按字数硬砍,而是按叙事节拍拆:

  1. 目标粒度约 10 秒,对应正文软上限约 200 字。
  2. 超过软上限时,按动作节拍、空段、句号等自然断点再拆。
  3. 群演和泛指角色(如「路人」「服务员」)从可绘制主演名单里剥离,避免挤占定妆槽位。
  4. 用户可以对整集重新切分,不满意自动结果就手动调整。

切完之后,每场独立走「绑定参考图 → 生成提示词 → 人工审词 → 选档位 → 出片 → 回看 takes」的完整链路。

场块和提示词、参考图的配合

场块不是孤立存在的,它是把美术资产和镜头语言落到每一帧的那个「挂钩点」。

  • 参考图只给本场:提示词生成时只消费本场的场景、道具、人物素材,禁止串戏——场 3 的提示词里不会出现场 7 才出场的道具。
  • 时代造型自动路由:穿越或闪回题材,系统按场景地点关键词判定现代 / 古代,取人物定妆图时优先匹配对应造型。
  • 手动可控:剧本里叫「警官」的角色,可以手动绑到档案里「李强」的定妆;无关道具可以手动排除,避免挤占参考槽位;同类同名下可以替换为历史版本里的另一张图。

诚实边界:场块做不到什么

场块是工程启发式,不是银弹,有几件事它明确不做:

  • 不是时间码精剪。约 10 秒是目标,不是硬指标,超长场会再拆,但仍可能出现偏长的块;精剪与串场成片需要后续剪辑环节。
  • 不做跨场自动续写 / 延长。产品单元是「单场多模态参考 → 单段成片」,当前没有把多场自动连成一整段长镜头的工作流。
  • 不自动择优。系统提供同场多 take,但没有成片自动打分引擎,质量终审在创作者和监制手里。
  • 不强制要图。缺参考图会提醒,但允许跳过走纯文字路径——通常质量更差,所以专业流程应该先定妆再开拍。

一句话总结

高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的。场块就是那个可控单元:约 10 秒、独立参考、独立提示词、独立成片、独立重拍。把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com