AI 短剧提示词里,时间该怎么写才不崩

猫斯卡编辑部 | 最后更新日期

提示词里的时间不该写成秒数,而该写成镜头序号。模型不是剪辑台,它不会按时间码精确执行;它更擅长理解「镜头 1 做什么、镜头 2 做什么」这种分镜表语言。

为什么「0–3 秒」在提示词里不好用

很多人第一次写视频提示词,会本能地模仿剪辑软件:

  • 0–2 秒:人物推门进来
  • 2–4 秒:人物抬头
  • 4–6 秒:镜头推近到眼睛

这在人类剪辑师眼里很清楚,但对生成模型来说,秒数更像一种模糊愿望,而不是可执行指令。它不知道第 2.1 秒该停在哪,也不知道「推门」和「抬头」之间是否需要剪辑点。结果通常是:动作挤在一起、运镜互相叠加、节奏忽快忽慢。

更麻烦的是,秒数会诱导写作者在一个镜头里塞太多事。一个 6 秒镜头里写三组动作加一次推镜,模型只能把它们揉成一团,而不是按你想象的时间线切开。

镜头序号是给模型看的「剪辑点」

把「0–3 秒」改成「镜头 1」,本质上是在提示词里人为插入剪辑点。

``text 总体设定:雨夜便利店门口,霓虹灯反射在湿地上。 镜头 1:中景,店员站在柜台后,听到玻璃门响动,抬眼。 镜头 2:近景,门被推开,风铃晃动,一个撑黑伞的人站在门外。 镜头 3:特写,店员的手慢慢按住柜台下的警棍。 约束包:竖屏 9:16,面部稳定,无水印,无 Logo。 ``

这种写法的好处是:

  1. 每个镜头只承担一个主要动作,模型不用猜优先级。
  2. 镜头之间天然是切换关系,不是强行在一条连续镜头里完成所有事。
  3. 运镜可以一镜一分配,镜头 1 固定、镜头 2 缓推、镜头 3 手持,不会叠成「推拉摇移同时发生」。
  4. 出问题时更容易定位,是镜头 2 崩了,就改镜头 2,不用重写整段时间码。

一镜一运镜:别让镜头自己打架

AI 视频最常见的崩坏之一,是提示词写了「镜头缓缓推进,同时环绕人物,再拉远揭示环境」。人类摄影师做不到,模型也做不到,最后只会产出一种说不清的漂移感。

镜头序号写法强迫你做选择:

写法问题改法
镜头 1:推进并环绕两种运镜叠加,画面易飘镜头 1:缓推;镜头 2:环绕
镜头 1:0–3 秒转身,3–5 秒说话秒数切割不被稳定执行镜头 1:转身;镜头 2:开口说话
镜头 1:全景到特写景别跳变容易糊镜头 1:全景;镜头 2:切特写

一个镜头只给一个运镜指令,是把生成模型当成掌机,而不是当成剪辑师加摄影师加特效师。

复杂场景用三段论,简单场景别硬拆

不是所有提示词都要写成长长的分镜表。场块约 10 秒时,可以按复杂度分流:

  • 简单场景:一段式写清主体、动作、场景、光影、运镜、风格和约束即可。
  • 复杂影视化场景:用「总体设定 → 镜头 1/2/3 → 约束包」的三段论。

如果一场戏只是「角色沉默地看着窗外」,硬拆三个镜头反而增加变量。如果一场戏有进门、对视、摔东西三个节拍,拆成镜头序号就比堆在一段话里稳定得多。

台词、音效、BGM 也要挂在镜头下

镜头序号不只是画面指令的容器,也能帮你把声音元素放对位置。写的时候可以用清晰符号区分:

  • 台词用 {}
  • 音效用 <>
  • BGM 用 ()

```text 镜头 1:中景,女人坐在梳妆台前,慢慢摘下耳环。 {你终于还是回来了。} <门外脚步声停住>

镜头 2:特写,镜中女人的嘴角微微上扬。 (低频弦乐压住) ```

这样做不是为了格式好看,而是让每句声音都有归属。模型至少知道这句台词发生在哪个画面单元里,而不是把整段旁白随机铺在 10 秒内。

写镜头序号时的几个硬规矩

  1. 不要写「0–3s」「第 3 秒」这类绝对时间。 用镜头 1、镜头 2、镜头 3。
  2. 不要在一个镜头里叠加多个运镜。 一镜一运镜,要变化就切镜头。
  3. 每个镜头只写一个主要动作或一个表情变化。 动作越细碎,越容易崩。
  4. 先写总体设定,再写镜头,再写约束包。 不要把画质要求散落在每个镜头里。
  5. 约束包放在最后统一兜底。 例如画质、面部稳定、无水印、多人场景避免分身等。
  6. 本场剧本正文才是最高依据。 不要为了凑镜头数,发明剧本里没有的动作。

什么时候镜头序号也救不了

镜头序号能解决节奏和运镜混乱,但它不是万能药。

如果人物没有定妆参考图,镜头切得再漂亮也可能换脸;如果场景和道具参考缺失,镜头 1 是便利店,镜头 2 可能变成仓库;如果提示词同时描写人物服装和参考图,模型会在两套外观之间打架。

所以更稳的流程是:先锁定人物、场景、道具参考图,再按镜头写动作;有参考图的人物,不要再用文字重复描写服装和外观,文字只写动作、表情、伤情。

说到底,系统在教模型用分镜表语言说话,而不是写小说。镜头序号就是那张分镜表上最基础的一列。

常见问题

为什么 AI 视频提示词不建议写秒数?

因为生成模型不会像剪辑软件那样精确执行时间码。写 0–3 秒、3–5 秒容易让动作和运镜挤在同一条镜头里,节奏不稳定。用镜头 1、镜头 2 可以明确插入剪辑点,让每个镜头承担独立动作。

镜头序号应该怎么写?

复杂场景建议用三段论:先写总体设定,再写镜头 1、镜头 2、镜头 3 的主体、动作、景别和运镜,最后写统一约束包。简单场景不必硬拆,一段式写清楚即可。

一个镜头里可以同时写推进和环绕吗?

不建议。一镜一运镜更稳定。如果既想推进又想环绕,最好拆成两个镜头,让镜头 1 缓推、镜头 2 环绕,避免画面漂移或动作崩坏。

用了镜头序号还会换脸吗?

会。镜头序号解决的是节奏、动作和运镜问题,不直接解决角色一致性。防换脸还需要先定妆、绑定人物参考图,并避免在提示词里重复描写有参考图人物的服装和外观。

每个 10 秒场块都要拆很多镜头吗?

不需要。约 10 秒是工程启发式的场块粒度,不是必须塞满多个镜头。简单动作可以一镜完成,复杂节拍再按镜头拆分,关键是每个镜头只承担一个主要动作或运镜。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com