写视频提示词,为什么要把「0–3秒」改成「镜头1」

猫斯卡编辑部 | 最后更新日期

提示词里写「0–3 秒推镜、4–6 秒切特写」,模型通常不会照表执行。更稳的做法是用「镜头 1 / 镜头 2」组织画面,把时间交给剪辑,把指令交给分镜。

时间码为什么在提示词里失灵

很多人第一次写 AI 视频提示词,会本能地写成一份时间表:

  • 0–2 秒:全景,女主走进办公室
  • 2–4 秒:推到中景,她看到桌上的离婚协议
  • 4–6 秒:特写,手指颤抖

这种写法看起来精确,实际上把两个系统混在了一起:剪辑时间线生成指令。剪辑软件认时间码,视频生成模型更认画面描述与镜头序列。你写「第 3 秒切特写」,模型未必理解这是一个硬切点;它可能把「推镜、特写、颤抖」揉进同一个连续镜头里,结果就是运镜糊、表情飘、节奏全靠运气。

镜头序号是一种分镜语言,不是时间标注。 它告诉模型:这里有几个独立镜头,每个镜头的主体、动作、景别和运镜分别是什么。至于每个镜头最终成片是 1.8 秒还是 2.4 秒,交给后期在时间线上裁。

镜头序号 vs 时间码:差别在哪

写法模型理解常见结果
0–3 秒推镜,3–5 秒特写一段连续描述里的时间修饰运镜叠加、切点不执行、画面拖沓
镜头 1:全景缓推;镜头 2:面部特写两个独立镜头单元意图更清晰,后期可按素材二次裁切
第 1 秒、第 4 秒分别做动作模糊的时间节拍动作提前或延后,关键帧错位
镜头 1 动作 A;镜头 2 动作 B分镜式任务拆分更适合多 take 重试与局部改词

核心区别在于:时间码是后期语言,镜头序号是拍摄语言。 写提示词时,你是在给「摄影师 + 分镜师」下指令,不是在给剪辑师拉时间线。

怎么把一段时间码改写成镜头序号

假设原提示词是:

0–2 秒,夜晚街头,男主撑伞走过,镜头跟随;2–4 秒,他停下,抬头看霓虹灯;4–6 秒,特写雨水顺着脸颊流下,眼神冰冷。

可以改成三段:

  1. 镜头 1|全景跟随:夜晚雨后街头,男主撑伞缓慢走过积水路面,镜头与人物平行移动,霓虹在水面反光。
  2. 镜头 2|中景停驻:男主脚步停住,缓缓抬头看向街边霓虹灯牌,肩膀微紧,呼吸克制。
  3. 镜头 3|面部特写:雨水顺着他的脸颊滑下,眼神冰冷不动,背景霓虹虚化闪烁。

这样写有三个好处:

  • 每个镜头只承担一个主要动作,模型更容易稳定生成;
  • 某个镜头失败时,可以只改那一段,不必整段重跑;
  • 后期拿到素材后,按实际表演节奏决定镜头 1 留 2 秒还是 3 秒。

一镜一运镜:别让镜头「又推又摇又环绕」

镜头序号还能强制一个重要纪律:一镜一运镜。

单镜内同时写「推近、环绕、轻微手持晃动」,模型很容易生成晕眩、漂移或主体变形的画面。更稳的写法是每个镜头只选一种主动运镜:

  • 镜头 1:缓推
  • 镜头 2:固定机位
  • 镜头 3:横移
  • 镜头 4:轻微手持跟随

如果确实需要复杂调度,把它拆成多个镜头,而不是在一个镜头里叠加多种运动。短剧的观看场景是手机竖屏,运镜越复杂,人物面部和服装越容易崩。

动作也要可执行,而不是写情绪形容词

镜头序号解决结构问题,动作细节解决画面问题。不要只写「他很愤怒」「她非常震惊」,要把情绪翻译成肢体:

情绪写法更可执行的动作写法
他很愤怒他攥紧拳头,指节发白,下颌紧绷,停顿半拍后转身
她很震惊她后退半步,瞳孔放大,手中文件滑落
气氛紧张两人对视不语,其中一人手指轻敲桌面,节奏越来越慢
他很难过他低头闭眼,深吸一口气,再抬头时眼眶泛红

动作原则是:肢体细化,程度量化,优先低缓连续动作。 高爆发的大幅度动作,例如突然转身、激烈打斗、快速奔跑,更容易出现肢体扭曲和穿帮。竖屏短剧里,克制的微表情往往比大动作更有冲击力。

复杂场景用三段论,不要堆成一段

如果一场戏只有一个人和一个简单动作,可以一段式写完。但如果是多人对话、情绪转折或强戏剧场面,建议用三段论:

  1. 总体设定:交代场景、时间、光线、色调、人物位置和视觉风格。
  2. 镜头序列:按「镜头 1 / 镜头 2 / 镜头 3」分别写主体、动作、景别、运镜。
  3. 约束包:统一补充画质、面部稳定、无水印、无多余肢体、风格一致等要求。

示例结构:

总体设定:现代医院走廊,冷白灯光,地面有轻微反光,气氛压抑。

镜头 1:长走廊全景,女主独自快步走来,脚步声在空走廊里回响。

镜头 2:中景,她在手术室门口停下,抬头看红灯。

镜头 3:特写,她的手缓缓握住背包带,指节泛白。

约束包:竖屏 9:16,面部稳定,肢体自然,无水印 Logo,多人或近似人物场景避免双胞胎与分身。

这种结构的价值在于:模型先知道「这是哪场戏」,再知道「每个镜头拍什么」,最后收到「不能出什么错」。它比把所有信息揉成一大段更稳定。

台词、音效、BGM 要分开标记

镜头里如果有声音元素,不要混在画面描述里。可以用清晰符号区分:

  • 台词用 {}{你终于来了。}
  • 音效用 <><脚步声由远及近>
  • BGM 用 ()(低沉弦乐渐起)

例如:

镜头 2:男主站在门口,低声说 {我们谈谈。},门外传来 <雷声>(压抑的低频音乐持续)

这样做不是为了炫技,而是避免模型把「雷声」「音乐」当成视觉元素去生成,也方便后期分离处理。

别串戏:每个镜头只吃本场素材

写系列短剧时,另一个高频问题是提示词把前后几场戏的信息混在一起。镜头 1 还在办公室,镜头 3 突然提到上一集的雨夜回忆,但本场没有对应的人物造型和道具参考,模型就会自由发挥。

稳定做法是:

  • 每个镜头只描述本场可见的人物、场景、道具;
  • 有参考图的人物,不再用文字重复描写服装和外貌;
  • 文字只补充动作、表情、伤情、光影和运镜;
  • 闪回或穿越场景单独处理造型与环境,不要和当前场次混写。

一句话:一致性靠资产,不靠运气。 定妆图、场景图、道具图先就位,提示词再去调度它们。

什么时候镜头序号也救不了

镜头序号不是万能药。它解决的是指令结构问题,不解决素材缺失问题。

以下情况仍会翻车:

  • 没有人物定妆图,却要求每个镜头长得一样;
  • 同一场塞了太多角色,模型分不清谁是谁;
  • 动作设计过于剧烈,超过当前视频模型的稳定范围;
  • 提示词同时要求多种画风、多个光源方向和复杂运镜;
  • 把 30 秒剧情压进一个镜头,期待模型自己剪辑。

如果一场戏正文很长,应该先拆成约 10 秒的场块,再在场块内写镜头序号。它是工程启发式,不是时间码精剪;最终串片仍需要剪辑环节把控节奏。

一个可直接套用的提示词骨架

``` 总体设定: 场次、时间、地点、光线、色调、人物位置、视觉风格。

镜头 1|景别 + 运镜: 主体是谁,在做什么,动作细节,表情或伤情,场景里有什么关键道具。

镜头 2|景别 + 运镜: 主体动作如何变化,镜头如何观察,台词 / 音效 / BGM 如有则标注。

镜头 3|景别 + 运镜: 收在哪个动作或表情上,为下一场留下什么悬念。

约束包: 竖屏 9:16;画质清晰;面部稳定;肢体自然;无水印 Logo; 有参考图的人物以参考图为准,文字不重复描写服装外观; 多人场景避免双胞胎、分身和多余手指;风格保持统一。 ```

把「第几秒」从提示词里删掉,不是放弃节奏,而是把节奏放回它该在的地方:拍摄时分镜清楚,剪辑时再决定长短。

常见问题

AI 视频提示词里为什么不要写 0 到 3 秒?

因为视频生成模型通常不像剪辑软件那样精确执行时间码。写「0–3 秒」容易被理解成模糊修饰,导致切点不执行、运镜叠加。用「镜头 1、镜头 2」描述独立画面,更符合分镜逻辑,也方便后期按素材实际节奏裁切。

镜头序号和时间码可以一起写吗?

不建议把时间码作为硬指令写进生成提示词。可以在脚本或剪辑备注里记录预期时长,但提示词主体应使用镜头序号。每个镜头最终生成多长,往往需要后期在时间线上精修。

一个镜头里可以同时写推镜和环绕吗?

不建议。更稳的纪律是一镜一运镜:一个镜头只选推、拉、摇、移、固定等一种主要运动。复杂调度应拆成多个镜头,否则容易出现画面漂移、主体变形或晕眩感。

提示词里的台词和音效怎么标注?

可以把台词、音效、BGM 分开标注,例如台词用花括号、音效用尖括号、BGM 用圆括号。这样能减少模型把声音元素误当成视觉内容,也方便后期处理。

用了镜头序号是不是就不会换脸或穿帮?

不是。镜头序号解决的是指令结构问题,角色一致性还要依赖定妆图、场景图、道具图等参考资产。有参考图的人物不应再用文字重复描写服装外观,文字应主要写动作、表情和伤情。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com