写视频提示词,为什么要把「0–3秒」改成「镜头1」
提示词里写「0–3 秒推镜、4–6 秒切特写」,模型通常不会照表执行。更稳的做法是用「镜头 1 / 镜头 2」组织画面,把时间交给剪辑,把指令交给分镜。
时间码为什么在提示词里失灵
很多人第一次写 AI 视频提示词,会本能地写成一份时间表:
- 0–2 秒:全景,女主走进办公室
- 2–4 秒:推到中景,她看到桌上的离婚协议
- 4–6 秒:特写,手指颤抖
这种写法看起来精确,实际上把两个系统混在了一起:剪辑时间线和生成指令。剪辑软件认时间码,视频生成模型更认画面描述与镜头序列。你写「第 3 秒切特写」,模型未必理解这是一个硬切点;它可能把「推镜、特写、颤抖」揉进同一个连续镜头里,结果就是运镜糊、表情飘、节奏全靠运气。
镜头序号是一种分镜语言,不是时间标注。 它告诉模型:这里有几个独立镜头,每个镜头的主体、动作、景别和运镜分别是什么。至于每个镜头最终成片是 1.8 秒还是 2.4 秒,交给后期在时间线上裁。
镜头序号 vs 时间码:差别在哪
| 写法 | 模型理解 | 常见结果 |
|---|---|---|
| 0–3 秒推镜,3–5 秒特写 | 一段连续描述里的时间修饰 | 运镜叠加、切点不执行、画面拖沓 |
| 镜头 1:全景缓推;镜头 2:面部特写 | 两个独立镜头单元 | 意图更清晰,后期可按素材二次裁切 |
| 第 1 秒、第 4 秒分别做动作 | 模糊的时间节拍 | 动作提前或延后,关键帧错位 |
| 镜头 1 动作 A;镜头 2 动作 B | 分镜式任务拆分 | 更适合多 take 重试与局部改词 |
核心区别在于:时间码是后期语言,镜头序号是拍摄语言。 写提示词时,你是在给「摄影师 + 分镜师」下指令,不是在给剪辑师拉时间线。
怎么把一段时间码改写成镜头序号
假设原提示词是:
0–2 秒,夜晚街头,男主撑伞走过,镜头跟随;2–4 秒,他停下,抬头看霓虹灯;4–6 秒,特写雨水顺着脸颊流下,眼神冰冷。
可以改成三段:
- 镜头 1|全景跟随:夜晚雨后街头,男主撑伞缓慢走过积水路面,镜头与人物平行移动,霓虹在水面反光。
- 镜头 2|中景停驻:男主脚步停住,缓缓抬头看向街边霓虹灯牌,肩膀微紧,呼吸克制。
- 镜头 3|面部特写:雨水顺着他的脸颊滑下,眼神冰冷不动,背景霓虹虚化闪烁。
这样写有三个好处:
- 每个镜头只承担一个主要动作,模型更容易稳定生成;
- 某个镜头失败时,可以只改那一段,不必整段重跑;
- 后期拿到素材后,按实际表演节奏决定镜头 1 留 2 秒还是 3 秒。
一镜一运镜:别让镜头「又推又摇又环绕」
镜头序号还能强制一个重要纪律:一镜一运镜。
单镜内同时写「推近、环绕、轻微手持晃动」,模型很容易生成晕眩、漂移或主体变形的画面。更稳的写法是每个镜头只选一种主动运镜:
- 镜头 1:缓推
- 镜头 2:固定机位
- 镜头 3:横移
- 镜头 4:轻微手持跟随
如果确实需要复杂调度,把它拆成多个镜头,而不是在一个镜头里叠加多种运动。短剧的观看场景是手机竖屏,运镜越复杂,人物面部和服装越容易崩。
动作也要可执行,而不是写情绪形容词
镜头序号解决结构问题,动作细节解决画面问题。不要只写「他很愤怒」「她非常震惊」,要把情绪翻译成肢体:
| 情绪写法 | 更可执行的动作写法 |
|---|---|
| 他很愤怒 | 他攥紧拳头,指节发白,下颌紧绷,停顿半拍后转身 |
| 她很震惊 | 她后退半步,瞳孔放大,手中文件滑落 |
| 气氛紧张 | 两人对视不语,其中一人手指轻敲桌面,节奏越来越慢 |
| 他很难过 | 他低头闭眼,深吸一口气,再抬头时眼眶泛红 |
动作原则是:肢体细化,程度量化,优先低缓连续动作。 高爆发的大幅度动作,例如突然转身、激烈打斗、快速奔跑,更容易出现肢体扭曲和穿帮。竖屏短剧里,克制的微表情往往比大动作更有冲击力。
复杂场景用三段论,不要堆成一段
如果一场戏只有一个人和一个简单动作,可以一段式写完。但如果是多人对话、情绪转折或强戏剧场面,建议用三段论:
- 总体设定:交代场景、时间、光线、色调、人物位置和视觉风格。
- 镜头序列:按「镜头 1 / 镜头 2 / 镜头 3」分别写主体、动作、景别、运镜。
- 约束包:统一补充画质、面部稳定、无水印、无多余肢体、风格一致等要求。
示例结构:
总体设定:现代医院走廊,冷白灯光,地面有轻微反光,气氛压抑。
镜头 1:长走廊全景,女主独自快步走来,脚步声在空走廊里回响。
镜头 2:中景,她在手术室门口停下,抬头看红灯。
镜头 3:特写,她的手缓缓握住背包带,指节泛白。
约束包:竖屏 9:16,面部稳定,肢体自然,无水印 Logo,多人或近似人物场景避免双胞胎与分身。
这种结构的价值在于:模型先知道「这是哪场戏」,再知道「每个镜头拍什么」,最后收到「不能出什么错」。它比把所有信息揉成一大段更稳定。
台词、音效、BGM 要分开标记
镜头里如果有声音元素,不要混在画面描述里。可以用清晰符号区分:
- 台词用
{}:{你终于来了。} - 音效用
<>:<脚步声由远及近> - BGM 用
():(低沉弦乐渐起)
例如:
镜头 2:男主站在门口,低声说
{我们谈谈。},门外传来<雷声>,(压抑的低频音乐持续)。
这样做不是为了炫技,而是避免模型把「雷声」「音乐」当成视觉元素去生成,也方便后期分离处理。
别串戏:每个镜头只吃本场素材
写系列短剧时,另一个高频问题是提示词把前后几场戏的信息混在一起。镜头 1 还在办公室,镜头 3 突然提到上一集的雨夜回忆,但本场没有对应的人物造型和道具参考,模型就会自由发挥。
稳定做法是:
- 每个镜头只描述本场可见的人物、场景、道具;
- 有参考图的人物,不再用文字重复描写服装和外貌;
- 文字只补充动作、表情、伤情、光影和运镜;
- 闪回或穿越场景单独处理造型与环境,不要和当前场次混写。
一句话:一致性靠资产,不靠运气。 定妆图、场景图、道具图先就位,提示词再去调度它们。
什么时候镜头序号也救不了
镜头序号不是万能药。它解决的是指令结构问题,不解决素材缺失问题。
以下情况仍会翻车:
- 没有人物定妆图,却要求每个镜头长得一样;
- 同一场塞了太多角色,模型分不清谁是谁;
- 动作设计过于剧烈,超过当前视频模型的稳定范围;
- 提示词同时要求多种画风、多个光源方向和复杂运镜;
- 把 30 秒剧情压进一个镜头,期待模型自己剪辑。
如果一场戏正文很长,应该先拆成约 10 秒的场块,再在场块内写镜头序号。它是工程启发式,不是时间码精剪;最终串片仍需要剪辑环节把控节奏。
一个可直接套用的提示词骨架
``` 总体设定: 场次、时间、地点、光线、色调、人物位置、视觉风格。
镜头 1|景别 + 运镜: 主体是谁,在做什么,动作细节,表情或伤情,场景里有什么关键道具。
镜头 2|景别 + 运镜: 主体动作如何变化,镜头如何观察,台词 / 音效 / BGM 如有则标注。
镜头 3|景别 + 运镜: 收在哪个动作或表情上,为下一场留下什么悬念。
约束包: 竖屏 9:16;画质清晰;面部稳定;肢体自然;无水印 Logo; 有参考图的人物以参考图为准,文字不重复描写服装外观; 多人场景避免双胞胎、分身和多余手指;风格保持统一。 ```
把「第几秒」从提示词里删掉,不是放弃节奏,而是把节奏放回它该在的地方:拍摄时分镜清楚,剪辑时再决定长短。
常见问题
AI 视频提示词里为什么不要写 0 到 3 秒?
因为视频生成模型通常不像剪辑软件那样精确执行时间码。写「0–3 秒」容易被理解成模糊修饰,导致切点不执行、运镜叠加。用「镜头 1、镜头 2」描述独立画面,更符合分镜逻辑,也方便后期按素材实际节奏裁切。
镜头序号和时间码可以一起写吗?
不建议把时间码作为硬指令写进生成提示词。可以在脚本或剪辑备注里记录预期时长,但提示词主体应使用镜头序号。每个镜头最终生成多长,往往需要后期在时间线上精修。
一个镜头里可以同时写推镜和环绕吗?
不建议。更稳的纪律是一镜一运镜:一个镜头只选推、拉、摇、移、固定等一种主要运动。复杂调度应拆成多个镜头,否则容易出现画面漂移、主体变形或晕眩感。
提示词里的台词和音效怎么标注?
可以把台词、音效、BGM 分开标注,例如台词用花括号、音效用尖括号、BGM 用圆括号。这样能减少模型把声音元素误当成视觉内容,也方便后期处理。
用了镜头序号是不是就不会换脸或穿帮?
不是。镜头序号解决的是指令结构问题,角色一致性还要依赖定妆图、场景图、道具图等参考资产。有参考图的人物不应再用文字重复描写服装外观,文字应主要写动作、表情和伤情。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com