AI 影视镜头提示词规范:八大要素与三段式写法

猫斯卡编辑部 | 最后更新日期

AI 影视镜头提示词的核心,是用分镜表语言跟模型说话,而不是写小说。把主体、动作、场景、光影、运镜、风格、画质、约束八件事写齐,再按三段式组织,出片稳定性会有量级差异。

为什么你的提示词出片总崩

很多人写 AI 视频提示词,习惯堆形容词:「氛围感拉满、电影质感、高级光影、情绪张力」。这些词对模型来说几乎是噪音——它不知道镜头里是谁、在做什么、机位在哪、光从哪来、动到什么程度。结果就是脸漂、手怪、动作跳、镜头乱晃、风格漂移。

问题不在模型,在指令语言。剧组里摄影师不会跟掌机说「拍得电影一点」,他会说:中近景、女主侧脸、窗边侧逆光、缓慢推近到眼部、情绪从隐忍到落泪、镜头不要摇。AI 也是一样。

镜头提示词是一份给模型的分镜说明,不是一段文学描写。

八大要素:一条合格提示词的骨架

不管场景简单还是复杂,一条能稳定出片的镜头提示词,都应该覆盖以下八个要素。缺任何一项,模型就会用自己的想象去补,而它的想象往往和你想的不一样。

序号要素要回答的问题反面写法正面写法
1精准主体镜头里是谁、几个、什么状态「一个女人」「穿白衬衫的年轻女性,短发,眼眶微红,侧身坐在窗边」
2动作细节具体在做什么、动到什么程度「情绪激动」「右手缓慢攥紧衣角,指节发白,肩膀微微颤抖」
3场景环境在哪、什么时间、周围有什么「室内」「老式居民楼卧室,夜晚,窗外霓虹透进来,床头有半杯水」
4光影色调光从哪来、色温、反差「电影感光影」「单侧冷蓝光从窗户打入,面部半明半暗,高反差,阴影偏蓝」
5镜头运镜景别、机位、运动方式、速度「镜头有感觉」「中近景,机位略低,缓慢推近至面部特写,全程不摇不移」
6视觉风格画风、年代感、材质倾向「高级感」「九十年代港片质感,胶片颗粒,偏暖黄绿,写实」
7画质清晰度、面部、细节要求「高清」「4K 画质,面部清晰稳定,皮肤纹理自然,无畸变」
8约束条件不要出现什么、兜底要求(不写)「无水印无 Logo,不出现多余人物,手部动作自然,不切换场景」

这八项里,前五项决定「拍什么」,后三项决定「怎么拍、别出什么错」。写的时候不必拘泥顺序,但必须件件有交代。

三段式写法:复杂场景的组织方式

简单场景(一个人、一个动作、一个固定机位)一段写完就够。但一旦涉及多人、多动作节拍、镜头内调度,一段式就会乱——模型会把所有信息糊在一起,导致动作抢戏、运镜打架。

复杂场景推荐三段式结构

第一段:总体设定

交代场景、时间、光影、风格、画质基线。这一段是整场的「世界观」,只写一次。

老式居民楼卧室,夜晚。窗外霓虹冷蓝光从右侧打入,面部半明半暗,高反差。九十年代港片胶片质感,颗粒明显,偏暖黄绿调色。4K,面部清晰稳定,无水印无 Logo。

第二段:镜头分点

按镜头序号写,每个镜头只写一个主体动作 + 一个运镜。一镜一运镜,禁止在同一个镜头里又推又拉又摇。

用「镜头 1 / 镜头 2」编号,不要写「0–3 秒」「3–6 秒」这种绝对秒数——不同模型对秒数的理解差异极大,用镜头序号更稳。

镜头 1:中近景,女主侧身坐在床边,右手缓慢攥紧衣角,指节发白。机位固定,不运动。

镜头 2:缓慢推近至女主面部特写,她眼眶泛红,一滴泪从左眼滑落,嘴唇轻颤。推镜速度极缓,全程不摇。

镜头 3:切到床头那杯水的特写,水面因远处震动微微泛起涟漪。机位固定。

第三段:约束包

集中写兜底规则和禁止项,不要散落在各段里。

全程不出现第二个人物,不切换房间,女主服装保持白衬衫不变,手部动作自然不畸变,不出现文字水印,不叠加多余运镜。

三段式的好处是:模型先建立环境基线,再按镜头顺序执行,最后被约束包兜住。比一大段散文式提示词的可控性高得多。

运镜:一镜一运镜原则

AI 视频最常见的运镜翻车,是提示词里写了「推拉摇移跟环拍」全活儿,模型理解成同一秒内同时做,结果画面像被甩出去一样。

硬规则:

  • 一个镜头只给一种运镜:推、拉、摇、移、跟、固定,选一个。
  • 速度必须量化:写「缓慢推近」「极缓横移」,不要只写「推镜」。默认速度下模型往往推得太快。
  • 景别先定:远景 / 全景 / 中景 / 中近景 / 近景 / 特写,先写景别再写运镜,否则模型会自己选一个奇怪的距离。
  • 机位高度要交代:平视、略俯、略仰、低角度。不写就随机。

常见运镜词汇对照:

你想要的效果推荐写法避免写法
慢慢靠近人物面部中近景起幅,缓慢推近至特写,速度极缓「镜头推进,有张力」
人物走路跟拍侧面中景,跟拍人物行走,保持同速同距「镜头跟着她走」
环境交代全景,固定机位,缓慢横移左到右「镜头扫一圈」
对峙压迫感仰拍中近景,机位略低,固定不动「镜头很有压迫感」
情绪特写面部大特写,固定机位,浅景深「镜头怼脸拍」

动作:低缓连续优于高爆发

AI 视频模型在处理大幅度、高速度、复杂肢体动作时,崩坏概率陡增:拳脚相向、奔跑转身、舞蹈旋转、多人肢体接触,都是重灾区。

写动作的三个原则:

  1. 肢体细化:不要写「她很生气」,要写「右手攥紧、眉头紧皱、呼吸加重、嘴角下压」。把情绪拆成可见的肌肉和肢体动作。
  2. 程度量化:「微微颤抖」比「颤抖」稳,「缓慢转头」比「猛然回头」稳。能用低缓连续动作表达的,不要用爆发动作。
  3. 一个镜头一个主动作:镜头 1 写攥拳,镜头 2 写抬头,镜头 3 写落泪。不要在一个镜头里让她同时攥拳、转头、后退、嘶吼。

如果剧本确实需要高爆发动作(比如巴掌、摔倒),处理方式是:把动作拆成「动作前 → 动作中 → 动作后」三个镜头,每个镜头只拍一个阶段,用剪辑节奏拼出爆发力,而不是指望一个镜头里完整演出来。

符号规范:台词、音效、BGM 怎么标

提示词里混入声音元素时,用统一符号区分,模型和后期都能看懂:

  • 台词用花括号:{你凭什么替我做决定}
  • 音效用尖括号:<雷声轰鸣><玻璃杯碎裂><脚步声由远及近>
  • BGM 用圆括号:(低沉弦乐渐起)(九十年代粤语老歌片段)

不要把台词直接写进正文叙述里。「女主说你凭什么替我决定」和「女主:{你凭什么替我做决定}」是两种完全不同的生成结果——前者模型可能把这句话当旁白处理,后者明确是角色开口。

参考图与文字的优先级

当一场戏绑定了人物定妆图、场景图、道具图之后,提示词里不要再用文字去描写有参考图人物的服装和外貌

这是 AI 短剧最经典的翻车源:你给了一张「红裙长发」的定妆图,提示词里又写「她穿着黑色风衣,短发利落」,模型在两套指令之间摇摆,结果就是中途换装、换脸、发色漂移。

正确做法:

  • 有参考图的人物:文字只写动作、表情、伤情、朝向,不写服装、发型、脸型、肤色。
  • 场景有参考图:文字只写时间变化、光影变化、临时道具,不重写场景装修。
  • 道具有参考图:文字写人物怎么使用它,不重复描述它长什么样。

一句话:参考图管「长什么样」,提示词管「在做什么」。

只给本场素材,禁止串戏

写某一场的提示词时,只引用这场戏里出现的人物、道具、场景信息。不要把全剧人物表、所有道具 catalog 都塞进去。

模型没有「这是第 3 场、那个人在第 8 场才出场」的概念,你写了它就可能让他提前出现。专业流程里,每场提示词自动只吃本场的素材切片:本场场景图、本场道具图、本场出场人物定妆图、本场剧本正文。

本场剧本正文是最高优先级的撰写依据,提示词是对剧本的镜头化翻译,不是二次创作。

兜底包:每条提示词都该带的尾巴

不管什么场景,以下兜底项建议默认带上,按题材增减:

  • 画质兜底:4K(或目标分辨率),面部清晰稳定,皮肤纹理自然,无畸变
  • 水印兜底:无水印、无 Logo、无文字叠加
  • 多人兜底:不出现双胞胎、分身、多余手指(多人场景必加)
  • 风格兜底:非写实画风必须加「全程保持 [画风名称] 风格,不切换写实」
  • 动作兜底:肢体动作自然连贯,不出现穿模、瞬移、物体悬浮
  • 场景兜底:不切换场景地点,光线方向保持一致

这些兜底看起来啰嗦,但它们是在替你挡掉模型最常犯的那几类错。

合规清洗:别把 IP 名写进提示词

很多人习惯写「像《某电影》一样的光影」「某导演风格」。这类描述有两个问题:一是下游模型可能触发版权拦截直接拒出;二是不同模型对同一部电影的视觉理解差异极大,出来的东西不可控。

正确做法是把参考对象拆解成技法语言:

  • 不说「像王家卫」,说「高饱和霓虹色光,慢快门拖影,浅景深,暖色调」
  • 不说「像诺兰」,说「低饱和冷色调,高反差硬光,IMAX 画幅质感,写实」
  • 不说「像吉卜力」,说「手绘水彩质感,柔和漫射光,色彩明快,线条清晰」

把美学翻译成可执行的视觉参数,比直接报片名稳。

一个完整示例

以「女主深夜在旧卧室收到一条短信,情绪崩溃」为例,三段式提示词写法:

总体设定 老式居民楼卧室,深夜。窗外冷蓝霓虹光从右侧窗户打入,面部半明半暗,高反差,阴影偏蓝。九十年代港片胶片质感,颗粒明显,色调偏暖黄绿。4K 画质,面部清晰稳定,皮肤纹理自然,无水印无 Logo。

镜头分点 镜头 1:中景,女主穿白衬衫侧身坐在床边,右手握着手机,屏幕光映在脸上。机位固定,不运动。<手机消息提示音> 镜头 2:切至手机屏幕特写,一条新消息弹出,女主拇指悬停在屏幕上方微微颤抖。机位固定,缓慢推近至屏幕。 镜头 3:切回女主面部特写,她读完消息,眼眶迅速泛红,嘴唇轻颤,右手缓慢攥紧手机壳。极缓推近,不摇。{怎么会是你……} 镜头 4:特写女主右手,手机从松开的指尖滑落,掉在床单上。机位固定。<手机砸在被褥上的闷响>(低沉弦乐渐起)

约束包 全程不出现第二个人物,不切换房间,女主服装保持白衬衫不变,发型保持参考图样式,手部动作自然不畸变,不出现多余手指,不叠加多余运镜,光线方向始终从右侧窗户打入。

诚实边界

这套规范能显著提升出片稳定性,但它不是魔法。有几件事需要说清楚:

  • 提示词规范是工程启发式,不是时间码精剪。约 10 秒的场块粒度是经验值,超长场会再拆,但仍可能出现偏长的块,精剪与串场成片需要后续剪辑环节。
  • 角色一致性依赖定妆资产链路,不是靠提示词里反复描写外貌。最终观感取决于立绘质量,以及提示词是否遵守「有图不写外观」。
  • 当前不做跨场自动续写或延长视频的产品化工作流,产品单元是「单场多模态参考 → 单段成片」,长片靠剪辑拼接。
  • 没有成片自动打分或自动择优重拍引擎,质量终审在创作者手里,系统提供的是多 take 与改词重拍的工具。

把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

---

*本文为 AI 竖屏短剧生产工艺系列之镜头提示词规范篇。*

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com