视频提示词的八大要素,缺一个都会出问题

猫斯卡编辑部 | 最后更新日期

AI 短剧出片翻车,多数不是模型不行,是提示词没把该交代的交代清楚。一个能稳定出片的视频提示词,必须同时说清八件事:谁、在干什么、在哪、什么光、镜头怎么动、什么画风、什么画质、什么不能发生。

为什么提示词少写一项,成片就崩一项

很多团队写视频提示词还停留在「一个女孩在雨中奔跑,情绪悲伤,电影感」这种小说式描述。这种写法在文生图时代勉强能用,到了视频阶段就会暴露问题:模型必须在几秒内同时决定人物长相、服装、动作幅度、镜头运动、光线方向、画面风格——你没写的,它就自己补,补出来什么全凭运气。

工程化镜头提示词是一种用分镜表语言和模型沟通的写法。它不追求文采,追求的是每一项指令都可执行、可核对、可复现。核心就是八大要素,缺一个,成片就会在那个维度上漂移。

八大要素逐项拆解

1. 精准主体

镜头里是谁,必须精确到可识别。

  • 有定妆参考图的人物:写角色名 + 当前状态(「苏晚,脸上带伤,衣服下摆沾泥」),不要重复描写服装和长相——那些交给参考图
  • 没有参考图的群演或路人:写泛指身份(「围观群众数人」「两名保安」),不要给他们起名字、不要写具体外貌,避免模型把精力花在无关角色上
  • 多人场景要点明主次:「苏晚(主)站在画面中央,陈警官(次)从右侧入画」

缺这一项的典型翻车:主角脸每镜一变、群演比主角还抢戏、本该是背影的镜头给了正脸。

2. 动作细节

这是视频和图片最大的区别——图片只有一个瞬间,视频是一段连续动作。

  • 动作要肢体细化 + 程度量化:「缓缓抬手,指尖颤抖,幅度约 10 厘米」比「激动地举手」可控得多
  • 优先写低缓连续动作:走、转脸、抬手、递东西、微微后退;少写高爆发动作(飞踢、翻滚、高速奔跑),这类动作模型最容易崩
  • 一个镜头只写一个主动作,不要贪多
  • 动作要和情绪匹配,但不要只写情绪词——「眼眶泛红,嘴唇紧抿,缓慢摇头」比「非常伤心」可执行

缺这一项的典型翻车:人物鬼畜抽搐、动作做到一半变形、手多了或少了。

3. 场景环境

在哪拍,内景还是外景,什么时间。

  • 结构化写:「内景 / 老旧出租屋 / 夜晚」或「外景 / 江边步道 / 黄昏」
  • 关键道具要点明位置:「桌上摊开一本旧相册」「脚边倒着一个行李箱」
  • 不要堆砌无关环境细节——场景图已经承担了大部分环境信息,提示词只补本场特有的布置
  • 场景图里严禁出现人物,否则参考图和提示词会打架

缺这一项的典型翻车:同一场戏背景从办公室跳到大街、白天变黑夜、关键道具凭空消失。

4. 光影色调

光线是情绪的载体,也是画面质感的来源。

  • 光源方向:「顶光」「侧逆光」「窗外冷色月光从左侧打入」
  • 色温倾向:「暖黄钨丝灯」「冷青荧光灯」「黄昏暖橙色」
  • 对比度氛围:「高反差,阴影浓重」「柔光,低对比」
  • 不要只写「电影感」「氛围感」——这不是可执行指令

缺这一项的典型翻车:画面平、没层次、同一场戏每镜色温跳来跳去。

5. 镜头运镜

这是最容易被忽略、也最容易造成「AI 味」的一项。

  • 一镜一运镜:一个镜头只选一种运动——推、拉、摇、移、跟、固定,禁止叠加(「推近同时摇移」几乎必崩)
  • 写清方向和速度:「缓慢推近至面部特写」「固定机位,无运镜」「从左向右横移,速度缓慢」
  • 景别要明确:远景 / 全景 / 中景 / 近景 / 特写
  • 用镜头序号组织,不要写绝对秒数(「镜头 1:……镜头 2:……」而不是「0–3 秒……3–6 秒……」)

缺这一项的典型翻车:镜头乱晃、莫名推拉、景别忽远忽近、一镜里塞了三种运镜。

6. 视觉风格

画风必须和全剧统一,不能每场各写各的。

  • 选定画风后,人物立绘、场景立绘、道具立绘、视频提示词共用同一条风格路径
  • 提示词里只写视频风格标签(如「国风工笔,淡彩,线条流畅」),不要把整套美术手册塞进视频提示词
  • 非写实风格必须加风格锚定,否则模型会滑向写实

缺这一项的典型翻车:人物是日漫脸,场景突然变写实 3D;上一镜是手绘风,下一镜变真人。

7. 画质

这一项看似废话,但不写兜底,模型会在最不该偷懒的地方偷懒。

  • 基础兜底:高清晰度、细节丰富、面部稳定
  • 竖屏短剧默认 9:16,要在提示词或输出参数里明确
  • 不要写「4K 超清 8K 极致画质」这种堆叠词,写实际交付规格对应的描述就够

缺这一项的典型翻车:脸部糊、边缘闪烁、分辨率忽高忽低。

8. 约束条件

这是「告诉模型什么不能做」的兜底包,也是专业提示词和业余提示词的分水岭。

  • 通用兜底:无水印、无 Logo、无字幕、面部稳定不变形
  • 多人场景加:无双胞胎、无分身、无多余肢体
  • 有参考图的人物加:服装外观以参考图为准,文字不描述服装
  • 动作约束:无瞬移、无穿模、无物体凭空出现
  • 合规约束:不出现特定影视作品名称、不出现真实名人脸

缺这一项的典型翻车:画面角落冒出莫名其妙的水印、两个人长得一模一样、手指数不对、衣服颜色和定妆图对不上。

简单场景 vs 复杂场景:两种写法

不是每场戏都要写满八百字。要素齐全不等于篇幅冗长,要按场景复杂度分流。

场景类型写法适用情况
简单场景一段式,八要素揉成一段两人对话、单人反应、固定机位、动作单一
复杂影视化场景三段论:总体设定 → 镜头 1/2/3 分写 → 兜底约束包多人物调度、有运镜变化、动作连续、情绪转折

三段论的结构大致是:

  1. 总体设定:交代场景、光影、风格、画质(这些是全场统一的)
  2. 分镜描述:按镜头序号写每个镜头的主体、动作、景别、运镜
  3. 约束包:把兜底条款集中放在最后,避免每条镜头重复写

常见缺项对照表

你看到的翻车现象大概率缺的要素补法
主角每镜长得不一样精准主体 + 约束条件绑定妆参考图,加「外观以参考图为准」
人物动作鬼畜、手变形动作细节降低动作幅度,写细化肢体动作,一镜一动
背景跳来跳去场景环境绑场景参考图,提示词只补本场特有布置
画面没质感、像手机随手拍光影色调写清光源方向、色温、对比度
镜头乱晃、莫名推拉镜头运镜一镜一运镜,写清方向速度,不需要动就写「固定」
人物是动漫、场景变真人视觉风格全剧统一画风路径,非写实加风格锚定
脸糊、边缘闪画质加清晰度与面部稳定兜底
多出一只手、两个人撞脸约束条件多人场景加双胞胎 / 分身 / 肢体兜底

几个写提示词时的硬纪律

  • 本场素材只给本场:提示词生成时只引用本场的场景图、道具图、人物定妆,不要把其他集的东西串进来
  • 有参考图的人物,禁止再用文字描写服装外观:文字只写动作、表情、伤情。这一条是解决「换装」最直接的手段
  • 台词用 {}、音效用 <>、BGM 用 ():符号规范让下游环节能准确识别哪些是说的、哪些是响的、哪些是铺的
  • 生成参数偏保守,取稳定可控:不要为了追求「惊艳」把参数调到天马行空,短剧是批量生产,稳定性大于单条惊艳
  • 提示词写完要人工审一遍:系统能帮你组织语言,但参考代号是否齐全、动作是否合理,最终还是人看一眼最靠谱

说到底,系统在教模型用分镜表语言说话,而不是写小说。八要素不是八股文,是让模型在每一个维度上都不用「猜」的最低信息集。

---

*本文是 AI 短剧镜头提示词规范的一部分,属于「AI 视频一致性问题全解」内容集群。*

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com