视频提示词的八大要素,缺一个都会出问题
AI 短剧出片翻车,多数不是模型不行,是提示词没把该交代的交代清楚。一个能稳定出片的视频提示词,必须同时说清八件事:谁、在干什么、在哪、什么光、镜头怎么动、什么画风、什么画质、什么不能发生。
为什么提示词少写一项,成片就崩一项
很多团队写视频提示词还停留在「一个女孩在雨中奔跑,情绪悲伤,电影感」这种小说式描述。这种写法在文生图时代勉强能用,到了视频阶段就会暴露问题:模型必须在几秒内同时决定人物长相、服装、动作幅度、镜头运动、光线方向、画面风格——你没写的,它就自己补,补出来什么全凭运气。
工程化镜头提示词是一种用分镜表语言和模型沟通的写法。它不追求文采,追求的是每一项指令都可执行、可核对、可复现。核心就是八大要素,缺一个,成片就会在那个维度上漂移。
八大要素逐项拆解
1. 精准主体
镜头里是谁,必须精确到可识别。
- 有定妆参考图的人物:写角色名 + 当前状态(「苏晚,脸上带伤,衣服下摆沾泥」),不要重复描写服装和长相——那些交给参考图
- 没有参考图的群演或路人:写泛指身份(「围观群众数人」「两名保安」),不要给他们起名字、不要写具体外貌,避免模型把精力花在无关角色上
- 多人场景要点明主次:「苏晚(主)站在画面中央,陈警官(次)从右侧入画」
缺这一项的典型翻车:主角脸每镜一变、群演比主角还抢戏、本该是背影的镜头给了正脸。
2. 动作细节
这是视频和图片最大的区别——图片只有一个瞬间,视频是一段连续动作。
- 动作要肢体细化 + 程度量化:「缓缓抬手,指尖颤抖,幅度约 10 厘米」比「激动地举手」可控得多
- 优先写低缓连续动作:走、转脸、抬手、递东西、微微后退;少写高爆发动作(飞踢、翻滚、高速奔跑),这类动作模型最容易崩
- 一个镜头只写一个主动作,不要贪多
- 动作要和情绪匹配,但不要只写情绪词——「眼眶泛红,嘴唇紧抿,缓慢摇头」比「非常伤心」可执行
缺这一项的典型翻车:人物鬼畜抽搐、动作做到一半变形、手多了或少了。
3. 场景环境
在哪拍,内景还是外景,什么时间。
- 结构化写:「内景 / 老旧出租屋 / 夜晚」或「外景 / 江边步道 / 黄昏」
- 关键道具要点明位置:「桌上摊开一本旧相册」「脚边倒着一个行李箱」
- 不要堆砌无关环境细节——场景图已经承担了大部分环境信息,提示词只补本场特有的布置
- 场景图里严禁出现人物,否则参考图和提示词会打架
缺这一项的典型翻车:同一场戏背景从办公室跳到大街、白天变黑夜、关键道具凭空消失。
4. 光影色调
光线是情绪的载体,也是画面质感的来源。
- 光源方向:「顶光」「侧逆光」「窗外冷色月光从左侧打入」
- 色温倾向:「暖黄钨丝灯」「冷青荧光灯」「黄昏暖橙色」
- 对比度氛围:「高反差,阴影浓重」「柔光,低对比」
- 不要只写「电影感」「氛围感」——这不是可执行指令
缺这一项的典型翻车:画面平、没层次、同一场戏每镜色温跳来跳去。
5. 镜头运镜
这是最容易被忽略、也最容易造成「AI 味」的一项。
- 一镜一运镜:一个镜头只选一种运动——推、拉、摇、移、跟、固定,禁止叠加(「推近同时摇移」几乎必崩)
- 写清方向和速度:「缓慢推近至面部特写」「固定机位,无运镜」「从左向右横移,速度缓慢」
- 景别要明确:远景 / 全景 / 中景 / 近景 / 特写
- 用镜头序号组织,不要写绝对秒数(「镜头 1:……镜头 2:……」而不是「0–3 秒……3–6 秒……」)
缺这一项的典型翻车:镜头乱晃、莫名推拉、景别忽远忽近、一镜里塞了三种运镜。
6. 视觉风格
画风必须和全剧统一,不能每场各写各的。
- 选定画风后,人物立绘、场景立绘、道具立绘、视频提示词共用同一条风格路径
- 提示词里只写视频风格标签(如「国风工笔,淡彩,线条流畅」),不要把整套美术手册塞进视频提示词
- 非写实风格必须加风格锚定,否则模型会滑向写实
缺这一项的典型翻车:人物是日漫脸,场景突然变写实 3D;上一镜是手绘风,下一镜变真人。
7. 画质
这一项看似废话,但不写兜底,模型会在最不该偷懒的地方偷懒。
- 基础兜底:高清晰度、细节丰富、面部稳定
- 竖屏短剧默认 9:16,要在提示词或输出参数里明确
- 不要写「4K 超清 8K 极致画质」这种堆叠词,写实际交付规格对应的描述就够
缺这一项的典型翻车:脸部糊、边缘闪烁、分辨率忽高忽低。
8. 约束条件
这是「告诉模型什么不能做」的兜底包,也是专业提示词和业余提示词的分水岭。
- 通用兜底:无水印、无 Logo、无字幕、面部稳定不变形
- 多人场景加:无双胞胎、无分身、无多余肢体
- 有参考图的人物加:服装外观以参考图为准,文字不描述服装
- 动作约束:无瞬移、无穿模、无物体凭空出现
- 合规约束:不出现特定影视作品名称、不出现真实名人脸
缺这一项的典型翻车:画面角落冒出莫名其妙的水印、两个人长得一模一样、手指数不对、衣服颜色和定妆图对不上。
简单场景 vs 复杂场景:两种写法
不是每场戏都要写满八百字。要素齐全不等于篇幅冗长,要按场景复杂度分流。
| 场景类型 | 写法 | 适用情况 |
|---|---|---|
| 简单场景 | 一段式,八要素揉成一段 | 两人对话、单人反应、固定机位、动作单一 |
| 复杂影视化场景 | 三段论:总体设定 → 镜头 1/2/3 分写 → 兜底约束包 | 多人物调度、有运镜变化、动作连续、情绪转折 |
三段论的结构大致是:
- 总体设定:交代场景、光影、风格、画质(这些是全场统一的)
- 分镜描述:按镜头序号写每个镜头的主体、动作、景别、运镜
- 约束包:把兜底条款集中放在最后,避免每条镜头重复写
常见缺项对照表
| 你看到的翻车现象 | 大概率缺的要素 | 补法 |
|---|---|---|
| 主角每镜长得不一样 | 精准主体 + 约束条件 | 绑定妆参考图,加「外观以参考图为准」 |
| 人物动作鬼畜、手变形 | 动作细节 | 降低动作幅度,写细化肢体动作,一镜一动 |
| 背景跳来跳去 | 场景环境 | 绑场景参考图,提示词只补本场特有布置 |
| 画面没质感、像手机随手拍 | 光影色调 | 写清光源方向、色温、对比度 |
| 镜头乱晃、莫名推拉 | 镜头运镜 | 一镜一运镜,写清方向速度,不需要动就写「固定」 |
| 人物是动漫、场景变真人 | 视觉风格 | 全剧统一画风路径,非写实加风格锚定 |
| 脸糊、边缘闪 | 画质 | 加清晰度与面部稳定兜底 |
| 多出一只手、两个人撞脸 | 约束条件 | 多人场景加双胞胎 / 分身 / 肢体兜底 |
几个写提示词时的硬纪律
- 本场素材只给本场:提示词生成时只引用本场的场景图、道具图、人物定妆,不要把其他集的东西串进来
- 有参考图的人物,禁止再用文字描写服装外观:文字只写动作、表情、伤情。这一条是解决「换装」最直接的手段
- 台词用
{}、音效用<>、BGM 用():符号规范让下游环节能准确识别哪些是说的、哪些是响的、哪些是铺的 - 生成参数偏保守,取稳定可控:不要为了追求「惊艳」把参数调到天马行空,短剧是批量生产,稳定性大于单条惊艳
- 提示词写完要人工审一遍:系统能帮你组织语言,但参考代号是否齐全、动作是否合理,最终还是人看一眼最靠谱
说到底,系统在教模型用分镜表语言说话,而不是写小说。八要素不是八股文,是让模型在每一个维度上都不用「猜」的最低信息集。
---
*本文是 AI 短剧镜头提示词规范的一部分,属于「AI 视频一致性问题全解」内容集群。*
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com