AI 短剧提示词返工诊断:八个最常被漏掉的镜头指令
AI 短剧视频提示词返工,多半不是写得不够华丽,而是少了模型执行镜头所需的关键信息。把主体、动作、场景、光影、运镜、风格、画质、约束八项补齐,出片才稳定。
为什么提示词看起来很长,成片还是崩
很多短剧团队写视频提示词,会陷入一个误区:把形容词堆得很满,却没有把镜头执行信息交代清楚。结果是画面看似有氛围,但人物动作飘、镜头乱晃、场景串戏、参考图失效。
视频提示词不是小说描写,也不是美术文案。它更像一张极简分镜表:谁在什么地方,做什么动作,光线如何,镜头怎么运动,必须遵守什么限制。
镜头提示词是给视频模型的执行指令,不是给读者想象的文学段落。 它需要让模型在一次生成里同时完成主体识别、动作调度、空间关系、光影统一和镜头语言控制。
下面按返工现场最常见的八个问题倒推,看看每一项到底该怎么补。
一、主体不清:模型不知道镜头该看谁
最常见的崩法,是提示词写了“两人争执”,但没有说明谁是镜头主体、谁在前景、谁在反应。模型会平均分配注意力,最后出现视线乱飘、动作抢戏、人物站位不稳定。
应该写清
- 本场主体是谁
- 主体在画面中的位置:前景 / 中景 / 后景
- 谁主动,谁反应
- 多人场景中谁的脸需要保持稳定
不建议写
- “一群人很紧张地看着他”
- “现场气氛非常压抑”
- “所有人都震惊了”
这些句子有情绪,没有执行对象。更稳的写法是:“女主站在前景,手指攥紧文件;两名保安在她身后半步,目光同时看向门口。”
如果人物已经有定妆参考图,就不要在提示词里重复描写服装、发型、五官。参考图负责外观,文字只负责动作、表情和伤情。否则文字和参考图互相打架,最容易造成换装、换脸。
二、动作太虚:模型只能自由发挥
“女主很生气”“男主冲过去”“两人发生冲突”都属于动作意图,不是可执行动作。模型会自行脑补动作幅度,结果可能变成夸张挥手、突然奔跑、表情变形。
动作要写成低缓、连续、可拍摄的肢体细节,并尽量给出程度。
| 虚写 | 更稳的写法 |
|---|---|
| 女主很生气 | 女主垂下眼,缓慢把杯子放回桌面,指节发白 |
| 男主冲过去 | 男主向前两步,伸手按住对方肩膀 |
| 两人争执 | 男人前倾半步,女人后退半步,声音压低 |
| 气氛紧张 | 两人对视三秒,无人先动 |
AI 视频对高爆发动作更脆弱:快速转身、打斗、奔跑、拥抱、大幅度手势都容易出现肢体错误。短剧里如果不是必须,优先用微表情、停顿、手部动作、步伐变化来制造张力。
三、场景不明:人物像飘在空背景里
只写“办公室”“酒店房间”“古代街道”还不够。模型需要知道空间关系和视觉锚点,否则人物会像贴在背景上,或者镜头一转就换了房间布局。
场景描述至少包含三件事:
- 空间类型:内景还是外景,具体地点
- 关键陈设:桌、门、窗、床、柜台、屏风等能定位人物的物件
- 人与空间的关系:坐在哪里、站在什么旁边、从哪扇门进入
例如:“内景,狭小审讯室。女主坐在铁桌后方,头顶日光灯偏冷;男主站在门口,手搭在门把上,没有立刻进来。”
如果已经有场景参考图,提示词应避免重新发明场景布局。文字只补充本场需要的调度,比如人物从窗边走到桌前。
另外,场景图本身要遵守空镜纪律:场景参考图里不要出现人物。否则拍摄时,模型可能把图里的陌生人也当成角色。
四、光影和色调缺失:前后场不像同一部剧
很多团队只在画风里写“电影感”,但每场不补光线方向和色调,最后成片一场亮、一场暗、一场偏蓝、一场偏黄。观众未必能说出原因,但会觉得“不像同一部剧”。
光影不是装饰,它是连续性的一部分。
每场至少交代
- 光源:窗光、台灯、霓虹、月光、烛光、顶灯
- 方向:顺光、侧光、逆光、顶光
- 色调:冷色、暖色、低饱和、高对比
- 时间:日景、黄昏、夜晚
例如:“夜晚,窗外霓虹从左侧打入,人物半边脸呈冷蓝色,背景压暗。”
要注意,光影描述要服务剧情,不要每一场都写“电影级光影”。真正有用的是能让模型执行的光线信息。
五、运镜贪多:一镜里推拉摇移全上
AI 视频最容易出戏的地方之一,是镜头自己乱动。提示词写“镜头缓缓推进、环绕、拉升、晃动”,模型会把多个运镜叠加,最后画面眩晕、主体丢失。
稳的原则是:一镜一运镜。
一个镜头只选一个主要运动:
- 固定机位
- 缓慢推近
- 缓慢拉远
- 横移跟随
- 轻微手持
- 升降镜头
如果剧情确实需要复杂调度,可以拆成多个场块,不要让一个 10 秒左右的镜头承担太多运动。
还有一个常见错误:用绝对秒数写镜头,比如“0–3 秒推近,3–6 秒环绕”。视频模型对这种时间码控制并不稳定。更适合的方式是用镜头序号或动作顺序描述:“镜头先固定在女主脸上;她抬眼后,镜头缓慢推近。”
六、风格不统一:人物、场景、视频各说各话
风格问题通常不是一句“国风”“写实”“赛博朋克”能解决的。真正的问题是:人物立绘按一种风格画,场景按另一种风格画,视频提示词又引入第三种审美。
稳定的做法是,选定画风后,让人物、场景、道具和视频提示词共用同一条风格路径。
风格描述应尽量具体,但不要借用具体影视作品或 IP 名称。可以写:
- 材质:水墨纸本、工笔重彩、黏土质感、3D 国漫、真实皮肤质感
- 线条:细腻线稿、粗颗粒、柔和边缘
- 色彩:低饱和灰调、高对比霓虹、暖金宫廷色
- 镜头质感:浅景深、胶片颗粒、柔和高光
不要写“像某部电影”“像某部动漫”。这类描述不仅有版权风险,也会让模型抓取不可控的视觉元素。
七、画质要求没兜底:奇怪文字、水印、脸部崩坏
有些提示词主体和动作都写得不错,但忘了加画质与稳定性约束,结果画面里出现乱码文字、Logo、水印、脸部变形、手指错误。
这类要求不需要写得很长,但要形成固定兜底包。每场都应包含:
- 高画质、清晰面部
- 无水印、无 Logo、无乱码文字
- 人物五官稳定
- 手指与肢体自然
- 多人场景避免双胞胎或分身
- 非写实风格保持画风一致
多人同框尤其要补“避免双胞胎 / 分身”。因为模型在相似服装、相似发型、相似光线下,很容易把两个人生成一张脸。
八、约束条件漏写:该禁止的没有说
约束条件不是负面词堆砌,而是告诉模型什么不能发生。短剧生产里,最有价值的约束通常和连续性有关。
常见约束
- 有参考图的人物,不改变服装、发型、五官
- 本场只出现指定人物,不新增陌生角色
- 不使用未绑定的道具
- 不改变场景布局
- 不突然切换年代、服饰和建筑风格
- 不加入现代物品,除非剧本明确要求
穿越、闪回、重生题材还要特别注意时代造型。同一个角色可能有现代装和古代装,系统需要按场景地点和剧情时间选择对应定妆图。如果绑错参考,提示词写得再好也会穿帮。
道具也不是越多越好。每场只保留剧情真正需要的道具。无关道具挤占参考槽位,还可能让模型把注意力放错地方。
一条可执行的提示词检查顺序
写完整场提示词后,不要立刻出片。按下面顺序检查一遍:
- 主体:镜头看谁,谁在前景,谁在反应?
- 动作:是否写成了可拍摄的连续动作?
- 场景:空间、陈设、人物位置是否明确?
- 光影:光源、方向、色调、时间是否交代?
- 运镜:是否只有一个主要镜头运动?
- 风格:是否与定妆、场景、道具保持同一画风?
- 画质:面部、水印、乱码、肢体、分身是否兜底?
- 约束:服装、道具、人物数量、时代是否被锁住?
这八项不是为了把提示词写长,而是为了减少返工。短剧生产里,最贵的不是第一次生成,而是同一场反复改词、反复换图、反复重拍。
简单场景和复杂场景要分开处理
不是每场都需要写成复杂三段式。提示词长度应服从场块复杂度。
简单场景:一段式
适合单人反应、对白特写、静态情绪戏。结构可以是:主体 + 动作 + 场景 + 光影 + 运镜 + 约束。
女主坐在审讯桌后,低头看着文件,手指慢慢收紧。冷白顶灯从上方落下,背景压暗。镜头固定在中近景,轻微推近。保持女主面部稳定,无水印,无乱码文字。
复杂影视化场景:三段式
适合多人调度、动作推进、情绪转折。结构可以是:
- 总体设定:场景、时间、光影、风格
- 镜头分段:镜头 1、镜头 2、镜头 3,各自写主体和动作
- 约束包:人物一致性、道具限制、画质兜底
复杂场景不要把所有动作塞进一个长句。按镜头序号拆开,模型更容易执行。
场块粒度决定提示词质量
很多提示词问题,本质上是场切得太大。一个场块如果塞进太多剧情、太多人物、太多动作,再强的模型也容易失控。
更稳的生产方式,是把一集切成约 10 秒左右的视频场块。每个场块只承担一个主要动作或情绪转折。正文过长时,再按动作节拍、空段和句号继续拆。
这不是时间码精剪,而是工程启发式。它的价值在于:每个场块都有独立提示词、独立参考图、独立成片和历史 takes。哪一场坏了,就重拍哪一场,不必整集重来。
需要承认的是,约 10 秒的场块不是精确剪辑单位,仍然可能出现偏长的块。精剪、串场、节奏压缩仍需要后续剪辑环节完成。
提示词写完后,还要做这三件事
1. 核对参考图顺序
每场参考素材建议按“场景图 → 本场道具图 → 人物定妆图”的顺序构建。有图才占槽位,没有图就标明仅文字,不要强行编造绑定。
2. 确认角色称呼绑定
剧本里可能写“警官”“她”“那个男人”,但档案里的角色有正式姓名。拍摄前要确认称呼和定妆图绑定正确,尤其是客串、泛指角色和群演。
3. 保留重拍版本
同一场可以多拍几条,通过改词、换参考图、换模型档位得到不同 takes。不要只留一条结果。短剧生产需要择优,而不是把第一次生成当终审。
诚实边界:提示词不能解决所有问题
再好的提示词也有边界。
- 没有成片自动打分或自动择优重拍引擎,最终质量仍由创作者判断。
- 参考图不是强制门禁,缺图可以跳过纯文字生成,但质量通常更差。
- 当前产品单元主要是“单场多模态参考 → 单段成片”,不做跨场自动续写或延长视频的产品化工作流。
- 角色一致性依赖定妆资产链路,不是人脸嵌入校验;最终观感仍取决于立绘质量和提示词是否遵守“有图不写外观”。
所以,提示词规范的价值不是承诺零失误,而是把可控的部分先控住。把重复、易漂移、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
常见问题
AI 短剧视频提示词为什么越写越长还是会崩?
因为长度不等于有效信息。模型需要的是主体、动作、场景、光影、运镜、风格、画质和约束这些可执行信息;如果只是堆形容词和情绪词,它仍然需要自由发挥,自然容易翻车。
有角色参考图后,提示词还要不要描写服装和长相?
不要。有参考图的人物,外观应以参考图为准,提示词只写动作、表情、伤情和调度。重复描写服装、发型、五官,反而可能和参考图冲突,造成换装或换脸。
一个镜头里可以同时推近、环绕和拉升吗?
不建议。稳定做法是一镜一运镜,一个镜头只保留一个主要运动。复杂调度应拆成多个场块或多个镜头,否则容易出现画面眩晕和主体丢失。
为什么 AI 视频里的人物会突然换衣服?
常见原因是文字提示词重新描写了服装外观,或者本场绑定了错误的人物定妆图。解决方法是先锁定定妆资产,提示词不再改写外观,并在拍摄前核对角色绑定。
视频场块为什么要切成约 10 秒?
这是为了让每个场块只承担一个主要动作或情绪转折,降低模型失控概率。每个场块有独立提示词、参考图和成片,出问题时可以只重拍一场,而不是整集重来。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com