AI 短剧提示词返工诊断:八个最常被漏掉的镜头指令

猫斯卡编辑部 | 最后更新日期

AI 短剧视频提示词返工,多半不是写得不够华丽,而是少了模型执行镜头所需的关键信息。把主体、动作、场景、光影、运镜、风格、画质、约束八项补齐,出片才稳定。

为什么提示词看起来很长,成片还是崩

很多短剧团队写视频提示词,会陷入一个误区:把形容词堆得很满,却没有把镜头执行信息交代清楚。结果是画面看似有氛围,但人物动作飘、镜头乱晃、场景串戏、参考图失效。

视频提示词不是小说描写,也不是美术文案。它更像一张极简分镜表:谁在什么地方,做什么动作,光线如何,镜头怎么运动,必须遵守什么限制。

镜头提示词是给视频模型的执行指令,不是给读者想象的文学段落。 它需要让模型在一次生成里同时完成主体识别、动作调度、空间关系、光影统一和镜头语言控制。

下面按返工现场最常见的八个问题倒推,看看每一项到底该怎么补。

一、主体不清:模型不知道镜头该看谁

最常见的崩法,是提示词写了“两人争执”,但没有说明谁是镜头主体、谁在前景、谁在反应。模型会平均分配注意力,最后出现视线乱飘、动作抢戏、人物站位不稳定。

应该写清

  • 本场主体是谁
  • 主体在画面中的位置:前景 / 中景 / 后景
  • 谁主动,谁反应
  • 多人场景中谁的脸需要保持稳定

不建议写

  • “一群人很紧张地看着他”
  • “现场气氛非常压抑”
  • “所有人都震惊了”

这些句子有情绪,没有执行对象。更稳的写法是:“女主站在前景,手指攥紧文件;两名保安在她身后半步,目光同时看向门口。”

如果人物已经有定妆参考图,就不要在提示词里重复描写服装、发型、五官。参考图负责外观,文字只负责动作、表情和伤情。否则文字和参考图互相打架,最容易造成换装、换脸。

二、动作太虚:模型只能自由发挥

“女主很生气”“男主冲过去”“两人发生冲突”都属于动作意图,不是可执行动作。模型会自行脑补动作幅度,结果可能变成夸张挥手、突然奔跑、表情变形。

动作要写成低缓、连续、可拍摄的肢体细节,并尽量给出程度。

虚写更稳的写法
女主很生气女主垂下眼,缓慢把杯子放回桌面,指节发白
男主冲过去男主向前两步,伸手按住对方肩膀
两人争执男人前倾半步,女人后退半步,声音压低
气氛紧张两人对视三秒,无人先动

AI 视频对高爆发动作更脆弱:快速转身、打斗、奔跑、拥抱、大幅度手势都容易出现肢体错误。短剧里如果不是必须,优先用微表情、停顿、手部动作、步伐变化来制造张力。

三、场景不明:人物像飘在空背景里

只写“办公室”“酒店房间”“古代街道”还不够。模型需要知道空间关系和视觉锚点,否则人物会像贴在背景上,或者镜头一转就换了房间布局。

场景描述至少包含三件事:

  1. 空间类型:内景还是外景,具体地点
  2. 关键陈设:桌、门、窗、床、柜台、屏风等能定位人物的物件
  3. 人与空间的关系:坐在哪里、站在什么旁边、从哪扇门进入

例如:“内景,狭小审讯室。女主坐在铁桌后方,头顶日光灯偏冷;男主站在门口,手搭在门把上,没有立刻进来。”

如果已经有场景参考图,提示词应避免重新发明场景布局。文字只补充本场需要的调度,比如人物从窗边走到桌前。

另外,场景图本身要遵守空镜纪律:场景参考图里不要出现人物。否则拍摄时,模型可能把图里的陌生人也当成角色。

四、光影和色调缺失:前后场不像同一部剧

很多团队只在画风里写“电影感”,但每场不补光线方向和色调,最后成片一场亮、一场暗、一场偏蓝、一场偏黄。观众未必能说出原因,但会觉得“不像同一部剧”。

光影不是装饰,它是连续性的一部分。

每场至少交代

  • 光源:窗光、台灯、霓虹、月光、烛光、顶灯
  • 方向:顺光、侧光、逆光、顶光
  • 色调:冷色、暖色、低饱和、高对比
  • 时间:日景、黄昏、夜晚

例如:“夜晚,窗外霓虹从左侧打入,人物半边脸呈冷蓝色,背景压暗。”

要注意,光影描述要服务剧情,不要每一场都写“电影级光影”。真正有用的是能让模型执行的光线信息。

五、运镜贪多:一镜里推拉摇移全上

AI 视频最容易出戏的地方之一,是镜头自己乱动。提示词写“镜头缓缓推进、环绕、拉升、晃动”,模型会把多个运镜叠加,最后画面眩晕、主体丢失。

稳的原则是:一镜一运镜。

一个镜头只选一个主要运动:

  • 固定机位
  • 缓慢推近
  • 缓慢拉远
  • 横移跟随
  • 轻微手持
  • 升降镜头

如果剧情确实需要复杂调度,可以拆成多个场块,不要让一个 10 秒左右的镜头承担太多运动。

还有一个常见错误:用绝对秒数写镜头,比如“0–3 秒推近,3–6 秒环绕”。视频模型对这种时间码控制并不稳定。更适合的方式是用镜头序号或动作顺序描述:“镜头先固定在女主脸上;她抬眼后,镜头缓慢推近。”

六、风格不统一:人物、场景、视频各说各话

风格问题通常不是一句“国风”“写实”“赛博朋克”能解决的。真正的问题是:人物立绘按一种风格画,场景按另一种风格画,视频提示词又引入第三种审美。

稳定的做法是,选定画风后,让人物、场景、道具和视频提示词共用同一条风格路径。

风格描述应尽量具体,但不要借用具体影视作品或 IP 名称。可以写:

  • 材质:水墨纸本、工笔重彩、黏土质感、3D 国漫、真实皮肤质感
  • 线条:细腻线稿、粗颗粒、柔和边缘
  • 色彩:低饱和灰调、高对比霓虹、暖金宫廷色
  • 镜头质感:浅景深、胶片颗粒、柔和高光

不要写“像某部电影”“像某部动漫”。这类描述不仅有版权风险,也会让模型抓取不可控的视觉元素。

七、画质要求没兜底:奇怪文字、水印、脸部崩坏

有些提示词主体和动作都写得不错,但忘了加画质与稳定性约束,结果画面里出现乱码文字、Logo、水印、脸部变形、手指错误。

这类要求不需要写得很长,但要形成固定兜底包。每场都应包含:

  • 高画质、清晰面部
  • 无水印、无 Logo、无乱码文字
  • 人物五官稳定
  • 手指与肢体自然
  • 多人场景避免双胞胎或分身
  • 非写实风格保持画风一致

多人同框尤其要补“避免双胞胎 / 分身”。因为模型在相似服装、相似发型、相似光线下,很容易把两个人生成一张脸。

八、约束条件漏写:该禁止的没有说

约束条件不是负面词堆砌,而是告诉模型什么不能发生。短剧生产里,最有价值的约束通常和连续性有关。

常见约束

  • 有参考图的人物,不改变服装、发型、五官
  • 本场只出现指定人物,不新增陌生角色
  • 不使用未绑定的道具
  • 不改变场景布局
  • 不突然切换年代、服饰和建筑风格
  • 不加入现代物品,除非剧本明确要求

穿越、闪回、重生题材还要特别注意时代造型。同一个角色可能有现代装和古代装,系统需要按场景地点和剧情时间选择对应定妆图。如果绑错参考,提示词写得再好也会穿帮。

道具也不是越多越好。每场只保留剧情真正需要的道具。无关道具挤占参考槽位,还可能让模型把注意力放错地方。

一条可执行的提示词检查顺序

写完整场提示词后,不要立刻出片。按下面顺序检查一遍:

  1. 主体:镜头看谁,谁在前景,谁在反应?
  2. 动作:是否写成了可拍摄的连续动作?
  3. 场景:空间、陈设、人物位置是否明确?
  4. 光影:光源、方向、色调、时间是否交代?
  5. 运镜:是否只有一个主要镜头运动?
  6. 风格:是否与定妆、场景、道具保持同一画风?
  7. 画质:面部、水印、乱码、肢体、分身是否兜底?
  8. 约束:服装、道具、人物数量、时代是否被锁住?

这八项不是为了把提示词写长,而是为了减少返工。短剧生产里,最贵的不是第一次生成,而是同一场反复改词、反复换图、反复重拍。

简单场景和复杂场景要分开处理

不是每场都需要写成复杂三段式。提示词长度应服从场块复杂度。

简单场景:一段式

适合单人反应、对白特写、静态情绪戏。结构可以是:主体 + 动作 + 场景 + 光影 + 运镜 + 约束。

女主坐在审讯桌后,低头看着文件,手指慢慢收紧。冷白顶灯从上方落下,背景压暗。镜头固定在中近景,轻微推近。保持女主面部稳定,无水印,无乱码文字。

复杂影视化场景:三段式

适合多人调度、动作推进、情绪转折。结构可以是:

  1. 总体设定:场景、时间、光影、风格
  2. 镜头分段:镜头 1、镜头 2、镜头 3,各自写主体和动作
  3. 约束包:人物一致性、道具限制、画质兜底

复杂场景不要把所有动作塞进一个长句。按镜头序号拆开,模型更容易执行。

场块粒度决定提示词质量

很多提示词问题,本质上是场切得太大。一个场块如果塞进太多剧情、太多人物、太多动作,再强的模型也容易失控。

更稳的生产方式,是把一集切成约 10 秒左右的视频场块。每个场块只承担一个主要动作或情绪转折。正文过长时,再按动作节拍、空段和句号继续拆。

这不是时间码精剪,而是工程启发式。它的价值在于:每个场块都有独立提示词、独立参考图、独立成片和历史 takes。哪一场坏了,就重拍哪一场,不必整集重来。

需要承认的是,约 10 秒的场块不是精确剪辑单位,仍然可能出现偏长的块。精剪、串场、节奏压缩仍需要后续剪辑环节完成。

提示词写完后,还要做这三件事

1. 核对参考图顺序

每场参考素材建议按“场景图 → 本场道具图 → 人物定妆图”的顺序构建。有图才占槽位,没有图就标明仅文字,不要强行编造绑定。

2. 确认角色称呼绑定

剧本里可能写“警官”“她”“那个男人”,但档案里的角色有正式姓名。拍摄前要确认称呼和定妆图绑定正确,尤其是客串、泛指角色和群演。

3. 保留重拍版本

同一场可以多拍几条,通过改词、换参考图、换模型档位得到不同 takes。不要只留一条结果。短剧生产需要择优,而不是把第一次生成当终审。

诚实边界:提示词不能解决所有问题

再好的提示词也有边界。

  • 没有成片自动打分或自动择优重拍引擎,最终质量仍由创作者判断。
  • 参考图不是强制门禁,缺图可以跳过纯文字生成,但质量通常更差。
  • 当前产品单元主要是“单场多模态参考 → 单段成片”,不做跨场自动续写或延长视频的产品化工作流。
  • 角色一致性依赖定妆资产链路,不是人脸嵌入校验;最终观感仍取决于立绘质量和提示词是否遵守“有图不写外观”。

所以,提示词规范的价值不是承诺零失误,而是把可控的部分先控住。把重复、易漂移、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。

常见问题

AI 短剧视频提示词为什么越写越长还是会崩?

因为长度不等于有效信息。模型需要的是主体、动作、场景、光影、运镜、风格、画质和约束这些可执行信息;如果只是堆形容词和情绪词,它仍然需要自由发挥,自然容易翻车。

有角色参考图后,提示词还要不要描写服装和长相?

不要。有参考图的人物,外观应以参考图为准,提示词只写动作、表情、伤情和调度。重复描写服装、发型、五官,反而可能和参考图冲突,造成换装或换脸。

一个镜头里可以同时推近、环绕和拉升吗?

不建议。稳定做法是一镜一运镜,一个镜头只保留一个主要运动。复杂调度应拆成多个场块或多个镜头,否则容易出现画面眩晕和主体丢失。

为什么 AI 视频里的人物会突然换衣服?

常见原因是文字提示词重新描写了服装外观,或者本场绑定了错误的人物定妆图。解决方法是先锁定定妆资产,提示词不再改写外观,并在拍摄前核对角色绑定。

视频场块为什么要切成约 10 秒?

这是为了让每个场块只承担一个主要动作或情绪转折,降低模型失控概率。每个场块有独立提示词、参考图和成片,出问题时可以只重拍一场,而不是整集重来。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com