AI 短剧动作戏别让模型「自己演完」:把一个动作拆成可拍的三段

猫斯卡编辑部 | 最后更新日期

AI 短剧动作戏崩,多半崩在「让模型一次演完一整套动作」。稳的写法不是少写动作,而是把动作拆短、写清起止、降低单镜爆发强度,让每个镜头只承担一个可验证的肢体变化。

先给结论:动作越像「完整表演」,越容易失控

很多 AI 短剧动作戏的问题,不在拳打脚踢本身,而在提示词把「冲过去、抓住、转身、摔倒、怒吼、镜头甩动」全塞进一个镜头。模型要同时理解身体重心、接触关系、服装摆动、景别变化和运镜,任何一项没对齐,画面就会出现穿模、肢体数量错误、接触点漂移或表情突变。

更稳的动作提示词,不是追求文字上的激烈,而是追求镜头上的可执行:

  • 一个镜头只表现一个主要肢体变化;
  • 动作有明确起点和终点;
  • 速度、幅度、重心方向可被画面看见;
  • 运镜不跟动作抢戏;
  • 参考图负责外观,文字只负责动作。

这也是 AI 竖屏短剧和真人拍摄最不一样的地方:真人演员可以完成连续调度,AI 模型更适合被喂给「短、清楚、低歧义」的镜头任务。

高爆发瞬间为什么容易崩

高爆发动作通常同时包含三个难点:快速位移、身体接触、剧烈形变。比如挥拳、踢腿、扑倒、摔砸、转身抽刀、拥抱后推开。它们在真人片场可以靠武术指导、替身、剪辑点解决,但在 AI 视频里,如果一个镜头要求模型从头演到尾,就容易出现以下问题。

崩坏类型常见原因更稳的处理
手部畸形、多出手指手部在高速运动中缺少稳定姿态把手部动作停在明确姿态:握拳、抓住衣领、按住桌面
接触点漂移模型没有真正理解「谁碰到谁」写成静态接触关系,减少接触中的滑动
脸部突变头部快速转动或头发遮挡改成转头前或转头后的稳定表情
服装穿模大幅动作叠加宽松衣物降低动作幅度,让衣料变化保持连续
道具消失或变形快速挥动时道具形态不稳定先拍手持道具的稳定画面,再切反应镜头
镜头晃到失焦动作和运镜同时剧烈变化一镜一运镜,动作段用固定或缓慢推进

这里的关键不是「AI 不能拍动作戏」,而是不要把动作戏的高潮全部压在同一个生成片段里。短剧观众要的是节奏和情绪,不一定需要每个打击点都被完整看见。

把动作拆成三段:起势、过程、落点

传统剪辑里,动作常常不是靠一个长镜头完成,而是靠多个镜头拼接。AI 短剧也可以借用这个思路。一个完整动作可以拆成三段,每段只让模型完成一个稳定任务。

1. 起势:让观众知道要发生什么

起势镜头负责蓄力。它不一定激烈,但必须给出方向和意图。

可写的动作:

  • 人物肩膀微沉,右手缓缓握拳;
  • 目光锁定对方,脚步向后撤半步;
  • 手指触到杯沿,停住;
  • 衣袖下的手慢慢收紧。

这类动作的优点是幅度小、重心清楚、脸部稳定,模型更容易生成可信画面。

2. 过程:用局部动作代替全身爆发

过程镜头不要写「他冲过去把对方打翻在地」这种整句表演。更好的方式是写局部:脚步、手、眼神、衣角、道具接触。

比如:

  • 皮鞋向前迈一步,地面水纹被踩开;
  • 一只手猛地扣住对方手腕;
  • 椅腿在地上擦出短距离;
  • 袖口扫过桌面,茶杯晃动。

局部动作能降低身体协调难度,也更适合竖屏构图。观众通过碎片自己补完动作,反而比模型硬演完整打斗更顺。

3. 落点:把结果拍清楚

落点是动作戏里最重要的一刀。观众真正记住的,往往是打完之后的状态。

可写的落点:

  • 对方靠墙,衣领被揪住,呼吸急促;
  • 刀落在地上,人物的手还悬在半空;
  • 主角站定,衣角缓慢落下;
  • 杯沿碎裂,茶水沿桌沿滴落。

落点要稳定、明确、可回看。它承担的是情绪结果,而不是继续增加动作复杂度。

低缓连续动作为什么更稳

低缓连续动作,不等于慢动作,也不等于没有张力。它指的是动作方向单一、速度可控、起止清楚。

比如:

  • 缓缓抬头;
  • 手指收紧;
  • 向前逼近半步;
  • 放下手中的照片;
  • 眼神从闪躲变为直视;
  • 雨水顺着发梢滴落。

这些动作之所以稳,是因为它们不需要模型在短时间内解决大量身体协调问题。它们有连续轨迹,没有突然的方向反转,也较少出现手脚同时大动的情况。

在竖屏短剧里,低缓连续动作还有一个优势:它更适合近景和特写。竖屏画面的视觉焦点集中在人物上半身、脸和手部,细微变化更容易被看见。与其让模型生成一个全身飞踢,不如拍三个稳定近景:眼神、手部、落点。

提示词里少写「剧烈副词」,多写可画出来的细节

很多动作提示词看起来很猛,其实很难生成。比如「极其愤怒地狠狠一拳砸在桌上,震得杯子全部飞起,镜头剧烈晃动」。这句话里有情绪、有动作、有道具反应、有运镜,但没有给模型一个稳定的视觉终点。

更可执行的写法是把程度量化、把结果固定:

不稳定写法更稳的写法
狠狠一拳砸过去右拳砸在桌面,指节发白,杯盏轻颤
他暴怒地冲过来他向前逼近半步,肩膀压低,目光锁住对方
一把甩开她他的手扣住对方手腕,向侧面推开半臂距离
刀光一闪刀刃停在对方面前,寒光从刀面划过
镜头疯狂晃动镜头固定,人物动作带起衣角轻微摆动

判断标准很简单:如果一句话需要演员花五秒钟连续表演,它就不适合直接塞进一个 AI 镜头。如果它能被画成一张关键帧,再让动作从这个姿态轻微延续,它就更稳。

运镜要给动作让路

动作戏一崩,很多人以为是模型不够强。其实常见问题是提示词同时要求「人物大动作」和「镜头大运动」。一镜内推、拉、摇、移叠加,会让模型更难判断主体边界。

更稳的原则是:一个镜头只给一个运镜任务

  • 对峙戏:固定镜头或极慢推进;
  • 逼近戏:跟一步即可,不要绕拍;
  • 打击落点:切近景,镜头不甩;
  • 情绪爆发:让表情和手部承担张力,镜头保持稳定;
  • 环境反应:单独拍空镜或道具特写,不要和主体动作混在一起。

镜头语言不是越满越好。短剧节奏快,靠的是剪辑点和信息密度,不是每个镜头都在运动。

参考图管外观,文字管动作

AI 短剧角色一致性最容易在动作戏里破功。原因之一是提示词一边绑了人物参考图,一边又用文字重新描写服装、发型、配饰。模型在参考图和文字之间摇摆,就可能出现换装、换脸、饰品消失。

更稳的规则是:

  • 有参考图的人物,不再写服装和外观;
  • 文字只写动作、表情、伤情;
  • 需要换造型时,先换对应定妆图,不要靠文字临时改;
  • 道具如果本场重要,先准备道具参考图;
  • 动作中不要追加复杂外观变化。

一句话:参考图决定人物长什么样,提示词决定人物这一秒做什么。

用剪辑点替代「一次生成完整打斗」

如果一场戏必须有强冲突,可以用剪辑结构制造激烈感,而不是强迫单个片段完成高难度动作。一个可参考的短场结构是:

  1. 环境或道具特写,给出危险信号;
  2. 人物起势近景,交代意图;
  3. 局部动作特写,表现接触;
  4. 反应镜头,表现情绪;
  5. 落点镜头,交代结果。

这样做有三个好处:

  • 每个生成片段更短、更稳定;
  • 观众通过剪辑自行补完动作,减少穿模被注意到的概率;
  • 某一条不满意时,只需要重拍单场,不必整段重来。

高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的。动作戏尤其如此。

什么时候可以用高爆发动作

不是所有高爆发动作都要回避。以下情况可以尝试,但仍建议缩短时长、减少同屏元素:

  • 动作方向单一,比如直直倒下、向前伸手;
  • 没有复杂身体接触;
  • 人物服装贴身,头发和飘带较少;
  • 景别较近,只拍局部;
  • 结果比过程重要,可以用落点镜头承接;
  • 可以接受多拍几条,从中择优。

不建议硬上的情况包括:多人混战、连续踢打、宽松长袖大动作、快速转身加道具、水中或雨中打斗、角色同时奔跑加台词。这些场景对模型的身体理解和物理一致性要求太高,成片率通常不稳定。

一个更稳的动作提示词检查清单

写动作镜头前,可以逐项过一遍:

  1. 这个镜头是否只有一个主要动作?
  2. 动作的起点和终点是否清楚?
  3. 是否避免了快速方向反转?
  4. 是否把全身大动作拆成了局部动作?
  5. 运镜是否只有一种?
  6. 有参考图的人物,是否没有再写服装外观?
  7. 道具是否有明确位置和状态?
  8. 是否可以用落点镜头代替过程镜头?
  9. 如果这一条崩了,是否能只重拍这一个场块?

如果其中超过三项答不上来,就不要急着出片。先把镜头拆小,往往比反复换模型更有效。

诚实边界

这套方法能提高动作戏的稳定性,但不能保证每条都一次成功。它的本质是降低单镜任务难度,而不是让模型自动完成复杂武行调度。多 take、改词重拍、局部替换,仍然是专业流程的一部分。

猫斯卡的做法,是把这些稳定性原则固化进镜头提示词规范和场块流程:约 10 秒一个视频场块,每场独立提示词、独立参考图、独立成片与历史 takes;提示词按主体、动作、环境、光影、运镜、风格、画质、约束来组织,并强调一镜一运镜、低缓连续动作、有参考图不写外观。它不替代导演判断,而是把容易漂移的执行细节变成可检查、可回退的生产步骤。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com