为什么高爆发动作容易崩,低缓连续动作更稳
AI 视频里高爆发动作容易崩,不是模型不行,是你让它在一镜里同时预测了太多关节的剧烈位移。把动作拆成低缓、连续、可量化的单步,稳定性会立刻上来。
高爆发动作为什么崩
AI 视频生成的本质,是模型根据首帧和提示词,逐帧预测下一帧的像素。动作越剧烈、参与的关节越多、速度变化越快,每一帧需要同时猜对的变量就越多——手、肘、肩、腰、膝、脚、重心、衣物、头发、道具,任何一个环节预测偏一帧,后面就会连锁错位。
动作崩坏是指模型在生成过程中出现肢体扭曲、多手指、关节反折、人物瞬移、道具穿模、衣物与身体分离等可见错误。它不是审美问题,是时序预测失败。
高爆发动作(腾空飞踢、猛力挥拳、高速转身、摔倒砸地、连续翻滚)之所以是重灾区,是因为它们同时踩中了三个雷:
- 单帧位移大:相邻两帧之间肢体位置跳变,模型容易猜错中间态。
- 关节耦合复杂:一个动作同时牵动肩、肘、腕、腰、腿,错一个就全乱。
- 速度不均匀:有加速、有制动、有瞬间停顿,模型对变速的预测远比对匀速的预测差。
这不是提示词写得不够华丽就能解决的。恰恰相反,越是用「迅猛」「凌厉」「电光火石」这类形容词堆出来的动作描述,模型越不知道每一帧具体该画什么。
低缓连续动作为什么稳
低缓连续动作的核心特征是:速度均匀、方向单一、参与关节少、每帧位移小。
- 「缓缓抬手」比「猛地挥出一拳」稳,因为手的轨迹是一条平滑曲线。
- 「慢慢转头看向镜头」比「突然回头」稳,因为颈部旋转角度可预测。
- 「向前走两步」比「飞身跃起」稳,因为重心始终在支撑面内。
- 「手指轻轻敲桌面」比「一掌拍碎桌子」稳,因为手指动作幅度小、不涉及全身联动。
模型对这类动作的预测几乎是在做插值:知道起点,知道终点,中间每帧变化不大,猜中的概率自然高。
这不是让你所有戏都拍成慢动作。短剧需要爽点、需要冲突、需要爆发力。关键是怎么把高爆发动作翻译成模型能稳定执行的形态。
把高爆发动作拆开写的三条原则
原则一:一个镜头只承载一个动作意图
一镜一运镜之外,还要一镜一动作。不要在同一段视频提示词里写「他猛地站起来,掀翻桌子,冲过去掐住对方脖子」——这是三个动作,每个都涉及不同的关节组合和重心变化,模型会在切换处乱掉。
正确做法是拆成三个场块:
| 场块 | 动作 | 运镜 |
|---|---|---|
| 场 1 | 男子双手撑桌,缓缓站起,椅子向后滑开 | 中景固定 |
| 场 2 | 男子手臂横扫,桌面物件散落 | 侧近景,轻微横移 |
| 场 3 | 男子跨步上前,伸手抓住对方衣领 | 正面中景,跟随 |
每段只做一件事,每件事的速度都可控。观众在剪辑台上连起来看,感受到的是一气呵成的爆发;模型在生成时面对的是三个稳定的单步。
原则二:用程度量化代替情绪形容词
「狠狠扇过去」是情绪,不是动作指令。模型不知道「狠狠」对应多大的角速度、多大的手臂摆动幅度。
把形容词翻译成可量化的肢体描述:
| 情绪化写法(不稳) | 量化写法(稳) |
|---|---|
| 猛地一拳砸在桌上 | 右手握拳抬起约二十厘米,向下砸向桌面,接触时手指微微张开 |
| 狠狠一巴掌 | 右手从肩侧抬起,手臂伸直,向左水平挥出,停在对方脸颊侧 |
| 突然转身就走 | 双脚不动,上半身向左转约九十度,然后迈步向前走 |
| 悲痛地跪倒 | 双膝依次弯曲,膝盖触地,上身缓慢前倾 |
注意「停在对方脸颊侧」这种写法——它给了模型一个明确的终点位置,避免挥击动作因为没有终止条件而无限延伸、导致手臂变形。
原则三:爆发的前一拍和后一拍比爆发本身更重要
真正让观众感受到力量的,不是击中的那一帧,而是击中前的蓄力和击中后的反应。这两拍恰好都是低缓动作,模型最擅长。
一个完整的「打耳光」爽点,在 AI 短剧里应该这样分配:
- 蓄力(稳):抬手,手臂后引,表情收紧——约 1.5 秒,低缓。
- 挥击(可省略或极短):手臂挥动的中间过程——这是最容易崩的半秒,能不拍就不拍,用切镜或音效盖过去。
- 击中反应(稳):对方头部被打偏,头发甩动,手捂脸,停顿——约 2 秒,低缓。
观众脑补出来的那一巴掌,比模型硬画出来的一巴掌要狠得多,也稳得多。
提示词里的动作写法清单
写视频提示词的动作部分时,按这个顺序检查:
- 主体明确:谁在动,哪个身体部位在动,写清楚。
- 方向单一:一个动作句里只有一个方向(上/下/左/右/前/后),不要「先左后右再转身」。
- 幅度量化:用「约几厘米」「约九十度」「两步」「微微」「缓缓」这类可感知的程度词。
- 有终点:动作停在哪里、手放在什么位置、身体朝向哪里,交代清楚。
- 速度均匀:优先「缓缓」「慢慢」「匀速」,少用「猛地」「突然」「瞬间」。
- 减少联动:能只动手就不动腰,能只动头就不转身。
- 道具最后加:先把裸动作写稳,再让手里拿东西。道具是额外的变量,能晚加就晚加。
这七条对应的是同一件事:降低每一帧需要同时猜对的变量数。
场块粒度与动作稳定性
短剧成片看起来节奏快、冲突密,但那是剪辑的结果,不是单场生成的结果。把剧本切成约 10 秒一个场块,本质上就是在帮你把动作拆到模型能承受的粒度。
如果一场戏的正文超过约 200 字、或者包含多个连续动作,应该主动再拆。拆的依据不是时间码,是动作节拍:一个动作意图结束、下一个动作意图开始的地方,就是切点。
群演和泛指角色(「围观的人」「几个手下」)要从主演名单里剥离,因为他们的动作不可控,会挤占模型对主角动作的注意力。人越少、动作越简单、画面越稳。
什么时候可以用高爆发动作
不是所有高爆发动作都不能用。以下情况可以尝试,但要有心理预期:
- 远景或全景:人物在画面里占比小,肢体细节看不清,轻微崩坏不明显。
- 剪影或逆光:轮廓为主,关节错位被光影掩盖。
- 遮挡转场:挥击的瞬间用前景物体(门框、柱子、甩过的头发)遮挡半秒,切到反应镜头。
- 非写实画风:动画、漫画、黏土等风格本身对肢体精确度的容忍度高于写实。
即便在这些场景里,也建议先出低缓版本确认构图和运镜,再在确认过的基础上替换动作描述——不要在构图都没定的时候就上高难度动作,浪费 takes。
诚实边界
动作稳定性最终受限于底层视频模型的能力上限,提示词优化能显著降低崩坏率,但不能让一个本身不擅长复杂动作的模型突然变得擅长。多 take 择优、改词重拍、必要时用剪辑和音效规避高难度中间帧,仍然是专业流程的一部分。
把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com