AI 短剧分镜提示词怎么写才不崩:从小说腔到分镜表语言

猫斯卡编辑部 | 最后更新日期

AI 视频提示词最常见的翻车,是把镜头说明写成了小说段落。模型读到的是情绪和形容词,片场需要的却是主体、动作、景别、运镜、光影和约束——把这六类信息补齐,成片稳定性会立刻上一个台阶。

为什么你的提示词像小说,不像分镜

很多团队写 AI 短剧提示词时,习惯这样开头:「深夜,她独自走在空无一人的街道上,心里充满了委屈与不甘……」这类句子人读着很有画面感,但对视频模型来说信息密度很低:谁是主体?镜头是近景还是全景?机位动还是不动?光是冷还是暖?动作持续几秒?这些都没说。

镜头提示词不是文学描写,是给拍摄系统的执行单。 它的任务不是让读者感动,而是让模型在 5–15 秒内稳定地拍出一段可用素材。

判断一段提示词是否合格有个简单标准:删掉所有形容词之后,剩下的名词和动词能不能让一个摄影师独立架起机器拍出来。如果不能,这段词大概率会飘。

从小说腔切换到分镜表语言

两种写法的核心差别,可以用一张对照表说清:

小说腔写法分镜表写法差别
「她悲伤地站在雨中」「中景,女主正面,雨滴沿脸颊滑落,低头后缓慢抬眼看向镜头」后者给了景别、主体、具体动作
「气氛紧张到极点」「冷色侧光,手持微晃,背景警灯红蓝闪烁」用光影和镜头语言代替情绪形容词
「他猛地冲了过去」「全景,男主从画面右侧入画,三步快跑至门前,手按上门把」动作量化、有起止点
「画面很有电影感」「2.39:1 遮幅,浅景深,暖色轮廓光,35mm 镜头质感」把「电影感」拆成可执行参数

切换思路的关键一句话:系统在教模型用分镜表语言说话,而不是写小说。 形容词是留给导演和观众的,提示词里要换成镜头决策。

八大要素:一段合格提示词的骨架

无论场景简单还是复杂,一段能稳定出片的镜头提示词,都应该覆盖以下八类信息。不要求每次八类都写满,但缺哪一类,哪一类就会交给模型随机发挥。

  1. 精准主体:谁在画面里,是主演还是群演,服装外观以参考图为准,文字不再重复描写。
  2. 动作细节:具体到肢体,有起止点和程度,比如「缓慢抬手」而不是「做了个动作」。
  3. 场景环境:内景还是外景,具体地点,时间是日是夜,有哪些可见陈设。
  4. 光影色调:光源方向、色温倾向、明暗对比、是否有特效光(警灯、闪电、屏幕光)。
  5. 镜头运镜:景别(远/全/中/近/特)、机位角度、运镜方式(推/拉/摇/移/跟/固定),一镜一运镜
  6. 视觉风格:与全剧画风一致的风格标签,比如都市写实、国风工笔、3D 国漫等。
  7. 画质:分辨率、清晰度、面部稳定、无畸变等兜底要求。
  8. 约束条件:不能出现什么——无多余人物、无水印 Logo、不换装不换脸、多人场景不出现双胞胎。

这八类里,前五类决定画面内容,后三类决定画面不崩。新手常把精力全放在前两类,忽略后三类,结果就是动作拍对了,但脸换了、多了个路人、角落冒出个 Logo。

三段式写法:复杂场景的结构

简单场景(比如一个人坐着说台词)可以一段写完。一旦场景里有多人、多动作、多节拍,就应该用三段式结构,把信息分层。

第一段:总体设定

交代这一场的环境、光影、风格、画质基调。这一段是整场共用的底色,只写一次。

例:内景,老旧出租屋客厅,夜晚,仅一盏台灯提供暖色顶光,窗外有霓虹余光反射,都市写实画风,画面清晰,面部稳定。

第二段:镜头序列

按镜头序号写,每个序号对应一个镜头动作,不要写「0–3 秒」这种绝对秒数。用「镜头 1」「镜头 2」标注,每个镜头只给一个运镜。

例:

镜头 1:中景,女主坐在沙发边缘,双手紧握纸杯,低头不语,固定机位。

镜头 2:特写,纸杯被捏变形,杯沿水痕渗出,缓慢推近。

镜头 3:近景,女主抬眼,眼中有泪光,视线投向画外左侧门口。

第三段:约束包

集中写这一场的禁止项和兜底要求,避免散落在各处被模型忽略。

例:女主服装与外观以参考图为准,文字不重复描写;不出现多余人物;无水印 Logo;多人场景避免双胞胎;动作低缓连续,无高爆发突变。

三段式的好处是:模型先建立环境底色,再按序执行动作,最后被约束兜底。比起一大段揉在一起的散文,结构清晰的提示词出片稳定性明显更高。

一镜一运镜:最容易违反的一条规则

新手提示词里最常见的错误,是在一个镜头里堆好几种运镜:「镜头从远景缓缓推近,然后摇到她的脸,再拉远露出身后的人」。这种写法对真人剧组都需要调度,对模型更是灾难——它会在推、摇、拉之间随机切换,结果往往是画面抽搐、主体漂移、动作断裂。

一镜一运镜的意思是:一个镜头编号下,只允许一种主要运镜。需要复杂调度,就拆成多个镜头序号。

错误写法正确拆分
推近再摇到脸部镜头 1:中景缓慢推近至近景;镜头 2:近景固定,人物转头露出侧脸
拉远同时环绕镜头 1:中景缓慢拉远至全景;镜头 2:全景固定机位环绕 30 度
跟拍然后急停镜头 1:中景跟拍人物前行;镜头 2:人物停步,机位固定

拆镜头不是妥协,是专业。真人剧组也是这么干的。

动作原则:低缓连续,程度量化

AI 视频在高爆发动作上最容易崩:快速奔跑、激烈打斗、突然转身、大幅度手势,这些都是重灾区。原因不是模型不会动,而是大幅动作的中间帧插值空间太大,模型容易「脑补」出畸形肢体。

工程化的做法是两条:

  • 优先低缓连续动作:能用「缓慢抬手」就不用「猛地挥手」;能用「走三步」就不用「冲刺」。
  • 程度量化:「微微低头」比「低头」好,「嘴角抽动一下」比「表情复杂」好,「眼泪沿右颊滑落」比「哭了」好。

这不是在限制创作,是在把动作拆成模型能稳定插值的粒度。真正需要爆发力的瞬间,可以用剪辑节奏(切特写、切反应镜头)来制造冲击,而不是逼模型在一个镜头里完成高难度动作。

符号规范:台词、音效、BGM 怎么标

提示词里混入声音元素时,用统一符号标注,避免模型把台词当成画面内容去演,或把音效理解成视觉元素。

  • 台词用花括号:{你到底是谁?}
  • 音效用尖括号:<雷声轰鸣>
  • BGM 用圆括号:(低沉弦乐渐起)

这套符号的作用是分流:画面描述负责画面,声音标注负责声音轨道,互不干扰。如果把台词直接写在正文里,模型可能会试图让人物「说出」这句话的同时做出奇怪的口型,甚至把台词文字渲染到画面上。

兜底包:每段提示词都该带的安全网

很多翻车不是主体和动作写错了,而是没写「不要做什么」。一段专业提示词的末尾,应该有一组固定的兜底约束,根据场景按需组合:

  • 画质兜底:画面清晰,面部稳定,无畸变,无水印 Logo。
  • 多人兜底:多人场景避免双胞胎、分身、多余手指。
  • 一致性兜底:有参考图的人物,服装与外观以参考图为准,文字不重复描写。
  • 风格兜底:非写实画风需锚定风格标签,不向写实漂移。
  • 动作兜底:动作低缓连续,无突发高爆发动态。

兜底包不是越长越好,但关键几条不能省。一致性靠资产,不靠运气——参考图解决「长什么样」,兜底包解决「别乱变」。

本场素材原则:禁止串戏

提示词生成时,系统只应该给当前这一场的素材:本场的场景图、本场出现的道具、本场出场人物的定妆图。上一场的雨伞、下一场的礼服、别的角色的发型,都不应该混进本场提示词的参考范围。

串戏是 AI 短剧的经典翻车源:第三集的角色突然穿上了第八集才会出现的衣服,客厅戏里冒出了厨房的道具。原因通常不是模型记错,而是提示词阶段就把不该出现的素材喂了进去。

人工审词时,最后做一个检查:这段提示词里提到的每件道具、每个人物,是不是都在本场戏里出场? 不是的就删掉。

合规清洗:别把 IP 名写进提示词

很多创作者习惯用「像某部电影一样」「类似某导演风格」来描述视觉。这类写法有两个问题:一是可能触发下游模型的版权拦截,任务直接失败;二是即使不拦截,模型对「像某部电影」的理解也极不稳定,出来的画面可能和你想的完全不是一回事。

正确做法是把参考对象拆成技法描述:不说「像某电影的色调」,而说「青橙对比色调,高反差,阴影偏青」;不说「某导演的长镜头」,而说「缓慢横移,中景跟随人物,无剪辑」。技法是通用语言,IP 名是风险源。

诚实边界:提示词规范解决不了什么

这套规范能大幅提升出片稳定性,但它不是万能钥匙,有几件事它做不到,需要提前知道:

  1. 它不替代导演的审美判断。 规范保证的是「不崩」,不保证「好看」。景别、节奏、情绪落点,仍然是创作者的决策。
  2. 约 10 秒的场块是工程启发式,不是时间码精剪。 超长场会再拆,但仍可能出现偏长的块,精剪与串场成片需要后续剪辑环节。
  3. 当前不做跨场自动续写或延长视频的产品化工作流。 产品单元是「单场多模态参考 → 单段成片」,长镜头和跨场调度需要人工拆段再剪辑。
  4. 角色一致性依赖定妆资产链路,不是人脸嵌入校验。 提示词遵守「有图不写外观」只是第一步,最终观感仍取决于定妆图本身的质量。

把重复的、易漂移的、易失控的部分变成可约束的流水线,审美判断仍然坐在人这边。提示词规范做的是前者,后者永远是创作者的活。

一张上手用的自检清单

写完一段提示词,提交之前,过一遍这张表:

检查项是/否
是否写清了精准主体(谁、几个、在画面什么位置)
动作是否具体到肢体、有起止点、程度可量化
是否交代了场景(内/外、地点、日夜)
是否写了光影与色调倾向
是否只有一种主要运镜(一镜一运镜)
复杂场景是否用了三段式结构
是否用镜头序号而非绝对秒数
台词、音效、BGM 是否用了统一符号
是否带了画质与一致性兜底包
是否只引用本场素材,没有串戏
是否剥离了具体影视作品 / IP 名称

十一项全部打勾,这段提示词就已经超过了市面上大部分「AI 电影感提示词」的水准。剩下的,交给多 take 择优——同一场拍几条,选最稳的一条用,这和真人片场的工作方式没有区别。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com