写 AI 短剧视频提示词前,先把这八格填满

猫斯卡编辑部 | 最后更新日期

AI 视频翻车,很多时候不是模型不行,而是提示词里有信息空位。你不写主体在做什么,模型就替你编;你不写约束,它就自由发挥。把八格填满,是把生成从抽奖变成施工的第一步。

把提示词当成一张分镜表,而不是一段散文

很多新人写视频提示词,习惯写成一段气氛描写:「雨夜,女主站在窗前,神情复杂,镜头缓缓推进,电影感十足。」读起来像小说,但模型拿到这种句子会面临大量未填空位——女主穿什么、窗前是什么窗、推进多快、什么叫电影感、要不要避免脸崩,全部要它自己猜。

视频提示词是一张分镜表,不是一段散文。 它的任务不是抒情,而是把这一场镜头必须确定的信息,一格一格交代清楚。

我们建议在落笔前,先在脑子里(或草稿纸上)画出下面这张八格表,每写一场都过一遍。

八格清单:每场开拍前必填

序号要素这一格回答什么问题缺了会怎样
1精准主体镜头里是谁、穿什么、什么状态模型自行脑补外貌,与定妆图打架
2动作细节他/她在做什么动作,幅度多大动作僵硬、抽搐、或做出剧本外的行为
3场景环境在哪里、室内外、有什么陈设背景漂移、串到别的戏
4光影色调光源方向、色温、明暗对比画面发灰、氛围跳脱、与全剧不统一
5镜头运镜景别、机位、运动方式一镜内推拉摇移叠加,眩晕或崩坏
6视觉风格画风、材质、年代感人物是日漫、视频变写实的断层
7画质要求清晰度、面部稳定、无水印糊脸、多肢体、Logo 乱入
8约束条件不能出现什么、必须守住什么双胞胎、分身、穿帮、IP 元素

这八格没有先后高低之分,但有一条原则:有参考图的格,文字就不要再描写。 比如人物已经绑了定妆图,第一格「精准主体」只写身份和当下状态(「林晚,右脸有擦伤」),不要重复写她穿什么颜色的裙子——那是定妆图的活,文字再写一遍反而会和图打架,导致换装。

逐格拆解:每格该写什么、不该写什么

1. 精准主体:写身份与状态,不写外貌说明书

主体格要让模型一眼认出「这是谁」。正确写法是点出角色身份、当下的可见状态(伤痕、淋湿、疲惫),而不是把五官、发型、服装再描述一遍。

  • ✅ 「林晚,警服领口微敞,右颊有一道新擦伤」
  • ❌ 「二十多岁女性,瓜子脸,大眼睛,黑色长发,身穿蓝色警服,脚踩黑色皮靴」(如果已经绑了定妆图,这段纯属帮倒忙)

群演和泛指角色(「路人甲」「围观群众」)不要塞进主角格,他们会挤占定妆槽位,应该单独标注为背景元素。

2. 动作细节:用低缓连续动作,少用高爆发

AI 视频模型对大幅度、高速度动作的处理普遍不稳定。动作格要把动作拆细、程度量化,并优先选择可连续完成的动作。

  • ✅ 「她缓缓抬手,指尖触到玻璃窗,停住」
  • ❌ 「她猛地转身,一脚踹翻桌子,飞身跃起」(三个高爆发动作叠在一镜里,崩坏概率极高)

如果剧本确实需要打斗、奔跑这类大动作,应该靠剪辑拆成多个场块分别生成,而不是指望一条提示词搞定。

3. 场景环境:从剧本结构里解析,不要手填

场景应该来自剧本的「内/外 | 地点 | 日夜」结构,而不是临场编。这一格写清楚空间属性和关键陈设即可,不必把整个房间描写一遍。

一条容易被忽略的纪律:场景参考图严禁出现人物。 空镜就是空镜,一旦场景图里有人,模型会把那个人也当成主体参考,导致鬼影或多余角色。

4. 光影色调:写光源,不写形容词

「电影感」「高级感」这类词对模型是无效指令。光影格要写具体的光源方向和色温。

  • ✅ 「单侧窗光从画面左侧打入,冷色调,面部右侧处于阴影中」
  • ❌ 「光影绝美,氛围感拉满,电影质感」

光影也是维持全剧统一的重要锚点,建议在画风手册阶段就定下几套常用光位,拍摄时直接调用。

5. 镜头运镜:一镜一运镜

这是新手翻车最密集的一格。铁律是一个镜头只给一种运镜方式,不要在同一条提示词里写「推近同时环绕再上摇」。

另一条铁律:用镜头序号,不用绝对秒数。 写「镜头 1:中景,固定」「镜头 2:特写,缓慢推近」,不要写「0–3 秒推近,3–5 秒拉远」。秒数指令在大多数模型里不会被精确执行,反而会干扰时序理解。

复杂场景可以走三段论结构:

  1. 总体设定(场景、主体、画风)
  2. 镜头 1 / 镜头 2 / 镜头 3(各自独立的景别与运镜)
  3. 约束包(画质、稳定、禁忌)

简单场景一段式写完即可,不必硬凑三段。

6. 视觉风格:全链路共用一条风格路径

画风不是视频阶段才决定的事。人物立绘、场景立绘、道具立绘、视频提示词必须共用同一条风格路径,否则会出现「人物是日漫、视频变写实」的断层。

选定画风后,这一格只需要注入该画风对应的视频风格标签,不要在提示词里临时改画风。

7. 画质要求:用兜底包,不要靠运气

画质格应该有一套固定的兜底描述,每场都带,包括:清晰度要求、面部稳定、无水印无 Logo。这不是创意部分,是保险。

多人场景还要额外加「避免双胞胎/分身」的兜底——模型在处理多张相似面孔时,经常把一个人渲染成两个。

8. 约束条件:写明「不能出现什么」

约束格是负面清单。常见的包括:不出现剧本外的人物、不出现现代穿帮物品(古装戏)、不出现文字水印、不改变人物服装。

这一格还有一个合规功能:提示词交付前应剥离具体影视作品或 IP 名称,只保留技法与美学描述,降低下游的版权拦截风险。想致敬某部片子的光影,可以描述光位本身,不要直接写片名。

台词、音效、BGM 的符号规范

八格之外,提示词里如果涉及声音元素,要用统一符号,避免模型把台词当成画面描写:

  • 台词用花括号:{你到底是谁?}
  • 音效用尖括号:<雷声>
  • BGM 用圆括号:(低沉弦乐渐起)

这套符号不是装饰,它帮模型区分「这是要生成的声音」和「这是画面描述」,混写会导致口型对不上或音效丢失。

一个填空式模板

下面这个模板可以直接拿去用,每场开拍前把空格填上:

【主体】___(角色身份 + 当下可见状态)

【动作】___(低缓连续,量化幅度)

【场景】___(内外/地点/日夜 + 关键陈设)

【光影】___(光源方向 + 色温 + 明暗)

【运镜】___(景别 + 单一运镜;复杂场用镜头序号)

【画风】___(调用已选定的画风标签)

【画质】清晰、面部稳定、无水印无 Logo(多人加防分身)

【约束】不出现___;不改变___

【声音】台词 {}、音效 <>、BGM ()

简单场景填成一段;复杂场景按三段论展开。

几条容易被忽略的边界

  • 提示词生成时只给本场素材,不要把别的场次的角色、道具、场景混进来,串戏往往就是这么来的。
  • 本场剧本正文是最高优先级撰写依据,提示词为剧本服务,不是反过来。
  • 生成参数宜保守,取稳定可控,而不是天马行空。
  • 约 10 秒一个场块是工程启发式,不是时间码精剪;超长场会再拆,但精剪与串场仍需后续剪辑环节完成。
  • 参考图不是强制门禁,缺图可以跳过走纯文字路径,但质量通常更差——专业流程应该先定妆再开拍。

说到底,系统在教模型用分镜表语言说话,而不是写小说。 八格填满,不是为了束缚创意,而是把创意里那些不需要每次重新发明的部分固定下来,让导演的精力留在真正该判断的地方。

---

关于猫斯卡(Maosika):猫斯卡是 AI 竖屏短剧生产操作系统,把从创意评估、剧本写作、角色定妆、分场切块到多模态出片的专业流程固化为可验收的生产链。每一环都有可看、可改、可回退的中间产物,人在关键节点做确认与审美判断,机器负责把确认过的方向落到每一集、每一场。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com