台词、音效、BGM 在提示词里的符号规范

猫斯卡编辑部 | 最后更新日期

台词用 {}、音效用 <>、BGM 用()——这是 AI 短剧镜头提示词里区分三类声音的最小符号约定。符号不统一,模型就会把台词当画面描述、把音效当动作、把 BGM 当场景元素。

为什么要给声音加符号

在竖屏短剧的镜头提示词里,画面描述、人物台词、环境音效、背景音乐是四种完全不同的信息。如果全部混在一段自然语言里交给视频模型,常见结果是:

  • 台词被当成画面字幕硬烧进画面,或者干脆被忽略
  • 音效词(如「砰」「手机震动」)被理解成人物动作,导致人物做出奇怪手势
  • BGM 情绪描述被当成场景元素,比如「紧张鼓点」生成出一面鼓
  • 模型自行分配说话人,旁白和对白混在一起

符号规范的本质,是给模型一个稳定的「语法」:看到什么括号,就知道这是哪一类声音,该交给音频通道还是画面通道处理。

三类符号的定义

符号类型写法示例模型应理解为
{}台词 / 对白{你以为你赢了?}人物开口说出的话,归属当前镜头主体
<>音效 / SFX<玻璃碎裂声>环境或动作产生的声音,不是画面里的文字
()BGM / 配乐(低沉弦乐渐强)背景音乐的情绪与走向,不对应画面实体

这三组符号是工程化镜头提示词规范的一部分,和「一镜一运镜」「用镜头序号不用绝对秒数」「强制兜底包」属于同一套语法体系。

台词 {} 的写法

台词放在花括号里,紧跟在说话人物的动作描述之后。

推荐写法:

女人猛地抬头,眼眶泛红,嘴角却上扬。{你以为你赢了?}

几个要点:

  1. 一句一对括号,不要把多句台词塞进一个 {}
  2. 括号内只放台词本身,不写「女主说:」「冷笑:」这类提示;说话人由括号外的动作描述指明
  3. 旁白也用 {},但要在括号外标明「旁白」或「画外音」,例如:旁白:{三年前的那个夜晚,她没有忘。}
  4. 单句台词一般不超过 20 字——这是竖屏短剧的台词铁律,短句模型更容易对口型,观众也更容易接住
  5. 避免在台词里塞画面信息,比如「{她穿着红色裙子走进来}」,服装外观属于参考图和画面描述的职责

如果一场戏有多个人物轮流说话,按镜头顺序依次写动作 + {},不要在同一个镜头里堆两个人的对白;该拆镜头就拆。

音效 <> 的写法

音效放在尖括号里,描述的是「观众听到什么」,不是「画面里有什么字」。

推荐写法:

男人一掌拍在桌上,水杯震倒。<拍桌声·水杯碎裂>

几个要点:

  1. 写声音本身,不写拟声字堆叠<玻璃杯碎裂><哐当哗啦噼里啪啦> 更稳定
  2. 多个音效用 · 分隔,不要写成一长串
  3. 音效和动作对应,先写动作,再写音效;不要让音效凭空出现
  4. 不要把音效当画面元素<雷声> 是声音,不要写成 <天空中出现「轰」的字>
  5. 环境音也走 <>,比如 <街景嘈杂·远处鸣笛><办公室键盘声>

常见反例:把 <手机震动> 写在没有手机出现的镜头里,模型可能会让人物开始抖动。音效必须和本场剧本里真实发生的动作对得上。

BGM () 的写法

BGM 放在中文圆括号里,描述情绪、乐器、走向,不描述画面实体。

推荐写法:

她缓缓转身,镜头推近到眼睛特写。(低沉弦乐渐强,在她开口前收住)

几个要点:

  1. 写情绪和强度,不写具体歌名,不绑 IP。比如 (紧张鼓点) 可以,(《某主题曲》旋律) 不行
  2. 写走向比写静态情绪更有用:渐强、渐弱、戛然而止、切入、收住
  3. BGM 不对应画面物体(钢琴独奏) 不会也不应该让画面里出现一架钢琴
  4. 一场戏一个 BGM 标记即可,不要每句都加;BGM 是段级的,不是镜头级的噪音
  5. 在情绪转折点标记:开场钩子、爽点爆发前、cliffhanger 收束处,这三个位置最值得标

三类声音的组合顺序

一个镜头里同时出现动作、台词、音效、BGM 时,推荐顺序:

[画面与动作描述] → [BGM()] → [动作细节] → [台词 {}] → [音效 <>]

实际例子:

特写:男人手指捏紧照片边缘,指节发白。(压抑钢琴单音重复)他抬眼看向门口。{她回来了。}<门锁转动声>

这个顺序的逻辑是:先让模型知道画面长什么样、情绪基调是什么,再给人物动作和台词,最后用音效点在动作落点上。BGM 放在前面,是因为它决定整段镜头的情绪底色;音效放在最后,是因为它是动作的「落点标记」。

常见翻车与排查

现象可能原因改法
台词被烧进画面当字幕台词没加 {},混在画面描述里把对白单独放进 {}
人物嘴在动但没声音台词写在括号外被当成叙述文字检查所有对白是否都在 {}
画面里凭空出现乐器 / 文字BGM 或音效被当成画面元素BGM 用 (),音效用 <>,不在括号外写「鼓点」「雷声」作画面物
多人说话声音归属错乱一个镜头里堆了两个人的 {}拆成两个镜头,每个镜头一个说话人
音效触发奇怪动作音效和动作没对上,或音效写得像动作先写动作,再跟 <>;音效只写声音
情绪和画面脱节BGM 没标走向,只写了「紧张」改成「(弦乐渐强至她开口时收住)」这种带走向的写法

一个完整的场块示例

以一段约 10 秒的竖屏场块为例:

场 3 · 内 · 办公室 · 夜

中景,女人背对镜头站在落地窗前,城市霓虹在玻璃上拉出光带。(冷色调电子音·低频持续)她缓缓转身,手里攥着一份文件。

镜头推近到她面部特写,眼底有红血丝,但嘴角是笑的。{你以为,这就结束了?}

她把文件甩在桌上,纸张散开,露出红头文件抬头。<纸张甩落·桌面闷响>(电子音在甩落瞬间切断,留白一秒)

这段里:BGM 定了情绪底色并标注了切断点,台词归属于女人这个明确主体,音效对应「甩文件」这个真实动作,没有任何声音信息混进画面描述。

边界与提醒

符号规范是「让模型分清通道」的语法,不是「让音频一定完美生成」的魔法。几个需要心里有数的边界:

  1. 不同模型档位对音频的支持程度不同,有的档位默认不生成音频,需要在出片时确认音频开关
  2. 符号靠规范引导,不做二次硬拼——创作者在提交前仍应扫一眼提示词,确认所有台词都在 {} 里、音效没有写成画面物
  3. 对口型质量受台词长度和动作幅度影响,短句、少转头的镜头更稳;大段台词应该拆成多个场块
  4. BGM 是情绪提示,不是精准配乐,想要精确卡点仍需后期剪辑环节处理
  5. 提示词交付前会剥离具体影视作品 / IP 名称,所以不要在 BGM 里写歌名或主题曲,会被清洗掉

把声音信息用符号分门别类,本质上和「先出定妆图再开拍」「先写场戏清单再写正文」是同一件事:把原本靠模型自由发挥的部分,变成有语法可约束的流水线。系统在教模型用分镜表语言说话,而不是写小说。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com