台词、音效、BGM 在提示词里的符号规范
台词用 {}、音效用 <>、BGM 用()——这是 AI 短剧镜头提示词里区分三类声音的最小符号约定。符号不统一,模型就会把台词当画面描述、把音效当动作、把 BGM 当场景元素。
为什么要给声音加符号
在竖屏短剧的镜头提示词里,画面描述、人物台词、环境音效、背景音乐是四种完全不同的信息。如果全部混在一段自然语言里交给视频模型,常见结果是:
- 台词被当成画面字幕硬烧进画面,或者干脆被忽略
- 音效词(如「砰」「手机震动」)被理解成人物动作,导致人物做出奇怪手势
- BGM 情绪描述被当成场景元素,比如「紧张鼓点」生成出一面鼓
- 模型自行分配说话人,旁白和对白混在一起
符号规范的本质,是给模型一个稳定的「语法」:看到什么括号,就知道这是哪一类声音,该交给音频通道还是画面通道处理。
三类符号的定义
| 符号 | 类型 | 写法示例 | 模型应理解为 |
|---|---|---|---|
{} | 台词 / 对白 | {你以为你赢了?} | 人物开口说出的话,归属当前镜头主体 |
<> | 音效 / SFX | <玻璃碎裂声> | 环境或动作产生的声音,不是画面里的文字 |
() | BGM / 配乐 | (低沉弦乐渐强) | 背景音乐的情绪与走向,不对应画面实体 |
这三组符号是工程化镜头提示词规范的一部分,和「一镜一运镜」「用镜头序号不用绝对秒数」「强制兜底包」属于同一套语法体系。
台词 {} 的写法
台词放在花括号里,紧跟在说话人物的动作描述之后。
推荐写法:
女人猛地抬头,眼眶泛红,嘴角却上扬。{你以为你赢了?}
几个要点:
- 一句一对括号,不要把多句台词塞进一个
{}里 - 括号内只放台词本身,不写「女主说:」「冷笑:」这类提示;说话人由括号外的动作描述指明
- 旁白也用
{},但要在括号外标明「旁白」或「画外音」,例如:旁白:{三年前的那个夜晚,她没有忘。} - 单句台词一般不超过 20 字——这是竖屏短剧的台词铁律,短句模型更容易对口型,观众也更容易接住
- 避免在台词里塞画面信息,比如「{她穿着红色裙子走进来}」,服装外观属于参考图和画面描述的职责
如果一场戏有多个人物轮流说话,按镜头顺序依次写动作 + {},不要在同一个镜头里堆两个人的对白;该拆镜头就拆。
音效 <> 的写法
音效放在尖括号里,描述的是「观众听到什么」,不是「画面里有什么字」。
推荐写法:
男人一掌拍在桌上,水杯震倒。<拍桌声·水杯碎裂>
几个要点:
- 写声音本身,不写拟声字堆叠。
<玻璃杯碎裂>比<哐当哗啦噼里啪啦>更稳定 - 多个音效用
·分隔,不要写成一长串 - 音效和动作对应,先写动作,再写音效;不要让音效凭空出现
- 不要把音效当画面元素。
<雷声>是声音,不要写成<天空中出现「轰」的字> - 环境音也走
<>,比如<街景嘈杂·远处鸣笛>、<办公室键盘声>
常见反例:把 <手机震动> 写在没有手机出现的镜头里,模型可能会让人物开始抖动。音效必须和本场剧本里真实发生的动作对得上。
BGM () 的写法
BGM 放在中文圆括号里,描述情绪、乐器、走向,不描述画面实体。
推荐写法:
她缓缓转身,镜头推近到眼睛特写。(低沉弦乐渐强,在她开口前收住)
几个要点:
- 写情绪和强度,不写具体歌名,不绑 IP。比如
(紧张鼓点)可以,(《某主题曲》旋律)不行 - 写走向比写静态情绪更有用:渐强、渐弱、戛然而止、切入、收住
- BGM 不对应画面物体。
(钢琴独奏)不会也不应该让画面里出现一架钢琴 - 一场戏一个 BGM 标记即可,不要每句都加;BGM 是段级的,不是镜头级的噪音
- 在情绪转折点标记:开场钩子、爽点爆发前、cliffhanger 收束处,这三个位置最值得标
三类声音的组合顺序
一个镜头里同时出现动作、台词、音效、BGM 时,推荐顺序:
[画面与动作描述] → [BGM()] → [动作细节] → [台词 {}] → [音效 <>]
实际例子:
特写:男人手指捏紧照片边缘,指节发白。(压抑钢琴单音重复)他抬眼看向门口。{她回来了。}<门锁转动声>
这个顺序的逻辑是:先让模型知道画面长什么样、情绪基调是什么,再给人物动作和台词,最后用音效点在动作落点上。BGM 放在前面,是因为它决定整段镜头的情绪底色;音效放在最后,是因为它是动作的「落点标记」。
常见翻车与排查
| 现象 | 可能原因 | 改法 |
|---|---|---|
| 台词被烧进画面当字幕 | 台词没加 {},混在画面描述里 | 把对白单独放进 {} |
| 人物嘴在动但没声音 | 台词写在括号外被当成叙述文字 | 检查所有对白是否都在 {} 内 |
| 画面里凭空出现乐器 / 文字 | BGM 或音效被当成画面元素 | BGM 用 (),音效用 <>,不在括号外写「鼓点」「雷声」作画面物 |
| 多人说话声音归属错乱 | 一个镜头里堆了两个人的 {} | 拆成两个镜头,每个镜头一个说话人 |
| 音效触发奇怪动作 | 音效和动作没对上,或音效写得像动作 | 先写动作,再跟 <>;音效只写声音 |
| 情绪和画面脱节 | BGM 没标走向,只写了「紧张」 | 改成「(弦乐渐强至她开口时收住)」这种带走向的写法 |
一个完整的场块示例
以一段约 10 秒的竖屏场块为例:
场 3 · 内 · 办公室 · 夜
中景,女人背对镜头站在落地窗前,城市霓虹在玻璃上拉出光带。(冷色调电子音·低频持续)她缓缓转身,手里攥着一份文件。
镜头推近到她面部特写,眼底有红血丝,但嘴角是笑的。{你以为,这就结束了?}
她把文件甩在桌上,纸张散开,露出红头文件抬头。<纸张甩落·桌面闷响>(电子音在甩落瞬间切断,留白一秒)
这段里:BGM 定了情绪底色并标注了切断点,台词归属于女人这个明确主体,音效对应「甩文件」这个真实动作,没有任何声音信息混进画面描述。
边界与提醒
符号规范是「让模型分清通道」的语法,不是「让音频一定完美生成」的魔法。几个需要心里有数的边界:
- 不同模型档位对音频的支持程度不同,有的档位默认不生成音频,需要在出片时确认音频开关
- 符号靠规范引导,不做二次硬拼——创作者在提交前仍应扫一眼提示词,确认所有台词都在
{}里、音效没有写成画面物 - 对口型质量受台词长度和动作幅度影响,短句、少转头的镜头更稳;大段台词应该拆成多个场块
- BGM 是情绪提示,不是精准配乐,想要精确卡点仍需后期剪辑环节处理
- 提示词交付前会剥离具体影视作品 / IP 名称,所以不要在 BGM 里写歌名或主题曲,会被清洗掉
把声音信息用符号分门别类,本质上和「先出定妆图再开拍」「先写场戏清单再写正文」是同一件事:把原本靠模型自由发挥的部分,变成有语法可约束的流水线。系统在教模型用分镜表语言说话,而不是写小说。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com