提示词里的声音层:台词、音效、BGM 用对括号,模型才不会把声音画成画面
台词、音效、BGM 在提示词里要分层写:台词用花括号,音效用尖括号,BGM 用圆括号。符号的作用是让模型分清「谁在说」「现场响什么」「情绪铺什么」,避免把声音描述误画成画面。
为什么声音要单独分层
很多 AI 短剧翻车,不是画面词写得不够,而是声音和画面混在一句话里。模型读到「她冷笑,门被撞开,紧张音乐响起」,可能把「冷笑」理解成表情,把「撞开」理解成动作,却把「紧张音乐」当成场景里真的有乐器。
声音层符号是一套给模型看的分镜表语言:画面写在正文里,台词、音效、BGM 分别用不同括号包起来,模型才知道哪些是镜头要拍到的,哪些是后期要听到的。
三种符号,三种声音身份
| 符号 | 用途 | 例子 | 模型应理解为 |
|---|---|---|---|
{} | 台词 | {你到底是谁?} | 角色开口说的话 |
<> | 音效 | <重物落地声> | 现场发生的声音 |
() | BGM | (低沉弦乐渐起) | 后期铺的情绪音乐 |
这套区分的核心,不是括号形状本身,而是每种声音对应不同的制作环节:台词绑定角色口型与表演,音效绑定动作发生的瞬间,BGM 绑定整场情绪,不绑定具体画面。
台词:花括号里只放说出口的话
台词用花括号包起来,并且只放角色真正说出口的内容。
- 写
{你没有资格提她。},不写「她愤怒地说:你没有资格提她」 - 情绪、语气、动作放在括号外的画面描述里,例如:她攥紧酒杯,指节发白,{你没有资格提她。}
- 旁白如果是角色的内心独白,也走花括号,但要在画面层标明是内心独白,避免模型生成开口说话的镜头
花括号的边界要干净。括号里塞「冷笑」「停顿」「压低声音」这类表演指示,模型容易把它当成台词内容念出来;这些应该写在括号外,作为动作和表情。
音效:尖括号对准动作发生的瞬间
音效用尖括号,写在它对应的动作旁边,而不是堆在场次开头或结尾。
- 动作和音效贴在一起:他把文件摔在桌上,<文件拍桌声>
- 用具体声源,不用抽象形容词:写 <瓷器碎裂声>,不写「清脆的声音」
- 一场里音效不要过密。约 10 秒的场块通常只承担一两个关键声音点,堆太多会让模型分不清主次
音效是现场的,BGM 是后期的。如果一个声音是剧情里真实发生的——敲门声、耳光声、雨声——它属于尖括号;如果是为了烘托情绪铺上去的音乐,它属于圆括号。
BGM:圆括号里写情绪,不写乐器位置
BGM 用圆括号,写的是情绪方向和进退场,而不是画面里真的有人在演奏。
- 写(紧张弦乐渐强),不写「角落里小提琴手开始演奏」
- 标明进退场:(BGM 戛然而止)比单纯写「音乐停了」更清楚
- BGM 不要和音效抢戏。需要台词听清的段落,BGM 描述应压低或留白
常见误区是把 BGM 写成场景的一部分。比如在一个现代办公室场景里写「恢弘交响乐响起」,模型可能真的在办公室里生成乐队。圆括号的作用就是明确告诉模型:这是铺上去的,不是拍到的。
一个场块里的声音层长什么样
把三层放在一起,结构应该是:画面动作在前,音效贴在动作旁,台词绑定角色,BGM 单独标情绪。
她站在门口,手还握着门把。<门轴吱呀声> 他背对她,没有转身。{你回来了。}
(低沉钢琴单音,留白三秒)
这段话里,画面、现场声、台词、配乐各归其位。模型不需要猜测「低沉钢琴」是房间里的道具,也不需要把「你回来了」念成旁白。
容易踩的四个坑
- 括号混用:把 BGM 写成
<紧张音乐>,模型可能当成现场音效;把音效写成(耳光声),又可能被当成配乐处理。 - 台词里塞表演指示:
{冷笑:你以为我会信}容易被整句念出。表演拆到画面层。 - 声音词太抽象:<一阵声音>、(好听的音乐)没有可执行信息,模型只能自由发挥。
- 一场塞满声音:场块粒度约 10 秒,声音点也要克制,留给镜头和表演空间。
边界:符号规范解决什么,不解决什么
符号规范能解决的是声音身份混乱:让模型分清台词、音效、BGM 分别属于哪一层。它不能替代好的画面描述,也不能保证任何模型都完美生成口型或混音。
如果某场戏跳过参考图、纯文字生成,即使声音符号写得再标准,角色一致性仍可能漂移。符号是镜头提示词八大要素里的约束条件之一,不是整条片子的质量保险。
系统在教模型用分镜表语言说话,而不是写小说。声音层符号就是这套语言里最基础的标点:用对了,声音归声音,画面归画面;用错了,模型就会把音乐画进镜头里。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com