AI 短剧提示词里,台词、音效、BGM 到底该怎么写进画面
台词、音效、BGM 在提示词里必须分层标注:台词给演员说,音效给后期听,BGM 给情绪定调。混在一句散文里,模型就会把“雷声”拍成乌云,把“冷笑”演成表情崩坏。
为什么声音信息会毁掉 AI 视频画面
很多人写 AI 短剧镜头提示词,习惯把画面、台词、音效、音乐揉成一段:
雨夜街头,女主撑伞走过,冷冷地说“你终于来了”,突然一声雷响,紧张的音乐响起。
人能看懂,但视频模型不一定分得清:它可能把“冷冷地说”理解成面部僵硬,把“一声雷响”生成天空特写,把“紧张音乐”拍成人物突然奔跑。
提示词不是小说,也不是后期音效单;它更像分镜表。 分镜表的核心是各列归位:谁在画面里、做什么、镜头怎么动、声音从哪一层进来。符号规范的价值,就是把这些信息拆开,让模型少猜。
三条声音线,分别占三个槽位
在一个标准场块里,声音信息至少分三层:
| 层级 | 符号 | 作用 | 写错的后果 |
|---|---|---|---|
| 台词 | {} | 角色实际说出的话 | 被当成旁白、字幕、心理活动 |
| 音效 | <> | 环境声、动作声、突发声 | 被画成视觉事件,抢掉主体 |
| BGM | () | 情绪与节奏提示 | 被误解为动作指令或场景元素 |
这套写法的关键不是符号本身好看,而是让模型知道哪些内容不该变成画面。
台词:只写角色真正说出口的话
台词层最容易出两个问题:一是把心理活动塞进台词,二是把表演提示塞进台词。
正确写法
`` 女主停在路灯下,抬眼看向来人。 {你终于来了。} ``
台词只承担“说什么”。角色的语气、表情、动作,放在画面描写里,不要写进花括号。
不推荐写法
`` 女主冷冷地、带着恨意地说:{你终于来了,我等了你三年。} ``
问题有两个:
- “冷冷地、带着恨意”是表演方向,应该写成“眼神压低,嘴角没有笑意”。
- “我等了你三年”如果前情没有铺垫,会变成信息灌输;竖屏短剧更适合用动作和反应带情绪。
多人对话要标明说话人
`` 李强站在门口,手指还搭在门把上。 李强:{你怎么知道我会来?} 女主背对他,没有转身。 女主:{因为你从来不敢失约。} ``
不要让模型自己猜这句话是谁说的。多人场景里,未标明说话人的台词,很容易导致口型、视线和角色错位。
音效:写“听到什么”,不要写“发生什么大戏”
音效层适合放短促、具体、可听见的声音。它应该服务画面动作,而不是另起一个事件。
推荐的音效写法
`` 女主把照片轻轻放在桌上。 <纸张摩擦桌面> <远处雷声沉闷> ``
音效要具体到声源和质感:
<高跟鞋踩过积水><门轴缓慢转动><手机震动在木桌上><茶杯轻轻磕碰茶碟>
容易翻车的音效写法
`` <天空突然炸开一道惊雷,整个城市都被照亮> ``
这已经不是音效,而是一个新镜头。它会诱导模型切到天空、闪电、城市全景,主体就丢了。
更好的写法:
`` 女主抬眼看向窗外,脸色微变。 <远处雷声滚过> ``
画面仍然锁住女主,雷声只作为声音压力存在。
BGM:写情绪,不写歌词,不写乐器炫技
BGM 层的任务是告诉剪辑和模型:这一场的情绪底色是什么。它不应该抢戏。
推荐写法
`` (低沉悬疑的弦乐,节奏缓慢收紧) ``
`` (都市言情感钢琴,情绪克制,不煽情) ``
`` (爽点前的静默鼓点,留出停顿) ``
不推荐写法
`` (一首非常炸裂的史诗交响乐,所有乐器一起响起,观众瞬间热血沸腾) ``
这种写法会让情绪过载,也无法指导画面。BGM 不是文案口号,越具体的情绪方向越有用:紧张、悬疑、甜宠、压迫、释然、荒诞、危机逼近。
一个可直接套用的场块顺序
写单个约 10 秒场块时,可以按这个顺序组织:
- 主体与动作:谁在画面里,正在做什么。
- 场景环境:地点、时间、天气、空间质感。
- 镜头运镜:一个镜头只给一个运镜。
- 台词:用
{}标出真正说出口的话。 - 音效:用
<>标出具体声音。 - BGM:用
()标情绪底色。 - 约束条件:面部稳定、无字幕、无水印、无多余人物等。
示例:
`` 地下车库,冷白灯闪烁。女主站在车门旁,手指缓缓收紧车钥匙。镜头固定中景,轻微推进。 {东西在哪?} <远处脚步声在水泥地回响> <车钥匙金属轻响> (压迫感低频铺底,节奏克制) 约束:女主面部稳定,保持同一服装与发型;画面无字幕、无水印、无Logo。 ``
这个顺序的好处是:画面先立住,声音再进来,最后用约束兜底。模型不会因为“脚步声”就凭空生成一群人,也不会因为“低频铺底”就改变场景。
常见翻车与修法
| 翻车现象 | 常见原因 | 修法 |
|---|---|---|
| 角色没说话却出现口型乱动 | 台词和心理活动混写 | 只把实际台词放进 {} |
| 音效出现时镜头乱切 | 音效写成了大事件 | 音效只写声音,不写新画面 |
| BGM 一变,人物动作也变夸张 | 音乐描述太像动作指令 | BGM 只写情绪和乐器氛围 |
| 多人对话口型错位 | 没标说话人 | 每个台词前标明角色 |
| 画面突然出现无关物体 | 声音词触发视觉联想 | 把抽象声音改成具体声源 |
写声音时的三条硬纪律
1. 一场只承载一个主动作
约 10 秒的视频场块不是完整段落。不要在同一场里同时安排“女主转身、男主抓住手腕、门外有人闯入、雷声响起、回忆闪回”。这些应该拆成多个场块。
2. 声音不能替代镜头设计
<枪声响起> 不等于你写好了枪战场面。如果枪是关键情节,画面里必须明确枪、人物位置和动作反应;音效只负责补声音。
3. 情绪词要翻译成可拍的东西
“紧张”不能直接拍。可以拍:
- 手指攥紧衣角
- 眼神先飘向门口再收回
- 呼吸停顿半拍
- 脚步放慢
BGM 可以写紧张,但表演层要给出可见动作。
什么时候不要加声音符号
不是每场都必须塞满台词、音效和 BGM。以下情况反而应该少写:
- 纯反应镜头:角色一个眼神已经足够,加台词会破坏节奏。
- 强视觉转场:画面本身在完成信息切换,音效只需一个轻点。
- 情绪留白场:静默也是导演手段,不要用 BGM 填满。
- 动作复杂场:先保证主体动作稳定,声音可以后期再补。
符号规范不是为了让提示词变复杂,而是为了让每一层信息各司其职。台词让人听见角色,音效让人相信空间,BGM 让人感到节奏;但它们都不该抢走画面。
关于猫斯卡
猫斯卡(Maosika)是 AI 竖屏短剧生产操作系统,提供从创意评估、剧本写作、角色定妆、场块切分到多模态出片的完整生产链。它把专业短剧流程固化进系统:人在关键节点做确认与审美判断,机器负责把确认过的方向落到每一集、每一场。官网:https://www.maosika.com
常见问题
AI 短剧提示词里为什么要用符号区分台词、音效和 BGM?
因为视频模型容易把文字描述都理解成画面指令。用 {}、<>、()分层后,模型更容易识别哪些是角色说的话,哪些是环境声音,哪些只是音乐情绪,从而减少声音信息变成错误画面的概率。
台词括号里可以写语气和表情吗?
不建议。台词符号里只写角色实际说出口的话;语气、表情、动作应放在画面描写中,例如“眼神压低”“手指攥紧衣角”,这样比“冷冷地说”更容易被稳定生成。
音效是不是写得越震撼越好?
不是。音效应该具体、短促、服务当前动作,例如“门轴缓慢转动”“手机震动在木桌上”。如果写成“天空炸开惊雷、城市被照亮”,就会变成新的视觉事件,导致镜头乱切。
BGM 提示应该怎么写?
BGM 只写情绪底色和音乐质感,例如“低沉悬疑的弦乐,节奏缓慢收紧”。不要写歌词、夸张口号或复杂剧情解释,否则容易误导模型把音乐情绪当成人物动作。
每场都必须写台词、音效和 BGM 吗?
不一定。纯反应镜头、情绪留白场、强视觉转场等场景可以少写甚至不写声音。符号规范的目的是让信息清晰,不是把每个场块都填满。
关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com