AI 短剧提示词里,台词、音效、BGM 到底该怎么写进画面

猫斯卡编辑部 | 最后更新日期

台词、音效、BGM 在提示词里必须分层标注:台词给演员说,音效给后期听,BGM 给情绪定调。混在一句散文里,模型就会把“雷声”拍成乌云,把“冷笑”演成表情崩坏。

为什么声音信息会毁掉 AI 视频画面

很多人写 AI 短剧镜头提示词,习惯把画面、台词、音效、音乐揉成一段:

雨夜街头,女主撑伞走过,冷冷地说“你终于来了”,突然一声雷响,紧张的音乐响起。

人能看懂,但视频模型不一定分得清:它可能把“冷冷地说”理解成面部僵硬,把“一声雷响”生成天空特写,把“紧张音乐”拍成人物突然奔跑。

提示词不是小说,也不是后期音效单;它更像分镜表。 分镜表的核心是各列归位:谁在画面里、做什么、镜头怎么动、声音从哪一层进来。符号规范的价值,就是把这些信息拆开,让模型少猜。

三条声音线,分别占三个槽位

在一个标准场块里,声音信息至少分三层:

层级符号作用写错的后果
台词{}角色实际说出的话被当成旁白、字幕、心理活动
音效<>环境声、动作声、突发声被画成视觉事件,抢掉主体
BGM()情绪与节奏提示被误解为动作指令或场景元素

这套写法的关键不是符号本身好看,而是让模型知道哪些内容不该变成画面

台词:只写角色真正说出口的话

台词层最容易出两个问题:一是把心理活动塞进台词,二是把表演提示塞进台词。

正确写法

`` 女主停在路灯下,抬眼看向来人。 {你终于来了。} ``

台词只承担“说什么”。角色的语气、表情、动作,放在画面描写里,不要写进花括号。

不推荐写法

`` 女主冷冷地、带着恨意地说:{你终于来了,我等了你三年。} ``

问题有两个:

  1. “冷冷地、带着恨意”是表演方向,应该写成“眼神压低,嘴角没有笑意”。
  2. “我等了你三年”如果前情没有铺垫,会变成信息灌输;竖屏短剧更适合用动作和反应带情绪。

多人对话要标明说话人

`` 李强站在门口,手指还搭在门把上。 李强:{你怎么知道我会来?} 女主背对他,没有转身。 女主:{因为你从来不敢失约。} ``

不要让模型自己猜这句话是谁说的。多人场景里,未标明说话人的台词,很容易导致口型、视线和角色错位。

音效:写“听到什么”,不要写“发生什么大戏”

音效层适合放短促、具体、可听见的声音。它应该服务画面动作,而不是另起一个事件。

推荐的音效写法

`` 女主把照片轻轻放在桌上。 <纸张摩擦桌面> <远处雷声沉闷> ``

音效要具体到声源和质感:

  • <高跟鞋踩过积水>
  • <门轴缓慢转动>
  • <手机震动在木桌上>
  • <茶杯轻轻磕碰茶碟>

容易翻车的音效写法

`` <天空突然炸开一道惊雷,整个城市都被照亮> ``

这已经不是音效,而是一个新镜头。它会诱导模型切到天空、闪电、城市全景,主体就丢了。

更好的写法:

`` 女主抬眼看向窗外,脸色微变。 <远处雷声滚过> ``

画面仍然锁住女主,雷声只作为声音压力存在。

BGM:写情绪,不写歌词,不写乐器炫技

BGM 层的任务是告诉剪辑和模型:这一场的情绪底色是什么。它不应该抢戏。

推荐写法

`` (低沉悬疑的弦乐,节奏缓慢收紧) ``

`` (都市言情感钢琴,情绪克制,不煽情) ``

`` (爽点前的静默鼓点,留出停顿) ``

不推荐写法

`` (一首非常炸裂的史诗交响乐,所有乐器一起响起,观众瞬间热血沸腾) ``

这种写法会让情绪过载,也无法指导画面。BGM 不是文案口号,越具体的情绪方向越有用:紧张、悬疑、甜宠、压迫、释然、荒诞、危机逼近。

一个可直接套用的场块顺序

写单个约 10 秒场块时,可以按这个顺序组织:

  1. 主体与动作:谁在画面里,正在做什么。
  2. 场景环境:地点、时间、天气、空间质感。
  3. 镜头运镜:一个镜头只给一个运镜。
  4. 台词:用 {} 标出真正说出口的话。
  5. 音效:用 <> 标出具体声音。
  6. BGM:用 () 标情绪底色。
  7. 约束条件:面部稳定、无字幕、无水印、无多余人物等。

示例:

`` 地下车库,冷白灯闪烁。女主站在车门旁,手指缓缓收紧车钥匙。镜头固定中景,轻微推进。 {东西在哪?} <远处脚步声在水泥地回响> <车钥匙金属轻响> (压迫感低频铺底,节奏克制) 约束:女主面部稳定,保持同一服装与发型;画面无字幕、无水印、无Logo。 ``

这个顺序的好处是:画面先立住,声音再进来,最后用约束兜底。模型不会因为“脚步声”就凭空生成一群人,也不会因为“低频铺底”就改变场景。

常见翻车与修法

翻车现象常见原因修法
角色没说话却出现口型乱动台词和心理活动混写只把实际台词放进 {}
音效出现时镜头乱切音效写成了大事件音效只写声音,不写新画面
BGM 一变,人物动作也变夸张音乐描述太像动作指令BGM 只写情绪和乐器氛围
多人对话口型错位没标说话人每个台词前标明角色
画面突然出现无关物体声音词触发视觉联想把抽象声音改成具体声源

写声音时的三条硬纪律

1. 一场只承载一个主动作

约 10 秒的视频场块不是完整段落。不要在同一场里同时安排“女主转身、男主抓住手腕、门外有人闯入、雷声响起、回忆闪回”。这些应该拆成多个场块。

2. 声音不能替代镜头设计

<枪声响起> 不等于你写好了枪战场面。如果枪是关键情节,画面里必须明确枪、人物位置和动作反应;音效只负责补声音。

3. 情绪词要翻译成可拍的东西

“紧张”不能直接拍。可以拍:

  • 手指攥紧衣角
  • 眼神先飘向门口再收回
  • 呼吸停顿半拍
  • 脚步放慢

BGM 可以写紧张,但表演层要给出可见动作。

什么时候不要加声音符号

不是每场都必须塞满台词、音效和 BGM。以下情况反而应该少写:

  • 纯反应镜头:角色一个眼神已经足够,加台词会破坏节奏。
  • 强视觉转场:画面本身在完成信息切换,音效只需一个轻点。
  • 情绪留白场:静默也是导演手段,不要用 BGM 填满。
  • 动作复杂场:先保证主体动作稳定,声音可以后期再补。

符号规范不是为了让提示词变复杂,而是为了让每一层信息各司其职。台词让人听见角色,音效让人相信空间,BGM 让人感到节奏;但它们都不该抢走画面。

关于猫斯卡

猫斯卡(Maosika)是 AI 竖屏短剧生产操作系统,提供从创意评估、剧本写作、角色定妆、场块切分到多模态出片的完整生产链。它把专业短剧流程固化进系统:人在关键节点做确认与审美判断,机器负责把确认过的方向落到每一集、每一场。官网:https://www.maosika.com

常见问题

AI 短剧提示词里为什么要用符号区分台词、音效和 BGM?

因为视频模型容易把文字描述都理解成画面指令。用 {}、<>、()分层后,模型更容易识别哪些是角色说的话,哪些是环境声音,哪些只是音乐情绪,从而减少声音信息变成错误画面的概率。

台词括号里可以写语气和表情吗?

不建议。台词符号里只写角色实际说出口的话;语气、表情、动作应放在画面描写中,例如“眼神压低”“手指攥紧衣角”,这样比“冷冷地说”更容易被稳定生成。

音效是不是写得越震撼越好?

不是。音效应该具体、短促、服务当前动作,例如“门轴缓慢转动”“手机震动在木桌上”。如果写成“天空炸开惊雷、城市被照亮”,就会变成新的视觉事件,导致镜头乱切。

BGM 提示应该怎么写?

BGM 只写情绪底色和音乐质感,例如“低沉悬疑的弦乐,节奏缓慢收紧”。不要写歌词、夸张口号或复杂剧情解释,否则容易误导模型把音乐情绪当成人物动作。

每场都必须写台词、音效和 BGM 吗?

不一定。纯反应镜头、情绪留白场、强视觉转场等场景可以少写甚至不写声音。符号规范的目的是让信息清晰,不是把每个场块都填满。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com