群演和泛指角色该怎么处理:AI 短剧里的「路人甲」工艺

猫斯卡编辑部 | 最后更新日期

群演不是「少画几张图」那么简单。AI 短剧里路人甲一旦被当成主演去占参考槽位,主演的脸反而会被挤掉。正确做法是把群演从可绘制主演名单里剥离,用文字和镜头调度去承载,而不是给每个人都出定妆。

为什么群演是 AI 短剧的高频翻车点

在真人剧组里,群演是副导演拉来的活人,站在哪、穿什么、走什么路线,现场调度就解决了。但在 AI 短剧的生产链里,每一个被剧本点名的「人物」,都可能被下游当成需要绑定参考图的角色去处理——这就是问题的起点。

典型翻车路径是这样的:

  1. 剧本里写了「围观群众议论纷纷」「几个保安冲了上来」「餐厅里其他客人侧目」
  2. 系统在解析人物时,把「围观群众」「保安」「客人」也当成了角色条目
  3. 这些条目没有定妆图,要么被强行生成随机脸,要么反过来挤占主演的参考图槽位
  4. 出片时主演脸漂了,群演反而每人一张清晰但毫无连续性的脸

群演处理的核心原则:可绘制的主演名单和剧本里出现的所有人物,不是同一个集合。 前者是要做定妆、要跨场保持一致的资产;后者只是叙事功能。把二者混在一起,是 AI 短剧一致性崩盘的常见原因之一。

这也是为什么在猫斯卡的场块切分逻辑里,群演和泛指角色会被明确从可绘制主演名单里剥离——不是忽略他们,而是把他们放回「环境与氛围」的层级去处理。

第一步:在剧本阶段就把「谁需要定妆」分清楚

剧本是所有下游环节的源头。群演问题如果拖到出图或出片阶段再处理,成本会成倍放大。编剧在写的时候就应该有一个隐性分类:

类别例子是否需要定妆处理方式
主演林晚、顾沉、苏晴必须出定妆图,跨场绑定参考
有名有姓的配角王管家、李警官、陈医生视戏份出场 ≥3 场或有台词推动剧情的,出定妆;否则降级为功能角色
功能角色前台、司机、服务员、护士一般不需要用职业 + 动作描写,不起名字,不给特写
群演 / 泛指围观群众、保安们、食客、路人不需要作为环境元素处理,不给个体台词,不给近景

判断标准很简单:这个角色跨不跨场、观众需不需要记住他的脸。 需要,就进定妆链路;不需要,就留在文字层。

编剧常犯的一个错误是给功能角色起名字。剧本里写「前台小张说……」和「前台抬头说……」,对剧情没有任何区别,但前者会让下游以为「小张」是个需要建档的人物。除非小张后面还要出场并推动剧情,否则不要起名。

第二步:写群演的台词和动作,有专门的写法

群演不是不能有声音,但他们的声音是「环境声」,不是「角色表演」。

错误写法(把群演当角色写):

【人物】围观群众甲、围观群众乙、围观群众丙

围观群众甲:这女的是谁啊?

围观群众乙:听说就是她把顾总气走的。

围观群众丙:真不要脸。

这种写法会触发三个问题:系统要为三个人物找参考图;镜头可能给其中某个人切近景;下一场「围观群众」又会生成三张全新的脸。

正确写法(把群演当氛围写):

【人物】林晚

人群里传出细碎的议论声,没人站出来,也没人散开。

林晚攥紧了包带,抬眼看向门口。

要点:

  • 群演不出现在【人物】行里,只出现在动作描写里
  • 群演的台词用「议论声」「窃窃私语」「有人喊了一句」这种概括式处理,不拆成个体
  • 镜头焦点始终在主演身上,群演是背景层
  • 如果确实需要某一句群演台词推动剧情(比如有人喊「他来了!」制造悬念),写成「人群里有人喊了一声」,不要给说话人起身份

第三步:场块切分时,群演不占定妆槽位

剧本进入拍摄链路后,会被切成约 10 秒一个的视频场块。这一步有一个关键动作:把群演和泛指角色从可绘制主演名单里剥离。

这意味着什么?

  • 每一场在构建参考素材表时,只会绑定主演和已出定妆的配角
  • 群演不占参考图槽位,也就不会和主演抢「人脸锚点」
  • 提示词里群演以「背景人群」「模糊的路人」等方式存在,不要求个体面部一致性

这里有一个容易被忽略的细节:参考图槽位是有上限的,每场绑定多张参考图,按「场景图 → 道具图 → 人物定妆图」的顺序占位。如果群演占了人物槽位,主演的定妆图反而可能排不进去——这才是群演问题真正的破坏力:不是群演自己画不好,是他们把主演挤掉了。

第四步:提示词里怎么写群演

提示词层面,群演的处理遵循一个原则:写群体状态,不写个体特征。

工程化镜头提示词的八大要素里,群演属于「场景环境」这一项,不属于「精准主体」。

写法示例效果
✅ 群体 + 状态「背景里三两个模糊的食客低头吃饭,面部虚化」群演是氛围,不抢焦点,不要求一致性
✅ 群体 + 动作「走廊里几名保安快步跑过,只拍背影和侧影」有动感但不触发面部生成
⚠️ 群体 + 数量模糊「周围站满了人」可用,但模型可能生成过多人脸,建议加「虚焦背景」
❌ 个体 + 穿着「左边一个穿红裙子的女人惊讶地看着主角」模型会给这个女人生成一张清晰的脸,下一场无法复现
❌ 个体 + 台词「一个戴帽子的男人说:快跑!」触发特写 + 个体面部,跨场必漂

还有一个实用技巧:如果群演必须出现在中近景(比如主角在人群中穿行),提示词里加「背景人群面部虚焦、景深外模糊」这类约束,把模型的注意力预算集中在主演脸上。

第五步:什么时候需要手动绑定

大多数情况下,群演走自动剥离就够了。但有三种情况需要人工介入:

1. 功能角色反复出场,需要升级为配角。

比如一个前台,第一场只是抬头说了句话,第三场又出现并递了一封信,第八场还帮主角挡了一下。这种情况下,应该在角色阵容里补建这个角色,出定妆图,后续场次手动绑定。判断信号:当你发现某场的「前台」开始有连续动作或情绪反应,就该升级了。

2. 剧本里的称呼和档案里的名字对不上。

剧本里写「那个警官」,但档案里这个角色叫「李强」。系统支持手动角色绑定,就是为了处理这种指代不一致。不要让「警官」被当成一个新的泛指角色生成随机脸。

3. 道具师视角提取的「人物道具」需要排除。

某些剧本描写里,群演可能被误提取为视觉元素(比如「人群里举着的牌子」「保安手里的对讲机」是道具,但「保安」本人不是)。道具的纳入和排除是手动可控的,确保无关元素不挤占本场的视觉焦点。

边界:群演处理做不到什么

诚实讲,有几件事目前的工艺做不到,也不该指望系统自动解决:

  • 大场面全景群演的精细控制。 如果你要的是《指环王》式的千军万马,单场多模态生成的当前能力上限就在那里,群演数量和个体动作的精细度都有限。这类镜头建议用远景 + 剪影 + 音效叙事,不要指望看清每个人。
  • 群演跨场的服装一致性。 因为群演没有定妆资产,同一家咖啡店的服务员在第 3 集和第 10 集穿的制服可能不一样。如果这个服务员是观众会注意到的,他就不该是群演——给他出定妆。
  • 群演的「表演」。 AI 目前擅长的是动作和姿态,不是群演之间的微妙互动。不要写「两个路人在角落里窃窃私语并交换眼神」这种需要群体编排的调度,写出来也出不来。

一条可操作的检查清单

写完一集剧本、准备进入拍摄链路之前,花两分钟过一遍这个清单:

  1. 【人物】行里,有没有不起名的功能角色或群演?有就清出去。
  2. 有没有只出场一次却被起了名字的角色?有就降级为职业指代。
  3. 群演的台词是不是被拆成了个体?是就合并为概括式。
  4. 需要跨场出场的功能角色,有没有建档并出定妆?没有就补。
  5. 剧本里的角色称呼,和档案里的名字能不能对上?对不上就手动绑定。
  6. 群演出现在中近景时,提示词里有没有加「虚焦 / 背景 / 模糊」约束?没有就加。

群演处理本质上是一个「分类问题」:谁是资产,谁是氛围。把这条线在剧本阶段就画清楚,后面的定妆、分场、出片环节会省掉大量返工。高质量短剧从来不是一条长生成硬剪出来的,而是一条条可控单元堆起来的——群演这种「看起来不重要」的细节,恰恰是可控单元能不能成立的分界线。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com