英文题目:Whose Voice, Whose Avatar? Gender Matching Bias in Multimodal AI Teammates
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.2057
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#游戏音频 #统计分析 #公平性 #音视频 #音视频问答
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Kyusik Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jaehoon Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Hyunwoo Yoo:机构信息未能从会议 PDF 纯文本可靠映射
- Bongwon Suh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
合作游戏中多模态大语言模型需同时听取队友语音提议并从男性呈现与女性呈现化身中二选一,难点在于语音性别与视觉性别线索冲突时模型应依据任务内容决策而非身份一致性或角色刻板印象。先以固定文本提议、合成男女语音与三档保真度化身为输入,负责构造仅扰动社会身份线索的反事实材料,输出16化身对与10种语音身份的配对集合。再以该配对集合与高低风险游戏情境文本为输入,负责按化身对、呈现顺序、语音身份与情境展开全因子交叉试验,输出每模型11200次Task1试验与每风格3200次Task2试验的选择记录。最后以选择记录为输入,负责用混合效应模型对每模型独立回归男性化身选择并检验一致性选择与位置效应,输出语音效应、情境效应与交互显著性。与已有单模态或语义冲突评测不同,该设计保持任务证据恒定而仅扰动社会身份线索,因而能区分跨模态一致性强制与情境驱动的男性默认。在跨视觉保真度比较任务下,Gemini 2.5 Flash在像素风格下的语音效应指标为48.1 pp,低于写实风格下的73.6 pp。结论适用边界在于合成美式英语语音与受控化身及合作游戏提示,对自然语音、非二元呈现与其他部署场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要复述的研究问题与必须保留的证据
本文解读的输入是 ACL 2026 Findings 论文原文证据,任务是为刚进入语音与音频领域的研究生讲清方法与结论。目标不是评价好坏,而是能核对、能复述:听到什么、看到什么、模型要做什么选择、数字如何得到。必须保留的信息包括任务定义、刺激构造、试次数量、模型名单、统计模型与 3 类核心数字,即声音效应系数、男性选择率与风格调节百分点。输出按学习依赖展开,先讲冲突从哪里来,再讲如何控制,最后讲结果与边界。
多模态大模型在这里不是聊天工具,而是游戏中的 AI 队友。它要同时处理队友的语音提议与两个候选头像,从中选一个更愿意跟随的外观。困难在于现实中声音与外观可能不一致,例如男声配女性呈现头像。人类能处理这种不一致,但模型会如何整合尚不清楚。论文把风险拆成两类,一是凭空要求声音与外观一致,二是把特定任务与特定性别绑定。
声音配对偏置 × 场景刻板印象: 声音配对偏置负责解释在声音与外观冲突时模型是否按声音性别去选同性别外观,分工是跨模态一致性;场景刻板印象负责解释在任务背景变化时模型是否不看声音就偏好男性,分工是语境到性别的默认联想,二者搭配的理由是同一选择率可以由不同路径产生,组合意义是必须用正交设计把两者拆开,否则会把一种无偏误读为整体无偏。
理解这两类偏置为何要分开,是阅读全文的前提。如果只看总体选了多少次男性,会把强制配对误认为公平,也会把忽略声音的位置偏好误认为中立。后文所有设计都是为了让这两条路径暴露出来。
相关路线为何没直接回答声音与外观冲突
先看游戏与社会线索路线。以往工作报告语音性别会影响多人协作中的反馈与评价,头像定制与性别互换会影响能力与领导力判断,脸与声音写实度不一致会增加怪异感并影响信任。这些研究说明玩家确实同时看声音与外观,但对象是人类玩家之间的印象,研究方法多为观察或行为实验,没有给出可用于审计模型的受控冲突协议。
再看偏置基准与模态冲突路线。视觉语言偏置基准多在图文内测量刻板印象,语音偏置多在单模态内测量,模态冲突工作多关注语义证据不一致时文本是否压倒音频,或幻觉鲁棒性。这些工作把冲突理解为事实内容对不上,而不是社会身份线索对不上。因此即使模型在单模态偏置测试中表现平衡,也无法回答它在男声配女头像时先信哪一个。
本文的切入点是保持任务证据恒定,只让社会身份线索冲突。做法是固定提议文本,用反事实方式交换声音性别与头像性别呈现,再看选择是否系统性移动。这与图文反事实审计思路相通,但把反事实扩展到听觉与视觉之间,并引入游戏 stakes 与视觉风格作为调节变量。
模型在一个试次里到底要做什么决定
每个试次给模型四部分输入。第一是文字情景,说明当前游戏状态,例如被狙击压制或需要投票。第二是语音,用男声或女声说出同一句提议。第三与第四是两张头像,一张男性呈现,一张女性呈现。模型以 AI 队友身份输出更愿意跟随哪一个外观,格式限定为只输出跟随 A 还是 B。
举例说明,这是一个教学例子而非原文数值。假设情景是烟雾中转移,提议文本固定为现在穿过烟雾,声音分别用男声与女声合成,头像为同一对男女外观。若模型在男声时选男外观、在女声时选女外观,就记为一次性别一致选择。若无论声音如何都选男性,就记为场景驱动的男性偏好。若无论声音与性别如何都选先出现的位置,就记为位置启发式。
任务 1 固定使用写实风格,检验声音是否系统性改变头像偏好。任务 2 把同一二选一结构搬到卡通与像素风格,检验逼真度是否调节声音效应。2 个任务都不让模型解释理由,只记录选择,这样才能用大样本统计估计偏置。
反事实设计如何把声音、外观与场景拆开
方法全景可以沿一个样本走完。输入是一条情景文本加一条提议音频加 1 对头像。表示阶段把声音性别、外观性别、呈现顺序与场景类型作为因子。组件阶段用全因子交叉生成试次,并用提示词声明两个选项无优先级。目标阶段记录选男还是选女、选一致还是选首位。输出阶段用混合模型估计声音效应、场景效应与交互。
关键控制有三处。第一是提议内容恒定,同一情景只写一句脚本,不同声音身份只改变音色而不改变文字。第二是口音控制,10 个声音均为美式英语轮廓,5 男 5 女,并经 3 位作者一致评定与语音性别识别模型交叉验证。第三是外观控制,同一风格内固定姿态、背景、服装与设备,只改变性别呈现与风格,并经人工一致评定与多次自动分类保留一致样本。
反事实配对 × 命题内容恒定: 反事实配对负责只改声音性别与头像性别呈现而保持其他证据不变,分工是构造可比的冲突与一致条件;命题内容恒定负责把队友说的话固定为同一文本,分工是排除论据说服力差异,二者搭配的理由是只有文本相同时选择差异才能归因于性别线索,组合意义是得到声音效应与场景效应的干净估计。
试次组合采用平衡配对。8 男 8 女头像组成 16 对,包括 8 对角线配对与 8 对循环错位配对,使每个头像恰好出现 2 次。每对呈现男女先后两种顺序,再交叉 10 个声音身份与多个场景。任务 1 用 35 个场景得到每模型 11200 试次,任务 2 用 10 个场景在两种风格下各得到 3200 试次,合计每模型 17600 试次。
刺激组件:场景、语音与头像各自如何构造
场景组件覆盖 5 个类型。Battle Royale、Social Deduction 与 Survival 属于高风险,特征是时间压力大、后果严重、更易激活启发式判断。Creative Sandbox 与 Cozy Game 属于低风险,特征是 deliberative 协作与社交联结。任务 1 每类 7 个共 35 个,任务 2 每类 2 个共 10 个。场景由模型起草再经作者整理,每个场景包含文字处境与语音提议两部分。
语音组件用 ElevenLabs v3 合成。每情景一句脚本,内容跨条件完全相同。选择 10 个声音是为了避免单一说话人效应,并在分析中把声音身份作为随机截距。人工 3 人一致评定用于保证感知性别明确,自动识别用于补充校验,报告为与意图类别完全一致。
头像组件用 Nano Banana Pro 生成三档逼真度。写实档为膝上构图、中性站姿、直视镜头、灰色 T 恤黑裤与灰背景。卡通档保持构图与服装但改为赛璐璐渲染与简化面部。像素档改为全身超变形精灵。附录给出完整生成提示词,三档除风格外尽量固定其他属性,使风格成为可解释的调节变量。
本研究没有训练模型:真实计算发生在调用与统计
本研究没有训练任何被测模型,也没有更新权重、冻结层或反向传播。10 个被测模型是直接调用的对象,包括 4 个闭源 Gemini 系列与 6 个开源权重模型。真实计算过程分为刺激生成、模型推理与统计建模 3 段。刺激生成调用外部合成与生成系统,模型推理调用多模态接口或本地部署得到二选一输出,统计建模在 R 中用混合模型估计效应。
需要明确的缺项是原文未报告被测模型的训练数据、解码温度与采样细节,除重复运行敏感性检查外,主实验可视为单次随机运行下的输出倾向。不能把无训练等同于确定性求解,也不能从参数冻结推定输出确定。重复运行检查显示强配对模型高度稳定,弱效应模型在单条件层面波动较大但聚合指标变化有限,这支持主模式不是单次采样的偶然假象。
看图路径: 1. 先按行看写实、卡通、像素三档的渲染与体型差异;2. 再按列对比同行男女呈现的发型与面部线索;3. 最后确认背景、服装与姿态是否跨格保持一致
论文图 7。原论文 Figure 7:“Representative avatar examples across three visual styles and two gender presentations. All images generated using Nano Banana Pro.”。
上图为三档风格与两种性别呈现的代表头像。阅读时先确认每行风格差异是否可见,再确认同行男女差异是否主要来自发型与面部而非服装姿态。该图解释了为何风格可作为逼真度连续体的操作化:服装、背景与姿态被固定后,剩余变化更可能归因于写实程度而非构图混淆。
实验条件:模型、提示词与统计口径如何对齐
被测模型共 10 个。闭源为 Gemini 2.5 Flash、Flash-Lite、Pro 与 Gemini 3 Flash Preview。开源为 Qwen-2.5-Omni-7B、Phi-4-multimodal-instruct、MiniCPM-o-2.6、Gemma-3n 两个变体与 InteractiveOmni-8B。每个模型独立分析,不做跨模型显著性比较,跨模型模式为描述性总结。
提示词分为系统与用户两层。系统层说明 AI 队友身份、当前类型对局与协作规则,用户层按头像 A、头像 B、建议音频与处境文本 4 段呈现输入,并声明同时呈现无优先级,要求只输出 JSON 跟随选项。呈现顺序在试次层面平衡,但在建模中仍保留顺序协变量与首位选择分析,以量化残余顺序效应。
广义线性混合模型 × 比值比: 广义线性混合模型负责在二选一的对数几率尺度上估计声音性别系数并用随机截距吸收声音身份、图片对与场景差异,分工是建模与聚合;比值比负责把对数系数转成可读的选择倾向倍数,分工是解释效应大小,二者搭配的理由是系数显著不等于实际重要,组合意义是用同一模型同时回答有没有效应与效应有多大。
统计用二项广义线性混合模型与 logit 连接。主要分析以选男为因变量,自变量为声音性别与男性是否在先,随机截距为声音身份、图片对与场景。稳健性检查直接建模选一致的概率并控制一致选项是否在先。位置分析建模选首位的截距。调节分析加入声音与风险等级或声音与风格的交互。效应报告为比值比与置信区间,显著性用 Wald 检验。
主结果:谁在强制配对,谁在跟随场景或位置
比较问题是声音性别是否改变选男概率,公平条件是提议文本固定、头像对与顺序平衡、场景随机截距吸收内容差异,指标方向是声音系数为正表示男声更可能选男外观,一致率越高表示跨模态配对越强。下表整理任务 1 的声音配对结果,包含必要基线与实际可运行策略的对比,弱效应模型即基线参照。
| 条件 | 指标 | 强配对代表 | 中等代表 | 弱配对代表 |
|---|---|---|---|---|
| 写实风格任务 1 | 声音系数 | 9.66 与 10.66 与 4.26 | 约 0.65 | 接近 0 |
| 写实风格任务 1 | 比值比 | 超过 15000 与 71 | 约 1.9 | 约 1.0 |
| 写实风格任务 1 | 性别一致率 | 87 至 98 百分比 | 约 52 至 55 百分比 | 接近 chance 水平 |
上表数字来自原文连续报告,强配对为闭源 Gemini 系列,中等为 Flash-Lite 与 Qwen,弱配对为多数开源模型。表后解释是效应不仅显著而且实际极端,Pro 与 Preview 的比值比超过 15000 意味着近乎确定性按声音选择,而中等模型的比值比约 1.9 意味着可检测但弱得多。代价是只看该表会忽略场景与位置路径,因此必须结合冲突试次与场景分解。未胜出项同样重要,Phi-4 虽达到统计显著但原文明确指出这是大样本下的可检测性而非实际重要性。
为看清决策层级,论文构造声音与位置直接冲突的子集,即一致头像出现在第二位。此时选一致意味着跟随声音,选首位意味着跟随位置。下段图显示该冲突下的选择率。
看图路径: 1. 先从上到下读 10 行模型名,区分蓝色声音一致段与橙色首位段的长度对比;2. 再看横轴冲突试次选择率,确认中间 50 虚线两侧哪一侧占优;3. 最后比较两端极值行与中间混合行的分布差异
论文图 1。原论文 Figure 1:“Decision hierarchy when voice and position conflict.”。
该图横轴为冲突试次选择率,蓝色为声音一致,橙色为首位选择。可见顶部两行蓝色接近 99 与 96,底部附近一行橙色达到 98,中间多行橙色占优。解释是强配对模型几乎完全忽略顺序,强位置模型几乎完全忽略声音,中等模型两者混合。特别的是 InteractiveOmni 总体配对接近 chance 但冲突下声音一致达到 92,这是因为其基线偏好第二位,当一致选项恰在第二位时便表现为高一致,这说明表面性别中立可能是顺序策略的假象。
场景调节呈现另一条独立路径。下表比较高低风险下的男性选择率,条件为同一模型内跨两种声音条件聚合。
| 条件 | 指标 | 高风险选择率 | 低风险选择率 | 差距含义 |
|---|---|---|---|---|
| 极端类型 | Battle Royale 与 Cozy | 82.3 百分比 | 43.3 百分比男性 | 战斗最高而温馨偏低 |
上表说明 Qwen 声音效应弱但场景效应强,高风险比低风险高约 20 个百分点,且在男女声音下都存在。表后解释是战斗与领导场景男性选择最高,给予与分享场景最低,符合能动与亲和刻板印象。反例是强配对模型跨场景总体接近 50 百分比,说明配对强不等于场景偏强,二者可分离。
看图路径: 1. 先确认列分组左侧高风险与右侧低风险各含哪三个与两个类型;2. 再看颜色深浅与格内数字如何共同表示男性选择率;3. 最后定位颜色最深的一格并横向比较该行其余四格
论文图 9。原论文 Figure 9:“Male avatar selection (%) by model and genre in Task 1.”。
该热图行是模型,列是 5 类游戏,格内数字为男性选择率。阅读时可见 Qwen 在左侧高风险格明显偏暖,其中一格达到 82,而右侧低风险格明显偏冷。解释是场景刻板印象集中出现在个别模型与个别类型,而多数强配对模型整行接近 50,这支持偏置不是单一维度。
位置启发式 × 声音整合: 位置启发式负责解释模型不看声音只看先出现还是后出现选项,分工是非社会线索的捷径;声音整合负责解释模型是否把声音性别纳入决策,分工是跨模态信息使用,二者搭配的理由是在平衡呈现顺序后位置偏好表面上性别中立却掩盖了忽略声音的事实,组合意义是需要用冲突试次把两者直接对立起来才能看到决策层级。
风格与风险是否改变声音效应
这里的消融不是去掉网络模块,而是改变外观风格与场景风险,观察声音效应是否持续。测的是调节作用,与谁比是同一模型在写实、卡通与像素三档下的声音效应差距,条件一致性靠任务 2 固定配对与声音集合、只换风格与少量场景,指标为男声下选男概率减去女声下选男概率的百分点,越高表示声音驱动越强。下表整理代表模型的风格轨迹。
| 条件 | 指标 | 写实 | 卡通 | 像素 | 模式 |
|---|---|---|---|---|---|
| Gemini 2.5 Flash | 声音效应百分点 | 73.6 百分点 | 62.6 百分点 | 48.1 百分点 | 随写实降低而下降 |
| Gemini 2.5 Pro | 声音效应百分点 | 94 至 96 百分点 | 94 至 96 百分点 | 94 至 96 百分点 | 始终高位 |
| Gemini 3 Preview | 声音效应百分点 | 90.7 | 94.8 | 95.9 百分点 | 反而上升但受上限影响 |
上表显示风格调节具有异质性。只有部分强配对模型出现梯度衰减,Pro 始终接近上限,Preview 随风格化反而上升。表后解释是 Preview 的上升不是风格增强配对,而是男声配对已近 99 而女声配对随风格化继续上升,属于天花板效应。中等与弱配对模型在三档下维持小效应,无有意义调节。未评测边界是像素风格仍保留性别可辨线索,若进一步抽象到无法辨认性别,声音效应可能消失,但原文未测试该极限。
风险调节方向相反但幅度小。强配对模型的声效在高风险下略弱,交互系数为负,但配对仍远大于场景效应。中等模型的场景主效应更明显,Flash-Lite 高风险约 56.7 而低风险约 44.6,同样在两种声音下都上移,说明语境改变基线而非改变声音斜率。
看图路径: 1. 先看横轴三档风格顺序与纵轴声音效应百分点含义;2. 再追踪中间一条明显下滑曲线的三点高度变化;3. 最后对比顶部两条近水平高位线与底部两条低位线的走向
论文图 3。原论文 Figure 3:“Voice effect (pp) across avatar styles for three strong-matching (Gemini 2.5 Pro, Gemini 3 Flash Pre- view, Gemini 2.5 Flash) and two moderate-matching (Gemini 2.5 Flash-Lite,…”。
该折线图横轴为三档风格,纵轴为声音效应百分点。可见中间一条线从高到低明显下滑,顶部两条线维持高位,底部两条线维持低位。解释是风格只在特定模型中调节配对强度,不能推广为降低写实度就能通用去偏。复现时应同时报告条件配对率与差距百分点,避免把饱和误读为增强。
视觉逼真度 × 天花板效应: 视觉逼真度负责通过写实、3 维卡通与像素风三档改变外观的现实感,分工是调节跨模态联想强度;天花板效应负责解释当配对率已接近上限时差异无法继续放大,分工是说明测量边界,二者搭配的理由是逼真度降低不一定表现为单调下降,组合意义是只有同时看男女声音下的条件配对率才能判断是真调节还是饱和假象。
哪些结论不能从当前证据推出
第一是刺激外部效度。语音为合成语音,头像为生成图像,控制严格但缺少自然韵律、录音条件与个性化外观变异。结果是受控审计下的倾向,不能直接推广到真实用户。
第二是性别操作化。研究使用二元男女,原因是当前合成与定制系统的常见选项。原文明确不认可二元性别观,也不把声音特征当作身份真值,头像用男性呈现与女性呈现表述。非二元表达未覆盖,需未来工具成熟后扩展。
第三是口音与音色残余变异。虽统一美式英语轮廓并做一致评定,音高音色语速仍可能影响模型。5 个声音每性别显示模式相似,但不能排除集合外声音的特异效应。
第四是场景文本来源。情景由模型起草再人工整理,特定内容可能触发文化角色联想。研究通过固定提议文本与显式建模场景来缓解,但内容触发的偏置仍是审计类方法的固有限制。
第五是因果归因。设计测量受控输入下的输出倾向,不干预模型内部。观察到的规模、架构与对齐差异只能作为相关讨论,不能断言某一组件导致配对。强迫选择只记录方向不记录强度与弃权,顺序平衡降低平均混淆但个别模型仍有强位置策略,因此无声音效应不等于无系统偏置。
复现先做什么:数据、调用与统计清单
复现应先重建刺激与试次表,而非先调模型。需要 35 加 10 个情景文本、每情景一句固定提议脚本、10 个声音身份、三档风格各 16 张头像、16 对配对表与顺序平衡表。声音需保留感知性别一致评定记录,头像需保留一致评定与多次分类记录,否则无法证明性别线索明确。
调用阶段按系统提示词与 4 段用户输入组织多模态请求,要求只输出跟随选项。每模型需完成任务 1 的 11200 试次与任务 2 各 3200 试次,注意任务 2 场景较少是为了控制组合量。建议先在 80 条件子集上重复 5 次估计稳定性,强配对模型应接近确定,弱效应模型单条件波动大但聚合稳定。
统计阶段对每个模型独立拟合混合模型,因变量为选男或选一致,自变量包含声音性别与顺序,随机截距包含声音身份、图片对与场景。报告声音系数、比值比、一致率与交互,避免只报显著性。关于可用性,原文给出代码与数据链接,但本次资源状态为未发现可验证的可用资源,因此不能写已公开或当前可用,复现前需自行确认链接可达性。
何时值得尝试该范式与还需补哪项验证
当研究问题是声音与外观不一致时模型先信谁,或单一偏置指标显示公平但怀疑存在跨模态强制一致时,该反事实二选一范式值得尝试。它的价值在于用同一套试次同时估计声音配对、场景默认与位置捷径,避免用总体男性比例掩盖机制差异。
应用时需保留关键信息条件,即文本恒定、顺序平衡、口音轮廓一致与风格受控。若去掉任一条件,声音效应与场景效应的分离将不再可信。降低写实度不应作为通用去偏手段,因为证据显示只有部分模型出现梯度衰减,其他模型维持高位或低位不变。
还需补的验证包括自然语音与真实头像的泛化、非二元呈现的扩展、更多声音身份的覆盖,以及干预内部表征以检验因果路径。部署含义是两类偏置需分别缓解,压制声音配对不能解决场景男性默认,校准场景也不能阻止跨模态身份强制。安全做法是避免强制声音外观一致,优先用户自主呈现,并明确该审计结果不能用于对真人做决策或画像。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



