英文题目:Gender Bias in ASR: A Controlled Study of Gender Composition Across Training Paradigms

会议身份:conference:interspeech:2026:conference-paper-id:s26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#SFT #模型比较 #公平性 #语音识别

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Seshan S:机构信息未能从会议 PDF 纯文本可靠映射
  • Murali Kadambi:机构信息未能从会议 PDF 纯文本可靠映射
  • Amartya Veer:机构信息未能从会议 PDF 纯文本可靠映射
  • Prasanta Kumar Ghosh:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究处理语音识别中的性别差异,输入为不同性别构成的训练语音,输出为分性别的词错误率与人口学差异分数,难点是预训练带来的未知性别分布会混杂微调阶段的构成效应。方法链分三步:先按女性占比0%至100%以10%步长构造11种训练划分并固定测试集,再对3个预训练模型做监督微调同时对混合模型做从零训练,最后按性别分组计算词错误率与人口学差异分数以对比构成敏感性。与已有微调研究的关键机制差异是引入完全受控的从零训练参照,从而分离预训练表征稳定性和微调数据构成的影响。在Indic TIMIT评测设置下,从零Kaldi系统在全男性训练时的人口学差异分数为+43.1,高于全女性训练时的人口学差异分数-37.2,而3个预训练系统波动基本在正负12以内且无单调趋势。结论边界限于英语朗读与众包语音、二元性别标注和71.36小时量级训练,不支持向非二元性别、多语言或大规模持续预训练外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么:为什么要控制性别构成来谈偏差?

本文输入是英文语音识别任务,输出是文字转写,评价按性别分组进行。研究目标不是把总体词错误率再降低一点,而是检验一个被广泛使用的方法假设:只要在微调阶段把男女训练时长配平,就能观察并缓解性别偏差。论文作者来自印度科学理工学院 SPIRE 实验室,面向刚入门的研究生,关键信息必须保留:3 个数据集、四系统、十一档配比、共 132 次独立训练与固定测试集。

白话先讲自动语音识别:系统听一段波形,输出词序列。词错误率越低越好,分别在男声和女声测试句上计算,就能看到性别差异。人口统计均等差异分数,英文为 Demographic Disparity Score,缩写为 DDS,是本文的核心差异指标。它以男性错误率为分母,计算女性相对男性的超额百分比。正值表示女性更差,负值表示男性更差,零表示均等。后文统一用词错误率和 DDS 指代这两个量。

学习依赖上,先要理解偏差来源的两种故事。一种故事说偏差来自训练数据中男女不平衡,补数据就能解决。另一种故事说偏差来自大规模预训练阶段已形成的表征,微调阶段的小数据很难改写。本文要区分这两种故事,因此必须同时做预训练模型微调和从头训练对照。输出上,论文不是提出新模型,而是给出方法论判断:平衡微调数据不足以研究和缓解预训练模型的性别偏差。

前人用微调研究配比得到了什么,为何还缺一块对照?

同输入同目标的直接前人工作是性别构成受控的微调研究。Garnerin 等人在 LibriSpeech 上构造不同女性占比的训练集,发现说话人特异性有时比性别比例影响更大。ElGhazaly 等人微调 Whisper Small 的十一档配比,发现训练平衡与性别词错误率之间是非单调关系,最优配比取决于声学覆盖而非人口比例。Boito 等人在法语上改变 wav2vec 2.0 预训练阶段的性别平衡,发现平衡预训练并不一致地缩小下游性别差距。这些结果在各自内部一致,但跨模型跨数据集没有稳定方向。

同监督不同阶段的另一条线是预训练本身的性别影响。由于预训练语料规模大且性别分布未知或未记录,微调时的构成效应与预训练残留效应混在一起。先前工作通常只做一个模型一个数据集,无法分离 2 阶段影响。本文明确指出这个混杂是方法缺口,并用相同配比同时驱动预训练模型和从头模型来补上。

更广的背景是性别偏差方向本身不稳定。荷兰语和韩语研究曾报告女性错误更低,非裔美国英语语料则相反,多语言评估显示占优性别随语言、数据集和模型变化,还有研究显示差异不显著。这支持论文的起点:差异不是男女固有声学差异的必然结果,而是数据构成与训练范式塑造的。对初学者而言,相关工作的教训是不要把某 1 数据集上的男女优劣当成普遍结论,而要看实验条件是否可比。

要回答的具体问题是什么,什么算系统性关系?

论文把问题收敛为一句话:预训练系统与从头系统在面对完全相同的训练性别构成变化时,反应是否不同。具体操作是把女性训练占比从 0% 到 100% 以 10% 为步长滑动,共十一档,每档训练数据总量固定,测试集固定,只看 DDS 是否随构成单调或方向一致地移动。

什么算系统性关系需要事先讲清。系统性不是某两档之间偶然一升一降,而是在 3 数据集上可重复的方向性移动:女性数据增多时女性相对错误下降,DDS 向下移动;男性数据增多时反之。幅度也要大到超出测试划分的随机波动。本文用男女测试句各随机分成 10 个不重叠子集,分别算词错误率并报告均值与标准差,以此估计波动。若 DDS 来回抖动且幅度只在几个百分点内,就不算系统性。

举例说明但不虚构数值:假设一个样本是女性朗读的有声书句子,系统输出把个别词听错,计入女性词错误率。若训练中女性占比提高后,同类句子错误持续减少而男声错误相对上升,DDS 下移,这就是构成效应的直观体现。论文要检验的正是这种直观在预训练模型上是否还成立。

全景如何组织 132 次实验来隔离预训练的影响?

方法全景可以沿一个训练条件走一遍。取一个具体配比,例如男性 50% 女性 50%,从 3 个语料中按该比例抽取共 71.36 小时的训练语音,男女说话人与测试说话人严格不重叠。然后用同一份数据分别训练 4 个系统:3 个从公开检查点出发微调的预训练系统,一个只用这份数据从头训练的 Kaldi 混合系统。最后在固定测试集上分别计算男女词错误率和 DDS。把配比换成另外十档,重复上述过程,就得到每个系统在每个数据集上的 DDS 曲线。

3 数据集负责覆盖不同声学条件。LibriSpeech 是 16 kHz 朗读有声书,取干净子集,干净测试集有 40 个说话人。Indic TIMIT 是 240 小时印度英语朗读,音素丰富,80 个说话人全部出现在测试集中。Mozilla Common Voice 第三版是众包多条件语料,自然分布约 75 比 25 偏向男性,测试集有 1266 个说话人。三者都只提供男或女二元标注,这是后续局限的来源。

四系统负责对比范式。Wav2Vec 2.0 是自监督 Transformer 编码器,在英文上预训练。SPRING Wav2Vec 2.0 架构相同但在印度口音英文上预训练,提供领域相关变体。Whisper Medium 是大规模弱监督编码器解码器模型,在多语言语音上预训练。Kaldi 是基于 TDNN-HMM 的混合系统,用无格最大互信息目标从头训练,解码用固定三元统计语言模型且在全部 132 个条件下保持不变,以保证语言模型影响一致。总数上,3 数据集乘四系统乘十一配比等于 132 次独立训练,这是全文复述时必须保留的数字关系。

组件如何分工:编码器、混合模型与评价指标各管什么?

先看预训练侧的组件。Wav2Vec 2.0 和 SPRING 负责把波形编码为上下文表示,Whisper 负责编码加解码直接生成文字。它们共同点是推理前已带有大规模预训练的表示,微调只是在此基础上小步调整。Kaldi 混合侧则完全不同:声学模型从头学习发音到状态的映射,语言模型固定外部文本训练的三元模型,解码时两者结合。这种设计使 Kaldi 的全部性别相关表示只能来自受控训练数据。

评价侧的组件是分组词错误率加 DDS。分组词错误率回答男女各自错多少,DDS 回答两者相对差多少。DDS 以男性为参照组,女性为目标组,公式含义是女性减男性再除以男性乘 100。符号上,分母为男性词错误率,分子为男女之差。计算目标是把绝对错误水平归一化,便于跨数据集比较偏差方向。实现上男女测试句各分 10 个子集独立计算再平均,避免 1 次划分的偶然性。

微调 × 预训练表征: 微调指固定已在大规模外部语料上学到的参数起点,只用性别受控的小规模数据继续更新;预训练表征指该起点中已编码的声学与语言映射。两者搭配的理由是希望小数据能覆盖大数据的性别偏置,新增作用本应是低成本校正,但论文显示预训练表征的稳定性限制了微调改写性别相关映射的能力。

沿样本走完 1 次:一条女性测试语音进入系统,编码器给出表示,解码器或混合解码给出词序列,与参考文本对齐计错误,累积到女性组;同样处理男声得到男性组;最后用两组均值算 DDS。若训练中女性占比提高,理想情况下女性组错误下降更快,DDS 下移。

配比、采样与冻结条件如何保证唯一变量是性别构成?

配比组件负责定义自变量。从 0% 女性到 100% 女性共十一档,每档总量锁定 71.36 小时,这是女性在 CommonVoice 中可用的最大单性别时长。按比例换算,10% 女性对应约 7.14 小时女性加 64.22 小时男性,50 比 50 对应各 35.68 小时,依此类推。采样在话语级无放回随机抽取,随机种子固定为 42,说话人数量按比例保持,使说话人层面和时长层面构成一致。

冻结组件负责固定其他变量。同一模型同一数据集的超参数在十一档间完全相同,测试集固定且与训练说话人不重叠,Kaldi 的语言模型固定。这种安排的理由在原文明确给出:确保训练性别构成是唯一变化因素,使 DDS 曲线可以直接解读为构成敏感性。

从头训练 × 性别构成: 从头训练指所有参数随机初始化后只从性别受控数据学习;性别构成指训练集中男性与女性时长占比从 0:100 到 100:0 的十一档设置。两者搭配的理由是切断外部数据的混杂,使构成成为唯一变化因素,新增作用是提供因果参照,验证构成效应真实存在且可被系统性检测。

词错误率 × 人口统计均等差异分数: 词错误率负责分别度量男声和女声测试子集上的识别错误水平;人口统计均等差异分数负责把两者压缩为以男性为参照的相对差异百分比。正值表示女性错误更高,负值相反,零表示均等。两者搭配的理由是只看总体错误会掩盖性别分化,组合后才能追踪构成变化是否系统性改变偏差方向。

Wav2Vec 2.0 × SPRING: Wav2Vec 2.0 是英文自监督 Transformer 编码器,负责提供通用英文预训练起点;SPRING 架构相同但在印度口音英文上预训练,负责提供领域相关的预训练变体。两者搭配的理由是检验不敏感究竟来自某个语料还是来自预训练范式本身,新增作用是若两者都稳定,则支持范式层面的解释。

需要提醒初学者:超参数固定不等于模型输出确定,训练仍有随机性,但本文用测试子集划分估计波动而非重复训练,这是原文明确的统计处理,不应误读为多次训练取平均。

训练与微调实际执行了什么,哪些细节未报告?

训练过程分两类。预训练模型做微调:用 HuggingFace Transformers 库从公开检查点初始化,Wav2Vec 2.0 用 facebook 的 base 检查点,SPRING 用对应印度口音检查点,Whisper 用 medium 检查点。Wav2Vec 2.0 和 SPRING 用 Adam 优化器,学习率 3 乘 10 的负 5 次方,批量 8,最大梯度范数 1.0。Whisper Medium 用 AdamW,学习率 1 乘 10 的负 5 次方,批量 4。每个配比独立训练 1 次,不跨配比延续。

从头训练过程是 Kaldi 链式模型。用受控数据从零学习声学表示,目标为无格最大互信息,解码配固定三元语言模型。为验证结论不限于混合架构,作者还在 LibriSpeech 两极端配比上用 IceFall 工具的 Zipformer 端到端模型做了补充从头训练。硬件为 NVIDIA GeForce RTX 3090。

缺项必须点明:原文未报告微调时冻结哪些层、训练轮数与早停规则、学习率调度与梯度具体流向,也未给出 Kaldi 与 Zipformer 的完整网络尺寸与训练步数。因此不能从模型名字推定实现细节,也不能断言拿掉某组件必然如何。复现时应先按原文超参数跑通,再补做训练日志与检查点记录。

数据如何配平,评价如何聚合,公平条件是什么?

比较问题是:在总量与测试集固定的前提下,改变男女时长占比是否改变性别偏差。公平条件有三:总量固定 71.36 小时,测试集固定且说话人不重叠,同一模型超参数固定。指标方向是 DDS 绝对值越小越接近均等,但关键看 DDS 是否随女性占比单调移动,而不仅看某一点是否接近零,因为极端不平衡下也可能偶然接近零。

主结果:从头训练翻转而预训练模型原地抖动

要看的主曲线是 DDS 随女性训练占比的变化。导读如下:横轴为女性训练占比从 0 到 100,纵轴为 DDS 百分比,正为女性更差,负为男性更差,蓝色虚线为零均等线。4 个面板分别为 Kaldi、Wav2Vec2、SPRING 和 Whisper,每个面板内 3 条线为 3 个数据集。读图时先确认图例与纵轴量级,再判断升降方向的好坏,不能把曲线向下直接等同于性能变差,因为 DDS 向下可能是女性改善或男性变差共同导致,需结合分组词错误率。

看图路径: 1. 先看左上 Kaldi 面板三条曲线是否随女性占比增加整体向下穿越零线;2. 再看右上、左下、右下三个预训练面板曲线是否在零线附近小幅缠绕无单调趋势;3. 对比纵轴量级:Kaldi 跨越数十个百分点,预训练面板多在十个百分点以内;4. 注意 Whisper 在 LibriSpeech 上长期为正且 LibriSpeech 绿色线与其他数据集分离

原论文 Figure 1:Demographic Disparity Score (DDS) as a function of female training proportion for Kaldi, Wav2Vec…

论文图 1。原论文 Figure 1:“Demographic Disparity Score (DDS) as a function of female training proportion for Kaldi, Wav2Vec 2.0, SPRING, and Whisper across Common Voice, Indic TIMIT, and LibriSpeech.”。

像素可见的内容支持以下解释。左上 Kaldi 面板 3 条线整体随女性占比增加向下走,Indic TIMIT 橙线从约 40 以上陡降并穿越零线到约负 40,Common Voice 蓝线从约 19 降到约负 13,LibriSpeech 绿线从约 33 降到约 5 附近但未完全过零。右上 Wav2Vec2、左下 SPRING、右下 Whisper 则无此单调结构,曲线在零线上下小幅缠绕或长期偏向一侧,纵轴跨度明显更小,SPRING 与 Wav2Vec2 行为接近,Whisper 在 LibriSpeech 上长期为正且波动大。

来源证据量化值一量化值二量化值三量化值四
来源句一37.280——
来源句三+33.2+4.7——

表后解释主要收益与代价。收益是 Kaldi 与 Zipformer 共同证明构成效应真实存在且幅度大,预训练模型的不敏感不是效应不存在,而是被掩盖。代价是 LibriSpeech 上 Kaldi 即使全女性训练仍为 +4.7,说明除构成外还有数据集固有偏置。未胜出项是 Wav2Vec2 在 LibriSpeech 上的持续女性劣势与 Whisper 的稳定正 DDS,微调十一档都未消除,这是平衡微调无效的最直接反例。

来源证据量化值一量化值二量化值三量化值四
来源句一71.36———
来源句二5201040;30;0
来源句三42———

该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据。

反证与消融:换预训练语料与换架构能否推翻结论?

论文做了两类特有反证。第一类是换预训练语料:SPRING 在印度口音上预训练,Wav2Vec2 在通用英文上预训练,若不敏感只是某个语料的偶然,两者应分化。但结果显示两者 DDS 都保持在约正负 12 以内,且在平衡点与极端点都可能偶然近零,行为高度一致。原文明确据此判断不敏感来自预训练范式而非语料特性。

第二类是换从头架构:Zipformer 端到端模型只做两极端配比,DDS 从全女性负 9.3 到全男性正 39.4,复现了 Kaldi 的方向翻转。这说明强构成敏感性是从头训练范式的属性,不是 Kaldi 混合架构的特例。

来源证据量化值一量化值二量化值三量化值四
来源句一2.010——
来源句二12———
来源句三2019168;15

表后必须说明限制。Zipformer 只测两极端,未做完整十一档,不能断言其中间单调形状。预训练模型的波动虽小,但个别数据集上仍有数个百分点起伏,不能说构成完全零作用,只能说无可靠方向关系。原文也指出表观均等可能出现在极端不平衡下,因此不能把单点近零当作缓解成功的证据。

什么还没验证:语言、性别标注与成本缺口在哪里?

论文明确报告的局限是仅限英文与二元性别。这反映标准标注实践并便于与先前受控研究直接比较,但结论是否适用于非二元说话人、多语言与口音更复杂的场景待验证。初学者不应把英文上的翻转幅度当成其他语言的预期值。

未测量的量也要分开讨论。原文未报告误判率之外的延迟、推理开销、训练能耗与总体拥有成本,因此不能承诺平衡或干预措施会改善这些量。训练资源只给出 GPU 型号为 RTX 3090,未给出总时长与电耗。推理帧率与实际延迟未讨论,总体趋势不等于每组每步都成立。

另一个缺口是预训练语料的性别分布本身未知。论文的解释是表征稳定性掩盖了微调效应,这得到跨模型一致性的支持,但属于有限解释而非直接测量预训练语料构成的因果证明。要升级为因果,需要受控的继续预训练或表示探测实验,而这正是作者建议的未来方向。用报告、支持、可能 3 级表达:报告的是 DDS 曲线与锚点数值,支持的是范式差异判断,可能的是预训练表征稳定性的机制解释。

复现先做什么,需要哪些权重与划分?

复现起点是拿到三公开语料与三公开检查点,再按十一档重建 71.36 小时训练集。LibriSpeech 用干净子集,Indic TIMIT 用 240 小时印度英语,Common Voice 用第三版。抽样必须话语级无放回、种子 42、说话人数按比例、训练测试说话人不重叠、测试集固定。总量截断是关键,任何多用数据都会破坏可比性。

模型侧,Wav2Vec2、SPRING 与 Whisper 从原文给出的公开检查点初始化,超参数按原文锁定:前两者 Adam 学习率 3 乘 10 负 5 批量 8 梯度裁剪 1.0,后者 AdamW 学习率 1 乘 10 负 5 批量 4。Kaldi 用 TDNN-HMM 加无格最大互信息从头训练,解码配固定外部文本训练的三元语言模型且全条件不变。每个配比独立训练 1 次,共 132 次。评价侧把男女测试句各分 10 个不重叠子集,分别算词错误率均值与标准差,再算 DDS。

资源状态必须如实写:本次收到的证据中未发现来源绑定且完成 HTTPS 验证的资源,不得声称代码、模型或数据已公开。论文正文提及检查点名称与工具库,但本次未能确认可达,复现前需自行验证链接与版本。还需补的验证是记录训练日志、检查点哈希与语言模型文本来源,否则 132 次实验难以审计。

何时值得尝试平衡微调,何时必须动预训练表示?

综合判断是:若目标是研究构成效应或缓解预训练模型的性别偏差,只平衡微调数据不值得单独尝试,因为三预训练模型在十一档上的 DDS 始终小幅无序波动,LibriSpeech 上的持续劣势与 CommonVoice 上偶然的近零都说明单点均等不可靠。若目标是从头训练小系统,构成控制值得优先尝试,因为 Kaldi 与 Zipformer 都显示大幅方向性翻转,配比可以直接塑造偏差方向。

论文特有的误解需要澄清。第一,平衡不等于公平,50 比 50 处近零也可能在极端处再现,公平要看整条曲线是否响应构成。第二,总体词错误率稳定不等于偏差稳定,预训练模型男女错误各自稳定但 DDS 仍在小范围抖动,不能用总体错误代替分组评估。第三,从头敏感不等于预训练无效,只是说明干预点选错了层级,作者建议转向受控继续预训练、针对性适配与显式探测修改表示。

收束到可执行建议:先复现 DDS 曲线确认范式差异,再对预训练表示做探测分析定位性别相关方向,最后设计表示层干预并用同样十一档检验 DDS 是否恢复单调响应。只有当干预使预训练模型的 DDS 动态范围接近从头模型的量级且方向可预测时,才能说缓解真正触及了偏差来源。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总