英文题目:MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment

会议身份:conference:interspeech:2026:conference-paper-id:ren26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多任务学习 #统计分析 #公平性 #语音 #语音质量评估

评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Wenze Ren:机构信息未能从会议 PDF 纯文本可靠映射
  • Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
  • Wen-Chin Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Erica Cooper:机构信息未能从会议 PDF 纯文本可靠映射
  • Ryandhimas Zezario:机构信息未能从会议 PDF 纯文本可靠映射
  • Hsin-Min Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究处理合成语音与转换语音的语音质量评估,输入为待评波形,输出为人类感知质量分,难点是听众性别带来的系统性差异被简单平均掩盖。该掩盖使聚合标签偏向一方感知标准且幅度随整体质量变化,难以用固定校准消除。方法链分三步:第一步在BVCC训练集上按听众性别乘说话人性别统计评分均值与标准差以刻画分布,第二步承接该分布做Welch t检验验证差异显著性并按整体MOS四档(1-2、2-3、3-4、4-5)量化男女均值差随质量收窄的规律。第三步将上述分组规律转为监督信号,构建共享自监督学习(Self-Supervised Learning,SSL)编码器加均值分支与性别分支的联合模型,同时拟合整体真值、男性组真值与女性组真值。相比直接拼接性别标签或为男女各训独立模型,该设计用取值为0与1的抽象二元组嵌入作为条件信号,共享编码器保留全量数据表示,两分支分离偏好。在 BVCC 测试集3个随机种子(1337、2337、3337)平均下,性别感知模型的均值分支在话语级将线性相关系数(Linear Correlation Coefficient,LCC)从 0.853 提升至 0.862,均方误差(Mean Squared Error,MSE)从 0.290 降至 0.239;基线同一预测对照男性真值话语级 MSE 为 0.372,对照女性真值为 0.430,系统级为 0.141 对 0.194,相对差距 37.6%。结论目前仅在 BVCC 英语合成语音、二元性别划分与 SSL-MOS 框架下成立,未验证跨数据集、跨语言与缓解后公平收益,原文未披露训练推理成本与开源产物。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么:为什么要先检查打分人本身?

这篇论文研究的输入是一段待评价语音,目标是预测人类听音测试会给出的质量分数。初学者可以把平均意见分理解为很多人打分后的平均值,白话就是一组人听完同一条语音后各自给 1 到 5 分,再平均成一个数,英文是 Mean Opinion Score,缩写为 MOS。自动语音质量评估的目标就是只看音频波形,直接估计这个平均数,用于文本转语音、声音转换和语音增强等系统的快速迭代。

本解读的输入是论文正文证据与官方原图信息,目标是让刚入门的研究生能核对关键数字并复述方法。必须保留的信息包括数据集名称与划分、听众性别与说话人性别的分组方式、质量分段上的差距数字、基线训练条件、评价粒度和指标方向,以及性别感知模型的分支与损失构成。输出是 1 篇按学习依赖展开的技术解读,不做超出证据的效果承诺。

为什么不是把声音丢给模型就结束?因为监督信号本身来自人,而人带有系统性差异。如果男听众和女听众对同一批语音的感知标准不同,那么简单平均得到的标签就不是中立代表,它可能更接近其中一组。模型在这种标签上训练,即使训练时完全看不到性别信息,也会把偏斜当作正确目标学下来。论文的起点正是先量化这种标注偏差,再检验模型是否继承它,最后看显式建模分性别模式能否同时改善总体与分性别精度。

已有路线在解决什么,相邻公平性工作为何不能直接套用?

自动 MOS 预测已有成熟路线,例如 MOSNet、SSL-MOS、MOSA-Net、UTMOS 和 HighRateMOS。白话说,这些方法都是从音频学一个回归器去拟合平均分,英文主流框架是 SSL-MOS,即先用自监督语音表示抽特征,再接回归头预测分数。另一条路线是听众依赖建模,例如 MBNet 和 LDNet,白话就是不再只学全局平均,而是同时学每个具体听众的偏置或个性化偏移,以解释同一条语音不同人打分不同。

相邻领域的标注偏差研究提供了对照。在自然语言处理中,标注者的性别、年龄和文化背景会在情感分析、有毒语言检测中引入系统差;在计算机视觉中,标注者人口属性也会影响对冒犯性内容的判断。语音处理中的公平性更多集中在说话人一侧,例如语音识别和语音情感识别中的性别与口音差异,以及用元学习做个性化情感标注。

这些工作不能直接当作同条件胜负对照,因为输入、目标和监督都不同。自然语言与图像的偏差结论不能直接搬到听觉感知;说话人公平性关心的是被评价的发音人,而本文关心的是给出分数的听众;听众依赖模型虽然建模个体,但没有检验个体差异背后的性别结构。论文的定位是补上听众性别这一被忽视的维度,并追问平均标签与在其上训练的模型是否隐含偏向。

问题如何形式化:一条语音的三个分数是什么关系?

设某条语音为 u,听众 i 给出的打分为 ri。标准 MOS 是该条语音上全部 N 个打分的算术平均。性别特定分是分组平均:只对男听众集合求平均得到男听众 MOS,只对女听众集合求平均得到女听众 MOS。标准 MOS 在数学上是这两个分组均值的加权平均,权重正比于每组人数。

平均意见分 × 性别特定分: 平均意见分是将同一条语音上所有听众打分的加权平均作为唯一真值,分工是给出可排序的单一质量标尺;性别特定分是分别对男听众集合与女听众集合内求平均,分工是保留两组感知标准的各自位置。两者搭配的理由是当两组标准存在系统差时,单点平均会同时偏离两组,而保留分性别参照才能检验平均分偏向哪一组,组合意义在于把公平性问题转化为可计算的对齐差距。

沿一个样本走一遍有助于理解。假设一条低质量语音有 8 个听众,其中男听众较少、女听众较多,每人给出 1 到 5 分。先分别算男组均值和女组均值,再按人数加权得到公布的平均分。如果男组系统性给得更高,那么即使男组人数较少,加权平均仍会被拉向男组方向之外的某个中间点,这个中间点可能既不等于男组均值,也不等于女组均值。论文要检验的正是这种系统差是否存在、是否随质量变化,以及模型预测更靠近哪一组的均值。

方法全景:先证偏差存在,再证模型继承,最后做性别感知

论文的方法全景分 3 步。第一步是偏差分析,只用 BVCC 训练集的人类标注,不训练任何模型,按听众性别与说话人性别交叉统计均值与标准差,并用适合样本量不平衡的韦尔奇 t 检验判断差异是否显著,再按总体 MOS 把语音分成 4 个质量区间,看男减女差距如何变化。第二步是偏差继承分析,用标准 SSL-MOS 基线只拟合总体平均分,然后把同一组预测分别与总体真值、男组真值和女组真值比较,看误差与相关性是否不对称。第 3 步是性别感知建模,在共享编码器上并行增加性别分支,用抽象组嵌入区分两组,用三项均方误差联合训练,同时输出平均预测、男视角预测和女视角预测。

这个顺序有学习依赖:若不先证明人类标注存在结构性差距,就无法解释模型不对称来自标签而非随机;若不先证明单标签模型会继承偏向,就没有必要引入多任务分支;只有确认差距随质量变化,才能理解为何简单的全局加减校准不够,而需要条件化建模。3 步共用同一数据集划分与同一评价粒度,保证结论可比。

共享编码器与双分支如何分工:一个样本走完前向过程

基线 SSL-MOS 的核心是自监督编码器加回归头。白话说,自监督编码器是先在大规模语音上学通用声学表示的网络,英文是 self-supervised learning encoder,缩写为 SSL 编码器;回归头是把表示映射成一个分数的小网络。论文的性别感知模型保留这个主干,复制出两条并行的预测网络:一条是平均分支,负责预测总体 MOS;另一条是性别分支,负责在不同组嵌入条件下分别预测男组 MOS 和女组 MOS。

共享自监督编码器 × 性别分支: 共享自监督编码器负责把波形变成两条分支共用的语音表示,分工是让两组感知学习共享全部数据而不切分训练集;性别分支负责在该表示上用不同组嵌入条件输出男视角与女视角分数,分工是学习随质量变化的打分偏移。搭配理由是只靠单分支只能学混合均值,而共享表示加条件分支既保留数据效率又分离感知差异,组合后主分支能更纯粹地学语音内在质量。

以前向过程为例。输入是一条语音波形,先经过共享 SSL 编码器得到表示向量。平均分支直接把该表示映射为总体分数。性别分支则额外接收一个硬编码的二值条件,0 代表一个抽象组,1 代表另一个抽象组,同一表示在不同条件下走共享权重的投影,分别输出男视角分数与女视角分数。训练时 3 个输出各有对应的真值:总体均值、男组均值和女组均值。测试时可以根据需要取平均分支做总体预测,或取对应性别分支做分性别预测。

为何不用真实性别作输入:抽象二值组嵌入的设计理由

初学者容易问,为何不直接把听众是男是女拼进特征。论文的选择是反直觉但有理由的:基线被设定为性别中立的听众,测试时不应要求调用方提供人口学标签;同时作者希望模型从数据中的性别化信号自主发现感知模式,而不是靠显式标签记忆。因此性别分支的条件不是性别字符串,而是两个抽象的二值组嵌入,白话就是只告诉网络现在要按组 0 或组 1 输出,但不告诉它组 0 一定等于女性。

抽象二值组嵌入 × 听众性别标签: 听众性别标签是真实人口学信息,分工是直接指明样本来自哪组;抽象二值组嵌入是用硬编码的 0 和 1 作为条件输入,分工是只告诉模型存在两个需要区分的抽象组而不直接喂入性别语义。搭配理由是避免把性别先验写死进输入并保持基线性别中立的设计,同时迫使模型从分性别监督信号中自主发现两组模式,组合意义在于用可控的条件机制实现性别感知而不做显式人口学分类。

这种设计还有数据效率考虑。如果为男女各训一个完全独立模型,每组只能用各自子集,样本量减半;共享编码器让 2 分支看到全部数据,只在投影层学习差异。论文明确用等权重的三项损失联合优化,避免某一视角主导训练。需要指出缺项:原文没有报告编码器是否冻结、组嵌入维度与初始化方式、以及分支投影的具体层数与梯度是否截断,这些实现细节未给出,不能从模型名称推定。

训练如何组织:基线与性别感知模型各优化什么?

基线训练是标准的单目标回归。优化器使用随机梯度下降,学习率为 0.001,最多训练 100000 步,每隔一段时间在开发集上看系统级斯皮尔曼秩相关系数,若连续 20 次评估没有提升则早停。为保证稳健性,基线在 3 个随机种子下独立训练,其他条件保持不变,种子取 1337、2337 和 3337。监督来源只有总体 MOS,不使用任何性别信息。

性别感知模型的训练是多任务回归。总损失是平均分支损失加男分支损失加女分支损失,每项都是对应分支预测与对应性别真值之间的均方误差,权重按 1 比 1 比 1 平均。实验框架采用 SHEET 工具包,该工具包支持多数据集的 MOS 训练与预测。论文选择 BVCC 的原因是它在 SHEET 支持的数据集中唯一同时提供说话人与听众性别元数据。BVCC 整合了 Blizzard 挑战、声音转换挑战和 ESPnet 文本转语音公开发布的样本,每条语音由 8 名听众评价,划分为 4974 条训练语音、1066 条开发语音和 1066 条测试语音。

关于资源缺项需要如实说明:原文没有报告训练硬件、批量大小、评估频率对应的步数间隔、编码器参数量与训练时长,因此不能讨论训练成本与推理延迟的定量结论。多任务是否增加推理开销也未测量,只能从结构上说推理时多了一个并行投影分支,但具体帧率与延迟未知。

实验条件如何保证可比:数据、分组、指标与聚合口径

数据与协议按原文交代。偏差分析主要用训练集的人类标注,偏差继承与模型比较用测试集。分组维度有两个:听众性别分为男听众与女听众,说话人性别分为男声与女声。训练集中每条音频平均有 3.6 个男听众打分和 4.25 个女听众打分,女听众是人数较多的一方,这个细节对理解平均分偏向至关重要。质量分段按总体 MOS 分为 1 到 2、2 到 3、3 到 4、4 到 5 四档,分别对应差、一般、好和优秀。

指标包括线性相关系数、斯皮尔曼秩相关系数、均方误差和肯德尔秩相关系数。白话说,前两者越大表示排序与线性趋势越准,英文分别是 Linear Correlation Coefficient 和 Spearman Rank Correlation Coefficient,缩写为 LCC 和 SRCC;均方误差越小表示数值越接近,英文是 Mean Squared Error,缩写为 MSE;肯德尔系数衡量排序一致性,缩写为 KTAU。评估分话语级与系统级两种聚合:话语级对每条语音计分,系统级先聚合到系统再计分。

所有模型结果都是 3 个种子平均,并报告波动。统计检验用韦尔奇 t 检验处理样本量不平衡,显著性阈值远低于常规水平。

资源可用性必须按规则说明。本次没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。论文正文提到的 SHEET 工具包与 BVCC 数据集只是研究使用的对象,不代表本次可确认其下载链接可达。

人类标注差了多少:总体差距与随质量变化的结构

要回答的比较问题是,在说话人性别相同、评价协议相同的条件下,男听众与女听众的均值是否存在稳定差异,指标方向是均值越高表示打分越宽松。下面第一张表整理总体均值对比,公平条件是同一说话人性别分组内比较不同听众性别,表中数字为原始平均分,裸值无单位,精度保留原文 2 位小数。

说话人条件评价对象男听众平均分女听众平均分比较对象
男声同批语音质量2.9252.822男听众对比女听众
女声同批语音质量3.0652.964男听众对比女听众

表后解释需要同时给出收益与代价视角。这里的收益是证据清晰:在男声条件下男听众高出约 0.103,在女声条件下高出约 0.101,且两组都给女声更高分,说明听众性别效应与说话人性别效应独立存在。韦尔奇 t 检验在男声、女声和总体条件下均显著,总体 p 值达到 4.58 乘 10 的负 17 次方量级,支持差异是结构性的而非抽样波动。

代价或限制是该表只给均值对比,未报告效应量随听众个体分布的离散程度,且训练集女听众多于男听众,简单的多数决定论无法解释为何平均分仍偏向男听众,这恰好引出下一张质量分段表。未胜出项是女听众在所有条件下均更严格,若只看总体平均会掩盖这一严格标准的存在。

话语级评估 × 系统级评估: 话语级评估对每一条语音分别算预测与真值的相关与误差,分工是检验细粒度打分能力;系统级评估先把同一系统多条语音的分数聚合成系统均值再比较,分工是检验对系统排序的稳定性。搭配理由是语音质量评估既关心单条误差也关心跨系统排名,组合使用才能发现只在总体平均上好看、但在分性别或细粒度上偏斜的问题。

第二张表回答差距形状问题:在总体质量不同的区间内,男减女差值是否恒定。公平条件是按总体 MOS 分箱后在箱内比较,指标方向是差值越大表示低质段分歧越大。

质量区间指标男减女差值说话人分层比较对象
1 到 2 分区间内均值差0.167按说话人性别分别统计男听众对比女听众
2 到 3 分区间内均值差0.124按说话人性别分别统计男听众对比女听众
3 到 4 分区间内均值差0.097按说话人性别分别统计男听众对比女听众
4 到 5 分区间内均值差0.030按说话人性别分别统计男听众对比女听众

表后解释的关键是单调递减:从低质段的 0.167 降到高质段的 0.030,且对每种说话人性别都成立,支持差距由听众性别驱动而非说话人性别假象。论文提出两种可能解释,一是高分端的天花板效应,二是高质量语音感知一致性更高,但原文未做因果验证,只能表述为支持与可能。反例是最高质量段差距接近消失,若把该段结论推广到全程会低估低质段的公平风险。适用条件是该结构在 BVCC 训练集上成立,能否推广到其他数据集待验证。

单标签模型继承了谁的标准:同一预测对两组真值的误差

要回答的比较问题是,只用总体平均分训练且看不到性别的基线,其预测在数值上更接近哪一组。公平条件是同一组预测、同一测试集、同一指标,分别以总体真值、男组真值和女组真值为参照,指标方向是均方误差越小越接近,相关系数越大越接近。下面第三张表整理这种不对称,表中误差为均方误差,相关为线性相关,裸值保留原文精度。

评估粒度指标男真值下结果女真值下结果相对差距
话语级均方误差0.3720.430相对差距 15.6%
系统级均方误差0.1410.194相对差距 37.6%
系统级线性相关0.9010.888男组更高

表后解释必须点明反直觉之处:训练集中女听众人均更多,但预测误差在男组真值下系统性更小,话语级相对差距为 15.6%,系统级扩大到 37.6%,系统级线性相关也是男组更高。这支持平均标签并非性别中立,而是隐含男性感知标准并被模型忠实学下。未胜出项是女组真值下的误差始终更大,说明只报告总体误差会掩盖分性别劣势。限制是该结论来自 SSL-MOS 基线与 BVCC 测试集,不能直接推广到所有 MOS 模型;且相关性差距小于误差差距,说明排序能力的不对称弱于数值校准的不对称,复现时应同时看两类指标。

为何固定偏移不够:质量依赖结构对校准方法的约束

把质量依赖差距与全局固定校准并列,可以看清方法选择的必要性。如果差距是常数,例如所有质量段都高 0.1,那么测试时减去 0.1 即可。但实际差距从 0.167 单调降到 0.030,固定校准在低质段会校准不足,在高质段会过度校准。论文因此没有采用后处理加减法,而是让性别分支在不同质量条件下学习不同的映射。

质量依赖差距 × 全局固定校准: 质量依赖差距指男减女的均值差随总体质量区间单调变化,分工是描述偏差的结构形状;全局固定校准指给所有样本加同一个常数偏移,分工是用最简单方式抹平组间差。搭配理由是若差距是常数则固定校准足够,若差距随质量变化则固定校准必然在低质段欠补、在高质段过补,组合对比说明必须用能随质量条件变化的性别感知建模而非单一偏置项。

从复现角度看,消融或对照至少应包括 3 类:只用平均分支的基线、性别感知模型的平均分支输出、性别感知模型的分性别分支输出。论文的表 4 正是这种结构:以总体为真值时比较平均分支,以男组为真值时比较基线平均、模型平均和模型男分支,以女组为真值时比较基线平均、模型平均和模型女分支。这种设计能分离多任务带来的总体增益与条件分支带来的分性别增益。缺项是原文没有报告去掉某一性别损失项、或把等权重改成非等权重会怎样,因此不能断言权重选择的必要性,也不能补写拿掉后必然怎样。

哪些结论有边界:数据唯一性与未测量的量

第一个边界是数据唯一性。论文明确在 SHEET 支持的数据集中只有 BVCC 同时提供说话人与听众性别元数据,因此所有性别分析都依赖这一个数据集。不同合成系统、不同语言、不同听众池是否呈现相同的单调递减结构,原文没有验证,不能当作已成立。第二个边界是因果解释不足。天花板效应与感知一致性只是论文提出的可能原因,没有设计实验分离量程压缩与真实感知趋同。

第 3 个边界是模型覆盖不足。偏差继承只在 SSL-MOS 基线上系统报告,虽然该架构是后续模型的常见基础,但不能直接断言所有 MOS 模型偏斜幅度相同。

未测量的量需要逐项点名。论文没有测量误判率、推理延迟、训练能耗与输出帧率,因此不能承诺性别感知分支改善了这些量;总体趋势不等于每组每步都成立,例如总体线性相关从 0.853 到 0.862 的提升幅度小于均方误差从 0.290 到 0.239 的下降幅度,说明不同指标的收益不同。百分点与相对百分比也需区分:15.6% 与 37.6% 是相对差距,不是百分点差。最后,性别二分的划分本身是简化,未涉及非二元性别与年龄、语言背景等其他人口属性的交互。

复现先做什么:按原文重放数据切分与评价的动作清单

第一步是重建评价数据。按 4974 条训练、1066 条开发、1066 条测试切分 BVCC,确认每条语音有 8 个听众打分,并保留听众性别与说话人性别字段。先复算训练集交叉表:按听众性别乘说话人性别分组求均值与标准差,核对男声下 2.925 对比 2.822、女声下 3.065 对比 2.964 是否重现,再用韦尔奇 t 检验核对显著性方向。第二步是复算质量分段差距。按总体 MOS 把训练语音分入 4 个区间,在每个区间内算男减女均值差,核对 0.167、0.124、0.097、0.030 的单调递减是否重现,并检查按说话人性别分层后趋势是否保持。

第 3 步是重训基线。用 SSL-MOS 只拟合总体 MOS,优化器用随机梯度下降、学习率 0.001、最多 100000 步,以系统级斯皮尔曼秩相关为早停依据、耐心为 20 次评估,在 3 个给定种子下重复。第四步是复算继承差距。把同一预测分别与总体、男组和女组真值比较,同时报告话语级与系统级的四项指标,重点核对话语级均方误差 0.372 对比 0.430、系统级 0.141 对比 0.194 是否重现。第五步是实现性别感知模型。

复制回归头为平均分支与性别分支,性别分支接受 0 和 1 的抽象条件,联合优化三项等权重均方误差,评价时分别取平均输出与分性别输出。若要补验证,优先补跨数据集检验与去掉单个性别损失项的对照,并记录硬件、批量大小与训练时长以补上原文缺项。

何时值得尝试性别感知建模:收束判断与下一步验证

当评价目标不仅是总体排序,还关心对不同听众群体的代表性时,值得尝试论文的性别感知思路。具体信号有 3 个:分性别均值存在显著且稳定的方向差;差距随质量区间系统变化而非恒定偏移;单标签模型的预测误差在某一组真值下系统性更小。若三者同时出现,简单的全局校准很可能不够,需要条件化建模。

复现与应用时应保留关键信息条件:监督需要分性别均值真值,测试时平均分支可独立使用,性别分支用于诊断与公平干预。论文报告的支持性结果是性别感知模型的平均分支在总体真值下话语级线性相关更高、均方误差更低,且分性别分支在各自真值下进一步降低误差,其中男组线性相关从 0.806 到 0.817、均方误差从 0.372 到 0.332,女组线性相关从 0.802 到 0.807、均方误差从 0.430 到 0.366。但这些是 BVCC 上的报告值,不是跨场景承诺。下一步最需要补的验证是跨数据集重复、显式报告推理开销,以及检验等权重之外的损失配比与个体级建模的叠加效果。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总