英文题目:The VoiceMOS Challenge 2026: Evaluating Speech Enhancement, Emotional TTS and Accented TTS Systems

标签:#语音质量评估 | #基准设计 | #语音 | #基准测试

评分:7.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Wen-Chin Huang:机构信息未在 arXiv HTML 中可靠披露
  • Wei Wang:机构信息未在 arXiv HTML 中可靠披露
  • Marvin Sach:机构信息未在 arXiv HTML 中可靠披露
  • Xiaoxue Gao:机构信息未在 arXiv HTML 中可靠披露
  • Nicholas Sanders:机构信息未在 arXiv HTML 中可靠披露
  • Erica Cooper:机构信息未在 arXiv HTML 中可靠披露
  • Toda Tomoki:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文针对人工听音主观评价成本高且难以规模化预测语音质量的问题,输入为增强语音、情感TTS与口音编解码合成样本,输出为ACR绝对分、CCR比较分及自然度与情感相似度等多维MOS,难点在于跨系统跨说话人泛化、情感感知的强主观性与口音细粒度判别。方法链分三步:首先按三赛道构建说话人与系统不相交的训练开发测试划分并统一听音评分协议,前一步的划分与标签直接作为后续建模与评测的输入。其次为各赛道提供零样本或微调基线以锚定难度,基线预测分数进入下一步作为被超越的参照。最后汇总排行榜、优胜系统问卷与听众建模集成等共性技术,形成对未来方向的归纳。与上届扩展到音乐与通用音频相比,关键机制差异是回归聚焦语音并同时覆盖绝对评价与成对比较范式,实际意义在于更直接对标增强与合成系统的工程选型。在情感TTS任务评测下,QMOS条件的UTT-SRCC指标为0.785,高于EMOS条件的UTT-SRCC指标0.758。结论的适用边界在于增强比较预测明显更难且口音相似度难于说话人相似度,复杂集成与听众建模的鲁棒性与可解释性尚未验证,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

这篇解读要解决什么学习问题?

这篇解读的输入是 VoiceMOS Challenge 2026 的挑战总结论文,目标是让刚进入语音合成与语音质量评估的研究生能够复述出 3 个赛道在测什么、数据如何划分、基线如何搭建、用什么指标判定胜负以及优胜系统做了哪些关键动作。必须保留的信息包括赛道定义、样本量与评分人数、基线名称与是否微调、主指标名称与方向、最高分数字与难度对比结论。

输出是 1 篇按学习依赖展开的技术解读,先建立听音测试为什么贵且必须被自动预测替代,再讲清绝对分、比较分、情绪分、说话人与口音相似度各自的评估动作,最后落到可复现的实验条件与复现入口。阅读时请把自动打分器理解成替人耳投票的代理模型,它的输入是波形或波形对,输出是与人均分的排序一致性,而不是还原某 1 次打分的绝对数值。

VoiceMOS 系列走到 2026 年改变了什么?

VoiceMOS Challenge 从 2022 年创办,初衷是用标准化数据集比较预测人耳平均意见分的技术,以替代成本高、耗时长的人工听音测试。前 4 届的路线是从域内到零样本、从英语到多语、从单维度到多维度、从文本转语音到含噪与增强语音乃至歌声。

2025 年曾大幅扩展为 AudioMOS Challenge,把音乐与通用合成音频纳入评估。论文报告 2026 年又收回到语音,理由是社区反馈认为语音评估的核心问题仍未解决。这一年组织了 3 个赛道,分别对应增强语音、情感文本转语音、带口音的编解码语音合成。

挑战吸引了全球 18 支队伍,多数队伍超过了组织方提供的基线。理解这条收缩路线很重要:不是模型做不到音乐评估,而是语音内部的比较评分、情绪匹配与口音相似度等细粒度任务的自动预测误差仍然大,值得先集中解决。

3 个赛道到底让模型预测什么?

赛道 1 针对语音增强系统的输出,要求同时预测绝对类别评分与比较类别评分。绝对类别评分是听众对单条增强语音总体质量在 5 分制上的打分,平均后得到平均意见分。比较类别评分是听众对同一源语句的 2 个增强版本做成对比较,在负 3 分到正 3 分的量表上给出偏好,平均后得到比较平均意见分,正值表示偏好成对输入中的第 1 条。

赛道 2 针对情感文本转语音,要求预测合成质量平均意见分与情绪平均意见分,前者看发音、语调与信号质量,后者看语音与真实情绪标签的匹配程度。可选任务还包括效价、唤醒度、优势度以及听众感知到的情绪类别。

赛道 3 针对编解码语音合成的带口音英语,给定输入样本与参考样本,要求输出说话人相似度与口音相似度,或 2 者都输出。3 个赛道覆盖了从信号质量到情绪语义再到身份与口音属性的评估轴,输入都包含待评语音,赛道 1 比较任务与赛道 3 相似度任务还额外包含第 2 条语音作为比较或参考。

绝对类别评分 × 比较类别评分: 绝对类别评分负责给单条增强语音打总体质量分,比较类别评分负责给同一源语句的 2 个增强版本打偏好差值,前者提供可排序的单点质量,后者直接建模人耳在成对试听中的偏好方向与强度,二者搭配才能同时回答系统有多好和系统 A 是否比系统 B 好,组合后比较预测可以由绝对分相减近似,也可以由偏好模块直接从语音对学习。

合成质量平均意见分 × 情绪平均意见分: 合成质量平均意见分分管发音、语调与信号质量决定的自然度,情绪平均意见分分管合成语音与目标情绪标签的匹配程度,前者是声学可懂度与自然度的底座,后者是情绪表达是否到位的上层判断,二者搭配的理由是同一条语音可能读得很清楚却情绪不对,组合后才能区分系统是输在合成器还是输在情绪控制。

说话人相似度 × 口音相似度: 说话人相似度分管输入样本与参考样本是否听起来像同一个人,口音相似度分管是否听起来是同一种口音,前者主要依赖音色与个人发声习惯,后者依赖元音、韵律与发音规则等群体性特征,二者搭配才能判断编解码合成是保住了个人身份还是保住了地域发音,组合意义在于同一系统可能换音色很准但口音漂移。

自动评分系统沿 1 条样本走完哪些步骤?

以 1 条待评语音为例,典型流程是波形输入、预训练语音编码器提取表示、评分头输出分数、与多人平均分比较。以赛道 1 为例,绝对分支输入 1 条增强语音,输出 1 个质量分。比较分支输入 1 个语音对,输出 1 个偏好差值。

组织方基线 UrgentMOS 统一支持 2 种模式,绝对模式从单样本预测平均意见分,比较模式用偏好模块直接从语音对预测比较平均意见分。以赛道 2 为例,质量分支用 UTMOS 类预测器,情绪与效价唤醒度优势度分支在基线中用大语言模型作为裁判,情绪类别分支用情绪识别模型的类别概率。

以赛道 3 为例,最简单的零样本基线是用说话人嵌入模型分别提取 2 条语音的嵌入,再用余弦相似度同时作为说话人与口音相似度的预测。参赛的优胜系统则在该骨架上增加了多编码器融合、听众嵌入、帧级打分再汇聚、交叉验证集成等步骤,但输入输出接口保持不变,仍然是波形到分数的映射。

优胜系统在表示与汇聚上做了什么?

赛道 1 的 T01 系统融合了冻结的 wav2vec 2.0 large robust 特征与 MERT 特征,先预测帧级质量分,再由虚拟听众汇聚为语句级候选,同时学习语句分数的均值与听众间标准差,并用听众路由器产生最终绝对分。训练还使用了部分混合增强、监督对比学习与语句排序损失,其比较分直接取预测绝对分的截断差值。

T09 系统则是加权集成 29 个分数,其中 27 个来自多个预训练语音质量模型,2 个来自微调 Whisper medium 与 HuBERT large 编码器得到的双分支模型,再在开发集上分别为绝对与比较任务拟合集成权重。比较时对 29 个分数差做排序归一化后加权。

赛道 2 的 T02 系统质量模型组合了听众嵌入、冻结 UTMOS 特征与微调后预测质量与情绪标签的 WavLM Large 编码器,情绪模型组合听众嵌入与只用情绪标签微调的 WavLM Base Plus 与 Large 编码器,推理时在 64 个听众身份与多折模型上平均。赛道 3 的 T04 系统为说话人与口音分别建模,各自集成 8 个成员,成员在冻结预训练语音嵌入、参考表示、损失函数与选点标准上变化,说话人模型还用 VoxSim 预热,推理时在 25 个听众嵌入上平均并做校准,说话人预测还做了系统级去收缩校正。

听众建模 × 集成: 听众建模分管显式刻画不同打分人的偏严偏松与方差,集成则分管把多个编码器、多个随机种子或多折模型的预测平均以降低偶然误差,前者处理人评的主观分歧来源,后者处理单模型的估计噪声,二者搭配的理由是先用听众嵌入得到多个虚拟听众的打分再平均,比直接回归平均分更贴近先分歧后平均的真实听音过程。

哪些参数被训练,哪些被冻结?

论文没有给出统一的训练超参数表,需要按赛道分别交代。赛道 1 基线的所有预测都没有在挑战数据上微调,直接使用公开的 urgent-mos-f1c1m5dcorpus 检查点,该检查点以 WavLM 为特征编码器并在多个语音质量语料上训练。

赛道 2 基线同样以零样本方式得到预测,没有任何微调,其中质量用 UTMOS,情绪与效价唤醒度优势度用与人类听音相同指令提示的大语言模型,情绪类别用 Emotion2vec+ large 的类别概率。赛道 3 有 2 个基线,第 1 个是零样本余弦相似度,不训练。第 2 个在训练集上微调预训练 ECAPA-TDNN,说话人与口音分别训练 2 个模型,批量大小为 16,优化器为 AdamW,学习率为 0.001,固定训练步数为 20000。

参赛系统的训练数据在论文中有点名,例如 T01 用了 BVCC、NISQA、SingMOS-Pro、TMHINT-QI、URGENT2024-SQA 与 URGENT2025-SQA 等外部语料,T04 说话人模型额外用 VoxSim 预热。论文未报告各优胜系统的完整学习率、轮数与梯度是否截断等细节,这部分属于具体缺项,复现时只能以开源基线仓库与各队问卷描述为准,不能从模型名字推定实现。

数据划分、评分人数与指标方向如何规定?

赛道 1 数据来自 URGENT 2026 语音增强挑战,包含 840 条源语句的 6 个系统输出,覆盖 9 种语言,源语音包括真实录制与仿真加噪条件。每条语句有 6 条增强样本用于绝对评分,以及 15 个系统两两组合用于比较评分。每个样本或样本对通常有 8 个评分。

开发集与测试集在说话人与源语句上都不重叠。开发集包含 168 条源语句、1008 个绝对样本与 2520 个比较对,测试集包含 672 条源语句、4032 个绝对样本与 10080 个比较对。赛道 2 数据包含 5 种情绪类别与 13 种合成系统,句子与自然参考来自 ESD 与 DailyTalk,每条样本有 4 个评分到 9 个评分,除类别选择题外均为 5 分制,类别题允许多选。

赛道 3 基于 CodecMOS-Accent 数据集,共 4000 条样本,来自 24 个编解码重合成与语音合成系统,覆盖 32 个说话人与 10 种口音,开发与测试集包含训练未见过的系统。主指标均为语句级斯皮尔曼等级相关系数,数值越高表示排序越一致。赛道 2 类别任务用类别误差,数值越低越好。挑战时间为 2026 年 5 月 20 日到 2026 年 8 月 10 日,评估语音在 2026 年 7 月 31 日发布,2026 年 8 月 10 日截止提交,2026 年 8 月 31 日公布结果。

语句级斯皮尔曼等级相关系数 × 类别误差: 语句级斯皮尔曼等级相关系数分管预测分与人均分在排序上是否一致,类别误差分管预测的情绪类别分布与选择该类别的听众比例之间差了多少,前者只看相对顺序不看绝对分值,后者看概率分布的绝对偏差,二者搭配是因为情绪任务既要排对哪条更像目标情绪,也要如实估计听众分歧,组合后可以同时检查排序能力与校准程度。

赛道规模与提交数如何对照阅读?

下面这张表把 3 个赛道的样本量、系统数与每样本评分人数放在一起,阅读时先问每个赛道的训练、开发与测试是否可比,再看评分人数是否足以支撑人均分作为金标准。赛道 1 没有训练集划分,开发与测试量差异大,赛道 2 训练量最大,赛道 3 训练、开发与测试量相对均衡。

条件指标赛道 1赛道 2赛道 3
开发集绝对样本与比较对样本量1008 个绝对样本与 2520 个比较对2730 个样本600 个样本
测试集绝对样本与比较对样本量4032 个绝对样本与 10080 个比较对2730 个样本600 个样本

表中赛道 1 开发集 1008 个绝对样本与 2520 个比较对、测试集 4032 个绝对样本与 10080 个比较对的量级差,意味着比较任务的测试对数远多于绝对任务,评估更稳定但也更考验成对建模。赛道 2 的 12746 条训练样本支持了微调 WavLM 等大编码器的做法。赛道 3 训练 2800 条、开发 600 条、测试 600 条且开发测试含未见系统,直接检验跨系统泛化。每样本评分人数的差异提醒读者,人均分的噪声水平在赛道间并不相同,不能把跨赛道的指标数值直接比较大小。

主结果显示哪类预测更难?

下面这张表集中比较论文直接报告的最高语句级相关系数与难度判断,阅读时注意指标方向都是越高越好,但任务难度结论只能在各自赛道内成立。赛道 1 最高绝对分与最高比较分差距明显,论文明确判断比较比绝对更难。赛道 2 最高质量分与最高情绪分接近,论文判断情绪不一定比质量更难。

条件指标绝对与质量分支最高分比较与情绪分支最高分论文难度判断
赛道 1 增强语音语句级相关系数0.7790.487比较比绝对更难
赛道 2 情感合成语句级相关系数0.7850.758情绪不一定比质量更难
赛道 3 口音合成语句级相关系数说话人高于口音口音略低口音略难于说话人

该表支持的判断是比较评分是 2026 年最突出的难点,其最高分不到 0.5,而绝对、质量与情绪任务的最高分都在 0.75 以上。限制是这些数字来自不同测试集与不同听众群体,不能跨赛道断言比较任务在绝对意义上比情绪任务难,只能说在各自数据与基线条件下相对基线的提升空间与绝对数值表现不同。另一个限制是论文只报告了语句级排序相关,没有报告系统级相关与均方误差等互补视角,复现时应同时检查绝对误差以免只优化排序。

比较偏好强度如何改变符号准确率?

赛道 1 的附加分析考察了比较预测的符号准确率随真实比较值绝对值的变化,符号准确率指预测比较分与真实比较分符号是否一致,结果按 0.1 宽的绝对值区间计算并做平滑可视化。该图对初学者的教学价值在于把回归误差转化为方向是否判对的问题,偏好强度越大,方向越容易判对,初学者可先看横轴偏好强度再看纵轴准确率。

看图路径: 1. 先确认横轴为偏好强度指标|CCR|值,纵轴为方向判对比例指标符号准确率;2. 再观察 5 条曲线随偏好强度增大而上升的整体形态;3. 比较基线与 4 支参赛队伍曲线在中间偏好强度区间的上下关系

原论文 Figure 2:Sign accuracy of Track 1 CCR predictions as a function of |CCR|, where sign accuracy measures…

论文图 2。原论文 Figure 2::“Sign accuracy of Track 1 CCR predictions as a function of |CCR|, where sign accuracy measures whether the predicted CCR has the same sign as the ground-truth CCR.”。

从像素可见横轴为偏好强度指标|CCR|值,范围为|CCR|值 0 到|CCR|值 2.5,纵轴为符号准确率(%),范围为符号准确率 0 到符号准确率 1.0,5 条曲线分别对应基线 B01 与参赛队伍 T01、T09、T11、T12。曲线都从左侧低偏好强度区开始随横轴单调爬升,在|CCR|值约 0.2 到|CCR|值约 0.5 区间内从符号准确率(%)约 0.5 上升到符号准确率约 0.65,在|CCR|值 1.0 附近达到符号准确率约 0.8 到符号准确率约 0.85,在|CCR|值 2.0 以上趋近于符号准确率 1.0。队伍间差异在中间区间更明显,T09 曲线在中间区间略高于基线曲线,但在两端大偏好与小偏好处差距收窄。

这支持论文的解释,即当 2 条样本的感知差异较大时,系统更可能预测对偏好方向。反例是当绝对值接近 0 时所有系统准确率都低,说明细微差异仍是盲区,不能把高偏好区间的成功推广到全区间。

情绪子任务中哪个维度最容易?

赛道 2 的可选任务包括效价、唤醒度、优势度与情绪类别,论文用柱状图同时展示 3 者的语句级排序相关与类别误差,其中排序相关越高越好,类别误差越低越好。该图帮助初学者理解多维情绪评估不是单一分数,而是 3 个连续维度加 1 个分布匹配误差,阅读时先对照左右纵轴方向再比较组内高低。

看图路径: 1. 先对照左右纵轴左侧排序相关越高越好与右侧类别误差越低越好的方向;2. 再比较每个队伍内唤醒度柱与效价柱和优势度柱的高低关系;3. 观察基线类别误差柱与 6 支参赛队伍类别误差柱的高低差异

原论文 Figure 3:Track 2 optional emotion-related prediction task results.

论文图 3。原论文 Figure 3::“Track 2 optional emotion-related prediction task results.”。

从像素可见横轴为 7 个系统,分别为 B02、T02、T03、T05、T08、T13、T14,每个系统有 4 根柱,蓝色为效价、绿色为唤醒度、紫色为优势度对应左侧纵轴,橙色条纹为类别误差对应右侧纵轴。基线 B02 的绿色唤醒度约 0.45、蓝色效价约 0.37、紫色优势度约 0.30,橙色类别误差约 0.22,明显差于所有参赛队。

参赛队中绿色唤醒度柱普遍最高,多在排序相关 0.73 到排序相关 0.78 之间,蓝色效价多在排序相关 0.69 到排序相关 0.72 之间,紫色优势度多在排序相关 0.67 到排序相关 0.71 之间,橙色类别误差多在类别误差 0.15 到类别误差 0.17 之间,其中 T02 在质量、情绪、效价、唤醒度与类别误差上均居首。

论文还报告中性类别在质量与情绪预测上对多数队伍略难,悲伤类别的质量预测略易,快乐与悲伤最易预测效价,愤怒与悲伤最易预测唤醒度与优势度,中性易被过预测而惊讶易被欠预测,这些细粒度结论提醒复现时要按情绪分层评估,不能只看总体平均。

基线配置与优胜策略的对照说明了什么?

下面这张表把 3 条基线的预测器与训练方式并置,目的是在相同测试条件下理解参赛队超越基线的代价。赛道 1 基线为 UrgentMOS,赛道 2 基线按问题类型拆分,赛道 3 基线分为零样本余弦与微调 ECAPA-TDNN 共 2 档,比较时需注意微调与零样本的条件并不相同。

条件指标赛道 1 个基线赛道 2 个基线赛道 3 个基线
预测器名称模型UrgentMOS 记为 B01UTMOS 与大语言模型裁判ECAPA-TDNN 余弦与微调版
优化器与学习率配置WavLM 编码器零样本提示AdamW 与学习率 0.001

表后解释需要同时讲收益与代价。收益是多数队伍超过基线,说明微调、听众建模与集成带来了排序一致性的提升。代价是优胜系统明显更复杂,例如赛道 1 的 T09 集成 29 个分数并在开发集上拟合权重,赛道 2 的 T02 在 64 个听众身份与多折模型上平均,赛道 3 的 T04 集成 8 个成员并做校准与去收缩。论文未提供去掉某一组件后的消融数字,也未报告训练与推理成本,因此不能断言某个组件必然带来多少提升,只能说问卷显示的共性是预训练特征加听众建模加集成。

未胜出项方面,赛道 2 有 2 支队伍未参加可选子任务,赛道 3 有队伍只提交口音结果,赛道 1 有提交缺失 157 条样本而只用 2574 条可用样本计算指标,这些边界情况说明排行榜数字的计算口径并不完全一致,比较时需留意缺失样本的处理。

哪些结论还不能下,缺了哪些验证?

论文直接报告的是排序相关与类别误差上的领先关系,有限解释是比较评分更难、唤醒度最易、口音比说话人略难,这些判断得到组内数字的支持。未验证的推测包括复杂集成是否在跨域与跨语上依然稳健,以及大语言模型作为情绪裁判的提示是否对所有情绪类别公平,论文没有提供跨数据集测试与显著性检验。

缺失证据不是技术错误,但复现时要补足 3 项验证,第 1 是同时报告系统级相关与绝对误差,避免只优化语句级排序。第 2 是按语言、系统、情绪类别分层报告,防止总体趋势掩盖中性与惊讶类别的偏差。第 3 是记录训练资源、推理开销与输出延迟,因为论文未测量误判率、延迟或成本,不能承诺这些量得到改善。

此外,开发集标签的使用许可曾缺乏提前通知、数据集规模不均衡、失败提交的诊断信息不足,这些组织层面的限制也影响结果的可比性,需要在后续版本中明确规则。

要复现这项挑战先做什么?

复现的第 1 步是区分代码开源、权重下载与系统可运行 3 件事。基线代码仓库当前可用,地址为 github 上的 vmc2026-baselines,可用于查看 3 个赛道的基线搭建。赛道 1 检查点 urgent-mos-f1c1m5dcorpus 当前可用,赛道 3 说话人嵌入检查点 spkrec-ecapa-voxceleb 当前可用,赛道 2 用到的 Gemini 模型文档当前可用,这些属于权重与文档可下载,不等于一键可运行。

挑战官方网站当前可用,可核对赛道说明与时间线。挑战所用的 CodaBench 竞赛链接当前不可用,状态为 404,因此不能依赖该链接提交或下载评估包,本次解读将其记为链接当前不可用。复现动作建议按赛道分别进行,赛道 1 先跑通 UrgentMOS 的单样本绝对预测与双样本比较预测,注意比较分支是偏好模块直接预测差值而非事后相减。

赛道 2 先跑通 UTMOS 质量分支与情绪识别类别概率分支,再按人类听音相同指令调用大语言模型做情绪与效价唤醒度优势度判断。赛道 3 先跑通余弦相似度零样本基线,再用批量大小 16、AdamW、学习率 0.001、固定步数 20000 的配置微调 ECAPA-TDNN。关键超参数与信息条件是开发测试在说话人、源语句或系统上不重叠,评分人数与量表如前所述,复现时必须保持相同划分与指标聚合才能与论文数字对照。

何时值得尝试这类方法,还需补哪项验证?

当任务是为语音增强、情感合成或编解码合成做快速迭代筛选时,值得尝试这类自动评分器,因为它能替代部分听音测试的排序工作,尤其在绝对质量与情绪匹配上已有 0.75 以上的排序相关作为证据。当任务涉及细微偏好比较或口音相似度时要更谨慎,因为比较最高分仅 0.487 且小偏好区间的符号准确率低,口音也略难于说话人,此时应把自动分只用作初筛,关键决策仍需人工复听。

复现时先从对应基线起步,再逐步加入冻结编码器微调、听众嵌入与小规模集成,每加 1 步都在开发集上检查分层表现,避免一次性堆叠 29 个模型导致无法归因。还需补的验证包括可解释性与不确定性估计、长语音与全双工对话评估、跨语言跨域评估以及偏好测试结果的自动预测,这些正是参赛者问卷中建议的未来方向。

常见误解是把参数冻结等同于输出确定,或把无微调等同于确定性求解,实际上即使编码器冻结,采样、集成平均与大语言模型调用仍可能引入随机性,需要固定种子并多次运行才能报告稳定结论。

📎 论文与评分元数据

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-15 语音/音乐/音频论文速递