英文题目:Evaluating Objective Speech Quality Metrics for Neural Audio Codecs
会议身份:
conference:interspeech:2026:conference-paper-id:lanzendoerfer26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#统计分析 #主观评测 #音频编码 #语音质量评估
评分:6.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Luca A. Lanzendöerfer:机构信息未能从会议 PDF 纯文本可靠映射
- Florian Grötschla:机构信息未能从会议 PDF 纯文本可靠映射
- Roger Wattenhofer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是评估神经音频编解码器重建语音的感知质量,输入为48 kHz立体声参考语音与语音加背景声混合音频,输出为客观指标与人耳判断一致性的排序与选型建议,难点在于生成式压缩失真与立体声通道独立编码引入的空间损伤超出了电话语音与广播音频指标的设计域。方法链分为四步:先将开放音频质量数据集的11个纯语音与11个混合片段重采样至48 kHz并做响度归一化,再经6种低码率通用系统独立编码左右通道重建,然后组织多刺激隐藏参考与锚点听测获得基本音频质量主观均分,最后计算失真、感知、可懂度与免参考平均意见分预测四大类20余种指标与主观均分的Pearson线性相关与Kendall排序相关。机制差异在于同时覆盖侵入式与非侵入式指标,并区分纯语音与混合内容两种失真分布,对照手工心理声学模型与数据驱动神经嵌入两条路线。在纯语音评测条件下,SCOREQ的Pearson为0.937,高于PESQ的Pearson0.886。混合内容下感知语音质量评估仍保持高相关而免参考指标全面退化,凸显背景声与空间损伤的域依赖。结论仅适用于10 kbps以下通用编解码器的48 kHz双通道独立编码场景,外推至专用语音编解码器、单声道电话、音乐与空间渲染未经验证。原文未披露训练、推理与部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么:本文要解决的评测问题
本文输入为神经音频编解码器压缩重建的高保真语音波形,输出为重建质量判断。用白话说:神经音频编解码器,英文 Neural Audio Codec,简称 NAC,指用神经网络把声音压缩到很小再还原的工具,常见工作点在 10 kbps 以下,语音最低可到 1 kbps 附近。主观听测,英文 subjective listening test,指让人直接试听并打分的方法,其中 MUSHRA 为多刺激带隐藏参考和锚点的标准方法,被试以显式参考为 100 分尺度,给每个待评样本打出 0 到 100 分。客观指标,英文 objective metric,指用算法自动打分的方法,分为需要干净参考的侵入式和免参考两类。
论文核心问题为:失真来自近年 NAC 时,常用客观指标是否依然贴合人耳,传统电话编码器失真结论可作参照,结论以本文数据为准。本文聚焦语音与语音加背景音两种内容,教学用例子在下文明确标为例子。证据表明听测依然是金标准,成本高更适合小规模验证,因此需要在 NAC 失真下找到可靠的客观替代。后续各节按学习依赖展开,先讲已有路线,再讲编解码、听测与相关分析的构造,最后给出选型建议与复现要点。
已有路线比较了什么,为什么还要做一次 NAC 专项检验
已有工作按输入、目标、监督与运行阶段可以分为 3 条路线。第一条是传统语音编码评测,以 PESQ 为代表,输入是窄带电话语音与参考,目标是预测端到端语音质量,监督来自早年主观库,运行阶段是离线比较。第二条是通用音频编码评测,以 PEAQ 为代表,输入是宽带音乐与混合音频,目标是预测基本音频质量,监督来自广播级听测,运行阶段同样是离线比较。第 3 条是分离与增强评测,以 2f-Model、DNSMOS、NISQA 为代表,输入是分离或降噪后的语音,目标是估计可懂度或平均意见分,部分为免参考。
Torcoli 等人的工作报告显示多数客观指标有领域依赖,在自己设计的应用域内表现较好。例子:把为电话语音设计的指标直接拿去评音乐分离,就像用尺子量体重,量具与对象错配。本文的差异是把被评对象固定为近年 NAC 重建语音,失真类型是神经量化、生成式重建与逐通道立体声处理带来的新伪影,区别于传统波形编码失真。因此跨领域结论仅作背景,定量结论回到本文 MUSHRA 数据重新核对相关系数。
被评失真有什么特殊:低码率神经重建与立体声处理
本文界定的任务是评估 NAC 在语音上的感知质量。用白话说,就是把 48 kHz 的高保真语音先用神经编码器压到每秒几千比特,再解码回波形,让人判断像原来声音的程度。难点有三点。第一,神经重建区别于加噪或带限,它可能生成新的谐波、抹掉背景纹理或改变音色,传统信噪比类度量主要反映能量接近程度,对这类错误反映有限。
第二,内容从纯净语音扩展到语音加背景音,背景本身是合法信号,免参考模型需要区分有意保留的背景与待扣分的噪声,这对模型设计提出更高要求。第三,被测 NAC 本身面向单声道设计,研究者对左右通道分别独立编码再解码,这会改变通道间的幅度与相位关系,对含真实立体声背景的混合音频可能引入空间伪影,而所有被测客观指标主要覆盖音质与可懂度,空间质量在原文讨论中单独说明。
也就是说,即使逐采样误差很小,人耳仍可能听到声像漂移或背景变窄。本文因此设计纯语音与混合音频两套条件,用同一批模型与同一套指标分别计算相关,检验指标的领域稳定性。
方法全景:一个样本如何走完编码、听测与相关计算
沿一个样本走完全流程有助于建立全局依赖。起点是从 ODAQ 数据集中取一段原始高保真语音,可能是纯语音,也可能是语音加背景音,统一重采样到 48 kHz 并做响度归一化到负 28 dB 以避免削波。接着把该样本送入 6 种待评系统之一,例如 DAC 或 EnCodec,得到压缩码流再解码为待评波形;对立体声样本则左右通道分别独立编解码。然后把同一原始样本的多种重建版本加上隐藏参考与两个锚点放在同一个 MUSHRA 试次中,被试在可重复播放下逐个打分。
最后把每个模型与每个片段组合上的被试平均分作为主观值,把同一组合上的客观指标值作为客观值,计算两者之间的 Pearson 线性相关与 Kendall 排序相关。整个流程调用已有模型做推理,再用统计量检验已有指标,覆盖重建、人耳均值、相关系数 3 个环节。理解这个顺序很关键:先有重建,再有人耳均值,最后才有相关系数,把相关误读为因果会带来错误解读。
被测系统有哪些:四个编解码器加两个声码器如何分工
6 个被测系统覆盖不同的码率与重建思路。EnCodec 使用 24 kHz、6 kbps 模型,是基线编解码器。DAC 支持 44.1 kHz 重建,码率约为 7.74 kbps,是本文码率最高的系统。SNAC 扩展自 DAC,使用 44.1 kHz、2.6 kbps 模型,主打 1 到 3 kbps 超低码率。Mimi 基于 EnCodec,把 24 kHz 语音压缩到 4.4 kbps,同时产生声学与语义 token。
另两个是只做重建的声码器:Vocos 在傅里叶域重建 EnCodec 隐变量,MBD 用分频带扩散解码 EnCodec 隐变量。用白话说,编解码器管压缩加解压,声码器只管把别人给的压缩表示还原为声音。论文明确说明这 6 个系统是代表性选择,覆盖近期大量神经语音专用编码器之外的通用音频路线,选择理由是它们都被广泛用于音频、语音与音乐生成,且都落在 10 kbps 以下,适合同时检验纯语音与混合音频。
神经音频编解码器 × 声码器: 神经音频编解码器负责把波形压缩为离散隐表示再重建波形,分工是端到端地承担压缩与重建;声码器只负责从已有的压缩隐表示合成波形,分工是替换解码器。本研究把 Vocos 与 MBD 作为 EnCodec 隐空间的声码器与 EnCodec、DAC、SNAC、Mimi 并列比较,搭配理由是检验同一隐表示下不同重建方式的感知差异,组合意义是区分失真来自编码器还是来自重建器。
从复述角度记住每个系统的码率与采样率很关键,后文 DAC 表现最好时同时说明它码率最高,有助于区分码率优势与架构优势。Vocos 主要在干净语音上训练,MBD 涉及扩散采样,这些实现细节是解释后文跨条件性能变化的线索,原文给出的是模型调用层面的说明,训练梯度与参数细节属于证据之外的信息。
客观指标有哪些:失真、可懂度、感知与免参考如何分组
被测客观指标按白话可分为 4 组。第一组是波形失真类,包括 SNR、尺度不变的 SI-SNR 及其变体 C-SI-SNR,以及 SDR、SI-SDR、SA-SDR,分工是度量重建波形与参考在能量层面的接近程度。第二组是感知类,包括 PESQ、PEAQ 基本客观差分等级、聚合 ADB 与 AvgModDiff1 的 2f-Model、WARP-Q、ViSQOL 音频版与语音版,分工是用听觉模型或谱相似度模仿人耳。第三组是可懂度类,以 STOI 为代表,分工是估计语音可懂程度。第 4 组是免参考平均意见分估计,包括 DNSMOS、NISQA、NORESQA、NORESQA-MOS 与 SCOREQ 免参考版,分工是在缺少参考时直接预测人会打多少分。
其中 SCOREQ 有参考版基于对比回归学习嵌入,免参考版则基于同样的对比回归思路完成预测。论文说明除 DNSMOS、NISQA、NORESQA、NORESQA-MOS 与 SCOREQ 免参考版之外,其余均为侵入式。POLQA 在原文中列为方法边界,原文给出的理由是缺少访问权限且相对 PESQ 增益有限,复述时以该说明为准。
MUSHRA × 侵入式指标: MUSHRA 的分工是让人以隐藏参考为满分尺度直接打分,提供主观真值;侵入式指标的分工是用算法比较参考信号与重建信号给出客观分,目标是模仿人耳排序。两者搭配的原因是只有以前者为基准才能计算 Pearson ρ 与 Kendall τ,组合意义是用相关系数判断客观指标在神经编解码器失真下是否还值得信任。
记住分组后才能理解后文结论:侵入式总体优于免参考,但在混合音频上部分感知指标也会掉点,说明分组正确仍需要跨域检验。
本研究训练了什么:明确说明无新模型训练与真实计算过程
本研究的核心计算是推理加统计,调用已有权重完成重建与打分,再做相关分析,这个定位有助于避免把相关分析误当成模型训练。推理侧是调用已有实现:把每个 ODAQ 样本送入 6 个系统的公开实现做编码再解码,对立体声逐通道独立处理,输出重建波形;对客观指标侧同样调用已有实现,对每个重建与参考对计算侵入式分数,对重建本身计算免参考分数。统计侧是对每个模型与片段组合取被试平均 MUSHRA 分,再与客观分计算 Pearson ρ 与 Kendall τ。
原文给出的是调用与统计层面的说明,梯度路径、优化器、学习率、参数冻结或重置时机属于该流程之外的信息。复现时按原文文字调用同名模型与同名指标为宜,名称相同不足以推定内部实现一致。把冻结参数等同于输出确定也会带来误读,扩散类声码器本身可能带随机性,原文对随机种子的说明保持空白。
数据、听测与统计如何组织:样本量、筛选与相关公式输入
数据来自 ODAQ,取 11 段干净语音与 11 段语音加背景音,原始采样为 44.1 kHz 或 48 kHz,实验统一重采样到 48 kHz。响度归一化到负 28 dB,被试来自众包 MUSHRA 工具,需在试次间短暂休息以防疲劳。每个试次含 9 个刺激:6 个模型重建、一个隐藏参考、两个锚点,锚点由参考下采样到 3.5 kHz 与 7 kHz 得到。播放顺序随机,播放次数由被试自主决定,打分范围 0 到 100。质量控制按 MUSHRA 协议剔除至少 2 次把参考打到 90 分以下的评分者,剔除率约为 18%,高于协议建议的 15%,剔除后纯语音剩 13 人,混合音频剩 17 人。
统计时对每个模型与片段组合取被试均值作为主观值,与客观值配对计算 Pearson ρ 与 Kendall τ。Pearson 度量线性比例关系,对异常值较为敏感;Kendall 基于一致对与差异对计数,度量排序一致性,对线性形式依赖较小。
Pearson 相关 × Kendall 秩相关: Pearson 相关的分工是度量客观分与主观均值之间线性关系的强度,Kendall 秩相关的分工是度量两者排序一致的程度。搭配理由是 Pearson 对异常值和量纲敏感而 Kendall 只看相对顺序更稳健,组合意义是同时报告两者可以区分是数值成比例还是仅仅排序一致,避免单一系数误导选型。
复述时要注意聚合对象是模型与片段组合层面,而非被试层面,数值相同也需要按指标分别引用。硬件预算、播放设备校准与听音环境属于证据之外的信息,复述保持空白。
人耳先听到什么:MUSHRA 主观排序与码率条件
在看客观指标之前,先确认人耳给出的排序,否则相关系数没有意义。纯语音条件下 DAC 整体最优,有经验的被试有时无法区分 DAC 重建与隐藏参考,说明其感知质量接近透明;混合音频条件下各系统得分普遍低于纯语音,原文解释是混合内容频谱更宽,压缩伪影更容易被察觉,而纯语音带宽相对集中。Vocos 在纯语音上明显优于 EnCodec,但在混合音频上与 EnCodec 相当,原文用训练数据以干净语音为主来解释其对混合内容鲁棒性不足。
MBD 表现明显低于预期,尤其在混合音频上更差,原文指出纯语音样本是双通道相同的幻象居中语音,独立编码不引入空间劣化,而混合音频的背景含真实立体声,逐通道独立编码会破坏通道间关系从而产生空间伪影。下图把上述排序可视化为比特率与 MUSHRA 分的关系,阅读时先确认参考与锚点位置,再看模型点的相对高低。
本段导读对应下图:左面板为纯语音数据集,右面板为混合数据集,横轴均为比特率,纵轴均为 MUSHRA 分,阴影与须线表示 95% 置信区间,底部图例区分参考线、两条锚点线与 6 个模型符号。
看图路径: 1. 先看横轴比特率与纵轴 MUSHRA 分的含义,再区分左侧纯语音面板与右侧混合音频面板;2. 对照底部图例找出 DAC、Mimi、SNAC、Vocos、EnCodec、MBD 六个模型符号的位置;3. 比较顶部绿色参考线与中部两条锚点虚线,确认模型分都落在参考与锚点之间;4. 观察同一比特率附近 Vocos 与 EnCodec 在左右两图的相对高低变化
论文图 1。原论文 Figure 1:“MUSHRA listening test results for speech-only (left) and combined audio (right).”。
从像素可见,顶部深绿色参考线接近 100 分,中部橙色 7 kHz 锚点虚线与底部红色 3.5 kHz 锚点点线明显更低,6 个模型符号分布在两者之间;左侧 DAC 符号最接近顶部参考线,MBD 绿色菱形在 6 kbps 附近明显偏低,右侧所有模型符号整体下移且 DAC 仍最高而 MBD 仍最低,Vocos 红色三角在左侧高于紫色 EnCodec 倒三角而在右侧两者接近。该图支持后文用相关系数检验指标能否复现这一排序,图中纵轴是原始 MUSHRA 分而非改善量,不能把右侧整体下移误读为所有模型在混合音频上都劣于锚点。
锚点与参考的分值是多少:先固定量尺再谈模型高低
为说明量尺锚定是否有效,先整理参考与两个锚点在纯语音与混合内容下的平均分与置信区间,再观察模型分化是否超出锚定范围。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 7 kHz | 3.5 kHz | 98.7 | 0.5;40.3;3.2;18.7;2.5;98.1;1.0 |
表后解释需要同时看到收益与代价。参考在两种内容下都接近满分,说明被试正确使用了量尺上限,这是后续相关的前提。两个锚点在混合音频上都明显低于纯语音,尤其是 7 kHz 锚点从 40.3 降到 26.7,说明带限对宽谱混合内容的感知损伤更大。未胜出项在这里是锚点本身:它们不是待评模型,只是用来锚定量尺下限,不能把模型高于锚点就等同于足够好。DAC 接近参考而 MBD 接近甚至低于锚点的现象,要结合下一节的相关系数才能判断哪些客观指标捕捉到了这种差距。该表不能替代模型间的客观指标表,数据来源与聚合对象不同,不应混用。
哪些客观指标跟上了人耳:PESQ 与 SCOREQ 为何被推荐
为对比纯语音与混合音频下感知指标排序是否稳定,下面整理论文报告的关键相关系数,重点观察互补关系。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 0.886 | — | — | — |
| 来源句二 | 0.937 | — | — | — |
表后解释要给出机制与反例。论文报告 PESQ 在混合音频上 ρ 为 0.903、在纯语音上 ρ 为 0.886,SCOREQ 在纯语音上 ρ 为 0.937、在混合音频上 ρ 为 0.869,两者互补:前者靠手工心理声学模型,后者靠数据驱动嵌入。支持的判断是两者可作为实用首选,纯语音优先 SCOREQ、混合内容优先 PESQ。反例同样重要:ViSQOL 语音版从纯语音的 0.85 掉到混合音频的 0.593,PEAQ 在纯语音上接近零相关,DNSMOS、NISQA、NORESQA-MOS 在混合音频上都很弱,2f-Model 虽基于与 PEAQ 相同的中间量却明显优于 PEAQ。简单失真度量如 SNR 与 SDR 反而与人耳中度相关,甚至超过部分感知指标,这提示不能把名称含感知就等同于更准。
PESQ × SCOREQ: PESQ 的分工是用手工心理声学变换与掩蔽模型预测语音质量,SCOREQ 的分工是用对比回归在学习到的神经嵌入上预测质量。搭配理由是两者代表完全不同的技术路线,前者重听觉先验,后者重数据驱动表示,组合意义是同时从两个视角交叉验证,若两者都与 MUSHRA 高度相关则结论更稳固。
所有 p 值远小于 0.05,支持差异不是随机波动,但相关不是因果,且空间质量未被任何指标显式建模,这是混合音频相关普遍变弱的可能原因之一,仍待验证。
换了内容会掉多少:从纯语音到混合音频的稳定性对照
把内容从纯语音换成混合音频可以看作 1 次天然的消融,检验指标是否依赖内容类型。操作是固定 6 个模型与计算流程,只改变输入是纯语音还是语音加背景音,再重新计算与 MUSHRA 均值的相关。结果显示侵入式总体仍优于免参考,但多数指标在混合音频上相关下降。免参考指标掉得最多:SCOREQ 免参考版在纯语音上尚可,在混合音频上大幅下降;DNSMOS、NISQA、NORESQA、NORESQA-MOS 在混合音频上都表现差,原文解释是它们为语音清晰度设计,会把有意的背景声一律惩罚。
ViSQOL 音频版在两种条件下都弱,WARP-Q 归一化与原始版在纯语音上尚可而在混合音频上减弱,STOI 与 2f-Model 相对稳健但仍不及 PESQ 与 SCOREQ。未胜出项必须保留:PEAQ 在纯语音上 Pearson 接近 0.145,在混合音频上虽升至 0.582 但 Kendall 接近零,说明线性相关与排序一致并不等价,不能单看一个系数就选型。这个对照的限制是样本只有 22 段、听音人数十余人,且立体声采用逐通道独立编码,空间伪影的影响没有被分离出来,因此不能推广到所有音乐或多声道场景。
还不能说什么:样本、空间与成本的边界
论文直接报告的边界需要逐项列清。首先是样本边界:只有 11 段纯语音与 11 段混合音频,模型只有 6 个,听音人数为 13 人与 17 人,p 值虽显著但泛化到其他语种、其他背景类型与更高码率时仍需验证。其次是空间边界:所有客观指标都不度量空间质量,而混合音频的劣化部分来自逐通道独立编码破坏立体声关系,这段因果是论文的有限解释而非严格证明,因为没有做单声道对照或空间指标消融。
再次是指标边界:POLQA 因无访问权限未测,PEAQ 只报告基本客观差分等级,ViSQOL 分音频与语音两个版本不能混用,免参考指标的差值不能放到侵入式列下比较。最后是成本边界:原文未测量误判率、延迟、推理开销与输出帧率,没有报告运行硬件与预算,因此不能承诺用 PESQ 或 SCOREQ 替代听测能省多少时间与算力。
免参考指标 × 混合音频: 免参考指标的分工是在没有干净参考时估计语音清晰度或平均意见分,混合音频则是有意保留语音加背景声的待评内容。搭配会出问题的原因是免参考模型常把背景声本身当作劣化加以惩罚,不管背景是否属于原始信号,组合意义是说明不能把为纯净语音设计的 DNSMOS、NISQA、NORESQA-MOS 直接搬到含背景音的编解码器评测中。
缺失证据不是技术错误,相关性也不是因果,总体趋势不等于每组片段都成立,复述时对未验证的推测必须用可能或待验证来表达。
要复现先做什么:数据、模型调用与评分的最小闭环
复现的最小闭环是先跑通数据与重建,再跑通主观均值与客观分,最后复算相关。第一步取 ODAQ 的 11 段纯语音与 11 段混合音频,重采样到 48 kHz,响度归一化到负 28 dB,对立体声左右通道分别独立编解码,模型使用 EnCodec 24 kHz 6 kbps、DAC 44.1 kHz 约 7.74 kbps、SNAC 44.1 kHz 2.6 kbps、Mimi 24 kHz 4.4 kbps,以及基于 EnCodec 隐空间的 Vocos 与 MBD。第二步组织 MUSHRA 试次,每个试次含 6 个重建加隐藏参考加 3.5 kHz 与 7 kHz 锚点,随机顺序不限重播,按至少 2 次参考低于 90 分则剔除的规则筛选。第三步对每个模型与片段组合取被试均值,再计算各客观指标的 Pearson ρ 与 Kendall τ。
关键超参数与信息条件是打分范围 0 到 100、置信区间取 95%、相关在组合层面聚合。资源状态方面,本次收到的证据中没有完成 HTTPS 验证的可用资源声明,因此不得声称代码、模型或数据已公开,只能写本次未能确认可达,复现前需自行确认对应实现版本与重采样细节。论文称会公开主观评分以支持未来研究,但在本证据下同样按未确认处理。
何时值得尝试:给语音编解码器评测的选型收束
回到开场问题:当失真来自 NAC 时,什么客观指标还值得信任。论文支持的答案分内容给出。对干净语音,SCOREQ 与人耳最一致,PESQ 是稳健替代,SCOREQ 免参考版在必须无参考时可考虑。对语音加背景音的混合内容,PESQ 是最可靠的选择,多数其他指标明显退化,免参考指标尤其不适合,因为它们会把有意的背景当作劣化。简单 SNR 与 SDR 可作辅助参考,但不能替代感知验证。
何时值得尝试:如果你的任务是迭代 NAC 或为生成模型选择 tokenizer,且内容以语音为主,先用 PESQ 加 SCOREQ 做快速筛选,再对胜出系统做小规模 MUSHRA 确认;如果内容含重要背景或立体声,还需补做空间质量的主观检验,因为现有指标覆盖不到。还需补的验证是更大样本、更多码率、单声道对照以分离空间因素,以及报告推理成本与延迟。记住 DAC 的高分伴随最高码率,跨码率比较时应固定码率或明确标注码率差异,否则会把压缩效率与重建质量混为一谈。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
