Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions
📄 Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions 标签:#语音质量评估 #预训练 #模型评估 #基准测试 #语音编码 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.0/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音质量评估 | #预训练 | #模型评估 #基准测试 | arxiv 👥 作者与机构 第一作者:未披露(文献信息中标注 * 与 †† 为 equal contribution,但原文未在正文给出作者机构信息) 通讯作者:未说明 作者列表:Wolfgang Mack、Nezih Topaloglu、Laura Lechler、Ivana Balić、Alexandra Craciun、Mansur Yesilbursa、Kamil Wojcicki(机构信息均未披露) 备注:论文首页脚注标注 “††* Equal contribution” 💡 毒舌点评 这篇文章用 45 个客观指标去碰 17 个神经编解码器条件,最后得出结论:神经网络指标比传统指标强,scoreq_ref 最牛,非侵入式指标在高分段会饱和。整个工作像一次大型指标“选美比赛”,态度认真、数据量大,但选美标准(主观 MUSHRA-1S)本身就是众包分数的平均值,评委只有约 7 人/文件,噪声不小。更关键的是,作者把“非侵入式指标高分段饱和”归因于 MOS 训练目标,却拿不出训练标签分布的直接证据,只能停在“我们推测”的层面。至于那个“高分数区间可能没有真实质量差异,侵入式指标测的只是与参考信号的无关差异”的自我怀疑,论文也只是轻轻带过——这个 alternative hypothesis 要是真成立,整篇的“指标好用”叙事就得打对折。另外,论文没给代码、没给数据、没给指标版本配置,号称 reproducible evaluation protocol 却连最小复现包都没有,审稿人要是较真,一句“请提供评估脚本”就能让作者难受半天。 ...