PrefSQA: Pairwise Preference Prediction for Speech Quality Assessment and the Critical Role of High Quality Datasets
📄 PrefSQA: Pairwise Preference Prediction for Speech Quality Assessment and the Critical Role of High Quality Datasets #语音质量评估 #对比学习 7.3/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.3/10 | 前50% | #语音质量评估 | #对比学习 | arxiv 👥 作者与机构 作者: Junyi Fan, Donald S. Williamson 机构: The Ohio State University, USA 💡 毒舌点评 论文选题切中了MOS标注噪声这一实际痛点,并试图用偏好学习来解决,思路直接且合理。然而,方法的“创新”部分更偏向于对现有技术模块(如Bradley-Terry模型、注意力机制、NMR头)的工程化组合与适配,缺乏更深层的原理性突破。作者投入大量篇幅构建和论证数据集质量的重要性,这一点确实有价值,但也反衬出其模型本身在标准、噪声较大的基准上提升有限。最令人诟病的是,论文中最重要的两个基线SQAPP和UPPSQA的代码均不可用,这使得其声称的“基于框架”和“实现”变得难以验证,严重削弱了可复现性和说服力。此外,关于“非匹配参考”对模型全局排序的提升作用,其消融实验显示的增益非常小,这让人质疑该组件的必要性。 ...