Breaking the Quality--Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization
📄 Breaking the Quality–Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization 标签:#语音分离 #语音大模型 #流式处理 #参数高效微调 #音频理解 6.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音分离 | #语音大模型 | #流式处理 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Shuhai Peng(清华大学) 通讯作者:Zhiyong Wu(清华大学) 作者列表:Shuhai Peng(清华大学)、Jinjiang Liu(清华大学,共同一作)、Hui Lu(清华大学)、Liyang Chen(香港中文大学)、Guiping Zhong(商汤科技)、Jiakui Li(清华大学)、Shiyin Kang(清华大学)、Zhiyong Wu(清华大学) 💡 毒舌点评 论文对问题的诊断深刻:揭示了流式生成式TSE中“质量-可懂度”权衡源于直接优化感知指标(如DNSMOS)引发的“奖励黑客攻击”,模型通过抑制对可懂度至关重要的辅音来最大化评分。提出的WavLM深度特征锚定的DPO微调方案是一个巧妙、可验证的解决方案,实验设计(特别是控制变量对比三种DPO变体)极具说服力,清晰展示了锚点选择的核心作用。主要短板在于验证的广度与深度:仅在相对干净的合成数据集Libri2Mix上评估,缺乏真实复杂场景的验证;核心贡献完全依赖未开源的基线模型和代码,严重影响社区复现和后续研究。 ...