PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement
📄 PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement 标签:#语音增强 #知识蒸馏 #自监督学习 #生成模型 #预训练 8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音增强 | #知识蒸馏 | #自监督学习 #生成模型 | arxiv 👥 作者与机构 第一作者:Xiaobin Rong(未说明) 通讯作者:未说明 作者列表: Xiaobin Rong(未说明) Qinwen Hu(未说明) Mansur Yesilbursa(未说明) Kamil Wojcicki(未说明) Jing Lu(未说明) 机构信息:论文可见部分未直接给出作者所属机构名称;作者名后虽有上标,但机构列表未出现在当前提供的文本中。致谢仅提到国家自然科学基金(No. 12274221)与长三角科技创新共同体联合研究项目(No. 2024CSJGG1103),无法据此确认作者单位。 💡 毒舌点评 PASE把生成式SE中容易被忽视的“幻觉”拆成语言内容错误与声学特征漂移,并用“去噪WavLM+双流声码器”在连续表示空间里给出一个低算力、可复现、WER低至7.49%的完整方案,确实比多数“只拼音质”的生成式SE更接近落地。可惜,“音系先验来自掩码预测”的论证高度依赖MRS/RFS这类代理探针,且没有人类听感评测和SNR难度分层,导致“高质量、低幻觉”的结论仍隔着一层证据窗户纸。 ...