COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation
📄 COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation 标签:#语音识别 #对比学习 #参数高效微调 #语音大模型 7.5/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #对比学习 | #参数高效微调 #语音大模型 | arxiv 👥 作者与机构 第一作者:Jhih-Rong Guo(国立台湾师范大学) 通讯作者:未说明 作者列表:Jhih-Rong Guo(国立台湾师范大学)、Bi-Cheng Yan(国立台湾师范大学)、Tien-Hong Lo(国立台湾师范大学)、Berlin Chen(国立台湾师范大学) 💡 毒舌点评 论文针对语音增强语言模型(SLM)在多实体上下文偏置场景下的梯度冲突问题,提出了MPD-Loss和DPD-Loss两种损失函数,将偏置评分重构为点对点二分类问题,在大规模偏置列表下实现了高召回率和低B-WER。然而,“零偏置"场景下的基础ASR性能(B-WER 23.39/39.49)远逊于所有对比基线(如RNN-T+IB的12.96/28.09),论文仅承认差距而未深入分析原因;所有实验仅在相对规整的LibriSpeech上进行,缺乏噪声、口音等真实场景验证;未经BTI过滤直接输入偏置列表(N=500/1000)时B-WER(20.38/35.01)劣于无偏置条件,暗示方法高度依赖阈值筛选机制,评分器本身的区分能力不足以直接支撑上下文偏置。 ...