Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions
📄 暖启动之后,基座模型还记得什么:用隐状态几何找回被遗忘的人名 英文题目:Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions 一句话:针对暖启动语音大模型对命名实体等多词元词的系统性误识,论文用语音模型与自身基座模型的层间角度与幅度几何做门控,只在约 10% 高语义依赖位置做束搜索与概率插值,以约 1.4 倍贪心代价恢复束搜索 96.4% 命名实体增益并在两遍纠错中把平均命名实体错误率从 18.29% 降到 17.69% 且总体词错误率不恶化。 标签:#语音识别 | #多模态模型 | #参数高效微调 | #鲁棒性 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Chan-Jan Hsu:机构信息未在 arXiv HTML 中可靠披露 Jaeyeon Kim:机构信息未在 arXiv HTML 中可靠披露 Chao-Han Huck Yang:NVIDIA Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露 Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露 Carlos Busso:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把适配后残留的基座大语言模型变成免费校正器,用跨模型隐状态几何做门控,避免全局融合的幻觉灾难,想法干净。短板是所谓自校正高度依赖在 YODAS 上拟合的高斯门限与延续词元规则,换模型换领域就要重标定,完整端到端只验了一个 Phi-4-Multimodal,离通用解码器还差一口气。 ...