Mandarin Humorous Homophone Recognition and Disambiguation in Automatic Speech Recognition
📄 谐音不是错字:让普通话 ASR 在纠错与保留笑点之间踩刹车 英文题目:Mandarin Humorous Homophone Recognition and Disambiguation in Automatic Speech Recognition 一句话:这篇论文把高频字改对和别把故意反常的谐音笑点抹平拆为双支路,用 span 定位、条件提示与不同的语义选择规则分担矛盾;低频收益、高频退化和 80 条 TTS HumourPhone 共同说明保守路由仍未被充分验证。 标签:#语音识别 #大语言模型 #Adapter #提示学习 #模型评估 评分:5.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 💬 毒舌点评 该工作真正做对的不是再增加泛化提示词,而是承认纠错和识别笑点的判据相反:常规支路用 5% 相对裕量保留原转写,HumourPhone 支路则允许保留合乎模式的语义不协调。Whisper-v3 的低频靶词 T-CER 从 24.74% 到 20.39%说明,先圈定可疑 span 再局部改写,比让语音 LLM 对整句即兴发挥更有纪律。 但最难的现实部分只有 80 条、0.08 小时的 Edge TTS 语料,也没有拆开 Emotion Detector、span 扩展、LLM 生成和 MacBERT 选择器的贡献。Qwen3-ASR 高频组从 2.19% 升到 3.42%,Prompt 4 又从 13.88% 回升到 14.04%;这提醒我们,知道哪里可能有梗,离知道何时绝不能动原句,仍缺少被实测的置信度策略。 ...