When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue
📄 当文字说得太漂亮,声音却在摇头:如何让模型听出言外之意 英文题目:When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue 一句话:论文把“只看文字就能答对”的捷径变成可测量的陷阱,用 333 道冲突题与 168 道一致题的 ContraTalk 检验模型是否真的听见了声音,并用把韵律与情感转成可检索文本卡片的 Audio Twin 把冲突准确率从 47.7% 拉到 50.5%、把陷阱选择率压到 29.4%,代价是在小模型上会扰动原本正确的文字判断。 标签:#语音交互 #音频大模型 #基准测试 #数据集 评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yen-Ju Lu:机构信息未在 arXiv HTML 中可靠披露 Yuzhe Wang:机构信息未在 arXiv HTML 中可靠披露 Yaohan Guan:机构信息未在 arXiv HTML 中可靠披露 Xiluo He:机构信息未在 arXiv HTML 中可靠披露 Jiarui Hai:Center for Language and Speech Processing, Johns Hopkins University Mingrui Liang:机构信息未在 arXiv HTML 中可靠披露 Kaavya Chaparala:机构信息未在 arXiv HTML 中可靠披露 Thomas Thebaud:机构信息未在 arXiv HTML 中可靠披露 Laureano Moro-Velazquez:机构信息未在 arXiv HTML 中可靠披露 Najim Dehak:机构信息未在 arXiv HTML 中可靠披露 Jesus Villalba:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语音对话中长期被文本捷径掩盖的跨模态分歧形式化为可测的冲突与一致双分支基准,并用可审计的文本化声学证据卡把玄学融合变成可检索的证据仲裁。短板是 501 题仅源自 117 段 Seamless Interaction 对话且依赖提示词与大语言模型生成问题,Audio Twin 本质仍是手工规则离散化韵律与情感特征的检索增强,对抗性提升有限且一致集上小模型被声学证据带偏。 ...