When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

📄 当文字说得太漂亮,声音却在摇头:如何让模型听出言外之意 英文题目:When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue 一句话:论文把“只看文字就能答对”的捷径变成可测量的陷阱,用 333 道冲突题与 168 道一致题的 ContraTalk 检验模型是否真的听见了声音,并用把韵律与情感转成可检索文本卡片的 Audio Twin 把冲突准确率从 47.7% 拉到 50.5%、把陷阱选择率压到 29.4%,代价是在小模型上会扰动原本正确的文字判断。 标签:#语音交互 #音频大模型 #基准测试 #数据集 评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yen-Ju Lu:机构信息未在 arXiv HTML 中可靠披露 Yuzhe Wang:机构信息未在 arXiv HTML 中可靠披露 Yaohan Guan:机构信息未在 arXiv HTML 中可靠披露 Xiluo He:机构信息未在 arXiv HTML 中可靠披露 Jiarui Hai:Center for Language and Speech Processing, Johns Hopkins University Mingrui Liang:机构信息未在 arXiv HTML 中可靠披露 Kaavya Chaparala:机构信息未在 arXiv HTML 中可靠披露 Thomas Thebaud:机构信息未在 arXiv HTML 中可靠披露 Laureano Moro-Velazquez:机构信息未在 arXiv HTML 中可靠披露 Najim Dehak:机构信息未在 arXiv HTML 中可靠披露 Jesus Villalba:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语音对话中长期被文本捷径掩盖的跨模态分歧形式化为可测的冲突与一致双分支基准,并用可审计的文本化声学证据卡把玄学融合变成可检索的证据仲裁。短板是 501 题仅源自 117 段 Seamless Interaction 对话且依赖提示词与大语言模型生成问题,Audio Twin 本质仍是手工规则离散化韵律与情感特征的检索增强,对抗性提升有限且一致集上小模型被声学证据带偏。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 992 words

TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue

📄 把“该不该开口”拆成可追责时间表:TurnBench 逼出的轮次交接难题 英文题目:TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue 一句话:TurnBench 的关键贡献在于把抢话、附和语与中途停顿放进同一套因果时间窗:它证明当前系统必须在更早开口和更少误报之间付出可量化代价。 标签:#语音交互 #数据集 #基准测试 #模型评估 评分:8.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 💬 毒舌点评 TurnBench 最扎实的地方,是没有把“模型开口了”偷换成“模型理解了轮次”:mid-turn pause、backchannel 和抢占打断都被摆进同一条时间轴,Casual 这类 backchannel 密集场景也不再被总体均分遮住。VAP 在这张更严的账本上仍达 EOT 0.845 recall、0.055 FPR,说明它能识别真实的系统差异。 但账本同样照出尴尬:最佳 VAP 的 INT 要 994 ms 才提交,人类平滑交接却在 turn 结束前中位 151 ms 开始说话;快的 Server VAD 大量误报 backchannel,SmartTurn v3 则漏掉绝大多数抢话。英语录音棚双人语料外的噪声、多人和跨语言条件仍未验证,排行榜不能被误读为语音助手已经学会自然接话。 ...

2026-08-27 · 更新于 2026-09-04 · 3 min · 608 words

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

📄 语音助手的记忆为什么要分脑:VoiceMem 用 134 ms 换来 top-5 的长期理解 英文题目:VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction 一句话:VoiceMem 的可证伪主张是:只要把事实路由和情感归因分工为 2 个可交联状态,并把候选缩减提前到用户说话期间,实时语音助手就能以 top-5 记忆预算取得更高的离线检索分数,而代价与真实端到端可靠性仍须另测。 标签:#语音交互 #大语言模型 #流式处理 #长音频处理 评分:6.6/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.8/1.5 💬 毒舌点评 VoiceMem 最有价值之处是把 top-5 这个真实输入预算当成设计约束:schema—entity 路由先缩小候选池,右脑把人格与情绪指向拆开保存,再把 searching 塞进 VAD 的沉默窗口。跨 3 个后端迁移和移除 upper-layer index 后的 4 组掉分,使上层组织不只是双脑比喻。 冷水也该泼在关键处:134 ms 只是 dense dual-brain retrieval,而非完整电话式对话延迟;ChatMem-Bench 的标注流程推迟到后续报告。人格系统最危险的错误归因、记忆删除与隐私控制没有量化,本文证明的是离线候选池更密,不是安全可靠的长期陪伴已经完成。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 759 words

Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate

📄 Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate 标签:#语音交互 #数据集 #模型评估 #工业应用 7.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #语音交互 | #数据集 | #模型评估 #工业应用 | arxiv 👥 作者与机构 第一作者:Ethan Traister(scam.ai) 通讯作者:Simiao Ren(论文以 benren@scam.ai 标注通讯邮箱) 作者列表:Ethan Traister、Ankit Raj、Jiaqi Gan、Xingyu Shen、Tyler Wu、Yuchen Zhou、Tommy Duong、Kidus Zewde、Siying Chen、Simiao Ren(机构:scam.ai) ...

2026-08-26 · 更新于 2026-09-04 · 3 min · 496 words

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

📄 Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight 标签:#模型评估 #基准测试 #语音交互 #大语言模型 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音交互 | #大语言模型 | #模型评估 #基准测试 | arxiv 👥 作者与机构 第一作者:Shashank Singh(Sprinklr AI,Bengaluru,India) 通讯作者:Anupam Purwar 作者列表:Shashank Singh、Anupam Purwar、Kritika Srivastava(机构:Sprinklr AI,Bengaluru / Gurugram,India) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 706 words

A Factorial Ablation of a Speech-to-SFT Pipeline: Differential Effects on Data Quality and Downstream Transfer

📄 A Factorial Ablation of a Speech-to-SFT Pipeline: Differential Effects on Data Quality and Downstream Transfer 标签:#语音交互 #SFT #LoRA #数据清洗 9.7/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 9.7/10 | 前10% | 文档类型:应用研究 | 评分置信度:中 | #语音交互 | #SFT | #LoRA #数据清洗 | arxiv 👥 作者与机构 第一作者:Wonsup Shin(Flitto) 通讯作者:正文未明确标注 作者列表:Wonsup Shin、Jingu Kim(机构:Flitto) 💡 毒舌点评 这项工作最值得读的不是新增的 SFT 数据生产线,而是不讨巧的结论:judge 和专家都认为 QA 更好,固定配方训练后的 MCQA 却没有显著平均收益。2×2 消融、跨家族网格、Whisper 替换和全参 sanity check 让这一结论比单一最佳分数可靠。落地时应把论文当作阶段投资与评测匹配的证据,而不是把“质量精炼”视为默认增益按钮;更换语言、领域、模型家族或开放式端点后都需要重新验证。 ...

2026-08-25 · 更新于 2026-09-04 · 5 min · 858 words

Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text

📄 Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text 标签:#语音交互 #语音大模型 #LoRA #指令微调 10.0/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 10.0/10 | 前10% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #语音大模型 | #LoRA #指令微调 | arxiv 👥 作者与机构 第一作者:Hyeonyu Kim(Maum AI Inc.(全文并列列出 KAIST 与 Atmanity Inc.)) 通讯作者:Hyeonyu Kim 作者列表:Hyeonyu Kim、Hwayeon Kim、Youngwon Choi、Myeongkyun Cho、Huu-Kim Nguyen(机构:Maum AI Inc.;KAIST;Atmanity Inc.) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 467 words

WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

📄 WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs 标签:#语音交互 #语音大模型 #高效推理 #长音频处理 9.4/10 | 创新 1.9/2 | 严谨 1.5/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 9.4/10 | 前10% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #语音大模型 | #高效推理 #长音频处理 | arxiv 👥 作者与机构 第一作者:Yiming Yao(Xiamen University,School of Informatics;闽台非物质文化遗产数字化保护与智能处理重点实验室) 通讯作者:Jinsong Su 作者列表:Yiming Yao、Chenyang Lyu、Xuanfan Ni、Longyue Wang、Weihua Luo、Yazheng Yang、Jinsong Su(机构:Alibaba Group;Xiamen University,School of Informatics;闽台非物质文化遗产数字化保护与智能处理重点实验室) ...

2026-08-25 · 更新于 2026-09-04 · 4 min · 721 words

Does Listening Matter? Backchanneling and Nodding in AI Clone

📄 Does Listening Matter? Backchanneling and Nodding in AI Clone 标签:#语音交互 #多模态模型 #音视频交互 #语音克隆 5.2/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 5.2/10 | 后50% | 文档类型:应用研究 | 评分置信度:中 | #语音交互 | #多模态模型 | #音视频交互 #语音克隆 | arxiv 👥 作者与机构 Koji Inoue、Kazushi Kato、Tatsuya Kawahara 来自京都大学(Kyoto University),Shunichi Kasahara 来自索尼计算机科学实验室(Sony Computer Science Laboratories)。通信地址为京都大学社会智能信息学实验室。该工作被 ICMI 2026 的 Late-Breaking Results(LBR)短文轨道接收,属于初步性成果展示。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 360 words

Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does

📄 Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does 标签:#语音交互 #大语言模型 #音频理解 #基准测试 6.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.4/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音交互 | #大语言模型 | #音频理解 #基准测试 | arxiv 👥 作者与机构 Xinyi Liu(亚马逊实习期间完成工作)与 Dilek Hakkani-Tur 兼属伊利诺伊大学香槟分校,Emine Yilmaz 兼属伦敦大学学院,Hooshang Nayyeri、JK Kim、Yifei Zhang、Charith Peris、Hari Thadakamalla 来自亚马逊。基准场景种子取自 Schema-Guided Dialogue 数据集的服务类目。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 292 words