DuplexWorld: Can voice agents help you get through the day?

📄 DuplexWorld: Can voice agents help you get through the day? 标签:#语音交互 #端到端 #基准测试 #模型评估 #大语言模型 8.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.5/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音交互 | #端到端 | #基准测试 #模型评估 | arxiv 👥 作者与机构 第一作者:Aryan Vijay Bhosale(Centific Global Solutions Inc.;University of Maryland,标注为在 Centific 实习期间完成工作) 通讯作者:未说明(论文未明确标注通讯作者;Abhishek Mukherji 与 Dinesh Manocha 被标注为 † 共同指导) 合作者标注:Aryan Vijay Bhosale、Harshit Rajgarhia、Akhil Pothanapalli 为 ∗ 平等贡献 作者列表: Aryan Vijay Bhosale(Centific Global Solutions Inc.;University of Maryland) Harshit Rajgarhia(Centific Global Solutions Inc.) Akhil Pothanapalli(Centific Global Solutions Inc.) Asif Shaik(Centific Global Solutions Inc.) Abhishek Mukherji(Centific Global Solutions Inc.) Dinesh Manocha(University of Maryland) 💡 毒舌点评 把导航世界装进语音智能体评测、并在同一 harness 下用 12 个指标横扫六个世界,这套基准的设计纪律和工程完成度在同类工作中罕见地高,“探索越多到达越少"的反转结论尤其有洞察力。但全部被测系统都是闭源商业 API、judge 指标未经本语料上的人类评分校验、模拟用户比真人耐心得多,三者叠加让任何"真实部署能力"的外推都底气不足;更讽刺的是,作者自己承认 GS 可以被"不作为"通过,且 Pathfinding 中从不行动的 Nova 2 Sonic 在选择性上几乎满分,说明指标体系的对抗性设计还差最后一公里。 ...

2026-08-12 · 更新于 2026-08-14 · 5 min · 947 words

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

📄 Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models 标签:#语音交互 #对抗训练 #音频大模型 #鲁棒性 5.4/10 | 创新 1.4/2 | 严谨 0.7/1.5 | 实验 1/1.5 | 清晰 0.6/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.7/1.5 📝 5.4/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv 👥 作者与机构 作者列表:Shuozhe Cheng、Kunlan Xiang、Mingxuan Li、Ji Zhang、Dongxiao Liu、Wenbo Jiang。 论文正文未列出任何作者的单位、实验室名称或完整机构信息。 邮箱信息:论文仅提供 sc8483629@gmail.com 与 wenbo_jiang@uestc.edu.cn 两个邮箱。排版中 Corresponding author 字样紧跟在 sc8483629@gmail.com 之后,但未明确标注该邮箱对应哪位作者;按常见模板惯例可推断 Shuozhe Cheng 可能是通讯作者,但此推断无法被论文正文确证。 wenbo_jiang@uestc.edu.cn 的域名为 uestc.edu.cn,可可靠推断 Wenbo Jiang 来自电子科技大学;其他作者所属机构均为“未说明”。 原文未提供作者顺序对应的机构编号列表,也未提供 ORCID 或贡献声明。 💡 毒舌点评 第一次系统地把文本 LLM 的 DoS 攻击研究拓展到端到端语音大模型,问题切入点有实际意义;四分量联合损失配合 VAD 的 pipeline 设计也具备一定工程完成度。但论文在证据链上存在多处明显瑕疵:消融表 2 的行与组件对应关系无法唯一解码,正文表述与表格数值存在直接冲突(如 FunAudioChat clean input 显存在正文写 17.26 GB、表 1 却写 20.26 GB);使用“ChatGPT 5.5”作为响应质量评测器但未提供任何可独立验证的版本信息;文本基线 Crabs/ExtendAttack 如何适配到语音输入完全没有说明;攻击成功样本的波形分析显示所谓“never stop speaking”实际产生的是大量低能量静音片段而非持续可听语音。这些问题使得当前结果只能视为初步探索,距离顶会主刊的完整证据标准尚有明显距离。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 735 words

The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset

📄 The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset 标签:#语音交互 #基准测试 #数据集 7.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.2/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音交互 | #基准测试 | #数据集 | arxiv 👥 作者与机构 第一作者:Rajmund Nagy(KTH Royal Institute of Technology) 通讯作者:未说明 作者列表与机构: Rajmund Nagy(KTH Royal Institute of Technology) Silvia Arellano García(KTH Royal Institute of Technology) Hendric Voss(Bielefeld University) Mihail Tsakov(Independent researcher) Taras Kucherenko(National Library of Sweden) Youngwoo Yoon(Electronics and Telecommunications Research Institute, ETRI) Gustav Eje Henter(KTH Royal Institute of Technology / Motorica AB) 资助信息:RN、SAG、MT、GEH 部分受 Knut and Alice Wallenberg Foundation 的 Wallenberg AI, Autonomous Systems and Software Program (WASP) 资助;YY 和 GEH 部分受 MOTIE(韩国)资助的 Industrial Strategic Technology Development Program(资助号 20023495)支持。 💡 毒舌点评 作为第四届GENEA挑战赛的延续,本文的评估版图从“语音-动作对齐”扩展到了“副语言交流对齐”和“语义对齐”两个新维度,并首次提出文本失配(text mismatching)范式——这是评测方法论上一次实质推进。但尴尬的是,所有参赛系统在主任务(T2)上最高仅32%对齐率,距离mocap的62%相去甚远;T3和T4中参赛系统几乎全军覆没,竞技结果的意义大打折扣。这与其说是挑战赛的胜利,不如说是对现有方法能力上限的一次温和示警。论文对T3负置信区间给出的统计解释(系统级随机性与研究级随机性)是诚实且有理论依据的,但也暴露了整个评估体系面对“低响应率任务”时统计功效不足的短板——尤其只有46段stimuli的T3,结论的稳定性仍存疑。此外,论文承认此前GENEA Leaderboard上已有扩散Transformer在BEAT2上达到mocap级对齐,但这次挑战未纳入任何已有公开SOTA系统作为对比,削弱了“Seamless Interaction更复杂”这一论断的直接说服力。 ...

2026-08-12 · 更新于 2026-08-14 · 2 min · 380 words

X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction

📄 X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction 标签:#语音交互 #多任务学习 #模型评估 6.4/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #多任务学习 | #模型评估 | arxiv 👥 作者与机构 第一作者:Kaiqi Fu(机构未说明) 通讯作者:未说明 作者列表:Kaiqi Fu、Rime Wen、Altman Lin、Shawn Qin、Roy Gan、Hao Wang、Qian Wang(机构均未说明) 💡 毒舌点评 把 turn state 做成与 ASR head 平行的帧同步输出,粒度上确实比 utterance/chunk 级级联方案更贴近真实对话控制的需求,工程方向有价值。但整个实验只依赖 EasyTurn 中英测试集,且标注由 LLM 自动生成而无人工作一致性验证,最关键的“真实对话中能否正确抢话/让话/忽略 backchannel”并没有被端到端验证。更刺眼的是,Stage2-Turn 联合训练后 AISHELL-1 从 Stage1 的 2.57 回退到 3.94,在 Freeze-Omni 的 2.79 面前已经不再占优,原文却说“still matches or exceeds Freeze-Omni”,这个 claim 需要修正。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 843 words

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

📄 EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models 标签:#语音情感识别 #强化学习 #语音交互 6.2/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音情感识别 | #强化学习 | #语音交互 | arxiv 👥 作者与机构 第一作者:Junyu Wang(天津大学,天津大学认知计算与应用天津市重点实验室) 通讯作者:未说明(论文只有 \correspondingauthor 标记,未明确标注对应作者姓名) 作者列表: Junyu Wang(天津大学,天津大学认知计算与应用天津市重点实验室) Siyuan Zhang(天津大学,天津大学认知计算与应用天津市重点实验室) Peiyuan Jiang(天津大学,天津大学认知计算与应用天津市重点实验室) Jian Zong(天津大学,天津大学认知计算与应用天津市重点实验室) Jingyu Zhang(天津大学) Tianrui Wang(天津大学) Yuqin Lin(福州大学) Zhenghui Chen(福州大学) Shuqing Xie(福州大学) Ziyang Ma(上海交通大学) Meng Ge(天津大学) Xiaobao Wang(天津大学) Longbiao Wang(天津大学,天津大学认知计算与应用天津市重点实验室) Jianwu Dang(中国科学院深圳先进技术研究院) 💡 毒舌点评 用 Mayer-Salovey 四分支模型把 SLM 情绪智力从“听出情绪”扩展成可评测的十任务体系,EmoBench 和 EmoDialogue 的规模确实称得上该方向目前最完整的尝试。但核心数据集、模型和代码全部没有公开,评测样本又来自同一套合成 pipeline,83.8% 的“接近人类”更像是在自建题库里的闭卷成绩;缺少标注一致性、泄漏分析和基线提示词说明,审稿人很难判断这个数字的真实迁移价值。真实场景 62.9% 的掉点也说明分布外泛化仍是明显短板。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 620 words

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

📄 PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue 标签:#语音交互 #大语言模型 #语音识别 #语音合成 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音交互 | #大语言模型 | #语音识别 #语音合成 | arxiv 👥 作者与机构 第一作者:Shibo Wang(Alibaba Group)、Zicheng Zhang(Alibaba Group),论文标注为Co-first authors(共同第一作者) 通讯作者:Libo Wang(Alibaba Group),论文标注为Corresponding author 作者列表:Shibo Wang(Alibaba Group)、Zicheng Zhang(Alibaba Group)、Libo Wang(Alibaba Group)、Junfeng Ma(Alibaba Group) 💡 毒舌点评 PACE 用"播放边界"这个系统可观测信号把 LLM 全双工语音对话中最隐蔽的上下文错位问题变成了可工程化修复的问题,GCM 的提法本身很有价值,且 25.0%→96.3% 的 RAA 提升令人印象深刻;但整个验证只基于 DashScope 单一家后端、TTS 合成的用户轨迹和 ChatGPT 5.5 单一裁判,“provider-independent” 的系统级卖点目前还停留在架构声明层面,且 PACE 核心代码未开源,独立复现门槛较高。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 771 words

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

📄 FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India 标签:#语音交互 #大语言模型 #语音识别 #鲁棒性 #基准测试 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音交互 | #大语言模型 | #语音识别 #鲁棒性 | arxiv 👥 作者与机构 作者列表:Aman Dalmia、Sanskriti Midha、Jigar Doshi 机构信息:论文未说明作者所属机构 通讯作者:论文未标明通讯作者 💡 毒舌点评 把“LLM 只做语义提取和话术生成、校验与跳转完全交给规则层”的混合架构做到可部署粒度,并给出成本—延迟—准确率的 Pareto 选择流程,这是工程洞察上的亮点;但整个 benchmark 全部来自脚本化模拟用户和单次录音,所谓 pilot 没有给出任何真实通话数据,端到端结论的生态效度仍然存疑。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 768 words

Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization

📄 Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization 标签:#语音交互 #强化学习 #音频理解 #Transformer #模型评估 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #强化学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者: Xiang Lin(未说明机构) 通讯作者: 未说明 作者列表: Xiang Lin (注:原文脚注标明与Tian-Hao Zhang同等贡献), Tian-Hao Zhang, Chunfeng Wang, Zhou Pan, Kun Zhan, Liang Li 机构: 未明确说明。从脚注推断作者1,2分属不同机构,但正文未提供具体单位和所属机构。 💡 毒舌点评 论文提出了一种巧妙的声学-文本解耦策略优化方法(ALPO),为解决语音大模型中内容质量与情感表达此消彼长的难题提供了新思路,动机分析和消融实验设计得漂亮且说理清晰。但这项工作完全建立在单轮对话和合成数据的基础上,严重缺乏在真实、嘈杂、多轮场景下的验证,且代码、模型、数据全线闭源,让整个方法的实际鲁棒性和社区可验证性都打上了问号,更像是在理想化实验环境中的一次干净利落的算法展示。 ...

2026-08-05 · 更新于 2026-08-14 · 2 min · 421 words

Homebot: A Personal AI Agent for Conversational Home Assistance and Automation

📄 Homebot: A Personal AI Agent for Conversational Home Assistance and Automation 标签:#语音交互 #大语言模型 #语音唤醒 #说话人验证 #流式处理 3.8/10 | 创新 0.8/2 | 严谨 1/1.5 | 实验 0/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 3.8/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #语音交互 | #大语言模型 | #语音唤醒 #说话人验证 | arxiv 👥 作者与机构 第一作者:Shengyuan Ye(机构未说明) 通讯作者:Shengyuan Ye(邮箱 brandonye@foxmail.com,机构未说明) 作者列表:Shengyuan Ye、Yixin Zhang、Han Liang、Liekang Zeng、Jiangsu Du、Mu Yuan(所有作者机构均未说明) 项目网站:https://ysyisyourbrother.github.io/homebot 💡 毒舌点评 语音对话状态协议(end/follow_up/continuous)设计清晰,有效解耦了语义判断与通道状态转换,是工程上一个聪明的小创新。然而,全文竟然没有提供一丁点定量实验结果——延迟、成功率、冒烟测试、用户反馈统统缺席。这让整个系统看起来更像一份产品需求文档,离说服读者这是“实用的本地家庭助手”还差十万八千里。 ...

2026-08-04 · 更新于 2026-08-14 · 1 min · 170 words

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

📄 M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models 标签:#语音交互 #模型评估 #音频理解 #Transformer 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.1/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音交互 | #Transformer | #模型评估 #音频理解 | arxiv 👥 作者与机构 第一作者:Ryo Fukuda(NTT Corporation) 通讯作者:未说明 作者列表:Ryo Fukuda(NTT Corporation)、Atsushi Ando(NTT Corporation)、Hiroki Kanagawa(NTT Corporation)、Takatomo Kano(NTT Corporation)、Marc Delcroix(NTT Corporation)、Naohiro Tawara(NTT Corporation)、Yuya Chiba(NTT Corporation) 💡 毒舌点评 这篇论文做了一件踏实但不够惊艳的工作:为全双工对话系统搭了一个多语言多领域的评估擂台。Teacher-forced inference的多轮评估思路解决了上下文不一致的老大难问题,实验也揭示了日语模型在内容理解上与英语模型的明显鸿沟。可惜的是,这张擂台的门票只发给Moshi架构的模型,通用性严重受限。内容评估全押宝在GPT-5 nano单一裁判身上,数据的可靠性和结论的稳固性让人捏一把汗。开源仓库不见踪影,让这个擂台的“公平公开”打了折扣。 ...

2026-08-03 · 更新于 2026-08-14 · 2 min · 325 words