论文解读

终点相同不等于负担相同:语音客服审计为何要先过验证门

该文把语音客服审计对象定为固定服务事实下的完整服务事件,用七道验证门和六类指标区分最终结果与过程负担,并以全合成退款实例说明方法,全程不报告真系统比较结果。

 · 更新于 2026-09-24 · 约 17 分钟 · 8354 字 阅读 →
论文解读

边说话边动:把全身动作做成对话模型的原生输出

针对先说话后做动作的级联需要两次推理且无法联合优化的问题,Motion-Omni 让动作直接从产生语音的隐状态生成,并在 422856 对教师伪标签与 SwDA-500 对照下以 RTF=0.78 达到与同音频教师级联接近的动作质量,代价是动作质量仍受教师分布约束。

 · 更新于 2026-09-24 · 约 19 分钟 · 9430 字 阅读 →
论文解读

语音不只是文字的喇叭:温暖介导伤害为何必须同时审听觉与文本

在同一模型上以 7 轮 WHO 脚本对比音频与纯文本,音频在诱发轮出现更短更快更低更轻且不更温暖的韵律漂移,文本转录审计会漏检而高风险自伤脚本的模态差异最集中。

 · 更新于 2026-09-24 · 约 20 分钟 · 9684 字 阅读 →
论文解读

语音上下文不能只存文字:用有界编排同时管住说什么、怎么说和何时打断

llmovoice 把语音交互的上下文拆成语义、副语言与环境三状态,用 VoicePage/VoiceThread 组织记忆并在预算内投影到上下文窗口,再让服务模型联合推理生成运行时指令,在丢包下把误打断率从 46.0% 降至 0.9%、每轮成本最高降低 24.9 倍,代价是编排调用时约 790 ms 的额外决策延迟与摘要压缩带来的细节丢失。

 · 更新于 2026-09-24 · 约 25 分钟 · 12248 字 阅读 →
论文解读

听见的对话如何被核查:TRILOGUE 把多轮声称钉回源文章与配对音频

针对播客式多轮对话中声称分散与 ASR 噪声的核查难题,TRILOGUE 以源文章可追溯的英俄哈三语对话与配对音频构建受控基准,显示仅看声称的验证最难、加入源证据后大幅回升,而哈萨克语的识别与合成瓶颈仍是主要代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10512 字 阅读 →
论文解读

Reference-Based Prosody and Rhythm Evaluation for Spoken Dialogue Systems

语音对话系统 | 4.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5571 字 阅读 →
论文解读

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5988 字 阅读 →
论文解读

MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild

语音对话系统 | 7.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6606 字 阅读 →
论文解读

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

语音对话系统 | 9.3/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8738 字 阅读 →
论文解读

Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

语音识别 | 9.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8124 字 阅读 →
论文解读

DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action

语音对话系统 | 7.8/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9025 字 阅读 →
论文解读

Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models

语音对话系统 | 7.6/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7848 字 阅读 →
论文解读

Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation

语音对话系统 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 8002 字 阅读 →
论文解读

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

模型评估 | 6.3/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10971 字 阅读 →
论文解读

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

语音对话系统 | 8.0/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9925 字 阅读 →
论文解读

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

语音对话系统 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8653 字 阅读 →
论文解读

MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

 · 更新于 2026-09-24 · 约 14 分钟 · 7004 字 阅读 →
论文解读

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7885 字 阅读 →
论文解读

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12846 字 阅读 →
论文解读

Can Speech LLMs Think while Listening?

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4703 字 阅读 →