论文解读

FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection

这篇论文针对全双工语音对话系统中需要低延迟、高精度判断用户是否结束发言(轮次检测)的难题,提出了FastTurn统一框架。其核心方法是将流式CTC解码提供的快速部分语义信息,与Conformer编码器提取的声学特征,通过适配器输入给大语言模型(LLM)进行推理,并最终融合声学与语义特征进行轮次预测。

 · 更新于 2026-09-25 · 约 10 分钟 · 4565 字 阅读 →
论文解读

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

这篇论文旨在解决当前音频-文本检索模型在**真实、多样化用户查询**下性能下降的问题。作者指出,现有基准测试(如AudioCaps, Clotho)依赖描述性标题式查询,与真实世界中简短、多变的搜索行为(如问题、命令、关键词、排除性查询)存在巨大差距。为此,论文提出了两大核心贡献:1) **Omni

 · 更新于 2026-09-25 · 约 9 分钟 · 4160 字 阅读 →
论文解读

Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party Interruptions

本文旨在解决语音语言模型(SLMs)在真实场景中无法有效区分主要用户与第三方插入语音(Third-Party Interruption, TPI)的问题,这会导致上下文理解失败。为此,作者首先创建了 **TPI-Train**,一个包含8.8万个样本的训练数据集,其核心设计是“说话人感知的难负例”,

 · 更新于 2026-09-25 · 约 8 分钟 · 3773 字 阅读 →
论文解读

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

这篇论文旨在解决当前语音语言模型(SLM)社会对齐评估不全面、不深入的问题。现有基准要么只关注基础音频理解,要么孤立地研究单一风险,无法区分模型是因“不懂”还是因“没用对地方”而失败。为此,作者提出了**VoxSafeBench**,这是首个联合评估SLM在**安全、公平、隐私**三大社会对齐维度上

 · 更新于 2026-09-25 · 约 13 分钟 · 6394 字 阅读 →