研究条目

Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning

📄 Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning #语音交互 #多模态模型 #自监督学习 #低资源 8.2/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | #语音交互 | #强化学习 | #多模态模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Yuxin Li(Nanyang Technological University) 通讯作者:未说明 作者列表:Yuxin Li(Nanyang Technological University)、Donghang Wu(Nanyang Technological University)、Guan-Ting Lin(National Taiwan University)、Hung-yi Lee(National Taiwan University)、Chengwei Qin(The Hong Kong University of Science and Technology)、Zhehuai Chen(NVIDIA)、Chen Chen(NVIDIA) 💡 毒舌点评 该工作聪明地将全双工对话中“何时说话”与“说什么”解耦,用精心设计的局部窗口采样和因子化奖励把发声时机变成一个独立的 RL 优化目标,既保住了指令跟随能力又把交互指标拉满。但奖励函数的八个超参数和繁杂的惩罚项像是精心调制的独门秘方,其跨语言、跨风格的泛化性未经验证,且代码与模型均未开源,让社区难以深入复现和改进。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 834 字 阅读 →
研究条目

Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs

📄 Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs #语音交互 #语音大模型 #多模态模型 #端到端 #流式处理 9.2/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 🔥 9.2/10 | 前10% | #语音交互 | #语音大模型 | #多模态模型 #端到端 | arxiv 👥 作者与机构 第一作者:Zhenyu Liu(哈尔滨工业大学(深圳)计算机科学与技术学院;语言智能与机器中心,深圳河套研究院) 通讯作者:Baotian Hu(哈尔滨工业大学(深圳)计算机科学与技术学院;语言智能与机器中心,深圳河套研究院) 其他作者:Yunxin Li, Xuanyu Zhang(哈尔滨工业大学(深圳),语言智能与机器中心),Qixun Teng, Shenyuan Jiang(哈尔滨工业大学(深圳)),Haolan Chen, Minjun Zhao, Fanbo Meng, Yu Xu, Yancheng He(机构未详细说明),Haizhou Li(香港中文大学(深圳)人工智能学院),Min Zhang(哈尔滨工业大学(深圳),语言智能与机器中心) 💡 毒舌点评 本文以梯度冲突分析精准诊断了全双工SLM“既要又要”的模态干扰病根,层级参数分离的策略对症下药,逻辑清晰且实验扎实,为领域提供了高价值基线。遗憾的是,方法对合成数据的依赖构成显著硬伤,侧语难题被轻描淡写地归咎于数据而回避了架构本身的判别上限,这使得框架在真实世界的鲁棒性仍是一个巨大的问号。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 731 字 阅读 →
研究条目

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

📄 DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling #语音交互 #扩散模型 #语音分离 5.9/10 | 创新 0.6/2 | 严谨 0.7/1.5 | 实验 0.4/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 📝 5.9/10 | 前50% | #语音交互 | #扩散模型 | #语音分离 | arxiv 👥 作者与机构 第一作者:Wataru Nakata(The University of Tokyo, Japan) 第二作者:Yuki Saito(The University of Tokyo / JST BOOST) 第三作者:Hiroshi Saruwatari(The University of Tokyo) 通讯作者:未明确标注,推测为 Wataru Nakata 💡 毒舌点评 DuplexChat通过播客管道规模化构建说话人分离的全双工对话语料,填补了公开大规模双通道训练数据的空白,工程集成能力扎实,构建了当前最大规模对话语音资源(~415k小时)。但下游SDLM训练实验完全缺失,使得"适合全双工建模"的核心断言悬空;单通道混合到双通道估计的分离链路引入模型噪声,其分离错误对下游对话建模的长期影响并未讨论。更致命的是,论文仅与Fisher这一电话窄带语料对比声学质量,既未与J-CHAT等相近的播客/音视频对话语料对比,也未讨论pyannote日志模型的级联误差,导致语料真实可用性缺乏说服力。整体来看,这是一个优秀的工程基础设施论文,但缺少SDLM训练验证使其影响力大打折扣——就像造了一条高速公路却从未让它跑过车。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 291 字 阅读 →
研究条目

Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

📄 Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving #语音交互 #流式处理 8.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 8.7/10 | 前25% | #语音交互 | #Transformer | #流式处理 | arxiv 👥 作者与机构 第一作者:Jiaying Meng(Independent Researcher) 通讯作者:未说明 作者列表:Jiaying Meng(Independent Researcher)、Bojie Li(Pine AI) 💡 毒舌点评 本文以简洁的系统洞察切中交互语音模型服务的隐秘死穴——无界KV引发静默延迟悬崖,窗口化加准入控制的双药方既治标又治本,实验端到端且扎实。但单GPU、单引擎的验证格局让人对其跨生态普适性存疑,20次运行的统计量在系统论文中略显单薄,且sink kernel仅实现在Triton后端,FlashAttention路径仍无解,对工业部署的覆盖力打了折扣。 📌 核心摘要 本文揭示并解决了实时交互语音模型(Moshi、MiniCPM-o、Qwen-Omni系列)在推理服务中因无界KV缓存导致的内存耗尽型“延迟悬崖”:在持续会话下,延迟从数毫秒突然跳至约1.6秒,而引擎仍在“准时”返回空帧,导致常规延迟与超时监控完全失效。Metronome通过两个相互依赖的机制修复此问题:(1)在每个会话上施加窗口化KV缓存,仅保留最近W个token和少量固定注意力sink token,从而将无界状态变为有界状态;(2)基于恢复后的单调延迟信号,使用AIMD在线准入控制器发现可调度的并发数N*,并干净地丢弃溢出请求。端到端实验在四个交互模型上表明,窗口化KV将崩溃率从14/20降至0/20,控制器在约209个并发会话处稳定收敛(Qwen-Omni-30B,2s帧预算),而消融实验证明sink token对自由运行生成质量不可或缺。该原则可推广至任何具有周期性截止时间和无界状态的实时推理服务。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 326 字 阅读 →
研究条目

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

📄 SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models #语音交互 #大语言模型 #基准测试 #流式处理 #模型评估 8.9/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.9/10 | 前25% | #语音交互 | #大语言模型 | #基准测试 #流式处理 | arxiv 👥 作者与机构 第一作者:Thomas Thebaud(单位未明确说明,论文为匿名提交至 IEEE SLT 2026) 通讯作者:未说明 作者列表: Thomas Thebaud(未说明)、Yuzhe Wang(未说明)、Hao Zhang(未说明)、Sathvik Manikantan Napa Ugandhar(未说明)、Ashish Hallur(未说明)、Georgi Tinchev(未说明)、Venkatesh Ravichandran(未说明)、Laureano Moro-Velazquez(未说明) 💡 毒舌点评 这项工作的亮点在于,它首次将打断、方言跟随、情感关联、人际立场等高度离散的社会性对话维度塞进了一个可统一运行的自动化 Benchmark 里,并且数据、代码、排行榜网站全开源,对 S2S 模型的工程迭代确实有"开箱即用"的推进作用。但毒舌地说,这本质上是一个工程集成项目,所有评估器都是拿来即用的现成模型,缺乏对复合评估偏差、评估器自身错误在 Benchmark 中的影响分析,使得分数的解释力在严格学术意义上打了折扣;同时仅用英文双人问答场景,就冠以"通用对话自然度"的名号,结论的泛化性存疑。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 822 字 阅读 →
研究条目

-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

📄 \(\tau\)-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains #语音交互 #基准测试 #语音大模型 #模型比较 9.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 9.1/10 | 前10% | #语音交互 | #语音大模型 | #基准测试 #模型比较 | arxiv 👥 作者与机构 第一作者:Soham Ray(Sierra.ai, USA) 通讯作者:Victor Barres(Sierra.ai, USA; 另外 Soham Ray、Keshav Dhandhania 亦列通讯) 作者列表:Soham Ray(Sierra.ai, USA)、Keshav Dhandhania(Sierra.ai, USA)、Victor Barres(Sierra.ai, USA)、Karthik Narasimhan(Princeton University, USA) 💡 毒舌点评 这是一个填补空白的有力基准工作,巧妙地将对话动态测量与硬核任务完成揉在一起,提出的离时钟时间解耦框架虽不惊天动地,但工程上有可贵的可控性。然而论文对语音生成质量本身不评估,且用TTS模拟真实口音的说服力打折扣,实验仅英文、集中三大闭源模型也限制了结论的泛化性。好在小众但尖锐的声学消融实验给无障碍评估敲了警钟。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 576 字 阅读 →
研究条目

BFCL Audio: An Audio Function Calling Evaluation for Large Language Models

📄 BFCL Audio: An Audio Function Calling Evaluation for Large Language Models #基准测试 #语音交互 #多模态模型 #模型比较 7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | #语音交互 | #多模态模型 | #基准测试 #模型比较 | arxiv 👥 作者与机构 第一作者:Huanzhi Mao(University of California, Berkeley) 通讯作者:Huanzhi Mao(University of California, Berkeley) 作者列表:Huanzhi Mao(University of California, Berkeley)、Aditya Ghai(University of California, Berkeley)、Imra Dawoodani(University of California, Berkeley)、Tony A Ginart(Salesforce AI Research)、Shishir G Patil(University of California, Berkeley)、John Emmons(Salesforce AI Research)、Joseph E. Gonzalez(University of California, Berkeley) 💡 毒舌点评 首次系统评估音频function calling,其可控合成管道和无需LLM裁判的自动评分机制,为语音Agent的鲁棒性问题提供了清晰的归因分析。但工作本质上仍是现有BFCL基准向语音模态的延伸,且完全依赖合成数据,在真实场景的生态效度和结论的泛化性上存在硬伤。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 623 字 阅读 →
研究条目

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

📄 LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues #语音交互 #语音大模型 #基准测试 #内容审核 #多模态模型 8.1/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #语音交互 | #语音大模型 | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 通讯作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 作者列表:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering)、Shinji Watanabe(Carnegie Mellon University, Language Technologies Institute) 💡 毒舌点评 这篇论文为语音安全评估贡献了一个设计精良的受控基准,最可贵之处在于清晰揭示了“增加音频不一定更安全”这一反直觉结论,并系统解构了模态、转录源和提示策略间的复杂交互。然而,所有对话均基于合成语音,真实的嘈杂环境、口音、自然副语言信息和多轮累积危害的缺失,使得当前结论能否直接迁移到实际部署中仍存较大疑问,而作者在这方面过于乐观的决策流程图可能会误导急于落地的从业者。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 753 字 阅读 →
研究条目

Unlocking Speech–Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

📄 Unlocking Speech–Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning #语音交互 #语音大模型 #模型融合 #参数高效微调 #指令微调 #语音合成 6.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.7/10 | 前50% | #语音交互 | #模型融合 | #语音大模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Congrui Du(University of California, Santa Barbara, USA) 通讯作者:Yang Zhang(MIT-IBM Computing Research Lab, IBM Research, USA) 其他作者:Kaizhi Qian(MIT-IBM Computing Research Lab, IBM Research)、Shiyu Chang(University of California, Santa Barbara) 💡 毒舌点评 这篇论文用一个极其简单的权重算术绕过了SLM领域“卷数据”的军备竞赛,洞察深刻,但成也萧何败也萧何——仅用30k小时数据就达成此性能令人眼前一亮,但其方法的脆弱性同样引人注目:输出格式极度依赖后期强制修正、语音能力上限被韵律分词器锁死、对预训练数据结构的病态依赖,以及依赖外部ASR的pipeline设计,使其离一个实用、鲁棒的SLM新范式尚有距离。它更像一个巧妙的概念验证,而非可直接部署的突破。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 547 字 阅读 →
研究条目

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

📄 Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings #语音交互 #预训练 #多任务学习 #低资源 #迁移学习 #Transformer 7/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7/10 | 前50% | #语音交互 | #预训练 | #多任务学习 #低资源 | arxiv 👥 作者与机构 第一作者:Jesuraj Bandekar(印度科学学院电气工程系) 通讯作者:Prasanta Kumar Ghosh(印度科学学院电气工程系) 作者列表:Jesuraj Bandekar、Prasanta Kumar Ghosh(均来自印度科学学院电气工程系) 资助信息:本研究由印度科技部(Department of Science and Technology, DST)资助。 💡 毒舌点评 本文用一套组合式多任务预训练给低资源 AAI 打了针强心剂,用廉价的 MFCC 就敢叫板重量级 SSL 特征,工程实用性看似不错。但方法只是将已知预训练目标拼盘,却未深究多目标间的互补与冗余;消融止于最终性能的罗列,没有一丝表征层面的分析。仅抱紧 TERA 和单一数据集,就敢声称“高效替代”,说服力在审稿人看来仍需更多证据。 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1175 字 阅读 →
研究条目

TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue

📄 TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue #语音交互 #自监督学习 #基准测试 #模型评估 7/10 | 创新 0.8/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7/10 | 前50% | #语音交互 | #Transformer | #自监督学习 #基准测试 | arxiv 👥 作者与机构 第一作者:Hao Zhang(未说明) 通讯作者:Hao Zhang(未说明)、Laureano Moro-Velázquez(未说明) 作者列表:Hao Zhang(未说明)、Thomas Thebaud(未说明)、Georgi Tinchev(未说明)、Venkatesh Ravichandran(未说明)、Laureano Moro-Velázquez(未说明) 💡 毒舌点评 将轮次预测模型重用作自然度评估器是个巧妙的思路,用似然度统一多种时序故障避免了为每种行为单独设计指标。但这种方法论上的重组创新性有限,且实验完全局限于人工构造的局部扰动,从未在真实全双工对话系统的输出上验证。在缺乏与Full-Duplex-Bench等现有行为特定基准直接对比的情况下,宣称的“统一评分”优势仍停留在纸面上,令人怀疑其在实际嘈杂、混合故障场景中的鲁棒性。 📌 核心摘要 论文提出TurnNat,一种基于似然度的自动评估框架,旨在统一量化双人对话中的轮次自然度。其核心是一个仅由自然对话训练得到的因果轮次预测模型,该模型逐帧估计未来2秒内双说话人语音活动的状态分布。通过计算观测到的真实未来活动状态的负对数似然(NLL)来度量时序的非典型性。为避免全局平均稀释局部异常,TurnNat设计了“轮次边界单元”(TBU),在发言起始和结束前的2秒窗口内集中评分,并通过合并NLL均值和尾部高分NLL的均值(TailNLL)聚合为对话级自然度分数。作者构建了一个经人工验证的轮次扰动基准,包含五种局部时序扰动(延迟响应、过早插话等)。实验显示,最佳配置(基于DualTurn的D4变体)在自然-扰动配对判别准确率达到88.0%,相较VAP基线提升7-8个百分点。主要局限性在于:评测对象仅为人工构造的单点扰动,未在真实系统输出上验证,且未与任何现有的行为特定基准进行对比。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 284 字 阅读 →
研究条目

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

📄 Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning #语音交互 #语音大模型 #模型融合 #低资源 #参数高效微调 8.5/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.5/10 | 前25% | #语音交互 | #模型融合 | #语音大模型 #低资源 | arxiv 👥 作者与机构 第一作者:Congrui Du(机构未明确给出,但论文匿名期已过,推断来自UC Santa Barbara,因项目主页域名为ucsb.edu) 通讯作者:未明确标示,通常为末位作者Shiyu Chang。 作者列表:Congrui Du, Yang Zhang, Kaizhi Qian, Shiyu Chang。机构均未在论文首页明确注明。 💡 毒舌点评 本文用一个极度精简、甚至有些投机取巧的权重组合方案,试图颠覆SLM必须堆数据和指令微调的昂贵范式,效果竟然出奇地好,尤其在重音检测与生成任务上碾压所有基线。思路的优雅与执行的高效令人印象深刻,但推理时对Whisper ASR、格式强制等一系列外部组件的强依赖暴露出其“伪端到端”的本质,更像是一个精心设计的系统工程集成,而非一个能独立感知与交互的语音原生模型。格式输出的不稳定性问题被作者一笔带过,但这是实用化的致命伤;长思考能力虽由推理模板“免费”激活,却也因缺乏训练监督而容易失效。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 377 字 阅读 →