BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM

📄 BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM #语音合成 #语音识别 #自回归模型 9/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 🔥 9/10 | 前10% | #语音合成 | #语音识别 | #自回归模型 | arxiv 👥 作者与机构 论文有三位作者:Qingkai Fang、Shoutao Guo、Yang Feng。他们都隶属于中国科学院计算技术研究所(ICT/CAS)的智能信息处理重点实验室、中国科学院AI安全重点实验室以及中国科学院大学。 💡 毒舌点评 这篇论文在“如何让LLM学会实时对话”这个问题上给出了一个相当聪明的答案。它没有像Moshi那样另起炉灶搞一套复杂的双流并行架构,而是巧妙地在现有的单工LLM(GLM-4-Voice)上“打补丁”——通过精心设计的多通道交错序列和四个特殊令牌,把“什么时候该说话、什么时候该闭嘴、什么时候该被打断”这些复杂决策,统统变成了LLM最擅长的“下一个词预测”游戏。这个想法非常优雅,工程上也极其友好,40万样本微调就能从单工变全双工,成本控制堪称典范。实验结果也足够亮眼,尤其是在轮流和打断的成功率上碾压了Moshi,证明了“内化决策”的有效性。然而,它的软肋也很明显:所有实验都在干净、无噪、单人的合成语音上进行,这就像在无菌实验室里测试越野车,真正开上马路(复杂现实环境)表现如何,谁也不知道。此外,0.8秒的固有延迟虽然被提及,但分析深度不足,对于追求极致响应速度的应用来说,这可能是一个硬伤。总体而言,这是一篇工程思维出色、架构设计巧妙的工作,但其宣称的“原生全双工”能力,还需要在更“脏”的真实世界数据中经受考验。 📌 核心摘要 本文提出了BayLing-Duplex,一个基于单一自回归大语言模型(LLM)的原生全双工语音对话系统。该系统通过一种创新的多通道交错序列布局,将用户语音、助手文本和助手语音三个流以固定块大小交错组织,并引入[SILENCE]、[ASSISTANT]、[PAD]、[EPAD]四个对话状态特殊令牌。这一设计将全双工对话中的轮流说话和打断决策,完全转化为标准LLM的下一个令牌预测任务,无需任何额外的分类头、状态机或外部语音活动检测(VAD)模块。模型以GLM-4-Voice为骨干,仅通过在40万全双工合成样本上进行有监督微调(SFT)和直接偏好优化(DPO)两阶段训练,便实现了从单工到全双工的能力转换。实验表明,BayLing-Duplex在轮流说话成功率(92.0%)和打断成功率(100%)上大幅超越了基线模型Moshi,并在语音问答等任务上保持了与单工版本相当或更优的性能,验证了全双工建模并未以牺牲回复质量为代价。 🔗 开源详情 代码:https://github.com/BayLing-Models/BayLing-Duplex 模型权重:论文中未直接提供独立的模型权重下载链接,但根据摘要中的信息,代码和模型已发布于上述GitHub仓库。模型基于GLM-4-Voice检查点训练。 数据集:论文中描述的数据集为基于Alpaca和UltraChat数据集,通过Llama-3.3-70B-Instruct改写并使用CosyVoice合成的多轮对话语音语料,后被转换为全双工格式。原始合成数据集的获取链接论文中未提及。 Demo:论文中未提及。 复现材料:论文中提供了详细的训练配置。SFT阶段:在400K全双工样本上训练1个epoch,批量大小32,峰值学习率1e-5,使用带10%预热的余弦学习率调度。DPO阶段:训练200步,峰值学习率3e-7,β=0.5,λ_ftx=0.5,使用带5%预热的余弦学习率调度。训练代码基于LLaMA-Factory。但检查点文件的具体下载链接论文中未提及。 论文中引用的开源项目: GLM-4-Voice: https://github.com/THUDM/GLM-4-Voice Whisper-large-v3: https://github.com/openai/whisper CosyVoice: https://github.com/FunAudioLLM/CosyVoice LLaMA-Factory: https://github.com/hiyouga/LLaMA-Factory 🏗️ 方法概述和架构 BayLing-Duplex的核心架构是在已有的GLM-4-Voice单工语音LLM基础上,通过设计一种新颖的序列布局来赋予其全双工能力,而不引入新的网络模块。 ...

2026-06-15 · 更新于 2026-08-14 · 2 min · 316 words

Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR

📄 Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR #持续学习 #语音识别 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.3/10 | 前25% | #语音识别 | #持续学习 | arxiv 👥 作者与机构 作者: Henri-Leon Kordt, Theresa Pekarek Rosin, Jae Hee Lee, Stefan Wermter 机构: Knowledge Technology, Department of Informatics, University of Hamburg, Germany 💡 毒舌点评 这篇工作选题很有意思,直击ASR领域的痛点——不流畅语音处理,并试图用持续学习这个“时髦”工具来解决。作者实验做得挺认真,对比了四种主流CL方法,还挖到了注意力头特化这个有趣的“彩蛋”,分析部分比许多只会刷点的论文强不少。但是,话说回来,顶会审稿人的眼睛是雪亮的:你只用了一个whisper-small.en,而且任务顺序固定,这就好比只用一道菜的食谱去证明一种烹饪方法的普适性,说服力打了折扣。另外,你的方法最终是落在ASR性能上的,但和那些专攻不流畅识别或超大模型的SOTA比起来,数字上好像没特别亮眼啊?你的“可解释性”发现很酷,但能稳定复现吗?别只是恰好在whisper上观察到的现象。总的来说,是一篇不错的“探索性”工作,但离“里程碑”还有距离。 ...

2026-06-15 · 更新于 2026-08-14 · 3 min · 500 words

Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models

📄 Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models #语音识别 #Transformer 9.6/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 9.6/10 | 前25% | #语音识别 | #Transformer | arxiv 👥 作者与机构 Ravi Ranjan (Florida International University,通讯作者),Utkarsh Grover (University of South Florida),Xiaomin Lin (University of South Florida),Agoritsa Polyzou (Florida International University)。论文已被INTERSPEECH 2026接收。 💡 毒舌点评 这篇论文在可解释AI(XAI)这个“网红”赛道上试图解决一个实际痛点:Transformer ASR模型的“黑箱”问题。LEAF-X这个名字起得很有品牌感,将“聆听”、“熵”、“注意力”、“忠实”几个关键词打包。其核心思想——用注意力的熵来筛选“靠谱”的注意力头,再结合跨层传播和因果消融——逻辑上是通的,也确实针对了现有方法(如纯注意力、LIME等)在音频时序定位和忠实度上的弱点。作者在实验设计上做足了功课,用了两个主流模型(Whisper, Canary)和两个数据集(LibriSpeech, TED-LIUM)进行交叉验证,并提出了一个相对全面的评估指标体系(LEAF-XBench)。结果也显示,在多项指标上取得了“最优或接近最优”的成绩。然而,作为一篇旨在提升透明度的方法论文,其自身的“透明度”仍有改进空间:1)实验部分对多次运行的标准差描述略显模糊(仅给出范围而非具体数值),这在严格的顶会审稿中可能会被追问统计显著性;2)关于计算开销的讨论,尤其是因果重加权部分的成本-收益权衡,目前的描述更像是功能开关而非定量的工程分析;3)最大的遗憾在于,尽管提到了“用户研究验证”,但最终并未提供,这使得“可解释性”在人类用户层面的价值未能闭环;4)方法中对“音频伪令牌”的描述以及其与编码器-解码器模型处理方式的差异,可以更清晰地阐述以提升通用性印象。总体而言,这是一篇扎实、有明确贡献的工作,但距离让审稿人无可挑剔(尤其是对实验严谨性和实用性论证的挑剔)还差临门一脚。 ...

2026-06-15 · 更新于 2026-08-14 · 1 min · 119 words

MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition

📄 MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition #语音识别 #持续学习 #鲁棒性 #数据增强 6.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | #语音识别 | #持续学习 | #鲁棒性 #数据增强 | arxiv 👥 作者与机构 作者:Theresa Pekarek Rosin, Matthias Kerzel, Stefan Wermter 机构:德国汉堡大学信息学系知识技术实验室 💡 毒舌点评 这篇论文想法不错,想解决ASR鲁棒性评估脱离实际的痛点,用持续学习(CL)这个“时髦”工具来诊断。但“诊断”这词用得有点大。用Whisper-small.en这个本身就不太强的模型在一堆精心构造的任务上做实验,结论的普适性存疑。方法创新有限,主要是把因子设计和CL结合到语音领域。实验部分,虽然对比了三种CL方法,但都比较经典,缺少和近期更先进的CL方法对比。最大的亮点是数据集设计和开源,这点要给赞。但要说对领域有多大推动,可能更多是提供了一个不错的基准和工具,离深刻洞察还差一步。CL在ASR上的实际应用价值?目前看更像是个学术玩具。 📌 核心摘要 本文针对现有自动语音识别(ASR)鲁棒性评估基准孤立看待噪声、口音、疾病等分布偏移因素的问题,提出将鲁棒性视为一个动态发展的持续学习(CL)能力。为此,作者构建了MoDiCoL数据集,这是一个基于正交阵列和折叠设计的模块化、可诊断CL数据集,系统地覆盖了语言内容、说话人特征和声学环境三大类因素。数据集包含8100个样本(18.79小时,其中14.08小时为合成语音),通过可配置的增强管道精确控制因素水平。论文设计了一个模拟真实世界增量更新的CL课程,包含四个顺序任务(控制设置、声学漂移、说话人漂移、语言漂移、复合漂移),并通过排列任务顺序评估鲁棒性迁移。在实验上,使用Whisper-small.en作为骨干模型,对比了经验重放缓冲区(ER-5%, ER-10%)、表示级正则化(RLR)和正交梯度下降(OGD)三种CL策略。结果表明,ER-10%在平均词错误率(A-WER)和遗忘度量(FM)上表现最优,甚至超过了联合训练上界;OGD在平均增量词错误率(AI-WER)上最佳。研究发现,顺序引入偏移可以提高模型的学习可塑性,但任务顺序对记忆稳定性影响显著。作者总结认为,CL不仅能保持模型鲁棒性,也可作为诊断预训练模型遗忘机制的工具。MoDiCoL数据集、增强流程及CL课程设置已开源。 ...

2026-06-15 · 更新于 2026-08-14 · 2 min · 363 words

The Holistic Storage of Verb+Up Phrases in Text-based and Audio-based Language Models

📄 The Holistic Storage of Verb+Up Phrases in Text-based and Audio-based Language Models #语音识别 8.2/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 🔥 8.2/10 | 前50% | #语音识别 | #语音识别 | arxiv 👥 作者与机构 作者: Zachary N. Houghton, Yu Zhou, Dan Pluth, Vijay K. Gurbani 机构: University of Oregon, Vail Systems, Inc. 💡 毒舌点评 这篇论文像个严谨的侦探,试图在AI的“大脑”里寻找人类语言处理的痕迹。它最大的优点是问题问得漂亮——模型是“死记硬背”整个短语,还是像拼积木一样临时组合?实验设计也算全面,从迷你模型测到大模型,从文本测到语音,证据链是完整的。但问题也很明显:你用一个“探针”去测量表征差异,就敢断定这是“整体存储”?万一只是一种更通用的“上下文敏感性”呢?论文在区分这两者上没下够功夫。另外,对Whisper encoder里发现效应的解释有点绕,缺乏更直接的验证。最让人皱眉的是局限性部分,写得像匆匆结尾的附录,把自家方法的软肋(比如探针偏差、定义操作化问题)都藏了起来。总的来说,一篇扎实但结论需要加点问号的工作。 ...

2026-06-15 · 更新于 2026-08-14 · 2 min · 232 words

Unsupervised Approaches for Global Prosodic Embedding Extraction

📄 Unsupervised Approaches for Global Prosodic Embedding Extraction #语音合成 #语音识别 #自监督学习 #对比学习 7.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.8/10 | 前25% | #语音合成 | #自监督学习 | #语音识别 #对比学习 | arxiv 👥 作者与机构 作者:Martin Meza, Luciana Ferrer, Pablo Riera 机构:1 Departamento de Computación, FCEyN, Universidad de Buenos Aires (UBA), Argentina; 2 Instituto de Investigación en Ciencias de la Computación (ICC), CONICET-UBA, Argentina ...

2026-06-15 · 更新于 2026-08-14 · 2 min · 287 words

Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition

📄 Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition #语音识别 #说话人日志 #大语言模型 7.1/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | #语音识别 | #说话人日志 | #大语言模型 | arxiv 👥 作者与机构 论文标题:Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition 作者:Zheng Naijun, Lin Yuke, Tian Sanli, Li Mengtian, Lin Zhiwei, Xiao Longshuai, Tu Dandan 机构:华为技术有限公司,中国 ...

2026-06-12 · 更新于 2026-08-14 · 4 min · 693 words

Positional Encoding in the Context of Memristor-Based Analog Computation for Automatic Speech Recognition

📄 Positional Encoding in the Context of Memristor-Based Analog Computation for Automatic Speech Recognition #语音识别 #低资源 #模型压缩 8/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8/10 | 前50% | #语音识别 | #模型压缩 | #低资源 | arxiv 👥 作者与机构 作者:Benedikt Hilmes, Nick Rossenbach, Ralf Schlüter 机构:RWTH Aachen University 机器学习与人类语言技术组, Apptek GmbH (德国亚琛) 💡 毒舌点评 这篇论文精准地切入了一个“硬件-算法协同设计”的细分痛点:在忆阻器这种新兴模拟计算硬件上,一个原本能提升性能的常规组件(相对位置编码)反而成了性能毒药。文章的价值在于揭示了这种“水土不服”的现象并给出了工程上的补救方案。然而,作为一篇投向顶会的论文,其贡献的“宽度”和“深度”略显不足。它更像一份扎实的硬件部署问题诊断报告,而非一篇提出全新算法或深刻理论洞察的论文。问题本身有趣,但解决方案(调整ADC位数、移除线性层)相对直接,缺乏令人眼前一亮的创新。此外,结论中“∼50%”和“∼30%”的表述需要更精确的定义和基准,否则容易产生误导。 ...

2026-06-12 · 更新于 2026-08-14 · 2 min · 385 words

PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue

📄 PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue #语音合成 #语音识别 8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8.1/10 | 前25% | #语音合成 | #语音识别 | arxiv 👥 作者与机构 Wen Zhang, Xiaocui Yang, Zhuoyue Gao, Daling Shi, Yifei Feng, Daling Wang, Yifei Zhang。隶属于东北大学计算机科学与工程学院。 💡 毒舌点评 这篇工作试图用多智能体框架解决共情语音对话这个“老大难”问题,方向是好的。但就像一个组装精良却忘了拧紧螺丝的机器,理论框架看起来挺完整,可细节经不起推敲。那个拍脑袋定权重的“确定性分数”,简直是对“科学计算”四个字的侮辱。实验倒是把所有能拿的指标都拿上了,但缺少最硬核的声学评估,就像评价一个歌手只看他写了多少词,却从不听他唱得怎么样。最要命的是,声称“可解释”,但各模块间的“协调”机制描述得像黑话,这“多智能体”的协作到底有多智能,恐怕连作者自己都说不清。 📌 核心摘要 本文提出PRISM,一个用于共情语音对话的多智能体框架。该框架将语音感知、对话管理和语音合成分解为专门模块(Perceiver, Manager, Responder, Vocalizer),并通过引入“韵律到语言”转换机制,将低级声学线索转化为LLM可处理的文本描述,从而增强共情推理的可控性与稳定性。此外,框架支持按需调用外部知识工具。在AvaMERG数据集上的实验表明,PRISM在多个自动指标和人工评估上优于多种基线模型。 ...

2026-06-12 · 更新于 2026-08-14 · 3 min · 506 words

Evaluating Bias in Phoneme-Based Automatic Speech Recognition Systems: An Analysis of IPA Transcription Models

📄 Evaluating Bias in Phoneme-Based Automatic Speech Recognition Systems: An Analysis of IPA Transcription Models #语音识别 #多语言 #低资源 8.8/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 0.7/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8.8/10 | 前50% | #语音识别 | #多语言 | #低资源 | arxiv 👥 作者与机构 Catherine Bao, Maneesha Rani Saha, Neal Patwari, 均来自University of Utah。 💡 毒舌点评 这篇论文选题重要,直击IPA-ASR系统在多语言与人口统计公平性评估的空白,其提出的Soft PER指标在概念上具有启发性。然而,论文的“软肋”在于其核心评估框架建立在一个无法回避的“软肋”之上:依赖G2P生成的、未经专家验证的IPA作为“标准答案”。这使得所有性能差异的解读都笼罩在“标注噪声”和“标准化偏见”的阴影下,大大削弱了结论的确定性。Soft PER本身虽试图缓解此问题,但其设计(特别是英语优先的映射)也可能引入新的偏差。模型评估部分清晰,但结论中关于“无系统性性别差异”和“特定口音/族裔差异”的断言,受限于数据集规模和异质性,显得有些武断。整体而言,是一篇扎实但受方法论约束的初步探索,距离“揭示偏差根源”还有相当距离。 ...

2026-06-11 · 更新于 2026-08-14 · 2 min · 329 words