SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations

📄 SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations #音频理解 #语音识别 8.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.4/10 | 前25% | #音频理解 | #自监督学习 | #语音识别 | arxiv 👥 作者与机构 第一作者/通讯作者:Xiaoyu Yang(Department of Engineering, University of Cambridge) 作者列表:Xiaoyu Yang(University of Cambridge)、Yifan Yang(Shanghai Jiao Tong University)、Zengrui Jin(Tsinghua University)、Ziyun Cui(Tsinghua University, Shanghai Artificial Intelligence Laboratory)、Wen Wu(Shanghai Artificial Intelligence Laboratory)、Baoxiang Li(Shanghai Artificial Intelligence Laboratory)、Chao Zhang(Tsinghua University, Shanghai Artificial Intelligence Laboratory)、Phil Woodland(University of Cambridge) 💡 毒舌点评 SPEAR 用多码本矢量量化(MVQ)这把快刀,把语音和音频两个域的知识剁成离散 token,再让 Zipformer 用掩码预测全吞下去。思路直接有效,在 SUPERB 和 HEAR 上双线刷榜,token mixing 更是让分离任务表现惊艳。但整个框架的命门在于强依赖教师模型质量,训练 pipeline 重得像个工程怪兽,且音频数据仅 13k 小时,想在纯音乐或环境声上压制音频大模型还差火候。说是统一框架,但目前还是个理解专才,生成任务的门都没摸到。 ...

2026-07-04 · 更新于 2026-08-14 · 5 min · 1028 words

WaveSSM: Multiscale State-Space Models for Non-stationary Signal Attention

📄 WaveSSM: Multiscale State-Space Models for Non-stationary Signal Attention #音频分类 #语音识别 4.8/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 0.5/1.5 📝 4.8/10 | 后50% | #音频分类 | #语音识别 | arxiv 👥 作者与机构 第一作者:Ruben Solozabal (MBZUAI) 通讯作者:Ruben Solozabal (MBZUAI) 作者列表:Ruben Solozabal (MBZUAI)、Velibor Bojkovic (MBZUAI)、Hilal AlQuabeh (MBZUAI / RIKEN AIP)、Klea Ziu (MBZUAI)、Kentaro Inui (MBZUAI / RIKEN AIP)、Martin Takáč (MBZUAI) 💡 毒舌点评 将小波先验注入状态空间模型(SSM),理论上为模型带来了期望的时间和频率局部化能力,在合成任务上的地址able记忆也展示得漂亮。但亮点止步于此:在真实基准上的性能提升微弱到几乎可以归为噪声,而在需要真正长程建模能力的任务(PathX, Pathfinder)上却全面溃败。这种极端的任务偏好性,加上零开源和大量悬而未决的理论-实践差距,使论文看起来更像一个精致的初步探索,而非一项坚实的贡献。 ...

2026-07-04 · 更新于 2026-08-14 · 3 min · 494 words

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation

📄 An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation #语音合成 #语音识别 #多模态模型 6.8/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.5/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ✅ 6.8/10 | 前50% | #语音合成 | #自回归模型 | #语音识别 #多模态模型 | arxiv 👥 作者与机构 第一作者:Haoran Wang(Carnegie Mellon University, Shanghai Jiao Tong University) 通讯作者:未说明 作者列表:Haoran Wang(Carnegie Mellon University, Shanghai Jiao Tong University)、Jinchuan Tian(Carnegie Mellon University)、Siddhant Arora(Carnegie Mellon University)、Shinji Watanabe(Carnegie Mellon University) 💡 毒舌点评 这篇文章为解决语音语言模型的高通量推理痛点提供了一个精巧的工程方案,尤其是 Paired Request Co-Scheduling 对 CFG 开销的消解颇具巧思,不是简单的“拼组件”。然而,实验对比维度过于单薄,仅与原始 PyTorch 串行推理比较,缺乏与 naive CFG 实现或其他推理框架的横向对打,让“80% 吞吐保持”这一核心卖点缺少足够的说服力。更关键的是,全文未提供任何延迟指标,对于实时语音交互场景而言,这几乎是不可接受的遗漏。 ...

2026-07-03 · 更新于 2026-08-14 · 3 min · 626 words

Beyond Words: Towards Effective Modeling of Non-Verbal Vocalizations in ASR

📄 Beyond Words: Towards Effective Modeling of Non-Verbal Vocalizations in ASR #语音识别 6.4/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 ✅ 6.4/10 | 前50% | #语音识别 | #课程学习 | arxiv 👥 作者与机构 第一作者:Gene Yang(Meta) 通讯作者:Haibin Wu(Meta) 作者列表:Gene Yang(Meta)、Haibin Wu(Meta)、Peng Su(Meta)、Ruizhe Huang(Meta)、Suwon Shon(Meta)、Bach Do(Meta)、Minxue Niu(Meta)、Zhaoheng Ni(Meta)、Shang-Wen Li(Meta)、Florian Metze(Meta)、Yossi Adi(Meta)、Ming Sun(Meta)、Yuzong Liu(Meta) 💡 毒舌点评 本文从实际痛点出发,将两阶段课程学习、跨类别声学知识迁移与语音转换增强巧妙组合,在内部数据上显著提升了稀缺非语言发声的检测性能,其“声学支架”的洞察有实用智慧。然而,所有实验基于两个不可公开的内部数据集,无任何代码、模型或数据开源承诺;唯一的系统级外部对比仅为一个Whisper‑D模型,且该比较存在规格不对等——Whisper‑D基于1.55B参数的Whisper‑v2‑large微调,而本文模型仅约200M参数,却未讨论该差异对结论的影响。关键训练超参数、架构细节和训练流程大面积留白,使得方法可复现性与泛化说服力大打折扣。整体而言是一份扎实的工业技术报告,但距顶会论文的开放性和严谨性标准仍有明显距离。 📌 核心摘要 本文旨在解决端到端ASR中稀疏、长尾的非语言发声(如笑声、呼吸、咳嗽、哭泣)检测问题。方法核心包含三个数据为中心的策略:(1)两阶段课程学习:Stage 1将所有NV事件映射为通用token <NV>,利用全部可用NV数据学习非语言声学基座,辅以帧级音素分类损失(所有NV帧统一映射为 SPN 标签);Stage 2恢复细粒度标签,将Stage 1学得的 <NV> 嵌入直接复制初始化各NV token,再用少量类别特定标注进行专精微调;(2)跨类别声学知识迁移:利用高资源NV类别(如 <laugh>、<breath>)与低资源目标(如 <cry>)在呼吸和喉部发声机制上的共享生理声学特征,将大量高资源样本混入目标类别的训练mini‑batch,作为“声学支架”间接强化低资源token的表示学习;(3)类别平衡与语音转换协同:先通过基于类别的上采样(上限2–5倍)均衡训练信号,再使用零样本扩散语音转换Seed‑VC生成最多10倍说话人多样性的增强样本,二者必须配合使用——仅做VC增强而无类别平衡,在极端长尾下几乎无效。 ...

2026-07-03 · 更新于 2026-08-14 · 3 min · 441 words

From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages

📄 From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages #语音识别 #低资源 4.8/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 0/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 📝 4.8/10 | 后50% | #语音识别 | #端到端 | #低资源 | arxiv 👥 作者与机构 第一作者:Jesujoba O. Alabi(萨尔大学/DFG SFB 1102) 通讯作者:未说明 作者列表:Jesujoba O. Alabi(萨尔大学,DFG SFB 1102)、Julian Herreilers(未说明)、Badr M. Abdullah(萨尔大学,DFG SFB 1102)、Dietrich Klakow(萨尔大学) 💡 毒舌点评 在南非语言ASR的蛮荒之地上,这篇工作用Mamba立了一块"省时省显存"的路标,证明了SSM在此地跑得通。但整个研究本质上是一次对ConMamba的"加盟商复制"——把公开的Mamba-ASR配方(SpeechBrain模板)原样搬到七个南非语种上,加上几个教科书式的多语条件化trick,没有触及非洲语言形态复杂、语码混杂等本质痛点。更糟糕的是,全篇零代码、零模型、零数据承诺,连个README都没有,让后续研究者想复现都无从下手。 ...

2026-07-03 · 更新于 2026-08-14 · 3 min · 599 words

H-SAGE: Holistic Speaker-Aware Guided Experts for MoE-based Multi-Talker ASR

📄 H-SAGE: Holistic Speaker-Aware Guided Experts for MoE-based Multi-Talker ASR #语音识别 #多任务学习 #LoRA #语音分离 6.9/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.5/1.5 ✅ 6.9/10 | 前50% | #语音识别 | #多任务学习 | #LoRA #语音分离 | arxiv 👥 作者与机构 第一作者:Yujie Guo(南开大学/NKU-HLT) 通讯作者:Yong Qin(南开大学/NKU-HLT) 作者列表:Yujie Guo(南开大学/NKU-HLT)、Jiaming Zhou(南开大学/NKU-HLT)、Yuhang Jia(南开大学/NKU-HLT)、Yang Chen(南开大学/NKU-HLT)、Yong Qin(南开大学/NKU-HLT) 💡 毒舌点评 论文靠显式重叠监督和整体门控给MoE路由强行灌输“场景认知”,消融实验干净利落,把自注意力全局编码和显式损失的必要性扒得很清楚。但性能提升相当温吞,尤其是重中之重的3-mix场景,OA-WER仅从GLAD的20.0%抠到19.8%,基本属于统计误差级别的进步,且低重叠区被SACTC反超,说明这套“显式建模”的优势极度依赖说话人高度纠缠的特定条件;只在讲卫生的LibriSpeechMix读书腔上跑分,放到真实鸡尾酒会里会不会露怯尚完全未知。 📌 核心摘要 针对多说话人语音识别中MoE路由普遍依赖帧独立投影、仅靠隐性ASR目标学习而导致时序短视和可解释性缺失的问题,本文提出H-SAGE。其核心是用Speaker-Aware Global Encoder(SA-Encoder)建模长程说话人活动状态,并配套Overlap-Aware Loss对帧级的重叠、单说话人、静音/填充三态施加显式交叉熵监督;在此之上设计了Holistic Gating Mechanism,将SA-Encoder跨层共享的全局上下文与当前层的局部特征拼合,学习动态融合权重以平衡全局与局部路由概率。在LibriSpeechMix基准上,H-SAGE在2-mix和3-mix的高重叠子集取得SOTA,并通过消融证实显式监督和整体门控各自均有实质性收益。该工作将MTASR的专家路由从“隐式+局部”打上了“显式+全局”的声学先验补丁,在高重叠场景下提升了鲁棒性。主要局限在于分离增益不够显著(3-mix客观指标近乎持平GLAD),且仅在人工合成、读书风格的LibriSpeechMix单基准上验证,对真实口语音素变化、噪声及跨语言泛化性未作评估。 ...

2026-07-03 · 更新于 2026-08-14 · 2 min · 374 words

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

📄 NAVER LABS Europe Submission to the Instruction-following 2026 Short Track #语音识别 #语音翻译 #参数高效微调 #语音大模型 #低资源 6.2/10 | 创新 0.8/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.3/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 6.2/10 | 前50% | #语音翻译 | #参数高效微调 | #语音识别 #语音大模型 | arxiv 👥 作者与机构 第一作者:Marcely Zanon Boito(NAVER LABS Europe, France) 通讯作者:Marcely Zanon Boito(NAVER LABS Europe, France),邮箱 marcely.zanon-boito@naverlabs.com 作者列表:Marcely Zanon Boito(NAVER LABS Europe, France)、Hemant Yadav(IIIT Delhi, India)、Jean-Luc Meunier(NAVER LABS Europe, France)、Ioan Calapodescu(NAVER LABS Europe, France) 💡 毒舌点评 这篇系统报告本质上是一份竞赛技术报告,工程实现扎实,用更小的模型跑平了去年的SOTA。但学术贡献有限:改进的SpeechMapper不过是损失函数从MSE换成L1再拼上CTC的"四件套",fakACL数据集是标准LLM生成套路的领域特化,毫无方法论创新。ASR和SQA的跷跷板效应只会摊手说"不可兼得",却连个像样的帕累托分析都不做。MCIF一个验证集定生死,过拟合风险完全忽视。只能说竞赛第一,但科研价值嘛,别太当真。 ...

2026-07-03 · 更新于 2026-08-14 · 3 min · 464 words

Spatial Speech Perception Systems: A Survey of Sound Source Localization, Directional Enhancement, and Speech Recognition

📄 Spatial Speech Perception Systems: A Survey of Sound Source Localization, Directional Enhancement, and Speech Recognition #空间音频 #声源定位 #语音增强 #语音识别 4.1/10 | 创新 0.8/2 | 严谨 0.6/1.5 | 实验 0.4/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 0.8/1.5 📝 4.1/10 | 后50% | #声源定位 | #空间音频 | #语音增强 #语音识别 | arxiv 👥 作者与机构 第一作者:Pengyuan Shao(University College London, Department of Computer Science) 通讯作者:未明确说明,根据作者顺序推断为 Dimitrios Kanoulas(University College London, Department of Computer Science) 作者列表:Pengyuan Shao(University College London, Department of Computer Science)、Dimitrios Kanoulas(University College London, Department of Computer Science) 💡 毒舌点评 这篇综述选题有现实意义,试图将空间语音感知系统的三大组件进行统一综述,但在顶会级别看来,其贡献仅停留在文献整理和概念归纳层面。全文没有任何定量元分析、方法对比实验或新基准/工具,不发布数据集也不开源代码。所谓的"系统级评价"、“语义可靠性"等概念始终停留在愿景,缺乏可操作的量化定义或评测方案。对于希望直接拿来评估或改进自己系统的研究者而言,这篇综述提供不了太多硬核见解。 ...

2026-07-03 · 更新于 2026-08-14 · 4 min · 737 words

NPUsper: Eliminating Redundant Computation for Real-Time Whisper on Mobile NPUs

📄 NPUsper: Eliminating Redundant Computation for Real-Time Whisper on Mobile NPUs #语音识别 9/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.3/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 9/10 | 前10% | #语音识别 | #自回归模型 | arxiv 👥 作者与机构 第一作者:Sihyeon Lee(Korea University) 通讯作者:Suman Banerjee(University of Wisconsin–Madison)、Seyeon Kim(Korea University) 作者列表:Sihyeon Lee(Korea University)、Hojeong Lee(University of Wisconsin–Madison)、Sungwon Woo(Korea University)、Chengpo Yan(University of Wisconsin–Madison)、Suman Banerjee(University of Wisconsin–Madison)、Seyeon Kim(Korea University) 💡 毒舌点评 本文用交叉注意力的时序特性来无阈值检测幻觉,一举砍掉了流式Whisper中常年“标配��的低效音频填充,想法干净得让人嫉妒。工程上,面向NPU的受控展开解码也把静态图执行和动态自回归解码的矛盾调和得相当漂亮。但实验验证的骨架太细:主结果就靠两个长音频样本撑着,统计说服力基本没有,难以让人完全信服其在各种声学场景下的稳健性。幻觉检测虽称“无阈值”,但滤波窗口等超参依然需要手动选定,跨模型大小的泛化也只是做了初步验证,多少有点“按下葫芦浮起瓢”的意思。 ...

2026-07-02 · 更新于 2026-08-14 · 3 min · 435 words

Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

📄 Adapting Foundation ASR Models to Dysarthric Speech: A Case Study #语音识别 #自回归模型 #参数高效微调 #数据增强 6.2/10 ✅ 6.2/10 | 前50% | #语音识别 | #参数高效微调 | #自回归模型 #数据增强 | arxiv 👥 作者与机构 作者:Christian Huber, Laura Kernahan, Alexander Waibel 机构:卡尔·斯鲁普工业大学(KIT,德国)及其卡内基-梅隆大学(CMU,美国)的合作项目 💡 毒舌点评 说白了,这是一篇非常扎实的“工程应用报告”,但离顶会的“科研论文”标准还有不小的距离。优点很明显:选题刚需,流程完整,结果感人(从完全不能用到相当可用),还有真实的部署和用户反馈,这比很多只在数据集上刷分的工作要实在得多。但问题是,它的“学术味儿”太淡了。核心方法就是“拿Whisper微调”,这操作放在语音社区甚至不如“在LibriSpeech上微调”来得有新意。实验设计最大硬伤就是“单人验证”,这直接把结论的普遍性打入冷宫——你的LoRA不行、Qwen3-ASR不行,换个人可能就反过来了。分析也浮于表面,比如只说LoRA效果差是因为“失配”,却没动手验证这个猜想(比如调调rank试试?)。最可惜的是,它本可以提炼出一些关于“极端域下全量微调 vs 参数高效微调”的有趣规律,但论文满足于描述现象,没有深入机理。所以,它很好地解决了一个实际问题,但对科学共同体贡献的新知有限。更适合发表在应用类会议或期刊上。 📌 核心摘要 本文针对基础ASR模型在构音障碍语音上性能差的问题,提出了一个端到端的个性化适配与部署方案。核心工作是使用TEQST工具收集了单一说话者约92小时的朗读语音,并通过部署的移动应用收集了8.8小时的纠正数据。以Whisper (whisper-large-v3) 为基础模型,通过全量微调,仅用1.4小时数据就将WER从基线的128.4%降至15.8%,使用全部数据(含纠正)后达到最佳9.7%。作为对比,LoRA参数高效微调方法效果较差(相对下降15%-39%),而另一个基础模型Qwen3-ASR-1.7B在相同设置下的表现也不及Whisper。最终,微调后的模型被部署为iOS移动应用,提供多种录音模式和实时纠正功能,显著改善了用户的生活质量和沟通信心。论文指出,该工作成功证明了全量微调在应对巨大领域偏移时的有效性,并为解决实际无障碍通信问题提供了一个可行路径。 🔗 开源详情 代码:论文中未提及任何代码仓库链接。 模型权重:论文中未提供作者微调后的模型权重下载链接。论文使用了开源的Whisper (whisper-large-v3) 和 Qwen3-ASR-1.7B作为基础模型,但未提供最终的个性化模型。 数据集:论文中提及“The data set can be accessed here”,暗示数据集可通过链接访问,但在提供的论文全文中未显示具体的URL。数据集包含约100.8小时的构音障碍语音(训练集89.8小时,纠正数据8.8小时,开发集和测试集各1.1小时)。 Demo:论文中未提及在线演示链接或移动应用商店链接。 复现材料:论文中未提及具体的训练配置文件、检查点、环境依赖列表或附录等复现材料。 论文中引用的开源项目: TEQST:论文引用为[4],用于数据收集,未提供具体链接。 Whisper:OpenAI的ASR模型,论文引用为[10],未提供具体链接。 Qwen3-ASR:阿里云的ASR模型,论文引用为[11],未提供具体链接。 Faster Whisper:论文引用为[13],用于模型部署,未提供具体链接。 CTranslate2:论文引用为[5, 6],作为Faster Whisper的实现基础,未提供具体链接。 LoRA:论文引用为[3],参数高效微调方法,未提供具体链接。 补充链接(自动提取): ...

2026-07-01 · 更新于 2026-08-14 · 1 min · 209 words