研究条目

Evidence Subspace Projection: Measuring How Much Evidence Explains Deepfake Detection in Self-Supervised Speech Models

📄 Evidence Subspace Projection: Measuring How Much Evidence Explains Deepfake Detection in Self-Supervised Speech Models 标签:#语音伪造检测 #自监督学习 #模型评估 #音频理解 #Transformer 8.1/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音伪造检测 | #自监督学习 | #模型评估 #音频理解 | arxiv 👥 作者与机构 第一作者:Yixuan Xiao(University of Stuttgart, Germany, Institute for Natural Language Processing (IMS)) 通讯作者:未说明 作者列表:Yixuan Xiao(University of Stuttgart, IMS, Germany),Cheng-Wei Lin(National Institute of Informatics, Japan),Xin Wang(German Research Center for Artificial Intelligence (DFKI), Germany),Yassine El Kheir(Technical University of Berlin, Germany),Arnab Das(German Research Center for Artificial Intelligence (DFKI), Germany),Tim Polzehl(German Research Center for Artificial Intelligence (DFKI), Germany),Sebastian Möller(Technical University of Berlin, Germany),Ngoc Thang Vu(University of Stuttgart, IMS, Germany) 💡 毒舌点评 论文的亮点在于将深伪检测的“决策依据”从黑盒特征空间提升到了可解释的神经元激活空间,提供了一种新颖且量化的分析视角,对理解模型泛化失败的原因有直接启发。主要短板在于方法的工程实践价值有限,它更像一个强大的诊断工具,而非一个可以直接提升检测性能的系统;同时,核心实验集中于XLSR和HuBERT,对更广泛的SSL模型家族的覆盖不足,结论的普适性有待进一步验证。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 358 字 阅读 →
研究条目

GigaAM Multilingual: Foundation Model for Underrepresented Languages

📄 GigaAM Multilingual: Foundation Model for Underrepresented Languages 标签:#语音识别 #自监督学习 #多语言 #低资源 #语音大模型 8.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.5/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 🔥 8.1/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音识别 | #自监督学习 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Andrei Kuzmenko 通讯作者:未说明(但提供了统一联系邮箱) 作者列表:Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin (均来自 SaluteDevices, Russia) 💡 毒舌点评 本文是一个扎实且完整的系统技术报告,通过精心设计的聚类级预训练加权和领域感知微调采样策略,在哈萨克语、吉尔吉斯语等中亚低资源语言ASR上取得了显著性能提升,工程落地价值突出。然而,核心方法(聚类权重、领域感知采样)本质上属于针对数据问题的成熟工程技巧组合与调优,缺乏范式级别的理论或架构创新;同时,关键实现细节(如聚类算法、具体权重阈值)的描述不够透明,影响了方法的可复现性和深度分析。此外,虽然承诺开源,但链接未在论文中提供指向可用仓库,对社区即时复现构成了障碍。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 533 字 阅读 →
研究条目

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

📄 Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors 标签:#音视频生成 #Transformer #生成模型 #自监督学习 #音频理解 6.8/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #Transformer | #生成模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Zikai Huang (South China University of Technology, School of Computer Science and Engineering) 通讯作者:Shengfeng He (Singapore Management University, School of Computing and Information Systems) 作者列表:Zikai Huang (South China University of Technology, School of Computer Science and Engineering), Siyue Chen (South China University of Technology, School of Design), Xuemiao Xu (South China University of Technology, School of Computer Science and Engineering; Guangdong Engineering Center for Large Model and GenAI Technology; State Key Laboratory of Subtropical Building and Urban Science; Ministry of Education Key Laboratory of Big Data and Intelligent Robot), Haoxin Yang (South China University of Technology, School of Computer Science and Engineering), Cheng Xu (Singapore Management University, School of Computing and Information Systems), Yihong Lin (South China University of Technology, School of Computer Science and Engineering), Shengfeng He (Singapore Management University, School of Computing and Information Systems) 💡 毒舌点评 这篇论文在解决音频驱动对话头像运动的“信号纠缠”问题上提出了一个相当清晰且有效的范式,通过分离预训练运动先验和交互调制,避免了从头学习端到端模型的复杂性和数据依赖,其核心思想和模块设计(如跨注意力交互预测)具有启发性。然而,其主要评估仅限于单一数据集(DualTalk),且模型对预训练独白模型质量的依赖程度未被充分讨论,这使得其声称的“模型无关性”和“可扩展性”缺乏更广泛的实证支撑。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 390 字 阅读 →
研究条目

Listen to the Features: Voice Anonymization Driven by Content Embedding Matching over Signal Reconstruction

📄 Listen to the Features: Voice Anonymization Driven by Content Embedding Matching over Signal Reconstruction 标签:#自监督学习 #语音克隆 #说话人验证 #语音识别 #音频理解 6.5/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.4/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音克隆 | #自监督学习 | #说话人验证 #语音识别 | arxiv 👥 作者与机构 第一作者:Adrien Schneider(Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG) 通讯作者:未说明 作者列表:Adrien Schneider(Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG)、Kacper Zabkowski(Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG)、Anderson Augusma(Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG)、Frédérique Letué(Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK)、Maria Camila Pinzon(Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG)、Dominique Vaufreydaz(Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG) 💡 毒舌点评 一个“反直觉”的实验:抛弃了音频信号处理的基石——波形重建,转而追求在特征空间的“遥感对齐”,在ASR上取得了惊人的低WER。这证明了“为机器听”的匿名化路径在技术上可行,具有启发性。然而,其代价是生成的音频沦为“可懂度尚存的机器人噪音”(MOS 1.63),且匿名化强度在当前评估体系下仅属最低档(EER 13-24%)。更戏剧性的是,论文试图引入的匿名化监督(梯度反转)直接导致了系统的灾难性崩溃,揭示了特征纠缠下简单对抗策略的脆弱性。这篇论文更像是一个概念验证:它打开了新思路,但也用自身的失败,赤裸裸地展示了该思路通往实用道路上的巨大鸿沟。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 568 字 阅读 →
研究条目

Local Multimodal Music Alignment from Global Supervision

📄 Local Multimodal Music Alignment from Global Supervision 标签:#对比学习 #多模态模型 #自监督学习 #音频理解 #Transformer 7.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #对比学习 | #Transformer | #多模态模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Irmak Bukey(论文中未明确标注第一作者,但作者列表首位为Irmak Bukey) 通讯作者:未说明 作者列表:Irmak Bukey(未说明)、Zachary Novack(未说明)、Jongmin Jung(未说明)、Dasaem Jeong(未说明)、Chris Donahue(未说明) 💡 毒舌点评 论文提出了一个巧妙的“先融合后池化”框架,用Sinkhorn软对齐作为归纳偏置,成功地从全局成对监督中“挤”出了显著的局部对齐能力,这对于缺乏精细标注的音乐模态对齐任务是一个有价值的贡献。然而,其核心创新(Sinkhorn、对比学习、预训练编码器)均为已知技术的组合,创新性体现在具体问题域的应用上。实验严重依赖合成数据(MusicXML渲染的乐谱和MIDI生成的音频),与真实世界存在巨大领域鸿沟,这使得其宣称的降低标注成本的优势在真实场景中存疑。实验基线设置不够充分,缺乏与更多利用局部特征或注意力机制的对比学习方法(即使是弱监督版本)的直接比较,使得其相对现有技术的贡献边界模糊。 📌 核心摘要 要解决的问题:在多模态音乐理解中,需要理解音频时间与乐谱图像像素之间的局部对应关系。然而,获取这种精细的局部监督(对齐标注)成本高昂,而仅有粗粒度的全局监督(如成对的音频-乐谱片段)相对易得。本文旨在探索能否仅从全局监督中学习到局部对齐。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 618 字 阅读 →
研究条目

MeloBottleneck: Self-Supervised Melody Skeleton Extraction with a Latent Subsequence Bottleneck

📄 MeloBottleneck: Self-Supervised Melody Skeleton Extraction with a Latent Subsequence Bottleneck 标签:#音乐理解 #自监督学习 #音乐检索 #Transformer #零样本 7.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.7/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #自监督学习 | #音乐检索 #Transformer | arxiv 👥 作者与机构 第一作者:Fan Bu 通讯作者:未说明 作者列表:Fan Bu, Rongfeng Li, Linfeng Fan 机构信息:未说明 💡 毒舌点评 论文将旋律骨架提取问题重新定义为可学习的、长度可控的潜在子序列瓶颈,视角新颖,组合技术(自监督、先验、不变性学习)设计合理。然而,方法核心自监督信号严重依赖程序化装饰器生成的训练视图,且评估完全缺失对提取骨架音乐质量(如可听性、连贯性)的独立验证。这使得其从“有用的表征”到“可靠的音乐工具”的论证存在明显缺口,更像是为特定任务设计的编码技巧,而非一个真正理解音乐结构的模型。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 606 字 阅读 →
研究条目

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

📄 Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment 标签:#语音合成 #自监督学习 #语音克隆 #音视频生成 #音频理解 5.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.4/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 5.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #自监督学习 | #语音克隆 #音视频生成 | arxiv 👥 作者与机构 第一作者:Sheng Li(未说明) 通讯作者:未说明 作者列表:Sheng Li(未说明)、Takahiro Shinozaki(未说明) 💡 毒舌点评 论文提出了一个颇具雄心的设想:用物理可解释的3D发声道模型为高保真神经音频“配音”。其载体-物理模型分离架构以及用JEPA进行运动对齐的思路有新意。然而,论文最致命的弱点在于其评估的极度“迷你化”:仅用24个单词的诊断集和自动指标来宣称一个完整系统的有效性,这远未达到顶会系统论文的证据门槛。这使得一个有潜力的工程原型,更像是一个未完成的、缺乏说服力的概念验证。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 374 字 阅读 →
研究条目

Phone Segmentation and Recognition through Phonological Activation Mapping

📄 Phone Segmentation and Recognition through Phonological Activation Mapping 标签:#语音识别 #自监督学习 #多语言 #低资源 #音频理解 7.7/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #自监督学习 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Shikhar Bharadwaj (Carnegie Mellon University, University of Tokyo) 通讯作者:未说明 作者列表:Shikhar Bharadwaj (Carnegie Mellon University, University of Tokyo), Kwanghee Choi (Adobe Research), Stephen McIntosh (University of Tokyo), Chin-Jou Li (Carnegie Mellon University), Eunjung Yeo (Adobe Research), Daisuke Saito (University of Tokyo), Nobuaki Minematsu (University of Tokyo), Shinji Watanabe (Carnegie Mellon University), Jian Zhu (University of Alberta), David Harwath (Adobe Research), David R. Mortensen (Carnegie Mellon University)。作者根据上标数字有明确的机构关联:1=共同贡献,2=Adobe Research,3=University of Tokyo,4=Carnegie Mellon University,5=University of Alberta。 💡 毒舌点评 亮点在于将音素切分与识别这两个传统分离的任务优雅地统一在“音韵激活映射”这一中间表示下,并通过完全无梯度的轻量头实现,这在理论上很优雅,在低资源场景下潜力巨大,为S3M的细粒度分析提供了新范式。短板也同样明显:识别性能在有监督场景下与专用模型差距显著,当前的分割质量(尤其是R值在域内的表现)是识别的主要瓶颈;“无梯度”设计虽然高效,但可能也限制了通过端到端微调进一步逼近性能上限的能力。整体上,这是一项非常扎实、有洞察力的工作,但尚未达到能颠覆现有范式的程度。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 677 字 阅读 →
研究条目

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

📄 A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration 标签:#音频事件检测 #自监督学习 #Transformer #低资源 #音频理解 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.3/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音频事件检测 | #自监督学习 | #Transformer #低资源 | arxiv 👥 作者与机构 第一作者:Pierre-Yves Raumer (Laboratoire de Géologie, Ecole Normale Supérieure/CNRS UMR 8538, PSL Research University, Paris 75005, France; Université de Brest, CNRS, Ifremer, UMR6538 Geo-Ocean, 29280 Plouzané, France; Lab-STICC – UMR 6285 CNRS, ENSTA IP Paris, Brest, France) 通讯作者:Pierre-Yves Raumer (同上,邮箱为论文唯一指定的联系邮箱) 作者列表:Pierre-Yves Raumer (Laboratoire de Géologie, Ecole Normale Supérieure/CNRS UMR 8538; Université de Brest, CNRS, Ifremer, UMR6538 Geo-Ocean; Lab-STICC – UMR 6285 CNRS, ENSTA IP Paris), Axel Marmoret (IMT Atlantique, Lab-STICC, UMR 6285 CNRS, Brest, France), Dorian Cazau (Lab-STICC – UMR 6285 CNRS, ENSTA IP Paris, Brest, France), Anatole Gros-Martial (Centre d’Etudes Biologiques de Chizé (CEBC), UMR 7372, CNRS-La Rochelle Université, Villiers-en-Bois, France), Richard Dreo (Université de Paris, Institut de physique du globe de Paris, CNRS; SAS Boksound), Maëlle Torterotot (Lab-STICC – UMR 6285 CNRS, ENSTA IP Paris, Brest, France), Sara Bazin (Université de Brest, CNRS, Ifremer, UMR6538 Geo-Ocean, IUEM, 29280 Plouzané, France), Flore Samaran (Lab-STICC – UMR 6285 CNRS, ENSTA IP Paris, Brest, France), Jean-Yves Royer (Université de Brest, CNRS, Ifremer, UMR6538 Geo-Ocean, 29280 Plouzané, France) 💡 毒舌点评 本文为低频水下声学数据提供了一个端到端、工程导向的探索流水线,其核心价值在于将自监督MAE表征学习与轻量化的事件级聚类相结合,旨在以最小的人工事后检查(声称约1小时)实现对海量未标注数据的快速模式发现。方法描述清晰,实验验证(作为分类器)显示其能达到可比或优于两个专门设计的监督/无监督基线。然而,作为一篇面向NeurIPS/ICML/ICLR的投稿,其技术贡献的“新颖性”和“深度”存在明显天花板:核心事件提取算法(基于切比雪夫距离的相邻patch合并)过于简单,对于形态复杂或部分重叠的声学事件缺乏精细解纠缠能力;聚类质量的最终评估(映射到15个语义类别)严重依赖单人快速视觉检查,缺乏客观、定量的聚类内部评估(如轮廓系数)或更严谨的人工验证,这使得其“成功”的结论显得主观且脆弱。整个流水线更像一个优秀的领域应用系统报告,而非能推动表征学习或聚类方法学本身发展的算法创新。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 592 字 阅读 →
研究条目

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

📄 A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration 标签:#音频事件检测 #自监督学习 #Transformer #低资源 8.1/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频事件检测 | #自监督学习 | #Transformer #低资源 | arxiv 👥 作者与机构 第一作者:Pierre-Yves Raumer (Laboratoire de Géologie, Ecole Normale Supérieure/CNRS UMR 8538, PSL Research University, Paris; Université de Brest, CNRS, Ifremer, UMR6538 Geo-Ocean; Lab-STICC – UMR 6285 CNRS, ENSTA IP Paris) 通讯作者:Pierre-Yves Raumer (论文中明确邮箱为pierre-yves.raumer@gmail.com,通常通讯作者为邮箱对应者) 作者列表:Pierre-Yves Raumer (Laboratoire de Géologie, ENS/CNRS; Univ. Brest/CNRS/Ifremer; Lab-STICC/CNRS/ENSTA), Axel Marmoret (IMT Atlantique, Lab-STICC), Dorian Cazau (Lab-STICC/CNRS/ENSTA), Anatole Gros-Martial (Centre d’Etudes Biologiques de Chizé (CEBC), CNRS-La Rochelle Université), Richard Dreo (Université de Paris, Institut de physique du globe de Paris, CNRS; SAS Boksound), Maëlle Torterotot (Lab-STICC/CNRS/ENSTA), Sara Bazin (Univ. Brest/CNRS/Ifremer), Flore Samaran (Lab-STICC/CNRS/ENSTA), Jean-Yves Royer (Univ. Brest/CNRS/Ifremer) 💡 毒舌点评 本文提出了一个将视觉MAE移植到水声频谱图,并创新性地设计事件级提取流水线的框架,解决了信号重叠的实际痛点,工程落地性强,开源代码和模型。然而,其根本性的评估方法论缺陷严重削弱了结论的说服力:将无监督聚类强制映射到有监督分类任务,并以F1分数作为核心比较依据,这混淆了两种范式,使得定量比较的有效性存疑。技术细节上,部分启发式设计缺乏理论支撑,且影响力局限于非常专门的低频水声领域,难以触及更广泛的音频社区。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 381 字 阅读 →
研究条目

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

📄 Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors 标签:#Transformer #多模态模型 #医疗音频 #可解释性 #自监督学习 5.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 📝 5.3/10 | 后50% | 文档类型:应用研究 | 评分置信度:高 | #多模态模型 | #Transformer | #医疗音频 #可解释性 | arxiv 👥 作者与机构 第一作者:Vladimir Despotovic (Bioinformatics & AI, Department of Medical Informatics, Luxembourg Institute of Health) 通讯作者:Guy Fagherazzi (Deep Digital Phenotyping, Department of Precision Health, Luxembourg Institute of Health) 作者列表:Vladimir Despotovic (Bioinformatics & AI, Department of Medical Informatics, Luxembourg Institute of Health)、Milena Despotovic (Translational Medicine Operations Hub, Luxembourg Institute of Health)、Abir Elbeji (Multi-Omics Data Science, Department of Cancer Research, Luxembourg Institute of Health)、Petr V. Nazarov (Multi-Omics Data Science, Department of Cancer Research, Luxembourg Institute of Health)、Guy Fagherazzi (Deep Digital Phenotyping, Department of Precision Health, Luxembourg Institute of Health) 💡 毒舌点评 论文的亮点在于其临床导向的问题定义和对可解释性的探索,特别是通过分析门控权重与症状严重度的相关性,为模型的决策逻辑提供了一层临床意义。然而,其核心短板在于整体创新性不足,更像是一个针对特定临床问题的有效工程应用,而非方法论突破。作者声称其贡献之一是引入MoE架构于临床多模态数据,但这在通用临床预测领域已有先例,论文未能与之充分区分。最关键的是,在强调“可扩展筛查”的同时,其核心代码、模型和数据均未开源,这严重削弱了其学术贡献的可复用性和实际影响力,使得整篇工作停留在了概念验证阶段。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 844 字 阅读 →
研究条目

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

📄 Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors 标签:#语音属性识别 #多模态模型 #可解释性 #基准测试 #医疗音频 #自监督学习 5.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音属性识别 | #模型融合 | #多模态模型 #可解释性 | arxiv 👥 作者与机构 第一作者:Vladimir Despotovic (Luxembourg Institute of Health, Bioinformatics & AI, Department of Medical Informatics) 通讯作者:论文中未明确说明 作者列表:Vladimir Despotovic (Luxembourg Institute of Health), Milena Despotovic (Luxembourg Institute of Health), Abir Elbeji (Luxembourg Institute of Health), Petr V. Nazarov (Luxembourg Institute of Health), Guy Fagherazzi (Luxembourg Institute of Health) 💡 毒舌点评 这篇论文的亮点在于将成熟的多模态Mixture-of-Experts架构系统性地应用于语音生物标志物,并结合了两种互补的语音任务和丰富的临床数据,且对门控机制的解释性分析做得相对扎实。主要短板在于整个工作的创新性高度依赖于MoE框架的工程化应用而非方法本身,且核心贡献——数据集和模型完全未开源,严重限制了其影响力和可复现性,使其更像一份详尽的可行性报告而非突破性研究。此外,其声称的“首次”应用值得推敲,因为MoE在其他临床多模态数据中已有探索。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 695 字 阅读 →
研究条目

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

📄 PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction 标签:#语音分离 #多任务学习 #数据集 #自监督学习 #音频理解 8.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.5/1.5 🔥 8.0/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音分离 | #多任务学习 | #数据集 #自监督学习 | arxiv 👥 作者与机构 第一作者:Wanyi Ning(机构未在作者列表注明,但摘要脚注显示为1,2) 通讯作者:未明确说明 作者列表:Wanyi Ning(机构1,2), Wei Zhou(机构1), Yingpeng Li(机构1), Yinshang Guo(机构3), Haitao Qian(机构1), Yiming Cheng(机构1) 💡 毒舌点评 本文直击了目标说话人提取(TSE)模型在真实场景中“无干净语音可训”的核心痛点,通过构建首个大规模真实数据训练集REAL-PS4并提出多维度代理监督联合训练策略,在REAL-T挑战赛中取得了令人信服的第二名及多项最佳子指标。其方法论具备完整的工程链条和明确的实用价值。主要短板在于:实验部分对四个核心损失函数的有效性缺乏消融验证,使得其“联合优化”的贡献度停留在黑箱层面;关键的训练超参数(如损失权重、优化器)描述缺失,严重削弱了其可复现性;部分技术细节(如VAD损失的能量特征计算)描述模糊。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 375 字 阅读 →
研究条目

Why Do You Say It Like That? A Phoneme-Level Framework for Explainable Speech Deepfake Detection

📄 Why Do You Say It Like That? A Phoneme-Level Framework for Explainable Speech Deepfake Detection 标签:#语音伪造检测 #可解释性 #自监督学习 #CNN #音频理解 6.5/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音伪造检测 | #自监督学习 | #可解释性 #CNN | arxiv 👥 作者与机构 第一作者:Anna Taylor 机构:EURECOM 通讯作者:未说明 作者列表:Anna Taylor, Michele Panariello, Massimiliano Todisco, Chiara Galdi, Nicholas Evans, Driss Matrouf (均来自 EURECOM) 💡 毒舌点评 亮点在于成功地将计算机视觉中成熟的Grad-CAM方法与语音处理中的强制对齐相结合,构建了一个完整的、具有语言学意义的可解释性分析管道,并进行了大规模的统计分析,揭示了攻击和说话人依赖的显著效应,为理解黑盒检测器的决策逻辑提供了新视角。主要短板是整个研究是分析性的,没有提出任何旨在提升检测性能的新模型或训练方法,其价值完全取决于分析本身的新颖性和洞察力;且核心框架并未开源,限制了其直接复用和扩展;同时,缺乏将分析洞察转化为改进检测器的闭环验证。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 354 字 阅读 →
研究条目

Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning

📄 Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning #语音交互 #多模态模型 #自监督学习 #低资源 8.2/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | #语音交互 | #强化学习 | #多模态模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Yuxin Li(Nanyang Technological University) 通讯作者:未说明 作者列表:Yuxin Li(Nanyang Technological University)、Donghang Wu(Nanyang Technological University)、Guan-Ting Lin(National Taiwan University)、Hung-yi Lee(National Taiwan University)、Chengwei Qin(The Hong Kong University of Science and Technology)、Zhehuai Chen(NVIDIA)、Chen Chen(NVIDIA) 💡 毒舌点评 该工作聪明地将全双工对话中“何时说话”与“说什么”解耦,用精心设计的局部窗口采样和因子化奖励把发声时机变成一个独立的 RL 优化目标,既保住了指令跟随能力又把交互指标拉满。但奖励函数的八个超参数和繁杂的惩罚项像是精心调制的独门秘方,其跨语言、跨风格的泛化性未经验证,且代码与模型均未开源,让社区难以深入复现和改进。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 834 字 阅读 →
研究条目

Transformer-based segmentation of prosodic boundaries in Brazilian Portuguese

📄 Transformer-based segmentation of prosodic boundaries in Brazilian Portuguese #语音识别 #低资源 #自监督学习 4/10 | 创新 0.3/2 | 严谨 0.6/1.5 | 实验 0.5/1.5 | 清晰 0.6/1 | 影响 0.3/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 📝 4/10 | 后50% | #语音识别 | #迁移学习 | #低资源 #自监督学习 | arxiv 👥 作者与机构 第一作者:Rodrigo de Freitas Lima(论文中未提供机构信息) 通讯作者:未说明 作者列表:Rodrigo de Freitas Lima(未说明)、Julio Cesar Galdino(未说明)、Marcos Vinicius Treviso(未说明) 💡 毒舌点评 论文试图把巴西葡萄牙语韵律边界分割包装成独立贡献,但本质上只是将英语PSST!框架的“转录+边界标记”策略照搬到小语种,外加几个音频滤波器做消遣性实验。工程实现完整、写作通顺,但学术增量几乎为零:无方法创新、无与传统方法的量化对比、滤波器效果在统计噪声级别。更致命的是,论文自我定位不清——既不提供可部署的系统,又不做深入的语言学分析,卡在技术报告和学术论文之间,两头不讨好。放在顶会语境下,更像一篇硕士论文的中间产物,距离NeurIPS/ICML/ICLR的录用标准差距显著。 📌 核心摘要 本文面向巴西葡萄牙语(BP)语音中的终端韵律边界自动分割任务,提出SAMPA模型。方法直接沿用英语任务中的PSST!框架,将韵律边界预测转化为在ASR转录文本中插入特殊分隔符 !!!!! 的序列到序列任务,通过微调Whisper large-v3实现端到端学习。实验在NURC-SP Minimal Corpus和CATNA-MT合并数据集(共约31小时,训练/验证28h44m,测试2h58m)和域外MuPe-Diversidades数据集(2.5小时)上进行,探索了五种训练滤波配置(无滤波、LP 3200 Hz、HP 400 Hz、HP 600 Hz、数据增强)和多种测试时滤波策略。最佳模型在域内测试集上获得 \(F_1=0.731\)(二分类),域外数据集上获得 \(F_1=0.796\)(二分类)。此外,通过n-gram分析和Praat声学可视化定性展示了模型利用了形态句法、语义和韵律线索,并分析了假阳性案例。主要局限包括:方法完全缺乏创新性;未与任何已有的BP韵律分割方法(规则法、LDA、随机森林等)进行直接量化比较;模型仅标注终端边界而非完整韵律层级;滤波器实验效果微小(\(\lt 0.3\) 百分点),其实际意义存疑。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 410 字 阅读 →
研究条目

From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition

📄 From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition #语音识别 #迁移学习 #自监督学习 #低资源 #多语言 6.6/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.6/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.6/10 | 前50% | #语音识别 | #迁移学习 | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Lukmal Ilyas(未说明机构) 通讯作者:未明确说明 作者列表:Lukmal Ilyas(未说明机构)、Nevidu Jayatilleke(未说明机构) 💡 毒舌点评 亮点是系统性地对比了五种迁移范式并发现语言ID令牌在低资源双语场景下的反直觉损害,同时用土耳其语控制实验干净地剥离了语言相关性效应;短板则在于全篇无多次重复实验与统计检验,部分架构不一致(XLS‑R与Wav2Vec2‑BERT混用)且未做音素级错误分析,使“最佳策略”的可靠性打了折扣,而且KenLM带来的绝对增益远超任何迁移策略,显得迁移学习本身收益甚微。 📌 核心摘要 问题:低资源语言Dhivehi缺乏足够语音数据,本文研究利用语言亲缘关系较近且资源较多的Sinhala进行跨语言迁移,提升Dhivehi语音识别性能。 方法核心:以Wav2Vec/XLS‑R预训练编码器为基础,比较五种迁移范式——仅Dhivehi微调、顺序微调(先Sinhala后Dhivehi)、多语言联合微调(含/不含语言ID令牌)、继续预训练(在Sinhala音频上继续自监督学习后微调Dhivehi)以及土耳其语无关语言控制实验;解码端统一采用5‑gram KenLM浅融合与CTC束搜索。 新意:首次在Sinhala→Dhivehi方向上进行受控跨语言迁移研究,揭示语言ID令牌在低资源双语条件下可能有害,并通过无关语言控制实验验证了语言亲缘关系对迁移的贡献。 主要实验:在Common Voice Dhivehi验证集上,最佳系统(继续预训练+KenLM)达12.89% WER、2.70% CER,优于Dhivehi‑only基线(13.50% WER / 3.02% CER)。KenLM解码平均降低约27个WER百分点。多语言微调不含语言ID令牌(13.26% WER)优于含令牌(18.46% WER)。土耳其控制实验(13.77% WER)劣于Sinhala多语言微调,验证了语言亲缘性的作用。具体结果见表。 配置 LM WER(%) CER(%) Dhivehi only ✓ 13.50 3.02 Dhivehi only ✕ 41.27 6.19 Sequential (Si→Dv) ✓ 15.15 3.48 Sequential (Si→Dv) ✕ 43.55 6.69 Multi 60h Si + LID ✓ 18.46 3.72 Multi 60h Si + LID ✕ 42.29 6.40 Multi 60h Si, no LID ✓ 13.26 3.08 Multi 60h Si, no LID ✕ 42.09 6.30 Multi 30h Si, no LID ✓ 13.34 3.04 Multi 30h Si, no LID ✕ 41.94 6.33 Cont. pretrain Si→Dv ✓ 12.89 2.70 Cont. pretrain Si→Dv ✕ 40.54 5.95 Turkish ctrl, no LID ✓ 13.77 3.24 Turkish ctrl, no LID ✕ 43.02 6.60 实际意义:为极度低资源语音识别提供了可复用的迁移学习框架与解码策略经验,明确指出外部语言模型的重要性不亚于迁移策略本身,对类似小众语言对的技术落地有直接参考价值。 主要局限:仅进行单次运行无统计检验,继续预训练采用不同架构(XLS‑R)导致与其他实验可比性不足,缺乏音素级错误分析,解码超参数调优有限,且评估局限于单一测试集。 🔗 开源详情 代码:https://github.com/lukmalilyas/From-Sinhala-to-Dhivehi-ASR 模型权重:论文中未提及提供,代码仓库中未确认包含 数据集: Sinhala:OpenSLR SLR52,https://www.openslr.org/52/ Dhivehi:Mozilla Common Voice版本24.0 Dhivehi子集,https://commonvoice.mozilla.org/ Turkish:Mozilla Common Voice版本22.0土耳其语子集,https://commonvoice.mozilla.org/ Demo:论文中未提及 复现材料:提供实验脚本地址,并声称覆盖17个实验运行、5种迁移范式的全部组合。脚本中应包含论文所述的主要超参数设置,但缺少预训练模型、KenLM文件及详细环境配置,离一键复现仍有距离。 🏗️ 方法概述和架构 整体流程:输入原始16kHz单声道音频,经Wav2Vec/XLS‑R系列自监督编码器提取上下文语音表征;表征通过一个线性层映射到字符级标签空间,用CTC损失进行监督训练;推理阶段,CTC输出的声学得分与外部5‑gram KenLM语言模型得分通过浅融合束搜索进行联合解码,产生最终文本。整个系统是模块化的“自监督编码器 + CTC微调 + LM解码”流水线。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 479 字 阅读 →
研究条目

Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition

📄 Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition #语音识别 #多语言 #低资源 #迁移学习 #参数高效微调 #自监督学习 6.5/10 | 创新 1/2 | 严谨 1.5/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.5/10 | 前50% | #语音识别 | #迁移学习 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Andrei Florian(Princeton University) 通讯作者:Andrei Florian(Princeton University)、Happy Buzaaba(Princeton University) 作者列表:Andrei Florian(Princeton University)、Cynthia Jayne Amol(Maseno University)、Hope Kerubo Ombaba(Maseno University)、Xiaoyu Cui(Princeton University)、Boniface Mwau(Maseno University)、Biatus Maina Kamau(Maseno University)、Lilian Diana Awuor Wanzare(Maseno University)、Christiane Fellbaum(Princeton University)、Happy Buzaaba(Princeton University) 💡 毒舌点评 这是一篇经典的"证伪"论文,作者严谨地证明了在小模型上成立的假设,在大模型上并不成立。六因素受控实验设计堪称方法论范本,但结论的毁灭性力量也扫到了论文自身的价值:如果语言相关性完全没用,那告诉社区此路不通的功劳,能换来多大影响?更致命的是,它只告诉你船漏了,却没给新船。纯负面结果的研究,在顶会博弈中注定处于弱势。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 353 字 阅读 →
研究条目

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

📄 Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion #语音识别 #多任务学习 #多模态模型 #低资源 #自监督学习 5.8/10 | 创新 0.8/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 📝 5.8/10 | 前50% | #语音识别 | #多任务学习 | #多模态模型 #低资源 | arxiv 👥 作者与机构 第一作者:Saurabh Kumar(印度科学理工学院电气工程系) 第二作者:Amartyaveer(印度科学理工学院电气工程系) 第三作者/通讯作者:Prasanta Kumar Ghosh(印度科学理工学院电气工程系,邮箱 prasantag@gmail.com) 💡 毒舌点评 本文用“即插即用”的多模态融合模块将方言信息注入ASR,在印度多语言场景下同时刷了DID和ASR的榜。工程集成思路清晰,结果实用。但本质上仍是Conformer、RoBERTa、bottleneck等成熟组件的精巧重组,对“为什么门控融合有效”缺乏深层机理分析,且仅在单一且受限(朗读语音)的数据集上验证,模型泛化性和理论贡献薄弱。更像是一份优秀的实验报告,而非方法学上的突破。 📌 核心摘要 问题:印度语言方言差异显著,现有联合优化语音识别(ASR)与方言识别(DID)的方法存在跷跷板效应,尤其是将方言ID作为硬性文本前缀的方法,在方言预测错误时会严重损害ASR性能。 方法核心:提出多模态特征融合框架,在Conformer ASR编码器之上,以梯度阻断方式接入一个DID模块。该模块利用瓶颈编码器和RoBERTa编码器分别从语音特征和CTC软对齐输出中提取方言线索,经门控机制动态融合并由注意力编码器精炼,最终将获得的方言嵌入拼回ASR主特征流,以软特征方式增强ASR。 创新点:将方言信息从“文本硬条件”转变为“特征软注入”,通过梯度阻断(detach)策略解耦ASR与DID的优化,避免了错误方言预测带来的ASR退化;设计了语音-文本双模态门控融合,自适应挖掘不同模态的方言信息。 主要结果:在RESPIN数据集八种印度语言的33个方言上,ASR-BN-ROB模型取得了平均81.63%的DID准确率,以及4.65%的CER和17.73%的WER,均优于多个强基线。尤其对于DID预测错误的样本,ASR性能相对基线有显著提升。 实际意义:为低资源、多方言的ASR系统提供了一种有效且相对鲁棒的端到端联合优化方案。代码、模型和数据集均已公开,对印度语言语音应用的开发具有直接参考价值。 主要局限性:仅在单一数据集和一种冻结的预训练模型(IndicWav2Vec)上验证;未深入分析门控融合机制的行为和决策过程;缺乏对跨领域、噪声环境及自发性语音的泛化性评估;模型参数量增加,但未与等参模型进行严格对比;未讨论计算开销和推理延迟。 🔗 开源详情 代码:https://github.com/labspire/respin_did_interspeech25.git 模型权重:https://github.com/labspire/respin_did_interspeech25.git(与代码同一仓库) 数据集:RESPIN 数据集,获取链接:https://spiredatasets.ee.iisc.ac.in/respincorpus Demo:未提及 复现材料:论文在第3.2节提供了详细的超参数和实验设置,代码仓库中理应包含训练配置。 论文中引用的开源项目: ESPnet:https://github.com/espnet/espnet.git IndicWav2Vec:https://github.com/AI4Bharat/IndicWav2Vec 未明确列出 RoBERTa 的具体开源实现链接。 🏗️ 方法概述和架构 本文提出一种多任务学习框架,通过多模态特征融合同时优化自动语音识别(ASR)和方言识别(DID)。系统由ASR Block和DID Block两部分组成,其数据流为:输入语音 → SSL前端(IndicWav2Vec) → Conformer编码器 → ASR Block和DID Block并行处理 → DID Block产出的方言嵌入以梯度阻断方式拼回ASR Block → ASR Block内注意力编码器融合 → 混合CTC/Attention解码器输出文本。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 424 字 阅读 →
研究条目

Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

📄 Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR #语音识别 #参数高效微调 #低资源 #自监督学习 7.5/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | #语音识别 | #Adapter | #参数高效微调 #低资源 | arxiv 👥 作者与机构 第一作者:Ho Lam Chung(台湾大学,华硕) 通讯作者:Hung-yi Lee(台湾大学) 作者列表:Ho Lam Chung(台湾大学,华硕)、Yiming Chen(新加坡国立大学)、Dau-Cheng Lyu(华硕)、Hsiao-Tsung Hung(华硕)、Hung-yi Lee(台湾大学) 💡 毒舌点评 这篇论文将连续潜在测试时缩放巧妙地引入冻结ASR骨干网,稳定注入机制的设计颇具匠心,实验覆盖面广、消融充分,证明了在极小数据量下该方法明显优于传统微调。然而,WER的绝对下降幅度仅有千分之一到百分之一量级,实际收益偏薄,且所有实验都基于同一个0.6B的Qwen3-ASR模型,方法的可推广性尚存疑;此外零代码开源,令审稿人对其复现成本深感担忧。 📌 核心摘要 问题:端到端ASR模型一次前向完成转录,无法对困难输入进行额外的“思考”。本文探究能否在冻结ASR骨干网上添加连续的潜在计算环,实现输入依赖的测试时计算分配。 方法核心:LatentASR引入两个可训练模块——Latent Adapter 和 Value Head。Latent Adapter 通过有界循环更新精炼少量潜在前缀嵌入,并采用三种稳定机制(归一化、门控、固定锚点)防止冻结解码器崩溃;Value Head 预测每个话语的潜在计算效用并提前停止循环。 新颖点:不同于在全部参数上微调或修改输入分布,该方法仅训练约4M参数,保持骨干完全冻结,通过受限的、可选的残差更新在连续空间内进行迭代优化,无需中间推理文本。 主要结果:在500条话语的极小训练集下,LatentASR 是唯一不提升WER的方法,在 FLEURS (en_us) 上相对WER降低2.54% (4.900→4.776),VoxPopuli (en) 降低0.47% (9.038→8.995);口音/语码切换 (ASCEND) 上相对CER降低16.0% (57.81→48.55);在30种语言的多语言评估中WER均匀下降,无过拟合。 实际意义:提供了一种无需修改预训练ASR骨干即可为其注入自适应计算量的方法,可将固定算力转变为按需分配的软调度。 主要局限:干净语音上的绝对提升很小,方法对激活集大小和构成敏感(最优窗口仅500条),未见在更大ASR模型上的验证,零开源降低了即时工业采纳的可能性,且未探讨流式/实时场景的可行性。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及模型权重的发布链接(如 HuggingFace 或 ModelScope) 数据集:训练使用 500 条混合样本,来源于以下公开数据集: Common Voice 16.0 FLEURS VoxPopuli LibriSpeech GigaSpeech The People’s Speech ASCEND 上述数据集均为公开可获取的研究语料,但论文未给出具体下载链接或预处理脚本的仓库地址。 Demo:论文中未提及 复现材料:论文中未提及提供训练配置、检查点或补充附录等专门复现材料;训练细节(优化器、超参数、数据构造原则)在正文第 4.1 节有描述,但未指向独立的配置文件或代码仓库。 论文中引用的开源项目: Whisper (Radford et al.) —— 原始模型为 OpenAI 发布,未提供链接,通常获取方式为 GitHub: https://github.com/openai/whisper OWSM v4 —— 基于 ESPnet 的开源语音模型,通常获取方式为 GitHub: https://github.com/espnet/espnet Qwen3-ASR (0.6B) —— 论文中作为基础模型,技术报告为 arXiv:2601.21337,未给出权重链接;通常可通过 HuggingFace 或 ModelScope 获取 Coconut (Hao et al.) —— 论文 arXiv:2412.06769,未提供项目链接 Quiet-STaR (Zelikman et al.) —— 论文 arXiv:2403.09629,未提供项目链接 Pause tokens (Goyal et al.) —— 论文发表于 ICLR 2024,未提供项目链接 (注:以上仅列出在论文中被直接引用且涉及开源工具/模型的条目,无具体链接指向作者提供的仓库时,给出常见获取渠道;没有提及的项目则写“未提及”) 🏗️ 方法概述和架构 LatentASR 在完全冻结的编码器‑解码器ASR骨干上叠加两个轻量可训练模块:Latent Adapter 和 Value Head。整体流程:给定语音a,编码器输出声学状态Z并传入解码器;在解码器输入的系统提示与需转录的文本之间,插入N个隐式前缀位置(不产生任何文本token)。Latent Adapter 逐个位置对这些隐式嵌入进行迭代精炼,Value Head 监控解码器隐状态,判断是否继续或提前停止循环。若Value Head在起始锚点判定无益,则全跳过N步,直接回退到冻结基线的输出;否则逐步执行,并可在中间任意步停下。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 756 字 阅读 →