ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

📄 ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era #语音识别 #语音合成 #语音增强 #说话人识别 #语音翻译 #语音分离 #语音编码 #自监督学习 #数据增强 #参数高效微调 #迁移学习 7.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | #语音识别 | #自监督学习 | #语音合成 #语音增强 | arxiv 👥 作者与机构 Masao Someki (Carnegie Mellon University, Pittsburgh, USA) Alexander Polok (Brno University of Technology, Brno, Czechia) Carlos Carvalho (Instituto Superior Técnico, Lisbon, Portugal) Chyi-Jiunn Lin (Hanyang University, Seoul, South Korea) Da-Hee Yang (Hitachi Astemo, Tokyo, Japan) Jiatong Shi (Shanghai Jiao Tong University, Shanghai, China) Jinchuan Tian (Carnegie Mellon University, Pittsburgh, USA) Nelson Enrique Yalta Soplin (Carnegie Mellon University, Pittsburgh, USA) Samuele Cornell (Carnegie Mellon University, Pittsburgh, USA) Siddhant Arora (Carnegie Mellon University, Pittsburgh, USA) Francisco Teixeira (Instituto Superior Técnico, Lisbon, Portugal) Wei Wang (Shanghai Jiao Tong University, Shanghai, China) William Chen (Carnegie Mellon University, Pittsburgh, USA) Alberto Abad (Instituto Superior Técnico, Lisbon, Portugal) Chenda Li (Carnegie Mellon University, Pittsburgh, USA) Shinji Watanabe (Carnegie Mellon University, Pittsburgh, USA) Wangyou Zhang (Shanghai Jiao Tong University, Shanghai, China) ...

2026-06-23 · 更新于 2026-08-14 · 4 min · 698 words

From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection

📄 From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection #语音识别 #大语言模型 7.5/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前50% | #语音识别 | #大语言模型 | arxiv 👥 作者与机构 Jan Jasiński, Mateusz Barański, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk. Signal Processing Group, Institute of Electronics, AGH University of Krakow, Poland. ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 426 words

HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems

📄 HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems #语音识别 #数据集 #基准测试 8.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 🔥 8.4/10 | 前50% | #语音识别 | #数据集 | #基准测试 | arxiv 👥 作者与机构 Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk Signal Processing Group, Institute of Electronics, AGH University of Krakow, Poland ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 425 words

Interleaved Speech Language Models Latently Work In Text

📄 Interleaved Speech Language Models Latently Work In Text #语音识别 #预训练 #多模态模型 6.4/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 ✅ 6.4/10 | 前50% | #语音识别 | #预训练 | #多模态模型 | arxiv 👥 作者与机构 Talia Sternberg, Gallil Maimon, Yossi Adi The Hebrew University of Jerusalem 💡 毒舌点评 这篇论文提出了一个有趣且符合直觉的假设:语音模型内部可能在“偷偷”把语音转成文字来思考。用logit lens这个“X光机”去扫描模型中间层,确实观察到了这种现象,控制实验也表明这需要文本预训练和交错数据两个条件。然而,整篇文章更像是在报告一个有趣的观察现象,而非深入的机制解剖。相关性的发现(ρ≈0.7)虽然显著,但远非强有力,且未建立因果关系。方法上,最大值聚合的倾向可能高估了信号强度。作者自己也承认了这些局限,但作为顶会论文,在提供深刻机制洞察和严谨因果验证方面有所欠缺。论文读起来像是为未来工作指明了方向,但本身并未完成最令人兴奋的证明环节。 📌 核心摘要 本研究的核心发现是,经过交错语音-文本训练的语音语言模型,在处理语音输入时,其Transformer模型的中间层会自发地产生对应语音内容的文本表示(隐式转录),即使模型从未被显式训练过语音识别任务。这种行为需要两个关键前提:从预训练的文本语言模型初始化,以及使用包含语音-文本交错的数据进行训练。模型在中间层“思考”在文本空间,完成转录和下一步预测后,再将表示转换回语音域以生成语音。此外,这种隐式转录能力与模型在语音输入下进行常识事实检索的能力呈正相关,表明这种内部机制可能与模型的知识能力有关。 🔗 开源详情 代码:论文中未提及代码开源链接。 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 383 words

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

📄 ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech #语音合成 #语音识别 #多模态模型 6.6/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 0.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.6/10 | 前50% | #语音合成 | #语音识别 | #多模态模型 | arxiv 👥 作者与机构 论文标题:ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech 作者列表(按原文顺序):Wei Xue (香港科技大学), Junlan Feng (中国移动), Shilei Zhang (中国移动九天智能科技(北京)有限公司), Yue Wang (中国移动香港创新研究院), Ruosong Yang (中国移动香港创新研究院), Bei Liu (香港科技大学), Liumeng Xue (南京大学), Sitong Cheng (香港科技大学), Jiahao Pan (香港科技大学), Weizhen Bian (香港科技大学), Boyi Kang (香港科技大学), Bin Long (香港生成式AI研发中心) 机构:香港科技大学, 中国移动, 中国移动九天智能科技(北京)有限公司, 中国移动香港创新研究院, 南京大学, 香港生成式AI研发中心 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 239 words

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

📄 MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data #语音识别 #低资源 #数据增强 #多模态模型 #自监督学习 #参数高效微调 5.8/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.4/1.5 | 开源 0.1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.8/10 | 前50% | #语音识别 | #数据增强 | #低资源 #多模态模型 | arxiv 👥 作者与机构 作者:Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida。第一作者Muxuan Liu和第二作者Ichiro Kobayashi隶属于日本御茶水女子大学(Ochanomizu University)人文与科学研究生院;第三作者Satoshi Nishida隶属于日本国立信息通信技术研究所(NICT)先进ICT研究所信息与神经网络中心(CiNet)。 ...

2026-06-23 · 更新于 2026-08-14 · 1 min · 163 words

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

📄 Online Predictive Coding for Dual-Mode Self-Supervised Speech Model #语音识别 #自监督学习 #预训练 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.2/10 | 前50% | #语音识别 | #自监督学习 | #预训练 | arxiv 👥 作者与机构 Keita Goto\(^{1}\), Takashi Maekaku\(^{1}\), Jin Sakuma\(^{1}\), Jinchuan Tian\(^{2}\), Yusuke Shinohara\(^{1}\), Shinji Watanabe\(^{1}\) \(^{1}\) LY Corporation, Tokyo, Japan \(^{2}\) Carnegie Mellon University, PA, USA ...

2026-06-23 · 更新于 2026-08-14 · 4 min · 678 words

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

📄 OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics #语音识别 #低资源 #开源工具 8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8/10 | 前50% | #语音识别 | #低资源 | #开源工具 | arxiv 👥 作者与机构 论文作者是Korbinian Kuhn和Gottfried Zimmermann。机构为斯图加特传媒大学(Stuttgart Media University)和蒂宾根大学(University of Tübingen)。 💡 毒舌点评 这篇论文本质上是一个做得不错的开源工具包发布,包装了一套工程化的评估流水线。它的价值在于“整合”与“实用”,而非“发现”或“突破”。将几个已有的后处理技巧(归一化、复合词处理)打包进一个统一的框架,并号称能降低WER,这更像是对现有最佳实践的梳理和标准化,而非开辟新路。最大的亮点——细粒度评估(标点、大小写)——虽然有用,但概念上并不新颖。性能上的巨大鸿沟(慢100多倍)是其学术转化应用的阿喀琉斯之踵。论文在论证“为什么数值更低的WER就更好”这一核心问题上显得乏力,缺乏与人类判断的直接挂钩,这使得其“改进”的说服力打折扣。总体而言,这是一篇合格的、对社区有工具性贡献的工作,但距离顶级会议所期待的深刻洞见或显著性能提升尚有距离。 📌 核心摘要 本文提出了OpenWER,一个用于改进跨语言自动语音识别评估的开源工具。其核心贡献在于:1) 通过模块化设计支持灵活的文本预处理(分词、语言特定归一化);2) 扩展了Levenshtein距离算法,以处理标点符号和复合词,从而减少非语义差异导致的WER波动;3) 基于token的对齐机制能够保留原始文本及嵌入的元数据(如词性、置信度),从而支持计算标点准确率、大小写准确率等互补指标。在Common Voice 17数据集上对52种语言的评估显示,OpenWER相比JiWER和Whisper默认归一化,平均WER分别降低了7.7%(14.5%相对)和3.8%(9.2%相对),绝对WER降低最高可达25%。论文强调此工具旨在提高跨语言评估的公平性和全面性。 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 263 words

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

📄 Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior #参数高效微调 #语音识别 #语音情感识别 #模型压缩 #大语言模型 7.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.4/0.5 | 工程 0.4/1.5 ✅ 7.2/10 | 前50% | #语音识别 | #参数高效微调 | #语音情感识别 #模型压缩 | arxiv 👥 作者与机构 论文作者为 Vyom Agarwal, Mokshda Gangrade, Siddharth Pal, Jerry Wu。文中未明确提及作者所属机构。 💡 毒舌点评 这篇论文像是在用显微镜仔细观察一个众所周知的工程事实:模型越大、输入越多、算的越细,效果一般会越好,但算力不是无限的。其核心贡献“三轴框架”(\(x_N, x_T, x_V\))更像是一种标准化的观察视角,而非突破性的算法或理论。方法上,本质上是“控制变量法”(Star-Sweep)在模型缩放场景下的应用,组合了现成的LoRA和DAMA技术。实验很扎实,表格列得很满,Pareto前沿图也画了,结论基本符合直觉(例如收益递减、存在最优输入长度)。但“创新性”令人尴尬,更像是在ICASSP发的工作硬往顶会挤。审稿人看到“extends this idea to the audio domain”这种话大概会翻白眼。最大的亮点可能是清晰地揭示了ASR和SER任务在缩放特性上的本质差异(平滑前沿 vs. 稀疏前沿),但这更像是一个细致的实证发现,而非方法上的突破。 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 352 words

The Anatomy of the CTC Oracle Gap: Acoustic Exhaustion and Linguistic Recovery

📄 The Anatomy of the CTC Oracle Gap: Acoustic Exhaustion and Linguistic Recovery #语音识别 7.3/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.3/10 | 前50% | #语音识别 | #语音识别 | arxiv 👥 作者与机构 作者: Ivan Novosad 邮箱: ivan.novosad@hse.ru 机构: HSE University 💡 毒舌点评 这篇论文做了一件干净利落的事:给CTC的解码能力办了场“追悼会”,然后证明了“续命”的唯一方法是找外援(语言模型)。其诊断部分(11种内部方法全军覆没)堪称经典,像一场精心设计的尸检,无可辩驳地指出了CTC“声学力竭”的死因。提出用RoBERTa PLL构建MBR后验的方案也确实有效,跨条件泛化实验做得扎实。最有趣的是对MWER训练失败的剖析,那两个失败模式的对比(没信号 vs 扭曲地形)颇有深度。不过,作者在理论连接上似乎有些“手软”——Rao-Blackwell化这部分明明是个漂亮的理论卖点,却主要停在了经验验证层面。另外,计算开销这个“房间里的大象”被完全忽略了。总的来说,这是一篇分析透彻、实验严谨的“诊断式”论文,其最大价值在于清晰地划定了CTC模型的能力边界,并指明了突破方向。 📌 核心摘要 本研究深入剖析了基于连接主义时间分类(CTC)的自动语音识别(ASR)系统在解码阶段的能力瓶颈。研究首先通过系统性实验(11种CTC内部评分策略)证明,在波束宽度\(G=16\)时,任何基于CTC后验或编码器特征的重排序方法均无法带来统计显著的词错误率(WER)降低,其根本原因在于CTC的评分与WER之间的排名相关性(Spearman \(\rho\))随候选列表增大而急剧下降(从\(G=4\)时的-0.574降至\(G=128\)时的-0.270),表现出“声学力竭”。这表明瓶颈存在于声学模型与语言逻辑之间,而非声学模型内部。作为验证,研究引入外部语言信息:使用预训练RoBERTa模型计算候选句子的伪对数似然(PLL)分数,并以此构建后验概率分布进行最小风险(MBR)解码,损失函数为字符错误率(CER)。在LibriSpeech test-other数据集上,该方法(\(G=128\), \(\tau=10\))取得了5.42%的WER,相比贪心解码(5.96%)有9.0%的相对降低,且该结果在13个跨架构、跨领域、跨噪声的测试条件中的11个中显著,无需参数调整。在训练侧,研究分析了最小字错误率(MWER)序列级微调在接近收敛的CTC模型上失败的机制,识别出两种模式:在CR-CTC模型上因训练集oracle gap极小(0.007 pp)导致的奖励信号缺失和灾难性崩溃;在标准CTC模型上因损失曲面几何性质导致的轻微漂移或RA FT微调的坍塌。本研究核心结论是,CTC模型的解码瓶颈是表征性的而非架构性的,MBR与PLL的结合有效突破了该瓶颈。 ...

2026-06-23 · 更新于 2026-08-14 · 3 min · 586 words