DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

📄 DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation #语音合成 #语音识别 #低资源 #数据增强 7.2/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #数据增强 | #语音识别 #低资源 | arxiv 👥 作者与机构 作者:Yao Lu 机构:TMCC, College of Computer Science, Nankai University, Tianjin, China (南开大学计算机科学学院智能多媒体计算中心) 邮箱:2211843@mail.nankai.edu.cn 💡 毒舌点评 动机与定位清晰,但“低资源”声明需斟酌:针对普通话口吃语音数据稀缺导致ASR性能下降的问题,提出合成增强方案,动机合理。声称“仅需少于50小时数据微调”,这在特定任务下是优势,但需注意AS-70数据集本身就有48小时,且预训练使用了85小时的AISHELL-3,严格意义上“低资源”可能指目标领域的微调数据量。 方法设计模块化,有改进但创新性中等:将离散token生成与可控口吃建模结合,并引入非自回归模型缓解误差累积,思路直接有效。然而,核心组件(SpeechTokenizer, MaskGCT, HiFi-GAN, 韵律解码器)均为已有工作,本文主要贡献在于整合与适配,针对口吃合成的原创性架构设计或理论贡献有限。 实验充分,但部分评估可深化:在合成质量和ASR增强上做了全面对比,结果显示有效。但缺少关键的消融实验来验证各组件(如非自回归模型、显式音高能量模块、口吃标签)的具体贡献。ASR增强实验虽结果显著,但“state-of-the-art”的声明受限于特定数据集和评估设置,泛化性未知。 开源与可复现性严重不足:论文未提供代码、模型权重或合成数据,这极大限制了其可复现性和对社区的贡献。作为一篇应用性较强的论文,不开源使得验证其主张和进行后续研究变得困难。 局限性挖掘可更深入:论文提及了未来工作方向,但审稿人认为应更尖锐地指出当前局限,例如:自动插入口吃标签的策略可能过于简单,无法模拟真实口吃的复杂性和上下文依赖性;模型在极严重或罕见口吃类型上的泛化能力未被验证;合成语音与真实口吃语音在自然度和多样性上的差距未被量化讨论。 📌 核心摘要 本文针对普通话口吃语音数据稀缺导致自动语音识别(ASR)系统性能下降的问题,提出了DisSpeech框架。该框架是一个基于离散语音token的低资源可控口吃语音合成系统,可用于ASR数据增强。核心思想是将文本和显式口吃事件标签通过非自回归掩码生成Transformer映射为语义token,再通过一个集成显式音高与能量建模的解码器重建声学特征,最终由HiFi-GAN生成波形。实验表明,DisSpeech在合成质量和口吃事件可控性上优于现有方法(如Stutter-TTS)。利用其生成的94小时合成口吃语音增强ASR模型训练后,Qwen3-ASR-0.6B模型在评估的普通话口吃语音识别任务上达到4.19%的最优字符错误率(CER),同时对流利语音识别性能影响轻微。 ...

2026-06-23 · 更新于 2026-07-24 · 2 min · 373 words

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

📄 ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era #语音识别 #语音合成 #语音增强 #说话人识别 #语音翻译 #语音分离 #语音编码 #自监督学习 #数据增强 #参数高效微调 #迁移学习 7.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | #语音识别 | #自监督学习 | #语音合成 #语音增强 | arxiv 👥 作者与机构 Masao Someki (Carnegie Mellon University, Pittsburgh, USA) Alexander Polok (Brno University of Technology, Brno, Czechia) Carlos Carvalho (Instituto Superior Técnico, Lisbon, Portugal) Chyi-Jiunn Lin (Hanyang University, Seoul, South Korea) Da-Hee Yang (Hitachi Astemo, Tokyo, Japan) Jiatong Shi (Shanghai Jiao Tong University, Shanghai, China) Jinchuan Tian (Carnegie Mellon University, Pittsburgh, USA) Nelson Enrique Yalta Soplin (Carnegie Mellon University, Pittsburgh, USA) Samuele Cornell (Carnegie Mellon University, Pittsburgh, USA) Siddhant Arora (Carnegie Mellon University, Pittsburgh, USA) Francisco Teixeira (Instituto Superior Técnico, Lisbon, Portugal) Wei Wang (Shanghai Jiao Tong University, Shanghai, China) William Chen (Carnegie Mellon University, Pittsburgh, USA) Alberto Abad (Instituto Superior Técnico, Lisbon, Portugal) Chenda Li (Carnegie Mellon University, Pittsburgh, USA) Shinji Watanabe (Carnegie Mellon University, Pittsburgh, USA) Wangyou Zhang (Shanghai Jiao Tong University, Shanghai, China) ...

2026-06-23 · 更新于 2026-07-24 · 4 min · 698 words

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

📄 MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data #语音识别 #低资源 #数据增强 #多模态模型 #自监督学习 #参数高效微调 5.8/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.4/1.5 | 开源 0.1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.8/10 | 前50% | #语音识别 | #数据增强 | #低资源 #多模态模型 | arxiv 👥 作者与机构 作者:Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida。第一作者Muxuan Liu和第二作者Ichiro Kobayashi隶属于日本御茶水女子大学(Ochanomizu University)人文与科学研究生院;第三作者Satoshi Nishida隶属于日本国立信息通信技术研究所(NICT)先进ICT研究所信息与神经网络中心(CiNet)。 ...

2026-06-23 · 更新于 2026-07-24 · 1 min · 163 words

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

📄 On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models #语音合成 #语音生成 #自监督学习 #低资源 #数据增强 7.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.4/10 | 前25% | #语音合成 | #自监督学习 | #语音生成 #低资源 | arxiv 👥 作者与机构 Shunsuke Kando (东京大学) Wataru Nakata (庆应义塾大学) Shinnosuke Takamichi (东京大学) Yusuke Miyao (庆应义塾大学) ...

2026-06-23 · 更新于 2026-07-24 · 3 min · 608 words

The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection

📄 The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection #数据增强 6.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.3/1.5 | 复现 0.4/0.5 | 工程 0.7/1.5 ✅ 6.8/10 | 前50% | #数据增强 | #数据增强 | arxiv 👥 作者与机构 Nicolas M. Müller, Pascal Debus 德国联邦教育与研究部(BMBF)项目 AIgenCY 💡 毒舌点评 这篇论文抓住了一个行业实践的痛点,问题本身是有趣且重要的。但作为一篇声称揭示“漏洞”的论文,其技术深度和评估的全面性值得商榷。所谓的“捷径学习”是机器学习老生常谈的概念,本文将其应用于音频水印与检测的特定场景,新颖性有限。实验部分,白盒验证设计得不错,控制变量清晰;但黑盒实验仅针对一个未知商业API,结论的普适性存疑。提出的缓解方法——在训练时对所有语音都加水印——过于简单,甚至有点“天真”,完全没有考虑水印本身的引入是否会影响检测器对真实伪造伪迹的判别能力,或者引入新的脆弱性。论文更像是对一个现象的观察报告,而非一篇具有深度分析和稳健解决方案的顶会工作。更令人不满的是,论文声称发布了WASP数据集,但代码和模型权重均未开源,这在当今顶会标准下是明显减分项。 📌 核心摘要 本文指出,在音频深度伪造检测领域,一种普遍的行业实践——仅为合成语音添加溯源水印——会在训练数据中引入“水印 ⇨ 假货”的虚假相关性。这导致检测器学习到一个简单的“捷径”特征,而非真正的语音伪造伪迹。该捷径引发三种耦合的失败模式:1)泛化能力下降,在标准(无水印)数据上表现变差;2)“去除水印以规避”:移除假货上的水印可使其逃脱检测;3)“添加水印以栽赃”:给真实语音添加水印会被误判为假货。通过白盒实验(AASIST检测器,ASVspoof19数据集)和黑盒实验(商用API测试),论文证实了这一现象。作者发布了配对的“干净-水印”语音数据集WASP以供研究,并提出了一种简单的训练增强策略(对所有语音都应用水印)来消除此捷径。 🔗 开源详情 代码:论文中未提及代码链接,未开源。 模型权重:论文中未提及,未开源。 数据集:WASP (Watermarked Audio for Spoofing Paired)。 论文中给出的获取链接为:https://huggingface.co/datasets/mueller91/WASP Demo:论文中未提及。 复现材料:论文中未提及具体复现材料(如配置文件、脚本或检查点)。论文中描述了实验设置(使用AASIST检测器、ASVspoof19数据集、三个种子进行训练),但未提供可下载的完整材料。 论文中引用的开源项目: Chatterbox (及 Chatterbox-Turbo):由Resemble AI开发的文本到语音系统,开源并默认嵌入了PerTh水印。论文中未提供具体链接。 DramaBox:论文中提及的TTS系统之一,具体链接未提供。 Kyutai:论文中提及的TTS系统之一,具体链接未提供。 Orpheus:论文中提及的TTS系统之一,具体链接未提供。 Sesame CSM:论文中提及的TTS系统之一,具体链接未提供。 PerTh:由Resemble AI开发的神经音频水印技术,集成于Chatterbox中。论文中未提供独立链接。 WavMark:由微软开发的水印��术。论文中未提供链接。 AudioSeal:由Meta开发的音频水印技术,论文中提及“has open implementations”。论文中未提供具体链接。 SilentCipher:由索尼开发的水印技术。论文中未提供链接。 VITS, VALL-E, F5-TTS, CosyVoice:论文在相关工作中提及的神经语音合成系统,具体链接未提供。 M-AILABS, AISHELL-3:论文中提及的用于提供真实语音的数据集,具体链接未提供。 🏗️ 方法概述和架构 本文的方法主要分为现象验证(白盒与黑盒实验)和缓解策略提出两大部分。其核心架构并非提出新的检测模型,而是通过严谨的实验设计揭示现有训练范式下的漏洞,并验证一种训练策略的有效性。 ...

2026-06-23 · 更新于 2026-07-24 · 1 min · 199 words

FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS

📄 FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS #语音合成 #语音增强 #参数高效微调 #持续学习 #低资源 #数据增强 #多语言 10/10 | 创新 2/2 | 严谨 1.5/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 10/10 | 前25% | #语音合成 | #参数高效微调 | #语音增强 #持续学习 | arxiv 👥 作者与机构 作者:Harshit Singh (1), Ayush Pratap Singh (2), Nityanand Mathur (3) 机构:1 University Of Maryland, 2 TU Darmstadt, 3 Smallest AI 联系邮箱:nityanandmathur@gmail.com ...

2026-06-19 · 更新于 2026-07-24 · 2 min · 423 words

Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech

📄 Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech #语音识别 #数据增强 #语音合成 7.6/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | #语音识别 | #数据增强 | #语音合成 | arxiv 👥 作者与机构 作者:Yue Heng Yeo, Haoyang Li, Yizhou Peng, Shreyas Gopal, Hexin Liu, Leibny Paola Garcia-Perera, Hardik B. Sailor, Jeremy H. M. Wong, Eng Siong Chng 机构:1 College of Computing and Data Science, Nanyang Technological University, Singapore;2 Institute for Infocomm Research (I2R), A*STAR, Singapore;3 HLT-COE & CLSP, Johns Hopkins University, USA;4 Google DeepMind, Singapore 💡 毒舌点评 这篇论文的出发点很明确:用合成数据解决代码切换ASR的数据稀缺问题。但问题在于,整个框架的复杂性是否必要?引入一个新的声学指标 CMI_speech,并用DPO进行多目标优化,听起来很高大上。但仔细一看,核心创新点——那个所谓的“声学层面的语言混合度量”——依赖于一个带语言对齐损失(LAL)训练的Whisper模型来生成伪标签。这本身就是一个巨大的假设:这个伪标签生成器的准确性有多高?论文完全没有评估这个“裁判”本身的可靠性。如果裁判是瞎的,那用它来评判选手(合成语音)的好坏,结果就值得怀疑了。此外,实验只在单一的SEAME数据集上进行,这个数据集虽然经典,但能否代表所有代码切换场景?论文缺乏在更广泛或多语言数据集上的泛化验证,说服力打了折扣。总的来说,方法设计有一定的巧思,但关键环节的验证不足,使得整个框架像是在“沙堆上建塔”。 ...

2026-06-19 · 更新于 2026-07-24 · 2 min · 379 words

Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation

📄 Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation #语音识别 #自监督学习 #低资源 #数据增强 6.5/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.5/10 | 前50% | #语音识别 | #数据增强 | #自监督学习 #低资源 | arxiv 👥 作者与机构 Paban Sapkota, Hemant Kumar Kathania, Sudarsana Reddy Kadiri, Shrikanth Narayanan 未提及具体单位,但作者Paban Sapkota, Hemant Kumar Kathania与Sudarsana Reddy Kadiri, Shrikanth Narayanan可能来自同一机构或合作机构。原文未明确说明第一作者及通讯作者的所属机构。 💡 毒舌点评 这篇论文解决了一个有价值的实际问题——为数据稀缺的构音障碍群体改善语音识别。其工作是扎实的,系统性地将几种经典数据增强技术应用到Wav2Vec2微调中,并针对不同严重程度进行了细致调参,得出了SRM和PM各有侧重的结论。然而,其“顶会”成色不足。创新性主要体现在“首次应用”和“系统性实验”,而���方法论或模型的突破。最致命的弱点是实验设计:评估设置可能并非严格的说话者独立,这使得结果的泛化性存疑;同时,仅使用一个较小的公开数据集(TORGO)和一个SSL模型(Wav2Vec2),缺乏与当前SOTA方法(如其他SSL模型或专门针对残障语音的模型)的直接对比,结论的说服力和影响力大打折扣。论文在讨论和反思上也显得吝啬,未能深入剖析技术选择背后的声学机理。总体而言,这是一篇合格的系统性实验论文,但距离顶会要求的深刻洞见和坚实论证尚有差距。 ...

2026-06-19 · 更新于 2026-07-24 · 3 min · 528 words

Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations

📄 Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations #语音合成 #自监督学习 #数据增强 6.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.9/10 | 前25% | #语音合成 | #自监督学习 | #数据增强 | arxiv 👥 作者与机构 第一作者:Masato Takagi (名古屋工业大学) 通讯/共同作者:Masaya Kawamura, Reo Shimizu, Yuma Shirahata (均为LY Corporation) 机构:1 Nagoya Institute of Technology, Japan; 2 LY Corporation, Japan ...

2026-06-19 · 更新于 2026-07-24 · 3 min · 467 words

Leveraging systems' non-linearity to tackle the scarcity of data in the design of Intelligent Fault Diagnosis Systems

📄 Leveraging systems' non-linearity to tackle the scarcity of data in the design of Intelligent Fault Diagnosis Systems #数据增强 #迁移学习 5.5/10 | 创新 1.6/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.7/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.2/1.5 📝 5.5/10 | 后50% | #数据增强 | #数据增强 | #迁移学习 | arxiv 👥 作者与机构 Giancarlo Santamato, Andrea Mattia Garavagno, Massimiliano Solazzi, Antonio Frisoli。所属机构为意大利的Scuola Superiore Sant’Anna。 💡 毒舌点评 这篇论文试图解决故障诊断中的“数据荒”问题,这个动机本身值得肯定,但其提出的解决方案却像是“用高射炮打蚊子”。其核心思想是利用非线性系统的特性——不同激励水平下FRF会变化——来生成二维图像,再通过一个简单的行置换操作做“数据增强”。本质上,这是将一个一维信号处理问题,通过一个非常特定的、依赖于实验条件的假设,强行包装成了一个图像分类问题。更令人皱眉的是,这种“增强”技术可能会混合不同摩擦状态下的数据,论文对此避而不谈其风险。在实验上,仅在一个特定、甚至略显过时的机械系统(受电弓)上,用一个网络(MobileNetV2)进行了一次性验证,就宣称方法有效。这种验证方式在顶会看来是不够的,因为它无法证明方法的普适性、相对于其他增强方法的优越性,也无法排除模型选择带来的偏差。论文声称利用了“深度迁移学习”,但本质上只是用了ImageNet预训练权重作为特征提取器,这在2024年已是标准操作,算不上核心创新。总而言之,论文想法有趣,但执行得过于简单、验证过于单薄,理论支撑几乎空白。 ...

2026-06-19 · 更新于 2026-07-24 · 1 min · 169 words