DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation
📄 DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation #语音合成 #语音识别 #低资源 #数据增强 7.2/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #数据增强 | #语音识别 #低资源 | arxiv 👥 作者与机构 作者:Yao Lu 机构:TMCC, College of Computer Science, Nankai University, Tianjin, China (南开大学计算机科学学院智能多媒体计算中心) 邮箱:2211843@mail.nankai.edu.cn 💡 毒舌点评 动机与定位清晰,但“低资源”声明需斟酌:针对普通话口吃语音数据稀缺导致ASR性能下降的问题,提出合成增强方案,动机合理。声称“仅需少于50小时数据微调”,这在特定任务下是优势,但需注意AS-70数据集本身就有48小时,且预训练使用了85小时的AISHELL-3,严格意义上“低资源”可能指目标领域的微调数据量。 方法设计模块化,有改进但创新性中等:将离散token生成与可控口吃建模结合,并引入非自回归模型缓解误差累积,思路直接有效。然而,核心组件(SpeechTokenizer, MaskGCT, HiFi-GAN, 韵律解码器)均为已有工作,本文主要贡献在于整合与适配,针对口吃合成的原创性架构设计或理论贡献有限。 实验充分,但部分评估可深化:在合成质量和ASR增强上做了全面对比,结果显示有效。但缺少关键的消融实验来验证各组件(如非自回归模型、显式音高能量模块、口吃标签)的具体贡献。ASR增强实验虽结果显著,但“state-of-the-art”的声明受限于特定数据集和评估设置,泛化性未知。 开源与可复现性严重不足:论文未提供代码、模型权重或合成数据,这极大限制了其可复现性和对社区的贡献。作为一篇应用性较强的论文,不开源使得验证其主张和进行后续研究变得困难。 局限性挖掘可更深入:论文提及了未来工作方向,但审稿人认为应更尖锐地指出当前局限,例如:自动插入口吃标签的策略可能过于简单,无法模拟真实口吃的复杂性和上下文依赖性;模型在极严重或罕见口吃类型上的泛化能力未被验证;合成语音与真实口吃语音在自然度和多样性上的差距未被量化讨论。 📌 核心摘要 本文针对普通话口吃语音数据稀缺导致自动语音识别(ASR)系统性能下降的问题,提出了DisSpeech框架。该框架是一个基于离散语音token的低资源可控口吃语音合成系统,可用于ASR数据增强。核心思想是将文本和显式口吃事件标签通过非自回归掩码生成Transformer映射为语义token,再通过一个集成显式音高与能量建模的解码器重建声学特征,最终由HiFi-GAN生成波形。实验表明,DisSpeech在合成质量和口吃事件可控性上优于现有方法(如Stutter-TTS)。利用其生成的94小时合成口吃语音增强ASR模型训练后,Qwen3-ASR-0.6B模型在评估的普通话口吃语音识别任务上达到4.19%的最优字符错误率(CER),同时对流利语音识别性能影响轻微。 ...