Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis

📄 Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis #语音合成 #大语言模型 #数据增强 8.4/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.9/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8.4/10 | 前25% | #语音合成 | #数据增强 | #大语言模型 | arxiv 👥 作者与机构 Jinchuan Tian (卡内基梅隆大学), Haoran Wang (LY Corporation), Siddhant Arora (卡内基梅隆大学), Takashi Maekaku (LY Corporation), Keita Goto (NVIDIA Research), Jin Sakuma (NVIDIA Research), Yusuke Shinohara (NVIDIA Research), Chao-Han Huck Yang (NVIDIA Research), Shinji Watanabe (卡内基梅隆大学)。 ...

2026-06-23 · 更新于 2026-08-14 · 3 min · 467 words

Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study

📄 Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study #大语言模型 #基准测试 #语音合成 8.4/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8.4/10 | 前25% | #语音合成 | #大语言模型 | #基准测试 | arxiv 👥 作者与机构 Koriyama, Tomoki. CyberAgent, Japan. 💡 毒舌点评 这篇论文是一篇扎实的工程性基准测试研究,对日语G2P这个具体任务的LLM应用进行了迄今为止最全面的评估。实验设计合理,覆盖了30+模型,分析维度(模型规模、版本、专门化训练、提示模式)清晰。作为一篇面向应用的实证论文,其价值在于为日语TTS领域的从业者提供了明确的模型选择参考和性能基线。然而,其核心贡献是“评估”而非“提出”新方法,创新性相对有限,更像是一篇详尽的系统报告而非顶会级别的理论或方法突破。论文对错误模式的分析不够深入,对“为什么”某些模式有效或失败的探讨可以更进一步。TTS对比实验虽然实用,但对比系统的选择(如使用未提及的CosyVoice 2作为E2E代表)和实验设置(仅微调一个模型)的说服力可以更强。总体而言,这是一篇合格的、有用的工作,但可能更适合作为领域内的技术报告或会议短文,而非顶会主会场论文。 📌 核心摘要 本文首次对超过30种大型语言模型(LLM)在日语字形到音素(G2P)转换任务上的性能进行了大规模基准测试。研究提出并比较了两种LLM应用策略:解析模式(LLM执行形态分析,规则后处理负责发音规则)和直接模式(LLM直接预测假名)。实验使用包含3000句手动标注假名的JVS语料库子集,以假名字符错误率(CER)为指标。结果显示,模型规模、版本更新以及针对日语的专门化训练是提升准确率的关键因素。最优的专有模型(如Claude Opus,解析模式CER 0.52%)超越了最佳传统工具OpenJTalk(CER 1.03%)。解析模式在绝大多数模型上优于直接模式,因其减轻了LLM处理复杂发音规则的负担。此外,研究将LLM预测的假名输入一个微调的假名输入TTS模型(CosyVoice 2),其发音准确度优于多个端到端(E2E)TTS系统(如Gemini 2.5 Flash TTS, Qwen 3 TTS),同时保持了可比的自然度,证明了显式G2P模块在可控发音方面的实用价值。 ...

2026-06-23 · 更新于 2026-08-14 · 3 min · 481 words

DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

📄 DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation #语音合成 #语音识别 #低资源 #数据增强 7.2/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #数据增强 | #语音识别 #低资源 | arxiv 👥 作者与机构 作者:Yao Lu 机构:TMCC, College of Computer Science, Nankai University, Tianjin, China (南开大学计算机科学学院智能多媒体计算中心) 邮箱:2211843@mail.nankai.edu.cn 💡 毒舌点评 动机与定位清晰,但“低资源”声明需斟酌:针对普通话口吃语音数据稀缺导致ASR性能下降的问题,提出合成增强方案,动机合理。声称“仅需少于50小时数据微调”,这在特定任务下是优势,但需注意AS-70数据集本身就有48小时,且预训练使用了85小时的AISHELL-3,严格意义上“低资源”可能指目标领域的微调数据量。 方法设计模块化,有改进但创新性中等:将离散token生成与可控口吃建模结合,并引入非自回归模型缓解误差累积,思路直接有效。然而,核心组件(SpeechTokenizer, MaskGCT, HiFi-GAN, 韵律解码器)均为已有工作,本文主要贡献在于整合与适配,针对口吃合成的原创性架构设计或理论贡献有限。 实验充分,但部分评估可深化:在合成质量和ASR增强上做了全面对比,结果显示有效。但缺少关键的消融实验来验证各组件(如非自回归模型、显式音高能量模块、口吃标签)的具体贡献。ASR增强实验虽结果显著,但“state-of-the-art”的声明受限于特定数据集和评估设置,泛化性未知。 开源与可复现性严重不足:论文未提供代码、模型权重或合成数据,这极大限制了其可复现性和对社区的贡献。作为一篇应用性较强的论文,不开源使得验证其主张和进行后续研究变得困难。 局限性挖掘可更深入:论文提及了未来工作方向,但审稿人认为应更尖锐地指出当前局限,例如:自动插入口吃标签的策略可能过于简单,无法模拟真实口吃的复杂性和上下文依赖性;模型在极严重或罕见口吃类型上的泛化能力未被验证;合成语音与真实口吃语音在自然度和多样性上的差距未被量化讨论。 📌 核心摘要 本文针对普通话口吃语音数据稀缺导致自动语音识别(ASR)系统性能下降的问题,提出了DisSpeech框架。该框架是一个基于离散语音token的低资源可控口吃语音合成系统,可用于ASR数据增强。核心思想是将文本和显式口吃事件标签通过非自回归掩码生成Transformer映射为语义token,再通过一个集成显式音高与能量建模的解码器重建声学特征,最终由HiFi-GAN生成波形。实验表明,DisSpeech在合成质量和口吃事件可控性上优于现有方法(如Stutter-TTS)。利用其生成的94小时合成口吃语音增强ASR模型训练后,Qwen3-ASR-0.6B模型在评估的普通话口吃语音识别任务上达到4.19%的最优字符错误率(CER),同时对流利语音识别性能影响轻微。 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 373 words

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

📄 ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era #语音识别 #语音合成 #语音增强 #说话人识别 #语音翻译 #语音分离 #语音编码 #自监督学习 #数据增强 #参数高效微调 #迁移学习 7.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | #语音识别 | #自监督学习 | #语音合成 #语音增强 | arxiv 👥 作者与机构 Masao Someki (Carnegie Mellon University, Pittsburgh, USA) Alexander Polok (Brno University of Technology, Brno, Czechia) Carlos Carvalho (Instituto Superior Técnico, Lisbon, Portugal) Chyi-Jiunn Lin (Hanyang University, Seoul, South Korea) Da-Hee Yang (Hitachi Astemo, Tokyo, Japan) Jiatong Shi (Shanghai Jiao Tong University, Shanghai, China) Jinchuan Tian (Carnegie Mellon University, Pittsburgh, USA) Nelson Enrique Yalta Soplin (Carnegie Mellon University, Pittsburgh, USA) Samuele Cornell (Carnegie Mellon University, Pittsburgh, USA) Siddhant Arora (Carnegie Mellon University, Pittsburgh, USA) Francisco Teixeira (Instituto Superior Técnico, Lisbon, Portugal) Wei Wang (Shanghai Jiao Tong University, Shanghai, China) William Chen (Carnegie Mellon University, Pittsburgh, USA) Alberto Abad (Instituto Superior Técnico, Lisbon, Portugal) Chenda Li (Carnegie Mellon University, Pittsburgh, USA) Shinji Watanabe (Carnegie Mellon University, Pittsburgh, USA) Wangyou Zhang (Shanghai Jiao Tong University, Shanghai, China) ...

2026-06-23 · 更新于 2026-08-14 · 4 min · 698 words

Imitation Learning for Elder-Facing Speech Synthesis

📄 Imitation Learning for Elder-Facing Speech Synthesis #语音合成 #强化学习 #低资源 5.5/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0.1/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 📝 5.5/10 | 前50% | #语音合成 | #强化学习 | #低资源 | arxiv 👥 作者与机构 作者:Dongrui Han, Weidong Chen, Jiawen Kang, Mingyu Cui, Helen Meng, Xixin Wu 机构:1 The Chinese University of Hong Kong, Hong Kong SAR, China; 2 Tencent Hunyuan, China ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 417 words

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

📄 ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech #语音合成 #语音识别 #多模态模型 6.6/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 0.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.6/10 | 前50% | #语音合成 | #语音识别 | #多模态模型 | arxiv 👥 作者与机构 论文标题:ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech 作者列表(按原文顺序):Wei Xue (香港科技大学), Junlan Feng (中国移动), Shilei Zhang (中国移动九天智能科技(北京)有限公司), Yue Wang (中国移动香港创新研究院), Ruosong Yang (中国移动香港创新研究院), Bei Liu (香港科技大学), Liumeng Xue (南京大学), Sitong Cheng (香港科技大学), Jiahao Pan (香港科技大学), Weizhen Bian (香港科技大学), Boyi Kang (香港科技大学), Bin Long (香港生成式AI研发中心) 机构:香港科技大学, 中国移动, 中国移动九天智能科技(北京)有限公司, 中国移动香港创新研究院, 南京大学, 香港生成式AI研发中心 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 239 words

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

📄 LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity #音频水印 #音频生成 #语音合成 8/10 | 创新 1.6/2 | 严谨 1.1/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8/10 | 前25% | #音频水印 | #生成对抗网络 | #音频生成 #语音合成 | arxiv 👥 作者与机构 Kexin Li, Xiao Hu, Ilya Grishchenko, David Lie University of Toronto, Canada *Equal contributions, BCorresponding author 💡 毒舌点评 本文首次将“放射性”水印概念系统化地引入音频领域,并通过语义潜在空间嵌入提出了一个新颖的框架LambdaMark,实验结果看起来非常漂亮,声称在所有评估的攻击下都保持了鲁棒性。然而,审稿人必须指出几个严重关切。首先,该方法的“通用性”高度依赖于一个特定的、未开源的语义编码器(Dasheng)和声码器(SemanticVocoder)骨干网络,这使得其声称的通用性打了折扣。其次,论文在理论深度上有所欠缺,主要贡献是架构设计和实证验证,缺乏对为何“语义嵌入”比“波形嵌入”更鲁棒的严格数学分析或理论证明。第三,尽管实验全面,但评估完全依赖于作者自己提出的“HarmonicAttack”,且该攻击的泛化性和威胁强度是否代表最先进水平有待商榷。论文的局限性部分诚实,但更多地描述了方法适用范围,而非对方法内在缺陷的深入剖析。总体而言,这是一篇不错的工程导向论文,但距离顶会论文所要求的理论创新和深度分析仍有差距。 ...

2026-06-23 · 更新于 2026-08-14 · 5 min · 922 words

LISE : Listenable Interpretable Speaker Embeddings

📄 LISE : Listenable Interpretable Speaker Embeddings #说话人验证 #说话人识别 #语音合成 6.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.1/1.5 | 复现 0.4/0.5 | 工程 0.3/1.5 ✅ 6.8/10 | 前50% | #说话人验证 | #说话人识别 | #语音合成 | arxiv 👥 作者与机构 Xiaoliang Wu:University of Southampton, United Kingdom; The Hong Kong Polytechnic University, Hong Kong SAR, China Chongxin Gan:The Hong Kong Polytechnic University, Hong Kong SAR, China Ke Liu:University of Edinburgh, United Kingdom Peter Bell:University of Edinburgh, United Kingdom Jennifer Williams:University of Southampton, United Kingdom 💡 毒舌点评 这篇论文试图解决一个真实且重要的问题:让黑盒的说话人嵌入变得“可听”(Listenable),即人类可以通过听觉验证其组件的含义。这个想法很有价值,尤其是设计了严谨的感知实验来验证,这比多数只做自动指标的可解释性工作要扎实。然而,方法的创新性稍显不足,核心是现有非负矩阵分解(NMF)技术在特定约束下的应用。作者很诚实地讨论了局限,但部分讨论(如语言混淆)可能比实际影响更值得强调。总的来说,这是一篇工整、动机明确、实验设计用心的入门级可解释性论文,离顶级会议(如NeurIPS)对方法创新或理论深度的要求还有距离,但是一篇质量不错的领域会议(如Interspeech)论文。 ...

2026-06-23 · 更新于 2026-08-14 · 3 min · 515 words

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

📄 On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models #语音合成 #语音生成 #自监督学习 #低资源 #数据增强 7.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.4/10 | 前25% | #语音合成 | #自监督学习 | #语音生成 #低资源 | arxiv 👥 作者与机构 Shunsuke Kando (东京大学) Wataru Nakata (庆应义塾大学) Shinnosuke Takamichi (东京大学) Yusuke Miyao (庆应义塾大学) ...

2026-06-23 · 更新于 2026-08-14 · 3 min · 608 words

Physics-Informed Neural Operator for Speech Production Analysis

📄 Physics-Informed Neural Operator for Speech Production Analysis #语音合成 #自监督学习 6.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 ✅ 6.7/10 | 前50% | #语音合成 | #自监督学习 | arxiv 👥 作者与机构 Yokota, Kazuya (1) Luan, Xinmeng (2) Mohapatra, Debasish Ray (3) Scavone, Gary (2) Fels, Sidney (3) 1 Department of Mechanical Engineering, Nagaoka University of Technology, Japan 2 Schulich School of Music, McGill University, Canada 3 Department of Electrical and Computer Engineering, University of British Columbia, Canada ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 358 words