MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data
📄 MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data #语音合成 7.9/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 ✅ 7.9/10 | 前25% | #语音合成 | #语音合成 | arxiv 👥 作者与机构 Paarth Neekhara, Shehzeen Hussain, Ryan Langman, Xuesong Yang, Roy Fejgin, Subhankar Ghosh, Jason Li。隶属于 NVIDIA Corporation。 💡 毒舌点评 这篇论文精准地戳中了现有TTS系统在长文本生成上的痛点(韵律漂移、边界伪影),并提出了一个非常实用、即插即用的“纯推理时”解决方案。其核心价值在于“不改模型,只改策略”,具有很强的工程吸引力。然而,论文在技术细节的深挖(如超参数为何如此选择)、新数据集的公开透明度、以及泛化性声明的严谨性上,都留有明显的“草稿感”,像是一个出色的工程实践报告,而非一篇理论扎实、无懈可击的学术论文。 📌 核心摘要 本文提出了 MagpieTTS-LF,一种无需在长文本数据上重新训练,仅在推理时对现有 MagpieTTS 模型进行改进以生成连贯长文本语音的方法。其核心创新在于:1) 引入软注意力先验分布,引导模型在保持单调对齐的同时保留远距离上下文信息;2) 设计一种有状态的块生成算法,在独立的句子块之间传播注意力先验状态、编码器隐藏状态和文本历史,以维持韵律连续性和说话人一致性;3) 利用历史文本历史进行话语级的韵律规划。在自建的长文本评估集上,MagpieTTS-LF 在可懂度(WER/CER)、韵律边界连续性(Δ Energy)、说话人一致性(SSIM)和自然度稳定性(UTMOSv2)等多个维度上,均显著优于 XTTS、Qwen3-TTS 和 VibeVoice 等基线模型。 ...