Gogo: Group-wise granularity-ordered codec for stable and efficient speech generation
📄 Gogo: Group-wise granularity-ordered codec for stable and efficient speech generation #语音合成 #流匹配 #自回归模型 #零样本 #语音大模型 🔥 8.5/10 | 前25% | #语音合成 | #流匹配 | #自回归模型 #零样本 学术质量 6.5/7 | 选题价值 1.8/2 | 复现加成 0.5 | 置信度 高 👥 作者与机构 第一作者:Weidong Chen (香港中文大学电子工程系) 通讯作者:Xixin Wu (香港中文大学电子工程系) 作者列表:Weidong Chen (香港中文大学电子工程系), Helen M. Meng (香港中文大学电子工程系), Xixin Wu (香港中文大学电子工程系) 💡 毒舌点评 论文的亮点在于巧妙地将“组级量化”与“粒度排序”结合,从根源上解决了语音编解码器既要“高层抽象利于建模”又要“低层细节保证音质”的矛盾,设计思路清晰且优雅。但短板在于其框架组件繁多(编解码器、两阶段生成模型、额外训练的分配器),训练流程复杂,且token分配器的优化与主模型分离,可能并非全局最优,工程实现的门槛不低。 🔗 开源详情 代码:论文中未提及官方代码仓库链接。 模型权重:未提及公开预训练模型权重。 数据集:训练使用Emilia(英文子集),评估使用LibriTTS和Seed-TTS,均为已有公开数据集。论文未提及提供新的数据集。 Demo:提供了在线演示链接:https://happycolor.github.io/gogo。 复现材料:附录(A-M)提供了极其详细的实现细节、训练配置、评估设置、消融实验说明和可视化,复现信息非常充分。 论文中引用的开源项目:Vocos (声码器), LLaMA-3.2-1B-Instruct (SLM基础模型), PyTorch等常见框架。对比实验中引用了EnCodec, DAC, SpeechTokenizer, Mimi, SNAC, WavTokenizer等众多开源编码器模型。 📌 核心摘要 本文旨在解决当前语音语言模型中核心的语音编解码器面临的双重挑战:传统帧级量化难以捕获高层语义信息,以及固定比特率分配忽略了语音信号信息分布的不均匀性。为此,作者提出了Gogo编解码器,它创新性地将连续帧分组,并为每组生成从粗到细、粒度有序的令牌,粗令牌编码高层抽象,细令牌逐步恢复声学细节。基于此,设计了GogoSpeech两阶段语音生成模型:第一阶段以极低令牌率生成高层语音骨架,第二阶段再丰富细节。此外,引入了一个基于GRPO训练的令牌分配器,根据语音片段的复杂度自适应分配细粒度令牌的预算,以提升效率。实验表明,在47 Hz的令牌率下,Gogo在多项重建指标(如UT-MOS 4.19, DNS-MOS 3.99)上优于其他SOTA编解码器。在零样本语音合成任务中,GogoSpeech取得了最佳的说话人相似度(SIM 0.667)和综合质量评分(SMOS 4.381, CMOS +1.832),并证明了令牌分配器能在几乎不损质量的前提下将平均令牌率从47 Hz降至36 Hz。这项工作为高效、稳定的语音生成提供了新的范式。其局限性在于依赖固定的分组策略,且令牌分配器的训练与主生成模型解耦,可能存在优化不足。 ...