Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech
📄 Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech #语音合成 #扩散模型 8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8/10 | 前25% | #语音合成 | #扩散模型 | arxiv 👥 作者与机构 第一作者:Vadim Popov(Huawei Noah’s Ark Lab, National Research University Higher School of Economics) 通讯作者:Vadim Popov(popov.vadim1@huawei.com) 作者列表:Vadim Popov(Huawei Noah’s Ark Lab, National Research University Higher School of Economics)、Wenju Gu(Huawei Noah’s Ark Lab)、Tasnima Sadekova(Huawei Noah’s Ark Lab, National Research University Higher School of Economics)、Georgii Aparin(Huawei Noah’s Ark Lab, National University of Science and Technology MISIS)、Assel Yermekova(Huawei Noah’s Ark Lab) 💡 毒舌点评 这篇论文巧妙地将 FSQ 的几何结构注入了连续扩散混合生成的理论框架, 从路径测度 KL 散度给出了一个漂亮的解释, 并用一套完整的 TTS 系统秀了肌肉。但理论的华美长袍下藏着“等先验”的致命伤疤, 一旦面对真实世界中不平衡的 token 分布, 所谓“最优性”可能瞬间沦为纸上谈兵, 而作者在实验中对此几乎是讳莫如深。 ...