Multimodal Latent Language Modeling with Next-Token Diffusion
📄 Multimodal Latent Language Modeling with Next-Token Diffusion #语音合成 #多模态模型 6.1/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.1/10 | 前50% | #语音合成 | #自回归模型 | #多模态模型 | arxiv 👥 作者与机构 第一作者: Yutao Sun (Tsinghua University) 通讯作者: Furu Wei (Microsoft Research), Jianyong Wang (Tsinghua University) 作者列表: Yutao Sun (Tsinghua University), Hangbo Bao (Microsoft Research), Wenhui Wang (Microsoft Research), Zhiliang Peng (Microsoft Research), Li Dong (Microsoft Research), Shaohan Huang (Microsoft Research), Yaoyao Chang (未说明), Jianyong Wang (Tsinghua University), Furu Wei (Microsoft Research) 💡 毒舌点评 本文在“一切皆为token”的统一多模态框架上迈出了扎实的一步,用next-token diffusion巧妙绕开了VQ-VAE的信息瓶颈,σ-VAE的方差约束设计也切中自回归生成的exposure bias要害。但ImageNet上的图像生成实验,LatentLM-L(479M, FID 2.24)实际上并未超越同体量的MAR(479M, FID 1.78),论文将其归入非因果类进行对比虽分类合理,但未能提供等计算量对比来证明因果框架自身能弥补这一差距;此外,仅在200B tokens上训练的1.3B多模态LLM远未达到收敛,声称的scaling优势仍需更大规模验证;TTS人类评估仅24人,略显单薄。 ...