KVAE: Family of Tokenizers for Multimodal Generative Models
📄 KVAE: Family of Tokenizers for Multimodal Generative Models 标签:#多模态模型 #变分自编码器 #音频编码 #音频理解 #Transformer 8.1/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 🔥 8.1/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音频编码 | #变分自编码器 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Andrey Shutkin(Kandinsky Lab) 通讯作者:未说明 作者列表:Andrey Shutkin、Denis Parkhomenko、Ivan Kirillov、Kirill Chernyshev、Kirill Malakhov、Ilia Vasiliev、Ilia Trushkin、Valeriya Kobenko、David Chikovani、Alexander Ivanov、Azat Saginbaev、Egor Silvestrov、Ivan Mikheev、Konstantin Zakharov,均署名 Kandinsky Lab 💡 毒舌点评 把 tokenizer 当作影响扩散生成的第一公民来做,跨图像、视频、音频统一评估 diffusability,并用 tokenizer-swap 和主观评测证明“重建好不等于生成好”,这是很实用的工程视角。但最关键的音频对齐目标、感知损失具体配置和大量精确超参数被推到“后续 publication”,导致读者很难独立复现。更值得注意的是,客观指标上并非处处 SOTA:音乐域 FAD/CLAP 仍落后于 MMAudio,语音域 SI-SDR 仍落后于 MovieGen DACVAE;最终“全面超越”的结论主要靠 side-by-side 主观胜率撑住,而主观评测又没有给出标注者数量、一致性和置信区间。 ...