📄 OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation 标签:#音视频生成 #变分自编码器 #对比学习 #知识蒸馏 #音频理解
7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5
✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #变分自编码器 | #对比学习 #知识蒸馏 | arxiv
👥 作者与机构 第一作者:Jun Zhan(复旦大学, 上海创新研究院, MOSI Intelligence) 通讯作者:Xipeng Qiu(复旦大学, 上海创新研究院, MOSI Intelligence) 作者列表:Jun Zhan(复旦大学, 上海创新研究院, MOSI Intelligence)、Chen Yang(复旦大学, 上海创新研究院, MOSI Intelligence)、Yitian Gong(复旦大学, MOSI Intelligence)、Donghua Yu(复旦大学, MOSI Intelligence)、Kuangwei Chen(复旦大学, MOSI Intelligence)、Wenbo Zhang(复旦大学, MOSI Intelligence)、Kexin Huang(复旦大学, MOSI Intelligence)、Qi Luo(复旦大学, MOSI Intelligence)、Zhe Xu(复旦大学, MOSI Intelligence)、Ying Zhu(MOSI Intelligence, 上海交通大学)、Jin Wang(复旦大学, MOSI Intelligence)、Tengyue Zhang(上海创新研究院, 上海交通大学)、Qi Chen(上海创新研究院, 上海交通大学)、Cheng Chang(复旦大学, MOSI Intelligence)、Songlin Wang(MOSI Intelligence)、Junqi Dai(复旦大学)、Jiasheng Ye(复旦大学)、Xiaogui Yang(MOSI Intelligence)、Tianyi Liang(上海创新研究院, MOSI Intelligence)、Xiangyu Peng(MOSI Intelligence)、Zhaoye Fei(复旦大学, 上海创新研究院, MOSI Intelligence)、Shimin Li(复旦大学, MOSI Intelligence)、Qinyuan Cheng(复旦大学, MOSI Intelligence)、Xie Chen(上海创新研究院, 上海交通大学)、Xinchi Chen(复旦大学)、Xipeng Qiu(复旦大学, 上海创新研究院, MOSI Intelligence) 💡 毒舌点评 这项工作精准地抓住了当前音频-视频生成模型中的一个关键痛点:独立训练的VAE缺乏跨模态对齐,导致下游生成器需要从零开始学习同步。提出的两种训练期目标(语义蒸馏和对比对齐)设计合理,消融实验令人信服地展示了二者的互补效果。然而,重建质量的下滑(尤其是音频侧)暴露了多目标联合训练的固有张力,论文虽然在工程上通过分阶段训练和损失加权予以缓解,但缺乏对这种张力更深入的机制分析,略显“头痛医头”。
...