📄 OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
标签:#音视频生成 #变分自编码器 #对比学习 #知识蒸馏 #音频理解
7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5
✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #变分自编码器 | #对比学习 #知识蒸馏 | arxiv
👥 作者与机构
- 第一作者:Jun Zhan(复旦大学, 上海创新研究院, MOSI Intelligence)
- 通讯作者:Xipeng Qiu(复旦大学, 上海创新研究院, MOSI Intelligence)
- 作者列表:Jun Zhan(复旦大学, 上海创新研究院, MOSI Intelligence)、Chen Yang(复旦大学, 上海创新研究院, MOSI Intelligence)、Yitian Gong(复旦大学, MOSI Intelligence)、Donghua Yu(复旦大学, MOSI Intelligence)、Kuangwei Chen(复旦大学, MOSI Intelligence)、Wenbo Zhang(复旦大学, MOSI Intelligence)、Kexin Huang(复旦大学, MOSI Intelligence)、Qi Luo(复旦大学, MOSI Intelligence)、Zhe Xu(复旦大学, MOSI Intelligence)、Ying Zhu(MOSI Intelligence, 上海交通大学)、Jin Wang(复旦大学, MOSI Intelligence)、Tengyue Zhang(上海创新研究院, 上海交通大学)、Qi Chen(上海创新研究院, 上海交通大学)、Cheng Chang(复旦大学, MOSI Intelligence)、Songlin Wang(MOSI Intelligence)、Junqi Dai(复旦大学)、Jiasheng Ye(复旦大学)、Xiaogui Yang(MOSI Intelligence)、Tianyi Liang(上海创新研究院, MOSI Intelligence)、Xiangyu Peng(MOSI Intelligence)、Zhaoye Fei(复旦大学, 上海创新研究院, MOSI Intelligence)、Shimin Li(复旦大学, MOSI Intelligence)、Qinyuan Cheng(复旦大学, MOSI Intelligence)、Xie Chen(上海创新研究院, 上海交通大学)、Xinchi Chen(复旦大学)、Xipeng Qiu(复旦大学, 上海创新研究院, MOSI Intelligence)
💡 毒舌点评
这项工作精准地抓住了当前音频-视频生成模型中的一个关键痛点:独立训练的VAE缺乏跨模态对齐,导致下游生成器需要从零开始学习同步。提出的两种训练期目标(语义蒸馏和对比对齐)设计合理,消融实验令人信服地展示了二者的互补效果。然而,重建质量的下滑(尤其是音频侧)暴露了多目标联合训练的固有张力,论文虽然在工程上通过分阶段训练和损失加权予以缓解,但缺乏对这种张力更深入的机制分析,略显“头痛医头”。
📌 核心摘要
- 要解决什么问题:当前音视频联合生成模型通常使用独立训练的VAE,导致音频和视频的潜空间缺乏跨模态对齐,下游生成任务难以学习细粒度的音画同步。
- 方法核心:提出OmniVAE,一个联合训练的音视频VAE,在保持各模态独立编解码架构的同时,通过两个训练期专用目标实现潜空间对齐:1)段级别的音视频对比学习(双向InfoNCE损失),强制同类时刻的音频和视频特征在共享空间中靠近;2)模态特定的语义蒸馏,将冻结的预训练语义编码器(Qwen3-Omni)的特征注入VAE的潜变量中。
- 新在何处:首次将跨模态对齐直接融入音视频VAE的训练过程。与独立重建VAE、或依赖外部同步特征的下游生成器不同,OmniVAE将细粒度的时间和语义对应性原生地编码到潜空间,且不增加任何推理开销。
- 主要实验结果:在重建任务上,加入对比学习后,音频重建指标略有下降(如LibriSpeech PESQ-WB从4.5557降至4.4085),但视频重建质量基本保持。在关键的同步探针测试(VGS-Sp)中,OmniVAE的A@1达到20.2%,远高于仅重建的6.4%。在下游T2AV生成任务中,OmniVAE显著优于自身所有变体基线。
配置方案 DeSync ↓ LSE-C ↑ Video-Audio Sim ↑ 语音WER ↓ Recon(仅重建) 0.884 1.479 0.254 0.243 Recon + Distill(+蒸馏) 0.814 1.450 0.256 0.205 Recon + AVCLIP(+对比) 0.576 1.970 0.257 0.172 OmniVAE(全量) 0.570 2.093 0.274 0.168 - 实际意义:为音视频生成模型提供了一个即插即用的、内置对齐能力的tokenizer,有望减少下游模型学习跨模态同步的负担,成为Omni-modal模型的基础组件。
- 主要局限性:引入对比学习会轻微损害音频重建的感知质量(出现了电子伪影),需要后处理修复;方法对大规模、高质量对齐数据的依赖性强,论文中使用的数据管道较为复杂。
🔗 开源详情
- 代码:https://github.com/OpenMOSS/OmniVAE
🏗️ 方法概述和架构
OmniVAE的核心架构由两个独立的模态分支(视频VAE和音频VAE)以及两个训练期专用的辅助模块组成,最终产物是一个在推理时不增加额外开销的、内在对齐的潜空间编码器-解码器对。
视频VAE分支:采用了Wan2.2 VAE架构。输入一个包含文本帧的视频片段 \(x_v \in \mathbb{R}^{(1+T) \times H \times W \times 3}\),通过因果编码器进行4倍时间下采样和8倍空间下采样,得到潜变量 \(z_v \in \mathbb{R}^{C_v \times T_v \times (H/8) \times (W/8)}\),其中 \(T_v = 1 + T/4\)。解码器则负责从潜变量重建原始视频。该分支使用L1损失、LPIPS感知损失和KL散度作为重建目标,并在预训练阶段引入对抗性监督。
音频VAE分支:借鉴了DAC风格的连续VAE。输入48 kHz的波形 \(x_a \in \mathbb{R}^{1 \times L}\),编码器对其进行时间下采样(下采样因子为 \(d_a\)),输出1D潜变量 \(z_a \in \mathbb{R}^{C_a \times T_a}\)。音频重建损失由波形域损失、多分辨率梅尔频谱损失和KL散度构成,预训练阶段同样使用了判别器和特征匹配损失。
段级跨模态对齐模块(训练期专用):这是建立跨模态对齐的关键。由于音视频潜变量的结构和维度不同(视频为时空张量,音频为1D序列),该模块通过聚合器将它们映射到统一的段级特征空间。对于视频潜变量 \(z_v\),先通过一个轻量级Transformer空间聚合器将每帧压缩为一个令牌,再通过时间池化得到段特征(第一帧因因果VAE的特殊时间跨度被排除);对于音频潜变量 \(z_a\),则通过ConvNeXt-1D块进行时间聚合和池化,得到段特征。每个8秒片段被均匀分割为 \(S=48\) 个段(每段约0.17秒),最终得到视频段特征 \(u^v \in \mathbb{R}^{S \times d}\) 和音频段特征 \(u^a \in \mathbb{R}^{S \times d}\)。这两个模态的段特征被归一化后,使用双向InfoNCE损失进行对比学习。该损失的负样本构建采用了层级策略,包含来自同一片段的其他段(内片段负样本,47个)、来自同一源视频但不同时间窗口的段(同胞片段负样本,48个)以及来自批量中其他不相关视频的段(跨视频负样本,24个),比例约2:2:1,以同时实现细粒度的时间辨别和广泛的语义区分。
模态特定语义蒸馏模块(训练期专用):为了让每个模态的潜变量对其下游生成任务更友好,OmniVAE从冻结的预训练模型Qwen3-Omni中蒸馏语义知识。视频分支使用一个卷积投影头将视频潜变量的通道和分辨率与Qwen3-Omni视觉编码器的特征图对齐,然后用Sigmoid-余弦损失进行蒸馏。由于视频VAE使用了因果卷积,其对第一个文本帧的编码方式与其余帧不同,蒸馏时也将第一个潜帧与教师模型的图像特征对齐,剩余帧与其视频特征对齐。音频分支同理,使用1D卷积投影头对齐维度,并用Sigmoid-余弦损失从Qwen3-Omni音频编码器蒸馏特征。
训练与推理分离:负责对比学习和语义蒸馏的模块(聚合器、投影头)仅在训练阶段存在。训练完成后,这些模块被丢弃,只保留视频和音频的编码器与解码器,推理过程与标准VAE完全一致,计算成本和接口保持不变,但输出的潜变量已经内化了细粒度的时空语义对齐。
💡 核心创新点
- 联合对齐的音视频潜空间:首次提出并验证了直接对音视频VAE进行联合训练以实现潜空间对齐的可行性。与之前下游生成模型从零开始学习同步或依赖外部特征不同,OmniVAE将对齐信号直接注入到生成任务的“基础原料”——tokenizer的表示空间中。
- 细粒度段级对比学习框架:设计了专用于音视频对齐的段级对比学习目标与独特的层级负样本构建策略。该策略通过混合来自同一视频内不同时间点、同一源视频不同片段以及完全不同视频的负样本,使模型既能学习到精细的时间对应关系(如敲门声与敲门动作的瞬时匹配),又能捕捉高层次的语义关联,超越了传统的全局或受限负样本池的对比方法。
- 双目标互补驱动的潜空间优化:揭示了语义蒸馏和跨模态对比学习在优化潜空间时的互补作用。消融实验证明,对比学习主要提升跨模态同步精度,而语义蒸馏则改善了各模态自身的生成可学性(如音质和视觉质量)。二者的结合(OmniVAE)取得了最佳的整体下游性能。
- 零开销推理架构设计:所有对齐和蒸馏模块均为训练期专用,确保了该方法的实用性。这为工业界和学术界提供了一种直接替换现有VAE组件、无需改变下游生成模型架构或增加推理成本的升级方案。
📊 实验结果
论文通过重建评估、同步探测和下游T2AV生成三个层面验证了OmniVAE的效果。
1. 重建质量评估(表2):
视频重建结果(UCF-101 / Panda-70M):
| Configuration | PSNR ↑ | SSIM ↑ | LPIPS ↓ | L1 ↓ | rFVD ↓ |
|---|---|---|---|---|---|
| 外部VAE | |||||
| Wan2.1 VAE | 34.50 / 32.62 | 0.9510 / 0.9448 | 0.0201 / 0.0169 | 0.0117 / 0.0130 | 2.46 / 1.49 |
| Wan2.2 VAE | 34.87 / 33.21 | 0.9584 / 0.9541 | 0.0177 / 0.0137 | 0.0110 / 0.0120 | 3.72 / 1.38 |
| Ours | |||||
| Recon | 36.93 / 36.56 | 0.9656 / 0.9697 | 0.0102 / 0.0067 | 0.0090 / 0.0086 | 2.40 / 1.25 |
| Recon + Distill | 36.70 / 36.22 | 0.9649 / 0.9688 | 0.0107 / 0.0071 | 0.0092 / 0.0089 | 2.53 / 1.26 |
| Recon + AVCLIP | 36.22 / 35.13 | 0.9616 / 0.9631 | 0.0115 / 0.0079 | 0.0097 / 0.0098 | 2.66 / 1.35 |
| OmniVAE | 36.27 / 35.24 | 0.9616 / 0.9632 | 0.0113 / 0.0077 | 0.0097 / 0.0098 | 2.81 / 1.31 |
音频重建结果(Speech: LibriSpeech test-clean; Audio / Music: AudioSet / MUSDB18):
| Model | SIM ↑ | STOI ↑ | P-NB ↑ | P-WB ↑ | Mel ↓ (A/M) | STFT ↓ (A/M) | ViSQOL ↑ (A/M) |
|---|---|---|---|---|---|---|---|
| 外部VAE | |||||||
| HunyuanVideo-Foley VAE | 0.9899 | 0.9979 | 4.4780 | 4.5337 | 0.52/0.60 | 1.82/1.84 | 4.47/4.45 |
| MMAudio VAE | 0.9122 | 0.9502 | 3.4931 | 2.9797 | 1.23/1.36 | 2.14/2.44 | 4.42/4.42 |
| Stable Audio 3 SAME-S | 0.7960 | 0.9139 | 2.8073 | 2.2991 | 1.46/1.37 | 3.19/3.67 | 3.68/3.99 |
| Stable Audio 3 SAME-L | 0.8755 | 0.9539 | 3.4615 | 3.0739 | 1.37/1.22 | 3.30/3.55 | 3.76/4.17 |
| Ours | |||||||
| Recon | 0.9893 | 0.9981 | 4.4916 | 4.5557 | 0.44/0.50 | 1.75/1.72 | 4.55/4.60 |
| Recon + Distill | 0.9893 | 0.9970 | 4.4453 | 4.5101 | 0.56/0.64 | 1.96/1.95 | 4.44/4.42 |
| Recon + AVCLIP | 0.9666 | 0.9946 | 4.4346 | 4.3638 | 0.76/0.75 | 1.99/2.03 | 4.03/4.18 |
| OmniVAE | 0.9737 | 0.9948 | 4.4400 | 4.4085 | 0.74/0.73 | 2.02/2.08 | 4.08/4.31 |
视频重建质量在所有训练变体中基本得到保持,PSNR略有下降(如Panda-70M上从36.56降至35.24),但LPIPS和SSIM降幅很小。音频侧,OmniVAE的PESQ-WB(4.4085)和STOI(0.9948)低于Recon基线(4.5557, 0.9981),论文将此归因于第2阶段为节省显存而移除音频判别器导致的电子伪影,并通过第3阶段的解码器微调予以缓解。所有变体均从Wan2.2 VAE和HunyuanVideo-Foley VAE初始化,外部VAE仅作参考。
2. 跨模态同步探针(表3):
在VGGSound-Sparse上的偏移预测探针结果(%):
| Method | A@1 | A@5 | A@1tol |
|---|---|---|---|
| Frozen | |||
| Recon | 6.4 | 31.5 | 16.2 |
| Recon + Distill | 7.1 | 33.0 | 17.5 |
| Recon + AVCLIP | 18.1 | 47.8 | 34.5 |
| OmniVAE | 20.2 | 50.1 | 37.2 |
| +ft | |||
| Recon + ft | 7.0 | 32.4 | 17.1 |
| Recon + Distill + ft | 7.8 | 33.9 | 18.4 |
| Recon + AVCLIP + ft | 21.8 | 52.4 | 39.6 |
| OmniVAE + ft | 22.3 | 53.2 | 40.4 |
对比学习是提升跨模态时间对齐的主要驱动力:Recon+AVCLIP将A@1从Recon的6.4%大幅提升至18.1%。在冻结主干设置下,OmniVAE进一步提升至20.2%,证明了语义蒸馏也为对齐提供了正向增益。
3. 下游T2AV生成评估(表4和图2):
在Verse-Bench测试集上训练基于Flow Matching的T2AV联合生成模型,取最后三个检查点(180k, 190k, 200k)的均值,CFG=5:
| Configuration | DeSync ↓ | LSE-C ↑ | Video-Audio Sim ↑ | Text-Audio Sim ↑ | Aesthetic ↑ | MusiQ ↑ | ManiQA ↑ | Motion Score ↑ |
|---|---|---|---|---|---|---|---|---|
| Recon | 0.884 | 1.479 | 0.254 | 0.201 | 0.369 | 0.503 | 0.338 | 0.556 |
| Recon + Distill | 0.814 | 1.450 | 0.256 | 0.227 | 0.373 | 0.523 | 0.359 | 0.495 |
| Recon + AVCLIP | 0.576 | 1.970 | 0.257 | 0.225 | 0.382 | 0.503 | 0.341 | 0.533 |
| OmniVAE | 0.570 | 2.093 | 0.274 | 0.246 | 0.381 | 0.515 | 0.355 | 0.456 |
| Configuration | IS ↑ | KL ↓ | FD ↓ | WER ↓ | CE ↑ | CU ↑ | PC ↓ | PQ ↑ |
|---|---|---|---|---|---|---|---|---|
| Recon | 3.041 | 1.279 | 1.029 | 0.243 | 4.625 | 5.855 | 2.282 | 6.328 |
| Recon + Distill | 3.604 | 1.258 | 0.959 | 0.205 | 4.533 | 5.677 | 2.232 | 6.060 |
| Recon + AVCLIP | 3.598 | 1.231 | 0.932 | 0.172 | 4.666 | 5.894 | 2.237 | 6.219 |
| OmniVAE | 4.001 | 1.140 | 0.875 | 0.168 | 4.826 | 6.119 | 2.259 | 6.406 |
OmniVAE几乎在所有跨模态对齐指标上取得最佳:DeSync 0.570(越低越好)远优于Recon的0.884;LSE-C(唇形同步)从1.479提升至2.093;Video-Audio语义相似度也最高(0.274)。在音频生成质量上,OmniVAE的语音WER(0.168)为所有配置中最低;在AudioBox内容质量(CE, CU, PQ)和IS/KL/FD指标上也取得了最好的综合得分。这直接支撑了论文的核心论点:内置对齐的潜空间更易于下游模型学习同步,同时也有利于模态自身的生成质量。
4. 关键消融实验:
对比学习粒度消融(表5):
| FPS | Clip | Segment | A@1 (%) |
|---|---|---|---|
| 8 | 8 s | 0.50 s | 19.0 |
| 24 | — | 0.17 s | 7.0 |
| 24 | 2 s | 0.17 s | 6.0 |
| 24 | 8 s | 0.17 s | 30.0 |
| 24 | 8 s | 0.34 s | 27.0 |
| 24 | 8 s | 0.50 s | 29.0 |
将帧率从8fps提升至24fps、使用更长的8秒片段和更细的0.17秒段长,可大幅扩大负样本池,将A@1从7.0%提升至30.0%,证明了大规模精细对比学习的关键性。
损失平衡策略消融(表6):
| Balancing strategy | Intra A@48 | Overall A@64 | STOI | PESQ-WB | PESQ-NB | PSNR |
|---|---|---|---|---|---|---|
| Loss-magnitude (ours) | 0.51 | 0.24 | 0.994 | 4.41 | 4.38 | 34.1 |
| GradNorm (last-layer proxy) | 0.44 | 0.17 | 0.995 | 4.42 | 4.40 | 35.4 |
| Uncertainty-based adaptive | 0.29 | 0.13 | 0.994 | 4.45 | 4.41 | 33.4 |
三种策略的重建质量接近,但损失幅度加权在段检索准确率上大幅领先,因此被采纳为联合训练的策略。
🔬 细节详述
- 训练数据:构建了一个约2300万条音视频片段的内部数据集,通过LLM生成音视频概念树→人工验证→LLM搜索查询→多重过滤(ImageBind语义对齐评分、Synchformer DeSync过滤、BEATs音频事件检测)得到,语料中语音与非语音样本各占一半。使用了AudioSet、LibriSpeech、MUSDB18等公开数据作为评估。训练T2AV模型时,使用Qwen3.5-VL生成视觉标题,使用两个自研的Qwen3-Omni微调变体分别生成音频标题和统一音视频标题。
- 损失函数:
- 视频重建:L1 + LPIPS + KL
- 音频重建:波形域损失 + 多分辨率Mel损失 + KL
- 语义蒸馏:Sigmoid-余弦损失
-log(sigma(cos(projected_z, teacher_f))) - 跨模态对齐:双向InfoNCE损失,学习温度参数
τ - 总损失:
L_v = λ_vr*L_vr + λ_vd*L_vd + λ_avclip*L_avclip,L_a同理。λ系数通过“对比学习锚定的损失幅度加权”策略动态调整,以平衡不同量级的损失项(详见§4.5.2消融)。
- 训练策略:
- 三阶段训练:Stage 1独立预训练两个VAE(含判别器),视频VAE训练250k步(121帧),音频VAE同样充分预训练以获取基础重建能力。Stage 2引入对比和蒸馏目标,移除判别器以节省显存,联合训练82k步(193帧,global batch size 256),采用先冻结视频VAE再解冻的两阶段调度。Stage 3冻结音频编码器,仅微调音频解码器并恢复判别器与特征匹配损失,以修复Stage 2移除判别器导致的电子伪影。
- 优化器/超参数设置:论文未明确说明优化器类型、学习率、warmup策略等具体超参数。
- 模型大小:推理时保留的音视频VAE共10.76亿参数(视频VAE 7.047亿,音频VAE 3.716亿);训练期专用模块共0.495亿参数(对比头0.205亿,蒸馏投影器0.29亿)。
- 关键超参数:视频潜变量4x时间、8x空间下采样。对比学习片段时长8秒,段数S=48,段长约0.17秒。教师模型为Qwen3-Omni的视觉编码器第27层和音频编码器第18层。
- 训练硬件:未说明。
- 推理细节:VAE推理无特殊策略。下游T2AV生成使用Flow Matching,先预训练单模态先验(T2I/T2V和T2A),再通过轻量级交叉注意力桥接耦合进行联合训练;推理时使用CFG指导因子5。
⚖️ 评分理由
创新性 (1.2/2):首次将跨模态对齐直接融入音视频VAE训练,提出段级对比学习与语义蒸馏双目标驱动,实现推理零开销的潜空间对齐,设计具有新颖性且互补效果显著([A_SUMMARY]3)。
技术严谨性 (1.0/1.5):核心设计合理,消融实验验证了组件有效性,但音频重建质量下降暴露出多目标联合训练的深层张力,论文缺乏对该张力的机制分析([A_SUMMARY]6)。此外,视频因果VAE去除首帧进行对比学习可能破坏因果性,未作深入讨论([A_LIMITS]审稿人发现的潜在问题)。
实验充分性 (1.0/1.5):消融实验详细(粒度、损失平衡),跨数据集重建及同步探针评估较全面。主要不足:下游生成仅与自身变体比较,未与嵌入同步模块的外部生成器公平对比([A_LIMITS]基线比较公平性);缺乏Stage 3修复阶段对对齐性影响的验证实验([A_LIMITS]修复阶段遗忘风险),同步评估局限在VGS-Sp,泛化性未充分验证([A_LIMITS]局限)。
清晰度 (0.8/1):整体结构清晰,但部分设计决策(如去除因果VAE首帧进行对齐)的影响未充分解释,造成读者理解上的不确定性([A_LIMITS]审稿人发现的潜在问题)。
影响力 (1.0/1.5):为音视频生成提供内置对齐能力的tokenizer,可减少下游模型学习同步的负担,有望成为全模态模型的基础组件,对跨模态生成领域有推动作用([A_SUMMARY]5)。
开源 (1.2/1.5):提供了开源代码仓库([A_OPEN])和模型权重(首页声明),核心推理产物完整,但训练数据为内部数据集未公开,文档完整性未详述,故未达到最高分。
可复现性 (0.1/0.5):虽给出三阶段训练流程和损失公式,但未明确优化器类型、学习率、warmup策略等关键超参数(细节详述),也未报告训练总时长和GPU消耗([A_LIMITS]训练成本),核心训练配置大量缺失,难以完整复现。
工程/实践价值 (0.8/1.5):推理零开销且接口标准,易于直接替换现有VAE,工程实用性较强。但训练流程包括多阶段、大规模数据过滤及复杂的损失平衡,对资源和数据要求高,限制其直接移植与推广([A_LIMITS]训练成本与数据依赖)。
🚨 局限与问题
1. 论文明确承认的局限:
- 引入对比学习训练会损害音频重建的感知质量(引入电子伪影),需要在后处理阶段用对抗训练进行修复。
- 当前的同步评估依赖于手头构建的数据集和探针任务,更广泛场景下的泛化能力有待验证。
- 未来工作需要探索更有效的跨模态和模态内语义学习方法,并在更大规模上验证收益。
2. 审稿人发现的潜在问题:
- 训练成本与数据依赖:论文提出了一套复杂的多阶段训练流程和专门的LLM数据管道(音视频概念树、多重过滤、三阶段训练),虽然效果显著,但其训练成本和对高质量对齐数据的严重依赖可能限制了其在小团队或资源较少场景下的复现与推广。论文未报告训练总时长或GPU消耗。
- 修复阶段的“遗忘”风险:第三阶段冻住音频编码器,仅对解码器进行恢复性微调,虽然修复了音质,但存在一种风险:解码器的微调可能会削弱第二阶段好不容易学到的、体现在编码器潜变量中的跨模态对齐性在解码过程中的表达。论文缺乏实验(如同步探针在Stage 3前后的对比)证明这一步骤未损害已建立的同步性。
- 视频编码部分的因果性破坏:论文提到视频VAE是因果的,第一帧与后续帧不同,并在蒸馏时分别处理。但在空间聚合对比学习时,却移除了第一个潜帧。这种对因果性的“破坏”是否会导致下游生成任务中潜在的动作模糊或未来信息泄露,论文未做深入讨论。
- 基线比较的公平性:下游生成实验仅与自身变体比较,这种方式证明了本方法的优化有效性,但无法得出它优于“使用独立VAE但下游生成器架构更好地学习同步”(如注入Synchformer特征)这一终极结论。与一个装备了强大同步模块的下游模型进行公平对比,会使其论证更具说服力。