英文题目:FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

会议身份:conference:interspeech:2026:conference-paper-id:wang26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据增强 #扩散模型 #多模态学习 #音视频 #视频到声音生成

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Shiyao Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xijuan Zeng:机构信息未能从会议 PDF 纯文本可靠映射
  • Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shiwan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Feng Deng:机构信息未能从会议 PDF 纯文本可靠映射
  • Chen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

视频到声音生成需以视频为条件合成时间同步且语义一致的高质量音频,难点在于跨模态时间对齐、多模态条件控制与细粒度语义精度难以兼得。FoleyGenEx以多模态扩散Transformer为骨干,先经DAC-VAE、CLIP与Synchformer分别编码音频潜变量、文本语义与视频语义同步特征。条件潜变量经输入嵌入层注入并与初始噪声求和融合,音频视觉同步流施加一致同步掩码与掩码区均方误差以解耦语义与同步,随后由单模态扩散Transformer经流匹配去噪生成波形潜变量。相对MultiFoley的上采样拼接与MMAudio缺乏参考音频分支,该通道拼接加残差求和与同步掩码设计保留了时序精度并显著扩展了风格迁移与音频编辑控制能力。在VGGSound测试集视频到声音生成任务下,FoleyGenEx的FDVGG指标为0.74,低于MMAudio的FDVGG指标0.97。其适用边界受限于8秒片段与特定数据集划分,副词泛化与长时一致性尚未验证。训练成本为在8张A100硬件上基座训练300000步约三天,含副词增强数据时扩展至330000步。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出是什么,哪些信息必须保留?

本文的输入是一段无声或需修复的视频,可选地附带文本提示与参考音频,输出是与视频时长一致的音频波形。对刚进入音频领域的研究生,先建立一个可复述的动作链:把视频切成图像序列,把文本送入语义编码器,把参考音频送入音频自编码器得到潜在,再由生成主干把噪声逐步变换为目标潜在,最后解码为波形。必须保留的信息有 3 类。第一是事件语义,即画面中是什么在发声,文本可以补充或改写它。

第二是时间对齐,即动作发生的帧时刻,声音的起振必须落在该时刻附近。第三是声学风格,即参考音频的音色、韵律与事件质感,在音频控制与续写任务中需要延续。论文要解决的矛盾是,已有路线往往只能保住其中一到两类:有多模态控制的路线上采样对齐较弱,有强对齐的路线缺少参考音频分支且对快慢、远近、轻重等副词不敏感。FoleyGenEx 的目标是在一个框架内同时给出 5 种可运行模式,并在保持同步的前提下让副词真正可控。

官方演示页当前可用,地址为项目页,文中明确写出演示样本可在该页获取,这为听感核对提供了入口,但听感不能代替指标核对。

同输入同目标的路线如何对照,不把类别差异当胜负?

按同输入、同目标、同监督来对照更公平。文本到音频路线只用文本控制背景与环境声,优点是文本自由度高,缺点是缺少视频语义与逐帧同步,因此不能直接与视频到音频比同步指标。基础视频到音频路线用视频的语义与同步特征生成对齐音频,适用于默片配音与破损音轨修复,但文本控制弱。

近期多模态控制路线试图兼顾,例如用目标视频加参考视频与参考音频做风格迁移,或用响度、频谱质心与音高概率控制韵律,或把上采样视频特征与参考音频潜在做通道拼接以支持风格迁移与续写。论文报告 MultiFoley 属于后者,其简单上采样在文中被指出会损伤时间同步。

另一条强同步路线以多模态扩散变换器为代表,通过联合注意力与同步编码器实现帧级对齐,但原文指出其缺少专用参考音频条件分支,难以完成需要精确匹配参考音色与事件的任务,且标准数据集缺少副词线索,难以支持快敲与慢敲、大声与小声等细微区分。因此跨类别比较时应分开看:同步用同步指标,风格用风格指标,语义用语义指标,不能用文本音频相似度去判定同步好坏,也不能用同步误差去判定音色是否像。

要回答的三个具体问题是什么?

第一个问题是如何在不破坏帧级对齐的前提下引入参考音频条件。直接把参考潜在与噪声拼接若无配套掩码与位置编码,训练时条件音频与其视频天然对齐,推理时参考与目标是随机裁剪拼接,模型会学到错误的静态对齐捷径。第二个问题是如何让文本与视频解耦。文本控制的视频到音频要求文本可以与画面不一致,例如猫张嘴的视频配狮吼文本,仍要吼声落在张嘴时刻,这要求语义与同步分开处理。第 3 个问题是如何让副词可学。

现有标注多关注名词与动作,缺少速度、距离与音量动态的成对样本,人工标注成本高,需要自动构造音频变换与对应字幕。3 个问题分别对应后文的条件注入机制、多模态动态掩码与副词数据增强,实验也按文本到音频、基础视频到音频、文本控制、音频控制与续写分别设协议,避免用一个总分掩盖短板。

一个样本如何走完输入到输出?

沿一个 8 秒样本走一遍有助于记住全景。视频侧同时走两条路,一条经视觉编码器得到语义特征,一条经同步编码器得到逐帧同步特征并投影上采样到音频帧率。文本侧经文本编码器得到语义特征,不做掩码,因为文本与音频没有逐帧对应。音频侧经预训练的音频自编码器得到潜在,训练时随机遮挡大部分,再与流匹配的中间状态拼接后经输入嵌入与卷积位置嵌入进入主干。

主干先过若干多模态扩散变换器块做 3 模态拼接与双向注意力,再过若干单模态扩散变换器块精修音频,最后预测流场并用欧拉离散迭代去噪得到目标潜在,解码为波形。训练损失只在被掩码选中的帧上计算,推理时参考潜在与初始噪声相加进入同一输入嵌入,使训练的上下文加掩码与推理的参考加待生成在形式上对齐。为对齐时长,推理会在目标视频前拼接一段代理视频,其不同步段经镜像掩码中和,避免污染目标段的对齐。

下面先看训练框架总图,重点是 3 路特征如何汇入多模态块与帧级条件如何旁路进入单模态块。

看图路径: 1. 从底部音频文本视频三路输入向上追踪到多模态块与单模态块再到顶部流输出;2. 对比左侧音频支路的掩码与输入嵌入与右侧同步支路的投影上采样与掩码;3. 查看右上角拼接与置零分支如何与中间状态汇合;4. 确认文本支路不做掩码而视频与同步支路做镜像掩码

原论文 Figure 2:FoleyGenEx training framework.

论文图 2。原论文 Figure 2:“FoleyGenEx training framework. ther ensures alignment between training and inference, miti- gating the synchronization degradation observed in MultiFo- ley.”。

该图显示底部 3 路分别经过各自编码与投影后进入中间的多模态块,右侧同步支路经投影上采样与掩码后一方面进入多模态块,另一方面与平均池化后的语义向量相加形成帧级条件进入上层单模态块。左侧音频支路的掩码潜在与中间状态经拼接与输入嵌入进入主干,顶部用掩码区域的误差做监督。这种画法把全局语义条件与逐帧同步条件分开,解释了为何文本可改写内容而不改变时刻。

再看 5 种任务如何用同一结构实现,关键是哪些模态置零、哪些模态提供参考。

看图路径: 1. 从左到右数出五个任务块并读出每块顶部进入的文本视频与音频特征;2. 观察全零特征在无条件模态位置的占位方式;3. 对比音频控制任务中参考音频与初始噪声的双路进入与参考同步特征的前置拼接

原论文 Figure 3:Multi-modal controlled audio generation tasks.

论文图 3。原论文 Figure 3:“Multi-modal controlled audio generation tasks.”。

该图从左到右依次为文本到音频、基础视频到音频、文本控制、音频控制与续写。前三者无参考音频分支,用全零占位;音频控制把文本与视频语义置零,参考音频潜在与噪声共同进入,并把参考同步特征拼在目标同步特征之前;续写把目标视频语义与同步连同前段参考潜在一起给出,只生成后段。这种统一靠开关特征实现,而非为每个任务另建模型,是复现时最应先核对的配置表。

语义与同步、注入与掩码各自做什么?

先把白话与英文名对齐。语义特征指回答是什么的向量,同步特征指回答何时发生的逐帧向量。多模态扩散变换器指为每个模态保留独立参数流、注意力内拼接多模态序列的变换器,单模态扩散变换器指只精修音频流的变换器。条件注入指把参考潜在经通道拼接与残差相加送入音频流的专用通路。潜在掩码指遮挡音频潜在的训练策略。

双线性映射掩码指对视觉语义按与音频掩码镜像的方式遮挡,以中和代理视频引入的错位。自适应层归一化指把全局向量与帧级向量作为条件注入各块的方式。

多模态扩散变换器 × 同步特征: 多模态扩散变换器负责把音频、文本与视频语义放在各自流中建模再拼接做联合注意力,实现跨模态信息流动;同步特征由 Synchformer 从图像序列提取逐帧对齐信号,负责告诉模型声音事件何时发生。二者搭配的原因是语义只回答是什么,同步只回答何时发生,组合后语义分支经平均池化与投影做全局条件,同步分支经上采样做帧级条件,共同经自适应层归一化注入,从而同时约束内容与时刻。

条件注入 × 潜在掩码: 条件注入负责把参考音频潜在与中间状态拼接到音频流中,为音色与事件提供可利用的上下文;潜在掩码负责在训练时遮挡大部分音频潜在,只对被遮挡帧计算损失,迫使模型学会从上下文补全。二者搭配是因为若无掩码模型可直接复制可见音频而忽略跨模态对齐,组合后训练目标变为上下文加掩码,推理目标变为参考音频加待生成段,二者形式一致,从而支持音频控制与续写。

语义特征 × 同步特征: 语义特征由 CLIP 文本编码器与 CLIP 视觉编码器提取,负责描述事件类别与场景内容;同步特征由 Synchformer 提取并投影上采样,负责逐帧的动作时刻。搭配的原因是把两类信息混在一起上采样会稀释语义密度并引入填充伪影,组合机制是对视觉语义做双线性映射掩码、对同步特征做同样掩码后再拼接,且语义经平均池化做全局向量,同步做帧级向量,分别注入,从而让文本可与视频解耦而不破坏对齐。

具体计算上,音频潜在先被随机跨度掩码选中部分帧,逐帧误差先在特征维平均,再只在被选中帧上按总掩码帧数归一化求和。文本不掩码,视觉语义做双线性映射掩码,同步特征做同样掩码后与平均池化投影后的语义拼接。全局条件与帧级条件分别经自适应层归一化进入多模态块,帧级条件再引导单模态块。论文还报告曾尝试先上采样视觉语义再掩码,但填充伪影稀释语义密度而效果不佳,因此最终采用先掩码再与同步拼接的顺序。

推理的音频控制任务把参考潜在同时做通道拼接与与初始噪声残差相加,并用裁剪或复制目标视频构造与参考等长的代理视频,其同步特征拼在目标之前,以满足主干要求音频时长与视频序列严格匹配的约束。

训练如何构造数据、如何掩码、推理条件如何对齐?

训练数据按视频到音频与文本到音频两类以严格 1 比 1 配比组成每批,避免偏向某类轨迹。视频到音频约 500 小时来自 VGGSound,视频截为 8 秒且保留最后 8 秒以去掉无关片头。文本到音频约 128 小时来自 AudioCaps 与约 7600 小时来自 WavCaps,AudioCaps 统一截为 8 秒,WavCaps 过滤无效文本后短于 16 秒截为 8 秒,长于 16 秒切为至多 5 段不重叠 8 秒以提高利用率并减少冗余。副词增强数据约 88370 条自建样本,经静音去除、变速、房间混响与包络缩放后由大语言模型生成新字幕并做转述增强,提示词放在项目页。

特征预计算为二进制文件以省去即时计算。基础训练 300,000 步,加入增强数据后延至 330,000 步以保持相当的数据遍历量, batch 为 256,学习率与调度沿用原多模态框架的大模型 44.1 千赫配置。推理用无分类器引导 scale 为 4.5 与 25 步流匹配,训练时以 10% 概率丢弃视频或文本特征以支持引导。 下面看音频控制推理的构造,重点是参考与代理如何配平。

看图路径: 1. 从底部参考音频经编码与掩码再与初始噪声相加的路径看条件如何进入;2. 观察底部代理视频与目标视频拼接后经同步编码器进入右侧帧级条件;3. 确认顶部输出分为参考音频段与结果音频段且只生成后段

原论文 Figure 7:The inference setup for the audio-controlled video-to-audio task.

论文图 7。原论文 Figure 7:“The inference setup for the audio-controlled video-to-audio task.”。

该图底部显示参考音频经编码掩码后与初始噪声相加进入输入嵌入,底部右侧显示代理视频与目标视频拼接后进入图像序列与同步编码器,顶部输出分为左侧参考段与右侧结果段。这种构造把时长配平问题显式化:参考多长就补多长代理视频,再用掩码让模型学会忽略代理段的不同步影响。

流匹配 × 掩码均方误差: 流匹配负责学习从初始噪声分布到真实音频潜在分布的连续变换场,用插值状态逐步去噪生成音频;掩码均方误差负责只在被随机跨度掩码选中的帧上计算逐帧误差并按掩码帧数归一化。搭配的原因是全局平均会让模型在未遮挡段走捷径,组合后梯度只来自需要补全的对齐段,从而优先重建与目标视频时刻一致的片段。

副词增强 × 大语言模型改写: 副词增强负责用信号处理制造速度、距离与音量动态的物理变化,例如变速、加混响与包络渐强渐弱;大语言模型改写负责把原始上下文与所加物理变换合成为新字幕并做同义转述。搭配的原因是仅有音频变换而无对应文本监督无法学到副词含义,组合后每段增强音频都有对齐的副词标注,从而让文本成为速度与强度等细粒度属性的主控制器。

为便于核对超参数与掩码概率,先把训练与推理中报告为具体数字的配置集中为一张表。表中数值与单位均来自原文连续句,裸值不擅自添单位,百分比保留原写法。

配置项数值适用阶段条件说明备注
基础训练步数与硬件300,000 steps,8 A100基础训练批量 256约 3 天
加入增强后训练步数330,000 steps增强训练保持遍历量相当批量不变
推理引导与步数4.5,25 steps推理流匹配采样生成音频样本
音频潜在遮挡比例70–100%训练随机掩码策略零样本泛化
掩码潜在置零概率30%训练与推理兼容拼接前置零无参考时兼容
视频或文本丢弃概率10%训练支持无分类器引导随机丢弃

上表把易混的 3 个概率分开:遮挡比例决定补全难度,置零概率决定无参考兼容,丢弃概率决定引导能力。复现时应先按此表固定,再调其他细节。下表把评测规模与人工核验集中呈现,用于判断结果的统计稳健性。

评测项规模数值任务构成说明结果与计算
文本到音频与视频到音频测试量964 samples,15,220 samplesTTA 与 VTAAudioCaps 与 VGGSound 测试集全量集
音频控制风格迁移生成量582 samples,194 clipsAC-VTA每段目标配 3 段参考2 秒目标段
增强数据人工抽检量300 entries数据质量每速度级 20 条,距离音量各 50 条对应关系核验
增强数据准确率超过 97%数据质量分层抽样可靠性判断
副词主观评测配比与分数386:66:48,3.965副词控制10 人 50 条共 500 次Score 公式计算

上表显示主观评测的 500 次来自 10 人乘 50 条,386 比 66 比 48 经公式得 3.965,在 77.2% 实例中增强版更符合副词描述。该结论支持副词监督有效,但它比较的是增强前后同一主干,而非跨模型的听感排名,引用时需保留该条件。

用什么数据、什么指标、比较条件是否一致?

数据划分按原文交代。续写评测从同步测试集随机选 1000 段 8 秒片段做主要评测,并报告全量集以排除采样偏差,目标是以前 3 秒为参考生成后 5 秒。音频控制评测沿用条件生成协议,在 Greatest Hits 上用 194 段 2 秒目标视频每段配 3 段参考共生成 582 段。文本控制用 13 个与视频语义无关的例子,置零视频语义以考验模态冲突下的解耦。视频到音频在 VGGSound 测试集 15,220 段上评测,并为与 MultiFoley 公平对比过滤掉图像绑定分数低于 0.3 的样本得 8702 段,带星号结果对应过滤子集。

指标方向需记牢:分布匹配用 VGGish 弗雷歇距离越低越好,音频质量用 PANNs 起始分数越高越好,语义对齐文本到音频用 CLAP 文本音频余弦越高越好、视频到音频用图像绑定分数越高越好,时间对齐用同步器预测的音视频错位秒数越低越好,音频控制另用起振同步平均精度越高越好、风格相似用说话人编码器类余弦越高越好、参考与生成语义一致用音频对音频余弦越高越好。副词分布匹配另用两类库尔贝克散度越低越好。

所有模型生成 8 秒片段,对比的开源基线用公开实现重跑,文本到音频基线结果引自原框架报告。硬件预算只报告了 8 卡 A100 与步数,未报告推理延迟与逐步耗时,因此不能从训练时长推定部署成本。

主结果测了什么,谁在什么条件下更好?

文本到音频在 AudioCaps 测试集上比较分布、质量与语义,论文报告 FoleyGenEx 在分布匹配与语义相关上优于原多模态基线并保持有竞争力的质量,加入副词增强后进一步提升。视频到音频在 VGGSound 全量与过滤子集上比较分布、质量、语义与同步,论文报告在分布与质量上一致改进,同步保持竞争,相对 MultiFoley 在各维度有显著优势。

文本控制任务上语义相关与同步均优于 MultiFoley,频谱分析举例在鸟张嘴 1.804 秒处即使文本为其他动物叫声仍能生成准时音频,而对比方法只在文本与动作匹配时才生成对应谱特征,这支持语义与同步分离处理的有效性。音频控制任务上时间对齐、分布、风格与语义四项均取得稳健表现,虽然音频对音频余弦略低于在同域 Greatest Hits 上专门训练的条件生成模型,但本文方法为零样本泛化,该差异不能读作同条件失败。

续写任务上在 4 种输入组合与全量集上均显著超过 MultiFoley,尤其同步误差更低,而原同步强基线因缺少参考注入与多模态掩码难以保持风格延续。副词增强在两主干上均带来分布与语义的一致提升,主观盲测 10 人 500 次中增强版明显更符合副词。重提结果时要加新对照:同步好的模型不一定风格延续好,风格拟合好的同域模型不一定零样本可迁移,副词好的前提是增强前后同主干比较,这些边界决定了选型时的取舍。

掩码与注入的对照说明了什么,反例在哪里?

消融比较 3 种掩码训练策略。第一种只在音频分支掩码,第二种在音频、视觉与同步 3 流做多模态掩码,第 3 种在音频分支掩码上加输入嵌入模块。

音频控制任务上多模态掩码在起振同步上持续优于纯音频策略,即使后者配了输入嵌入,原文解释为多模态策略迫使模型区分参考音频线索与代理视觉特征,而纯音频训练因条件音频与其视频天然对齐会形成捷径偏置,推理遇到随机裁剪拼接便假设静态对齐仍成立,导致同步失败且在相同测试下不如基线配置。风格迁移上三者相对原基线均有音色语义改进,而输入嵌入使语义指标明显提升,甚至超过使用真实参考视频的理想基线。

续写任务上因参考与目标天然对齐,时间对齐在各策略下本就稳定,但输入嵌入仍能提升参考段与生成段的风格延续。未胜出项也要保留:纯音频掩码在同步上未胜出,加输入嵌入也不能完全弥补缺失多模态掩码的损失;续写中无参考的配置未报告完整对比,不能推广到无条件续写。部署含义是若目标是换音色且保时刻,应优先保留多模态掩码;若目标只是同段延续,输入嵌入的收益更直接。

哪些边界未评测,哪些推测不能当结论?

论文直接报告的是指标与受控主观评测,有限解释是对捷径偏置与填充伪影的机制分析,未验证推测是更长时长、更复杂混音与实时延迟的表现。缺失证据不是技术错误,但引用时要用可能与待验证表达。相关性不等于因果,例如增强数据与指标提升同时出现支持有效,但不能断言每条副词都同等改善。未测量误判率、推理延迟与输出帧率,总体趋势不等于每组每步成立。

数据方面增强集经 300 条抽检准确率超 97%,但仍有少量错配可能,文本转述的多样性也可能引入语义漂移。续写全量集虽报告了稳健性,但参考质量差或代理视频构造极端时的行为未系统评测。音频控制的零样本结论限于 Greatest Hits 协议,不能直接推广到音乐或语音韵律迁移。复现时若发现同步好但音色不像,应先检查参考注入与掩码是否同时启用,而非只调引导 scale。

复现先做什么,需要哪些信息条件?

先按信息条件准备。代码层面文中给出多模态框架、音视频评测工具与基线仓库链接,资源状态均为可用且状态码 200,可作为起点;演示页可用可试听,但不能当训练代码。权重与数据层面需区分代码开源、权重下载与系统可运行,原文未明确给出本模型权重下载方式,复现应先用公开基线重跑 8 秒生成流程,再接入自建注入与掩码。

数据层面按 1 比 1 配比组织视频到音频与文本到音频,视频保留最后 8 秒,文本到音频按短截长切规则处理,副词增强按先去首尾静音再变速、混响与包络缩放最后生成字幕的顺序执行,工具分别用通用音视频处理、变速、房间声学与包络工具,字幕提示词以项目页为准。训练先固定批量 256、基础 300,000 步与增强 330,000 步、遮挡 70 到 100%、置零 30%、丢弃 10%、推理引导 4.5 与 25 步,再核对掩码只监督被选中帧。

评测先复现分布、质量、语义与同步 4 维,再做文本控制 13 例、音频控制 582 例与续写 1000 例及全量集,避免只跑单一指标。常见误解是把自动指标当人评,或把不同指标差值放在模型列下比较,或把过滤子集与全量集混比,复现报告应写清数据集、基线、阶段、指标、单位与聚合对象。

何时值得尝试,还需补哪项验证?

当任务同时需要换内容、保时刻与学副词时值得尝试该统一框架,例如默片配音需改叫声类别但保张嘴时刻,或用一段金属敲击为切菜动作配音且保节奏,或需区分快慢轻重远近的细粒度文本控制。当只有纯文本到音频而无视频时,可退为文本模式,但同步指标不再适用。当已有强同步基线而缺参考控制时,优先补条件注入与多模态掩码,而非只加参考拼接。

还需补的验证包括推理延迟与显存开销、长于 8 秒的连贯性、嘈杂多声源下的误触发率,以及副词在未见名词上的泛化。收束一句话:用开关特征统一 5 种任务是工程优点,用掩码对齐训练与推理是同步关键,用物理变换加语言模型补副词监督是语义精度的来源,三者缺一则只能保住部分目标。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总