英文题目:Cinematic Audio Source Separation Using Visual Cues

会议身份:conference:cvpr:2026:conference-paper-id:Zhang_Cinematic_Audio_Source_Separation_Using_Visual_Cues_CVPR_2026_paper

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #环境声 #音乐 #语音 #音视频声源分离

评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Kang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Suyeon Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Arda Senocak:机构信息未能从会议 PDF 纯文本可靠映射
  • Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

电影音频源分离(Cinematic Audio Source Separation,CASS)需将单声道混合音分解为对白(DX)、音效(FX)与音乐(MX)三轨,难点在于三者频谱重叠严重且真实电影缺乏孤立分轨真值。作者用大规模野外数据合成训练对:以LRS3唇同步人脸视频配对白,以VGGSound事件视频配音效,以FMA无视频音乐混合,构造双视频流监督。再由冻结的人脸编码器与场景编码器抽取特征,经独立投影与融合得到视觉条件向量,输入基于卷积U-Net的向量场估计器。最后以条件流匹配(Conditional Flow Matching,CFM)从高斯噪声联合生成三路频谱,并用逆短时傅里叶变换恢复波形。在自建的60秒级AVDnR测试集上,该模型以平均FAD 0.84超过最强的BandIt的2.15,同时MOS达到3.90显著领先,真实电影MOS 4.13亦领先BandIt的3.78。该结论依赖合成分布与16 kHz单声道设定,对多说话人重叠、强混响影院母带及长时一致性的外推尚未验证。训练需4张RTX 4090运行60万步,推理默认128步欧拉积分,计算开销明显高于判别式基线。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

电影混音为什么难只靠声音拆开?

输入是一段电影的混合音频与同期视频,目标是恢复 3 路波形:对白、音效、音乐。论文把混合写作 3 路相加,任务示意是把左侧一条彩色混合波形经中间分离模块变成右侧 3 条独立波形。对白通常是间歇性语音,音效是与动作绑定的突发声,音乐是连续铺底,三者在频谱上大量重叠,仅靠声音的能量与音色难以判定归属。必须保留的信息是视觉与声音的同步关系:说话时嘴唇运动,铃铛、动物、车辆出现时对应音效出现。输出是 3 路可独立控制的波形,用于配音、重制与无障碍增强。

电影音频源分离 × 视听电影音频源分离: 电影音频源分离负责把一路混合波形拆成对白、音效、音乐三轨,视听电影音频源分离则额外要求利用同期画面提供归属约束,二者搭配的原因是电影中唇动与发声物体动作与声音高度同步,组合意义是用视觉指明哪部分能量该归哪一轨,从而减少纯音频模型在语义相近成分间的错放。

下面先看任务全貌图,左侧是电影画面加混合波形,右侧是三轨输出,中间是分离模块,该图建立后文所有组件的输入输出约定。

看图路径: 1. 先看左侧混合视频与混合波形包含的三种图标,再看右侧三条分支的命名与颜色;2. 确认中间黄色模块的输入是一路混合,输出是三路独立波形;3. 对比三路输出波形的疏密差异,理解对白间歇性与音乐连续性的区别

原论文 Figure 1:Illustration of the Cinematic Audio Source Separa- tion (CASS) task.

论文图 1。原论文 Figure 1:“Illustration of the Cinematic Audio Source Separa- tion (CASS) task. The audio stream from a movie is separated into distinct tracks: speech, sound effects, and music.”。

该图显示输入为一路混合视频与音频,输出为对白、音效、音乐 3 路波形,右侧 3 路用不同颜色与图标区分,中间黄色方框只做一路进 3 路出的映射,不包含具体网络结构。这意味着后文方法必须解释条件从何而来、生成器如何 1 次输出 3 路,以及没有真实电影分轨时如何构造监督。

初学者如何用一句话复述方法链条?

用可核对的动作复述:取野外语音的人脸视频做对白监督,取野外事件的场景视频做音效监督,取纯音乐做铺底,3 路按电影响度混成一路混合;训练时把 3 路频谱拼成联合目标,用混合频谱加融合视觉条件去学习从噪声指向目标的向量场;推理时从同一段真实电影裁出人脸流与全景流,不改结构,用欧拉积分 1 次生成 3 路频谱再转回波形。记住 3 个易错点:音乐没有直接画面,靠排除与分布先验归属;预测模型信干比高不等于听感好;合成指标好不等于真实电影同等好,后者需人评与错放率共同佐证。

已有路线在输入与监督上各缺了什么?

同输入同目标的路线是电影音频源分离。早期除噪重制数据集把任务形式化为 3 路分离,随后有频带切分循环网络等纯音频方法,多语言与非语言扩展主要改进数据与混合流程,但始终只用混合音频做输入,没有使用画面。另一条线是通用视听分离,证明唇动、人脸、乐器动作与场景外观能改善语音、音乐与通用声音分离,但多数工作只用单一视觉线索服务单一目标,例如只用人脸服务语音,或只用物体外观服务对应声。

预测式分离 × 生成式分离: 预测式分离负责直接估计掩蔽或波形以最小化重构与信噪比损失,生成式分离负责学习干净音频的分布并采样出听感自然的样本,二者搭配比较的原因是前者在信噪比类指标上占优但易过平滑,后者在分布与听感指标上占优,组合对照意义是说明该工作选择生成路线是为了得到可用于配音与重制的自然音频。

第 3 条线是流匹配与扩散生成。论文指出掩蔽式预测模型易产生频谱空洞,不利于后期编辑,而流匹配以更短的生成轨迹实现高效采样,已在语音合成、增强与分离中得到应用。本文的差别在于把条件流匹配用于 3 路联合生成,并同时引入面部与场景两路视觉,而不是单目标单线索。这一定位决定了实验必须同时对比纯音频电影分离基线与视听通用分离基线,才能说明视觉的使用方式而不仅是有无视觉带来了增益。

与同输入同目标的工作如何对照而不误判?

对照必须按同输入、同目标、同监督与同运行阶段进行。纯音频电影分离与本文是同目标不同输入,前者无画面,后者有双流画面,不能把本文在视听条件下的胜负直接解读为纯音频主干的胜负,纯音频变体的对照才是同条件比较。通用视听分离与本文是部分同输入不同目标,前者多为单目标单线索,后者为 3 路多源,前者在音效单项占优不能推广为电影三轨更优,本文表中的音乐错放率反例正是边界。生成与预测的对照是同目标不同优化哲学,指标方向相反时应分别报告分布与信噪比两类结果,而非只取一类定胜负。

一个样本从输入到输出要经过什么?

沿一个训练样本走完全程有助于固定符号。记混合波形为混合,对白、音效、音乐 3 路为各自波形,混合等于三者相加。所有波形转成频谱后,混合频谱记为混合条件,3 个干净频谱组成联合目标。视频记为包含面部帧序列与场景帧序列的两部分。视觉提取器把两路帧序列变成一个融合视觉条件,流模型以混合频谱与该视觉条件为条件,把高斯噪声映射为 3 个估计频谱,再经逆短时傅里叶变换回到波形。

推理时真实电影只有一段视频,做法是从同一段视频中裁出人脸区域作为面部流、保留全画面作为场景流,网络结构不变。教学例子:若画面中出现鸟且频谱高频出现上扬的鸣叫纹理,面部流无说话动作,模型应把该纹理归入音效而非音乐或对白,这正是后文定性图要检验的行为。

还有哪些未评测边界需要后续补验证?

原文明确留白的边界包括:多说话人重叠与非语言人声的系统评估、音乐有画面时的行为、长视频剪辑点处的时序稳定性、不同响度标准下的鲁棒性,以及推理步数、显存与延迟的联合成本曲线。统计层面,人评样本为 30 段真实片段,置信区间已给出但未报告评分者数量与一致性;合成集为 1K 条 60 秒,聚合方式为跨三轨平均,语音质量只评对白轨,跨指标差值不能混入模型列比较。这些缺项不是技术错误,但在引用结论时需用支持与可能等措辞区分已验证与待验证部分。

整体架构如何把两路画面变成三路声音?

架构分为三栏:左侧是独立可得的来源,中间是数据合成,右侧是视听分离模型。左侧提供带画面的语音、带画面的音效与纯音乐;中间把 3 路音频按响度规范混成混合音频,并保留两路视频;右侧上方是波形转频谱与噪声到频谱的生成通路,下方是面部编码器、场景编码器与融合模块构成的视觉通路,两条通路在向量场估计器处汇合,输出 3 路估计频谱。下图是理解该汇合位置的关键,阅读时注意条件箭头指向估计器的交叉注意力位置。

看图路径: 1. 从左到右追踪独立来源、数据合成、模型三栏的箭头主路径;2. 观察下方视频帧经面部与场景编码器汇入融合模块再进入向量场估计器的条件通路;3. 对比上方波形转频谱与下方视频特征在估计器处汇合的位置

原论文 Figure 2:Architecture of AV-CASS.

论文图 2。原论文 Figure 2:“Architecture of AV-CASS. The fusion module integrates visual features from the facial and scene encoders into cV , which serves as a conditioning input along with a mixture audio…”。

该图右侧显示混合频谱与中间带噪频谱进入上方绿色估计器,融合视觉条件从下方蓝色视觉特征提取器向上输入估计器,右侧输出 3 路生成频谱。左侧两栏显示混合音频由 3 路独立音频经重制得到,双流视频分别来自语音与音效的原始画面,音乐无对应画面。这种安排的理由在正文中明确写出:真实电影的干净分轨难以获得,只能用野外数据合成出带真值且符合电影视听惯例的训练对。

视觉编码与融合具体做了什么计算?

面部帧与场景帧分别送入两个冻结的编码器。面部编码器沿用为唇同步语音设计的结构,场景编码器基于时序语义对齐的 sounding 物体事件模型,二者在训练中保持冻结。输出是两组时序特征序列,各自有帧数与特征维度。融合时先用两个独立多层感知机把两路特征投影到同一通道维度,再沿时间轴拼接,最后经一个融合多层感知机得到视觉条件向量。该向量经交叉注意力注入基于卷积的 U 形网络主干。

条件流匹配 × 向量场估计器: 条件流匹配负责定义从高斯噪声到 3 路干净频谱联合分布的时间相关概率路径与训练目标,向量场估计器负责在每个中间时刻预测沿路径的前进方向,二者搭配的原因是生成式分离需要可学习的连续输运方向,组合意义是以混合频谱与视觉条件为输入逐步积分得到 3 路频谱,避免掩蔽法常见的频谱空洞。

生成部分把 3 路频谱沿通道拼接成联合变量,定义噪声分布到目标联合分布的条件映射。训练时在噪声样本与数据样本之间按时间插值构造中间点,目标向量场为数据减噪声,估计器以混合频谱与视觉条件为条件去拟合该方向,时间步从对数正态分布采样以加重中间时刻。推理时从高斯噪声出发,用前向欧拉法迭代更新,每步加上步长乘以估计的方向,共迭代固定步数后得到 3 路频谱。论文明确给出训练用 600k 步、批量 8、4 卡、评估用 128 步等设置,采样步数的影响在后文单独测量。

面部编码器 × 场景编码器: 面部编码器负责从人脸帧序列提取与唇动同步的对白线索,场景编码器负责从全景帧提取发声物体与事件的时序语义特征,二者搭配的原因是对白与音效在画面中占据不同空间与语义区域,组合意义是经投影与拼接融合为一个视觉条件向量,同时约束两类音源的归属。

冻结与更新的划分需要如实记录:两个视觉编码器冻结,融合模块与向量场估计器参与训练;训练先做纯音频暖机稳定优化,再用零初始化卷积逐步引入视觉,策略上遵循控制网络的做法。原文未给出融合维度与 U 形网络通道数等完整超参数,这是复现时需要补看附录或代码的缺项,不能从编码器名称推定其内部实现。

没有电影分轨时训练对如何造出来?

训练数据构造是本工作的可复述核心,因为它替代了不可得的电影分轨监督。对白选用唇同步视频数据集,音效选用带画面的日常事件数据集,音乐选用纯音乐数据集。对白与音效数据先用语音音乐活动检测模型过滤,保证每段只含单一干净声轨,过滤后得到约十万量级的对白片段、数万量级的音效与音乐样本。每条训练样本的做法是:从对白库取语音片段并取出对应人脸视频作为面部流,从音效库取片段并取出对应场景视频作为场景流,从音乐库取片段无画面,3 路经拼接、重叠过渡与响度归一化后相加成混合。音频统一为单声道并重采样到 16 kHz。

双流视频合成 × 音频重制混合: 双流视频合成负责为每条训练样本同时准备面部流与场景流,音频重制混合负责把对白、音效、音乐三轨按响度规范叠加成混合输入,二者搭配的原因是真实电影的分轨不可得而野外视听数据可分别获得,组合意义是构造出带真值的可控训练对,使模型学到脸对对白、场景对音效的对应关系。

该流程产生每样本包含一路混合、3 路真值与两路视频的结构,测试集按同样流程构造但严格划分来源片段不重叠,形成 1K 条、每条 60 秒的视听测试集。论文报告该合成数据训练的模型可直接用于真实电影而无需改结构,支持该判断的证据是后文真实电影的主观与错放率结果,但合成与真实在混响、响度与画面剪辑上的差距仍是适用边界,阅读时不应把合成指标直接等同于真实电影性能。

用什么数据、基线与指标才能公平比较?

评估围绕 3 个问题组织:真实电影能否泛化、合成可控集上是否全面占优、去掉画面后是否仍具竞争力。基线包括电影分离的早期多分辨率模型与频带切分网络、乐器分离的混合频谱波形与混合变换器模型、多源扩散模型,以及视听通用分离的当前流匹配模型,所有模型在同一合成训练集上从零训练并按各自原始配置适配 3 路任务。指标方向需先固定:弗雷歇音频距离与库尔贝克散度越低越好,反映生成与真实分布的接近程度。

语音质量感知评估越高越好,只评对白轨;尺度不变信干比提升越高越好,但预测模型因直接优化重构损失天然占优;错放率越低越好,用预训练声音事件检测模型估计非目标残留,无需真值即可在真实电影上计算。主观平均意见分越高越好,真实电影选自浓缩电影数据集并人工确认三轨俱全,共 30 段,因无真值只能做人评。训练实现上先纯音频暖机再引入视觉,优化器为亚当、学习率固定,评估采样 128 步,这些条件是复现对齐的关键。

主结果显示了什么收益与什么代价?

在合成视听测试集上的比较问题是:在相同训练数据下,视听生成模型能否在听感与分布指标上超过预测模型与单线索视听模型,同时保持可接受的信噪比。公平条件是所有方法同数据从零训练,指标方向如上节所述,下表保留预测与生成两类必要基线与可运行的纯音频变体。

方法是否用视觉弗雷歇音频距离越低越好库尔贝克散度越低越好信干比提升越高越好对白语音质量越高越好错放率越低越好
混合频谱波形分离否2.051.0313.572.165.24
混合变换器分离否2.081.0613.412.069.23
多分辨率电影基线否3.471.6710.601.8914.91
频带切分网络否2.151.1414.402.154.65
多源扩散模型否2.902.9011.632.125.65
通用视听流模型是5.941.649.251.9612.14
本文视听模型是0.840.9312.322.261.84
本文纯音频变体否1.631.1512.232.082.01

表后解释需要同时给出收益与代价。本文视听模型在分布与听感四项上为最好,错放率也最低,支持双流视觉提供了源特定的归属约束这一判断。代价是信干比提升低于频带切分网络与混合频谱模型,这与论文引用的已知现象一致:预测模型直接优化信噪比类损失因而数值更高,但输出易过平滑。未胜出项是通用视听流模型在该任务上全面落后,说明不是有视觉就够,而是需要为 3 路任务设计的双流与多源形式;纯音频变体虽弱于完整模型但仍优于多数基线的分布指标,说明生成式主干本身亦有贡献。

真实电影样本的可视化进一步说明错放行为。顶部为面部流与场景流,黄色框标出自行车铃铛,下方按混合、基线与本方法分行显示三轨频谱,虚线框表示被错放入非目标轨的成分。

看图路径: 1. 先看顶部面部流与场景流中自行车铃铛所在的黄色框位置;2. 再按行对比混合、基线与本方法在对白轨虚线框内的残留差异;3. 观察音效轨中黄色实线框的保留情况与粉色虚线框所示的语音串扰

原论文 Figure 4:Comparison of MRX, BandIt, and AV-CASS on a real-world movie sample.

论文图 4。原论文 Figure 4:“Comparison of MRX, BandIt, and AV-CASS on a real-world movie sample.”。

该图可见基线在对白轨残留铃声与欢呼能量,频带切分网络的音效轨还出现语音伪影,而本方法把铃声与欢呼更干净地归入音效轨,对白轨更干净。这种单样本可视化不能推广为全集结论,需结合下节真实电影的人评与错放率数值一起理解。

去掉一路视觉或减少采样步数会发生什么?

消融要回答视觉各路的分工与采样成本。论文报告只加面部流、只加场景流与双流齐备的 3 组对照,以及采样步数从小到大的曲线。先看合成集上的采样步数趋势,左图为分布距离随步数下降,右图为信干比提升随步数下降,二者方向相反是理解代价的关键。

数据集与方法弗雷歇音频距离越低越好库尔贝克散度越低越好信干比提升越高越好对白语音质量越高越好错放率越低越好
标准集混合频谱模型3.661.479.192.034.77
标准集混合变换器3.721.378.591.959.14
标准集多分辨率基线5.011.777.481.7816.56
标准集频带切分网络2.751.557.681.973.67
标准集多源扩散6.251.549.092.075.33
标准集本文纯音频变体1.951.338.101.932.13

表前问题是:当视频不可用而退化为纯音频时,本文方法在标准纯音频榜上是否仍可运行。公平条件是同合成数据训练后直接测标准集,指标方向同前,表中保留可运行的纯音频变体与多个预测基线。表后解释是:纯音频变体在分布距离与错放率上仍具优势,支持生成式主干带来自然度收益,但信干比仍非最高,且该表只覆盖标准集的平均值,未按对白、音效、音乐分轨展开,这是适用边界。

鸟鸣样本用于说明视觉分工。顶部场景流黄色框标出鸟,混合频谱高频有上扬鸣叫纹理,下方分行显示真值、纯音频变体、通用视听基线与本文模型的三轨估计。

看图路径: 1. 先确认顶部场景流中黄色框标注的鸟与混合频谱的位置对应关系;2. 对比纯音频模型把鸟鸣放入音乐轨的虚线框与视听模型放入音效轨的实线框;3. 观察另一视听基线在音乐轨中残留语音的粉色框,理解单视觉线索的局限

原论文 Figure 5:Comparison of our audio-only model (Ours-AO), DAVIS-Flow \\[29\\], and our audio-visual model…

论文图 5。原论文 Figure 5:“Comparison of our audio-only model (Ours-AO), DAVIS-Flow [29], and our audio-visual model (AV-CASS) on a clip from the AVDnR testset.”。

该图像素显示纯音频变体把鸟鸣错放入音乐轨的虚线框,两个视听模型均能将其保留在音效轨实线框,但通用视听基线在音乐轨残留语音的粉色框,本文模型三轨更接近真值。这支持面部与场景各管一路的解释:面部约束对白,场景约束音效,音乐无直接画面需靠排除法。论文的数值消融亦报告双流齐备时综合最好,单加一路各有提升,但原文未给出该消融的完整逐格可引用数字,本节不硬写其数值,仅保留方向性结论作为待补验证项。

哪些结论证据不足或存在冲突?

需要区分直接报告、有限解释与未验证推测。直接报告的是合成集分布与听感指标最好、真实电影人评更高、纯音频退化仍具竞争力。有限解释的是视觉减少语义串扰,因为错放率依赖预训练事件检测模型,其本身存在误检,且真实电影无真值,低错放率支持但不证明完全隔离。未验证的是延迟与成本:论文给出训练步数、批量与显卡型号,但未报告推理耗时、显存峰值与输出帧率,不能承诺实时性改善。

采样 128 步带来质量的同时必然增加计算,步数曲线显示分布距离随步数单调改善而信干比随步数下降,因此总体趋势不等于每一步都同时变好。数据层面,合成数据的响度归一化与重叠拼接只是近似电影母带流程,真实电影的混响、剪辑与多说话人重叠未被系统评估。资源状态方面,原文提及代码与演示链接,但本次收到的资源状态为空,不可写作已公开或可用,复现应以论文附录与实际可达链接为准。

要复现先做什么、按什么顺序检查?

先准备 3 类数据:唇同步语音库、带画面音效库与纯音乐库,并用语音音乐活动检测过滤出干净单源片段,统一单声道与采样率。接着按对白取脸、音效取场景、音乐无画面的规则合成混合与双流视频,严格划分训练与测试来源不重叠,复刻 60 秒测试条目。再搭建冻结的面部与场景编码器、投影融合模块与通道拼接的卷积 U 形向量场估计器,先纯音频暖机稳定,再用零初始化卷积逐步引入视觉。

训练用固定学习率与长步数,评估固定 128 步并记录分布、语音质量、信干比提升与错放率 4 类指标。检查顺序建议:先确认混合等于三轨相加且响度流程一致,再确认双流时间戳对齐,再确认冻结参数不更新而融合与主干更新,最后在合成集上对齐趋势后才看真实电影人评。若视觉无增益,优先检查时间对齐与冻结设置,而非直接增大模型。

何时值得尝试这种双流生成式分离?

当任务是电影级三轨可编辑分离、且有同期画面可用时值得尝试,尤其对白与音效在频谱上重叠但画面归属明确的片段,例如人群欢呼与自行车铃同时出现时的人声提取。真实电影的人评与错放率对照如下:人评越高越好,错放率越低越好,下表同时保留主观与客观两类证据,避免把自动指标当成人评。

评估对象平均意见分越高越好对白错放率越低越好音效错放率越低越好音乐错放率越低越好
通用视听流模型未报告人评5.8814.5835.94
本文视听模型4.130.4619.810.32

表后解释是:本文模型人评最高且在对白与音乐错放率上最低,支持听感与隔离的综合优势;代价是音效错放率并非最低,通用视听模型在该单项更低但其音乐错放率很高,说明单目标设计顾此失彼。结合前文采样曲线,若部署受限可降至 32 步左右仍可能超过次优分布基线,但需接受信噪比类指标的进一步变化,实际取舍应按重制任务更看重自然度还是数值保真来决定,还需补测延迟与显存后才能定稿。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 12 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 cvpr-2026 论文汇总