英文题目:TV-AudioRemover: Joint Text-Visual Guided Sound Removal with Multi-Task Hard-Mixture Curriculum
标签:#音视频声源分离 | #课程学习 | #多任务学习 | #音视频 | #基准测试
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Xinyue Guo:MiLM Plus, Xiaomi Inc.
- Jianxuan Yang:MiLM Plus, Xiaomi Inc.
- Daiguo Zhou:MiLM Plus, Xiaomi Inc.
- Jiagao Hu:MiLM Plus, Xiaomi Inc.
- Yuxuan Chen:MiLM Plus, Xiaomi Inc.
- Fei Wang:MiLM Plus, Xiaomi Inc.
- Jian Luan:MiLM Plus, Xiaomi Inc.
📌 核心摘要
输入为经视频擦除得到的编辑后视频、原始混合音频与自然语言指令,输出为仅抑制被删目标声而保留其余成分的音频,难点在于声学成分与视觉实体对齐模糊且提取与删除语义互斥易混淆。方法先以Qwen3-Omni音频优先结构化标注加SAM Audio分割与CLAP、PC分数和SAJ过滤构建单目标视听对齐库并在线合成为混合目标对,为模型提供可控监督。接着多模态扩散变换器将混合隐变量与噪声隐变量拼接去噪,并以任务令牌携带任务极性与模态专用全局调制区分保留与抑制意图。相比仅文本驱动的编辑模型,该视觉同步与任务极性设计提供更强语义接地与时间同步线索,兼顾目标抑制与非目标保留。最后多任务联合学习提取、删除与联合编辑以强化任务边界,再由语义远混合预训练到语义近难混合微调提升细粒度辨别。在AV-Remove-Bench基准下,TV-AudioRemover的TSSR指标为0.635,高于SAM Audio的TSSR指标0.354。该结论适用边界限于6秒左右的双发声体或前景加稳态背景场景,对视觉相似说话人重叠语音仍脆弱。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 演示资源:https://yjx-research.github.io/TV-AudioRemover/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
视频删掉了人,声音为什么还在?
这篇论文要解决的输入很具体:一个已经做过视觉物体移除的已编辑视频,一段原始混合音频,以及一句自然语言指令。目标输出是一段保留音频,它压制与被删视觉物体相关的目标声音,同时完整保留与保留视觉元素无关的其他声音。必须保留的信息包括三点:视觉条件来自删后视频而不是原视频,文字指令说明操作意图,原始混合音频提供重建所需的声学材料。
举例来说,画面删掉狗而留下猫,音频就要压住狗吠而留下猫叫,而不是整体静音或重新生成一段配乐。整体静音会破坏背景氛围、语音或音乐,完全重生成则容易改变混响、时序和声源身份。论文把这个问题定位为选择性声学擦除。已公开的演示页当前可用,地址为官方项目页,本文的事实核对以论文正文证据为准。
对刚入门的读者,先把任务边界说清。视频修复只管像素,不管声音;纯文字音频编辑只用文字加混合音频,不用删后视频;视听联合编辑多是做替换或风格迁移,不是为删除定制。删除任务的查询语义是反的:查询描述的是要排除什么,而不是要保留什么。这一点决定了后文的数据构造必须能合成混合与目标对,架构必须区分可保留与可压制,训练必须让模型分清提取和删除两种相反极性,评测必须同时看压制和保留。
三条相邻路线各缺了哪一块?
第一条路线是视频物体移除。论文提到的方法能擦除目标并补出时序连贯的遮挡区域,有的还处理阴影、反射和光照副作用。但这些方法输出的是视觉上合理的视频,原音频轨道不动。用户期待的是跨模态消失,所以需要在视觉移除之后接一个可独立优化的音频移除模块,而不是把视听耦合死。
第二条路线是音频编辑。纯文字路线只用文字和混合音频,没有视觉线索;视觉条件路线多是做声源提取或分离,查询指定要保留谁。这与删除任务相反。论文明确指出,多数分离系统为提取优化,查询语义是保留目标,而移除要求查询描述要排除的内容。直接把提取模型拿来做删除,需要改写任务,例如把多声源情形改写为提取要保留的源,把前景加背景情形改写为提取要删除的源再取残差,但这不是为删除和残差保真原生优化的。
第三条路线是视听联合编辑。一类用共享文字指令同时改画面和声音,没有充分利用模态间交互,且更适合把猫换成狗这类替换;另一类先改一个模态再引导另一个模态,模块紧耦合,第一阶段误差会放大,且难以单独替换或优化音频模块。论文的选择是解耦的即插即用下游音频移除器:接受任意视觉移除方法的输出,只优化音频模块,便于复用强大的视觉移除模型并隔离故障来源。
把一个样本走通:输入、表示、目标各是什么?
沿一个样本走一遍。输入是三元组:已编辑视频、原始混合音频、指令。已编辑视频经编码得到语义视觉特征与同步感知视觉特征;指令经文本编码得到指令特征,再叠加任务身份;原始混合音频经音频编码得到混合隐变量。
模型在去噪过程中把当前噪声隐变量与混合隐变量在通道维拼接,作为音频输入投影,然后在多模态扩散变换器中让 3 路特征交互,最终输出目标音频隐变量并解码为波形。监督来自合成的混合与目标对:混合是目标加干扰,目标是按任务模式定义的应保留部分。
这里的难点有两层。第一是映射:要把混合中的声学成分对应到视觉实体,知道哪段能量属于被删物体,哪段属于保留物体或背景。第二是极性:提取和删除的输出互斥,文字稍有不同就可能把保留说成删除。论文因此在数据上先做单物体视听对齐再混合,在架构上用任务令牌和分模态全局引导明确角色,在训练上用多任务加课程学习同时教定位与细粒度区分。
全景:数据、架构、训练、评测如何分工?
在展开细节前先看整体分工,避免把 4 个部分的作用记混。数据构造负责提供干净的单物体对齐样本,并在线合成为提取、删除与联合 3 种模式的混合目标对,这是监督来源。模型架构负责把删后视频、指令与混合音频 3 路条件组织进潜空间流匹配的去噪过程,这是计算载体。训练策略负责用多任务理解任务边界,用 2 阶段课程从语义远到语义近逐步提高区分难度,这是优化顺序。评测基准负责提供多样场景的删除样本与压制加保留两套度量,这是判断依据。
四者缺一不可:没有对齐数据,混合监督就不可信;没有任务身份,提取与删除就会混淆;没有难混合微调,相似音色就分不开;没有保留度量,静音一切也能拿高分。
下图是论文给出的任务总览,输入是删后视频、原始混合音频与文字指令,输出是压制目标声的保留音频,例子是保留猫叫、移除狗吠。
看图路径: 1. 先从左上原始视频经视频修复到右上已编辑视频,确认视觉分支的输入是删后视频;2. 再看左中原始混合音频与左下文字指令如何汇入中间的移除模块;3. 最后对照右下输出音频与右上气泡,确认保留猫叫、移除狗吠的分工
论文图 1。原论文 Figure 1::“Overview of the Text-Visual Guided Target-Sound Removal framework TV-AudioRemover.”。
这张总览图把解耦思想画得很直白。上路是原始视频经视频修复模型得到已编辑视频,下路是原始混合音频与文字指令共同进入中间的移除模块。注意视觉箭头来自已编辑视频,而不是原始视频,这意味着视觉条件是正向的保留线索:画面里还剩什么,音频里就该留什么。文字则负责说清要删谁。输出频谱相对输入的变化,就是被删成分能量下降而保留成分基本不动。复述时要抓住这个箭头方向,任何把原视频当视觉条件的说法都是错的。
数据怎么做:从原始候选到干净单物体样本?
数据管线的起点是两类原始候选:来自视频数据集的视听样本和来自纯音频资源的音频样本。论文用多模态大模型做结构化标注,输出场景类型、声源数量、声音类别与主要发声物体短语;对视频候选还要判断主发声源是否为画面主物体。通不过视听对应检查的直接拒绝,剩下的按单源与多源分流。单源直接送过滤,多源则用音频分割模型按主物体提示分离出对应音频,再与单源一起过滤。
过滤包括静音段检测、语义对齐与结构复杂度代理过滤,以及基于感知质量的过滤,最后在语音、音乐与音效间做类别均衡,得到干净清单。论文报告约一半候选被淘汰,得到约百万级高质量单目标对齐样本。 下图是 6 阶段处理管线,值得按阶段复述,而不是只记模型名。
看图路径: 1. 从左到右数出输入、标注、分类、分离、两级过滤与均衡共六个阶段;2. 找出两处进入拒绝桶的分支,区分对齐失败与分数过滤失败;3. 确认多源样本是先经分离再进入过滤,而不是直接丢弃
论文图 2。原论文 Figure 2::“Data processing pipeline for constructing single-object audio-visual aligned samples.”。
这张管线图的可执行读法是:输入之后第一阶段做标注与对齐检查,不匹配进拒绝桶;第二阶段做单源与多源分类;多源走第三阶段的分离,得到主源后再回到过滤;第四阶段用语义与复杂度分数做代理硬过滤,失败进拒绝桶;第五阶段用感知分数过滤。
第 6 阶段做 3 类均衡后输出干净清单。教学上要强调音频优先原则:主物体按音频证据选,而不是按画面显著物体选,这样可以避免视觉显著但声学无关的物体被当成正样本。
CLIP 语义特征 × Synchformer 同步特征: CLIP 语义特征负责回答画面里留下了什么物体、对应哪类声音,提供可保留内容的全局语义线索;Synchformer 同步特征负责回答声音与画面动作在时间上是否对齐,提供时序层面的保留依据。两者都来自已编辑视频,前者管类别对应,后者管时间对应,组合后音频分支既知道留什么,又知道在何时留。
拿到干净单物体样本后,论文不是存固定混合,而是在线合成混合目标对。对每个干净样本取语义不同的干扰片段,做随机时间裁剪与信噪比缩放后混合,形成两源与三源混合。3 种编辑模式的定义是关键公式,符号含义是混合音频等于目标源加干扰源,目标音频按模式取应保留部分。
\[\displaystyle\text{extract:}\quad\mathbf{a}_{\mathrm{mix}}=\mathbf{A}+\mathbf{B}(+\mathbf{C}),\quad\mathbf{a}_{\mathrm{tar}}=\mathbf{A},\]这个公式要这样读:提取模式的混合是目标加干扰,目标只取干净源;删除模式的混合同样是目标加干扰,但目标取干扰部分,也就是把干净源压掉;联合模式同时包含保留与删除语义。对视听样本,视觉条件通常取自源样本;在三源删除且目标输出变为多源保留时,实现上会对视觉条件做掩码,避免只对应部分保留输出的线索误导模型。
纯音频样本默认用空视觉特征。这一步解释了监督从哪来,也解释了为什么模型能同时学到保留与抑制。
架构怎么做:三路特征在哪里汇合?
架构 backbone 是多模态扩散变换器,训练采用潜空间流匹配。训练时采样目标隐变量与混合隐变量并归一化,在高斯噪声与目标隐变量之间构造带噪状态,再把带噪隐变量与混合隐变量沿通道拼接后做音频输入投影。去噪网络以此为音频输入,条件是已编辑视频、指令与混合隐变量,预测从噪声指向目标的流;推理时每一步都把混合隐变量与当前去噪隐变量拼接,从而始终保留源音频重建先验。视觉用语义编码器与同步编码器分别提特征,文字用文本编码器编码,声学用音频编码器编码,3 路投影到同一隐空间后经多模态块交互。
通道拼接的计算目标要单独讲清。公式中当前带噪隐变量与混合条件拼接,目的是让去噪过程每一步都能看到原始混合的声学材料,而不是只靠条件猜声音。这样做的好处是保留成分有据可查,坏处是模型可能偷懒原样复制,所以后文需要删除监督与保留度量共同约束。
\[\mathbf{x}_{t}=(1-t)\mathbf{x}_{0}+t\mathbf{x}_{1},\quad\mathbf{h}_{t}=\mathrm{Proj}_{\mathrm{audio}}\big([\mathbf{x}_{t},\mathbf{x}_{\mathrm{cond}}]\big),\]读这条公式先认符号:噪声起点、目标终点、中间插值状态、混合条件、拼接后投影。计算目标是预测从噪声到目标的速度场。原文明确的实现是拼接发生在音频输入投影之前,推理时每步拼接混合隐变量。未报告梯度细节不猜,只按证据说监督来源是合成混合目标对。 下图是 3 分支加全局引导的架构细节,重点看条件去哪了。
看图路径: 1. 先看顶部四个条件分支,分别对应已编辑视频、指令加任务编号、混合音频与全局引导;2. 再看中部视频、文本、音频三分支各自的自适应归一化条件来源;3. 最后看底部联合注意力与纯音频自注意力的先后顺序
论文图 3。原论文 Figure 3::“Architecture of the TV-AudioRemover multimodal diffusion Transformer.”。
这张架构图要分两层看。顶层是 4 个条件盒:已编辑视频经两个视觉编码器得到语义与同步特征;指令加任务编号经文本编码与任务嵌入相加得到指令特征;混合音频经编码与拼接得到音频输入;右上是分模态全局条件。
底层是视频、文本、音频 3 个分支,各自有不同的自适应归一化条件,再经联合注意力交互与纯音频自注意力输出。关键点是音频分支用视觉全局条件加同步上采样调制,而不是用文字全局调制,因为删后视频是关于期望视听状态的正向线索,而文字可能说保留也可能说删除。
任务令牌 × 通用指令建模: 任务令牌负责把当前要做提取、删除还是联合编辑的任务身份显式加到文字条件上,解决同一句话在不同任务下含义相反的问题;通用指令建模负责用多种提取、删除与保留加删除组合模板覆盖语言变化,减少对固定句式的依赖。两者搭配是身份加表达:前者定任务角色,后者保语言鲁棒性。
除任务令牌与通用指令外,第三个改动是分模态全局引导。视觉与文字特征分别投影为各自全局条件,音频分支由视觉条件加扩散时间与同步线索调制,视觉分支用视觉条件,指令分支用文字条件。这种解耦避免了文字与视觉抢同一调制通道,也让音频分支始终锚定删后画面的保留状态。复述时不要把全局引导说成简单的特征拼接,它是作用于各分支归一化的调制信号。
训练顺序:多任务与两阶段课程各解决什么?
训练策略有两个正交维度。多任务维度是每批随机采样源提取、源删除与联合编辑模式,比例分别为 0.4、0.4 与 0.2。提取不是为了单独做提取,而是为了加强目标定位、视听对齐与正负极性区分。只用删除样本训练会过拟合特定提示模式并导致过删。课程维度是先易后难:预训练用语义远混合,要求干扰源标签不同且基于文本标签相似度低于阈值。
微调用难混合,要求同一细粒度组内不同样本混合,并均匀采样各难组,同时变化信噪比以覆盖显著与微弱目标。难组覆盖人声年龄情感与性别、弦乐管乐打击乐、哺乳动物鸟类昆虫、 crowd 与动作、机械交通工具、拟音材质与自然环境等。
目标提取 × 目标删除: 目标提取负责说明要保留哪个声源并输出该声源,帮助模型把视觉与文字条件和具体声学成分对齐;目标删除负责说明要压制哪个声源并输出剩余声音。两者极性相反,放在同一多任务训练中搭配,可以让模型在同一套混合构造下同时学习正向保留与负向抑制的边界,从而减少只学删除时出现的过删和指令模式过拟合。
优化目标是流匹配损失,网络在给定全部条件下预测从噪声到目标的隐变量速度场。条件集合包括语义视觉特征、同步视觉特征、指令特征与混合隐变量。训练还用互斥丢弃做多模态分类器无关训练:同时丢视觉与文字、只丢视觉、只丢文字各有概率,丢文字时任务编号也掩码,从而使同一模型支持纯视觉、纯文字与联合条件。推理时的无条件分支掩掉视听文字线索但保留混合条件,因此引导只调编辑意图,不拿走重建先验。
\[\mathcal{L}_{\mathrm{fm}}=\mathbb{E}_{t,\mathbf{x}_{0},\mathbf{x}_{1}}\left[\left\|F_{\theta}(\mathbf{x}_{t},t,\mathcal{C})-(\mathbf{x}_{1}-\mathbf{x}_{0})\right\|_{2}^{2}\right].\]读这条损失先认期望对象:时间步、噪声起点与目标终点。计算目标是让预测速度逼近真实位移。原文未给出超出该式的梯度路径细节,不做推测。实现细节按证据交代:优化器、迭代数与学习率见后文训练配置表;混合是线上合成而非固定存储。
语义远混合 × 难混合: 语义远混合负责在预训练阶段提供类别差异大的干扰源,让模型先学到无歧义的压制与重建能力;难混合负责在微调阶段提供同组内音色或属性相近的干扰源,例如不同性别嗓音或同类乐器,逼模型做细粒度区分。两者按先易后难搭配,构成课程:先建立一般删除能力,再 sharpen 属性级判别。
下面两张表把训练的数据规模与优化配置固定下来,便于复现时逐项核对。第一张讲每段多长、预训练与微调各有多少、视听与纯音频比例与采样率推理步数;第二张讲优化器、迭代数、学习率与多任务采样概率。
表前说明比较问题与公平条件:这两张不是结果表,不比较模型好坏,只固定复现条件。阅读时把数据集、阶段、模态比例、音频时长与采样率放在一起核对,数值相同不代表同一指标,百分点与相对百分比也不同。
| 条件 | 指标 | 预训练 | 微调 | 推理 |
|---|---|---|---|---|
| 训练片段 | 时长 | 8 seconds | 8 seconds | 8 seconds |
| 数据规模 | 总量 | 1.11M general clips | 5.65K hard clips | 25 denoising steps |
| 视听部分 | 数量 | 602.9K audio-visual clips | 1:1 ratio | 44 kHz audio sampling rate |
| 纯音频部分 | 数量 | 511.2K audio-only clips | 1:1 ratio | 44 kHz audio sampling rate |
表后解释:预训练用百万级通用片段建立一般删除能力,微调用数千级难片段 sharpen 细粒度区分。视听与纯音频约 1 比 1 的配比使模型同时见过有画面与无画面条件。推理固定采样率与去噪步数,后文比较延迟时要在相同步数下理解。未报告硬件预算时不承诺训练成本改善。
| 条件 | 指标 | 预训练取值 | 微调取值 | 多任务采样 |
|---|---|---|---|---|
| 优化器 | 配置 | AdamW with weight decay 10^{-6} | AdamW with weight decay 10^{-6} | extraction 0.4 |
| 迭代 | 步数 | 350k iterations | 80k iterations | deletion 0.4 |
| 学习率 | 数值 | learning rate 10^{-4} | learning rate 2\times 10^{-6} | preserve-remove 0.2 |
| 其他 | 策略 | step decay | from the pre-trained checkpoint | online synthesis |
表后解释:预训练迭代多、学习率相对高,微调从预训练 checkpoint 出发、迭代少、学习率低,符合先学通用能力再做精细调整的课程直觉。多任务概率向提取与删除各倾斜 40%,联合占 20%。在线合成意味着每次混合的干扰、裁剪与信噪比都可变,复现时不能用固定混合文件代替。原文未报告梯度裁剪之外的显存与时长,不推定部署成本。
用什么测:基准、基线与指标方向?
评测基准是 AV-Remove-Bench,共 77 个约 6 秒的视听片段,覆盖语音、音乐与音效,来源包括公开数据集、生成视频与真实录制。场景分两种:多发声物体场景与前景目标加稳定背景场景,每个样本指定一个要从视听 2 流同时移除的发声物体。公开部分从音乐、语音与影视片段中人工挑选高质量样本,生成部分用手工提示覆盖 3 类音频并平衡两种场景,真实录制聚焦日常音效类移除。这种构成决定了结论只在该分布内成立,音效小样本与高度纠缠声源仍是边界。
基线分 3 组:视听联合编辑、纯文字音频编辑、视频文字控制的音频提取。纯文字组不看视觉,提取组需要为删除改写任务,例如多物体时改写为提取要保留的源,前景加背景时改写为提取要删除的源再取残差。为公平,推理用官方最优开源版本与相同实验条件,提取模型的重排候选设为单次推理。音频编辑模型的视听一致性指标统一配最优视觉移除器的删后视频计算,避免用不同画面比出虚假差距。
目标源抑制比 × 保留源保真度: 目标源抑制比负责度量被指定删除声源的分类置信度相对下降了多少,越高表示压得越干净;保留源保真度负责度量应保留声源的置信度是否维持,下降则扣分、去噪变好则给有限加分。两者必须成对看:只看前者会奖励静音一切的做法,只看后者会奖励原样复制的做法,组合才能刻画选择性擦除。
客观指标分两组。模型指标包括音频质量与多样性、感知分离质量、语义视听对齐与时序偏移,以及移除专用的压制与保留指标;多模态大模型指标包括音频指令遵循与保留保真。方向是压制越高越好、保留越高越好、对齐越高越好、时序偏移越低越好。主观指标由 10 名有经验评分者在盲测下按 3 级量表打分,维度是目标移除完整性、背景保留、时序自然度与总体听感,并据此算综合分与成功率。
\[\mathrm{TSSR}=\frac{P_{A,\mathrm{r}}-P_{B,\mathrm{r}}}{P_{A,\mathrm{r}}},\quad P_{A,\mathrm{r}}>\epsilon.\]这条是压制比:分子是原音频与编辑音频中目标源置信度之差,分母是原音频置信度。当原音频几乎不含目标源时该比无定义。符号先认清:下标 r 表示待移除源,A 表示原音频,B 表示编辑音频。计算目标是相对下降,不是绝对分贝差。
\[\mathrm{PSF}=\begin{cases}1-(P_{A,\mathrm{k}}-P_{B,\mathrm{k}}),&P_{B,\mathrm{k}}主结果支持什么,又没测什么?
论文报告的客观趋势是:所提方法在移除专用的压制与保留、大模型评的指令遵循与保真,以及视听语义与同步上取得最优;感知分离质量也最优。纯音频模型各有偏科:有的整体音频质量高但压制与保留低,原因是保留了大量原混合;有的指令遵循尚可但保真低,说明删目标时伤了保留音频。提取导向的强基线保真高、总体有竞争力,但论文认为它不是为删除与残差保留原生优化的。
联合视听编辑在删除任务上表现弱。主观听感上,所提方法在 4 个维度与综合分、成功率上均居首,对强提取基线的提升在目标完整性上最明显。商业模型对比中,论文报告所提方法总体更优,其中新版生成模型因重生成视听而同步强,但指令遵循与删除仍有差距。
下图是难例可视化:2 名厨师同时工作,要求移除磨刀声而保留切菜声,属于同场景下声学相近的细粒度区分。
看图路径: 1. 先看顶部原始视频与已编辑视频的人数变化,确认视觉目标已被移除;2. 再看原始音频频谱中标注的磨刀声与切菜声位置;3. 逐行比较各方法输出频谱的残留能量,重点看磨刀声是否减弱而切菜声是否保留
论文图 4。原论文 Figure 4::“Qualitative comparison of different sound removal methods.”。
这张对比图的可执行读法是:先确认原音频频谱中两类刀声的位置标注,再逐行看各方法输出频谱的能量变化。论文图示的含义是:所提方法同时满足移除与保留两项,而其他行各有缺失,有的两项皆失,有的只满足一项。读图时不要把频谱亮度直接当成绝对分贝值,像素不能精确辨别的数值不硬写;同时注意该图是单样本定性展示,定量结论要回到基准上的聚合指标与统计检验。未胜出项要就近说明:提取基线与文字基线在该难例上未能同时做到压制与保留,这支持难混合微调的必要性,但不证明所有纠缠语音都能解决。
下面用论文正文连续原句中有充分逐字证据的人评提升表承担结果表的职责,避免引用无法安全选择的宽表数字。表前提出比较问题、公平条件与指标方向:在同一基准、盲测、3 级量表下,与视频文字控制的强提取基线相比,所提方法在目标完整性、背景保留、自然度、总体、综合与成功率上的相对提升是多少,越高越好。
| 条件 | 指标 | 基线对象 | 本方法相对提升 | 方向 |
|---|---|---|---|---|
| AV-Remove-Bench | TRC | SAM Audio | 13.8% on TRC | 越高越好 |
| AV-Remove-Bench | BP | SAM Audio | 7.3% on BP | 越高越好 |
| AV-Remove-Bench | TN | SAM Audio | 6.0% on TN | 越高越好 |
| AV-Remove-Bench | OQ | SAM Audio | 7.5% on OQ | 越高越好 |
| AV-Remove-Bench | AC and ASR | SAM Audio | 9.4% on AC, and 19.4% on ASR | 越高越好 |
表后解释主要收益与代价:最大增益在目标移除完整性,其次是成功率,说明任务定制主要解决了删不干净与全零失败;背景保留与自然度的增益相对小,说明保留仍有代价。限制是这些是相对提升的报告值,不是每样本都成立;总体趋势不等于每组都成立。未测量延迟与成本时,不承诺这些量得到改善。训练资源、推理开销与实际延迟要分别讨论。
拿掉哪一块会怎样:课程、多任务、模态与上游?
论文的消融分 4 组。训练策略上,2 阶段优于单阶段,尤其利于目标压制,解释是预训练建一般能力、微调 sharpen 细粒度区分。多任务优于单任务,在感知质量、压制、保留、对齐与同步上全面占优,支持正负极性对比与视觉绑定增强的说法。输入模态上,纯文字已很强,与全模型感知质量持平、压制保留略低;纯视觉大幅掉压制,但在相当子集仍能删,说明视觉可提供语义与时间线索但缺文字意图就不精确。
联合视听最优,尤其在对齐与同步上。上游视觉移除器上,用最优视觉模型做条件时各项最优,说明删后视频越干净时序越一致,声音越好删。
表前提出比较问题:在相同基准与指标下,课程、任务、模态与上游 4 组对照各自的支持与限制是什么。公平条件是除被消融因素外其余固定,指标方向与主结果一致。
| 条件 | 指标 | 对照 | 趋势 | 未胜出项 |
|---|---|---|---|---|
| AV-Remove-Bench | Kendall | Instruction Compliancev 0.7494 | Overall average 0.7191 | Fidelitya 0.7092 |
| AV-Remove-Bench | Kendall | Fidelityv 0.7113 | Overall average 0.7191 | Instruction Compliancea 0.7063 |
| AV-Remove-Bench | 样本 | 77 samples | about six seconds | speech music sound effects |
| AV-Remove-Bench | 场景 | multi-sounding-object | foreground-target-plus-stable-background | highly entangled sources |
表后解释:这张表不是消融数字本身,而是消融可信度的边界表。大模型评分与人评的排序一致性总体均值达到 0.7191,四项都在 0.7 以上,支持用大模型做主观风格近似,但相关性不是因果,也不代替盲测人评。基准只有 77 个约 6 秒样本,场景覆盖两种,高度纠缠声源仍是论文自述的挑战。复述消融时要加适用条件:2 阶段与多任务的收益在该基准分布内成立,换分布或换上游视觉质量时幅度会变。
边界在哪:规模、纠缠与参考缺失?
论文自述的局限有 3 层。第一是基准规模有限,尤其是音效样本少,且多数样本没有目标移除后的参考音频,因此无法用参考型分离指标,只能用模型指标、大模型评分与人评。这意味着压制与保留的度量依赖分类器置信度与感知判断,对分类器误判敏感。第二是高度纠缠声源仍难,例如视觉相似说话人的重叠语音,需要更强的说话人与物体身份建模。第三是对上游视觉移除的依赖:删后视频质量差时,视觉条件会变脏,声音的语义与同步都会受损。
对初学者要纠正一个误解:视觉越好声音一定越好吗。论文的证据是支持相关,不是证明因果。上游消融显示更优视觉对应更优声音,但这是在固定音频模块与基准分布内的观察,不能推广为任何视频修复都单调提升声音。另一误解是把自动指标当人评。分类器分数、同步偏移与人耳的完整性、自然度不是同一聚合对象,数值相同也不是同一指标。遇到表头与正文冲突时应明确标注冲突,不自行编造划分或聚合口径。
要复现,先固定什么、再跑什么?
复现先固定信息条件:输入必须是删后视频加原混合加指令,不要误用原视频做视觉条件;混合目标对要按提取、删除与联合 3 种模式在线合成,采样概率按证据固定;难混合要在同组内采样并均匀覆盖各组。超参数按训练配置表固定:片段时长、采样率、去噪步数、优化器、迭代数与学习率。模态丢弃与任务掩码也要按证据实现,以保留纯视觉、纯文字与联合 3 种运行能力。
再跑评测:基准用 77 个约 6 秒样本的两类场景;压制与保留成对计算,保留的有限加分上限取 0.5;人评用盲测 3 级量表并报告综合与成功率;大模型评分只做辅助,并报告与人评的排序一致性。基线要保留实际可运行策略:纯文字模型直接跑删除,提取模型按论文改写为提取保留或提取删除取残差,单次推理,不做重排择优与事后最优代替部署收益。统计上注意成功率要求四项非零,综合分是加权平均乘百,百分点与相对百分比不要混用。
缺项要明说:论文未报告硬件预算与每步延迟,未给出超出损失式的梯度路径,未开源权重下载与系统可运行状态也未在本证据中说明。因此复现清单只能到配置与协议,不能承诺成本与实时性。若需补验证,优先补更大音效集、带参考音频的分离指标,以及纠缠说话人子集的误判率分析。
何时值得试这个方案?
当任务是删后视听一致,且你已有可靠的视觉移除器时,这个解耦方案值得试:复用任意视觉方法,只训练或调用音频移除器,用删后画面做保留锚、用文字定删除意图。当删除目标与保留目标音色相近时,要准备难混合微调与多任务训练,否则容易出现删不干净或过删。当上游视觉质量不稳定时,先修视觉再调音频,因为脏的视觉条件会同时伤语义与同步。
收束一句话:用删后视频告诉模型该留什么,用文字告诉模型该删什么,用合成混合教会模型在相反极性下区分两者,用压制加保留两套尺子防止作弊。记住边界:结论限于该基准分布,纠缠声源、更大规模参考评测与部署成本仍待验证。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses



