英文题目:Leveraging Mutual Intra-Modal Similarity Supervision for Text and Audio

会议身份:conference:interspeech:2026:conference-paper-id:vonaspern26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #多模态学习 #零样本 #音频分类 #音频检索

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Julian Miguel von Aspern:机构信息未能从会议 PDF 纯文本可靠映射
  • Bruno Defraene:机构信息未能从会议 PDF 纯文本可靠映射
  • Anastasios Vafeiadis:机构信息未能从会议 PDF 纯文本可靠映射
  • Oleksiy Kutscher:机构信息未能从会议 PDF 纯文本可靠映射
  • Ernst Seidel:机构信息未能从会议 PDF 纯文本可靠映射
  • Tim Fingscheidt:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

对比语言音频预训练需判断任意音频与文本是否语义对应,输入为批量内配对音频与文本、输出为模间相似度矩阵,难点是批量内非配对样本并非全为负例,独热目标会引入噪声监督。方法链分三步衔接:先冻结文本编码器与音频编码器,分别计算批量内文本间与音频间余弦相似度矩阵以刻画模内连续结构;再经简单加权或基于MC Dropout不确定性的加权混合,将双侧模内矩阵合成为模间相似度软目标;最后用该软目标监督可训练双编码器预测的模间矩阵,并以均方误差回归替代交叉熵,可选叠加带梯度反转的模态分类分支以缩小模态间隔。相对独热基线的关键差异是用双侧模内结构代替单侧硬标签,并把分类适配为回归以兼容软目标,实际意义是保留批量内语义近邻关系而非强制互斥。在Clotho-eval文本查询音频检索任务下,MSE+T变体的mAP@10为34.4%,高于基线的mAP@10 32.3%。该结论适用边界受限于约0.5M训练样本和批量64条件,在NSynth乐器族零样本分类上所有变体均落后于CLAP23,跨数据规模与大批量的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么独热目标不够用?

这篇论文处理的是音频与文本之间的语义对齐。输入是一批音频波形与一批原始文本,输出是一个跨模态相似度矩阵,行对应音频,列对应文本,数值越高表示越可能语义对应。下游直接用这个矩阵做 3 类事:给定文本找音频,给定音频找文本,以及给定音频从若干类别描述句中选最像的一句做零样本分类。初学者容易以为只要把配对的音频文本拉近、把不配对的推远就行。论文指出标准做法是独热目标:批量内对角线为 1,非对角线为 0,再用交叉熵比较。

这种做法隐含一个很强的假设,即同一个批量里所有非配对组合都同等错误。但在真实数据里,两条不同音频可能都描述下雨,两句不同文本可能都提到狗叫,它们的模态内语义本就接近。把这些接近关系一律压成 0,会丢掉批量内已经存在的语义结构。本文的起点就是把这种结构捡回来。输入侧因此多了一条教师路径:用冻结的音频编码器和文本编码器分别算音频间相似度和文本间相似度,再把它们混合成跨模态学习的软目标。

学习依赖是先理解基线如何从输入到嵌入再到相似度与独热损失,再理解软目标如何替换独热矩阵,最后才谈不确定度加权、模态分类与损失范式更换。全文只研究这 3 类检索与零样本任务,不涉及音频生成或语音识别,教学举例一律标为例子。

这条路线从图像文本走来,音频文本做了哪些接力?

对比语言图像预训练提供的是基本范式:两个编码器加共享空间加对比损失。后续有人把它扩展到图像语言音频 3 模态,也有人专门做对比语言音频预训练,并通过更大网络、更多数据、更大批量把性能推高。另一条线是数据侧改进:利用元数据、扩写文本、构造高质量音频文本数据集。还有一条线是框架侧改进:加入聚类损失作为额外信号,或者用已训练模型集成做知识蒸馏来提供目标。与本文直接相关的是两项工作。

第一项是图像文本领域用批量内文本间相似度作为模态间目标,证明软目标能大幅改进对比学习。第二项是用模态分类分支加梯度反转缩小模态间隙,在音频文本任务里见过收益。本文的定位很清晰:把第一项从图像文本搬到音频文本,并推广到同时用音频间相似度;再研究如何把两个模态内相似度合成为一个目标,包括固定加权与不确定度加权;同时考察模态分类分支是否还有叠加收益。

最后把交叉熵的分类范式换成均方误差的回归范式。相关工作的比较条件并不一致,因为各自训练数据、批量与编码器不同,所以不能把类别差异当成同条件胜负,只能看机制是否被本文在受控小批量条件下重新验证。

要解决的具体矛盾是什么,不解决会怎样?

具体矛盾是小批量下独热目标的信息密度太低。一个批量里只有对角线是正例,其余全部当负例,模型学到的是谁和谁配对,却学不到配对之间有多像。比如批量里有两段都是城市街道录音,只是配的描述句不同,独热目标要求它们的跨模态相似度同样低,这与语义直觉冲突。如果批量很大,这种噪声可能被平均掉一部分;但在批量只有几十的条件下,每个错误压制的影响更大,训练还可能退化到把所有相似度估计成相等的值。

论文把这个问题拆成 3 个可操作的子问题。第一,如何得到比 0 和 1 更细的目标。第二,音频侧和文本侧的结构是否都值得用,如何加权。第三,当教师自身的嵌入不可靠时,能否降低其目标权重。以及附带问题:模态间隙是否干扰余弦比较,损失函数是否适合软目标。

这些子问题决定了后面 4 个贡献的顺序:先引入文本内目标,再引入音频内目标,再做不确定度混合与模态分类,最后换损失。例子:假设批量里有 4 条音频,其中两条都是海浪声,独热目标只认各自配对句为 1;软目标则允许这两条音频对应的文本之间也有较高相似度,从而让跨模态矩阵的非对角位置保留一定数值。

整个训练回路长什么样,数据走哪几条路?

先沿一个批量走一遍。批量内有按下标对齐的音频与文本。主路径是可训练的音频编码器加全连接层得到音频嵌入,可训练的文本编码器加全连接层得到文本嵌入,两组嵌入算余弦相似度得到预测的跨模态矩阵。这是紫色基线部分,目标原来是独热矩阵。新增的蓝色部分是两条冻结教师路径:文本经过冻结文本编码器算文本间相似度,音频经过冻结音频编码器算音频间相似度,两者都是对称矩阵,对角线为 1。

它们经过混合模块得到目标相似度矩阵,再与预测矩阵比较。绿色部分是不确定度路径:对冻结编码器做多次参数扰动,得到每个样本的嵌入不确定度,再合成每对相似度的不确定度,用来做逐元加权混合。黄色部分是可选的模态分类路径:把音频嵌入和文本嵌入拼起来,送入梯度反转与分类器,判断每个向量来自哪个模态。训练时更新的是主编码器、全连接层以及可选的分类器,冻结教师不更新。推理时只用主编码器算跨模态相似度做排序或选类。 下面这张图是全文的方法总览,建议对照上面的文字路径阅读。

看图路径: 1. 先沿左侧音频波形与文本输入向右追踪到中间紫色基线编码器与相似度模块;2. 再看上下浅蓝色分支的冻结编码器如何算出音频内与文本内相似度并汇入混合模块;3. 观察最外层绿色不确定度路径与黄色模态分类路径分别从哪里分叉、向哪里回传;4. 核对每个方块下标的矩阵尺寸与公式编号,确认目标矩阵与预测矩阵都是批量乘批量的形状

原论文 Figure 1:Our training setup with the baseline’s \\[12\\] first stage in the purple area.

论文图 1。原论文 Figure 1:“Our training setup with the baseline’s [12] first stage in the purple area.”。

图中紫色是基线第一阶段,实线箭头是可训练主路径,虚线是冻结教师与目标路径。中间紫色块输出预测相似度,右侧蓝色混合块输出软目标,两者在损失模块相遇。上下两条绿色链分别估计音频与文本的不确定度并送入混合模块,左侧黄色块从拼接嵌入分叉做模态分类。火焰图标表示可训练,雪花图标表示冻结。阅读时注意区分对称的模态内矩阵与不对称的跨模态矩阵,以及混合模块标注的两种混合方式分别对应固定加权与不确定度加权。

软目标、混合权重与不确定度具体怎么算?

先讲符号。记批量大小为批量内样本数,嵌入维度为共享空间维度。音频嵌入矩阵与文本嵌入矩阵都是批量乘维度。预测的跨模态相似度用余弦相似度计算,取值在负 1 到 1 之间,一般不对称。模态内文本间矩阵与音频间矩阵用各自冻结编码器的输出算余弦相似度,都是对称矩阵。

基线把预测矩阵按行做温度缩放 softmax 变成概率分布,再与独热矩阵做平均行交叉熵,行与列 2 个方向各算 1 次再平均。提案把独热矩阵换成混合后的目标矩阵,并对目标矩阵同样做 softmax 后再比较。固定混合就是音频内矩阵乘音频权重加文本内矩阵乘文本权重,权重和为 1。取纯文本权重时就退化为图像文本领域已有方法的音频文本版本。

模态间对比学习 × 模态内相似度监督: 模态间对比学习负责把音频嵌入和文本嵌入拉到同一空间并用相似度矩阵判断配对关系,模态内相似度监督负责用同模态内部文本与文本、音频与音频的相似结构提供软目标,二者搭配的理由是批量内非对角配对并非全错,组合意义是用模态内语义结构软化原来非黑即白的独热目标。

不确定度混合的动机是教师嵌入本身有噪声。做法是对冻结编码器做多次随机扰动,对同一输入得到多个嵌入向量,计算它们的样本圆方差作为该样本的嵌入不确定度,方向越分散不确定度越高。再把 1 对相似度的不确定度定义为两个端点样本不确定度之和。混合时谁的不确定度小谁的权重高,具体权重是另一方不确定度占两者之和的比例,若两者都为 0 则各取一半。这样每个批量内位置都有自己的混合比例。

加权平均混合 × 不确定性加权混合: 加权平均混合负责用固定系数把音频内相似度矩阵和文本内相似度矩阵线性相加,不确定性加权混合负责用每个相似度条目对应的嵌入不确定度做逐元权重,加权平均提供可控的模态比例,不确定性加权提供逐对的可信度调节,组合意义是从全局固定比例走向随样本质量自适应的目标构造。

模态分类分支把所有音频嵌入与文本嵌入拼成 2 倍批量行,每行归一化到单位长度后预测是音频的概率,用二分类交叉熵监督。梯度反转在前向无作用,反向把梯度取负,从而让主编码器学到让分类器难以区分的表示。

模态分类分支 × 梯度反转层: 模态分类分支负责判断一个嵌入来自音频还是文本并给出二分类损失,梯度反转层负责在前向保持不变而在反向对梯度取负,分工上分类器试图分开两种模态,梯度反转迫使主编码器学到让分类器分不开的表示,组合意义是缩小模态间隙,使跨模态余弦相似度更可比。

损失范式更换是把交叉熵换成平均均方误差,直接比较预测分布与目标分布的逐元平方差。论文报告小批量下交叉熵会出现退化现象,换成均方误差后训练更稳。

交叉熵损失 × 均方误差损失: 交叉熵损失负责把每行相似度做温度缩放 softmax 后当分类分布与目标分布比较,均方误差损失负责直接比较预测相似度分布与目标相似度分布的逐元平方差,二者搭配的理由是软目标下分类范式训练不稳定,组合意义是把分类问题换成回归问题,让模型拟合连续相似度值而不是争夺概率质量。

冻结与可训练的分离保证目标不随主模型漂移。

冻结教师编码器 × 可训练双编码器: 冻结教师编码器负责离线产生稳定的模态内相似度和不确定度,不参与梯度更新,可训练双编码器负责产生真正要优化的跨模态音频嵌入和文本嵌入并接受梯度,二者搭配的理由是避免目标随自身预测漂移,组合意义是形成目标生成与表示学习分离的训练回路。

训练时更新谁、冻结谁,优化与验证如何组织?

训练对象是音频编码器、文本编码器、全连接层,以及启用时的模态分类器。冻结对象是用来算模态内相似度的音频教师编码器与文本教师编码器,以及不确定度估计中被扰动的副本所基于的同一套冻结参数。原文明确交代音频主编码器采用预训练的音频 Transformer 结构,不做补丁重叠,训练时使用结构化丢弃;文本主编码器采用预训练的大型文本编码器;教师音频编码器与主音频编码器是同一预训练模型但保持冻结。

教师文本编码器是预训练句子嵌入模型的某个公开变体。总体损失是主相似度损失加模态分类损失乘权重,权重经消融取为较小值。优化器用自适应矩估计,学习率先线性暖机再余弦下降后保持,总轮数为 20 轮,每轮后在验证集上用检索指标选最优检查点。音频按 10 秒切段或补齐,切段时对片段嵌入平均得到整文件嵌入。不确定度估计中用确定性丢弃层加速复现,扰动次数取 10,对原本无丢弃层的模型先在全连接与卷积后加丢弃。

需要指出的缺项是原文没有给出梯度裁剪、权重衰减与数据增强的完整细节,也没有报告每次扰动前向的具体耗时,不能从模型名称推定这些实现。

在什么数据、批量与指标下比较,条件公平吗?

训练用 3 个数据集的组合,验证用其中一个数据集的验证划分,并按已有工作的做法从一个数据集中移除测试集重叠。评估覆盖 3 类任务:4 个数据集上的零样本分类用准确率,同一评测划分上的文本查音频与音频查文本用平均精度与召回率,其中文本查音频还报告带额外标注的平均精度。零样本分类的文本是按类别标签套模板生成,检索任务用原始标题。

推理时对全库音频与文本各算 1 次嵌入再组成相似度矩阵,矩阵不一定是方的,按行或列排序后评价。比较的关键是训练预算不同:本文方法与基线同用小批量与约五十万训练样本,而对比的大规模方法用 9 倍以上数据与二十多倍批量,因此不能把跨预算的数值差距直接读成方法优劣,只能看在受控小预算下提案相对基线的提升,以及在小预算下能否接近大预算方法的水平。温度系数、嵌入维度与批量大小等关键超参数在原文有明确交代。

下表把训练预算与关键超参数的比较问题摆出来:比较对象是否在同一批量与数据量下训练,指标方向如何理解,公平条件是什么。

配置项数值类型基线与本方法取值大规模对比方法取值关键超参数
批量大小样本数641536温度系数 0.05 与 0.1
训练样本量样本数0.5M4.6M嵌入维度 1024
训练轮数与优化轮数20 轮未在同条件复现全连接层为线性层

下表说明主要代价与公平性边界:本方法用小批量复现基线条件,大规模方法的数据与批量优势保留在表中,不删除有利基线。

表中批量与样本量的数字与原文连续句逐字对应,温度与维度的数字同样来自原文,单位保留原文写法。未胜出项与未评测边界在结果节继续讨论。

主结果支持什么判断,哪里没有赢?

从累积排名的鸟瞰看,交叉熵训练只有两个第 2 名,而均方误差训练占据多数强排名。论文的解释是交叉熵在处理软目标时吃力,这属于有限解释,还需要更多损失曲面证据才能确认为因果。分任务看,零样本分类上纯文本软目标加均方误差表现突出,说明模态内相似度作为目标优于独热向量;纯音频软目标也有不错排名,说明音频侧结构同样可用。不确定度与模态分类在零样本分类上没有带来额外收益,这是一个明确的负结果。

文本查音频上音频文本联合加不确定度的版本领先,支持不确定度估计在这个任务有意义。音频查文本上音频文本联合加均方误差最强,且有两个单项第一。综合多任务看,纯文本加均方误差是最佳折中:在零样本分类居首,在两个检索任务居次席。若追求单任务最优,则应按任务选配置,而不是用同一配置打全部任务。

与基线和大规模方法相比,提案在除个别数据集外的所有任务与数据集上都超过两者,但大规模方法在某个数据集上仍居首,说明小预算方法不是全面碾压。 下表聚焦累积排名这一聚合口径,比较问题是同任务下不同目标来源与损失范式的相对顺序,指标方向是排名数字越小越好,公平条件是同批量同数据。

任务评价方式本方法取值一对比方法取值一对比方法取值二
零样本分类累积排名162021
文本查音频累积排名5626 到 29
音频查文本累积排名248

表后需要强调收益与代价:表中零样本分类的 16 对应纯文本加均方误差,20 对应纯文本加交叉熵,21 对应纯音频加均方误差,说明换损失的收益大于换模态来源的差异;文本查音频的 5 对应联合加不确定度,说明逐对自适应混合在该任务有收益;26 到 29 是大规模方法在联合评估中的平庸累积排名,说明大数据大批量优势并未在所有任务保持。

反例是纯音频与联合配置在零样本分类并未超过纯文本,大规模方法在个别数据集仍第一,因此不能把总体趋势推广到每组数据每一步都成立。

拿掉音频侧、文本侧、不确定度或模态分类会发生什么?

消融沿目标来源、混合方式、损失范式与附加分支 4 条轴展开。目标来源轴比较纯文本、纯音频与两者联合。报告显示纯文本通常是最稳的单来源,纯音频在零样本分类也能给出接近的排名,联合在检索任务更强。这支持文本与音频结构互补,但也说明联合不总是赢,需要按任务选择。混合方式轴比较固定加权与不确定度加权。

不确定度加权在文本查音频领先,在其他任务没有一致增益,说明其收益是任务相关的,不能当成通用改进。损失范式轴比较交叉熵与均方误差,均方误差在 3 个任务全面占优,这是全文最一致的消融信号,但原文只给出假设性解释,即交叉熵难以处理软目标,尚未提供完整的损失曲面与梯度分析,因此只能记为支持而非证明。附加分支轴比较是否加入模态分类。

在文本查音频中加入模态分类的版本能接近不确定度版本的排名,在零样本分类则无帮助,说明缩小模态间隙与提升可比性的作用取决于任务对跨模态排序的敏感度。还有一个隐含消融是批量大小:全文固定在小批量下验证,没有报告大批量下提案是否仍有效,因此不能把结论外推到大批量训练。

证据的边界在哪里,哪些话不能说?

第一,训练预算边界。所有提案都在批量 64 与约 500000 样本下与基线比较,大批量与数百万样本下的行为未测量,不能声称方法在大批量下必然同样有效。第二,评估边界。检索只在一个评测划分上报告,零样本分类只在 4 个数据集上报告,没有报告误判率分布、统计显著性与多次随机种子的方差,相关性不能当因果。第三,成本边界。

原文没有测量训练时长、推理延迟、显存占用与输出帧率,不确定度估计需要多次前向,模态分类需要额外网络,这些都会增加训练开销,但在没有实测数字时不能承诺延迟或成本改善。第四,实现边界。教师编码器的冻结是明确的,但扰动丢弃的具体插入位置、分类器网络宽度与初始化、音频切段平均的边界处理等细节只给部分描述,复现时需以原文为准,缺失处应标记为缺项而不是按模型名称猜测。第五,公开性边界。

本次收到的资源状态没有绑定且完成验证的开源链接,因此不能声称代码、模型或数据当前可用或已公开,只能按论文文字理解其训练流程,实际可运行性待验证。

要复现先做什么,需要保留哪些信息条件?

复现的第一步是重建基线第一阶段而不含知识蒸馏。按原文搭建可训练音频编码器与文本编码器加全连接层,用余弦相似度得到预测矩阵,用独热矩阵与交叉熵跑通小批量训练与验证选点流程,确认能复现基线的检索指标量级。第二步是加入冻结教师:加载与主音频编码器相同的预训练权重并冻结,加载句子嵌入教师并冻结,在每个批量内离线算出两个对称的模态内相似度矩阵,先用固定权重混合验证纯文本、纯音频与联合三档,再接入不确定度路径。

第三步是替换损失:把交叉熵换成均方误差,注意目标矩阵与预测矩阵都要经过相同的温度缩放 softmax 后再比较,不要只换一侧。第四步是可选的模态分类分支:拼接两组嵌入,归一化后送入梯度反转与多层感知机,用较小的分支权重联合训练。必须保留的信息条件包括批量大小、嵌入维度、两个温度系数、扰动次数、丢弃概率、分支权重与学习率 schedule,以及音频切段长度与验证选点指标。

若要验证单任务最优,应分别保存零样本分类、文本查音频、音频查文本的最优检查点,而不是强求一个检查点打全部任务。还需补做的验证是多次种子下的方差、大批量下的表现、以及训练与推理耗时的实测,这些是原文未报告但决定方法是否值得尝试的关键。

何时值得尝试这个方法,一句话如何复述?

当你的音频文本对比学习受限于小批量、小数据,且批量内存在语义相近但配对不同的样本时,值得尝试用冻结教师的模态内相似度做软目标,并把损失换成均方误差做回归。操作顺序是先上纯文本软目标加均方误差拿到多任务基准,再试音频文本联合,最后才按任务决定是否加不确定度加权或模态分类,因为后两者的收益是任务相关的且带来额外计算。

可以复述的方法是:每个批量内用冻结编码器算出文本间与音频间余弦矩阵,按固定比例或按不确定度逐对加权合成目标矩阵,对预测矩阵与目标矩阵做相同温度 softmax 后用均方误差比较,同时可选地用梯度反转让音频文本嵌入更难被分类器区分。需要清醒的是,这不等于解决了模态间隙或数据噪声,只是用更细的目标替代独热假设。

在没有大批量验证、没有成本实测、没有显著性统计之前,只能说该方法在指定小预算条件下与大规模方法竞争,而不能承诺在所有数据、批量与延迟约束下都更优。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总