英文题目:MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

会议身份:conference:interspeech:2026:conference-paper-id:nakagome26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #多模态学习 #预训练 #零样本 #音频检索

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yu Nakagome:机构信息未能从会议 PDF 纯文本可靠映射
  • Jaesong Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Soo-Whan Chung:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音频文本对齐输入为10秒音频片段与自由文本描述,输出为跨模态检索排序,难点在于同一场景含重叠声事件且描述方式多样,确定性点嵌入难以表达多对多歧义与包含语义。MixProLAP先用HTS-AT音频编码器与GPT-2文本编码器加均值方差头将双模态映射为对角高斯分布,再以概率成对对比学习Probabilistic Pairwise Contrastive Learning / PPCL与闭式采样距离Closed-form Sampled Distance / CSD做跨模态对齐,随后在同批次内以波形加权叠加与文本连接词拼接构造混合超集并施加模态内包含损失,最后按混合系数分级施加多层包含损失以形成不确定性梯度。与掩码式ProLAP的关键机制差异在于用加性组合而非信息删除来制造层级,混合体在语义上近似包含各源,避免瞬态事件被掩码抹除或环境声掩码无效的问题。在AudioCaps训练并在AudioCaps评测的音频到文本检索中MixProLAP以R@1 26.85超过CLAP基线24.23,显示了对描述歧义的更好建模。该结论目前仅限于AudioCaps与ClothoV2的零样本检索,文本拼接引入的语言不自然性与混合比例外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么对齐天然含糊?

这篇论文的输入是一段音频波形与一句自然语言描述,目标是学到跨模态检索能力:给定声音找到最匹配的文本,给定文本找到最匹配的声音。输出包括用于检索的概率嵌入,以及对方差大小的解读。必须保留的关键信息是数据条件、编码器起点、损失权重与评测指标,否则无法复述方法。真实声环境常常同时出现多个事件,例如鸟叫叠加小孩笑声,同一场景又可以用长短、详略不同的句子描述。于是音频与文本之间不是 1 对一,而是 1 对多与多对一交织。

传统对比语言音频预训练把每个样本压成一个点,用点与点靠近表示配对,这在语义层级上是吃力的。比如 heavy rain 在语义上蕴含 rain,点嵌入很难自然表达谁的范围更大。论文因此把每个模态表示为高斯分布,用均值表示位置,用方差表示不确定性或语义宽度。学习者需要先接受这个设定:方差大不直接等于模型没学好,而是可能对应更宽泛、更含糊的语义。后续所有混合与包含设计,都是为了让这种宽窄关系有可监督的训练信号。

已有路线做了什么,本文在哪个缺口上动手?

相关路线可以按同输入、同目标、同监督来对照。第一条是确定性对比语言音频预训练,以 CLAP 为代表,输入音频文本对,用 InfoNCE 拉近配对、推远非配对,运行阶段用余弦相似度做零样本检索。它在许多基准上有效,但表示本身不携带不确定性。

第二条是概率视觉语言预训练,以 ProLIP 为代表,把每张图像与每句话表示为高斯分布,提出概率成对对比学习与闭式采样距离,并用包含损失刻画图像被文本包含的非对称关系,还用图像块掩码与文本词掩码构造语义减少的版本,施加原图被掩码版本包含的模态内约束。第三条是直接把上述思想搬到音频的 ProLAP,用频谱块掩码模拟不确定性,并增加层级包含与掩码排斥等目标。

本文指出掩码在音频上假设不稳:对枪声、狗吠这类瞬态事件,掩码可能正好删掉决定性片段,使原样本不再是掩码版本的语义子集;对雨声、音乐这类环境声,掩码只改局部,全局语义几乎不变,形不成有意义的层级差异。因此本文保留概率对比与包含的基本框架,但把不确定性来源从删除改为叠加,用混合构造语义超集。教学上可以把例子记为:掩码是做减法,混合是做加法,本文认为加法更符合声音在时间上叠加的物理过程。

要解决的具体问题与可检验的预期是什么?

具体问题是:如何在训练中给出稳定、可复现的包含监督,使模型学到的方差能反映语义宽窄,而不是只靠对比损失顺带学出。可检验的预期分为两类。第一类是检索性能:在相同预训练权重与相同训练数据下,概率混合模型在 AudioCaps 与 ClothoV2 的音频到文本、文本到音频检索上,召回率与平均精度应可与微调后的确定性 CLAP 基线比较,并在音频到文本方向显示优势。第二类是机制验证:如果混合确实构造了超集,那么加入混合模态内包含损失应提升性能。

如果混合比例反映不确定性程度,那么再加入多级包含损失应在音频到文本方向带来额外增益;如果模态间信息构造方式一致很重要,那么音频混合配文本拼接应优于音频混合配词掩码。论文还预期文本越长、描述越丰富,不确定性越低,而音频 duration 与不确定性不呈简单单调关系,因为拉长同一录音往往只是时间冗余,而非新增声事件。这些预期都可以在消融与不确定性分析中逐项核对。

确定性点嵌入 × 概率高斯嵌入: 确定性点嵌入负责把一段音频或一句文本压成空间中一个固定点,分工是便于用余弦或点积算相似;概率高斯嵌入负责同时输出均值向量与对角方差向量,分工是用分布的中心表示语义位置、用 spread 表示含糊程度。搭配理由是音频文本存在 1 对多与多对一,单点无法表达 heavy rain 蕴含 rain 这类层级,组合意义是让相似度同时考虑中心距离与不确定性之和,为后续包含关系提供可计算的载体。

方法全景:一个样本如何走完输入到损失?

先沿一个配对样本走完全流程。输入是一段 10 秒音频与一句标题。音频经过 HTS-AT 音频编码器,文本经过 GPT-2 文本编码器,各自得到特征向量。随后每个编码器后面接两个独立投影头,一个预测高斯均值,一个预测对数方差,均值做 L2 归一化以稳定隐空间,方差用对数尺度保证数值稳定。于是每个样本变为一个对角高斯分布。

跨模态用概率成对对比学习对齐分布,距离采用闭式采样距离,即均值平方距离加方差和,相似度再经可学习缩放与偏置送入对比损失。同时施加模态间包含损失,鼓励音频分布被对应文本分布包含。模态内则另起一条线:在同一小批量内取两个不同音频文本对,把波形按比例相加得到混合音频,把两句标题用 and 或 while 连接得到拼接文本,分别施加源被混合包含的损失,并对不同混合比例之间施加多级包含损失。

全部损失加权求和,再加变分信息瓶颈正则防止方差坍缩。下图给出整体架构,有助于把上述分支 1 次看清。 下面这段是该架构图的阅读引导,读完引导再看图,再读图后解释。

看图路径: 1. 先从底部波形与词块向上追踪音频编码器与文本编码器的两条主路径;2. 再看每条路径上方均值头与方差头的分叉与归一化标注;3. 最后比较中间黄色对比箭头与两侧绿色包含箭头的连接对象

原论文 Figure 1:Overview of MixProLAP architecture.

论文图 1。原论文 Figure 1:“Overview of MixProLAP architecture. Audio and text en- coders output probabilistic embeddings through mean and variance projection heads.”。

图中自下而上是输入到输出的主路径:底部左侧为双色叠加的混合波形与单色源波形,右侧为蓝色源词块与绿色新增词块加灰色连接词;中部是橙色音频编码器与蓝色文本编码器;其上是全连接层与归一化或对数变换头;顶部是椭圆表示的分布。中间黄色双向箭头表示源音频与源文本之间的概率对比学习,两侧绿色箭头表示源分布到混合分布的包含约束。

例子 A little bird chirps 与 and kids laugh and shout 直观展示了文本拼接如何对应音频叠加。需要强调的是,图只说明结构,不证明包含关系天然成立,是否成立要看混合构造与损失的配合。

分布、距离与包含:组件各自算什么?

概率表示的计算目标是把不确定性写进相似度。编码器输出均值 mu 与方差 sigma 后,两个分布之间的闭式采样距离定义为均值差的平方 L2 范数加上两组方差之和的 L1 范数。直观理解是:中心越远距离越大,双方越不确定距离也越大。概率成对对比学习把该距离取负、经缩放偏置后送入逻辑损失,正样本要求距离小,负样本要求距离大。

包含损失的计算目标不同,它用假设得分衡量一个分布被另一个分布覆盖的程度,得分来自 2 个方向积分比值的对数,再经逻辑函数形成损失。模态间包含要求音频在文本内,模态内包含要求源在混合内。实现上原文明确给出均值归一化、对数方差、方差头偏置初始化为负 10 的细节,含义是训练起点先让不确定性很小,再逐渐学大。下图把模态内包含的语义画成椭圆覆盖关系,可作为公式含义的几何对照。 下面这段是包含示意图的阅读引导,读完后再看图。

看图路径: 1. 先看左侧三段波形如何指向同一个大椭圆内的两个小椭圆;2. 再看右侧蓝色与绿色小椭圆如何被灰色大椭圆包住;3. 对比左右两侧虚线箭头标注的源到混合的包含方向

原论文 Figure 2:Illustration of intra-modal inclusion loss.

论文图 2。原论文 Figure 2:“Illustration of intra-modal inclusion loss.”。

左图音频包含中,下方橙色与绿色波形是两个源,上方双色波形是混合,顶部大灰椭圆是混合分布,内部橙绿小椭圆是源分布,虚线箭头表示源被混合包含。右图文本包含中,下方蓝色词块对应源标题,绿色词块对应新增内容,顶部大椭圆是拼接文本分布,内部小椭圆是源标题分布。像素上可以执行 3 个动作:比较大小椭圆的覆盖方向是否都是源在内、混合在外;比较左右两图是否都用大包小表达超集;注意右图两个小椭圆位置分离,提示文本拼接的语义是并列而非融合。几何图只是示意,不能当作方差数值的证明。

概率成对对比学习 × 模态间包含损失: 概率成对对比学习负责拉近配对音频文本分布、推远非配对分布,分工是解决跨模态对齐;模态间包含损失负责让音频分布被包含进对应文本分布,分工是刻画文本更抽象、音频更具体的非对称关系。搭配原因是仅做对比只能学到靠近,学不到谁的语义更宽,组合意义是在对齐基础上再约束分布的覆盖方向,使宽泛描述对应更大的分布区域。

频谱掩码 × 混合超集: 频谱掩码负责通过删除时频块制造信息减少的版本,分工是模拟语义变窄;混合超集负责通过波形相加制造同时包含两个声事件的版本,分工是模拟语义变宽。搭配理由是音频具有瞬态与环境声的组成特性,掩码可能删掉枪声关键帧而破坏子集假设,或对雨声只改局部而不改变语义,组合意义是用加法构造天然满足包含关系的训练对,让包含损失在音频域可稳定施加。

混合系数 × 多级包含损失: 混合系数负责控制两个源信号在混合波形中的比例,分工是量化混合的不确定性程度;多级包含损失负责让混合比例更均衡、语义更杂的分布包含住比例更偏向单源的分布,分工是把离散的包含扩展为 graded 的层级链。搭配原因是单级混合只教模型源在混合内,多级才能教模型越均衡越不确定,组合意义是形成随混合度平滑增大的不确定性梯度。

混合如何构造,多级层级如何组织,总损失如何加权?

训练的构造过程是可复述的核心。给定同一小批量内两个音频波形 ai 与 aj,按 ai,j 等于 alpha 乘 ai 加 1 减 alpha 乘 aj 相加,alpha 从 0.5 到 1.0 的均匀分布中采样。采样对来自同一小批量内不同音频文本对,混合结果同时含有两个源的声学线索,被视为近似语义超集。文本侧把 ti 与 tj 用 A and B 或 A while B 形式拼接,保留双方语义,反映共现事件。损失上,音频混合包含损失要求两个源分布都被混合分布包含,文本拼接同理。

多级包含则定义 L 个混合水平,系数 alpha 递减,越靠后两源贡献越均衡、语义越不确定,要求前 1 级混合分布被后 1 级包含,原文实现取 L 等于 3。总损失是概率对比、模态间包含、音频混合包含、文本混合包含、多级包含与变分信息瓶颈的加权和,权重分别取模态间 5 乘 10 的负 7 次方,音频与文本混合各 5 乘 10 的负 3 次方,瓶颈系数 1 乘 10 的负 5 次方。优化用 AdamW,1 次矩 0.9,2 次矩 0.999,权重衰减 0.01,学习率 1 乘 10 的负 5 次方,余弦退火加 5 个 epoch 线性热身,共 30 个 epoch,有效批量 2048,其中 50% 样本用于混合。

编码器用与基线相同的预训练 CLAP 权重初始化,投影头为两层全连接。原文未报告梯度是否截断到编码器或投影头的细节,也未说明混合样本是否参与跨模态对比,复现时应按最直接的实现先做,再把该缺项记为待确认。

闭式采样距离 × 变分信息瓶颈损失: 闭式采样距离负责在检索与训练时度量两个高斯分布的距离,分工是把均值平方距离与方差和结合为可微相似度;变分信息瓶颈损失负责约束分布不要坍缩为方差为零的点,分工是正则化不确定性表示。搭配原因是没有瓶颈约束,模型可能为降低对比损失而把方差压到极小,退化为确定性模型,组合意义是在学到判别性的同时保留有意义的方差输出。

数据、划分、基线与指标如何保证可比?

实验用 AudioCaps 与 ClothoV2 同时做训练与评测。AudioCaps 约 51,000 段来自 AudioSet 的音频并配人工标题,ClothoV2 约 6 1,000 段音频且每段配 5 句标题。训练统一截为 10 秒段,ClothoV2 测试集中更长的音频被切为 10 秒块再平均嵌入得到最终表示。评测是标准音频语言检索做法,报告音频到文本与文本到音频 2 个方向的 Recall at 1、Recall at 10 与 mAP at 10,测试集全部 5 句标题都作为检索目标,概率模型用闭式采样距离代替余弦相似度计算跨模态相似。

基线是关键公平点:用相同预训练 CLAP 权重,在相同数据上用标准 InfoNCE 微调得到确定性基线,MixProLAP 的编码器也从同一权重初始化,再加均值方差头。训练配置除增强策略外保持一致,掩码对照还补了 ProLAP 的层级包含与掩码排斥损失。指标方向是越高越好,但不同指标不可混比,Recall at 1 反映首位命中,Recall at 10 反映前 10 覆盖,mAP at 10 反映排序质量。跨数据集训练与评测的组合用于同时看域内性能与跨域泛化,复现时必须核对训练集、测试集、方向与指标四元组,不能只看单一数字。

主结果:哪里赢了,哪里没赢,代价是什么?

比较问题是:在相同起点与相同数据下,混合不确定性建模是否在零样本检索上带来可运行的增益,指标方向均为越高越好。下表按训练集与测试集展开 2 个方向的三指标,基线为同条件微调的确定性 CLAP。

训练集评测集与方向方法R@1R@10mAP@10
AudioCaps 训练AudioCaps 音频到文本CLAP 基线24.2363.7118.89
AudioCaps 训练AudioCaps 音频到文本MixProLAP26.8568.3720.24
AudioCaps 训练AudioCaps 文本到音频CLAP 基线26.8571.4439.93
AudioCaps 训练AudioCaps 文本到音频MixProLAP25.5370.6338.76
ClothoV2 训练ClothoV2 音频到文本CLAP 基线13.4041.729.65
ClothoV2 训练ClothoV2 音频到文本MixProLAP15.6046.5111.19
ClothoV2 训练AudioCaps 文本到音频CLAP 基线20.2061.0731.65
ClothoV2 训练AudioCaps 文本到音频MixProLAP21.0563.8233.16

表后解释需要同时讲收益与代价。

当 AudioCaps 训练时,MixProLAP 在域内音频到文本方向从 24.23 提升到 26.85,Recall at 10 从 63.71 提升到 68.37,mAP 从 18.89 提升到 20.24,支持混合不确定性有助于处理一音多述;但在同域文本到音频方向,CLAP 的 26.85 高于 MixProLAP 的 25.53,mAP 也是 39.93 高于 38.76,这是明确的未胜出项,论文将其归因为简单文本拼接不如直接操作声信号有效,该解释属于有限解释而非已验证因果。当 ClothoV2 训练时,MixProLAP 在域内 2 个方向总体占优,并在跨域 AudioCaps 文本到音频上从 20.20 提升到 21.05,支持概率建模对标题表达变化更鲁棒。总体趋势不等于每组都赢,复述时必须保留方向不对称这一限制。 下面这段是不确定性曲线的阅读引导,读完后再看图。

看图路径: 1. 先确认左图横轴为音频时长、右图横轴为文本词数,纵轴均为方差;2. 再观察右图随词数增加而下降的趋势与误差棒变化;3. 对比左图随 duration 增加不单调且误差棒较大的形态

原论文 Figure 3:Relationship between input length and estimated uncertainty on AudioCaps test set.

论文图 3。原论文 Figure 3:“Relationship between input length and estimated uncertainty on AudioCaps test set.”。

左图显示音频方差随 duration 增加先升后波动且误差棒大,短片段方差反而小,原文解释为短片段常是清晰单事件,而拉长同一录音多为时间冗余;右图显示文本方差随词数增加单调下降,支持描述越丰富歧义越小的判断。读图时不要把左图纵轴小幅波动解读为性能变差,纵轴是方差不是召回率;也不要把右图末点推广为词数无限增加仍会下降,超出观测范围属于待验证。

消融:每个损失是否必要,失败条件是什么?

消融要回答混合包含与多级包含各自贡献了什么,比较条件是 AudioCaps 测试集、相同概率对比起点。下表比较仅概率对比加模态间包含、再加混合包含、再加多级包含的三档配置。

配置音频到文本 R@1音频到文本 mAP@10文本到音频 R@1文本到音频 mAP@10
概率对比加模态间包含22.9818.5526.0539.26
再加混合模态内包含24.6919.3426.6739.91
再加多级包含26.8520.2425.5338.76

表后解释是:加入混合包含后 2 个方向都有提升,音频到文本 R@1 从 22.98 到 24.69,文本到音频 R@1 从 26.05 到 26.67,支持源被混合包含的约束有效。

再加入多级包含后音频到文本继续从 24.69 到 26.85,但文本到音频从 26.67 回落到 25.53,mAP 也从 39.91 回落到 38.76,说明多级层级主要帮助音频到文本,代价是文本到音频轻微下降。另一组对照比较增强策略:频谱掩码加词掩码、音频混合加词掩码、音频混合加文本拼接三档中,前两档音频到文本 R@1 为 22.64 与 23.89,第三档跃升到 26.85;仅把音频换成混合而文本仍用掩码时,文本到音频反而从 21.68 降到 19.80,提示模态间不确定性方式不一致会造成语义错位,只有双侧都用组合式增强才大幅改善。

该负结果很重要:混合不是无条件有效,必须与文本拼接配套。

哪些边界尚未验证,不能承诺什么?

首先是方向不对称尚未解决,AudioCaps 训练下的文本到音频方向基线仍略优,多级包含也会轻微压低该方向,说明文本拼接的建模能力弱于音频混合,不能承诺所有检索方向都提升。其次是不确定性分析属于相关性观察,文本越长方差越小支持语义密度解释,但音频 duration 与方差无单调关系,原文用时间冗余解释,该解释未做事件数量受控实验,属于可能而非已证实。

第三是未测量量:原文未报告误判率、延迟、训练显存与推理开销,也未给出方差校准或阈值化使用的评估,因此不能承诺不确定性估计可直接用于拒绝识别或安全决策。第四是超参与构造缺项:混合系数上限、拼接连接词选择、多级水平数 L 等于 3 的敏感性未充分展开,梯度路径与混合样本是否进入对比损失也未明确,复现时需把这些记为待补验证。

最后是资源状态:本次收到的证据中没有完成 HTTPS 验证的开源资源声明,不得声称代码、模型或数据已公开,只能按论文文字复现。

复现先做什么,需要哪些信息条件?

复现的第一步是准备数据与起点:下载 AudioCaps 与 ClothoV2,按原文 10 秒分段训练,对 ClothoV2 长测试音频做 10 秒切块平均,并用微软 CLAP 预训练权重初始化 HTS-AT 与 GPT-2 编码器。第二步是实现概率头:每个编码器后加两个两层全连接头,分别输出均值与对数方差,均值 L2 归一化,方差头偏置初始化为负 10,检索时用闭式采样距离。第三步是实现混合流水线:在每批内配对不同样本,按 0.5 到 1.0 均匀采样 alpha 做波形相加,50% 批次样本参与混合,文本用 and 或 while 拼接,多级混合取 3 个递减系数。

第四步是按权重求和总损失:模态间包含 5 乘 10 的负 7 次方,音频文本混合各 5 乘 10 的负 3 次方,瓶颈 1 乘 10 的负 5 次方,用 AdamW 训练 30 个 epoch,学习率 1 乘 10 的负 5 次方加余弦退火与 5 epoch 热身,有效批量 2048。先复现主检索表,再复现消融三档与增强三档,最后画出方差随长度曲线。若结果在文本到音频方向波动,应优先检查文本拼接模板与批量内负样本采样,而不是直接调大包含权重。

何时值得尝试,何时不必照搬?

当任务中声音经常叠加、标题详略差异大,且需要在检索之外得到语义宽窄的相对排序时,这套加法不确定性值得尝试,因为它用可构造的超集关系给方差提供了直接监督。当数据多为单事件短音、文本长度规范统一时,混合带来的增益可能有限,不必照搬 3 级层级,可先只加单级混合包含验证。需要避免的误解有三:一是把方差大等同于样本难或标注错,方差大也可能只是语义本身宽泛。

二是把掩码一概否定,掩码在视觉与文本上仍有效,只是在音频瞬态与环境声上假设不稳;三是把跨域提升当作因果证明,论文显示的是在给定权重与数据下的相关改进,换 backbone 或换采样策略后仍需重测。收束一句话:用叠加构造超集、用比例构造层级,是本文对音频组成特性的针对性回答,复述与复现都应围绕超集是否成立、层级是否单调这两点展开。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总