英文题目:ProLAP: Probabilistic Language-Audio Pre-Training

会议身份:conference:interspeech:2026:conference-paper-id:manabe26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #对比学习 #多模态学习 #预训练 #音频检索

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Toranosuke Manabe:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuchi Ishikawa:机构信息未能从会议 PDF 纯文本可靠映射
  • Hokuto Munakata:机构信息未能从会议 PDF 纯文本可靠映射
  • Yoshimitsu Aoki:机构信息未能从会议 PDF 纯文本可靠映射
  • Tatsuya Komatsu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语言描述音频检索的输入为音频片段与自然语言查询,输出为跨模态相似度排序,难点在于一对多与多对一映射交织且声音源相互叠加,确定性单点嵌入难以表达抽象层级。概率语言音频预训练 ProLAP 先将音频与文本分别编码为对角高斯分布的均值与方差,再用概率成对对比损失 PPCL 拉近匹配对并推远非匹配对,随后用跨模态与模内包含损失约束一般概念包含具体概念。与确定性 CLAP 直接比较余弦距离不同,该方法用分布重叠度与非对称包含分数显式建模不确定性与层级,分层掩码进一步构造由粗到细的包含链条。在 AudioCaps 上音频到文本检索 R@1 达 42.13%,相对 SigLIP 基线提升约 1.25 个百分点且在跨数据集上保持稳定,音频遍历精度达 26.83% 显著高于基线。该结论仅在 AudioCaps 与 ClothoV2 微调与合成层级字幕上验证,对真实多源重叠与开放域查询的外推尚未证明。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么一对一假设不够用

这篇论文研究的输入是一段音频与其自然语言描述,目标是学到一个音频文本共享的表示空间,支持文本找音频、音频找文本以及零样本理解。必须保留的关键信息是音频与文本的关系是多对多:同一段音频可以用粗描述也可以用细描述,同一句粗描述可以对应多段不同的音频。举例来说,狗叫声是一个粗概念,它可以对应小型犬在室内的叫声,也可以对应大型犬在户外的叫声。

反过来,一段具体的录音既可以被标注为狗在叫,也可以被标注为小狗在室内吠叫。输出是每个输入在共享空间中的表示,以及表示之间的相似度或包含分数。传统对比语言音频预训练把每个输入映射为一个确定向量,再用配对关系拉近推远,这种做法隐含了 1 对一假设。它能学会配对是否匹配,但难以表达谁更一般、谁更具体,也难以表达一个粗描述覆盖多个具体实例的结构。

论文要解决的正是如何在不牺牲基本检索能力的前提下,让表示本身带有层级和不确定性。

视觉语言的层级做法为什么不能直接搬到音频

在视觉语言领域,已经有工作用概率嵌入、双曲空间或包含关系来建模多对多与层级,例如用分布覆盖关系表示一般概念包含具体概念,用遍历任务观察从具体图像向抽象概念移动时邻近文本的变化。这些做法依赖的一个前提是视觉场景中的对象在空间上相对可分,裁剪、遮挡或换描述往往对应比较清晰的语义变化。音频的困难在于真实声音是多个声源叠加的结果,时间上重叠、频谱上交织,很难像图像那样切出一块就得到一个干净的子概念。

直接把视觉的做法搬过来,可能会把叠加的混合声误当成单一层级,把遮挡后的变化误当成语义变粗。论文明确把这种模态差异作为起点,因此没有只做概率化,而是额外设计适合音频的遮挡处理与分层包含约束,并构造专门的诊断数据来检验学到的到底是语义包含还是遮挡痕迹。理解这一点,才能明白后文为什么要在音频编码器里特殊处理遮挡标记的池化,为什么要用事件级切分来做包含测试。

要验证什么问题,需要什么样的评测才能说明层级

论文把问题拆成 3 个可检验的部分。第一是基本对齐是否还在,也就是音频找文本、文本找音频的召回率和平均精度是否与确定性基线相当,这是不能丢失的底线。第二是层级是否真的被学到,需要比检索更直接的证据。作者为此构造了两个基于音频标题数据的诊断集。第一个是分层标题集,对每条原始标题生成从细到粗的 4 个抽象级别,原始标题最具体,级别一最抽象,例如把带细节的人声笑声描述逐步抽象为带人的哼鸣声。

第二个是事件级标题集,把一条复合标题拆成单个事件的短句,并用音频切分模型按短句切出对应的音频片段,用来检验部分与整体的包含关系。第三是不确定性估计是否直观,例如更长、更具体的文本是否对应更小的不确定性,被遮挡更多的输入是否对应更大的不确定性。只有这三部分同时成立,才能说模型既对齐又分层,而不是用检索分数掩盖层级缺失。

ProLAP 整体走通一个样本要经过哪些步骤

沿一个样本走一遍有助于建立全局感。一段音频先变成声谱特征并切成片段序列,一句文本先变成词序列,两者分别进入音频编码器和文本编码器。编码器不再只输出一个点,而是输出两组参数,一组是均值向量,表示该输入在共享空间中的中心位置,另一组是方差向量,表示该输入覆盖范围的大小,合起来就是一个对角协方差的高斯分布。训练时有两类目标同时作用。

第一类是概率成对对比目标,负责判断音频分布与文本分布是否匹配,匹配的拉近,不匹配的推远。第二类是包含目标,负责约束分布之间的覆盖方向,例如让更一般的分布包含更具体的分布。推理时检索仍用基于均值与协方差修正后的相似度,而层级分析则用包含分数或向抽象锚点移动的遍历序列。下面的总览图把这条主路径和 3 组损失的位置画了出来,读图时先分清上下是输入到分布的过程,底部是目标约束的是哪两团分布。

对比语言音频预训练 × 概率表示: 对比语言音频预训练负责把配对的音频和文本拉近、把不配对的推远,提供跨模态对齐的基本目标;概率表示负责把每个输入从一个确定点换成一个高斯分布,用均值表示位置、用方差表示不确定范围。二者搭配的理由是确定点只能表达 1 对 1 对应,而分布的覆盖范围可以表达 1 对多与包含,组合后模型既能对齐又能为粗细不同的描述预留不同的覆盖大小。

整体结构的前导说明是:上半部分是双路编码,下半部分是 3 个损失分别管对齐与包含,左路和右路的遮挡分支为层级提供对比材料。

看图路径: 1. 先从上向下看左侧声谱图与右侧文本的两条输入路径;2. 再看编码器下方均值与对数方差两个输出头如何分开;3. 最后看底部三组椭圆包含关系分别对应哪两路分布

原论文 Figure 1:Overview of ProLAP. ProLAP models the representation as a Gaussian random variable following N(μ,…

论文图 1。原论文 Figure 1:“Overview of ProLAP. ProLAP models the representation as a Gaussian random variable following N(μ, σ2).”。

对上图的解释是:顶部左侧是声谱图与其切分片段,顶部右侧是一句示例英文描述与其词序列,中间绿色块为音频编码器、紫色块为文本编码器,编码器下方橙色与深绿色小块分别输出均值与对数方差。底部左侧两团绿色椭圆表示遮挡音频分布包含原始音频分布,中间表示音频分布与文本分布的对比与包含,右侧两团紫色椭圆表示原始文本被遮挡文本包含。箭头方向标明了谁包含谁,遮挡分支的存在说明层级监督来自完整与缺损版本的比较,而不仅仅来自音频文本配对。

分布相似度与包含分数具体算什么

先讲白话再讲计算。概率表示的意思是每个输入对应一团云,云的中心是均值,云的胖瘦是方差。方差大表示这个输入可以对应很多种具体情况,也就是更一般、更不确定;方差小表示指向很具体的情况。修正相似度的作用是在算音频文本是否匹配时,同时考虑中心距离和两团云的大小,避免只看中心点带来的误判。

包含分数的作用是判断第一团云是否被第二团云包含,它通过比较 2 个方向上的密度重叠来构造非对称分数,再经过逻辑函数变成概率形式,分数为正表示包含假设成立的方向。跨模态包含假设文本比对应音频更不确定,因此约束音频分布被文本分布包含。模态内包含假设被遮挡的输入比完整输入更不确定,因此约束完整分布被遮挡分布包含。训练时还对每个分布加方差正则,防止方差塌缩到零而退化为确定点。

概率成对对比损失 × 包含损失: 概率成对对比损失负责在分布之间算相似度并做配对判别,维持音频文本是否匹配的基本区分力;包含损失负责约束两个分布之间的非对称覆盖关系,让更一般、更不确定的分布包含更具体、更确定的分布。二者搭配是因为只做对比只能学会靠近或远离,学不到谁更一般谁更具体,组合后对齐目标管匹配,包含目标管层级方向。

跨模态包含 × 模态内包含: 跨模态包含负责约束音频分布被对应文本分布包含,编码作者假设的文本比音频更不确定;模态内包含负责约束被遮挡输入的分布包含未被遮挡的对应分布,编码信息缺失带来不确定性增大。二者搭配是因为层级既存在于音频与文本之间,也存在于同一模态的完整与缺损版本之间,组合后模型同时从跨模态和模态内两条路径获得层级监督。

分层包含损失 × 遮挡: 遮挡负责制造信息量逐级减少的输入版本,文本丢词、音频丢片段,构造出由具体到抽象的序列;分层包含损失负责对相邻遮挡级别逐级施加包含约束,形成链式的包含关系。二者搭配的理由是单次遮挡只能给出 2 级对比,而递归遮挡给出多级阶梯,组合后模型能学到连续的粗细变化而不是只有完整与缺损两端。

实现上有两个音频特有的细节。文本编码器可以用句尾标记估计均值、用新增的不确定标记估计方差,遮挡就是把部分词换成遮挡标记。音频编码器基于滑动窗口结构,不能直接做词级别丢弃,作者加入不确定头与可学习的遮挡标记,并在最后的自适应平均池化中只平均未被遮挡的标记。原文报告说如果直接加遮挡标记而不改池化,被遮挡的音频嵌入会塌缩到几乎相同的表示,导致不确定性学不出来。这个细节说明音频的遮挡不是照搬文本做法就能生效,必须配合池化处理才能让遮挡真正带来信息缺失。

训练目标如何组合,遮挡层级如何递归构造

训练目标由三部分相加。第一部分是对所有音频文本对的概率成对对比损失,用可学习的缩放与偏置把修正相似度映射为配对判别。第二部分是模态内损失,对每个音频和每个文本的完整与遮挡版本施加包含约束,并加上方差正则。第三部分是跨模态包含损失,对配对的音频文本施加音频被文本包含的约束,权重在原文中设得很小,说明它起微调方向的作用而不是主导对齐。分层包含损失是把模态内的 1 次包含扩展为多级链。

做法是用哈达玛积递归生成二值遮挡掩码,每 1 级在上 1 级基础上再随机遮掉一部分,遮挡比例服从二项分布。相邻 2 级之间都施加 1 次包含约束,最缺损的 1 级包含关系链的顶端,最完整的 1 级在底端。当层级数为一时,该损失退化为单次包含。原文在文本侧用 2 级、在音频侧用 1 级,这种不对称设置来自消融结果,文本侧加深有助于不确定性与长度的相关性,音频侧加深则容易轻微损伤检索。

训练从已有的对比音频预训练权重开始微调,而不是从零训练,这意味着层级能力是在已有对齐基础上继续塑造的。

如果要重做训练,先准备什么超参数与数据处理

重做时先按原文的微调路线准备,而不是从零训练。起点是已有的对比音频预训练权重,编码器为分层音频变换器与第二代生成预训练文本模型,优化器用自适应矩估计,训练 50 轮、批量二百五十六、余弦调度加一轮热身。关键超参数按下表记录,表中数字来自原文连续句子,单位与精度保留原写法,阅读时注意权重数值很小,说明包含与正则项是辅助约束。

配置项数值与单位作用来源条件备注
训练轮数与批量50 轮,256 批量控制微调总量同一起点微调余弦调度
最大学习率1×10−5控制更新步长一轮热身后数值较小
包含与正则权重λ1 极小量级,λ2 更小,γ 最小平衡对齐与层级全实验固定需按原量级复现
遮挡层级音频 1 级,文本 2 级构造多级链消融后选择文本更深
遮挡概率与范围75%,前 12.5% 批量制造缺损对比双模态同设只作用部分样本

表后补充是:遮挡只作用于每批前 12.5% 的数据,意味着大部分样本仍走常规对比,只有小部分样本提供层级信号,这种设计兼顾了对齐稳定与层级塑造。音频池化必须只平均未被遮挡的标记,否则遮挡嵌入会塌缩,这是复现时最容易踩错的地方。包含测试中满足假设的比例如文本侧 83.5%、音频侧 91.7%,可作为重做后检查方向是否学反的粗略参照,但不宜当成必须精确复现的数值目标,因为切分与生成环节的版本差异会带来波动。

数据、基线、优化条件是否可比

评测用了两类数据。常规检索用音频标题数据与 Clotho 第二版,分别在各自训练后做文本找音频与音频找文本,指标是召回率前一与前十平均精度,数值越高越好。层级评测用新构造的分层标题集做音频遍历,用事件级标题集做包含测试。分层标题集用大语言模型把原始标题改写为 3 个更抽象级别,事件级标题集用小模型把复合标题拆成事件短句,再用音频切分模型按短句切出音频片段。

基线包括用信息噪声对比估计训练的确定性模型、用 sigmoid 损失训练的确定性模型,以及不加分层包含损失的概率基线,保证比较的是同一微调起点下的表示差异。优化条件按原文交代为训练 50 轮、批量 256、余弦调度加一轮热身、最大学习率十万分之一,文本与音频遮挡概率均为 75% 且只作用于每批前 12.5% 的数据。编码器沿用分层音频变换器与第二代生成预训练文本模型。

需要提醒的是分层与事件级标注依赖模型生成与切分,虽经人工核验,但仍可能带有生成模型的措辞偏好与切分误差,因此层级结论更适合理解为在该构造协议下的表现,而不是对所有真实层级的完备证明。资源状态方面,本次未发现来源绑定且完成验证的开源链接,因此不能声称代码、模型或数据已公开,复现只能依据论文文字重做。

复现评测要按什么顺序搭流水线

建议按依赖顺序搭建。第一步先跑通常规检索,保证音频找文本与文本找音频的流程、相似度计算与召回率统计无误,再引入概率分布的均值方差输出。第二步加入单级包含与方差正则,检查方差是否塌缩、不确定性是否随遮挡单调变化。第三步再把模态内包含换成分层包含,构造递归遮挡掩码并对相邻级别逐级加约束。

第四步独立搭建层级评测,先用生成模型做 4 级抽象改写并人工抽查措辞是否真的由细变粗,再把复合标题拆成事件短句并用切分模型切音频,最后分别跑遍历与包含测试。统计时注意召回率与平均精度的聚合对象不同,百分点差异与相对百分比不能混用,不同指标的差值也不能放在同一列下比较。硬件与时间预算在原文中没有交代,复现时应自行记录显存、步时与推理延迟,避免把总体趋势误当成每批都成立。

检索保住了吗,遍历与不确定性给出了什么证据

先看底线问题:概率化与层级约束是否损伤基本检索。下表整理了在音频标题数据上训练后,在同域与跨域上的检索表现,比较对象是两类确定性基线与两种概率变体,指标方向都是越高越好。表前需要明确公平条件:同一训练集、同一编码器起点、同一相似度计算方式下的对比,观察重点是概率方法是否至少持平。

训练数据评测方向方法召回率前一前十平均精度对比说明
音频标题数据文本找音频确定性信息噪声对比基线41.9057.30同域基线
音频标题数据文本找音频概率方法42.7057.37同域持平略高
音频标题数据文本找音频概率加分层包含42.7057.40层级约束未降检索
音频标题数据音频找文本确定性信息噪声对比基线39.7555.84同域基线
音频标题数据音频找文本概率加分层包含42.1356.66同域有所提升

表后解释是:概率方法在同域上与基线相当或略好,在跨域上原文报告提升更明显,支持层级建模没有以牺牲对齐为代价的判断。但这张表不能证明层级本身,只能说明底线保住了,层级证据要看遍历与包含测试。音频遍历的做法是从音频嵌入向最抽象锚点插值采样邻近文本,观察取回的标题是否由细变粗。确定性模型用空标题作为锚点,概率模型用空标题与最一般标题的平均作为锚点。下表是遍历精度与召回的对比。

评测集方法遍历精度遍历召回前一最抽象级别召回前一适用条件
分层标题集确定性信息噪声对比基线12.7713.468.48空标题锚点
分层标题集概率基线17.2113.729.73分布锚点
分层标题集概率加分层包含26.8315.6711.43分布锚点加层级损失
分层标题集确定性 sigmoid 基线10.6010.668.48空标题锚点
分层标题集概率加分层包含26.8315.6711.43最强层级证据

表后解释是:概率基线已优于确定性基线,加入分层包含后遍历精度提升幅度最大,说明多级遮挡约束对走出层级序列确有帮助。代价是锚点选择在两类模型间并不完全相同,因此遍历优势中有一部分可能来自锚点构造差异,阅读时不应把全部增益都归因于表示本身。未胜出的细节是确定性 sigmoid 基线在遍历上最弱,说明仅换对比损失形式并不能带来层级。

音频遍历 × 包含测试: 音频遍历负责检验嵌入空间中从具体音频向最抽象锚点移动时,邻近文本是否由细变粗,考察跨模态层级是否对齐;包含测试负责直接计算抽取出的事件级输入是否在概率上包含原始输入,考察语义包含是否成立。二者搭配是因为前者看检索序列的整体演化,后者看单对关系的数值方向,组合后分别回答层级能否被走出来和包含分数是否支持假设。

关于不确定性直观性的前导说明是:横轴为文本长度,纵轴为预测的文本不确定性,预期更长更具体的文本对应更小的不确定性,因此曲线应呈下降趋势,左图为不加分层损失的基线,右图为加入分层损失的版本。

看图路径: 1. 先确认横轴是输入上下文长度、纵轴是文本不确定性;2. 再比较左右两幅子图曲线的下降斜率与阴影宽度;3. 最后读出左下与右下角标注的相关系数差异

原论文 Figure 2:Text length vs. uncertainty in the baseline and proposed method.

论文图 2。原论文 Figure 2:“Text length vs. uncertainty in the baseline and proposed method. r denotes the correlation coefficient of the plots.”。

对该图的解释是:左右两幅子图都显示随上下文长度增加曲线总体下行,但右图的下降更清晰,标注的相关系数从 -0.30 变为 -0.43,达到原文期待的中等以上负相关阈值。阴影表示该长度区间内的波动范围,右侧长文本区阴影仍较宽,说明长尾区样本少、估计不稳定,不能把末端几个点的下降推广为所有长文本都成立。包含测试的前导说明是:横轴为包含假设值,正值表示抽取出的部分包含原始整体,纵轴为频数,左右分别对应文本与音频两种模态。

看图路径: 1. 先确认横轴是假设值、纵轴是频数,直方图以零为分界;2. 再读顶部标注的满足包含假设的样本比例;3. 最后比较左右两图横轴范围与分布拖尾的差异

原论文 Figure 3:Inclusion tests on AudioCaps-EC.

论文图 3。原论文 Figure 3:“Inclusion tests on AudioCaps-EC. Positive value indicates that extracted input include original one.”。

对该图的解释是:文本侧约 83.5% 的样本满足包含假设,音频侧约 91.7% 的样本满足假设,直方图主体落在正值区,支持模型学到的包含不只是遮挡标记的表面线索,因为事件级测试用的是真实切分的音频片段与拆分后的短句。但音频侧横轴范围更大、拖尾更长,反映音频切分与叠加声源带来的噪声更大,因此音频包含分数的绝对数值不宜与文本侧直接比较大小。

层级数与遮挡概率哪个在起作用

消融要回答的是分层包含的效果究竟来自损失形式还是更低的遮挡比例。原文固定其他条件,只改变音频侧与文本侧的层级数,并记录音频找文本的前十平均精度与文本长度不确定性相关系数。结果趋势是文本侧层级从一加到三时,相关系数的负向程度持续增强,而音频侧保持 1 级时检索最稳,加到 2 级时检索出现轻微一致下降。这说明文本更适合做多级抽象,音频做太深反而可能因信息丢失过多而损伤对齐。

另一组消融比较有无分层损失与遮挡概率取 0.5 还是 0.75。只降低遮挡概率而不加分层损失时,相关系数明显变差,说明真正起作用的是逐级包含约束,而不是最后 1 级遮挡变少。遮挡概率取 0.75 时检索略好于 0.5,因此最终选择保留较高的遮挡比例再加分层损失。未评测的边界是音频遮挡概率的消融被省略,原文称其影响很小而固定为 0.75,复现时若换数据集或换编码器,这项假设需要重新验证,不能默认音频遮挡一定不敏感。

哪些结论还不能推广,哪些代价没有测量

首先是数据构造的局限。分层标题与事件切分都依赖生成模型与切分模型,即使经过人工核验,也可能把模型的改写风格误当成自然层级,把切分误差误当成部分与整体关系。包含测试的高比例支持的是在该协议下成立,不能推广为对任意真实录音都成立。其次是锚点与指标的局限。遍历用的最抽象锚点在确定性与概率模型间定义不同,跨模型比较时条件不完全一致。

相关系数只刻画总体趋势,不代表每个长度区间都单调下降,长文本区样本稀疏、波动大。再次是成本缺失。原文没有报告训练时长、显存占用、推理延迟或分布表示带来的额外开销,也没有测量误判率随不确定性阈值的变化,因此不能声称该方法在过滤模糊样本或粗到细检索中一定更省或更快。最后是假设本身的局限。跨模态包含固定假设文本比音频更不确定,但在某些短标签或噪声录音下该方向可能反转,论文没有检验反向假设的失败条件。

把这些边界讲清,比只记增益数字更重要。

拿到什么才算可运行,缺什么要先补验证

可运行的最低标准是能输入一段未见过的音频与一句文本,输出匹配分数与各自的不确定性,并能对遮挡版本输出更大的不确定性。只复现检索分数不算复现层级,还需要能输出遍历序列与包含分数。若只有论文文字而无代码权重,就需要自己实现分布头、修正相似度、包含分数与递归遮挡,工作量主要在音频侧的遮挡标记与池化改造。还需补的验证包括换一个不依赖同一生成模型的改写方式,看遍历增益是否还在。

换一段强重叠的真实录音,看音频包含分数是否依然为正;把跨模态包含方向反转做 1 次反证,看检索与层级如何变化。资源状态必须如实记录:本次未发现可验证的公开链接,因此写作中不得声称代码、模型或数据当前可用,只能说复现需按论文描述重做,待后续可达性确认后再更新可用性判断。

何时值得尝试这个路线,如何一句话记住它

当任务中同时需要匹配与粗细判断时,这个路线值得尝试,例如用粗查询先召回再用细描述精排,或用不确定性标记抽象不匹配的样本以支持数据清洗。当任务只需要二值匹配且延迟敏感时,分布表示与多级遮挡带来的额外计算与调参可能得不偿失,确定性基线更直接。一句话记住:用分布的覆盖大小表示一般性,用包含方向表示谁更一般,用多级遮挡制造由细到粗的阶梯,用遍历与包含测试检验阶梯是否真的对应语义。

学习时先记住 1 对多需要覆盖范围,再记住覆盖方向需要非对称约束,最后记住音频叠加决定了遮挡与切分必须特殊处理。满足这三点,就能在不背公式的情况下复述方法,再对照原文核对权重、层级数与遮挡范围这些可执行的细节。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总