英文题目:ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:hanif26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#提示学习 #正则化 #少样本 #零样本 #音频分类
评分:7.1/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Asif Hanif:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Yaqub:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频语言模型零样本分类依赖音频编码器与文本编码器对齐,输入为音频波形与类别文本描述,输出为类别相似度排序,难点在于少样本提示调优后基类精度上升但新类泛化塌陷。所提ZEBRA冻结预训练主干并优化可学习上下文提示,再将一次性计算的零样本逻辑与提示学习逻辑按等权相加形成融合逻辑,最后在交叉熵上减去融合分布自熵以惩罚过自信预测。与仅用基类监督优化提示的上下文优化相比,关键差异是用零样本决策空间锚定适配并用熵最大化拉平决策边界,而非引入新参数重塑表示,实际意义在于保留预训练语义对齐的同时获得有监督适配收益。在11个数据集平均的评测设置下,COOP+ZEBRA的新类准确率为59.37%,高于ZERO-SHOT的新类准确率55.18%。结论仅在Pengi编码器与每基类16样本及既定基类-新类划分下成立,跨编码器与开放词汇外推尚未验证。原文披露训练与测试耗时几乎无增加,可视为可忽略开销。表3显示其训练成本与推理开销仅增加数秒,计算量几乎不变。
🔗 开源与复现资源
- 代码相关资源:https://github.com/asif-hanif/zebra — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么需要学提示?
这篇解读的输入是论文原文提供的文字证据与两张官方原图像素,目标是让刚进入语音音乐音频方向的研究生能复述 ZEBRA 做了什么、在什么条件下成立、代价是什么。必须保留的信息包括任务划分方式、骨干如何使用、训练样本数与优化设置、融合权重与熵缩放系数、以及基类与新类准确率的对照口径。输出是 1 篇按学习依赖展开的中文技术解读,不做营销式判断。
先把任务说具体。研究对象是音频语言模型,也就是同时有音频编码器和文本编码器的模型。白话讲,音频编码器把一段声音变成一个向量,文本编码器把类别名称放在一句话里也变成向量,两边向量越接近就越认为是这个类。英文叫 Audio-Language Models,简称 ALMs。零样本推理的英文是 zero-shot inference,指不给任何下游标注,只用人工写的一句话模板做分类。提示学习的英文是 prompt learning,指把模板前面那几个词换成可以训练的向量,用少量标注样本去调它们,骨干编码器本身保持冻结。
为什么不是把声音丢给模型就结束。第一,人工模板写法变化会带来性能波动,同一类别换一种说法相似度就变了。第二,真实音频任务很杂,乐器、环境声、情绪、声景、音乐流派分布差异大,预训练学到的通用对齐在具体数据集上往往不是最优。第三,全量微调需要大量标注和算力,对小样本场景不友好。所以论文走了一条中间路线:冻结大的音频文本编码器,只学一小段上下文向量,用每个基类 16 个样本去适应。这样做在已见类上通常能涨很多,但问题也随之而来。
沿一个样本走一遍便于建立直觉。举例只为教学,不是论文数据:输入一段 2 秒的狗叫波形,记为 x。音频编码器输出一个向量,文本侧对狗叫、猫叫等每个类别都构造一句话,文本编码器输出对应向量。计算余弦相似度得到每个类的分数,取最高分作为预测。提示学习阶段,这句话前面的几个词向量是可学习的,用基类样本的交叉熵去更新它们。新类在训练时从不出现,测试时却要和基类放在同一个全类别集合里一起比最高分,这就要求学到的提示不能把文本空间拽得只认识基类。
同输入同目标的已有路线在比什么?
要理解 ZEBRA 的位置,需要按同输入、同目标、同监督、同运行阶段来对照,而不是按模型名字大小来排座次。输入都是音频波形加类别文本,目标都是音频分类,监督都是少样本或零样本,运行阶段都包含基类训练与基类新类联合测试。
第一条路线是对比式音频语言预训练。代表是 CLAP 和 AudioCLIP,它们把图像领域的 CLIP 做法搬到音频,用大量音频文本对做对比学习,拉近匹配对、推远不匹配对。ZEBRA 不做预训练,直接复用这类预训练好的对齐能力,工作点在下游适应阶段。
第二条路线是视觉语言领域的提示学习。代表是 COOP 和 COCOOP。COOP 学一组所有样本共享的上下文向量,放在每个类名前一起送入文本编码器。COCOOP 进一步让上下文随每个音频样本动态变化,用音频特征做条件生成实例相关的提示。论文把这两者在 PALM 的实现下搬到音频,把视觉编码器换成音频编码器,作为基线和作为 ZEBRA 的底座。需要说明的是,论文明确排除了 PALM 本身作为基线,理由是 PALM 学的是类别相关的向量,难以泛化到未见类,而 COOP 与 COCOOP 是类别无关的,可以直接用于新类。
第三条路线是音频领域的少样本提示学习,例如 PALM。它证明只学少量提示向量就能在冻结的音频语言模型上取得不错的分类效果。ZEBRA 与它的区别在于不引入新的提示形式,而是在已有 COOP 类方法之上做输出融合与损失正则,属于即插即用。换句话说,如果把 COOP 看成一种已有的可训练底座,ZEBRA 就是包在外面的两件外套,一件管推理时怎么合并分数,一件管训练时不要太自信。
基类涨了,新类为什么反而掉了?
论文首先指出的现象是基类到新类的泛化落差,英文是 base-to-novel generalization gap。做法是把全部类别集合记为 C,切成基类集合与新类集合,两者不相交。训练只用基类的标注样本,测试分别在基类测试样本和新类测试样本上算准确率,但推理时类别空间是全量,模型必须在所有类里选最高分。
观察到的矛盾是,用基类少样本优化提示后,基类准确率大幅上升,新类准确率却经常下降,有的数据集甚至掉到零样本之下。论文的解释是,只用基类监督会让提示向量过度特化,把预训练学到的语义对齐扭曲了,决策边界紧紧包住已见类,对未见类的文本描述不再敏感。这不是某一个数据集的偶然,而是多个数据集上的系统性 trade-off。
这个问题的教学意义在于区分两种好。一种是在训练分布内做得好,另一种是在训练时没见过的语义上还能保持对齐。提示学习擅长前者,但如果没有约束,它会以破坏后者为代价。ZEBRA 的目标就是保住后者,同时尽量不丢前者。论文强调它不增加可学习参数,零样本对数算 1 次后训练和推理复用,因此额外开销可以忽略。这个轻量约束很重要,因为它决定了方法的可复现门槛和适用范围。
ZEBRA 全景:两条分支如何汇成一个预测?
ZEBRA 的全景可以概括为在已有提示学习方法之上加两件事。第一件是零样本对数融合,英文是 zero-shot logit fusion,训练和推理都把原始零样本分数与提示学习分数加权相加。第二件是自熵正则,英文是 self-entropy regularization,训练损失用交叉熵减去预测分布的熵,鼓励分布不要太尖。
从数据流看,音频波形进入冻结的音频编码器得到音频特征。文本侧走两路,一路是人工模板经冻结文本编码器得到零样本文本特征,另一路是可学习上下文加类名经同一文本编码器得到提示学习文本特征。两路分别与音频特征算余弦相似度,得到两组对数,再融合成最终对数。训练时用融合对数算交叉熵和熵,推理时只用融合对数取最大值对应的类,不再算熵。
下图是论文给出的整体框架,值得按箭头完整走一遍,它把冻结与可学习、相似度计算与损失组合画在了一张图里。
看图路径: 1. 先从左侧音频波形经音频编码器到中间蓝色特征条的主路径看输入流向;2. 再对比上方零样本文本特征与下方提示学习文本特征两条支路的异同;3. 接着看中间余弦相似度圆点如何分别产生零样本对数与提示学习对数;4. 最后看右侧融合对数与交叉熵减熵损失框如何闭环到可学习上下文
论文图 2。原论文 Figure 2:“ZEBRA approach operates on top of existing prompt learning methods to bridge the base-to-novel generalization gap, preserving zero-shot transferability while benefiting from…”。
这张图从左到右可以这样读。最左侧是音频波形与两组文本输入,上方是固定模板,下方是可学习上下文。中间 3 个梯形是编码器,图例标明它们都是冻结的,只有左下角的上下文是可学习的火焰标记。音频特征分别与上下两组文本特征做余弦相似度,得到零样本对数与提示学习对数,再汇成中间偏右的融合对数。右上角小框写明交叉熵与熵都基于融合对数计算,右中框写明最终损失是两者相减。
复述时要抓住三点:可学习量只有一个地方,融合发生在对数层而非特征层,熵只影响训练不影响推理取最大值的方式。论文报告这种设计没有引入额外可学习参数,零样本对数只需计算 1 次。
两个组件各自算什么,为什么要放在一起?
先把符号讲清。记输入音频为 x,类别文本集合为 t,音频编码器为 fA,文本编码器为 fT,相似度为余弦相似度。零样本对数记为 fzs,提示学习对数记为 fpr,可学习提示参数记为 phi。融合对数记为 fzebra,等于权重 lambda_zs 乘以零样本对数加上权重 lambda_pr 乘以提示学习对数。论文实验把两个权重都设为 0.5。经 softmax 得到的概率记为 p,最终预测取融合对数最大分量对应的类。
零样本推理 × 提示学习: 零样本推理分工是保持预训练阶段学到的音频与文本对齐,直接用人工模板计算相似度,不依赖下游标注;提示学习分工是用基类少样本把文本前面的可学习上下文向量调得更贴合当前数据集。搭配理由是前者泛化好但不够准,后者准但容易偏向见过的类,ZEBRA 把两者对数相加,让适应过程始终被原始决策空间锚住,新增作用是在训练和推理都保留一条回到预训练的通路。
零样本对数融合的具体计算是线性加权。它在训练时参与损失,在推理时参与决策。作用是把适应过程锚定在预训练决策空间附近,避免提示向量把分数带偏太远。由于零样本对数与具体少样本无关,可以预先算好复用,论文因此称额外开销可忽略。
零样本对数融合 × 自熵正则: 零样本对数融合分工是在输出层做加权平均,约束最终预测不要偏离预训练太远;自熵正则分工是在损失层惩罚过于尖锐的概率分布,让模型对基类不要过度自信。搭配原因是只融合仍可能在训练中把提示向量推向过拟合,只做熵正则又缺乏显式锚点,两者组合一处管输出位置,一处管训练动力,新增作用是同时从前向融合和反向梯度 2 个方向减少对基类的过度特化。
自熵正则的具体计算是对融合概率算熵,再在损失中减去它。优化时最小化交叉熵同时最大化熵,两者方向相反,形成牵制。论文把熵项缩放 0.05 倍后加入训练。直觉是交叉熵希望模型对正确基类非常确定,熵项则惩罚这种过度确定,迫使概率质量分散一些,决策边界更平滑。需要强调的是,论文没有给出梯度路径的额外假设,文本编码器与音频编码器保持冻结,只有提示参数更新,熵的梯度经由融合对数回传到提示参数。
训练时更新什么,冻结什么,监督从哪里来?
训练阶段只用基类样本。每个基类随机抽 16 个训练样本,训练 50 轮,用随机梯度下降,学习率 0.05。每次取一个音频标签对,算融合对数,算交叉熵与自熵,按加权组合得到 ZEBRA 损失,对提示参数求梯度并更新。音频编码器与文本编码器全程冻结,不更新。零样本对数在训练前算好,训练中直接复用,不需要对文本编码器再做前向。
交叉熵损失 × 自熵: 交叉熵损失分工是让融合后对数在正确基类上概率更高,提供少样本监督信号;自熵分工是让融合后概率分布本身更平滑,概率越集中熵越低,惩罚项越大。搭配理由是只用交叉熵会鼓励模型把基类概率推到接近 1,加入减去自熵的目标后,优化要在做对基类和保持不确定性之间平衡,新增作用是构造出更平缓的决策边界,为未见类留出空间。
监督来源只有基类标签,没有新类标签,也没有额外的人工标注。评估时基类与新类分开计量,但在推理时类别集合是全量,模型不知道当前样本来自基类还是新类,必须在所有类上比分数。这种训练测试不一致正是要测的泛化能力。论文对每个方法用 3 个随机种子取平均,零样本采用固定模板进行公平比较。
还有两个实现细节决定复现。第一,骨干采用 Pengi,去掉后面的大语言模型解码器,只用预训练的音频与文本编码器,按类似 CLIP 的对比方式使用,以利用其预训练表示与零样本能力。第二,融合权重各 0.5,熵缩放 0.05,这些是论文经验设定的值,不是搜索最优,不能当成可部署的最优超参数来承诺。未报告的内容也要指出:论文没有报告提示向量长度、初始化方式、批大小与学习率调度,这些缺项在复现时需要回到公开代码核对,不能从模型名字推定。
在哪些数据与条件下测,指标方向如何读?
实验覆盖语音与音频的多类任务。乐器分类用 Beijing Opera 与 NS-Instruments,声音事件用 ESC-50 及其子集 ESC50-Actions 以及 UrbanSound8K,情绪识别用 CREMA-D 与 RAVDESS,人声分类用 VocalSound,监控声音事件用 SESA,声景分类用 TUT2017,音乐分析用 GT-Music-Genre。共 11 个数据集,类型差异大,适合检验方法是否只在某一分布上有效。
基线包括零样本、COOP、COCOOP,以及 COOP 加 ZEBRA、COCOOP 加 ZEBRA。COOP 与 COCOOP 的音频适配沿用 PALM 的实现。训练协议统一为每基类 16 样本、50 轮、3 个种子平均,测试在完整测试集上按预设的基类新类划分分别算准确率。指标是准确率,方向是越高越好。比较时用相对于零样本的升降标记,上升为正,下降为负,但百分点与相对百分比含义不同,论文写的是准确率差值,应读作百分点变化。
硬件与成本方面,论文报告使用英伟达 RTX A6000,训练与测试耗时在所有数据集上平均,并报告期望校准误差。期望校准误差越低表示预测置信度与真实正确率越一致,方向是越低越好。代码资源状态是已公开,地址为论文给出的仓库链接,当前可用。这意味着复现时应先跑通仓库中的基类新类划分与少样本抽样逻辑,再核对超参数,而不是自行重写划分,因为划分不同会导致基类新类数字不可比。
主结果:新类回升了多少,基类付出了什么?
要回答的核心问题是,在相同划分与相同少样本条件下,加了 ZEBRA 后新类是否稳定回升,基类是否明显下滑。论文报告的平均趋势是,纯提示学习在基类上比零样本高 20 多个百分点,但在新类上低于零样本,而加了 ZEBRA 后新类回到零样本之上,基类基本保持。
下图是平均后的基类与新类柱状对比,左侧橙色为基类,右侧绿色为新类,虚线为零样本水平,它把 trade-off 画得非常直观。
看图路径: 1. 先看左侧橙色基类组五根柱子的高度,确认提示学习后基类都远高于零样本虚线;2. 再看右侧绿色新类组,比较零样本与纯提示学习柱子的高低反转;3. 最后看加了斑马方法的两根柱子是否重新超过零样本虚线
论文图 1。原论文 Figure 1:“Comparison of Base and Novel Performance.”。
从像素可见,左侧基类组中零样本约为 53.5,纯 COOP 与纯 COCOOP 分别约为 79.8 与 82.0,加了 ZEBRA 后分别约为 80.1 与 81.7,说明基类始终远高于零样本。右侧新类组中零样本约为 55.1,纯 COOP 掉到约 48.0,纯 COCOOP 约为 50.4,都低于零样本虚线,而 COOP 加 ZEBRA 升到约 59.3,COCOOP 加 ZEBRA 升到约 59.5,都超过零样本。这支持了论文的判断:融合与正则主要修复的是新类,基类没有付出大的代价。但总体趋势不等于每组都成立,具体到单个数据集仍有反例,需要看宽表。
基类 × 新类: 基类分工是提供少样本训练监督,所有提示参数只在基类样本上更新;新类分工是检验泛化,训练时完全不可见,测试时与基类一起参与全类别分类。搭配理由是把同一测试集按是否见过划分,才能暴露提示学习是否以牺牲未见类为代价换取已见类提升,新增作用是用基类与新类准确率的落差直接度量预训练对齐被破坏的程度。
下表把 11 个数据集的平均值整理成可核对的形式,比较问题是平均口径下谁在新类上真正超过零样本,公平条件是同划分同少样本同骨干,指标是准确率越高越好。
| 评估划分 | 指标 | ZERO-SHOT | COOP | COOP 加 ZEBRA |
|---|---|---|---|---|
| 基类 | 准确率 | 53.53 | 79.82 | 80.17 |
| 新类 | 准确率 | 55.18 | 48.04 | 59.37 |
表后需要同时讲收益与代价。收益是新类平均从 48.04 回到 59.37,超过零样本的 55.18,基类从 79.82 微变为 80.17,没有明显损失。代价与反例是平均数掩盖了个别数据集的下滑,例如按原文宽表,CREMA-D 上 COOP 加 ZEBRA 的新类仍低于零样本,UrbanSound8K 与 ESC50 上个别组合的新类也未超过零样本,说明方法改善的是平均趋势而非每个数据集都必胜。论文对 COCOOP 也报告了类似的平均回升,但同样存在个别新类仍低于零样本的情况。复述时不能把平均超过零样本说成所有数据集都超过。
拿掉融合或熵项,效果差在哪里?
消融要回答的是两个机制各自贡献多少。论文以 COOP 为底座,做了 4 个组合:都不加、只加零样本对数、只加熵、两者都加。报告显示大部分提升来自融合零样本对数,自熵带来进一步但较小的增益。只加熵时基类有小幅变化而新类几乎不动,只加融合时新类大幅回升,两者都加时达到论文主结果。
下表整理运行成本与校准误差,比较问题是在不增加参数的前提下,时间与校准是否变差,公平条件是同硬件同数据集平均,指标方向是时间越短越好,期望校准误差越低越好。
| 方法 | 训练耗时 | 测试耗时 | 基类期望校准误差 | 新类期望校准误差 |
|---|---|---|---|---|
| COOP | 19m 36s | 2m 40s | 0.0677 | 0.2033 |
| COOP 加 ZEBRA | 19m 45s | 2m 42s | 0.0755 | 0.1997 |
| COCOOP | 45m 37s | 3m 37s | 0.0821 | 0.2738 |
| COCOOP 加 ZEBRA | 45m 41s | 3m 38s | 0.0777 | 0.2253 |
表后解释是,训练时间从 19 分 36 秒到 19 分 45 秒、测试从 2 分 40 秒到 2 分 42 秒,增加只有数秒,COCOOP 侧也是类似的数秒增加,支持了可忽略开销的说法。新类校准误差从 0.2033 降到 0.1997、从 0.2738 降到 0.2253,平均上有改善,但基类侧 COOP 从 0.0677 升到 0.0755,说明校准改善不是在所有划分上都成立。论文没有测量推理延迟的逐步分布与显存占用,也没有报告误判率的类别细节,因此不能把校准误差降低直接等同于实际部署延迟降低或错误率全面降低。未胜出项也要点名:只用熵而不融合时新类几乎没有回升,说明单靠让分布变平滑不足以拉回预训练对齐。
哪些边界没有测,哪些结论不能外推?
首先是数据边界。论文覆盖 11 个数据集,但每个数据集的基类新类切分是预设的,原文没有给出切分比例与随机性分析,切分不同可能改变落差大小。3 个随机种子主要覆盖少样本抽样,划分本身的方差没有展开,因此不能把平均回升推广到任意新切分。
其次是方法边界。融合权重固定为 0.5 加 0.5,熵缩放固定为 0.05,没有报告超参数敏感性。如果权重偏向提示学习,锚定作用会减弱,如果熵权重过大,基类准确率可能受损。论文称无需额外调参是指在该固定值下即插即用,而不是证明该值在所有任务最优。
再次是指标边界。主指标是准确率,没有报告每类的召回、混淆模式,也没有报告新类中哪些语义更接近基类、哪些更远。校准误差虽有报告,但只是平均值,不能说明高置信错误的分布。原文表格中个别数据集仍低于零样本,例如情绪与部分环境声数据,说明在类间差异小或标注噪声大的任务上,简单融合可能不够。
最后是实现边界。骨干只验证了 Pengi 去掉解码器后的用法,没有验证 CLAP 等其他音频语言模型,冻结与否、文本模板写法变化时结论是否成立仍待验证。论文未给出提示长度与初始化等细节,复现时必须以公开代码为准,不能从模型名称推定实现。
要复现,先跑什么,再核对什么?
复现的第一步是准备环境与划分。按论文条件,使用相同的骨干使用方式,即 Pengi 只用音频与文本编码器,文本模板零样本用固定句式。拿到公开代码后,先确认基类新类划分文件与每基类 16 样本的抽样脚本,保证与论文同划分,否则数字不可比。运行 3 个随机种子并取平均,不要只跑 1 次就下结论。
第二步是跑通基线。先跑零样本,再跑 COOP 与 COCOOP 的音频适配版本,核对基类大幅上升、新类平均下降的现象是否出现。如果基线现象复现不出来,后续 ZEBRA 的增益也无从谈起。注意优化器用随机梯度下降,学习率 0.05,训练 50 轮,这些是论文明确给出的可复现条件。
第三步是加上 ZEBRA。融合权重设为 0.5 与 0.5,熵缩放设为 0.05,零样本对数预先计算并复用。训练损失为融合对数上的交叉熵减去熵,推理用融合对数取最大值。核对点包括新类平均是否回到零样本之上、基类是否保持、训练测试时间是否只增加数秒。代码当前可用,因此应以仓库中的损失实现与评估脚本为准,不要自行重写熵的计算方式。
还需补的验证包括更换随机划分、扫描融合权重与熵系数、换用其他骨干、记录显存与单步延迟。只有补了这些,才能判断方法在自己任务上是否值得尝试。一般来说,当观察到提示学习后基类涨但新类掉,且新类与基类语义有重叠但不相同时,优先尝试这种轻量融合,而不是直接增大提示容量或解冻骨干。
一句话收束:何时用它,何时不用?
把全文收成可操作的判断。ZEBRA 适合的场景是已经有可用的 COOP 类提示学习流程、冻结骨干、少样本适应后发现新类不如零样本,但又不希望增加参数与大幅改架构的项目。它的动作很具体:推理与训练都把零样本分数加回来一半,训练时再让分布别太尖。论文在 11 个数据集平均上显示新类从低于零样本回到高于零样本,基类保持在 80% 附近,时间只多几秒。
不适合或需谨慎的场景包括新类本身与零样本模板严重失配、情绪等细粒度任务上零样本就很弱的情况,此时锚定一个弱锚点可能收益有限。原文中个别数据集加了 ZEBRA 仍未超过零样本就是提醒,不能把平均结论当成逐数据集承诺。
给新生的复述抓手是三句话。第一,任务是基类训练、新类测试、全类别推理,落差来自只用基类监督。第二,方法是输出层加权融合加损失层减熵,一个管位置,一个管自信。第三,证据是平均新类回升、基类不掉、开销可忽略,限制是固定权重、单一骨干用法、个别数据集仍有反例。记住这三句,就抓住了论文实际研究的东西,也知道下一步该补哪项验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

