英文题目:Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.1583
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#提示学习 #音频大模型 #少样本 #音频分类
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jaehyuk Jang:机构信息未能从会议 PDF 纯文本可靠映射
- Wonjun Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Kangwook Ko:机构信息未能从会议 PDF 纯文本可靠映射
- Changick Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频语言模型零样本分类以音频波形与文本类名为输入,以音频嵌入和文本类原型在共享空间余弦相似度最高的类别为输出,其实际难点在于音频基准类别稀少,可调提示易过拟合基类并破坏预训练文本空间的语义邻近结构。语义扩展提示调优先为每个基类调用大语言模型生成语义邻居以扩大文本覆盖,该邻居集合作为后续正则的语义参照进入训练。将可学习上下文与类名拼接后送入冻结文本编码器得到类嵌入与邻居嵌入,类嵌入用于分类而邻居嵌入用于约束几何关系。再用语义扩展损失联合交叉熵优化提示,按手写模板估计的预训练几何设定类内与类间边距,只在违反边距时进行拉推。与直接拉近单一手写模板或全局概念池正则不同,该方法保留局部语义拓扑而非强制全局收缩,因而能缓解基类到新类的权衡并保持即插即用。在11个音频分类数据集的基类到新类评测下,CoOp接入SEPT后的新类准确率为42.98%,高于CoOp基线的新类准确率34.09%。该结论适用边界受限于以Pengi编码器为骨干的16样本英文类名场景,对音乐流派与情感等语义模糊类别及跨数据集迁移的稳定性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么要做提示调优?
这篇论文的输入是一段音频和一组候选类别名,输出是音频属于哪个类别的概率。做法是把音频送进冻结的音频编码器得到音频嵌入,把每个类别名拼进一段文本提示后送进冻结的文本编码器得到文本嵌入,再算余弦相似度并做归一化,谁的相似度高就判给谁。初学者可以这样理解:模型事先在大规模音频文本对上做过对比学习,已经把匹配的音频和文字拉近、不匹配的推远,分类就是在共享空间里找最近的文字原型。
提示调优是白话说的可调前缀方法,英文叫 prompt tuning。它不改编码器参数,只学一小段连续上下文向量,再把它和类别词的词嵌入拼起来送进文本编码器。训练信号是基类音频的交叉熵,目标是让音频嵌入更靠近正确类的提示嵌入。论文沿用的骨干是 Pengi,只取它的音频分支和文本分支做分类,音频分支基于层次化音频 Transformer,文本分支基于 CLIP 的 Transformer。推理时只用学到的上下文向量加类名,不需要额外的大模型。
必须保留的关键信息是:编码器在训练时保持冻结,只有上下文向量更新;评估分基类准确率、新类准确率和二者的调和平均;资源状态为本次未能确认可达,因此不能写代码模型数据已公开。目标读者是刚进入语音音乐音频的研究生,本文按学习依赖先讲任务与相关路线,再讲方法全景与损失计算,最后讲实验条件与可复现细节,所有数字只来自原文证据。
视觉和音频两条路线此前是怎么处理过拟合的?
视觉语言模型路线已经把基类新类权衡研究得很充分,英文叫 Base-New Tradeoff。CoOp 直接学上下文向量,基类很高但新类大跌。CoCoOp 加了一个随输入变化的 Meta-Net,MaPLe 同时学视觉和语言两边提示,KgCoOp 用手工提示做欧氏距离正则,LASP 做文本到文本的靠近约束,DePT 把通道偏置解耦,DPC 用双提示协作,TAC 用聚类感知的任务标记。这些方法的共同点是想让学到的提示不要离预训练的通用知识太远。
音频语言模型路线起步较晚,场景更分散。已有工作包括测试时域自适应、免音频的文本描述调优、少样本特征空间调优等,代表有 PT-Text、CLEP-DG 和 PALM。论文指出,音频上的泛化评估一直缺少统一设置,尤其缺少基类到新类和跨数据集两套协议的同时检验。另一个差异是音频基准通常只有几十个类,语义空间稀疏,提示更容易在基类上坍缩成孤立原型。
教学上要区分同输入同目标的对照:本文的直接对照是同样冻结 Pengi、同样只调文本提示的 CoOp、CoCoOp、KgCoOp、DePT,而不是改了骨干或改了音频分支的方法。跨模态的视觉结论不能直接搬到音频,因为类别密度和手工提示质量不同,这也是后文要单独分析 KgCoOp 在音频上反而变差的原因。
手工提示本来好好的,学一下为什么反而坏了?
论文的起点是一个预实验:用手工零样本提示时,每个类和它的语义邻居在文本空间里相似度很高,形成清晰的块状结构;换成 CoOp 学到的提示后,这种结构被打散了。白话说,本来铃和钟应该挨着、爆炸和鸟叫应该离得远,学完之后这种远近关系不再保持。作者把原因归于音频基准语义稀疏,几十个类名给不出足够的几何支撑,学到的提示为了拟合基类交叉熵,只能挤占空间而丢掉通用语义。
下面这张动机图把问题看得很直观,左边是基类,右边是新类,纵轴是类名,横轴是每个类对应的语义邻居,颜色越深表示相似度越高。读图时先分清零样本、CoOp、SEPT 三行的含义,再看对角块是否完整。
看图路径: 1. 先看左右两列如何区分基类相似度与新类相似度;2. 再逐行对比零样本、CoOp、SEPT 三行的对角块是否清晰;3. 注意 CoOp 行中非对角位置出现的杂散高亮;4. 确认 SEPT 行是否恢复了与零样本相近的块状结构
论文图 1。原论文 Figure 1:“Motivation. The y-axis corresponds to class names, and x-axis lists semantic neighbors for each class.”。
从像素看,第一行零样本无论基类还是新类,对角都有深红块,非对角偏浅黄,说明类与其自身邻居高度相关。第二行 CoOp 的对角变浅、非对角出现杂散橙色,块状边界模糊,说明学到的提示把语义关系搅乱了。第三行 SEPT 重新出现深红对角,非对角回落,说明方法目标就是恢复这种结构。需要强调的是,这张图显示的是文本嵌入之间的相似度,不是分类准确率本身,它支持但不证明分类一定变好,真正的证据还要看后文基类新类数字。
SEPT 的全景是什么,训练时多出来的分支去哪了?
SEPT 全称是语义扩展提示调优,英文为 Semantically Expanded Prompt Tuning。它是一个即插即用的正则模块,可以挂在 CoOp 及其变体上。训练时多出一条只在训练出现的分支:用大语言模型为每个已见类生成一组语义邻居词,再把这些邻居词同样拼上当前可学习的上下文向量,送进冻结文本编码器得到邻居提示嵌入。推理时这条分支直接丢掉,只用类提示嵌入和音频嵌入做相似度分类,因此不影响推理效率。
提示调优 × 语义邻居: 提示调优负责只更新连续上下文向量而不动音频和文本编码器,语义邻居负责为每个已见类提供声音属性相近的词汇扩展,二者搭配的理由是仅用十几个基类名监督会让提示退化为孤立原型,而邻居把每个类撑成一个小簇,组合后提示既拟合基类音频又保持文本几何结构。
拿一个样本走完全流程有助于建立依赖关系。假设输入是一段飞机声和候选类 airplane、breathing、can opening。音频波形先重采样到 44.1 kHz 并补齐或截断到 7 秒,转成对数梅尔谱后进音频编码器得到一个向量。另一边,airplane 与可学习向量拼成提示进文本编码器得到类嵌入,同时 aircraft takeoff、glider landing 等邻居也拼上同一套可学习向量得到邻居嵌入。分类损失让音频靠近 airplane,语义扩展损失让 airplane 靠近自己的邻居、远离 breathing 的邻居。反向传播只更新可学习向量,两边编码器不动。
下图是论文的框架图,左侧是音频和文本两条主路,右下是文本空间的拉推示意,读图时抓住哪条线只在训练出现、哪个损失作用在文本之间。
看图路径: 1. 沿左下大模型到语义邻居再到文本编码器的虚线找训练专用分支;2. 看中间音频嵌入与类提示嵌入如何做余弦相似并产生分类损失;3. 看右侧文本空间中拉与推两个箭头各自连接的对象
论文图 2。原论文 Figure 2:“Framework of proposed Semantically Expanded Prompt Tuning (SEPT), applied to CoOp (Zhou et al., 2022b).”。
图中左侧绿色大模型框输出语义邻居,标注只有训练使用。中间类提示嵌入参与余弦相似度和分类损失,语义邻居提示嵌入与类提示嵌入共同产生语义扩展损失。右侧文本空间小图用拉箭头表示类内靠近远正样本,用推箭头表示远离近负样本,并各画了一条虚线间隔。图例同时说明火焰表示可训练、雪花表示冻结,方块深浅区分是类嵌入还是邻居嵌入。这张图没有给出具体数值,它的作用是把后文两个损失和间隔的位置关系固定下来。
拉近推远具体怎么算,间隔为什么不能省?
符号先讲清楚。记第 i 个类的提示嵌入为类嵌入,记它第 n 个邻居的提示嵌入为邻居嵌入,二者都经过同一套可学习上下文向量和冻结文本编码器。类内对齐损失负责把类嵌入拉向自己的 N 个正邻居,类间分离损失负责把它推离其他所有类的邻居。原文默认每类生成 10 个邻居,用 100 个人工前缀平均来估计稳健的间隔。
类内对齐损失 × 类间分离损失: 类内对齐损失负责把类嵌入拉向自己所属的正邻居以形成紧致簇,类间分离损失负责把类嵌入推离其他类的负邻居以保持可分性,二者搭配是因为只拉不推会导致不同簇挤在一起、只推不拉会导致同簇散开,组合成语义扩展损失后同时实现簇内紧与簇间分。
计算目标是带间隔的合页损失。类内只有当欧氏距离大于预先算好的类内间隔时才惩罚差值,类间只有当与负邻居的距离小于类间间隔时才惩罚不足。总损失是交叉熵加权重系数乘语义扩展损失,默认权重为 3。间隔本身不是学出来的,而是用冻结编码器在多样手工前缀下算出的语义距离均值,目的是把预训练空间本来的远近作为先验固定下来。举例不是证据:比如 bell 与 chime 本来就近,间隔就小,允许靠得近;explosion 与 chirp 本来就远,间隔就大,不允许挤在一起。
间隔约束 × 语义扩展: 语义扩展负责给出拉近推远的方向,间隔约束负责给出何时停止拉推的阈值,搭配理由是不加阈值的硬拉硬推会把正邻居过度压缩、把负邻居过度排斥而破坏预训练几何,组合后只有当距离违反预先算好的语义间隔时才产生梯度,对噪声邻居天然设门。
为什么间隔不能省,消融给了反证。不加间隔地硬拉硬推会在基类和新类上都不涨甚至变差,因为语义远的正邻居被过度压缩、语义近的负邻居被过度排斥,簇结构被压碎或撕裂。加了间隔后,只有违反几何先验的样本才产生梯度,噪声邻居的影响被自然截断。这也解释了为什么邻居质量不完美时方法仍稳健:邻居只参与文本正则,不参与基类交叉熵,不直接污染决策边界。
训练时什么更新什么冻结,邻居和间隔何时准备?
训练流程按时间顺序只有 3 步。第一步离线准备:用 ChatGPT-4o 为每个基类生成 10 个音频语境下语义相近且互不重叠的词,同时用 100 个多样手工前缀算出类内和类间间隔。第二步前向:每批基类音频经冻结音频编码器得到音频嵌入,每类名和每个邻居词拼上当前可学习向量后经冻结文本编码器得到两组文本嵌入。第 3 步反向:分类损失作用在音频与类嵌入之间,语义扩展损失作用在文本与文本之间,加权求和后只更新长度为 16、维度为 512 的上下文向量,优化器用带动量的随机梯度下降,学习率 0.0125,共训练 50 个轮次。
可学习上下文向量 × 冻结编码器: 可学习上下文向量负责承载任务适配的全部可调参数,冻结编码器负责保持预训练的音频文本对齐能力不被破坏,搭配理由是音频基准语义稀疏、样本少,全量微调极易扭曲空间,组合后梯度只回传到上下文向量,推理时邻居分支可丢弃而不增加开销。
需要明确的缺项是:原文没有报告梯度裁剪、学习率衰减和早停之外的验证集划分,做法是取训练损失最低的检查点评估;也没有给出每次迭代的显存占用和每轮耗时,只有设备为单张 RTX 3090。重置时机方面,每次随机种子重新采样少样本并重新初始化上下文向量,结果取 3 次平均。推理时邻居生成、大模型调用和间隔计算都不需要,部署形态与普通 CoOp 相同。
在哪些数据上测,用什么协议和基线才算公平?
数据覆盖乐器、声音事件、情感、监控、场景、音乐和人声,共 11 个数据集。包括 Beijing-Opera、NS-Instruments、ESC50、ESC50-Actions、UrbanSound8K、CREMA-D、RAVDESS、SESA、TUT2017、GT-Music-Genre 和 VocalSound。划分上每个数据集的类别对半切为基类和新类,TUT2017 因 15 类而切成 8 比 7。多折数据集在所有折上做并平均。训练只用基类每类 16 个样本,测试分别报基类、新类和调和平均。
基类到新类泛化 × 跨数据集迁移: 基类到新类泛化负责在同一数据集内把类别对半切开,只用基类训练而在新类上测试类别漂移,跨数据集迁移负责在源数据集训练后直接到另一个数据集测试数据分布漂移,二者搭配才能分别回答学到的提示是记住类名还是保留了可迁移的语义结构,论文因此两套协议都做。
基线选择保持同骨干同阶段:Pengi 零样本、CoOp、CoCoOp、KgCoOp、DePT,以及各自加 SEPT 的版本。DePT 实现时去掉了测试时知识融合,Pengi 音频编码器的批归一化层被排除,以保证公平。跨数据集协议是另一套:只在源数据集上训练,直接到目标数据集上测,覆盖声音事件、情感和乐器 3 组迁移。指标方向是准确率越高越好,调和平均越高说明基类新类越均衡。
下表把可复现的训练配置固定下来,读表时注意它不是效果表,而是做实验前必须对齐的条件表。
| 条件 | 指标 | 基线取值 | 本方法取值 | 比较对象 |
|---|---|---|---|---|
| 每类样本数 | 训练抽样 | 16 | 16 | 全部基线一致 |
| 每类邻居数 | 语义扩展 | 0 | 10 | SEPT 新增 |
| 间隔前缀数 | 间隔估计 | 1 | 100 | SEPT 平均策略 |
| 损失权重 | 平衡系数 | 0 | 3 | SEPT 默认 |
| 重复次数 | 聚合方式 | 3 次平均 | 3 次平均 | 全部方法一致 |
表后需要说明代价与边界。该配置表的代价是每个类要多编码 10 个邻居文本,前向和损失计算量随类别数线性增长,但在音频这种稀疏类别下开销可接受。未评测的边界是每类 2、4、8 样本的低资源趋势在主表之外另行报告,跨数据集只做了 3 组源到目标,不能推广到所有音频迁移。百分点与相对百分比在此不同,本文只谈百分点的增减。
基类到新类到底涨了多少,有没有输的地方?
要回答的核心问题是:在只用基类训练的条件下,新类和调和平均是否变好,基类是否被拖累。公平条件是同骨干、同样本数、同种子平均,指标方向是三者越高越好。原文报告显示,加 SEPT 后 4 个基线的新类和调和平均普遍提升,基类基本保持竞争力,典型的基类新类权衡得到缓解。
| 方法对比 | 评估 | 基线值 | SEPT 值 | 适用条件 |
|---|---|---|---|---|
| CoOp | 新类平均 | 34.09% | 42.98% | 11 数据集平均 |
| CoCoOp | 新类平均 | 36.83% | 42.59% | 11 数据集平均 |
| CoOp 低样本 | 调和平均 | 37.69% | 41.83% | 每类 2 样本 |
| DePT | 调和平均 | 46.79% | 49.06% | 每类 16 样本 |
| CoCoOp | 调和平均 | 46.26% | 50.65% | 每类 16 样本 |
表后解释必须同时谈收益与代价。收益是新类平均提升约 8 个百分点量级,低样本下也有近 4 个百分点的调和平均提升,说明邻居正则在标注稀缺时仍有效。代价是个别数据集方法组合上基类略降,例如部分音乐情感类语义边界模糊时邻居可能重叠,引入噪声。未胜出项也要点名:KgCoOp 在音频上原本弱于 CoOp 甚至弱于零样本,这不是 SEPT 的失败,而是其单模板正则过度依赖手工提示质量,后文附录用 100 模板集成修复后 SEPT 仍能继续带来增益。
下图从几何上佐证了数字,左侧不用 SEPT 时同色点散开,右侧用后聚成团,但它只展示新类邻居结构,不能代替准确率表。
看图路径: 1. 对比左右两幅图中同色圆点是否聚成一团;2. 观察菱形新类标记与其同色邻居的距离变化;3. 注意左侧不同颜色点混杂的程度
论文图 3。原论文 Figure 3:“t-SNE visualization of prompt embeddings of new classes and their semantic neighbors from ESC50- Actions.”。
像素显示左图 5 个新类的圆点与菱形标记混杂,不同颜色交错,类中心不明显。右图同色圆点明显收拢,菱形标记落在其颜色簇中心附近,例如 sneezing 与 laughing 各自成团。这支持拉近推远确实在未见类上保留了簇结构,但要注意 t-SNE 只保留局部邻域关系,距离尺度不可直接读作准确率差距,结论仍以调和平均表为准。
拿掉间隔会怎样,邻居数量和权重怎么选?
消融要回答的是语义扩展中哪部分真正起作用。比较问题是:在固定 CoOp 主干下,类内损失、类间损失和各自间隔是否都必要。公平条件是同数据同样本,指标仍看基类、新类和调和平均。原文显示,不加间隔的朴素拉推不涨反跌,加了间隔后逐步回升,两者都加间隔时达到最好。
| 消融条件 | 评估 | 基线 | 本配置 | 说明 |
|---|---|---|---|---|
| 无间隔扩展 | 调和平均 | 42.83 | 下降或持平 | 硬拉硬推破坏结构 |
| 完整 SEPT | 调和平均 | 42.83 | 49.70 | 双间隔全开 |
| 完整 SEPT | 基类新类 | 基线水平 | 保持竞争力 | 未牺牲基类换新类 |
| 全局正则对照 | 调和平均 | 42.83 | 46.81 到 47.50 | 不如局部邻居 |
| 文本适配器对照 | 调和平均 | 42.83 | 46.67 | 不如 SEPT |
表后解释要给出机制。无间隔时语义远的正样本被强行拉近、语义近的负样本被强行推远,导致过度压缩与碎片化。间隔把预训练几何作为门限,只有违反才更新,因此能容忍部分低相似度噪声邻居。另一组对照显示,线性适配器和 200 个全局概念池的正则也有提升,但不如针对任务的局部邻居扩展,说明靶向的归纳偏置比宽泛的全局锚更有效。超参数上权重在 3 附近最好,邻居数增大总体向好但非严格单调。
下图展示邻居质量的分布,为何说噪声可控需要看这个证据。读图时先确认横轴是相似度分数,纵轴是频数。
看图路径: 1. 看横轴相似度分数从 0 到 1 的分布重心落在哪个区间;2. 看纵轴频数在 0.6 到 0.9 区间是否形成主峰;3. 注意低相似度尾部是否存在少量噪声邻居
论文图 7。原论文 Figure 7:“Distribution of similarity scores between classes and semantic neighbors across all datasets.”。
像素显示直方图主峰落在 0.6 到 0.9 之间,右侧 0.8 附近最高,左侧低分尾部频数很低。平均多样性约 0.45,正对平均相似度约 0.64 而负对约 0.34,说明邻居既贴近原类又有变化。解释段必须说明限制:该图只度量文本相似度,不能证明音频可分性;少量低分邻居确实存在,但因间隔门控而不主导梯度。跨大模型测试也支持稳健性,换用其他大模型仍能保持相近的调和平均,说明增益来自策略而非特定模型。
哪些情况可能不涨,还缺什么验证?
论文明确报告的局限有 3 类。第一是语义模糊域,如音乐流派和情感状态,类别边界本身抽象,生成的邻居在正负之间差距小,容易引入噪声而非结构,此时基类拟合可能受限。第二是复合正则,当基线已有强约束时再加 SEPT 可能过度正则,优化空间被压得过紧。第三是当前只正则文本分支,没有把语义扩展做到音频提示或多模态联合提示,这是未来方向。
未验证的推测要用可能表达。可能的原因是音频类别稀疏导致全局坍缩更严重,提示调优后平均余弦相似度上升而矩阵熵下降,但这只是几何指标与泛化的相关,不是因果证明。待验证的是推理延迟、显存峰值和误判率分布,原文没有测量这些量,不能承诺 SEPT 改善了延迟或成本。总体趋势不等于每组都成立,个别数据集方法组合上基类小幅下降就是反例。
另一个特有误解是新类名重叠。11 个数据集上基类邻居与新类名重叠仅约 1.7%,且邻居从不参与交叉熵,只做文本几何正则,过滤重叠后的复测性能几乎不变,因此不能把提升误读为偷看了新类。
要复现先对齐什么,第一步跑通什么?
复现先做三件事。第一是对齐数据划分:按附录的基类新类名单切分,TUT2017 按 8 比 7,其余对半,多折数据集全折平均。第二是对齐采样与种子:每类随机抽 16 个训练样本,上下文长度 16,训练 50 轮,3 次随机种子取平均,取训练损失最低检查点。第三是对齐间隔与邻居:每类 10 个邻居,100 个人工前缀平均算间隔,损失权重取 3,大模型默认用 ChatGPT-4o,换模型需重算邻居但流程不变。
最小可运行策略是先跑通 Pengi 零样本,再跑通 CoOp 基线,确认基类高新类低的权衡复现后,再挂上语义扩展损失。检查点包括:冻结音频和文本编码器、只优化上下文向量、推理时关闭邻居分支。由于本次资源状态未能确认可达,不要假设代码权重可下载,应按论文文字重写邻居生成提示和前缀池。硬件参考是单张 RTX 3090,但原文未给精确时长,复现时应自记每轮耗时。
信息条件上,邻居词表和前缀池是复现的关键输入,缺了它们只能复现趋势而不能逐数对齐。若要报告新结果,必须同时报基类、新类和调和平均,并注明聚合是跨数据集平均还是单数据集,避免把不同聚合口径的数字直接比较。
什么时候值得试这个方法,一句话怎么记住它?
当你的音频分类只有几十个类、手工模板效果不稳、CoOp 基类很高但新类掉得厉害时,值得试 SEPT。它用大模型先把每个类名的声音近义词铺开,再用带间隔的拉推把文本空间撑成一簇一簇,既不丢基类拟合,又让没见过的类能落到相近的簇附近。记住一句话:先扩展语义支撑,再约束几何,先有邻居的方向,再有间隔的刹车。
何时不值得优先试:如果类别本身高度抽象且正负邻居难以区分,或基线已有很强的知识蒸馏约束,应先做小规模消融,观察基类是否被过度正则。还需补的验证是跨数据集更多源到目标组合、不同音频时长与采样率下的稳定性,以及文本分支与音频分支联合扩展的效果。回到起点,分类仍是音频找最近文字原型的过程,SEPT 只是让这些文字原型在学习后依然保持合理的远近关系。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



