英文题目:Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:cho26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#提示学习 #音频大模型 #少样本 #音频分类
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Hyebin Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Jaehyuk Jang:机构信息未能从会议 PDF 纯文本可靠映射
- Changick Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频语言模型在少样本音频分类中输入为音频波形与类别文本模板,输出为余弦相似度最高的类别,难点在于音频域偏移大而音频编码器被冻结导致跨模态对齐受限。该方法在冻结的对比语言音频预训练层次化音频变换器音频编码器与冻结的文本编码器基础上,引入音频侧提示学习:先在对数梅尔频谱后做频带级仿射调制以校准能量分布与录制条件,其输出经分块嵌入后在通道维做令牌级调制以衔接卷积局部特征与注意力全局机制,再在首个滑动窗口变换器块后做结构级调制以稳定早期特征,三路调制与文本侧提示联合优化。与仅调文本的提示学习相比,关键差异在于全类共享的极轻量连续音频提示直接改变声学感知,而非迫使文本适配冻结音频。在11个数据集平均的16样本设置下,结合提示仿射调制学习的扩展配置相对该基线top-1准确率从77.86%提升至79.26%,绝对增益1.40个百分点。该结论限于对比语言音频预训练架构与2至16样本区间,在1样本时曾出现过拟合下滑。原文未披露训练时长与部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/hyebin-c/aspl — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么值得读?
本文输入是论文原文与官方原图像素,目标是为刚进入语音音乐音频方向的研究生复述出一套可核对、可复现的方法理解。必须保留的信息包括任务定义、编码器冻结与更新边界、三处调制位置与计算形式、训练与评估条件、主结果与反例、参数与延迟代价。输出是 1 篇中文技术解读,不做营销式判断,所有事实回到原文核对。 研究对象是对比式音频语言模型做少样本音频分类。
通俗说,模型平时在大规模音频加文字上预训练,学会把一段声音和一句描述放到同一个向量空间;下游任务给很少的带标签音频,要求模型不做全量微调,只学少量提示参数就能把新类别分对。英文名是 Audio-Language Models,缩写 ALMs,代表是对比语言音频预训练 Contrastive Language-Audio Pretraining,缩写 CLAP。 为什么这个任务不是把声音丢给模型就结束?因为预训练语料的录音条件、能量分布、背景噪声与下游 11 个数据集差异很大,直接做零样本余弦最近邻会有声学差距。
已有提示学习多在文本侧做文章,音频编码器保持冻结,文本再灵活也要去适配一个静态的音频空间,这构成瓶颈。论文要回答的是音频编码器早期是否也能用极轻量的可学习提示做任务相关的声学校准。
音频语言模型 × 对比学习对齐: 音频语言模型负责把声音波形和自然语言描述分别编码, contraste 学习对齐负责用余弦相似度把两者拉到同一空间做分类;前者提供可迁移的双编码器,后者规定了预测规则是选相似度最大的文本类别,少样本提示学习正是要在不解冻大编码器的前提下微调这个对齐过程。
沿一个样本走一遍便于建立依赖:输入一段音频波形,经对数梅尔谱变换得到时频表示,经块嵌入变成 token 序列,经 Swin Transformer 多层混合得到全局音频向量;另一路把每个类别名填入模板生成文本描述,经文本编码器得到文本向量;两路向量做余弦相似度,取最大者为预测类别。少样本训练只更新提示参数,两大编码器主干冻结,监督来自少量样本的交叉熵损失。
已有路线在调哪里,本文与它们是什么关系?
同输入同目标的已有路线都是文本侧提示学习。CoOp 引入静态可学习提示 token,所有样本共享同一组上下文;CoCoOp 进一步做动态实例条件化提示,每个音频实例生成不同的文本偏置,以处理实例级方差;PALM 扩展了提示的定义,不再局限于离散 token 拼接,证明文本特征上的轻量仿射变换也能有效充当提示,且与类别相关。它们的共同点是只精修文本表示,音频表示固定。
同运行阶段的另一条线是全量微调与适配器,但论文明确走参数高效路线,不更新编码器主干。作者认为音频信号连续、高维、类内方差大,过去被认为优化音频编码器不稳定低效,但这恰是文本中心偏见。未被探索的是音频编码器内的可学习提示在少样本音频分类中的作用。 本文与上述路线的关系是插件式互补,不是替代。ASPL 即 Audio-Side Prompt Learning,音频侧提示学习,被设计为可与 CoOp、CoCoOp、PALM 中任一文本侧方法叠加,形成双侧提示框架。
图 1 正是把 CoOp 画在文本侧、ASPL 画在音频侧来表达这种对称。
文本侧提示学习 × 音频侧提示学习: 文本侧提示学习分工是优化文本编码器一侧的类别描述表示,让文本锚点向音频靠拢,音频侧提示学习分工是直接在音频编码器早期调制声学表示,让音频向文本靠拢;两者搭配的理由是单侧适配会被冻结的另一侧限制,组合意义是形成双侧联合精调,更完整地弥合预训练语料与下游录音条件之间的声学差距。
与同类工作如何对照,避免类别错误?
按同输入同目标同监督对照:CoOp 与 CoCoOp 同为少样本提示学习,同运行阶段冻结主干,区别在静态与动态文本提示;PALM 同为仿射即提示,但作用在文本特征且类别相关,ASPL 将其思想迁移到音频早期且全类别共享。不能把类别差异当同条件胜负,例如生成式 ALM 如 Qwen2-Audio 与 SALMONN 面向音频到文本生成,与本文判别式分类的余弦最近邻目标不同,不宜直接比准确率。
同输入不同目标的如自动音频字幕与声音事件检测,虽共享 CLAP 表示,但任务头与指标不同,只能借鉴表示迁移思路,不能比少样本分类数字。数据集论文如 ESC、UrbanSound、CREMA-D 提供数据与划分,不提供方法基线,引用时只作数据来源。 常见误解是把比喻当性质证明:可学习均衡器只是帮助理解频率维缩放的比喻,真实机制是梯度优化的仿射参数重校准能量与通道,不能证明其学到物理均衡器特性;早期调制保护语义知识是设计动机与消融支持的判断,不是每层梯度的形式化保证。
要解决的具体问题与输入输出如何界定?
具体问题是少样本条件下跨模态对齐不充分。输入是每类 K 个训练样本,K 取 1、2、4、8、16,测试是各数据集的官方划分或多折交叉验证平均。输出是 C 类上的预测类别下标,由音频向量与 C 个文本向量余弦相似度最大决定。指标是 Top-1 准确率,方向是越高越好,聚合是 3 随机种子 0、1、2 独立运行取平均。 举例帮助理解,例子不是论文数据:比如城市声音 8 类任务,每类只给 16 段,每段长度与录音设备不一,模型要靠少量样本学会是警笛还是钻机。
例子只说明采样形态,不附加任何效果数值。 约束是两大编码器冻结,只更新提示参数与 ASPL 模块。文本侧用单个提示上下文,不做集成。音频与文本嵌入都做 L2 归一化,余弦分数先除以固定温度再进 Softmax,遵循 PALM 的提示优化协议。温度、优化器、训练轮数等见训练节,缺项在局限节指出。
ASPL 全景:三处调制放在哪里,为何只动早期?
ASPL 全景可以一句话概括:在 CLAP-HTSAT 音频编码器内的 3 个早期抽象层级各放一组共享仿射参数,与文本侧提示联合优化。3 个位置按信号流向依次是:对数梅尔谱变换之后、块嵌入生成 token 之后、Swin Transformer 第一个块输出之后。前两者构成 ASPL,后者加入后构成完整版 ASPL 星号。原文把这种安排称为分阶段调制,意图是在音频编码器建立抽象的早期就注入任务偏置,在低层感知级重校准频谱偏移,在接口级衔接局部卷积与全局注意力,在结构级稳定早期混合特征,避免物理细节扰动深层已学好的语义知识。 下图是全文的方法总览,读图时先走主路径再看注入点与冻结边界。
看图路径: 1. 沿左上角音频波形经对数梅尔提取、块嵌入、Block1 到 Block4 到音频特征的主路径走一遍;2. 观察顶部粉框内三个带火焰图标的提示分别用竖箭头注入哪两段之间;3. 对比底部文本分支的火焰图标与蓝色冻结编码器,确认双侧同时可训的位置;4. 看最右侧音频特征与文本特征汇合求相似度再输出分数的汇合点
论文图 1。原论文 Figure 1:“Overview of the proposed ASPL framework.”。
从像素看,左侧波形箭头进入绿色 Log-mel Extraction,再进入 Patch Embedding,再进入 Block1 到 Block4 的大绿框,最终输出 Audio Features;顶部粉框标出 Audio-Side Prompt Learning 星号,内含 Spectral Prompting、Token Prompting、Structural Prompting 3 个带火焰图标的小模块,各用黑色竖箭头分别注入上述 3 段之间;底部蓝色长条是 Text Encoder,左侧灰色 Class1 到 ClassN 叠加火焰图标表示文本侧提示可学习;右上角图例明确火焰为可训练、雪花为预训练冻结,音频与文本编码器虚线框右上角各有一个雪花;最右侧两路特征汇合求点积得到 Scores。
解释是:可训练量只在提示处,编码器主干不动;三处调制由浅入深覆盖从原始频谱到深层结构表示,文本侧以 CoOp 为例但可换成 CoCoOp 或 PALM,这正是即插即用的含义。
每级调制算什么,参数形状与广播如何工作?
3 级调制的统一计算形式都是逐通道仿射:输出等于可学习缩放乘输入加可学习偏置。符号上输入记为 3 维特征 X,输出记为 X 撇,伽马与贝塔是可学习 1 维连续提示向量,向其余时间或空间维广播。与文本侧 PALM 需要类别相关参数不同,这里的声学提示向量在所有类别与实例间共享,因此参数量恒定,不随标签空间复杂度增长。 第一级是频谱调制,作用在批量、频率、时间的对数梅尔谱上。
参数形状对应频率维,记为伽马谱与贝塔谱,在批量与时间上广播,做频率维缩放,功能类似可学习均衡器,适配能量分布与录音条件差异。原文强调不是做深层声学偏置学习,而是高效引导声学表示。 第二级是 token 级提示,作用在块嵌入输出的批量、token 长度、通道张量上。参数形状对应通道维,在批量与长度上广播,做通道重校准,自适应强调任务相关的声学模式。位置正好处于局部卷积特征向全局注意力过渡的接口,起到衔接作用。
第 3 级是结构提示,作用在第一个 Swin 块输出上。参数形状同样对应通道维,在批量与序列长度上广播,在首次局部全局混合后立即施加任务偏置,稳定早期特征并防止深层语义漂移。原文通过对照说明早期块优于晚期块,晚期调制会干扰预训练跨模态知识。
仿射调制 × 声学提示: 仿射调制分工是提供极简计算形式 X′等于伽马乘 X 加贝塔,按通道广播做缩放和平移,声学提示分工是赋予这组参数任务含义即在频谱、 token 和结构层重校准能量分布与早期特征;搭配理由是 PALM 已验证仿射可作参数高效的提示,组合意义是把离散 token 拼接换成连续声学均衡器式的提示,全类别共享且不引入重型适配器。
参数量可直接对应:64 个梅尔 bins 对应 128 个参数,96 维初始 token 投影对应 192 个参数,192 维第一 Transformer 块对应 384 个参数,因此 ASPL 新增 320,ASPL 星号新增 704,均为固定开销。
冻结谁、更新谁、监督从哪里来?
训练阶段冻结 CLAP-HTSAT 音频编码器与来自预训练 PENGI 的 CLIP 文本编码器主干,只更新文本侧提示参数与 ASPL 仿射对。梯度路径是从交叉熵损失经余弦相似度分数回传到两路提示参数,不进入冻结主干。监督来源是每类 K 个样本的类别标签,文本描述由模板生成,音频波形经 3 级调制后编码。优化器用 SGD,学习率 0.01,动量 0.9,权重衰减 0,批量 16,训练 100 轮,温度固定 0.01,嵌入 L2 归一化。随机种子固定为 0、1、2 做 3 次独立运行。
需要明确的缺项是原文未报告学习率调度、早停、梯度裁剪与提示参数初始化细节,也未说明不同数据集是否调超参数。从模型名称不能推定文本编码器具体层数与分词实现,复现时应以开源代码与 PALM 协议为准。推理时保持同样的 3 级调制与文本提示,不重置,温度与归一化与训练一致。
训练细节的第二视角:为什么是这个优化组合?
本节承担方法职责的等价构造说明:没有全量训练阶段,只有提示参数优化阶段。真实计算过程是前向经 3 级调制得到音频向量,经文本提示得到文本向量,算余弦相似度除以温度后 Softmax,与标签算交叉熵;反向只更新伽马贝塔与文本提示。SGD 无权重衰减的选择意味着不对提示参数做额外收缩,100 轮在小批量上足以让数百参数收敛,但也增加 1 样本过拟合风险,这与 1 样本下降现象一致。
批量 16 在少样本下可能包含重复采样,原文未说明采样器是有放回还是按类均衡,需看代码。温度固定而不学习,避免了双侧同时调温带来的不稳定,这也是冻结主干之外的稳定性设计。推理时不更新任何参数,直接用学到的共享仿射做确定性前向,但不能从参数冻结推定系统输出确定,因为仍受预处理与硬件浮点影响,原文未对此做确定性声明。
在哪些数据与协议上测,与谁比才算公平?
评估覆盖 11 个多样化音频分类数据集,遵循 PALM 的基准套件与评估协议,包括乐器分类的北京歌剧与 NS 乐器、声音事件的 ESC50 与 ESC50 动作与 UrbanSound8K、情感识别的 CREMA-D 与 RAVDESS、 vocal 声音的 VocalSound、监控事件的 SESA、声场景的 TUT2017、音乐分析的 GT 音乐流派。有官方划分用官方划分,无官方划分用多折交叉验证报告平均。 基线是实际可运行的训练型适配方法 CoOp、CoCoOp、PALM,架构统一为 CLAP-HTSAT 音频编码器加 CLIP 文本编码器,训练中两编码器冻结,只训提示。比较时文本侧用单个提示上下文且不集成,样本数、种子、轮数、优化器、批量与硬件均一致,硬件为英伟达 RTX A5000。
指标统一为平均 Top-1 准确率,方向越高越好。 下表整理训练与评估的关键可复现配置,数字与单位来自原文连续描述。
| 配置项 | 优化与采样 | 归一化与温度 | 运行与硬件 | 评估聚合 |
|---|---|---|---|---|
| 训练轮数与批量 | 100 轮,批量 16 | L2 归一化 | RTX A5000 | 种子 0,1,2 平均 |
| 优化器设置 | SGD,学习率 0.01,动量 0.9,权重衰减 0 | 温度 0.01 | 交叉熵损失 | Top-1 准确率 |
| 少样本采样 | 每类 1,2,4,8,16 个 | 余弦相似度后 Softmax | 编码器冻结 | 11 数据集平均 |
表前提出的问题是复现需要哪些条件才能与原文对齐,公平条件是编码器、提示上下文数、优化协议一致,指标方向是准确率越高越好。
表后解释是该配置的核心代价是 100 轮乘 11 数据集乘多基线乘 3 种子,计算量不小,但单次推理延迟增加很小;限制是未报告不同数据集的折数细节与学习率调度,复现时需先跑通代码默认配置再核对划分。
主结果:双侧提示是否普遍带来增益?
要回答的主问题是把 ASPL 叠加到文本侧基线上,在 16 样本下 11 数据集平均 Top-1 准确率是否提升。公平条件是同编码器、同冻结、同种子平均,指标方向越高越好。下表摘录原文大表中的平均列与关键行,保留原文写法与精度,百分号含义由表头平均 Top-1 准确率百分比界定,数据格为裸值。
| 文本基线 | 基线平均 | 叠加 ASPL 平均 | 叠加 ASPL 星号平均 | 模态配置 |
|---|---|---|---|---|
| CoOp | 73.56 | 74.41 | 75.54 | 文本静态加音频调制 |
| CoCoOp | 76.45 | 77.85 | 77.31 | 文本动态加音频调制 |
| PALM | 77.86 | 78.98 | 79.26 | 文本仿射加音频调制 |
表后解释是主要收益与代价。
报告显示轻量 ASPL 已带来平均约 1.1% 的增益,PALM 叠加 ASPL 星号达 79.26 为全文最高平均。分基线看,CoCoOp 因已有动态实例条件化文本提示,轻量 ASPL 即达最优,加深层反而略降至 77.31,支持动态文本加浅层声学已足够而不引入冗余的判断;CoOp 与 PALM 依赖静态或类别提示,文本刚性大,需要 ASPL 星号的早期结构调制补偿,分别从 73.56 到 75.54、从 77.86 到 79.26。代价是逐数据集有波动,例如 CoOp 叠加 ASPL 在 CREMA-D 与 SESA 等个别集出现下降,未胜出项提示总体趋势不等于每组都成立。
CoCoOp × ASPL: CoCoOp 分工是生成实例条件化的动态文本提示,已能处理实例级方差,ASPL 分工是提供轻量频谱加 token 2 级声学对齐;搭配理由是动态文本已较灵活时不需要再加深层结构调制,组合意义是轻量 ASPL 即达最优而避免冗余,这与静态文本基线需要更深 ASPL 星号补偿形成对照。
样本数、位置与成本:增益从哪里来?
消融按 3 个问题组织。第一是样本数从 1 到 16 的适应曲线,测的是不同监督量下双侧提示是否仍优于纯文本基线。第二是调制位置,测的是单级、2 级、输出空间复制与早晚块的效果差异。第三是参数与延迟成本,测的是增益是否以可忽略开销取得。 先看样本数。下图是 11 数据集平均准确率随样本数的柱状对比,同一小节内形成导读与解释闭环。
看图路径: 1. 先看横轴样本数 1 到 16 与纵轴 11 数据集平均准确率的范围;2. 对比每组内粉色基线与蓝色 ASPL、绿色 ASPL 星号在 2 样本起的相对高低;3. 注意 1 样本处蓝色与绿色未超越粉色的例外位置
论文图 2。原论文 Figure 2:“Ablation study on the number of shots.”。
从像素看,全图分 CoOp、Co-CoOp、PALM 三面板,横轴均为样本数 1、2、4、8、16,纵轴为平均准确率(%)0.50 到 0.80;图例中粉色为基线、蓝色为 ASPL、绿色为 ASPL 星号;除 1 样本处粉色略高或持平外,2 样本起蓝色与绿色在多数柱上高于粉色,且随样本增加差距保持,16 样本处最高接近 0.79。解释是原文报告 1 样本时因单例监督不足以稳健优化连续声学提示而略降或过拟合,从 2 样本起分层提示有效利用监督并持续抬高上限;限制是像素不能精确读出每柱小数,定量以主结果表为准。
位置消融显示单做频谱或单做 token 略降,表明孤立调制会扰动冻结编码器内部表征流;频谱加 token 联合达协同增益;简单复制 PALM 式输出空间调制到音频侧无效, late 块不如 early 块,支持早期声学条件化而保留深层跨模态知识的设计原则。 下表整理复杂度与性能,保留原文千分位与小数精度。
| 方法 | 可训练参数量 | 推理延迟 | 平均准确率 | 开销说明 |
|---|---|---|---|---|
| CoOp | 8,192 | 2.60 | 73.56 | 文本基线 |
| PALM | 4,100 | 2.60 | 77.86 | 文本基线 |
| PALM 加 ASPL | 4,420 | 3.09 | 78.98 | 新增 320 |
| PALM 加 ASPL 星号 | 4,804 | 2.97 | 79.26 | 新增 704 |
表前问题是增益是否值得额外成本,公平条件是同 PALM 基线、同 CREMA-D 测延迟、15 次试验平均,指标方向是准确率越高越好、延迟越低越好。表后解释是主要收益为超 1.4 个百分点的绝对增益,代价仅数百参数与 0.4 毫秒量级延迟波动,原文称在噪声范围内。
反例是 CoCoOp 基线本身已有 107072 参数,显著高于 PALM 系,说明文本动态化的参数代价远大于音频侧固定开销,未评测边界是延迟仅在 CREMA-D 上测,未覆盖长音频与批量推理。
哪些还没测,哪些结论不能推广?
直接报告的局限包括 1 样本下轻微下降、逐数据集波动、延迟只在 CREMA-D 上测量且波动在噪声范围内。有限解释是单样本不足以优化连续声学提示、孤立单级调制引起内部协变量偏移、深层 ASPL 星号补偿刚性文本表示,这些有消融支持但属于事后解释,需更多 seeds 与统计检验才能确立因果。 未验证的推测不能当结论:未测量误判率分布、校准误差、长尾类别表现,不承诺这些量改善;未报告不同录音设备与噪声水平的细粒度切片,不能把平均增益推广到每个声学域。
未做显著性检验与置信区间,不能断言每个数据集差异都显著。训练资源只给单卡型号与批量轮数,未给总时长与显存占用,推理开销只给延迟均值,未给吞吐与帧率,总体趋势不等于每步都成立。 原文表头与算术未发现直接冲突,但需注意百分点与相对百分比不同,平均列是 11 数据集平均 Top-1 准确率的算术平均,不是加权或中位数,不同指标差值不能混入模型列比较。
要复现,先跑通什么,再核对什么?
代码状态是正文声明当前可用,地址为开源仓库,本文写作时资源状态为可达,可按仓库说明下载运行。复现先做三件事:按 PALM 协议装好 CLAP-HTSAT 与 PENGI 的 CLIP 文本权重,冻结两编码器;实现 3 组仿射参数并确认广播维度与共享逻辑;用单提示上下文、固定温度 0.01、SGD 指定超参数跑通 16 样本 3 种子流程。 关键超参数与信息条件是学习率 0.01、动量 0.9、权重衰减 0、批量 16、100 轮、种子 0、1、2、温度 0.01、L2 归一化、单卡 RTX A5000。
先在 ESC50 与 UrbanSound8K 等划分清晰的数据集上核对基线平均,再叠加 ASPL 与 ASPL 星号核对平均增益方向与量级。需补的验证是 1、2、4、8 样本全曲线、早晚块对照、输出空间复制对照,以及延迟在自有硬件上的重测。区分代码开源、权重下载与系统可运行:有代码不等于有权重,有权重不等于划分与依赖一致,任何一环缺失都应明确记录为本次未能确认。
何时值得尝试,一句话如何带走?
何时值得尝试:当文本侧提示已调到瓶颈、音频域偏移明显但每类只有数个到十余个样本、且不能承担全量微调时,优先试轻量 ASPL;若文本侧是静态 CoOp 或 PALM 且仍欠拟合,再试 ASPL 星号补早期结构调制;若已用动态 CoCoOp,先用浅层 2 级,避免冗余深调。复现先跑通 16 样本平均与参数计数,再补全样本曲线与位置消融。还需补的验证是更多种子下的方差、逐数据集显著性、长音频延迟与显存。 带走一句话:冻结大编码器、只在音频早期学几百个共享缩放平移参数,就能在多个文本基线上换来稳定的平均增益,代价是单样本下需谨慎且个别数据集可能波动。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

