英文题目:Audio-Language Prompt Learning for Few-Shot Audio Classification

会议身份:conference:interspeech:2026:conference-paper-id:xu26l_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#提示学习 #音频大模型 #少样本 #音频分类

评分:6.0/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Qisheng Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiaoyi Tan:机构信息未能从会议 PDF 纯文本可靠映射
  • Wuyang Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Yutao Dou:机构信息未能从会议 PDF 纯文本可靠映射
  • Kele Xu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

少样本音频分类需在每类仅16个样本下将音频波形映射到正确语义类别,难点是声学相似类语义描述接近而细粒度声学差异难以建模,且文本主导适配易造成跨模态优化失衡。本文提出多模态音频语言提示学习(Multi-modal Audio-Language Prompt Learning,MALP),冻结PENGI音频编码器与文本编码器,只优化音频专用、文本专用与共享三组提示。模态专用提示先以残差方式分别增强音频与文本表示以保留预训练结构,共享提示再以拼接方式注入双分支形成公共语义子空间以促进对齐,融合表示逐类经余弦相似度与Softmax做分类并以交叉熵训练。与仅优化文本提示的CoOp、CoCoOp和PALM相比,关键差异是显式恢复音频分支可塑性并解耦专用化与对齐,从而提升细粒度类别的可分性与跨模态一致性。在11个基准平均准确率上MALP达到78.35%,相对PALM提升1.77个百分点,尤其在Beijing-Opera与CREMA-D等细粒度任务增益更明显。该结论限于PENGI骨干与16-shot为主的评测,尚未验证超低样本、跨域与跨骨干外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

本文解读的输入是题目为音频语言提示学习的少样本音频分类论文正文,以及本次实际收到的 3 张官方原图像素,不引入其他文献的解释或评价。目标读者是刚进入语音、音乐与音频方向的研究生,需要能照着复述方法、核对实验条件并理解每一步的监督来源。解读必须保留的关键信息包括骨干模型选择、冻结与更新的边界、3 类提示的计算位置、训练损失与推理规则、11 个数据集上的评估协议与平均性能数字。

输出按学习依赖组织:先讲少样本音频分类任务为何困难,再讲已有提示路线为何偏向文本,接着走完一个样本从输入到预测的全流程,然后展开训练细节、实验条件、主结果与反证,最后给出复现清单与适用判断。凡是教学用的举例都会明确标为例子,不把例子中的数字当作论文报告的结果。

少样本音频分类可以白话理解为每类只给很少的标注音频,要求模型仍能识别新类别,英文为 few-shot audio classification。音频语言模型是先在大规模音频文本对上做跨模态预训练,再用音频与文本嵌入的余弦相似度做分类的模型,英文为 audio-language models,简称 ALMs。提示学习是在冻结主干编码器的前提下,只优化少量连续可学习向量的适配方法,英文为 prompt learning。这三者的依赖关系是:预训练的 ALMs 提供可迁移的跨模态空间,少样本任务限定了监督预算,提示学习则是在该预算下调整模型的手段。

若把主干也一起微调,小数据下的优化方向会不稳定,因此论文把冻结主干作为基本约束,后续所有设计都围绕如何在该约束下补齐音频侧的建模能力。

同任务的已有路线在优化哪里,留下了什么缺口?

按同输入、同目标、同监督来对照,论文涉及 4 类可运行基线。零样本参考是 PENGI,直接用固定模板生成类别原型,不做任何提示优化,用于衡量预训练本身的迁移能力。单模态提示代表是 CoOp,在文本分支学习连续提示嵌入;CoCoOp 进一步让提示随单个样本实例变化,以增强泛化。音频语言少样本提示代表是 PALM,在 ALMs 的文本编码器中引入可学习提示向量,提高适配效率。教学例子:可以把 CoOp 想象成只允许修改考题题干的措辞,不允许给听力材料加标注,PALM 也是主要改题干一侧。

论文指出的结构性缺口是文本中心适配带来的跨模态优化不平衡。当 2 个类别的语义描述接近但声学细节不同时,例如吉他与贝斯,仅调整文本原型难以拉开音频嵌入之间的距离。原文用乐器例子说明,文本提示建模容量不足会导致声学相似类别的可分性下降。这不是说文本提示无效,而是在低数据下音频编码器长期不被适配,判别性声学线索没有可学习的参数去捕捉。后续方法全景正是为补上这一侧而设计,同时要避免破坏已有的跨模态对齐。

要解决的矛盾是什么,判别与对齐为何会冲突?

中心矛盾可以表述为:少样本音频分类同时需要模态内判别和跨模态对齐,但只优化文本提示会让两个目标失衡。模态内判别白话讲就是让同一类声音聚拢、不同类声音分开;跨模态对齐白话讲就是让一段音频靠近其正确类别的文本描述、远离错误类别的描述。前者主要依赖音频分支捕捉细粒度频谱与时序差异,后者依赖音频与文本共享可比的语义子空间。如果只动文本一侧,文本原型可以移动,但音频嵌入分布基本不动,声学相似类别的重叠区域就难以解开。

论文把解决思路分解为先专用化、再对齐的渐进策略。专用化是指音频专用提示与文本专用提示各自在分支内做残差增强,目标是放大任务相关的模态特性;对齐是指共享提示向 2 分支注入同一段上下文,目标是形成公共 conditioning 以保持可比性。关键约束是主干编码器始终冻结,只有提示参数参与优化,因此专用化不能改写预训练的全局结构,只能做轻量偏移。这种解耦设计的教学意义在于:把容易混在一起的两个梯度来源分开,先让各模态自己变好,再用共享参数把它们拉到同一尺度下比较。

MALP 的全景如何走通一个样本的输入到输出?

先沿一个样本走完主路径有助于建立全局坐标。输入包括两部分:一是每类标签填入文本模板得到的类别提示,例如模板为录音描述句式;二是待分类的音频波形。文本提示经过冻结的文本编码器得到类别原型嵌入,音频波形经过冻结的音频编码器得到音频嵌入。接着模态专用提示以加权残差方式分别修正两类嵌入,再将同一份共享提示拼接到两个分支,形成扩展空间中的融合表示。

最后计算音频融合表示与每个类别文本融合表示的余弦相似度,经 Softmax 得到类别概率,取最大值作为预测。训练时用少样本集上的交叉熵损失回传梯度,只更新 3 组提示参数。

下图是论文给出的整体框架,左侧为双分支输入与冻结编码器,中间为 3 类提示的注入位置,右侧为相似度预测与损失回传,阅读时重点区分加号代表的融合与交叉符号代表的拼接。

看图路径: 1. 先从左侧输入提示与输入音频出发,沿文本编码器与音频编码器两条支路向右追踪箭头;2. 再看文本提示、音频提示以加号汇入各自嵌入,共享提示以拼接方式同时进入上下两路融合嵌入;3. 最后看融合嵌入经相似度计算得到预测分布,并向上回传交叉熵损失,只更新带火焰标记的提示

原论文 Figure 2:Overall framework of the proposed MALP, featuring audio-specific and shared prompts for…

论文图 2。原论文 Figure 2:“Overall framework of the proposed MALP, featuring audio-specific and shared prompts for multi-level cross-modal alignment.”。

从像素可见,顶部文本支路与底部音频支路对称排列,蓝色雪花标记表示编码器冻结,红色火焰标记表示提示可学习。文本提示与音频提示分别通过加号符号汇入各自嵌入,共享提示则同时向下和向上引出箭头,以拼接符号进入文本融合嵌入与音频融合嵌入。最右侧柱状图表示预测分布,灰色箭头指向上方的交叉熵损失,图例明确区分融合、拼接、相似度、可学习与冻结 5 种符号。

该布局支持论文的渐进主张:专用增强发生在拼接之前,对齐发生在拼接之后,2 阶段在端到端可微图中保持分离又能联合优化。需要提醒的是,图中文本编码器与音频编码器的下标在像素渲染中存在笔误,解读时应以正文公式的符号定义为准,不从图中的错位下标推定实现。

模态专用提示在编码器之外做了什么计算?

模态专用提示的白话含义是只属于一个模态的少量可学习向量,英文为 modality-specific prompts,包括音频专用提示与文本专用提示。它们不插入编码器内部,而是作用于编码器输出的嵌入之上。原文给出的计算是凸组合形式的残差增强:增强后的音频表示等于原音频嵌入与音频提示的加权和,增强后的文本表示等于原文本原型与文本提示的加权和,权重是可学习的缩放系数。这种写法保留了预训练表示的全局结构,只注入任务特定的偏移,参数开销很小。

音频语言模型 × 提示学习: 音频语言模型负责把音频波形和类别文本映射到同一个可比的嵌入空间,分工是提供跨模态相似度分类的基础;提示学习负责在冻结主干编码器的前提下只调整少量可学习向量,分工是以低数据成本做任务适配;二者搭配的原因是少样本下全量微调易过拟合而零样本判别力不足,组合意义是冻结大模型知识的同时,用提示补上新类别所需的声学与语义偏移。

从学习依赖看,该组件先于跨模态对齐发生。原因是声学细节往往在高层语义描述中反映微弱,若不先在音频侧放大差异,后续对齐只能在重叠分布上做整体平移。训练时只有提示向量与缩放系数接收梯度,主干保持冻结,因此梯度路径不会改写通用音频与文本知识。推理时增强表示直接参与后续拼接与相似度计算,不需要额外重置或缓存。未报告的缺项是提示向量的维度初始化方式与缩放系数的初始值,论文只说明融合系数设为 0.2,没有给出初始化分布,复现时需要固定自己的选择并记录。

共享提示如何同时进入两个分支又不抹掉特性?

共享提示白话讲就是同一份可学习上下文被复制到音频和文本两侧,英文为 shared prompt。它的计算是向量拼接:将增强后的文本嵌入与共享向量拼接为文本融合表示,将增强后的音频嵌入与同一共享向量拼接到音频融合表示。拼接符号的含义是扩展嵌入空间,而不是把原嵌入覆盖掉。由于两侧拼接的是完全相同的向量,模型在扩展维度上获得了一个公共语义子空间,有利于余弦相似度在可比尺度下计算,而原始嵌入部分仍保留模态专用成分。

模态专用提示 × 共享提示: 模态专用提示分工是在音频分支和文本分支内部各自做残差式增强,分别捕捉任务相关的声学变化和类别语义细化;共享提示分工是向两个分支注入同一段可学习上下文,形成公共语义子空间以拉齐跨模态表示;搭配原因是只做专用增强会加剧模态漂移、只做共享对齐会抹掉模态特性,组合意义是先分化再对齐,在保留模态判别力的同时保证音频与文本可比。

搭配理由需要紧接着说明:若没有专用提示,共享拼接只能对齐原始分布,对声学相似类别的区分帮助有限;若没有共享提示,两侧专用增强可能朝不同方向漂移,导致相似度计算失准。组合后的新增作用是结构化融合机制,即在不覆盖专用适配的前提下促进一致性。推理时融合表示的相似度分数直接决定预测类别,分数经 Softmax 归一化为概率。原文没有给出拼接后是否重新归一化的实现细节,也没有报告共享提示长度的消融,因此不能从名称推定其长度或归一化方式,复现时应把该缺项记为待确认。

冻结谁、更新谁,监督信号从哪里来?

训练职责在本论文中是明确存在的:优化 3 组提示参数,最小化少样本集上的交叉熵损失。冻结对象是音频编码器与文本编码器,论文采用 PENGI 作为骨干以保证与已有方法公平比较。更新对象是文本专用提示、音频专用提示与共享提示,以及残差加权中的可学习缩放系数。监督来源是每类随机采样的 16 个标注样本提供的类别标签,零样本评估则使用固定模板而不做手工提示工程。优化器为随机梯度下降,批量大小为 16,学习率为 0.05,训练 50 轮,在与单张 RTX 3090 相当算力的单个 GPU 上运行,3 个随机种子重复并报告每次与平均性能。

少样本学习 × 冻结主干: 少样本学习分工是限定每类仅用 16 个随机采样样本提供监督,模拟罕见声音事件标注稀缺的现实条件;冻结主干分工是训练时不更新音频编码器和文本编码器,只让提示向量与缩放系数接收梯度;搭配原因是小数据下更新大参数量主干会破坏预训练结构,组合意义是用最小可调参数实现可复现的增量适配,并把性能变化归因于提示设计而非主干重训练。

从计算过程看,每一步前向先得到冻结编码器的嵌入,再经专用加权与共享拼接得到融合表示,计算与全部类别的余弦相似度并归一化为概率,损失对提示参数求梯度并更新编码器之外的参数。梯度不进入主干,因此不存在主干灾难性遗忘问题,但也意味着音频特征提取器的底层滤波能力没有被任务调整。需要区分的是,论文描述的先专用化后对齐是架构上的分阶段含义,不是先训练一部分再冻结另一部分的 2 阶段训练,原文明确 3 类提示是联合优化。未报告的缺项包括学习率调度、权重衰减与早停策略,复现时应保持 50 轮完整训练并记录种子方差。

在哪些数据与何种协议下比较,指标方向是什么?

评估覆盖 11 个公开数据集, spanning 乐器识别、环境声、语音情感、人声、监控声、声场景与音乐流派。乐器包括北京戏曲打击乐与 NS 乐器库,环境声包括 ESC50 及其动作子集与城市声音,情感语音包括 CREMA-D 与 RAVDESS,人声为 VocalSound,监控为 SESA,声场景为 TUT2017,音乐流派为 GT 音乐流派。这些数据集在语义粒度、声学可变性、时序复杂度和类别规模上各不相同,论文主张这种异构性能同时考验判别建模与跨模态对齐。指标为分类准确率,方向是越高越好,聚合对象是 11 个数据集的平均准确率与每个数据集的单独准确率。

比较条件保持一致是解读公平性的关键。基线包括零样本 PENGI、单模态提示 CoOp 与 CoCoOp,以及音频语言少样本提示 PALM,覆盖零样本迁移与基于提示的适配两类。所有方法共享同一骨干、同一 16 样本采样协议与同一固定模板,避免因模板工程带来额外增益。采样方式为每类随机抽 16 个样本训练,重复 3 个随机种子。需要指出,原文摘要与正文对 CoCoOp 的平均增益写法存在冲突,摘要写 4.80%,结果节写 4.88%,解读时明确标注该冲突而不自行取舍,后续表格同时保留两种写法的来源。资源状态方面,本次未发现来源绑定且完成验证的开源链接,因此不得声称代码、模型或数据已公开,只能按论文文字复述数据集名称与实验设置。

主结果在公平条件下显示了什么,代价与反例是什么?

要回答的核心比较问题是:在相同骨干、相同 16 样本协议与相同准确率指标下,多模态提示是否一致优于文本主导的提示方法。公平条件如上一节所述,指标方向为准确率越高越好。下表整理论文直接报告的平均性能与平均增益,不引入原表矩阵中未经逐字引用的单数据集数字,以保证每个数字都有连续原句覆盖。

对比基线样本设置评估指标报告的平均增益MALP 报告的平均准确率
CoOp16 样本每类准确率7.21%78.35%
CoCoOp16 样本每类准确率4.88%,摘要另写 4.80%78.35%
PALM16 样本每类准确率1.77%78.35%

表后解释需要同时给出收益与代价。论文报告 MALP 平均准确率达到 78.35%,对 CoOp、CoCoOp 与 PALM 的平均提升分别约为 7 个、近 5 个与近 2 个百分点,支持多层级提示在少样本音频分类中有效的判断。增益在北京戏曲、CREMA-D 与 RAVDESS 上更明显,论文解释为这些任务更依赖细粒度声学线索与微妙语义区分;在 ESC50 与音乐流派上提升较小但保持稳定,表明跨任务鲁棒性而非单点爆发。代价是 3 组提示都需要为新任务优化,参数量虽小但训练成本高于零样本直接推理。

反例方面,论文没有报告任何 MALP 输给基线的数据集,但也没有测量延迟与推理开销,因此不能承诺效率同步改善。百分点差值与相对百分比在此严格区分,上述增益均为平均准确率的百分点差。

类内紧致 × 跨模态对齐: 类内紧致分工是让同一乐器或同一事件的音频嵌入在特征空间中聚得更拢,反映音频侧判别力的提升;跨模态对齐分工是让音频嵌入与对应类别文本原型的余弦相似度高于错误类别,保证分类决策正确;搭配原因是紧致但不对齐仍可能整体偏向错误文本原型,对齐但不紧致则易受噪声样本干扰,组合意义是同时用分布形状和决策边界来检验多模态提示是否真正起作用。

为检验声学相似类别的可分性,论文在 NS 乐器数据集上给出音频嵌入的降维可视化,左侧为 PALM,右侧为本方法,重点看吉他与贝斯、木槌与键盘等易混类别是否分开。

看图路径: 1. 先确认左右两幅子图分别为 PALM 与本方法,右侧图例列出 10 类乐器的颜色对应关系;2. 再对比左侧吉他与贝斯、键盘等类别混杂区域在右侧是否收拢为更集中的色块;3. 最后观察弦乐、管风琴等原本已分离的类别在两侧是否保持独立,以排除整体位移的假象

原论文 Figure 1:t-SNE visualization of audio feature embeddings gen- erated by PALM and our method on the…

论文图 1。原论文 Figure 1:“t-SNE visualization of audio feature embeddings gen- erated by PALM and our method on the NS-Instruments dataset.”。

从实际像素看,两幅散点图共享右侧 10 类图例,颜色分别对应贝斯、铜管、长笛、吉他、键盘、木槌、管风琴、簧片、弦乐与人声。左侧 PALM 中蓝色贝斯点与红色吉他点在右侧中部大面积交织,紫色键盘点也分散混入该区域;右侧本方法中黄色弦乐在左侧形成独立小簇,粉色管风琴在底部保持独立,绿色长笛与灰色簧片在顶部收拢,而中部蓝红紫簇仍有重叠但边界比左侧更集中。

解读为报告显示本方法类内更紧致、声学相似类别分离更清晰,支持音频侧适配带来平衡优化的解释,但该图是定性证据,不能读出具体数值提升,且降维投影的距离不等于原始嵌入空间的余弦距离,判断仍需回到准确率数字。

拿掉一组提示会怎样,不同样本数下趋势是否一致?

消融要回答的问题是音频专用提示与共享提示是否各自贡献且互补。比较条件同样是 16 样本设置下的平均准确率,指标方向越高越好。下表只收录正文连续原句中明确出现的数字,避免为凑宽度引入无源列。

消融条件样本设置评估指标报告的平均准确率与基线的关系
仅基线16 样本每类准确率76.58%起点
增加音频提示16 样本每类准确率77.33%高于基线
增加共享提示16 样本每类准确率提升 0.31%略高于基线
两者结合16 样本每类准确率78.35%最优

表后解释需结合机制与限制。论文报告增加音频专用提示从 76.58% 提升到 77.33%,增加共享提示带来 0.31 个百分点的增益,两者结合达到 78.35% 并超过任一单独变体,支持音频提示主要增强模态内判别、共享提示贡献跨模态对齐且互补的判断。未胜出项是单独变体都不及完整组合,说明任一组件都不能替代另一组件。未评测边界是论文没有单独报告去掉文本专用提示的结果,也没有报告共享提示长度或拼接位置的敏感性,因此不能推断文本提示无用。

数据效率趋势由样本数曲线补充,论文考察不同样本数下的准确率变化,总体随标注增加而稳步上升,尤其在类内差异大的数据集上更明显,表明方法能有效利用新增监督并在低样本区保持优势。

看图路径: 1. 先确认每个子图横轴为每类样本数,纵轴为准确率,时间范围覆盖 0 到 16 个样本;2. 再比较环境声数据集与情感语音数据集曲线的斜率差异,区分快速饱和与持续爬升;3. 最后检查 SESA 在 0 到 1 个样本处是否有波动,判断极低样本下的稳定性边界

原论文 Figure 3:Accuracy vs. number of shots across different datasets.

论文图 3。原论文 Figure 3:“Accuracy vs. number of shots across different datasets.”。

从实际像素看,该图为多子图折线布局,横轴为每类样本数从 0 到 16,纵轴为准确率(%)。可见的 ESC50 动作、ESC50、RAVDESS、SESA 与 VocalSound 子图中,环境声类曲线在 0 到 4 个样本区间快速爬升后趋平,RAVDESS 则近似直线持续上升,SESA 在 0 到 1 处有轻微回落再上升,VocalSound 在 4 到 8 区间仍有明显增益。解读为报告显示趋势总体向上但形态因任务而异,不支持每增加一个样本都有相同回报的推广,极低样本下的波动也提示需要多种子平均才能稳定比较。像素分辨率不足以精确读出每个点的数值,解读不硬写中间点的具体百分比。

哪些结论尚未被验证,阅读时不能走多远?

首先区分 3 层表述。论文直接报告的是 11 个数据集 16 样本下的平均准确率与消融数字;有限解释是音频提示增强判别、共享提示促进对齐的机制归因,得到消融与可视化的支持;未验证推测是超低样本与跨域场景下的鲁棒性,论文在结尾明确列为未来工作,包括更具挑战的极低样本与分布偏移评估,以及更参数高效的提示设计。

缺失证据不是技术错误,但限制了可承诺的范围。论文未测量误判率的类别分布、推理延迟、训练时长与内存占用,因此不能声称这些量得到改善;训练资源只描述为与单张 RTX 3090 相当的单个 GPU,没有给出具体小时数与峰值显存。统计方面只报告 3 个随机种子的平均与单次结果,没有给出标准差或显著性检验,平均提升 1.77 个百分点是否稳定需要方差信息才能判断。

相关性不等于因果,可视化中更紧致的簇与更高的准确率同时出现,但不能仅凭该图证明紧致导致了分类改善,还需结合消融中去掉音频提示后性能下降的对照来理解。总体趋势不等于每组都成立,主结果中提升幅度在不同数据集上差异明显,不能把平均增益推广为每个任务都有相同增益。

要复现这篇工作,第一步先固定什么?

复现的第一步是固定信息条件:采用 PENGI 骨干并冻结音频与文本编码器,使用固定模板生成类别原型,不做手工模板调优;每类随机采样 16 个样本,批量 16、学习率 0.05、训练 50 轮,用随机梯度下降只更新 3 组提示与缩放系数,重复 3 个随机种子并同时记录单次与平均准确率。关键超参数中论文明确给出的是融合系数 0.2、批量、学习率与轮数,未明确的是提示向量维度、初始化、缩放系数初值与学习率调度,复现时应将自己的选择写入日志并保持跨基线一致。

第二步是按依赖顺序实现计算:先实现冻结编码器的前向与余弦相似度分类基线,验证零样本性能;再加入模态专用残差加权,检查音频提示单独带来的变化;最后加入共享拼接与联合损失,验证完整组合是否复现 78.35% 附近的平均水平。数据方面按 11 个数据集的原始划分与采样协议组织,注意 ESC50 与其动作子集、城市声音与声场景的类别定义不同,不能混用标签。还需补的验证包括报告标准差、记录单 GPU 训练时间与推理开销,以及在更低样本数与跨域划分下重复消融。由于本次没有可验证的开源链接,不应假设代码或权重可下载,所有实现都应从论文文字出发独立编写。

何时值得尝试这个方法,如何一句话记住它?

当任务满足 3 个条件时值得优先尝试:类别语义描述接近但声音细节不同,例如乐器家族内部区分;每类只有十几个标注且不允许微调整个大模型;已有文本提示方法在验证集上出现声学相似类别系统性混淆。此时在冻结主干的前提下加入音频专用提示与共享提示,有望在不破坏跨模态可比性的情况下补上音频侧的判别力。若任务本身语义区分已足够、或数据充足到可以微调主干,该方法的相对收益可能会缩小。

一句话记忆是:先让音频和文本各自戴上任务专用的小修正,再用同一段共享上下文把它们拉回同一把尺子下比较。复述方法时应能说清修正发生在编码器输出之后、共享发生在相似度计算之前、梯度只进入提示参数。最后的核对动作是回到原文数字:平均 78.35% 与对 PALM 提升 1.77 个百分点是核心证据,摘要与正文对 CoCoOp 增益的 4.80% 与 4.88% 冲突应如实保留,任何超出原文的效率或因果承诺都不应加入。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总