英文题目:Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

会议身份:conference:interspeech:2026:conference-paper-id:piao26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#医疗音频 #联邦学习 #音频大模型 #少样本 #音频分类

评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Ran Piao:机构信息未能从会议 PDF 纯文本可靠映射
  • Tsai-Ning Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Martijn den Dekker:机构信息未能从会议 PDF 纯文本可靠映射
  • Linda Moonen:机构信息未能从会议 PDF 纯文本可靠映射
  • Hareld Kemps:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuan Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Aaqib Saeed:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

临床音频诊断输入为分散在各医院的呼吸与心音片段,输出是对训练未见疾病的开放词汇诊断,实际难点是标注稀缺且音频不能出院、机构间标签空间与录音条件异构。FSC先在各客户端用医学音频编码器抽取嵌入并做本地K均值聚类,生成Mountain Breeze等无医学含义伪标签以切断语义捷径。音频再经线性投影层映射为语言模型前缀词元,与支撑集和查询交错的N路K样本情景序列拼接,训练模型按上下文生成标签。三阶段流水线依次做非情景对齐、情景精炼和冻结主干的LoRA适配,全程经Flower以FedProx只同步编码器、投影层与适配器,伪标签本地生成且原音频不出域。与原型网络等纯声学度量及直接提示音频大模型不同,伪标签语义空洞化迫使模型只学声学到上下文标签的抽象映射,疾病语义接地留给预训练医学语言模型。在2路2样本设置下,FSC的准确率为71.6%,高于最强基线的准确率62.1%。该结论适用边界受限于2路2样本条件,3路与增加样本时准确率下降且长多模态上下文会稀释声学注意力,神经系统筛查等外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

本文解读的对象是 Interspeech 2026 论文提出的联邦自上下文化方法,简称 FSC。输入是分散在多家医院的临床音频,包括呼吸音心脏音咳嗽音和呼吸气流,训练阶段没有任何专家诊断标签可用。目标是在测试时只给少量带真实临床描述的支持示例,让模型诊断从未见过的查询音频。解读必须保留的关键信息是伪标签的构造方式、3 阶段分别冻结和更新谁、联邦协议传什么不传什么、评测的情景构成与指标方向,以及主结果和反证数字的适用条件。

输出是一套可核对可复述的方法说明,不做超出原文的疗效承诺。初学者可以把全篇理解为一条主线,先搞清临床音频诊断为何不能做成固定分类,再看作者如何把推理技能学习和医学语义 grounding 分开,最后核对联邦训练和评测条件是否公平。

附录:关键术语速查与符号说明

为方便初学者回查,这里集中解释术语。情景指 1 次包含支持集和查询的评测单元。N-way K-shot 指 N 个类别每类 K 个支持示例。伪标签指聚类簇的无意义名字,训练用。真实描述指测试用的医学术语。

跨模态对齐指让音频词元能被语言模型区分的过程。LoRA 指只训练小秩旁路而不动基座大权重的方法。FedProx 指考虑客户端异质的联邦优化,FedAvg 为其简单平均对照。CaReAQA 是医学音频编码器,MedGemma-4B-IT 是医学语言模型。准确率看精确命中,ROUGE-L 看词面重叠,BERTScore 看语义相近。

符号上支持集记为 S,查询记为 xq,情景标签集合记为 YE,预测为在 YE 上取语言模型概率最大者。所有数字的单位和聚合口径以正文表格和相邻段落为准,裸值不擅自加百分号,百分点差值不写成相对百分比。

已有路线为什么接不住开放词汇加隐私约束?

论文把已有工作分成 3 条路线。第一条是传统临床音频分类,把诊断压缩为封闭标签集合上的分类器,需要大量集中标注,遇到训练时没见过的概念就要重训,也无法利用临床描述的语义结构。第二条是纯声学的少样本方法,例如原型网络,它在嵌入距离上比较相似性,但不理解喘鸣或房间隔缺损这些词的医学含义,因此做不了开放词汇诊断。

第 3 条是近年的音频语言模型,例如 Pengi、GAMA、Qwen2.5-Omni 和 Audio Flamingo,它们能处理声音加文本,但通常需要结构化的音频标签演示来训练上下文能力,而这恰恰是隐私受限医院最缺的东西。联邦学习路线能让数据不出院,但以往多用于监督分类,没有解决无标签条件下如何学会情景推理。FSC 的位置是同时满足三点,不集中原始音频,不依赖真实标签,测试时能接受新的自然语言诊断描述。理解这个定位后,才能明白后文为何要用无意义伪标签和医学语言模型分工。

附录:与同输入同目标方法的可比性说明

再补一层可比性,避免把类别差异当胜负。FSC 与 Pengi、GAMA、Gemma3N、Qwen2.5-Omni-7B、Audio Flamingo 3 的比较是同输入同目标同运行阶段,都接受音频加文本的情景提示并生成诊断词,因此主结果的 9 个百分点差距是在同一 2-way 2-shot 协议下的可比差距。但训练条件不同,基线是集中式且有更广的通用预训练,FSC 是联邦且无真标签,所以这不是同监督下的胜负,而是说明在更严约束下仍能取得更高情景准确率。

与原型网络等纯声学少样本方法的差异是输入模态和目标空间不同,一个用嵌入距离,一个用语言描述,前者天然做不了开放词汇,后者需要医学语义支撑,不能直接比数字。与集中式加伪标签的比较是同伪标签不同范式,联邦高 6 个点支持分布多样性的价值,但这组对照仍是论文内的 1 次实现,还需更多种子和站点划分验证。引用这些对照时必须同时说明 N 和 K 以及是否跨数据集混合,否则数字不可比。

任务如何形式化,训练和测试的标签为何不同?

论文把任务定义为情景诊断。每个情景包含支持集和一个查询样本,支持集是 N 个诊断概念各 K 个音频加标签对,查询是一个无标签音频。模型要输出支持集中某个标签描述,形式是给定支持集和查询后在候选描述集合上取语言模型概率最大者。关键的非常规设定是训练和测试的标签来源完全不同。训练时的标签是各客户端本地聚类得到的伪标签,例如 Sun Ray 或 Ocean Wave,故意不带医学语义。

测试时的标签是真实临床描述,例如 Wheeze 或 Atrial Septal Defect,且这些疾病概念在训练中从未出现。举例说明,训练时模型看到的是 3 段声音分别标为山风和海浪,它只能学先听再对照标签文本选一个,测试时突然看到喘鸣和杂音,它要靠语言模型原有的医学知识理解词义,再套用学到的对照技能。这种训练测试标签解耦是全文的核心假设,也是后文所有设计的出发点。

附录:从声音到诊断的一句话复述口径

最后给出一句可背诵的复述口径。每个医院在本地把声音聚成 10 组并起无意义名字,用这些名字组成支持加查询的情景,先只练声音到文字的接口再只练语言模型的对照注意力,每轮只上传接口或 LoRA 参数,测试时把无意义名字换成真正的疾病描述并靠医学知识理解词义。核对时抓住 4 个动作,聚类是否本地独立,投影长度是否为 4,前 2 阶段是否冻结语言模型,评测情景是否跨数据集且标签未见。

若有人问为何不用真标签,回答是隐私和稀缺使真标签不可得,而推理技能与语义知识可以分开获得。若有人问为何 5-shot 更差,回答是原文报告的自回归注意力稀释现象,且总体趋势不等于每类都如此,需按类表核对。

FSC 全景如何走通一个样本?

从一个样本看完整链路更清楚。一段 5 秒 16 kHz 音频先进入医学音频编码器 CaReAQA 得到 1280 维嵌入,再经线性投影变成 4 个前缀词元,插入到医学语言模型 MedGemma-4B-IT 的视觉边界词元之间,与文本一起过自注意力。训练时同一情景的支持示例都按音频词元加伪标签文本串起来,查询音频放在最后,模型被训练生成正确伪标签。测试时格式不变,只是把伪标签文本换成真实临床描述,模型生成对应诊断词。联邦层面有 7 个客户端,每个数据集就是一个医院,本地做聚类和训练,每轮后上传可训练参数聚合,原始音频从不离开本地。

支持集 × 查询样本: 支持集负责提供每类 K 个带标签的示例音频,查询样本负责提供待诊断的无标签音频,二者搭配的理由是低资源诊断无法靠大量标注训练固定分类器,只能靠少量示例临场定义任务,组合后新增的作用是构成一个情景,模型通过比较查询与支持的声学相似并结合标签文本生成预测。

以下导读帮你带着问题看总览图,重点是三栏如何衔接以及哪里只传参数不传声音。

看图路径: 1. 先从左侧 A 区沿原始音频到嵌入再到聚类最后到伪标签的箭头走三遍客户端流程;2. 再看中间 B 区下方三段训练箭头分别标注只训练投影还是只训练 LoRA;3. 然后看右侧 C 区真实支持集与查询音频如何汇入同一个 FSC 模型框;4. 最后确认全图只有参数参与联邦聚合且标注了原始音频不共享

原论文 Figure 1:Overview of Federated Self-Contextualization (FSC).

论文图 1。原论文 Figure 1:“Overview of Federated Self-Contextualization (FSC).”。

该图分为三栏。左栏 A 显示 3 个客户端各自从原始音频到编码器再到嵌入聚类最后生成伪标签,下方标注原始音频不共享,中间有联邦聚合与参数双向箭头。中栏 B 是本地模型结构,支持音频和查询音频经同一编码器和投影进入多模态大模型,大模型上叠加 LoRA 小模块,输出预测并计算损失回传,下方 3 段箭头标明先做标题预训练只调映射,再做情景精修仍只调映射,最后只调 LoRA。

右栏 C 是真实推理,顶部是喘鸣杂音喘吼的真实支持集,底部是查询临床音频,都进入 FSC 模型框,框内标注情景推理技能,最终输出诊断为喘鸣。看图时不要把训练用的伪标签和测试用的真标签混为一处,它们只是共用同一输入格式。

编码器投影和语言模型各自负责什么?

每个客户端的模型由三部分组成。音频编码器是 CaReAQA,一个在多种临床音频任务上预训练过的医学音频编码器,负责把波形变成有判别力的嵌入。投影层是线性层,负责把 1280 维嵌入映射为长度为 4 的前缀词元,维度对齐到语言模型隐状态,使声音能像特殊词一样插入文本序列。

语言模型是 4,000,000,000 参数的指令调优医学模型 MedGemma-4B-IT,有两个作用,一是提供生物医学预训练带来的临床知识,用于在测试时理解真实疾病描述,二是原生支持通过视觉边界词元插入非文本嵌入,无需改结构即可做音频条件生成。组合的关键是分工明确,编码器和投影解决听得清并能被语言模型区分,语言模型解决懂医学词并会按示例推理。

上下文学习 × 音频语言模型: 上下文学习负责在不更新参数的情况下,根据支持集中的音频加标签示例推断查询音频的标签,音频语言模型负责把声音变成语言模型能读的前缀词元并提供医学语义,二者搭配的理由是只靠声学距离无法理解喘鸣等开放词汇描述,只靠语言模型又听不到声音,组合后新增的作用是把声学证据对接到自然语言描述上做开放词汇诊断。

伪标签的构造同样需要讲清分工。每个客户端把本地全部音频嵌入做 K 均值聚类,簇数取 10,每簇分配一个无医学含义的中性名。训练情景从这些簇中采样,测试时换成真名。因为伪标签没有语义,模型无法靠记忆疾病声音关联过关,只能学到把声音与上下文标签文本对照的抽象模式。

伪标签 × 聚类: 聚类负责在每个客户端本地把音频嵌入分成 10 组并给出分组编号,伪标签负责给这些组起无医学含义的名字如 Mountain Breeze,二者搭配的理由是训练时没有真实诊断标签,只能用声音相似性构造情景训练,组合后新增的作用是迫使模型学到把声音模式映射到上下文标签描述的抽象技能,而不是记住某种疾病声音。

三阶段分别更新谁冻结谁,联邦传什么?

训练分成 3 个渐进阶段,每个阶段更新的参数子集不同。第一阶段是非情景对齐,用单个音频加标签对做分类格式,训练编码器和投影,冻结语言模型,目标是让投影后的音频词元有足够判别力,能被语言模型区分不同声学组。第二阶段引入情景格式,仍只训练编码器和投影,冻结语言模型,此时编码器必须学会在支持集的相对语境下产生可比的嵌入,而不只是在固定簇上可分。

第 3 阶段冻结编码器和投影,只在语言模型上加秩为 8 的 LoRA 适配器,用情景数据专门训练音频条件下的上下文推理注意力,同时保留基座权重的医学知识。作者强调这种分离是为了防止大语言模型在音频未对齐时主导训练。联邦执行用 Flower 框架和 FedProx,近端系数为 0.01,前 2 阶段同步编码器和投影,第 3 阶段只同步 LoRA 权重,预训练语言模型权重从不传输,既省通信也保知识。伪标签完全在本地用本地嵌入独立聚类,不需要跨机构统一标签体系。

优化器用 AdamW,第一二阶段学习率 5 乘 10 的负 4 次方,第 3 个阶段 2 乘 10 的负 4 次方,联邦轮数分别为 10 轮 15 轮 10 轮。

联邦学习 × 参数聚合: 联邦学习负责让原始音频不出医院,只在本地训练后上传参数,参数聚合负责在中央服务器用 FedProx 合并各医院传来的编码器投影或 LoRA 权重,二者搭配的理由是临床音频受隐私约束不能集中且各医院录音条件病种不同,组合后新增的作用是在保护数据主权的同时,让模型见到更多样化的录音分布并学到跨机构可迁移的表示。

跨模态对齐与 LoRA 适配的先后关系是复现时最容易错的地方,必须先稳定声音接口再调语言模型。

跨模态对齐 × LoRA 适配: 跨模态对齐负责在第一二阶段只训练音频编码器和投影层,让音频词元能被冻结的语言模型区分,LoRA 适配负责在第 3 阶段冻结音频侧只调语言模型的小秩旁路权重,二者搭配的理由是若一开始就调大语言模型会压制尚未对齐的音频表示,组合后新增的作用是先稳定声音接口再专门学习音频条件下的上下文推理注意力。

数据如何划分,情景如何构造,指标朝哪边看?

实验用 7 个医学音频数据集,覆盖呼吸和心脏两个域,总计训练 17479 条测试 2983 条。包括 ICBHI 呼吸音 539 训 384 测,CIRCOR 心音 1906 训 499 测,CoughVID 咳嗽 3527 训 64 测,HFLUNG 肺音 5663 训 465 测,SPRSound 呼吸音 1256 训 154 测,COVID-19 咳嗽呼吸 4000 训 1243 测,ZCHSound 心音 588 训 174 测。联邦设置中每个数据集就是一个客户端,共 7 个机构,自然带有录音条件标签空间和样本量的异质性。所有音频重采样到 16 kHz 并切成 5 秒定长,不足补零。训练只用训练划分加伪标签,评测只用保留测试划分加真实临床标签。

评测采用 N-way K-shot 情景协议,N 取 2 或 3,K 取 2 或 5。每个情景先抽一个查询样本,再从 N 个随机临床类别各抽 K 个支持样本,且支持和查询可以来自不同数据集,以考验跨域泛化。每个条件平均 1000 个情景和 5 个随机种子。为减少疾病措辞偏置,每个疾病用三份医生验证的文本描述表示并平均。指标有 3 个,都是越高越好,准确率为精确匹配,ROUGE-L F1 看词面重叠,BERTScore F1 看语义对齐。

基线是近年音频语言模型 Pengi、GAMA、Gemma3N、Qwen2.5-Omni-7B 和 Audio Flamingo 3,都按同样情景提示评测,且基线都是集中式可访问全数据,构成对联邦无真标签方法的上限对照。

主结果在什么条件下比谁高多少?

要回答的核心问题是,在标签未见且跨机构的情景下,FSC 是否比集中式音频语言模型更准。公平条件是所有方法都用同样的情景提示格式,指标方向都是越高越好,平均对象是 14 个类别上 1000 情景乘 5 种子。下表聚焦 2-way 2-shot 准确率(%),把最强基线和 FSC 放在同一条件同一指标下比较,避免用不同 N 和 K 混谈提升。 表前比较问题是,在 2-way 每类 2 个支持示例的最常用低资源条件下,FSC 的准确率是否超过集中式基线的最佳水平,指标为准确率越高越好。

条件指标基线本方法比较对象
2-way 2-shotAccuracy62.1%71.6%Qwen2.5-Omni-7B 等集中式音频语言模型

表后解释是,论文报告 FSC 为 71.6%,最强基线为 62.1%,差距超过 9 个百分点,且 ROUGE-L 和 BERTScore 有同量级提升,支持增益来自诊断能力而非表面词面匹配。代价和反例同样明确,同表体系下 2-way 5-shot 为 68.3%,3-way 2-shot 降到 54.3%,3-way 5-shot 为 51.8%,说明类别增多时在有限上下文中区分更难。类级别上呼吸的上呼吸道感染 89.3%、细支气管炎 74.8%、喘鸣 74.3%、爆裂音 70.6%,心脏的异常心音 80.7%、房间隔缺损 74.9%、室间隔缺损 70.0%,显示两大器官系统都有捕获,但慢性阻塞性肺病 61.3% 和罗音 63.3% 相对偏低,不能把平均数当成每类都强。

需要提醒的是,百分点差值不同于相对百分比提升,71.6 减 62.1 是 9.5 个百分点,不能写成提升 9.5%。

拿掉对齐打乱阶段或换掉声音会发生什么?

消融要回答哪些组件不可少,以及联邦和声音是否真在起作用。比较条件统一为 2-way 2-shot 平均 1000 情景。下表把可部署策略的实际数字放在同一指标下,另行标明集中式伪标签等对照的性质,不把不可部署的最优值当收益。 表前比较问题是,在同一情景协议下,去掉音频、换聚合方式、换集中训练或换语言模型基座时,准确率如何变化,指标越高越好。

条件指标基线本方法比较对象
去掉音频嵌入Accuracy49.7%71.6%推理时置零音频的 FSC
聚合方式Accuracy69.6%71.6%FedAvg 对比 FedProx
训练范式Accuracy65.4%71.6%集中式加伪标签对比联邦

表后解释是,置零音频后掉到 49.7% 接近随机,支持模型确实依赖声学内容而非只靠语言先验。FedProx 比 FedAvg 高约 2 个点,论文将其解释为对 7 客户端异质漂移的缓解。联邦比同伪标签策略的集中训练高超 6 个点,论文的有限解释是本地优化加聚合起到了正则作用,避免过拟合到单一整体聚类结构,这属于支持性解释而非因果证明。

训练策略上,去掉第一阶段对齐掉 4.3 个点,投影加 LoRA 联合从头训练掉 5.7 个点,支持渐进分离的必要性。换基座时 LLaMA3.2-1B 为 49.2%、Qwen2.5-1.5B 为 50.3%,大幅低于医学预训练的 MedGemma,支持医学先验的价值。伪标签簇数 C 取 2、4、16 时分别为 57.5%、57.7%、65.4%,取 24、32 时为 60.4%、56.2%,都不如默认 10,说明过少过粗或过多过碎都不利。未胜出项必须保留,5-shot 在同 N 下反而略低于 2-shot,作者归因于自回归模型长多模态上下文稀释注意力,这与基于嵌入距离的度量学习通常多样本更好的趋势相反,复现时不要默认样本越多越好。

哪些边界没有测,哪些推论还只是可能?

论文明确报告的限制有三处。第一,情景格式敏感,训练与评测的情景配置一致时性能最好,3-way 和 5-shot 的下降表明对上下文长度和类别数敏感,推理时加长支持集不一定增益。第二,类别不均衡,上呼吸道感染和异常心音等特征鲜明的类别很高,但混合呼吸异常在 3-way 下可低至 38.9% 和 27.2%,慢性阻塞性肺病和新冠咳嗽等也偏低,总体趋势不等于每组都成立。

第三,未测量的量不能承诺,原文没有报告误诊率分布、延迟、推理开销和实际部署帧率,也没有临床医生对照试验,因此不能把准确率提升直接等同于临床可用或更省成本。联邦更优的解释是可能和待验证,相关性不是因果,还需补跨医院前瞻验证和对录音设备噪声的系统测试。资源状态方面,本次未发现来源绑定且完成 HTTPS 验证的资源,不得声称代码模型或数据已公开,复现只能按论文文字重做。

复现先做什么,需要哪些超参数和信息条件?

复现的第一步是按信息条件准备数据与划分。把 7 个数据集各当一个客户端,音频统一 16 kHz 和 5 秒定长补零,训练划分只用于本地聚类和训练,测试划分只用于情景评测,情景必须跨数据集混合采样以检验跨域。第二步是搭模型,音频编码器用 CaReAQA 出 1280 维嵌入,线性投影到 4 个前缀词元并插入 MedGemma-4B-IT 的视觉边界词元之间,语言模型基座冻结。

第三步是本地伪标签,每客户端对全部训练嵌入做 K 均值 C 等于 10,起无医学含义的中性名,构造 N-way K-shot 交错序列,支持示例为音频词元加标签文本,查询音频在最后,用交叉熵训练生成正确标签。第四步按 3 阶段执行,第一阶段非情景只训编码器和投影,第二阶段情景仍只训编码器和投影,第 3 阶段冻结音频侧只训秩 8 的 LoRA,超参数为 AdamW、第一二阶段学习率 5 乘 10 的负 4 次方、第 3 个阶段 2 乘 10 的负 4 次方、联邦轮数 10 加 15 加 10、FedProx 系数 0.01。

评测时把伪标签替换为医生验证的真实描述,每病 3 种表述平均,跑 1000 情景乘 5 种子并报告准确率、ROUGE-L 和 BERTScore。先跑通 2-way 2-shot 的 71.6% 量级,再测 3-way 和换簇数等边界,避免一开始就调大模型。

何时值得尝试,何时要谨慎?

当医院音频分散且拿不到专家标注,但测试时能提供少量带文本描述的示例,且目标是开放词汇的新疾病声音时,FSC 的思路值得尝试,因为它把难获得的标注换成了易获得的聚类结构加语言模型已有的医学知识。当类别数较多或每个类别能给很多示例时要谨慎,论文显示 3-way 和 5-shot 并未带来预期增益,长上下文可能稀释对关键声学特征的注意力。另一个适用条件是机构间录音差异大,此时联邦聚合可能带来正则收益,但若各站点高度同质或通信受限,还需补验证。

常见误解是以为伪标签越细越好或联邦一定不如集中,论文的数字恰好相反,中性簇数 10 最优,联邦在同伪标签下超过集中。归根结底,这篇工作的可复述要点是训练时学对照技能,测试时靠医学语义接地,联邦 3 阶段只是让这一分工在不共享声音的前提下得以实现。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总