英文题目:PASA: Progressive-Adaptive Spectral Augmentation for Automated Auscultation in Data-Scarce Environments

会议身份:conference:aaai:2026:conference-paper-id:37093

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#医疗音频 #数据增强 #强化学习 #音频分类

评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Ying Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Guoheng Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xueyuan Gong:机构信息未能从会议 PDF 纯文本可靠映射
  • Xinxin Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiaochen Yuan:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

呼吸音与心杂音自动听诊输入为对数梅尔频谱图,输出为正常与多类病理类别,难点在于标注稀缺、类别不平衡且正常与病理声学特性差异大,统一固定增强易损害判别性特征。本文提出的渐进自适应频谱增强(Progressive-Adaptive Spectral Augmentation,PASA)构建诊断模型与增强策略智能体的交替闭环,先由诊断模型抽取原始与增强批次语义特征并拼接类别分布形成状态,再由柔性行动者评论家(Soft Actor-Critic,SAC)采样操作与强度动作,接着由混合批量样本(Hybrid Batch-Sample,HBS)执行器落地增强,最后用验证集增益作为奖励联合优化两端。与固定变换和纯批量或纯样本自适应方法不同,HBS先用批量均匀增强积累样本置信度统计,待验证性能停滞后再按困难度分集合约样本级个性化增强。在CirCor DigiScope心杂音检测上加权准确率达0.85,在SPRSound 2023四个任务上达84.56%、70.21%、78.79%和66.07%,原文宣称相对近期最优最高提升12.6%。该结论目前仅在三个听诊数据集与EfficientNet-B4诊断主干下验证,对跨设备、跨人群与多模态的外推尚未证明。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/wangying1586/PASA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么数据少会卡住听诊自动化?

这篇解读的输入是论文正文证据与官方原图像素,目标是让刚进入语音与音频方向的研究生能复述 PASA 的做法与实验条件。必须保留的信息包括任务定义、5 步工作流、混合批量-样本 2 阶段设计、状态动作奖励的具体计算、数据集与指标、关键超参数与主要对照结果,输出是 1 篇可核对的技术解读,不做超出证据的效果承诺。

自动听诊的任务是这样:用听诊器采集呼吸声或心音,判断是否存在异常呼吸事件或杂音,帮助在缺少医生与影像设备的地区做早期筛查。白话说,模型听的不是波形本身,而是预处理后的频谱表示。英文叫 log-mel spectrogram,对数梅尔谱图,它把时间与频率展开成图像,横轴是时间,纵轴是经过人耳感知加权的频率,亮度表示能量。哮喘、喘鸣、湿啰音等病理声会在特定频带留下纹理差异,模型要学的就是这些频率模式。

卡点在于标注稀缺。医疗音频采集贵,还要专家校验,罕见病理样本更少。直接训练谱图分类器容易过拟合多数类,少数类学不充分。数据增强因此成为关键:通过变换或合成增加训练多样性。但论文指出,正常呼吸与病理声的声学特性不同,对增强的耐受不同。

对正常样本做低频强调可能更稳健,对喘鸣样本做时间遮蔽可能抹掉关键病理纹理。若对所有样本用同一固定概率与幅度的变换,就会浪费本已稀缺的数据,甚至引入有害样本。

PASA 要解决的矛盾就是效率与个性化的权衡。批量级方法省算力但一刀切,样本级方法个性化但冷启动不稳、奖励波动大、逐样本优化贵。PASA 的选择是把增强选择看作与诊断模型交替进行的决策问题,用强化学习反馈逐步留下有效增强、过滤有害增强,并用 2 阶段执行策略先省算力收集统计、再做个性化。

已有增强路线分哪几类,各自在什么假设下失效?

按同输入同目标来对照,论文把听诊增强分成 3 条已有路线。第一是生成式方法,用生成模型合成人工病理谱图再加入训练集。它的假设是生成器能可控地产生病理特征,失效点是生成过程不可控,可能造出不符合真实声学分布的样本。第二是基于先验规则的组合方法,把正常与异常音频片段按规则拼接混合。它的假设是手写规则能覆盖真实组合,失效点是受原始数据可用性限制,多样性仍不足。

第三是变换预定义方法,在训练时以固定概率开关固定变换,例如时间遮蔽、频率遮蔽。这类方法假设所有样本在所有轮次需要同样的增强,失效点是忽略样本差异与训练阶段差异。

自适应增强是另一条来自计算机视觉的路线,论文按运行粒度再分两类。批量级自适应对每个小批量用同一策略,假设批内样本增强需求相似。听诊中该假设不成立,因为正常与病理声谱特性不同。样本级自适应对每个样本分别优化,理论上更贴合,但存在冷启动缺数据、奖励波动致训练不稳、逐样本优化成本高的问题。PASA 的定位不是再加一种固定变换,而是让粒度可随训练进展切换。

下图把 4 种范式的流程差异画了出来,重点看数据流向是 1 次性离线生成还是训练中在线增强,以及有无从诊断性能回到增强决策的回路。

看图路径: 1. 先从上到下看四行:生成式、规则组合、固定变换与 PASA 的主路径差异;2. 对比前两行是一次性生成病理谱图加入训练集,第三行是在训练中随机开关固定变换;3. 看第四行是否形成从诊断模型回到增强策略学习的反馈回路;4. 观察第四行中随训练轮次从 TM 增强转向 SC 增强的标注变化

原论文 Figure 1:Illustration of the differences among (a) generative methods, (b) combination rule-based methods,…

论文图 1。原论文 Figure 1:“Illustration of the differences among (a) generative methods, (b) combination rule-based methods, (c) transfor- mation predefined methods, and (d) our PASA.”。

从像素可见,子图 a 用训练集训练生成模型,生成合成病理谱图后加入扩展训练集再训练诊断模型,是离线 1 次生成。子图 b 用训练集设计规则,生成组合病理谱图,底部还标注正常与喘鸣片段拼接,同样是先扩集再训练。子图 c 是预定义增强变换,在第 10 轮、第 20 轮到最终轮都随机以固定概率在时间遮蔽与不增强之间切换,没有反馈。子图 d 是 PASA,底部是自适应谱增强框,右侧有增强策略学习模块,诊断模型的状态回送给策略学习,策略再作用于增强谱图,形成闭环。

子图中还用叉、问号、对勾标注从时间遮蔽到谱对比度不同强度等级的演化,直观表达有害增强被过滤、有效增强被保留的过程。这张图不支持任何数值结论,只用于理解路线差异。

PASA 把增强选择形式化成什么决策问题?

PASA 把增强选择形式化为马尔可夫决策过程,英文 Markov Decision Process,简称 MDP。白话说,就是把训练过程看成一步接一步的决策:每一步看到当前情况,选一个增强动作,观察诊断变好还是变坏,再进入下一步。MDP 包含状态、动作、转移概率、奖励与折扣因子。在每个训练步,智能体收到状态,选择动作,得到奖励与下一状态,目标是最大化累积折扣奖励。论文用 Soft Actor-Critic 实现,简称 SAC,包含演员网络学策略、双评论家估计价值。

关键建模选择是把每个训练小批量当作 MDP 的一个离散时间步,而不是把每个轮次或每个样本当作步。这样做的好处是增强决策频率与模型更新频率对齐,能在训练中动态适应。每个迭代遵循状态到动作到奖励到下一状态的循环,对应后文 5 步工作流。折扣因子取 0.99,意味着更看重长期累积收益而非单步偶然提升,这对奖励波动大的听诊任务是必要的稳定手段。

举一个教学例子帮助理解,但不代表论文数值:假设当前小批量同时有正常呼吸与喘鸣样本,状态里既有模型提取的语义特征也有类别分布。智能体可能对该批量采样谱对比度中等幅度,执行后在验证集上平衡准确率略升,得到正奖励,下一状态更新为增强后的特征。例子只说明循环方向,实际采样由 SAC 输出的概率分布经分类采样决定。

五步工作流如何串起诊断模型与增强智能体?

PASA 的全景可以沿一个样本走一遍。输入是原始呼吸音频,先做重采样、去噪、归一化与长度标准化,再转成对数梅尔谱图。谱图数据集按 8 比 2 分成训练集与验证集,训练时用平衡采样器生成类别均衡的小批量。设小批量为原始谱图与标签的集合,谱图形状为单通道高与宽,标签为类别编号。

第一步是特征提取与状态构建。对当前小批量,用诊断模型倒数第二层的特征经全局平均池化得到批量语义特征,再把原始批量与增强批量的两路特征与标签类别分布拼接成状态。在第 0 步尚未增强时,增强路特征等于原始路特征。第二步是用 SAC 演员网络采样动作。动作空间是 9 种谱操作乘 5 种幅度等级共 45 种策略,9 种包括时间遮蔽、频率遮蔽、噪声注入、谐波扰动、呼吸周期拉伸、低频强调、谱对比度、不增强与随机量化。

演员输出操作概率与幅度概率,再经分类采样选出具体编号。第三步是混合批量-样本执行,把选出的增强落到谱图上得到增强批量。第四步是性能评估与奖励计算,比较用原始批量与增强批量各训练一步后在验证集上的平衡准确率之差。第 5 步是联合优化,用增强批量以交叉熵损失更新诊断模型,定期用经验元组更新 SAC 网络。

下图是论文给出的 5 步总览,阅读时先沿主数据路径走,再看反馈路径在哪里闭合。

看图路径: 1. 沿左上听诊器到音频预处理再到均衡采样器的主数据流看输入到表示的路径;2. 找到中间诊断模型分出的状态构建分支与右下验证集到奖励计算的反馈分支;3. 在左下蓝色区域确认难度感知集合与置信跟踪器如何汇入增强执行;4. 核对右侧 9 乘 5 共 45 种策略列表与 Alpha 控制的位置关系

原论文 Figure 3:PASA paradigm with five-step workflow begin with the preprocessed datasets.

论文图 3。原论文 Figure 3:“PASA paradigm with five-step workflow begin with the preprocessed datasets.”。

从像素可见,左上从听诊采集经音频预处理得到谱图,进入训练集与平衡采样器,再到诊断模型。诊断模型分出状态构建分支送往演员网络与评论家网络,演员经动作采样与 Alpha 控制选出操作与幅度,右侧列出时间遮蔽与频率遮蔽的幅度取值为 0.05 到 0.25 等,不增强幅度全零,共 9 乘 5 等于 45 种。左下是混合批量-样本执行策略,包含置信跟踪器、性能饱和检测与难度感知集合,分为易判别集、模糊集与难判别集。

右下是验证集经分类模型到性能评估再到基于平衡准确率的奖励计算,最后回送 SAC 损失做网络优化。图中绿色标注对应 5 步编号,虚线表示跟踪与检测信号,实线表示数据与增强流。这张图说明组件连接关系,不直接证明性能高低。

状态、动作与混合执行分别算什么,难度如何划分?

状态构建的输入是诊断模型对当前批量的中间特征。做法是对每个样本取倒数第二层特征做全局平均池化,英文 global average pooling,再在批量维度平均得到批量特征。状态是原始批量特征、增强批量特征与类别分布的拼接,维度为 2 倍特征维加类别数。这种拼接让智能体同时看到数据内容、增强后的变化与类别组成,避免只看单一视角。

动作采样的输入是上述状态,输出是操作与幅度的概率分布。论文明确用 9 种操作与 5 级幅度的组合,采样后得到操作编号与幅度编号。幅度对不同操作的物理含义不同,例如遮蔽类是遮挡比例,强调类是增益强度,但论文统一为 5 档离散等级以便用分类分布学习。

马尔可夫决策过程 × Soft Actor-Critic: 马尔可夫决策过程负责定义增强选择的时间结构:把每个训练小批量看作一步,给出状态、动作、奖励和下一状态的循环;Soft Actor-Critic 负责在这个结构里学习策略,演员网络输出操作与幅度的概率,双评论家估计价值。两者搭配的原因是增强效果只能从诊断性能的滞后反馈中判断,需要试错与熵正则的探索,组合后新增的作用是把离散的 45 种增强策略变成可随训练演化的可学习分布。

批量级增强 × 样本级增强: 批量级增强负责计算效率:同一小批量内所有样本共用 1 次采样的操作与幅度,只付 1 次策略采样与执行代价;样本级增强负责个性化:按每个样本的难度分别采样与执行。搭配理由是听诊中正常呼吸与哮鸣、湿啰音等病理声需求不同,单一粒度要么欠拟合差异要么冷启动不稳,组合后混合批量-样本策略新增的作用是先用批量级收集统计、待验证性能停滞再切到样本级。

混合批量-样本策略是执行部件,分 2 个阶段。第一阶段默认执行,对当前小批量内所有样本用同一采样动作做统一增强,同时用全局样本编号维护每个样本的统计,包括预测置信度、第一与第二预测的置信间隔与准确率,用指数滑动平均更新,且只从正确预测中计算以保证难度评估可靠。第二阶段在验证性能连续多轮无提升时触发,判定式比较当前轮前多轮的验证平衡准确率与历史最优加阈值的差距。

进入第二阶段后,先给状态加高斯噪声并扰动全局编号以防过拟合固定模式,再按阈值把样本分为三集:同时超过置信、间隔与准确率阈值的是易判别集,处于中等区间的是模糊集,其余是难判别集。对应动作是易判别集用高温探索、模糊集用低温保守、难判别集执行不增强零幅度。最后按每个样本的独立动作生成增强谱图并持续更新统计。

难度感知样本集 × 温度参数: 难度感知样本集负责分类样本的可增强程度,分为易判别的 DS 集、模糊的 AS 集和难判别的 IS 集,依据是累积的预测置信度、第一与第二预测的置信间隔和准确率;温度参数负责控制策略采样的探索强度。搭配原因是不同难度样本应有不同探索力度,DS 可大胆探索、AS 需保守、IS 则暂停增强,组合后新增的作用是把统计难度转化为差异化的采样行为,避免对困难样本施加破坏性变换。

需要提醒初学者:难度划分的阈值与温度都是论文报告的超参数,不是推导出的最优值。阈值选择依赖验证集表现,换数据集需重调,不能直接复用为通用常数。

九种操作与五档幅度如何构成 45 种策略?

操作集合按原文列出 9 项,幅度统一为 5 档,组合成 45 种策略。时间遮蔽与频率遮蔽的幅度在图示中为 0.05 到 0.25,不增强的幅度全零,其余操作的幅度含义见代码实现。这种离散化把连续的增强强度变成可分类学习的动作,便于 SAC 用概率分布探索。若幅度划分过粗,可能错过最优强度;过细则动作空间爆炸、探索更难。论文选 5 档是效率与表达力的折中,未报告其他档数的对照,这是可补的验证。

执行时第一阶段用 1 次采样管全批,第二阶段每样本独立采样。第一阶段还承担收集统计的职责,第二阶段才真正发挥 45 种策略的个性化。温度参数控制探索强度,易判别集高温 1.0 鼓励尝试,模糊集低温 0.3 趋于保守,难判别集直接不增强。这种设计避免对最困难样本雪上加霜,符合医疗中先保稳再求变的做法。

初学者容易把不增强看作无用动作,实际上它在早期探索与困难样本保护中很关键。使用率从早期的约 8% 降到后期的约 2% 到 4%,说明模型学会在多数情况下做增强,只在必要时保留原图,这本身就是学到的策略。

奖励怎么算,两个网络何时更新、梯度从哪里来?

奖励计算要回答增强是否有训练收益。做法是分别用原始批量与增强批量对诊断模型各训练一步,再在验证集上测试,奖励等于增强分支的平衡准确率减去原始分支的平衡准确率。平衡准确率是对每个类别分别算召回再平均,适合类别不均的听诊任务。奖励为正表示这次增强带来增益,为负表示有害。这种设计把增强选择与诊断目标直接对齐,但代价是每步要多做评估,计算开销高于固定增强。

状态更新是用原始批量与增强批量的新特征按同样拼接方式得到下一状态,与当前状态、动作、奖励组成经验元组存入回放池。网络优化是联合但不同频:诊断模型用增强批量以交叉熵损失每步更新,SAC 网络定期用标准的演员-评论家损失更新。论文未给出 SAC 每几步更新 1 次的具体频率与损失系数的完整推导,只说明按标准 SAC 做法与周期性更新,这是复现时需要对照开源代码确认的缺项,不能从模型名推定实现。

状态构建 × 奖励计算: 状态构建负责把诊断模型的语义特征与类别分布拼成智能体可读的输入,包含原始批量与增强批量两路特征;奖励计算负责把增强的好坏变成标量信号,用增强后与原始批量各训练一步再在验证集上测得的平衡准确率之差表示。搭配原因是状态只描述当前数据与模型条件,奖励才给出增强是否有益的任务反馈,组合后形成状态到动作到奖励到下一状态的闭环,使策略能过滤有害增强。

训练中的阶段切换在轮次级别监控。每个轮次后在验证集上评估诊断模型,若连续耐心轮数无超过历史最优加阈值的提升,则从第一阶段切到第二阶段。论文报告的切换在所展示的任务中发生在第 28 轮附近,但这是该任务与该划分下的观测,不是通用切换点。切换后训练集精度可能继续走高而验证精度保持稳定,说明样本级个性化在抑制过拟合,这一点在后文学习动态图中可核对。

单步计算如何组织,梯度与监督从哪里来?

把单步计算按顺序写清有助于避免把奖励当作可微损失。设当前小批量为原始谱图集合,状态由原始与增强两路特征加类别分布组成。演员以前馈方式输出操作与幅度的概率,不直接输出谱图。执行部件按阶段把概率变为具体增强:第一阶段全批共用,第二阶段按难度分别采样。增强批量送入诊断模型算交叉熵损失,梯度只更新诊断模型,不回传给增强操作本身,因为谱变换多为不可微或不需微分。

监督来源有两路:诊断模型的监督来自标签的交叉熵,策略的监督来自验证集平衡准确率之差构成的奖励,经 SAC 的演员-评论家损失更新。经验元组存入回放池后周期性采样,打破时序相关。原文未给出 SAC 损失的具体系数与更新间隔的完整公式,复现时以代码为准,不从 SAC 名称推定实现细节。

一个常见误解是把验证奖励当作测试分数。验证奖励只用于选增强,测试分数才是最终报告。两者划分不同,若验证集泄漏测试分布,增益会被高估。论文用 8 比 2 划分训练与验证,测试用官方测试集,五折平均报告,这一点在对比时必须核对阶段一致。

在哪些数据、划分、模型与指标上测,条件是什么?

论文在 3 个呼吸声数据集上做实验。CirCor DigiScope 侧重心杂音检测,SPRSound 2022 与 SPRSound 2023 包含事件级任务与记录级任务,记为 T1-1、T1-2、T2-1、T2-2。评估指标包括加权准确率、英文 weighted accuracy 简称 W.acc、非加权平均召回率 UAR 与 Score 百分比。Score 按数据集定义的综合分数使用,方向都是越高越好,但不同任务的类别数与聚合对象不同,数值不能跨任务直接比较,百分点差与相对百分比也需区分。

实现条件按原文交代:用 PyTorch 在 RTX 8000 上运行,随机种子 42,诊断模型用 ImageNet 预训练的 EfficientNet-B4,优化器为 AdamW,学习率 1e-4,批量 32,早停耐心 20。SAC 学习率 3e-4,折扣因子 0.99,目标网络更新率 0.005,回放池 5000。混合策略的置信、间隔与准确率阈值以及温度参数在正文与超参数小节给出,所有结果为五折交叉验证平均。其他细节指向附录,当前证据未包含附录全文,复现时需以代码为准。

对数梅尔谱图 × 平衡采样: 对数梅尔谱图负责把呼吸音频变成保留频率模式的 2 维表示,是诊断模型与增强操作的直接对象;平衡采样负责在类别不均时让每个小批量中类别分布均衡。搭配原因是听诊数据稀缺且罕见病理类更少,若不平衡采样,状态统计与奖励都会被多数类主导,组合后使增强策略能在少数类上得到充分试错与评估。

下表整理论文报告的超参数关键取值,便于复现时先对齐信息条件,表中数值与单位保留原文写法,阈值符号与温度符号按原文含义使用。

条件指标基线本方法比较对象
SAC 优化学习率与折扣标准设置3e-4,0.99回放池 5000
HBS 难度划分置信与间隔阈值待调置信 0.8 与 0.5,间隔 0.5 与 0.1准确率 0.7 与区间 0.3 到 0.7
HBS 探索温度参数固定探索DS 为 1.0,AS 为 0.3IS 为不增强
诊断训练优化器与批量预训练主干AdamW,1e-4,批量 32早停耐心 20
阶段切换耐心与阈值单阶段连续无提升切阶段改进阈值 0.001

表后需要说明代价与边界:这些超参数是在 SPRSound 2022 的 T2-2 上做敏感性分析得到的阶段性最优,例如只用置信阈值时 0.8 与 0.5 最好,加入间隔后 0.5 与 0.1 最好,再加入准确率后 0.7 与 0.3 到 0.7 最好,温度 1.0 与 0.3 最好。换数据集或换主干时最优点可能移动,不能当作免调常数。论文未报告训练时长与推理延迟的完整预算,这是评估部署成本时的缺项。

数据划分与采样细节如何影响可比性?

数据与协议的细节决定数字能否对比。论文说明谱图数据集按 8 比 2 划分训练与验证,训练中用平衡采样保证小批量类别均衡,测试在官方测试集上进行,结果为五折交叉验证平均。指标中平衡准确率对每类召回平均,加权准确率按数据集定义加权,UAR 为非加权平均召回,Score 为百分比综合分。同一数值在不同指标下含义不同,不能因数值相近就视为同一指标。

跨论文对照时需注意预处理差异:重采样率、去噪、归一化与长度标准化都会改变谱图纹理,若对照方法预处理不同,分数差可能部分来自预处理而非增强。因此最可信的是论文内同预处理同主干的消融,其次才是跨论文对照。记录级任务与事件级任务的聚合对象不同,记录级要对整段录音判决,事件级对每个呼吸周期判决,难度与样本量都不同,跨任务比较分数高低没有意义。

硬件预算按原文为 RTX 8000,但未报告具体卡数与时长。复现时应记录每轮耗时、总训练时长与 SAC 额外开销占比,否则无法判断混合策略省下的样本级代价是否值得。

主结果测什么,与谁比,关键数字支持什么判断?

主结果要回答的比较问题是:在相同诊断主干下,只改增强策略能否提升稀缺听诊数据的分类分数。公平条件是论文用同一 EfficientNet-B4 主干做基线与消融,强调 PASA 的提升来自纯增强改进而无结构修改;与外部最优方法的比较则依赖各自论文报告的分数,数据划分与预处理不完全可控,阅读时应把同主干消融看作更公平的证据,把跨论文对照看作参考。指标方向都是越高越好。

在 CirCor DigiScope 杂音检测上,论文报告 PASA 达到 0.85 的加权准确率与 0.73 的 UAR,超过所列近期方法的 0.83 与 0.71。在 SPRSound 2022 上,PASA 在 T1-1 与 T2-2 达到 90.60% 与 64.29%,高于所列 Hu 方法的 89.46% 与 62.93%,在 T1-2 与 T2-1 为 70.39% 与 75.71%,略低于该对照,论文解释为多分类复杂性需要更多样数据做个性化。在 SPRSound 2023 上 4 个任务全部最优,论文称提升最高达 5.28%,结论称相对近期最优最高有 12.6% 的改进,两个数字对应不同基线与任务,引用时需注明对照对象,不宜混为同一口径。

下图展示 SPRSound 2022 的 T2-2 的混淆矩阵与 ROC 曲线,用于核对罕见混合类与低质量样本的行为,而非只看平均分。

看图路径: 1. 先看左侧混淆矩阵的行是真实标签、列是预测标签,对角线为正确数;2. 再看右侧 ROC 图的横轴是假正率、纵轴是真正率,每条曲线对应一个类别;3. 对比 Poor Quality 与 CAS 和 DAS 曲线的 AUC 数值差异;4. 检查 CAS 与 DAS 混合类样本数很少时曲线的阶梯形态

原论文 Figure 4:Confusion matrices and ROC curves on the SPRSound 2022 dataset for Task 2-2.

论文图 4。原论文 Figure 4:“Confusion matrices and ROC curves on the SPRSound 2022 dataset for Task 2-2.”。

从像素可见,左侧混淆矩阵横轴为预测标签,纵轴为真实标签,类别包括正常、低质量、CAS、DAS 与 CAS 和 DAS 混合。对角线为正确数,例如正常 323、低质量 7、混合 14,非对角线显示正常与 DAS 之间互混较多。右侧 ROC 横轴假正率、纵轴真正率,图例给出正常 0.757、低质量 0.901、CAS 0.717、DAS 0.668、混合 0.806。低质量曲线最靠左上,混合类在仅 36 个样本下仍达 0.806,支持论文关于罕见类与难样本受益的判断。但 DAS 的 0.668 明显偏低,说明方法并未在所有类上都胜出,这是必须保留的反例。平均分提升不等于每类都提升。

下表选择原文 SPRSound 2023 的对照矩阵,保留最近对照与 PASA 的可运行策略,避免只放数据集说明表。

MethodT1-1T1-2T2-1T2-2
Hu et al. (Hu et al. 2025)76.9363.1866.1551.21
PASA84.5670.2178.7966.07

表后解释主要收益与代价:PASA 在该表的 4 个任务上分别为 84.56%、70.21%、78.79% 与 66.07%,均高于同表所列方法,支持自适应增强在数据稀缺下能为不同声学特性找到更合适策略的判断。代价是该表跨论文对照的训练细节并不一致,且 PASA 需维护 SAC 网络、回放池与样本统计,训练成本高于固定增强。未胜出项在另 1 数据集的 T1-2 与 T2-1 已经出现,说明多分类与记录级任务的个性化仍受数据量限制,不能把单表最优推广为全任务必胜。

定性结果还显示了什么,罕见类行为能否复述?

除平均分外,论文用混淆矩阵与 ROC 强调罕见与难样本的行为。在 T2-2 中,混合的 CAS 与 DAS 类样本很少,仍取得 0.806 的 AUC,低质量类达 0.901,正常类正确 323 个且随机错误较少。这些定性结果支持自适应增强对少数类的帮助,因为固定增强容易在多数类上过拟合而忽略少数类。但 DAS 单类的 0.668 提醒我们个性化并非万能,某些病理纹理可能对现有 9 种操作都不敏感,或需要更精细的幅度划分。

复述时应带条件:罕见类受益的结论限于该数据集的该任务与该划分,不能推广为所有罕见病都受益。若要在新数据上验证,应先看类别样本数与基线混淆模式,再看引入 PASA 后对角线与关键互混项的变化,而不是只看总分。若混合类样本数极少,AUC 的置信区间会很宽,单点 0.806 不宜过度解读。

另一点是操作偏好的可解释性。正常样本偏好低频强调、噪声注入与呼吸周期拉伸,目的是更稳健且保持自然;喘鸣样本偏好谱对比度与谐波扰动,目的是放大病理声学特征。这些偏好来自使用率统计,是事后观察而非先验规则,引用时应说明是学习到的趋势,换数据可能变化。

拿掉自适应或混合后会怎样,学习过程如何演化?

消融要回答的比较问题是:固定增强、批量级学习、样本级学习与混合策略各自贡献多少,公平条件是同主干同数据同指标,只改增强执行方式。论文在 SPRSound 2022 的 4 个任务上设基线为 EfficientNet-B4,固定增强选 PASA 最常用操作以 0.5 概率应用,批量级只做批量学习,样本级只做样本学习,PASA 用混合策略。复杂度从大 O 上看,基线与固定增强为样本量级,批量级多一项批量数乘 SAC 代价,样本级多一项样本数乘 SAC 代价,混合为两者按阶段比例加权。结果是固定增强比基线高 0.5-2%,批量级比固定增强再高 1%,样本级表现好但成本高,混合在更低成本下取得最好分数。

下图展示 T2-2 的学习动态,用于核对切换时机、难度集合演化与操作偏好变化三件事。

看图路径: 1. 在子图 a 中沿横轴轮次找到 28 附近的切换虚线,比较切换后三条验证曲线的走向;2. 在子图 b 中看 DS、AS、IS 三条比例曲线随轮次的升降与交叉点;3. 在子图 c 热力表中按列对比 1-10 轮与 41-50 轮偏好的数值变化;4. 确认被抑制的操作在后期是否稳定处于低使用率

原论文 Figure 5:Learning dynamics analysis on SPRSound 2022 dataset for Task 2-2.

论文图 5。原论文 Figure 5:“Learning dynamics analysis on SPRSound 2022 dataset for Task 2-2.”。

从像素可见,子图 a 横轴轮次、纵轴精度,虚线标出切换轮次 28。切换前三者训练与验证曲线接近,切换后批量级与样本级的训练验证差距拉大,PASA 验证曲线保持稳定而训练曲线继续上升,支持混合策略抑制过拟合的判断。子图 b 横轴轮次、纵轴比例,初期难判别集占主导,模糊集快速下降,易判别集从接近零持续上升到 0.9 以上,说明统计积累使越来越多样本变得可增强。

子图 c 为操作使用率热力表,横轴为轮次分组,纵轴为操作,早期分布较均衡,后期谐波扰动从 0.229 升到 0.273、谱对比度从 0.208 升到 0.270,而时间遮蔽、低频强调与频率遮蔽降到 0.03 左右,说明有害操作被抑制、有效操作被保留。但像素不能精确读出每轮确切步数时不应硬写,只报告分组趋势。

下表整理消融对照的数字结果,单位保留在表头 Score(%) 中,数据格保留原文裸值写法,不逐格追加%,重点是基线与可运行策略在 4 个任务上的对照。

条件T1-1 Score(%)T1-2 Score(%)T2-1 Score(%)T2-2 Score(%)
Base89.4266.1873.9962.57
Base+FA90.0568.8073.8162.80
Base+BO90.3968.7074.1163.62
Base+SO90.5869.3574.4763.65
PASA90.6070.3975.7164.29

表后必须指出反证与边界:T1-2 与 T2-1 未胜出表明多分类下样本级个性化仍需更多样数据;超参数最优组合随任务变化,例如温度偏大或偏小都会回落;学习动态的切换轮次与难度演化只在 T2-2 展示,不宜推广为所有任务都在 28 轮切换。总体趋势成立不等于每组每步都成立。

哪些验证还没做,哪些结论不能超出证据?

论文直接报告的是 3 个听诊数据集上的分数提升与学习动态趋势,有限解释是病理声需要个性化增强、混合策略平衡了效率与个性化。未验证的推测包括向多模态与其他医学领域的迁移潜力,原文只在结论展望中提出,没有给出跨模态实验,不能当作已证效果。

缺失的证据不是技术错误,但复现与选型时要明确:原文未完整报告训练时长、推理开销、输出帧率与实际延迟,也未测量误判率在临床阈值下的代价,因此不能承诺延迟或临床风险得到改善。奖励依赖验证集平衡准确率,若验证集本身小或分布偏移,策略可能过拟合验证划分。难度统计依赖正确预测的滑动平均,早期样本少时多数样本落在难判别集,个性化启动较晚,这正是需要第一阶段的原因。

相关性不等于因果:操作使用率上升与分数上升同时出现,支持该操作有益的判断,但不能证明单靠该操作就能复现全部增益。消融中固定增强用的是 PASA 最常用操作,本身已沾了自适应搜索的光,与完全手选固定策略的公平性需留意。引用 12.6% 与 5.28% 时必须同时注明基线与任务,避免把不同口径的最大值当作平均提升。

复现先做什么,代码与权重处于什么状态?

资源状态是正文开源声明的唯一依据,当前代码链接本次可达,可写当前可用与已公开。论文给出代码地址为 github 上的 PASA 仓库,复现第一步应先拉取该仓库,对照 5 步工作流确认数据预处理、8 比 2 划分、平衡采样、状态拼接、45 种策略定义、混合 2 阶段切换与奖励评估的实现是否与正文一致。

第二步对齐信息条件:诊断主干用 ImageNet 预训练 EfficientNet-B4,AdamW 学习率 1e-4,批量 32,早停耐心 20,种子 42;SAC 学习率 3e-4,折扣 0.99,目标更新 0.005,回放池 5000;混合策略阈值与温度按原文最优组合起步,再在验证集上小范围重调。第三步先跑同主干的基线、固定增强、批量级与样本级消融,确认混合策略的增益与成本,再跑跨数据集主结果。

需区分代码开源、权重下载与系统可运行:论文只声明代码公开,未在证据中说明是否提供预训练权重下载或一键可运行系统,因此复现预算应包含从头训练诊断模型与 SAC 网络的时间。若附录缺失,超参数细节以代码为准,遇到原文表头与正文算术冲突时应标注冲突而不自行编造划分或聚合口径。

何时值得尝试 PASA,还需补哪项验证?

当任务同时满足三点时值得尝试:音频数据稀缺且类别不均,正常与异常声音的频谱特性差异大,计算预算允许在训练中维护额外的策略网络与样本统计。PASA 的价值在于把增强从 1 次性手选变成随训练反馈演化的决策,特别适合罕见病理类容易被固定增强抹掉的场景。若数据充足或增强需求高度一致,固定增强可能已够,引入强化学习反而增加不稳定。

复现后还需补的验证包括:在新划分下重复五折以确认方差,报告训练时长与推理延迟以评估部署代价,在临床更关心的灵敏度与特异度阈值下评估误判代价,以及测试换主干与换采样率时阈值与温度是否仍稳健。教学上记住一条可复述的主线:谱图输入经平衡采样成批,诊断特征与类别分布拼成状态,SAC 采样操作与幅度,混合策略先统一增强收集统计、待验证停滞再按难度个性化,用验证增益做奖励,最后联合优化诊断与策略网络。抓住这条线,就能不依赖修辞讲清方法。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总