英文题目:DENOISING OF LUNG SOUND RECORDINGS WITH A TIME-FREQUENCY U-NET

会议身份:conference:eusipco:2026:conference-paper-id:0000301

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#医疗音频 #时频分析 #单通道 #生理信号 #音频修复

评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Petry, Lisa:机构信息未能从会议 PDF 纯文本可靠映射
  • Moliner, Eloi:机构信息未能从会议 PDF 纯文本可靠映射
  • Järvensivu, Tuomas:机构信息未能从会议 PDF 纯文本可靠映射
  • Välimäki, Vesa:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

肺音去噪输入为单通道听诊波形混合心音摩擦与环境噪声,输出为干净肺音波形,难点在于干扰与肺音频带重叠且呼吸能量起伏导致分段信噪比剧烈波动。所提系统先经短时傅里叶变换将波形映射为复数时频谱并堆叠实虚部,为同时估计幅度与相位提供可学习的实值输入。接着NCSN++型编码解码网络以残差卷积提取局部纹理并以瓶颈自注意力建模呼吸周期上下文,直接预测增强谱的实部与虚部。预测谱重组为复数信号后经逆短时傅里叶变换恢复去噪波形,训练则以干净肺音与心音摩擦粉白噪声按独立信噪比合成的配对数据监督波形均方误差。与仅掩蔽幅度谱保留含噪相位或直接建模波形的方法不同,该复数谱预测兼顾谱细节与长时吸气暂停动态,因而在高噪下残留更少。在16例留存人体模型录音评测下,STFT-U-Net的ΔSNR为20.06 ± 1.20,高于Autoencoder的ΔSNR 18.95 ± 0.58。该结论适用边界限于心音摩擦及粉白噪声三类合成混合,对真实病理杂音与设备差异尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

肺音为什么难录干净,临床又为什么需要去噪?

肺音在这里被明确限定为在胸壁处听到或记录到的呼吸音,不包括气管音等其他部位的泛化呼吸音。对于刚进入音频领域的研究生,可以把肺音理解为一种弱而间歇的生理声:吸气时能量较强,呼气与呼吸间歇时能量很弱,临床关心的胸壁频段主要集中在中低频。

数字听诊器让肺音可以被录制、回放和共享,也让基于人工智能的自动分析成为可能。但录制几乎不可避免地混入干扰,论文把单通道记录建模为干净肺音、心音干扰、听诊器摩擦干扰和背景噪声的加和。

去噪在这里是预处理步骤。如果心音的低频搏动、探头按压滑动的摩擦声和环境噪声不去掉,后续的异常音检测和疾病辅助判断都会受到影响。传统滤波、小波和经验模态分解方法被报告为效果有限,深度网络在声学去噪中被寄予更高期望。

更大的困难是缺少干净真值。真实世界拿不到同一段肺音的对齐干净版与含噪版,因此全文方法必须同时解决三件事:用什么表示让噪声可分,用什么数据制造可监督的配对,用什么评价口径说明改善真实可信。

肺音去噪与心音去噪各走了哪条路?

论文先把肺音去噪分为去除外部噪声和心肺分离两类。经典路线包括滤波器、小波去心音噪声和经验模态分解加分形维数滤波,原文评价为成功有限。深度路线在肺音侧列举了 3 条可对照的工作,分别处理心音与医院环境声、新生儿哭声与呼吸机噪声、以及双通道噪声参考下的心肺增强。

心音去噪被写成相对更成熟的参照,包括带双向长短时记忆跳连的时域 U-Net、基于短时傅里叶变换输入的复数谱 U-Net,以及只用幅度谱的掩蔽 U-Net。这些工作的输入表示、噪声类型和监督目标并不完全相同,不能直接当作同条件胜负。

论文与它们的关键区别被明确表述为数据策略不同。以往多用含噪或标注不一的真实数据,而本工作用高保真医学仿真人体模型的干净肺音做监督训练,再用合成混合模拟真实多噪声条件,并进一步在真实教学库肺音上检验泛化。

理解这一点很重要。后文所有改善数字都依赖于合成混合的构造方式,脱离混合协议去谈绝对性能会误导初学者。相关工作的价值是提供架构迁移线索,而不是提供可直接对比的排行榜。

任务到底是什么:从一条波形中恢复哪一部分?

形式化地说,记长度为 N 的数字听诊器记录为含噪波形,干净肺音为目标波形,心音与摩擦为两路干扰,背景噪声为环境分量,则观测满足加性混合。去噪器是从 N 维到 N 维的映射,输入是混合波形,输出是对干净肺音的估计。

训练目标是估计波形与真值波形之间均方误差的期望,误差按样本数归一化。学习依赖在于配对数据:真实采集无法提供对齐的干净与含噪版本,因此论文采用合成混合路线,用干净肺音加外部干扰按设定信噪比叠加,制造出可监督的输入输出对。

需要提前建立的判断是,信噪比在这里既是混合控制量,也是评价分箱量。混合时为每个噪声分量独立设定目标信噪比,评价时则按 1 秒段内实际干净与含噪能量重新计算段级信噪比并分箱。

举一个教学例子。若某 1 秒正好落在呼吸间歇,肺音能量很低,即使名义混合条件不变,该段的实际信噪比也会更低。去噪器在该段更容易留下残留噪声或过度衰减,这就是后文表格必须按段级信噪比分箱的原因。

全景:一个样本如何走完波形到波形?

对一条 1 秒或 15 秒的含噪肺音,处理链是固定 3 步。第一步用短时傅里叶变换把波形映射为复数时频谱,论文把实部与虚部沿通道维堆叠,使后续网络可以用实值张量运算处理复数信息。

第二步用核心网络处理该谱,预测增强后谱的实部与虚部,而不是只预测幅度掩蔽。第 3 步把预测的实部虚部重新组合为复数谱,再用逆短时傅里叶变换恢复为去噪波形。短时傅里叶变换与逆变换在模型中是可微的,因此训练可以直接从原始波形端到端进行。

核心网络采用为图像生成提出的 NCSN++ 结构并按语音增强的适配方式改造,整体是编码器解码器的 U-Net 形态。它由 2 维卷积加残差连接构成,瓶颈处放自注意力模块捕捉跨时间跨频率的长程依赖,编码器与解码器之间有跳连,全程使用 Swish 激活。

这种安排的原文理由是时频域对该任务更合适,且残差加瓶颈注意力的结构对保留谱内容与时间动态有效。参数量上原文提到所提模型略大于其他对比结构,这一点在解释优势时不能忽略。

短时傅里叶变换 × 逆短时傅里叶变换: 短时傅里叶变换分工是把 1 维波形切帧加窗映射为随时间变化的复数频谱,让心音低频、肺音中频和摩擦宽带在时频格点上分开;逆短时傅里叶变换分工是把网络预测的实部与虚部重新组合为复数谱并叠加重建为波形;二者搭配的理由是网络只在谱域做增强而监督损失仍写在波形域,组合意义是实现从原始波形输入到波形输出的端到端训练。

网络在谱上做了什么:直接预测复数谱意味着什么?

直接预测复数谱意味着网络的输出是每个时频格点的实部值与虚部值,逆变换时幅度和相位都被重建。对比之下,幅度谱掩蔽路线只预测一个乘性掩蔽,逐点乘回含噪幅度谱,相位直接沿用含噪相位。

用白话说,前者是把脏谱重画一遍,后者是给脏谱加一个橡皮章并保留原来的相位底稿。低噪声时含噪相位接近干净相位,掩蔽路线可以凭借保留相位获得不错的重建。高噪声时相位本身已被严重污染,只做幅度相乘就不够。

论文的对比结果支持这一解释:复数谱的 2 个模型整体优于时域模型,而只用幅度谱的模型在低噪声段尚可、高噪声段明显退化。但这仍是有限解释而非因果证明,因为各模型的容量、跳连和注意力配置并不完全相同。

对初学者而言,关键操作是核对每个模型的输入表示与输出形式。时域模型直接吃波形吐波形,复数谱模型吃堆叠实虚谱吐估计实虚谱,幅度谱模型吃幅度谱吐掩蔽再乘回原谱。表示不同,相同的波形均方误差对其约束路径也不同。

复数频谱 × 幅度谱掩蔽: 复数频谱分工是同时保留幅度与相位,网络直接预测增强后每个格点的实部与虚部;幅度谱掩蔽分工是只预测乘性掩蔽并乘回含噪幅度谱,相位沿用含噪相位;搭配比较的理由是低噪声时原相位已接近干净相位而高噪声时相位本身被污染,组合意义是解释复数谱方法在低信噪比下更稳而纯幅度掩蔽在高噪声下退化更明显。

残差与注意力各自解决谱上的哪部分困难?

残差卷积解决的是局部时频结构的特征提取与深层退化问题。肺音在谱上表现为随呼吸起伏的带状能量,心音是低频的周期性冲击,摩擦是宽带的不规则能量,环境粉红与白噪声是弥散的底噪。2 维卷积加残差连接让网络在多个尺度上提取局部纹理,同时通过恒等通路缓解优化困难。

瓶颈自注意力解决的是长程上下文问题。判断当前帧是吸气峰还是呼吸间歇,需要看到前后秒级的变化,而不仅是当前几十毫秒。论文的定性观察是,多个对比模型能压住肺音频带外的频率,但在吸气与呼气之间的暂停处留下残留噪声,说明时间上下文建模不足。

跳连的作用也被点名。去掉跳连倾向的自编码器会过度衰减,丢失肺音的特征结构,说明跳连对保留重要信号结构关键。把三者连起来,一个样本的命运是明确的:编码器下采样抽取多尺度谱特征,瓶颈注意力补上长程节律,解码器经跳连融合浅层细节并输出干净谱。

所提模型更好地保留了吸气峰与安静暂停,原文将其归因于残差卷积加瓶颈自注意力的组合。但原文同时提醒参数量略大也可能贡献了性能,因此不能把全部增益都归于注意力机制。

残差卷积 × 瓶颈自注意力: 残差卷积分工是在编码器与解码器各尺度提取局部时频纹理并保留梯度通路,瓶颈自注意力分工是在最压缩表示上建立跨时间跨频率的长程依赖;搭配理由是肺音吸气峰与呼吸间歇需要同时看到局部谐波结构和秒级节律,组合意义是既抑制肺音频带外残留噪声又保留吸气峰与静默暂停的时间动态。

没有真实配对时,训练数据是如何造出来的?

训练是监督的,但监督对来自合成混合。干净肺音主要来自仿真人体模型数据集,只用其中已分离的肺音与心音记录,每类各有数十段,每段 15 秒,覆盖不同肺部与心脏事件以及男女仿真。摩擦噪声是作者在消声室用数字听诊器自录的数据,通过过大压力、不同皮肤干湿状态和不同衣物摩擦振膜产生。

所有音频先重采样到 4 千赫以匹配肺音带宽,再按频带过滤并按最大绝对值做幅度归一化。目的是让肺音保留临床相关的中频、心音保留低频,并消除录音增益差异。摩擦记录被切为 1 秒不重叠片段使用,以保证训练与测试的噪声样本可以独立抽取。

混合采用分层策略。对每段干净肺音,把心音与摩擦从随机起点循环到同样长度,白噪声与粉红噪声直接生成到所需长度并合并为环境分量。然后按心音、摩擦、环境 3 个独立信噪比依次定标叠加,每次相对当前混合达到目标信噪比,最后再归一化得到含噪信号。

训练时每个噪声分量的信噪比在负 10 分贝到正 10 分贝之间均匀采样,分辨率 0.2 分贝,训练样本从长记录中随机裁 1 秒片段以增加时间上下文多样性。优化用批量 10 的 Adam,学习率十的负 5 次方,损失为干净与去噪波形之间的均方误差。数据划分按疾病类型、听诊位置和摩擦类型分层,多数基础肺音用于训练,少数留作验证与测试。

分层混合 × 段级信噪比: 分层混合分工是按心音、摩擦、环境 3 个分量依次定标并叠加到干净肺音上,用于制造可监督的配对数据;段级信噪比分工是在 1 秒窗口上按实际肺音能量重新计算真实难易度;搭配理由是同一条 15 秒记录内肺音能量起伏会让名义混合信噪比失真,组合意义是训练时均匀覆盖生成信噪比而评价时按实际段级信噪比分箱报告。

评价如何保证公平:对比了谁,指标向哪边看?

比较问题是:在相同的合成多噪声混合下,复数时频 U-Net 是否比已有的时域与谱域基线更准更稳。公平条件是所有模型用同样的人工混合数据在同样条件下实现与训练,谱模型统一用 127 点汉恩窗、跳长 32 计算短时傅里叶变换。

对比对象包括 1 维全卷积自编码器、1 维带跳连 U-Net、1 维带双向长短时记忆跳连的 U-Net、1 维瓶颈 Transformer 的 Uformer、复数谱 2 维 U-Net、幅度谱 2 维掩蔽 U-Net,以及所提的带残差与瓶颈自注意力的复数谱 U-Net。评价指标有 3 个方向:信噪比改善越高越好,均方根误差越低越好,百分比均方根差异越低越好。

所有指标都在 1 秒不重叠窗口上计算。测试用留出的仿真人体模型肺音,每段 15 秒切为 1 秒段,同一条记录内噪声参数保持恒定以模拟临床检查中噪声相对稳定的情形,再按实际段级信噪比分箱报告。真实泛化评价用教学库的低背景肺音加另一心音库的心音加留出摩擦集,按同样流程生成干净与含噪对。

下表先固定数据侧的可核对条件,避免把不同采样、频带和归一化下的数字直接比较。若采样率与频带不一致,任何改善都可能是带宽不同带来的假象,因此必须先核对预处理是否一致。

信号类型原始时长与采样重采样目标频带幅度处理与用途
肺音与心音分离记录15 s,22 050 Hz4 kHz200 Hz to 1000 Hz 肺音最大绝对值归一化,监督训练
心音干扰记录15 s,22 050 Hz4 kHz50 Hz to 250 Hz 心音最大绝对值归一化,按信噪比叠加
摩擦自录噪声8 min,切 1 秒片段4 kHz同肺音前端流程最大绝对值归一化,独立测试集
真实检验肺音教学库低背景片段4 kHz200 Hz to 1000 Hz 肺音心音换库,检验泛化代价

该表的主要收益是把采样、带宽和幅度归一化固定下来,使后文的信噪比改善与重建误差只反映去噪能力而非前端差异。具体代价是重采样与带通会丢掉高频细节,原文明确指出胸壁肺音临床相关频段在中低频,气管音可达更高频率,因此该结论不直接推广到气管音或婴儿等未覆盖的记录类型。

主结果:在合成混合上谁的改善最大、误差最低?

在心音、摩擦、环境 3 类噪声以相等信噪比同时叠加的最坏情形下,论文报告所提复数时频 U-Net 在全部段级信噪比箱中取得最大的信噪比改善和最低的均方根误差与百分比差异。趋势上复数谱模型整体优于时域模型,幅度掩蔽模型在低噪声时尚可但随噪声增大退化明显。

另一端是自编码器在高信噪比段甚至出现负改善并过度衰减,说明无跳连结构容易丢失信号结构。为避免逐行复述大表,这里用论文图注中给出的同一个 15 秒示例的平均指标做可运行的对照,该示例的 3 类噪声输入信噪比均为 5 分贝,指标为整条记录所有 1 秒段的平均。

比较问题是:在完全相同的输入与平均口径下,各模型谁保留了更多肺音能量并压住了噪声。公平条件是同一条含噪输入与同一条干净参考,指标方向为信噪比越高越好、均方根误差与百分比差异越低越好。下表只是一个示例记录的平均,不能代替按段级信噪比分箱的主表,但它保留了原文可直接核对的基线与本方法。

模型信噪比重建值均方根误差百分比差异输入混合条件与代价说明
自编码器2.8 dB0.141.26心音摩擦环境各 5 分贝,过衰减负例
2 维复数 U-Net8.3 dB0.060.92心音摩擦环境各 5 分贝,次优复数基线
幅度谱掩蔽 U-Net5.1 dB0.081.84心音摩擦环境各 5 分贝,高噪声退化例
时域 U-Net5.7 dB0.081.63心音摩擦环境各 5 分贝,暂停残留噪声
所提复数时频 U-Net12.2 dB0.040.53心音摩擦环境各 5 分贝,最高改善最低误差

该表的主要收益是所提模型在该示例上同时获得最高的信噪比重建值与最低的重建误差,支持其在谱内容与时间动态上保留得更好。具体代价与反例是自编码器的信噪比与误差最差且被定性为过衰减,而幅度掩蔽与部分时域模型处于中间,说明只看单一较高信噪比示例会低估低信噪比段的差距,因此必须回到分箱主结果与真实泛化检验做联合判断。

信噪比改善 × 均方根误差: 信噪比改善分工是衡量去噪前后信噪比提升的分贝数,越高表示噪声压制越多;均方根误差分工是衡量去噪波形与干净波形在幅度上的平均偏离,越低表示波形越接近;搭配理由是只看改善可能掩盖过衰减或放大,组合意义是必须同时看相对改善与绝对重建精度才能判断是否真正恢复肺音结构。

换到真实肺音与不同噪声水平,优势还成立吗?

论文做了两类特有的鲁棒性展开。第一类是按段级信噪比分箱:在极低段与高段之间分别考察改善与误差,避免总体平均掩盖条件差异。报告的趋势是所提模型在各箱均保持最好,但在高信噪比段各模型的绝对行为分化更大。

自编码器与部分时域模型在输入本来已干净时甚至出现改善接近零或为负,说明去噪器可能引入失真。这是一个重要的失败条件:去噪不是在所有输入上都有正收益,输入越干净,模型引入失真的风险占比越高。

第二类是从仿真人体模型训练转到真实教学库肺音的泛化检验,心音换库、摩擦用留出集,其余流程相同。结果显示真实集上仅有轻微下降,仍保持稳健的改善与较低误差,但原文提醒真实集可能包含训练未见的气管区记录与婴儿记录,会带来额外挑战。

这两类展开共同支持训练用合成数据是可行的折中,但也划出边界。优势是在给定混合协议与分箱口径下成立,换频带、换人群或换探头压力时需重新验证。未评测的边界包括极端摩擦、强语音干扰和连续运动伪影,这些在原文噪声目标之外,不能从现有数字外推。

哪些结论不能下:失真、延迟与临床可用性缺了什么?

首先缺的是临床保真验证。论文用波形误差与信噪比改善衡量重建,但未测量异常呼吸音是否被保留或扭曲,结尾明确提出未来需要全面的医学评价以确保去噪不损伤临床相关特征。因此不能把误差更低直接等同于诊断价值更高。

其次缺的是成本与延迟。原文只提到所提模型参数略多可能有助于性能,未报告训练时长、推理耗时、内存占用、输出帧率与实际延迟。总体趋势不等于每段都更快,部署到听诊器端侧前必须单独补测,参数更多通常意味着更高的计算开销。

第三,数据侧仍有缺项。干净真值假设录自安静环境,摩擦只覆盖自录的压力与衣物条件,环境只用粉红与白噪声代替一般环境扰动。真实医院的语音、脚步、设备报警等未被建模,超出该噪声集合的泛化属于待验证。

第四,评价口径依赖合成混合与 1 秒段平均,段级信噪比本身受肺音能量起伏影响,不同聚合方式可能改变排名。把这些缺项说清楚不是否定结果,而是限定适用条件:在论文的混合协议内复数谱加残差加注意力是更优的可运行选择,超出该协议则属于待验证。

要复现这篇工作,先做什么才能对上数字?

第一步固定数据与前端。拿到仿真人体模型数据集的分离肺音与心音,只用分离记录,按 15 秒、22 050 赫兹的原始规格核对,再统一重采样到 4 千赫。对肺音做 200 赫兹到 1000 赫兹带通、对心音做 50 赫兹到 250 赫兹滤波,并按最大绝对值归一化。

自录摩擦若无法完全复刻,至少保证分钟级的独立摩擦集并切为 1 秒不重叠片段,且测试摩擦与训练摩擦不重叠。真实泛化检验需要另外准备教学库的低背景肺音与独立心音库的心音,避免与训练集混用同一噪声样本。

第二步固定混合。实现心音、摩擦、环境 3 路依次定标的分层混合,每路相对当前混合达到目标信噪比。训练时 3 路信噪比在负 10 分贝到正 10 分贝均匀采样、分辨率 0.2 分贝,随机裁 1 秒训练。测试时同一条 15 秒记录内保持噪声参数恒定,再按段级信噪比分箱。

第 3 步固定模型与训练。谱模型用 127 点汉恩窗、跳长 32,核心网络用 2 维卷积残差加瓶颈自注意力、跳连与 Swish 激活,实虚堆叠输入、实虚预测输出、可微正逆变换包裹。批量 10、Adam 学习率十的负 5 次方、波形均方误差,多数段训练、少数段留作验证测试并按疾病、位置、摩擦类型分层。

第四步固定评价。在 1 秒不重叠窗口计算信噪比改善、均方根误差与百分比差异,先看分箱主表再看示例谱图,避免只用单条较高信噪比记录下结论。关于可用性,原文证据未绑定任何经验证的代码模型数据资源,因此不得声称代码或数据已公开,复现应按上述文字协议重新实现。

何时值得尝试这种复数时频 U-Net,何时先别用?

当任务是单通道胸壁肺音、干扰以低频心音、探头摩擦和弥散环境噪声为主,且拿不到真实配对干净数据时,这篇的路线值得尝试。用仿真人体模型干净肺音加分层合成混合训练复数谱 U-Net,保留相位重建能力并用瓶颈注意力补长时间上下文。

复现时优先保证频带、混合信噪比与分箱口径与原文一致,否则改善数字不可比。特别要注意把表示选择、配对构造与分箱评价三者同时讲清,才算真正复述了这篇方法。只谈网络结构而不谈混合协议,会让结果失去可比性。

当输入可能是气管音、婴儿肺音、强语音或剧烈运动伪影,或下游依赖异常音的细微形态时,应先别直接部署。需补做失真听辨、异常音保留率、延迟与端侧开销的验证,确认去噪没有抹掉临床细节。

记住两个易错点:幅度掩蔽在低噪声下好不代表高噪声下也好,总体改善高不代表每 1 秒段都好。输入越干净,过度处理的相对风险越高,这是选择是否启用去噪阈值的实际依据。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 2 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 2 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 2 页

区域 3 · 查看论文原页

另有 2 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eusipco-2026 论文汇总