英文题目:Real-Time Speech Enhancement on Edge Devices Guided by Harmonic and Voice-Activity Cues Utilizing Skin-Attachable Accelerometer
会议身份:
conference:interspeech:2026:conference-paper-id:song26g_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#多模态学习 #高效推理 #端侧运行 #实时处理 #语音增强
评分:7.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Yonghun Song:机构信息未能从会议 PDF 纯文本可靠映射
- Yeongmin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yunsik Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yeeun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonyoung Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
含噪声学麦克风 Acoustic Microphone 在低信噪比下严重退化,而可穿戴边缘设备又装不下并行编码器或注意力融合等多模态重型结构,本文以同步采集的含噪声学信号与皮肤贴附加速度计 Accelerometer 信号为输入,输出增强语音波形。本文提出轻量加速度计辅助 U-Net 第二版 Lightweight ACC-assisted U-Net v2,先从加速度计幅度谱提取帧级语音活动检测 Voice Activity Detection 与基频谐波软掩膜两类线索,再经轻量一维卷积生成特征线性调制 Feature-wise Linear Modulation 的缩放与偏置参数,最后在瓶颈处分别调制频率轴与时间轴门控循环单元并由解码器重建对数幅度谱。与输入拼接或双分支编码相比,该机制不学习完整跨模态重建特征,只传递压缩后的时频结构先验。在咽喉与声学配对语音 Throat and Acoustic Paired Speech 混合深度噪声抑制 Deep Noise Suppression 噪声的测试集下,轻量加速度计辅助 U-Net 第二版 Lightweight ACC-assisted U-Net v2 的感知语音质量评估 Perceptual Evaluation of Speech Quality(PESQ)为 2.78,高于声学单模态 U-Net 骨干的感知语音质量评估 Perceptual Evaluation of Speech Quality(PESQ)1.78,并在 -20 dB 至 0 dB 超越轻量与多模态基线。该结论目前仅在 8 kHz 韩语数据与受控混合协议上验证,真实佩戴偏移与强混响外推尚未证明。原文披露了 STM32H753 微控制器 Microcontroller 端 48.66 ms 推理时延与 40% 剪枝后的存储占用,训练为单卡工作站量级。
🔗 开源与复现资源
- 代码相关资源:https://github.com/yhsong06/LAU-NetV2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
任务是什么:要在边缘设备上实时恢复被强噪声淹没的语音吗?
输入是两路同步信号,一路是声学麦克风采集的带噪空气声,另一路是贴在颈部皮肤处的加速度计采集的体传导振动,目标是从带噪声学信号中恢复出清晰可懂的语音波形,必须保留的语音信息包括浊音谐波结构和语音段与非语音段的时间边界,输出是增强后的声学波形,仍沿用带噪相位做逆变换合成。
初学者容易把语音增强理解为只要把噪声频点删掉就行,但在信噪比低于 0 dB 时,极轻量网络深度和循环状态受限,仅靠带噪声学输入很难同时判断哪里是语音和语音谐波应该长什么样,这时需要另一路在噪声下仍然稳定的发声证据。皮肤加速度计正好提供这种证据,但它经过软组织传播后高频细节严重衰减,单独听感闷且不清晰,所以不能替代声学麦克风,只能作为引导。
皮肤贴附加速度计 × 声学麦克风: 皮肤贴附加速度计负责捕捉经身体传导的喉部振动,在环境噪声下保持稳定但高频音素细节被软组织衰减而发闷;声学麦克风负责捕捉空气传播的宽带语音,清晰但在低信噪比下易被噪声淹没;二者搭配的理由是前者提供噪声鲁棒的发声时机与浊音结构,后者提供可恢复的宽带细节,组合意义是用前者的稳定线索去门控和校正后者的时频恢复,而不是直接拼接两种频谱。
论文把资源约束摆在前面,可穿戴系统常用微控制器只有数百 KB 片上内存和 MB 级闪存,超过 10 MB 的融合模型放不下,之前用注意力融合或双并行编码器的多模态方案虽然提升了质量,但计算和存储开销大。学习依赖上,先要接受这个矛盾,轻量声学模型在强噪声下表征能力不足,而重型多模态融合又上不了端侧,后续方法全景、线索构造与调制位置都是为同时守住质量和开销而安排的。
已有路线如何分岔:只做轻量声学与做重型多模态各付了什么代价?
同输入同目标的第一条路线是纯声学轻量增强,例如双路径门控循环的全子带扩展网络和用子带卷积做到 37k 参数的轻量网络,它们把参数和每秒乘加次数压得很低,但在极低信噪比下因容量不足难以恢复语音特征和谐波结构。论文把这类方法作为必须打败的基线,因为它们代表了不上加速度计时轻量化的极限。
第二条路线是多模态增强,用骨传导或入耳麦克风辅助声学麦克风,例如基于时频长短时记忆的自发声重建、用注意力动态加权两路特征的密集连接卷积循环网络、以及用双并行编码器学习模态特有特征的系统。它们在质量上更好,但融合策略复杂,参数动辄数百万,乘加次数可达数十亿量级,难以装入微控制器。
论文的上一代工作属于轻量多模态的中间路线,已尝试用谐波注意力和相位估计引入加速度计。本文的判断是,融合位置和融合算子才是决定开销的关键,因此不再做并行编码器或注意力块,而是把加速度计压缩成两个紧凑线索,只在瓶颈处做调制。这种选择不是因为注意力在数学上不可行,而是因为在边缘约束下必须把融合成本降到 30k 量级。
问题如何形式化:输入表示、调制目标与输出如何衔接?
沿一个样本走一遍有助于建立全图,两路信号都按 8 kHz 采样,做 512 点汉宁窗、128 点跳点的短时傅里叶变换,网络操作对象是对数幅度谱。加速度计幅度谱先被压缩成帧级语音活动和软谐波掩膜,再经轻量卷积投成缩放与偏置参数,去调制主干中间特征;主干对带噪声学对数幅度谱做下采样编码、瓶颈建模、上采样解码,最后用带噪相位做逆变换得到增强波形。
关键约束是模型上下文长度被限制为 4 帧,对应 112 ms,训练与推理一致,这是为了把算法延迟控制在可交互范围内。训练目标是估计的干净声学对数幅度谱与真实干净谱之间的均方误差,不直接优化可懂度或感知分数,后续评测再用感知分数检验泛化。
初学者常误以为加速度计可以直接重建语音,论文明确其物理局限是高频音素细节被衰减,所以问题不是用加速度计替代声学通道,而是用它回答两个更小的问题,当前帧是不是语音,以及如果发声其谐波能量应出现在哪些频率附近,再让声学主干完成宽带细节恢复。
方法全景是什么:一条主干加两条线索如何汇合?
主干是一个 U 型网络,含 3 个下采样卷积块、一个受引导的瓶颈和 3 个上采样卷积块,卷积沿频率轴操作,下采样后两块用逐点加深度卷积减参,瓶颈依次放频率轴循环与时间轴循环,解码器用逐点卷积加最近邻上采样加标准卷积重建对数幅度谱,并用跳跃连接把编码器时频细节拼回解码器。加速度计不进入主干编码器,而是走两条侧路分别生成调制参数。
从数据流看,带噪声学幅度谱进入下采样块得到中间特征,谐波线索生成的参数先调制该特征再送入频率循环,语音活动线索生成的参数再调制 1 次后送入时间循环,最后进入解码器。这种先频后时的顺序对应了先整形谐波跨频模式、再建模语音时序动态的分工。
以下导读帮你带着问题看总体结构图,重点不是背模块名,而是确认两路输入在哪里分叉、两组参数在哪里汇入主链、以及输出从哪里合成。
看图路径: 1. 先从左右两侧找到加速度计输入与带噪声学输入各自的短时傅里叶变换入口;2. 再看左侧加速度计幅度谱如何分出谐波支路和语音活动支路;3. 接着观察两路调制参数如何分别汇入频率循环块之前与时间循环块之前;4. 最后沿下采样块到上采样块的主链与跳跃连接确认增强幅度谱到逆变换的出口
论文图 1。原论文 Figure 1:“Overall architecture of the cue-guided lightweight ACC-assisted U-Net v2 (LAU-NetV2) for speech enhancement.”。
这张总体结构图显示左侧加速度计经短时变换得到幅度谱后分出上下两条线索,上支画出随时间变化的谐波纹理并经卷积加整流加卷积生成一组缩放与偏置,下支画出随时间起伏的功率曲线与门限并同样生成另一组缩放与偏置;右侧带噪声学输入经变换与下采样后在中部主链上先后接受这两组参数的乘加调制,再依次经过频率循环块与时间循环块进入上采样块,最终输出增强幅度谱并经逆变换合成波形。右侧还给出带噪谱与增强谱的示意,左侧给出加速度计谱的低频集中形态,直观对应了噪声鲁棒但高频缺失的特点。
两路线索如何从加速度计中算出来:门限与谐波权重是什么操作?
第一路是语音活动检测,做法是计算加速度计每帧功率,如果大于阈值就判为含语音帧,阈值取训练集非语音帧平均功率的 5 倍。这个阈值不是逐句自适应的,而是在训练集上 1 次性统计得到,含义是体传导振动在发声时功率明显抬升,而环境噪声几乎不经身体传导,因此简单的能量门限就有区分力。
第二路是谐波线索,只在判为语音的帧上估计基频,再按其整数倍构造软谐波掩膜,在每条谐波附近赋予线性衰减权重,最小值为 0.5。这不是二值掩膜,而是在谐波中心最强、偏离中心逐渐减弱,目的是告诉网络浊音能量大致的频率骨架,同时容忍基频估计误差和频谱泄漏。
语音活动检测 × 谐波掩膜: 语音活动检测负责在时间轴上判断哪 1 帧含有语音能量,用于压制非语音区;谐波掩膜负责在频率轴上按基频整数倍给出线性衰减权重,用于保留浊音谐波结构;二者搭配的原因是前者解决何时增强、后者解决增强哪些频率成分,组合意义是分别送入时间循环和频率循环之前的调制点,形成先整形频谱结构再整形时序动态的分工。
初学者要区分这两个线索的输入来源,它们都只来自加速度计幅度谱,不看声学麦克风,因此在强噪声下仍然稳定。后续调制参数的时频分辨率要与瓶颈特征对齐,由两层 1 维卷积块生成,核尺寸分别为 3 和 1,中间加整流非线性,这保证了线索从帧级或谐波图映射到与特征同尺寸的逐点参数。
调制与瓶颈如何配合:乘加发生在循环之前还是之后?
调制公式的作用是对每个通道、频率、时间位置的特征做 1 次仿射变换,缩放控制幅度放大或抑制,偏置控制基线平移,公式中写成 1 加缩放再乘原特征是为了让零缩放对应恒等映射。谐波引导的参数先作用于下采样输出,调制结果送入频率轴循环;语音活动引导的参数再作用于频率循环输出,调制结果送入时间轴循环。原文明确给出这个先后关系,不是并行相加。
特征线性调制 × 瓶颈循环层: 特征线性调制负责由加速度计线索经轻量卷积生成缩放与偏置参数,对中间特征做逐通道逐时频的乘加;瓶颈循环层负责用频率轴循环捕捉谐波跨频模式、用时间轴循环捕捉语音时序依赖;搭配理由是调制不引入并行编码器或注意力融合,只在瓶颈处改变特征幅度和基线,组合意义是以极小开销实现有目标的时频引导。
这种安排的理由是频率循环擅长跨频率建模,谐波线索正好提供跨频先验;时间循环擅长序列动态,语音活动正好提供时序门控。计算上每路调制参数生成器都很轻,总开销约 30k 参数,远小于再建一个编码器。解码时跳跃连接保留时频空间细节,避免瓶颈调制把精细结构抹平。
一个具体动作是复述时先说清参数形状与特征形状一致,再说清谐波调制发生在频率循环前、语音活动调制发生在时间循环前,最后说清输出仍是增强对数幅度谱加带噪相位合成,避免把调制说成直接输出掩膜。
训练如何组织:数据、优化与模型选择按什么顺序执行?
数据用喉部与声学配对语音数据集,共 60 名韩语说话人,按说话人不相交划分为 40 人训练、10 人验证、10 人测试,两路信号都降采样到 8 kHz 以降低单位时间样本量和计算负载。带噪训练数据由干净声学语音混合深度噪声抑制挑战数据集中的 6000 段噪声构造,信噪比在负 20 dB 到 20 dB 之间均匀分布,短时变换用 64 ms 帧长和 16 ms 跳点。
优化目标是估计与干净对数幅度谱的均方误差,用 AdamW 优化器训练 100 轮,学习率 4 乘 10 的负 4 次方,批量 64,按验证损失最低选最终权重,训练在配有英特尔处理器、大内存与图形处理器的台式工作站上完成。论文未报告梯度截断、学习率衰减或早停轮数的具体安排,也未说明基频估计器内部是否参与梯度更新,复述时应把基频和谐波掩膜当作加速度计侧的线索构造,而不是默认其与主干端到端联合训练。
需要提醒的是,训练阶段的上下文长度与推理一致固定为 4 帧,这意味着网络每次只看 112 ms 窗口,训练时学到的时序依赖是短窗内的动态,部署时流式管线也要按同样窗口切分,否则会出现训练推理不一致。
实验条件是什么:和谁比、在什么信噪比下、用什么指标衡量代价?
比较对象分两类,一类是纯带噪声学轻量网络,包括全子带扩展网络与轻量子带双路径网络,另一类是同时用带噪声学与加速度计的多模态结构,包括低复杂度自发声重建、骨振语音增强系统与上一代轻量模型。为保证公平,所有基线都用各自公开仓库从零重新训练,并采用完全相同的配对混合协议,而不是直接引用原论文数字。
评测用窄带感知语音质量、短时客观可懂度与深度噪声抑制平均意见分,复杂度用参数量和每秒乘加次数衡量,实时性在目标微控制器上实测单次推理时间与端到端延迟。测试覆盖负 20 dB、负 10 dB、0 dB、10 dB、20 dB 5 个信噪比,重点看负 20 dB 到 0 dB 的极端噪声区,因为轻量纯声学模型在该区间退化最明显。
部署验证用自研可穿戴原型,集成声学麦克风、皮肤加速度计与 STM32H753 微控制器,主频 480 MHz,1 MB 内存与 2 MB 闪存,管线包括缓冲、双通道短时变换、线索提取、模型推理与逆变换合成,总延迟目标 176 ms,其中留给模型推理的预算是 58.25 ms,短时变换、线索提取与逆变换已分别占用 2.96 ms、0.06 ms 和 2.73 ms。代码当前可用,已公开,地址为论文脚注中的仓库链接。
主结果显示什么:在极低信噪比下谁保持住了质量?
先提出比较问题,在相同混合协议和 5 个信噪比下,引入加速度计调制的方法是否在极低信噪比下同时守住感知质量与可懂度,而代价是否仍保持轻量,指标方向是感知质量与可懂度越高越好,参数量与乘加次数越低越好。
| 方法 | 输入 | 参数量 | 起点 PESQ | 终点 PESQ |
|---|---|---|---|---|
| 带噪声学 U-Net 基线 | 带噪声学信号 | 轻量基线 | 1.78 | 未增强 |
| LAU-NetV2 | 带噪声学加加速度计 | 46k | 1.78 | 2.78 |
| LAU-NetV2 细节 | 带噪声学加加速度计 | 45.59k | 30k 调制开销 | 65.71M 每秒乘加 |
上表把核心收益与代价放在同一视野下,调制把感知质量从 1.78 带到 2.78,且总参数仍在 46k 量级,其中调制开销约 30k,每秒乘加约 65.71M,远小于需要数百万参数与数十亿乘加的注意力或双编码器方案。论文报告在负 20 dB 到 0 dB 区间该方法在感知质量与可懂度上都取得最好,而在高信噪比下各方法差距缩小,这符合加速度计在强噪声下提供增量信息的预期。
也要就近说明未胜出项,纯声学轻量基线在高信噪比仍有竞争力,上一代多模态与部分基线在某些高信噪比点并不落后,说明该方法的优势是有条件的,不是全信噪比无条件碾压。未评测边界包括混响、多人重叠与非平稳突发噪声,原文未给出这些条件下的数字,不能把强噪声结论推广到这些场景。
消融与反证支持什么:直接拼接与分开调制各贡献多少?
消融从纯声学 U 型基线出发,先把加速度计信号直接拼到输入,再分别加入语音活动调制与谐波调制,最后组合成完整模型。直接拼接已能提升,证实骨传导信息在强噪声下有益;在此基础上加入瓶颈调制带来进一步大幅增益,其中语音活动主要压制非语音主导区,谐波主要保留浊音结构,两者合在一起达到最好。
缩放参数 × 偏置参数: 缩放参数负责乘在原特征上放大或抑制激活,偏置参数负责加在特征上平移基线;论文把二者分开置零对照的理由是区分门控作用与基线校正作用,组合意义在于实测显示缩放置零带来更大退化,说明幅度门控是主要的增强机制,而偏置只是辅助。
更细的反证是把 4 组参数逐一置零做推理,谐波缩放置零、谐波偏置置零、语音活动缩放置零、语音活动偏置置零,观察感知质量与可懂度的下降幅度。报告显示把缩放置零的退化明显大于把偏置置零,语音活动缩放置零时退化尤其大,这支持乘性门控是主导机制、加性偏置是辅助的判断。参数分布分析也显示语音活动引导的缩放分布比谐波引导更正向偏移,而偏置都紧紧集中在零附近,说明调制主要改变幅度而非整体平移。
复述时不要把相关性说成因果,分布更正向不等于它必然更重要,真正的功能证据来自置零对照。原文未报告误判率或基频错误对谐波掩膜的敏感性,这是缺项,实际复现时应补测基频估计失败样本的表现。
代价与限制在哪里:剪枝换实时损失了什么、还有哪些没测?
先提出问题,未压缩模型在微控制器上单次推理要 87.12 ms,已超过 58.25 ms 预算,必须压缩才能满足 176 ms 端到端目标,压缩的代价与残留 footprint 是多少,指标方向是时间与存储越低越好而感知质量越高越好。
| 模型状态 | 感知质量 | 闪存占用 | 内存占用 | 单次推理时间 |
|---|---|---|---|---|
| 未剪枝 | 2.78 | 224.38 KiB | 232.32 KiB | 87.12 ms |
| 40% 剪枝 | 2.62 | 153.73 KiB | 151.22 KiB | 48.66 ms |
| 变化 | 下降 5.8% | 明显减小 | 明显减小 | 满足预算 |
上表显示 40% 结构化通道剪枝把推理时间从 87.12 ms 降到 48.66 ms,闪存与内存分别从 224.38 与 232.32 KiB 降到 153.73 与 151.22 KiB,感知质量从 2.78 降到 2.62,降幅约 5.8%。剪枝按标定子集平均绝对激活估计通道重要性并微调恢复,做法可重放,但论文未公开标定子集划分与微调轮数,这是复现缺项。
结构化通道剪枝 × 实时延迟预算: 结构化通道剪枝负责按标定子集上的平均绝对激活估计通道重要性并整体移除不重要通道再微调恢复;实时延迟预算负责把端到端 176 ms 内留给模型推理的 58.25 ms 卡死;搭配原因是未压缩模型单次推理要 87.12 ms 而超预算,组合意义是用可控的精度损失换取片上可运行,剪枝后推理降到 48.66 ms 而 PESQ 只从 2.78 降到 2.62。
真实场景验证是在 92.3 dBA 服务器机房噪声下朗读彩虹段落,频谱图显示宽带噪声被压制而浊音谐波得以保留,但这只是单一样本展示,没有给出该噪声下的统计指标,不能当作定量结论。其他限制包括只用 8 kHz 采样、只用均方误差训练、只在韩语配对数据上划分说话人测试,跨语言、跨佩戴位置与跨器件的泛化仍待验证。
复现先做什么:按什么顺序搭数据、模型与端侧管线?
第一步先跑通数据管线,把两路信号统一到 8 kHz,按 512 点窗、128 点跳点做短时变换,取对数幅度谱,上下文固定 4 帧,混合噪声时信噪比在负 20 dB 到 20 dB 均匀采样,并严格按说话人不相交划分训练验证测试,避免同一人同时出现在训练与测试中。第二步实现线索提取,先在训练集非语音帧上统计平均功率并乘五得到门限,再对语音帧估计基频并构造最小权重 0.5 的软谐波掩膜,确保调制参数与瓶颈特征同分辨率。
第三步搭建主干,按三下采样、谐波调制加频率循环、语音活动调制加时间循环、三上采样的顺序连接,调制生成器用卷积加整流加卷积、核 3 与 1,解码加跳跃连接,损失用对数幅度谱均方误差,优化用 AdamW、学习率 4 乘 10 的负 4 次方、批量 64、训练 100 轮并按验证损失选权重。第四步做端侧验证,先测短时变换、线索提取、逆变换耗时,再测未压缩推理时间,确认超预算后按平均绝对激活做 40% 结构化剪枝并微调,最后在目标微控制器上复测 48.66 ms 量级的推理时间与 176 ms 量级的端到端延迟。
常见误解是把加速度计当作第二路麦克风直接拼接就能替代调制,消融显示直接拼接虽有增益但明显小于瓶颈调制;另一个误解是把参数少等同于延迟一定低,实际延迟还取决于算子类型、内存搬运与上采样实现,必须在真机上实测。代码当前可用,已公开,可先复现训练曲线与感知分数,再复现剪枝前后对照。
何时值得尝试这种调制:结论、适用条件与还需补的验证是什么?
论文直接报告的是,在相同混合协议下,加速度计引导的瓶颈调制把感知质量从 1.78 提升到 2.78,在负 20 dB 到 0 dB 保持最好,且总开销仅 45.59k 参数与 65.71M 每秒乘加,经剪枝后可在资源受限微控制器上实时运行。有限解释是,语音活动提供更强的幅度增益、谐波提供结构保持、缩放比偏置更关键,这些有分布与置零对照支持,但仍局限于所用数据集与噪声分布。
适用条件很具体,当你有可同步的体传导传感器、目标场景是强稳态噪声、端侧预算只允许数十 k 额外参数且推理预算在 60 ms 量级时,这种先压缩成线索再在瓶颈调制的做法值得尝试;当只有单麦克风、高信噪比为主或已有充足算力做大模型时,不必引入该链路。
还需补的验证包括基频错误与门限漂移的鲁棒性、跨语言与跨佩戴位置测试、混响与重叠语音下的表现,以及剪枝标定细节与多次随机种子的方差报告。复现时保留的关键超参数是 8 kHz 采样、512 窗 128 跳、4 帧上下文、阈值为非语音平均功率 5 倍、谐波最小权重 0.5、学习率与批量设置,缺失的标定子集与微调安排应在复现报告中明确标注为待确认,而不是自行编造。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
