英文题目:Cross-Modal Consistency-Aware Structured Pruning for Efficient Speech Enhancement with Air- and Bone-Conduction Microphones
会议身份:
conference:interspeech:2026:conference-paper-id:kim26n_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#多模态学习 #模型剪枝 #高效推理 #端侧运行 #语音增强
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Yeeun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yonghun Song:机构信息未能从会议 PDF 纯文本可靠映射
- Yunsik Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonyoung Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态语音增强(Multimodal Speech Enhancement)需同时利用含噪空气传导麦克风(Air-Conduction Microphone)信号与骨传导麦克风(Bone-Conduction Microphone)信号,难点在于非平稳噪声与双模态带宽尺度失配会扭曲融合表示并抬高可穿戴部署成本。本文提出跨模态一致性感知结构化剪枝(Cross-Modal Consistency-Aware Structured Pruning,CCAP),先将双通道输入分别做模态级零掩蔽,再以卷积通道输出的L1幅值相对多模态参考归一化得到双路敏感度。双路敏感度经等权平均形成通道重要性分数,低分通道被一次性结构化移除后统一微调恢复性能。与幅值剪枝和跨模态激活直接比较类方法的机制差异在于以缺失保持率代替幅值或差异度,从而保留双缺失下仍稳定的融合共享通道。在TAPS数据集80%剪枝率评测条件下,CCAP的Linear CKA分数为0.950,高于MANU的Linear CKA分数0.900。在Arm Cortex-M7上50%剪枝的LAU-Net将延迟降至87 ms,实时因子为0.29。结论限于韩语朗读语音加DNS噪声的双通道早期融合卷积结构,对自发语音与异构融合架构的外推尚未验证。
🔗 开源与复现资源
- 代码相关资源:https://github.com/KYE-Postech/CCAP — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,什么信息不能丢?
这篇论文解决的是可穿戴场景下的多模态语音增强。输入是两路同步信号,一路是带噪的气导信号,论文记为带噪气导,等于干净气导加环境噪声,另一路是骨导信号,采集的是经皮肤与骨骼传导的振动。目标是从这两路输入中恢复出干净语音,既要压住背景噪声,又要补回骨导缺失的高频。
初学者可以这样走完一个样本:说话人开口,气导麦克风录到混噪的宽带语音,贴在喉部附近的骨导传感器录到抗噪但带宽受限的振动,两路按时频表示对齐后拼成双通道输入,送入增强网络得到增强波形或语谱。必须保留的信息有两类,一类是气导中的高频谐波与清浊结构,决定听感与可懂度上限,另一类是骨导在强噪声下仍稳定的浊音骨架,决定噪声下的下限。
论文反复强调的气导在高度非平稳噪声下易退化,以及骨导在 2 千赫兹以下频响受限且存在带宽与幅度失配,正是这两种信息缺一不可的原因。输出是增强后的语音,评价看感知质量与可懂度是否同时保住。代码当前可用,已公开在公共仓库,本文解读的事实只以论文正文与官方原图像素为准。
已有压缩路线为什么保不住融合通道?
论文把相关工作分成两条线。第一条是通用结构化通道剪枝,优点是整通道删除后直接降低延迟,不需要专用稀疏核支持。代表做法包括按权重稀疏统计删除通道的参数剪枝,记为 PP,按梯度近似估计重要性的泰勒展开剪枝,记为 TP,以及按批量归一化缩放因子幅值剪枝,记为 BN。它们的共同假设是幅值大或梯度敏感的通道更重要。第二条是试图考虑模态的 MANU 剪枝,通过分析激活统计的模态差异打分。
论文指出这两条线在气导骨导融合中都有缺口。通用路线是模态不可知的,它不显式评价通道对融合的贡献,跨模态共享但两路响应看起来冗余的通道容易被误剪。MANU 虽然看了模态,但直接比较跨模态激活模式,在非平稳噪声以及气导骨导带宽与幅度失配下会失真,导致重要性估计不可靠。教学上可以把区别记为:PP 与 TP 回答哪个通道在单模型内看起来大或敏感,BN 回答哪个通道缩放系数大,MANU 回答两路激活差异大不大,而 CCAP 要回答去掉一路后相对多模态参考还剩多少。
只有最后一个问题直接对应融合部署时一路被噪声污染的真实风险。
问题如何形式化,难点卡在哪里?
形式化上,设双通道输入由带噪气导与骨导拼接而成,网络中的每个卷积输出通道对输入有一个响应张量。论文考察 3 种输入条件:双路全在的多模态输入,只留气导而骨导置零的输入,只留骨导而气导置零的输入。难点有 3 个。第一,计算开销大,融合模型常用时频表示加融合模块,即使是轻量架构,超过 4,000,000 参数在边缘与穿戴设备的兆字节级内存与功耗预算下也难以实时执行。
第二,重要性难定义,融合相关通道往往在两路都有响应,单看幅值或单看差异都容易误判。第三,评价条件苛刻,噪声非平稳且两路失配,任何依赖跨模态直接对比的方法都会被失配污染。论文因此把问题收敛为:在预训练多模态增强模型上,为每个卷积输出通道计算一个跨层可比的重要性分,按分从低到高剪到目标剪枝率,再微调恢复性能,同时在质量、延迟与表示稳定性上给出可核对证据。
CCAP 全景:三步走完一次剪枝
CCAP 的操作全景可以按一个样本走通。第一步构造输入,把带噪气导与骨导直接拼成双通道,这是多模态参考。第二步做 2 次零掩蔽,1 次把骨导整段置零得到类气导单路输入,1 次把气导整段置零得到类骨导单路输入,掩蔽发生在输入阶段,形状与被掩蔽模态一致。第 3 步让这 3 种输入分别通过同一组预训练卷积,得到多模态响应、气导单路响应与骨导单路响应。
对每个通道,用响应幅度的 L1 范数在校准集上取期望,再用单路期望除以多模态期望加极小常数,得到两路各自的归一化灵敏度,最后等权平均得到重要性分。高分意味着去掉任一路后响应仍能保持,论文将其解释为支持融合相关表示。随后按分从低到高剪到目标比例,再做 1 次微调。下图把这 3 步画成了从左到右的流水线,是理解后文所有计算的骨架。
下面这张总览图把输入构造、打分与剪枝放在同一流水线中,建议先看分支再看汇合,避免把掩蔽当成训练增强。
看图路径: 1. 先从左侧人物与两路语谱图出发,确认噪声进入气导而骨导独立输入;2. 再看中间黄色输入块如何摆出三种条件:双路全在、置零骨导、置零气导;3. 接着沿箭头看卷积块输出的三组响应如何分别进入两个灵敏度分析器再求和;4. 最后看右侧重要性条与剪枝前后卷积块对比,确认删的是低分通道
论文图 1。原论文 Figure 1:“Overview of the proposed cross-modal consistency-aware structured pruning (CCAP) framework.”。
从像素看,左侧面板用人物示意与两张语谱图区分噪声、带噪气导与骨导,中间黄色输入块纵向摆出置零骨导、多模态、置零气导 3 种堆叠,箭头分别汇入卷积块的不同滤波器组,右侧两个分析器分别输出气导灵敏度与骨导灵敏度再经求和得到通道重要性,最后按从最不重要到最重要的条带选出目标通道并画出剪枝前后通道块变薄。这种画法直接对应正文的 3 条件与平均公式,初学者复述时只要说清 3 路输入共用同一卷积、分数是对多模态的保持率,就抓住了 CCAP 与幅值剪枝的本质区别。
双路输入与零掩蔽:如何制造可比的单模态条件?
白话说,气导麦克风,英文 air-conduction microphone,缩写 ACM,是贴近口鼻采集空气声的常用麦克风;骨导麦克风,英文 bone-conduction microphone,缩写 BCM,是贴合皮肤采集振动的传感器。前者宽带但怕噪,后者抗噪但高频缺失。CCAP 把二者拼成双通道,不是做特征级复杂融合,而是让卷积直接看到两路时频。零掩蔽,英文 zero-masking,是把某 1 通道全填零,模拟该模态缺失。
论文用全零信号保持形状不变,目的是让卷积的感受野与计算路径不变,只改变信息来源。这样得到的气导单路响应与骨导单路响应,才能与多模态响应逐通道对比。需要注意,零不是静音语谱的真实分布,它只是一个可控的探测输入,论文用它来测保持度,而不是用来训练鲁棒性。
气导麦克风 × 骨导麦克风: 气导麦克风负责采集空气传播的宽带语音但易混入环境噪声,分工是提供高频细节与可懂度上限;骨导麦克风负责采集经皮肤与骨骼传导的振动,分工是在非平稳噪声下提供抗干扰的低频骨传结构。搭配理由是二者频带与噪声敏感性互补,组合意义是让融合模型在噪声下仍能重建高频,CCAP 正是要保住同时依赖这两路的共有通道。
沿样本走一遍:某帧带噪气导混入街噪,骨导仍有清晰基频,双通道输入时某融合通道激活很强;置零骨导后若该通道大幅衰减,说明它依赖骨导;置零气导后若同样衰减,说明它也依赖气导;若 2 次都保持较好,说明它是双路共享的稳定通道,应得高分。这种设计刻意避开了直接比较两路激活的绝对差,因为两路带宽与幅度本就不同,直接比差会被失配主导。
打分计算:保持率如何平均成重要性?
白话说,响应保持率是单路响应幅度占多模态响应幅度的比例;多模态参考归一化,英文 normalized to the multimodal reference,是把分母固定为双路全在时的幅度。论文对每个卷积输出通道,先在校准集上对 L1 范数取期望,再做除法并加极小常数保证数值稳定,得到气导灵敏度与骨导灵敏度,最后以 0.5 与 0.5 等权平均得到重要性分。符号上可以记为多模态响应、气导单路响应、骨导单路响应与重要性分,但计算目标始终是保持程度,不是幅值本身。
原文明确的实现是分层独立计算、层内排序、按目标剪枝率删低分通道,重要性估计与剪枝只做 1 次,随后做 1 次微调。原文没有给出逐层自适应比例或跨层全局排序的安排,也没有声称梯度要经过掩蔽路径,复述时不应脑补为可学习的掩蔽门。
零掩蔽灵敏度 × 多模态参考归一化: 零掩蔽灵敏度负责制造单模态条件,把另一路输入整段置零后看某通道响应还剩多少,分工是暴露通道对单路的依赖;多模态参考归一化负责把该残留响应除以双路全在时的响应,分工是消除通道绝对幅值与跨层量纲差异。搭配理由是直接比较两路激活会被带宽与幅度失配污染,组合意义是得到在噪声与失配下仍可比的保持率,再对两路取平均即为重要性分。
举例说明,假设某通道多模态期望幅值为 10,气导单路为 9,骨导单路为 3,则两路灵敏度约为 0.9 与 0.3,平均约 0.6,属于偏气导通道;若另 1 通道两路分别为 8 与 8,平均约 0.8,则更共享,排序更靠后被剪的可能性更低。这个例子只是帮助理解平均机制,不代表论文报告的真实数值。等权平均的含义是两路同等重要,论文没有按信噪比动态加权,这既是简单性,也是高噪声下可能需要改进的点。
结构化通道剪枝 × 模态不可知剪枝: 结构化通道剪枝负责整通道删除卷积输出,分工是直接减少参数量、计算量与实测延迟而无需稀疏算子;模态不可知剪枝负责按权重幅值或梯度统计打分,分工是通用压缩但不看融合。搭配上的对比理由是后者会把跨模态看起来冗余的共享通道误剪,组合意义在于 CCAP 把结构化执行与跨模态一致性打分结合,既拿到硬件可用的加速,又保住融合相关通道。
通道间冗余 × 表征保持: 通道间冗余用层内绝对皮尔逊相关均值衡量,分工是回答剪枝是否去掉了功能重复的通道;表征保持用剪枝前后表征的线性中心核对齐衡量,分工是回答核心表示是否漂移。搭配理由是只看任务分会掩盖表示坍缩,只看冗余又不知道是否伤及融合,组合意义是 CCAP 同时报告相关下降与对齐保持,用双证据说明删的是冗余而非融合骨架。
预训练、一次剪枝与一次微调如何衔接?
本节的训练指增强主干的训练与剪枝后的恢复,不是 CCAP 本身在训练打分器。按原文,3 个代表性多模态增强网络先用各自原始论文的超参数预训练,其中轻量加速计辅助 U-Net 训练 200 轮,密集连接卷积循环网络与多模态内卷网络各训练 30 轮。随后在训练集中随机抽 3000 个样本组成校准集,只用于计算重要性分,不更新权重。接着做分层结构化通道剪枝,按分删掉最低的通道直到目标剪枝率,剪枝执行 1 次。
最后做单次微调恢复性能,训练配置与预训练相同,其中 U-Net 微调 40 轮,另 2 个模型微调 15 轮。实现基于 PyTorch,运行在 AMD EPYC 7313 中央处理器、128 吉字节内存与两块英伟达 RTX 3090 图形处理器上。需要明确的缺项是:论文未报告优化器类型、学习率、批量大小与损失函数在微调中是否调整,也未说明批量归一化统计与偏置如何折叠,复现时应先沿用各主干原始论文的训练配置,再核对剪枝后通道数是否与目标比例一致。CCAP 的梯度路径只存在于微调阶段,打分阶段是前向统计,没有反向更新。
数据、基线与指标:比较条件是否公平?
实验要回答 3 个问题:在不同剪枝率下质量与可懂度谁掉得慢,在相同延迟下谁质量更高,剪掉的是否是冗余而非骨架。数据用喉部与声学配对语音数据集,英文 throat and acoustic paired speech dataset,缩写 TAPS。比较的基线是 4 种实际可运行的剪枝策略:参数剪枝 PP、泰勒展开剪枝 TP、批量归一化剪枝 BN、模态感知神经元遗忘剪枝 MANU,外加未剪枝原模型。主干覆盖注意力早期融合密集连接卷积循环网络、多模态内卷神经网络与轻量加速计辅助 U-Net,均接受双通道输入。指标是窄带感知语音质量评价与短时客观可懂度。
窄带 PESQ × STOI: 窄带 PESQ 负责评价增强语音相对干净参考的感知质量,分工是反映降噪与高频重建是否好听;STOI 负责基于短时包络相关评价可懂度,分工是反映内容是否听得清。搭配理由是质量高不一定可懂度高,组合意义是论文同时报告二者,避免只优化听感而牺牲融合带来的可懂度增益。
下表整理数据划分与加噪协议,比较问题是训练、验证与测试是否说话人无关且噪声覆盖是否充分,公平条件是同一配对语料加同一噪声池,指标方向是覆盖越广结论越稳。
| 划分 | 说话人数 | 每人句数 | 气导加噪信噪比 | 噪声池规模 |
|---|---|---|---|---|
| 训练 | 40 人 | 100 句 | 负 5,分贝,0,分贝,5,分贝,10,分贝 | 6000 段选自 65000 样本 |
| 验证 | 10 人 | 100 句 | 负 5,分贝,0,分贝,5,分贝,10,分贝 | 150 类噪声 |
| 测试 | 10 人 | 100 句 | 负 5,分贝,0,分贝,5,分贝,10,分贝 | 同一噪声挑战集 |
| 合计 | 60 人 | 每人 100 句 | 4 档信噪比 | 6000 段选自 65000 样本 |
表后需要说明代价与边界。说话人无关划分避免了说话人记忆,4 档信噪比覆盖了强噪到弱噪,6000 段噪声来自 150 类的 65000 样本,多样性较好。但论文只报告了窄带质量与可懂度,未报告宽带质量、主观听感与误判率,噪声只加在气导而骨导视为干净同步,这与真实穿戴中骨导也会受摩擦与佩戴影响有差距。校准集 3000 样本随机抽自训练集,若噪声分布与测试偏移,打分稳定性待验证。论文把延迟定义为评估平台上每输入段的平均前向时间,这与微控制器实测延迟是两回事,需要分开看。
主结果:在相同压缩下质量掉得更慢吗?
主结果按剪枝率从 0 到 80% 展开。论文报告,在 80% 剪枝率下,CCAP 的窄带质量比最强基线在 3 个主干上分别高出 0.10、0.20 与 0.10,可懂度上轻量 U-Net 在超过 50% 剪枝后仍高于 0.88,另两个主干在全程高于 0.91。语谱图示例显示,在 30% 剪枝的轻量 U-Net 上,CCAP 残留噪声更少、高频更清晰,更接近干净参考。延迟与质量的权衡曲线显示,所有方法延迟都随剪枝率下降,但基线在相同延迟下质量掉得更多,CCAP 始终贴着曲线的上包络,意味着在低延迟区仍保持更高质量。论文把这解释为 CCAP 保住了融合相关线索,而模态不可知或跨模态直接比较的方法误删了融合通道。这属于有限解释,因为曲线只能显示相关性,不能证明删掉的每个通道的功能。
下表把可部署收益放在同一行比较,比较问题是压缩后能否实时运行,公平条件是同一 50% 剪枝的轻量模型,指标方向是延迟越低、内存越小越好,但质量必须同时看。
| 模型 | 推理延迟与输入时长 | 实时因子 | 存储下降 | 延迟下降 |
|---|---|---|---|---|
| 三主干 80% 剪枝 | 质量增益 0.10,0.20,0.10 | 可懂度高于 0.88 与 0.91 | 需看主结果曲线 | 低延迟区占优 |
| 对比基线 | 参数剪枝等 4 种 | 同延迟下质量更低 | 同压缩率 | 质量代价更大 |
表后解释收益与代价。收益是 50% 剪枝后在 Arm Cortex-M7 微控制器上处理 304 毫秒时频段只需 87 毫秒,实时因子 0.29,小于 1 意味着可实时,闪存与内存分别下降 48.3% 与 27.2%,延迟下降 43.1%,支持嵌入式部署。代价是这些数字只针对轻量 U-Net 与 2 兆字节闪存、1 兆字节内存的特定芯片,不能推广到所有主干。质量增益 0.10 到 0.20 是在 80% 极端剪枝下相对最强基线的差值,不是相对未剪枝模型的提升,基线本身在高剪枝下已大幅退化。未胜出项是论文没有给出每个剪枝率下 4 个基线的完整数值表,读者无法核对中间比例的方差,复现时应自己跑多次取均值与置信区间。
删的是冗余吗:相关与对齐给出什么反证?
论文用事后分析回答是否误删骨架。方法是在多模态内卷网络中选出通道间相关最高的层,用绝对皮尔逊相关均值衡量冗余,用线性中心核对齐衡量剪枝前后表示的保持度。报告显示,CCAP 在 50% 剪枝时该层平均相关下降 21.7%,且在 20% 到 80% 全程保持下降,而 4 个基线的下降幅度更小;对齐方面 CCAP 在各剪枝率下最高,从 0 到 80% 的下降最小。论文据此认为 CCAP 去掉了功能冗余而保住了核心表示,这与基于保持率的打分是一致的。严格说,这仍是支持性证据,因为相关下降也可能来自通道数减少本身,对齐高也可能来自微调的恢复,需要结合主结果一起读。
下图是这种反证最直观的像素证据,建议先看整体明暗再核对数值,避免把对角线黄线当成性能曲线。
看图路径: 1. 先确认左右两幅热力图的横纵轴都是通道序号,对角线为自相关;2. 再对比颜色整体变化,观察剪枝后深色低相关区域是否扩大;3. 最后核对每幅图下方白框内的平均绝对相关数值差异
论文图 2。原论文 Figure 5:“Absolute inter-channel Pearson correlation matrices (|ρ|) for the most correlated layer of MMINet before pruning (left) and after CCAP pruning at a 50% pruning ratio (right).”。
从像素看,左图为原始模型,通道序号到 512,右图为 50% 剪枝后模型,通道序号到 410,两图横纵轴均为通道序号,颜色条从 0 到 1.0 表示绝对相关值,对角线亮黄色为自相关。右图整体更偏深蓝,浅绿高相关斑块减少,下方白框分别标注平均绝对相关 0.387 与 0.303,数值下降与正文的冗余减少结论一致。需要注意,右图尺寸变小是因为通道数减少,不能直接用视觉密度判断好坏,必须结合均值与对齐数值。论文未评测的边界是只选了最相关的一层,其他层的冗余与漂移是否一致未知,复现时应逐层记录再平均。
哪些结论还不能下,缺了哪项验证?
首先,论文直接报告的是窄带质量、可懂度、延迟与内存下降,这些数字在给定数据集与硬件上可核对。有限解释是 CCAP 保住了融合相关通道,这一判断得到质量曲线与相关对齐的双支持,但没有逐通道的功能标注,不能说每个高分通道都是因果必需。其次,未验证的推测是跨噪声与跨设备的泛化,实验只在 TAPS 加 DNS 挑战噪声上完成,骨导视为同步干净,真实佩戴中的摩擦、位移与个体差异未覆盖。
第三,成本只给了微控制器端的推理延迟与存储,没有报告打分与微调的训练时间、能耗与峰值内存,也没有报告输出帧率与端到端延迟的分解,总体趋势不等于每档剪枝率都划算。第四,方法只针对卷积输出通道,对注意力、循环与全连接部分的压缩未讨论,等权平均也未按信噪比自适应。缺失证据不是技术错误,但在承诺部署前,至少要补宽带质量、主观听感、多次随机的方差以及另一套配对语料的验证。
复现先做什么,需要哪些信息条件?
复现应从可运行链路开始。第一步按各主干原始论文配置预训练,轻量 U-Net200 轮,另 2 个模型各 30 轮,保留未剪枝基线。第二步从训练集随机抽 3000 样本做校准集,对每个卷积通道前向计算多模态、置零骨导、置零气导 3 组 L1 期望,加极小常数后相除再平均,得到重要性分。第 3 步分层按分排序,删低分通道到目标比例,剪枝只做 1 次,随后用与预训练相同的配置微调 1 次,U-Net40 轮,另 2 个模型 15 轮。
关键超参数与信息条件是目标剪枝率、校准集随机种子、极小常数值、分层还是全局排序,以及微调是否冻结批量归一化,论文只明确了前三项中的比例与样本数,其余需看开源代码。资源状态是代码当前可用,已公开,论文还给出了演示网页,但复现仍应以仓库中的脚本与环境为准。部署验证需要 STM32H753ZI 级别的微控制器与 304 毫秒时频段的切分方式,分别记录闪存、内存、前向延迟与实时因子,再与窄带质量和可懂度一起报告,避免只报延迟不报质量。
何时值得尝试,一句话如何带走?
当你的增强模型必须同时吃气导与骨导,又要装进内存与功耗受限的穿戴设备,且噪声非平稳、两路存在带宽与幅度失配时,CCAP 值得尝试,因为它不直接比较两路激活,而是看去掉一路后相对多模态还剩多少,从而保住双路共享通道。复述方法只需记住 3 个条件、两灵敏度、一平均:双路全在做分母,2 次零掩蔽做分子,等权平均做排序,删低分再微调。论文的强证据是 80% 剪枝下三主干仍领先最强基线 0.10 到 0.20,以及 50% 剪枝轻量模型在微控制器上 87 毫秒处理 304 毫秒段的实时表现。
主要代价与边界是极端剪枝仍掉质量、只压卷积通道、只验单一配对语料与窄带指标。带走的实践建议是先在低剪枝率验证延迟收益,再推高压缩并补宽带与主观验证,不要把自动指标当成人评,也不要把单芯片数字当成全平台承诺。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

