英文题目:Balancing Speech Reconstruction and Noise Suppression Using Dual-Asymmetric Loss

会议身份:conference:interspeech:2026:conference-paper-id:carson26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#正则化 #单通道 #语音 #语音增强

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Merlin Carson:机构信息未能从会议 PDF 纯文本可靠映射
  • Suyash Dandekar:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音增强需从含噪混合中恢复目标语音,难点在于语音与噪声频谱高度重叠,过度抑制损伤语音而保守增强又残留噪声。该工作提出双非对称损失,先基于压缩复数均方误差基座,将增强谱与干净谱的压缩幅度和复数误差分别计算。接着用修正线性单元与指示函数拆分为只罚语音衰减的语音项和只罚残留噪声的噪声项,分别负责衰减检测与残留检测。然后以可调权重λ线性加权两项并经短时傅里叶变换一致性约束训练掩蔽或映射模型,使上一步的加权误差直接进入下一步的模型优化。与以往单边非对称或单步取最大值的可调损失不同,该设计同时优化两项加权和并保留相位感知复数项,避免了逐迭代只优化单目标带来的振荡。在DNS5 Blind Test Set评测下,LiSenNet λ=0.65的SIG得分为3.22,高于LiSenNet λ=0.35的SIG得分3.09。13个λ取值扫描显示λ与语音质量呈强正相关而与背景抑制呈强负相关,极端取值分别导致语音过抑制或噪声泄漏,其结论适用边界受限于测试的信噪比与噪声类型及尚未验证的跨语种外推范围。四种架构覆盖57K参数与56M计算量至2.25M参数与32.73B计算量,MP-SENet长语音评测受限于48GB硬件显存而仅取前30秒,训练成本为200轮指数衰减训练并以验证损失最低检查点测试。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文输出什么?

本文的输入是论文原文的文字证据与本次实际收到的官方原图像素,目标是让刚进入语音增强方向的研究生能核对方法并复述流程,必须保留的信息包括任务定义、损失构造、训练条件、评估协议与关键数字,输出是 1 篇按学习依赖展开的中文技术解读。语音增强的任务可以白话理解为从含噪录音中恢复干净语音,输入是带噪波形或其时频谱,输出是增强后的波形。

难点在于语音与多种噪声在频率上重叠,简单的衰减滤波或掩码会同时伤及语音,造成语音发闷、断续或留下残留噪声的 artifacts,也就是论文所说的语音伪影。嵌入式耳机、手机与会议软件对内存和算力约束很紧,不能直接搬运大模型,因此训练阶段就需要能按任务调偏好的控制手段。本文解读先讲任务与已有路线,再讲双非对称损失的全景与组件计算,然后讲训练与评估条件,最后讲结果、反例与复现要点。

教学用的举例会明确标为例子,不把例子当作论文报告的数值。

已有路线如何处理保语音与压噪声的矛盾?

已有路线大致分 3 类。第一类是强化语音质量,例如在损失中加入语音活动检测,也就是 voice activity detection,用语音存在性来减少语音伪影,另一支是用非对称项防止语音被过度衰减。这类做法的共性是单侧加码,压噪声不足时仍可能漏噪。第二类是加权组合语音失真与噪声失真,例如把含噪混合生成的掩码分别作用到混合物的组成成分上计算两路误差,再加权相加。

这类做法能同时看到两路误差,但论文指出其生成掩码所用混合信号的相位与各成分相位不一致,相位口径存在偏差。第 3 类是单项取最大值的可控损失,用分位数思想在欠抑制噪声与过抑制语音之间取较重者,实现一个参数调节相对关系。论文认为这种每步只优化一个目标的形式可能引起损失振荡,不利于收敛到更理想的局部极小。

此外,上述可独立调节语音与噪声的做法在损失中没有相位敏感项,而相位敏感项对复数模型训练很关键,对加了一致性约束的幅度模型也有增益。本文的定位是保留加权同时优化两路误差的形式,同时补上幅度和复数两路惩罚,使可调性与相位敏感性兼得。

要解决的具体问题与可调目标是什么?

具体问题是受约束的小模型在语音质量与噪声抑制上往往至少一侧不足,而压缩、剪枝与量化等前后优化若没有训练期的性能指向,可能把模型推向语音质量差或噪声压不住的意外角落。论文把需求写得很任务化,举例来说,游戏内语音可能更偏好强的噪声抑制,紧急电话则要求高可懂且无损的语音,这只是任务举例,不是论文给出的效果数值。可调目标是训练时用一个参数连续控制相对重要性,低值偏向压噪声,高值偏向保语音,中间值兼顾。

评价上需要同时看非侵入式感知分与有参考的信号保真度,因为只看感知分可能漏掉语音被丢掉或改写的情况。论文因此同时报告语音质量分、背景噪声分、总体分、语音质量客观分、可懂度分、尺度不变信失真比与词错误率,方向都是越高越好,除了词错误率越低越好。这种多指标并列不是为了堆数字,而是为了暴露单侧调参的代价。

双非对称损失的全景:一个样本走完全程

沿一个样本走一遍有助于建立整体感。输入是一段含噪语音,先分帧加窗做短时傅里叶变换,得到含噪复谱。模型预测一个掩码或滤波器,作用到含噪谱上得到增强谱,再经一致性重构与逆变换得到增强波形。表示层面同时保留幅度与相位,目标层面同时要求保住语音能量与压掉噪声能量,输出是增强波形及其对应的复谱。

双非对称损失,也就是 Dual-Asymmetric Loss,站在增强谱与目标干净谱之间算误差,它拆成两项,语音衰减项只在预测能量低于目标时计罚,残留噪声项只在预测能量高于目标时计罚,再用可调参数 λ 做线性组合。当 λ 取 0.5 时两项等权,退化为压缩复数均方误差的等比缩小版。当 λ 调小,噪声项权重变大,模型更敢于衰减重叠频带;当 λ 调大,语音项权重变大,模型更倾向于放行重叠频带,代价是漏掉更多噪声。每项内部都包含幅度部分与复数部分,使幅度和相位联合改进。

这种设计把此前的单侧非对称思想对称化,从只防过抑制扩展为两端各有一只眼睛盯着。

两项惩罚如何计算:幅度判断与复数约束如何对齐?

先理解两个基础构件。复数压缩均方误差白话说是把幅度压缩后再算平方误差,压缩因子通常取 0.3,目的是压住高能量区的统治地位,让轻声段也有话语权,它用一个系数权衡复数项与幅度项,常用值偏向幅度。非对称损失白话说是有方向的幅度均方误差,把目标减预测的差值用整流线性单元截零,只留下正的部分,也就是只罚预测比目标小的情况,对应语音被衰减。

在此基础上,论文把操作数交换得到镜像项,预测减目标再截零,只罚预测比目标大的情况,对应残留噪声。幅度部分的非对称用简单的差值加截零实现,复数部分因为复平面差的符号不能直接判定衰减还是残留,所以用指示函数按幅度大小选点。对语音项,目标幅度大于预测幅度的频点取一,表示语音被衰减;对噪声项,预测幅度大于目标幅度的频点取一,表示有残留噪声。

指示函数与压缩复谱差逐点相乘,保证幅度部分用到的频点与复数部分用到的频点是同一批。最终每项都是复数部分与幅度部分按同一系数加权,再在两项之间按 λ 加权。

复数压缩均方误差 × 非对称损失: 复数压缩均方误差负责同时约束幅度与相位,用压缩因子平衡大小能量,并用复数项与幅度项的加权处理短时傅里叶变换不一致带来的伪影;非对称损失负责只罚单侧错误,用差值加截零让过抑制语音时才产生惩罚。两者搭配的理由是前者提供相位敏感的基础重建能力,后者提供方向性,组合后才能把语音衰减和残留噪声拆成两个可独立加权的方向。

语音衰减项 × 残留噪声项: 语音衰减项的分工是当预测幅度小于目标幅度时才计罚,迫使模型把掩码推向全通以保留语音;残留噪声项的分工是当预测幅度大于目标幅度时才计罚,迫使模型把掩码推向全零以压住噪声。两者单独看目标矛盾,搭配理由是用 λ 做线性组合来显式分配相对重要性,组合意义是训练时同时优化 2 个方向而不是每步只优化其中一个,从而避免优化目标来回振荡。

幅度分量 × 复数分量: 幅度分量的分工是用压缩幅度差加整流线性单元判断能量多了还是少了,计算简单且方向明确;复数分量的分工是用带相位的压缩复谱差约束相位误差,对复数模型和加一致性约束的幅度模型都很关键。搭配理由是幅度判断决定哪些时频点算犯错,复数差决定相位偏了多少,组合意义是指示函数选出的同一批时频点同时贡献幅度和相位惩罚,保证两路惩罚口径一致。

训练时数据如何流动,参数如何更新与挑选?

训练的数据流按论文交代复述。所有模型都在语音库与噪声库合成的训练集上训练,并降采样到 16 kHz。每批由 8 段 2 秒音频组成,每帧含 512 个采样点,重叠一半并加汉恩窗。损失计算带短时傅里叶变换一致性约束,且使用与变换相同的参数,学习率取 5 乘 10 的负 4 次方,每个周期前按 0.99 指数衰减,共训练 200 个周期,选取验证损失最低的周期存档用于测试。

论文未报告优化器种类、梯度裁剪、是否冻结 backbone 或分阶段解冻等细节,这些缺项在复现时需要按各自代码库默认配置核对,不从模型名称推定实现。监督来源是合成混合对应的干净参考,属于有监督训练。推理侧的计算过程是模型前向预测掩码并重构波形,论文未给出逐模型的训练时长与硬件预算,只给出参数量与每秒乘加数用于刻画部署复杂度。短时傅里叶变换一致性与掩码估计的关系需要单独强调。

短时傅里叶变换一致性 × 掩码估计: 掩码估计的分工是对含噪谱逐点相乘得到增强谱,操作只在加窗分帧域完成;短时傅里叶变换一致性的分工是要求增强谱经过逆变换再正变换后仍自洽,因为分帧加窗重叠会让任意掩码结果不一定对应真实时域信号。搭配理由是即使理想幅度掩码加含噪相位重构也会有不一致伪影,组合意义是损失在计算前强制走一遍一致性重构,使复数惩罚真正落在可实现的信号上。

用什么模型、什么数据、什么指标来验证可调性?

为验证普适性,论文选了 4 个差异很大的架构。轻量实时因果模型参数最少,适合端侧;双路径卷积循环的 U 形网络居中;状态空间模型与并行去噪幅度相位的变换器模型较大且非因果,在公开合成集上感知分很高。四者覆盖因果与非因果、轻量与大算力,便于观察同一损失在不同容量下的行为。

评估用两个测试集,一个是众包实地录制的盲测集,含 389 个文件,时长 10 秒到 365 秒,背景为真实噪声;另一个是合成测试集,含 824 个片段,时长 1 到 10 秒,按多档信噪比混合。由于大模型显存受限,长文件只取前 30 秒评估。指标分两类,非侵入式感知分给出语音质量分、背景噪声分与总体分,有参考指标给出语音质量客观分、可懂度分、尺度不变信失真比,再用通用语音识别模型转写增强音频并与人工标注对比计算词错误率。

论文明确指出非侵入式感知分不能可靠发现语音被丢掉或改写,因此必须配有参考指标一起看。基线方面,两个大模型有官方公开权重可作基线,两个小模型因无公开权重而不报告基线,这一点在对比时要记住口径差异。 下表把 4 个模型的规模与定位放在一起比较,比较问题是同一损失是否跨容量有效,公平条件是同一训练集、同一分帧与同一选档规则,指标方向是参数量与算力越小越利于部署,但不直接代表增强质量。

表中轻量模型的算力比大模型低两个数量级以上,这解释了为什么相关性扫描选在轻量模型上做,而三点调参同时在 4 个模型上做。未胜出项要提前说明,大模型在合成集的语音质量客观分上基线更高,论文称基线是针对该指标专门优化的,因此新损失的优势更多体现在盲测集的泛化与可调性,而不是在合成集上全面压过基线。

λ 真的能拨动结果吗:三点调参与十三点扫描显示什么?

三点调参覆盖 0.35、0.5 与 0.65,分别对应偏抑制、均衡与偏保语音。论文报告,在每个模型组内偏抑制档在两套测试集上都拿到组内最高的背景噪声分;均衡档在语音质量分与背景噪声分之间取得平衡,并拿到最高的尺度不变信失真比,超过各自基线;偏保语音档在两套测试集上拿到三档中最高的语音质量分,两个大模型在盲测集上还超过了基线。

所有模型的词错误率相对含噪基线下降约三成到四成半,支持该损失有助于下游识别的判断,但论文未报告误判率置信区间,因此只能说支持,不能说因果成立。十三点扫描在轻量模型上从 0.2 到 0.8 以 0.05 为步长展开,语音质量分随 λ 增大总体上行,背景噪声分随 λ 增大总体下行,皮尔逊相关系数分别为 0.95 与 -0.96,伴随极小的显著性值,显示强且统计显著的相关。

下导读段完整说明该图的对象与条件,图中上下面板共享横轴 λ,纵轴分别为语音质量与背景噪声,散点颜色按面板区分,时间范围是单次扫参后的盲测集评估,不是训练曲线。

看图路径: 1. 先看横轴 λ 从 0.2 到 0.8 的覆盖范围,确认是同一轻量模型扫 13 个点的结果;2. 再对比上方面板蓝色语音质量点随 λ 上升、下方面板红色背景噪声点随 λ 下降;3. 注意两端离群点:在 0.2 附近语音质量明显偏低,在 0.8 附近背景噪声明显偏低;4. 结合正文相关系数判断中间段 0.3 到 0.65 是两者相对均衡的可选区间

原论文 Figure 1:DNSMOS SIG and BAK scores on the DNS5 Blind Test Set for LiSenNet models trained across a range…

论文图 1。原论文 Figure 1:“DNSMOS SIG and BAK scores on the DNS5 Blind Test Set for LiSenNet models trained across a range of λ val- ues, showing strong correlations between λ and both evaluation metrics.”。

从像素可见,上方蓝色散点从左侧最低点附近爬升,中间在 0.45 附近有小幅平台与回落,右侧在 0.6 到 0.8 继续走高但在 0.7 附近略有起伏;下方红色散点从左侧最高点附近下滑,中间在 0.35 到 0.4 附近斜率放缓,右侧在 0.6 之后加速下滑,到 0.8 跌至最低。这种镜像走势与正文相关系数一致,但也显示总体趋势不等于每一步单调,个别相邻 λ 会出现小幅逆行。

重提结果时要增加适用条件,论文指出 0.3 到 0.65 之间总体表现较好,靠近 0.5 能在保语音与压噪声之间取得有利平衡,同时仍允许向一侧倾斜。 下表把 λ 策略与相关性证据放在一起,比较问题是不同 λ 是否对应可预期的偏向,公平条件是同一模型与同一盲测集,指标方向是语音质量分越高越保真、背景噪声分越高越干净。

来源证据量化值一量化值二量化值三量化值四
来源句一0.350.50.65—
来源句二0.954.1107
来源句三0.962.7107

表后解释主要收益与具体代价,收益是调参方向可预期且跨架构复现,代价是两端会出现明显折损,偏抑制端语音质量分显著走低,偏保真端背景噪声分显著走低。未胜出项是均衡档并非所有感知分都最高,合成集上基线的语音质量客观分仍占优,因此不能把可调性理解为全面超越。

来源证据量化值一量化值二量化值三量化值四
来源句一5———
来源句二252.2——

该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据。

语音质量 × 噪声抑制: 语音质量的分工由语音质量分、参考型指标和词错误率共同刻画,反映语音是否被保留和可懂;噪声抑制的分工由背景噪声分刻画,反映残留噪声是否被压住。搭配理由是两者在重叠频带天然冲突,提高一侧往往损害另一侧,组合意义是论文不追求单点最优,而是用 λ 把折中曲线完整扫出来,让游戏语音偏抑制、应急通信偏保真等任务各自选点。

如果只看一端或去掉相位项会怎样:论文给了哪些对照?

论文没有做把复数项置零或把指示函数去掉的传统消融,而是用 λ 扫描本身充当对照。把 λ 推到 0.25 及以下,可视为近似只看噪声项的极端,此时背景噪声分高但语音质量分显著下跌,对应过度衰减语音相关频率。把 λ 推到 0.7 及以上,可视为近似只看语音项的极端,此时语音质量分最高但背景噪声分显著下跌,对应重叠区噪声泄漏增加。这种两端对照支持两项缺一不可的判断,但属于有限解释,因为极端档仍保留另一项的小权重,并非严格的单项切除。

另一组隐含对照是不同容量的 4 个模型在同一三档下的行为一致性,轻量因果模型与大非因果模型都呈现低 λ 偏干净、高 λ 偏保真的单调大势,支持可调性与架构解耦。论文还对比了加权同时优化与每步取最大值的单项优化,指出后者可能振荡,但未给出两者的同条件数值对比,因此只能作为动机层面的区分,不能当作已验证的胜负。

相位项的作用有文献引用支撑,称其对复数模型训练关键且能提升加一致性约束的幅度模型,但本文未单独报告去掉相位项后的数值,故复现时若要验证相位贡献,需要自行补一组保持其他条件不变的对照。

边界与未验证之处在哪里?

边界首先在 λ 两端,论文明确写出过低会过抑制、过高会漏噪,因此实际部署不宜把 λ 当作无约束旋钮,论文建议的较好区间在 0.3 到 0.65 附近。其次在评估口径上,盲测集长文件对大模型只取前 30 秒,可能与整文件评估存在差异;合成集基线在语音质量客观分上更强,说明新损失的增益具有数据集与指标依赖性。

未验证之处包括训练与推理成本,论文只给出参数量与每秒乘加数,未报告训练 GPU 小时、内存峰值、实时因子与实际延迟,因此不能承诺延迟或成本改善。统计层面只报告相关系数与显著性值,未报告多次随机种子的方差与置信带,十三点扫描的个别逆行点也提示单次结果存在波动。误判率、说话人改变与语义保真等风险未被直接测量,非侵入式感知分本身也不能发现语音被丢掉的情况,论文用有参考指标与词错误率部分弥补,但仍不是完备的人听评价。

相关性不等于因果,λ 与指标的相关不能直接解释为单独拨动 λ 就一定在新场景产生同样幅度的变化,换噪声类型与换语言仍待验证。

要复现应先固定什么,再扫什么?

复现先固定数据与变换口径,再扫 λ。数据用语音库与噪声库合成训练集并降采样到 16 kHz,测试同时覆盖众包真实噪声盲测集与合成测试集,避免只在合成集上调参。变换固定为每帧 512 采样、半重叠、汉恩窗,损失计算带一致性重构且与变换同参数,学习率与衰减、两百周期与验证损失选档按原文设置。模型侧建议先用轻量模型复现十三点扫描,因为成本低且能完整看到折中曲线,再把 0.35、0.5、0.653 档搬到其余架构验证方向一致性。

评估同时跑感知 3 分、有参考 3 分与词错误率,方向是除词错误率越低越好外其余越高越好。关键超参数是压缩因子与复数幅度权衡,论文沿用文献常用值,复现时不要轻易改动,否则会混淆 λ 的效果。信息条件方面,论文写明部分模型代码来自官方仓库、部分大模型有权重基线,但本次解读所依据的资源状态未验证当前可达,因此复现前需自行确认所用仓库与权重的版本和可运行性,区分代码可用、权重可下载与端到端可运行三件事。

下表把训练配置整理为可执行清单,便于逐项核对。

来源证据量化值一量化值二量化值三量化值四
来源句一512 samples50%——
来源句二5104—

表后补充代价与检查点,固定两百周期与最低验证损失选档可能偏向合成验证集,盲测集的泛化需要在选档后单独确认;长文件截断评估要在报告中注明起止范围,避免与整文件结果混比;若显存不足,应优先缩短评估窗而非改模型结构,并在复现记录中写明截断长度。

何时值得尝试这种可调损失?

当产品需要在同一套模型上服务不同任务偏好时值得尝试,例如同一模型既要给游戏语音提供更干净的背景,也要给通话场景保留更完整的语音,此时用 λ 在训练期定偏好比事后调阈值更直接。当模型容量受限且无法同时做好两端时,也值得用该损失先扫出折中曲线,再按任务选点,而不是盲目追求单指标最高。复现的最小闭环是轻量模型加十三点扫描加双测试集加七指标并列,看到镜像相关后再谈选型。

还需补的验证包括多种子方差、人听评价、真实延迟与端侧功耗,以及跨噪声库与跨语言的稳定性。常见误解是把背景噪声分高直接等同于整体好,实际上偏抑制端可能伴随语音质量分与可懂度代价;另一个误解是把均衡档当作全指标最优,实际上合成集上基线的语音质量客观分仍可能更高。

回到中心矛盾,语音与噪声重叠决定了增强永远在做取舍,本文的贡献是把取舍做成一个可核对、可复述的旋钮,并用跨架构的一致行为证明旋钮方向可靠,而不是宣称旋钮本身消除了取舍。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总