英文题目:SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

会议身份:conference:interspeech:2026:conference-paper-id:zhang26n_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#会议转录 #端到端学习 #语音 #语音增强

评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jinming Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Wei Rao:机构信息未能从会议 PDF 纯文本可靠映射
  • Xionghu Zhong:机构信息未能从会议 PDF 纯文本可靠映射
  • Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

会议录音的输入是带噪声混响且音量起伏大的单通道波形,目标是输出干净且响度均衡的波形,难点在于先增益会放大噪声而先增强又易抹掉小音量语音。语音增强(Speech Enhancement,SE)先在时频域去噪并保留音量差异,其输出经均方根归一化后进入自动增益控制(Automatic Gain Control,AGC),经频域卷积与双向长短时记忆网络建模做响度均衡,最后用增强相位经逆短时傅里叶变换重建波形。两模块以非对称惩罚联合优化,SE重罚过抑制而AGC重罚静音区虚假能量,从而让SE敢于保留弱语音并把音量交给AGC。与已有级联做法的关键差异是双目标端到端协同而非独立串接,避免了噪声放大与弱语音丢失的恶性循环。在LibriAGC测试集下,SE-AGCNet的WER为6.88%,低于MP-SENet(SE)+pyagc的WER 7.09%。该结论目前仅在英语朗读仿真与两组真实会议远场数据上验证,未覆盖强混响多说话人重叠与在线低延迟条件。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,要输出什么,会议音频难在哪?

输入是一段会议录音波形,记为长度为 L 的向量,里面同时混着背景噪声、混响和忽大忽小的说话声。大小声的来源很具体:离麦克风远近不同、说话人音量习惯不同、头部转动或身体移动都会改变拾取电平。目标输出是一段干净且音量平衡的波形,既要去掉噪声,又要把整体响度稳定到可懂、适合后级识别的水平。

传统做法把语音增强和自动增益控制做成前后级联的两个独立模块。如果增益在前,它不分 speech 与 noise 一起放大,信噪比被拉低,后续降噪更难;如果增益在后,它的成败高度依赖增强质量,残留噪声会被再次托起。论文还点出增强本身的偏置:低音量语音容易被误判为噪声而过度抑制,远场小声段首当其冲。

因此这篇论文只研究 1 个任务:在会议室声学下联合做增强与响度控制。必须保留的信息是两类监督目标的区分:增强目标是干净但音量不平衡语音,增益目标是干净且音量平衡语音。输出是增强后幅度谱配增强后相位谱重建的波形。本文按学习依赖展开,先讲路线差异与整体流程,再拆组件计算与训练构造,最后讲实验条件、结果与复现边界。

同输入同目标的已有路线为何不够用?

同输入、同目标、同运行阶段的直接对照是 3 类基线。第一类是原始 MP-SENet 检查点,它在 DNS Challenge 2020 数据上训练,没有见过大幅度音量起伏,论文报告它在仿真测试上出现严重的远场过抑制。第二类是分开训练的 MP-SENet 增强版,输入是噪声且音量不平衡音频,目标是干净但音量不平衡音频,只做降噪不做归一。第 3 类是单模型同时学两件事的 MP-SENet 增益版,输入相同但目标直接是干净且音量平衡音频,试图用一个网络包办。

另一条路线是增强后接开源后处理 pyagc,它是 GitHub 上分叉最多的开源增益实现之一,源自 Ellis 的 attack/release 时间控制策略。论文把它作为传统级联的代表,用来对比联合学习是否优于分步后处理。还有文献把回声消除、增强、增益做进统一 3A 框架,但论文指出其中增益只是脱离的后处理,或增益目标来自不公开的内部工具,影响复现与性能上限。

本文的教学例子是:把小声远场句先送增强再送增益。若增强已删掉该句,后级增益只能放大噪声;若增强保留但电平偏低,后级增益才有干净底子可调。这解释了为何论文坚持联合优化,而不是把两个现成模块简单串起来。

要解决的两个耦合问题是什么?

第一个问题是增强的保真与抑制矛盾。模型要在时频格点上判断每个点是语音还是噪声,噪声抑制越激进,低能量语音越危险。会议中远场语音能量本就接近噪声,逐点硬判决极易删小声。第二个问题是增益的放大选择性。增益只看包络调电平,它不知道残留的是语音还是噪声,一旦增强留下底噪,增益会把静音段的底噪一起托起来,主观响度达标但噪声更明显。

论文把协同目标写得很直白:增强被鼓励保留低音量语音并专注降噪,因为它确信音量归一会由增益模块接管;增益则在相对干净的底子上做电平调整,避免无差别放大。这是一种分工承诺,不是简单的多任务叠加。

评价也因此必须是 3 维的:语音质量、响度是否达标、下游识别是否变好。只看降噪指标会漏掉音量不平衡,只看响度会漏掉噪声放大,只有三者一起看才能判断联合是否成立。

沿一个样本走完输入到输出的主路径

拿一条 2 秒左右的会议片段为例。先对波形做短时傅里叶变换,得到幅度谱与相位谱,帧数记为 T,频点数记为 F。增强模块吃进带噪的幅度谱与相位谱,输出增强后的幅度谱与增强后的相位谱。此时增强目标仍保留原始的音量起伏,目的是不提前做归一。

随后增强幅度谱先做均方根归一化,再送入增益模块,得到音量平衡的幅度谱。最后用增益后的幅度谱配增强模块给出的相位谱做逆短时傅里叶变换,重建波形。重建前还做 1 次峰值归一化到 0.4,以稳定到目标响度 -23 LUFS 附近。

下图是全文唯一的结构总览,值得停留读完主路径与两处监督的位置。

语音增强 × 自动增益控制: 语音增强负责抑制噪声但保留低音量语音的相对起伏,自动增益控制负责把增强后语音的整体响度拉到目标并压缩动态范围,二者搭配的理由是级联时前者易把小声当噪声删掉、后者易把残留噪声放大,组合意义是让增强敢于保留小声,因为确信归一化会由增益模块完成。

看图路径: 1. 从左侧噪声且音量不平衡音频出发,沿箭头找到增强模型分出的两条支路;2. 确认上方幅度谱支路经过均方根归一化进入绿色增益模块,下方相位谱支路直达输出端;3. 核对两个虚线监督头分别指向增强目标音频与增益目标音频;4. 观察末端增强幅度谱与增强相位谱汇合再经峰值归一化生成干净且音量平衡音频

原论文 Figure 1:Overview of SE-AGCNet architecture.

论文图 1。原论文 Figure 1:“Overview of SE-AGCNet architecture. The system processes input audio through speech enhancement and automatic gain control modules in a joint training framework.”。

图中左侧是噪声且音量不平衡音频的语谱示意,经过绿色增强模型后分叉为橙色幅度谱支路与蓝色相位谱支路。幅度谱支路依次经过均方根归一化、绿色增益模块内的两层卷积、双向长短期记忆网络、线性与反卷积,再到增强幅度谱与峰值归一化;相位谱支路长距离直连到末端乘加节点。两处虚线监督头分别标注增强目标音频对应增强损失、增益目标音频对应增益损失,说明训练时两个模块各有自己的干净参考,但推理时只有一条前向通路。

增强模块做了什么改动,相位为何不动?

增强骨干直接采用 MP-SENet,保持原架构与训练设置:16 kHz 采样、400 点窗长、100 点跳长、400 点傅里叶变换、2 秒训练切段。论文唯一改动是损失侧的非对称重加权。具体做法是保持 MP-SENet 多损失定义不变,但对每个时频格点比较预测幅度与目标幅度,若预测小于目标即判为过抑制,就把该格点的增强损失乘以 10.0,否则保持原权重。

这样做的教学含义是:漏掉语音比留下一点噪声更贵。10 倍惩罚迫使模型在不确定时倾向于保留,尤其保护远场小声。训练时增强目标是干净但音量不平衡语音,所以模型学到的是在保留起伏的前提下降噪,把电平决策留给下游。

幅度谱 × 相位谱: 幅度谱承载能量与响度信息,是增强与增益真正修改的对象,相位谱决定波形重建时的时域对齐,搭配理由是只改幅度不改相位可以减少失真,组合意义是最终用增益后的幅度谱配增强后的相位谱做逆短时傅里叶变换得到波形。

增益模块只处理幅度谱,不碰相位谱。相位来自增强模块直接复用,避免了相位估计误差引入的金属声或混叠。幅度与相位的分工使监督更干净:幅度损失管干净程度与响度,复用相位保证重建稳定。

增益模块内部如何从归一化特征算出平衡幅度?

增益模块输入是均方根归一化后的增强幅度谱,输出是音量平衡幅度谱。内部 3 段式:频域卷积、双向长短期记忆网络时序建模、谱重建。卷积部分是两层 2 维卷积加批量归一化与修正线性单元,通道数为 16、核为 3 乘 3,得到频率感知特征。接着把特征重排为每帧 F 乘 16 的序列,送入 2 层双向长短期记忆网络,每方向隐层 256 维,再经线性层投影回 F 乘 16。重建部分用转置卷积逐级降通道并以修正线性单元保证非负幅度输出。

归一化策略是关键。训练时对输入与目标做独立均方根归一化,让模型学相对幅度控制而非绝对值。推理后的峰值归一化到 0.4 对应目标响度 -23 LUFS。论文强调因为增益已精确控制突发放大,峰值归一不会像传统做法那样被毛刺劫持而把正常语音压到极低。

频域卷积 × 双向长短期记忆网络: 频域卷积负责在时频面上提取局部频率结构,双向长短期记忆网络负责在时间轴上建模长时响度起伏与上下文,搭配理由是音量变化既有频带差异又有缓慢漂移,组合意义是先得频率感知特征再做时序平滑,避免逐帧独立增益带来的忽大忽小。

损失侧同样有条件加权:若目标幅度为零而预测大于零,就把该格点增益损失乘以 10,否则权重为 1。这直接惩罚在静音区造能量,抑制对残留噪声的放大。总损失是增强多损失加 0.9 倍的增益损失,0.9 与 MP-SENet 中幅度损失权重保持一致。

数据从哪来,课程与监督如何安排?

由于没有公开的增益数据集,论文提出可复现的仿真管线 SE-AGC-DataGen,基底是相对音量平衡的 LibriTTS。流程分 3 段:先拼接 2 到 5 个说话人的干净片段;再做两层音量处理,包括基础衰减到原音量的 5% 到 30% 或保持原量,以及 4 种增益模式各以 15% 概率施加,分别是突发尖峰、渐强、渐弱和起伏,用于模拟情绪、距离变化、设备特性与削波;最后混入从 DNS 挑战噪声集中精选的 35 段噪声,按 5 到 25 dB 信噪比混合,覆盖风扇、键盘、开关门与椅子移动等会议噪声。

监督来自同一仿真的不同阶段:第二阶段结束的干净但音量不平衡语音作为增强目标,第一阶段结束的干净且音量平衡语音作为增益目标。最终 LibriAGC 含 9487 条训练语音约 54 小时、1406 条测试语音约 8 小时,训练用 LibriTTS 训练干净 100 小时子集,测试用 LibriTTS 测试干净集。

均方根归一化 × 条件加权损失: 均方根归一化负责把输入与目标的绝对电平抹掉,让增益模块只学相对放大量,条件加权损失负责在目标静音而预测非零时施加 10 倍惩罚,搭配理由是只归一化仍可能在静音段吹起噪声,组合意义是一边学相对控制一边被禁止在无声处造能量。

训练策略是课程学习:先单独预训练增强模块 5 个轮次只用增强目标,再联合优化整体。推理时长录音用 2 秒窗、50% 重叠滑窗处理。论文未报告优化器细节与学习率曲线等完整超参数,这是复现时需要对照开源代码补齐的缺项,不能从模型名推定。

用什么数据、什么指标、与谁比才算公平?

数据集分 3 层。响度参考用 VoiceBank 加 DEMAND 与 LibriTTS,用于验证 -23 LUFS 目标是否合理。联合训练与主评用仿真 LibriAGC。泛化验证用两套真实数据:MMCSG 评估集 189 个文件约 9.4 小时,是戴 Aria 眼镜的双人对话;AliMeeting-far 远场部分 20 个文件约 10.8 小时。多通道只取第一通道。

指标分 3 组。主观用 SIGMOS 与 DNSMOS,其中 SIGMOS 含响度平均意见分,更适合增益评价;客观语音质量用 PESQ;下游用词错率与字错率,分别对应英文与中文会议。增益专用指标按 ITU-R BS.1770 与 EBU R128 定义综合响度、短期响度与响度范围。目标是综合与短期响度都回到 -23 附近,响度范围在 3 到 6 响度单位之间,过高为不平衡,过低为过度压缩。

综合响度 × 短期响度: 综合响度是按 ITU-R BS.1770 加门限的整体感知响度,短期响度是用 3 秒滑窗 1 秒跳平均的物理响度估计,搭配理由是门限会把远场小声段排除而低估不平衡,组合意义是要求两者同时回到 -23 附近并用响度范围约束动态,才算增益真正有效。

基线保持可运行:原始 MP-SENet 检查点、重训的增强版、重训的增益版,以及各自加 pyagc 后处理。重训模型都用 LibriAGC 训练数据,长音频推理条件一致。识别用 Whisper-large-v3-turbo 与 Nvidia conformer CTC 大模型两套,以检验对强弱识别器的不同增益。

仿真集上质量、响度与识别是否同时变好?

要回答的主问题是:在条件一致的 LibriAGC 测试集上,联合模型是否同时拿下语音质量、响度达标与识别提升。比较条件是同一仿真输入,指标方向为 PESQ、主观分越高越好,综合与短期响度越接近 -23 越好,响度范围落在 3 到 6 之间为达标,词错率越低越好。下表把输入、增强版与本方法放在一起,列覆盖质量、响度与识别。

条件感知质量 PESQ综合响度 LUFS短期响度 St LUFS响度范围 LRA识别词错率 WER
噪声且音量不平衡输入1.33-24.12-28.9514.8710.67 / 21.61
重训增强版 MP-SENet2.18-23.76-30.5218.617.61 / 11.20
联合 SE-AGCNet3.00-23.66-23.933.866.88 / 9.12

表中 PESQ 从 1.33 经 2.18 到 3.00 显示联合后语音质量最高,短期响度从 -28.95 与 -30.52 回到 -23.93 显示门限偏差被纠正,响度范围从 14.87 与 18.61 压到 3.86 显示动态被收紧,两套识别器的词错率都降到最低。论文报告显示原始 MP-SENet 加 pyagc 的级联仍有较高词错率,而增强版加 pyagc 虽把响度拉到达标区,但在报告指标上仍被联合模型一致超越,支持联合优化优于单纯后处理的判断。未胜出项也要看到:主观响度分上增强版与联合模型接近,说明只看平均意见分会低估短期响度与动态范围的差异,必须结合专用响度指标。

去掉联合或换成单模型会失去什么?

要回答的反证问题是:收益来自联合结构还是仅仅来自更多数据。论文用同数据重训的两个变体作对照:只做增强的版本保留起伏但不管归一,单模型直达平衡目标的版本试图 1 次学会两件事。比较条件仍是同一 LibriAGC 训练数据与同一推理滑窗,指标方向不变。下表转到响度基准与真实会议泛化,列覆盖参考响度与两套真实数据的归一效果。

条件参考综合响度 LUFS真实 MMCSG 综合响度 LUFS真实 MMCSG 响度范围 LRA真实远场综合响度 LUFS真实远场响度范围 LRA
高质量参考 VoiceBank-23.38----
高质量参考 LibriTTS-23.95----
真实原始 MMCSG/AliMeeting 远场--40.2420.21-34.8912.08
重训增强版--39.0720.83-35.6612.36
联合 SE-AGCNet--22.684.80-22.894.26

表中高质量参考的均值接近 -23 而响度范围仅 3 到 4,支持 -23 作为目标合理;真实原始录音低至 -40.24 与 -34.89 且范围高达 20.21 与 12.08,说明必须做增益;只做增强几乎不改变响度分布,而联合模型把两套真实数据都拉回 -22.68 与 -22.89 且范围回到 4.80 与 4.26。论文报告显示单模型增益版在真实集上响度反而更差,支持分工加联合比单模型包办更稳。代价是真实集识别仍有绝对误差,MMCSG 词错率与远场字错率虽为最好但并未清零,说明噪声与混响仍是瓶颈。

哪些边界没有测,哪些结论不能外推?

首先是声学边界。仿真只混会议室常见噪声与 5 到 25 dB 信噪比,未覆盖强混响大厅、重叠说话分离或移动声源跟踪,论文结尾也把更复杂声学与轻量实时模型列为未来工作。其次是评价边界。报告集中在质量、响度与识别,未测量逐帧延迟、计算量与内存占用,不能从识别提升推定实时性达标,训练资源与推理开销需要分开讨论。

再次是基线边界。pyagc 是分叉最多的开源增益之一,但并非最新或最强的商用增益,胜过它不等于胜过所有增益。单模型增益版的失败支持分工必要性,但论文没有逐层消融卷积通道、记忆网络层数或加权系数 10.0 与 0.9 的敏感性,拿掉后必然怎样属于待验证。

最后是指标解读。综合响度带门限,远场小声多时会被高估,论文用短期响度补救是合理的,但两者权重与聚合方式仍是约定,不是感知金标准。总体趋势成立不等于每句都成立,个别突发尖峰仍可能残留。

要复现应先准备什么,按什么顺序跑?

先确认资源状态。本次收到的官方资源显示代码与演示链接当前可用,地址为项目主页,可核对架构、仿真脚本与检查点是否与论文一致。若链接不可达,应明确写本次未能确认可达,不臆测。

复现顺序建议按依赖来。第一步跑通仿真管线:用 LibriTTS 生成增强目标与增益目标,检查音量衰减比例、4 种增益模式概率与噪声混合信噪比是否与描述一致,并统计输出时长与条数是否接近 54 小时训练与 8 小时测试。第二步复现增强预训练 5 轮,再开联合训练,注意总损失中增益权重 0.9 与两处 10 倍惩罚的实现位置。第三步按论文条件推理:2 秒窗、50% 重叠、16 kHz、400 窗长 100 跳长,多通道取首通道。

评价要 3 套一起跑:PESQ 与主客观分看质量,综合响度、短期响度与响度范围看是否回到 -23 与 3 到 6 区间,两套识别器看词错率与字错率。还需补的验证是延迟与显存占用,以及在自采会议室录音上的主观试听,避免只在仿真集上自证。

何时值得尝试这套联合思路?

当你的会议链路同时出现小声被吞与整体忽大忽小时,值得尝试先保留后归一的思路。增强侧用非对称惩罚保小声,增益侧用归一化学相对控制再用条件惩罚保静音,这种分工在仿真与两套真实数据上都把响度拉回目标并降低识别错误,尤其对训练数据有限、对音质更敏感的识别器帮助更大。

不值得盲目照搬的情形是已有强增益或强降噪且链路延迟吃紧时,因为本文未证明计算与延迟最优,也未在重叠语音与强混响下验证。动手前先想清楚监督从哪来:没有双目标仿真就没有联合训练,单模型直达平衡目标在论文中并未成功。

一句话收束:把增强的职责收敛为保语音去噪声,把归一的职责交给轻量增益并用联合损失约束两者,是这篇论文可复述、可核对的核心动作。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总