会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
论文解读

下限增益保住弱语音:用逐帧贝塔约束修补判决引导增强

针对低信噪比下判决引导增益过度衰减弱语音的问题,论文提出逐帧下限增益的 ABCDD 结构并用轻量 MLP 自动预测贝塔,在代表性样本上全面优于谱减法和经典 DD,在 100 条未见 VoiceBank-DEMAND 测试上把平均对齐信噪比从 9.41 dB 提升到 13.82 dB,代价是贝塔过大仍会残留噪声且感知质量未验证。

 · 约 17 分钟 · 8443 字 阅读 →
论文解读

只用两个全向麦克风做出可转向高阶差分波束:神经差分波束形成器如何学图案

针对双麦克风线性阵列只能做一阶、难以保持波束形状随指向平移的问题,该研究用深度网络直接估计两通道复权值去逼近预设的一阶与三阶心形差分图案,在端射方向取得高于经典差分与参数化方法的信号失真比,同时保持跨指向与跨频率的形状一致,并以左右各一个转向模型演示立体声录制,代价是训练依赖无混响仿真与固定阵列几何。

 · 约 20 分钟 · 9825 字 阅读 →
论文解读

不看配对样本,如何学到从退化到干净的随机输运

SE-MSB 用扩散薛定谔桥在干净与退化语音分布之间学习双向随机输运,并以端到端 Mamba 波形模型实现,在去混响与混合退化上报告可比拟配对方法的效果,同时保持少步采样与低计算量。

 · 约 18 分钟 · 8882 字 阅读 →
论文解读

训练走解析路径、推理走自生轨迹:纠正性强制如何统一后训练扩散与流

针对解析训练态与自生 rollout 态的暴露偏差,纠正性强制用动态 rollout 纠正加反事实转移一致性统一后训练 SB-VE 与 OT-CFM,在 VoiceBank 上把 SB-VE 的 PESQ 从 3.07 提升到 3.21 并稳定多步 SI-SDR,代价是 UTMOS 提升有限且需额外 rollout 开销。

 · 更新于 2026-09-24 · 约 23 分钟 · 11351 字 阅读 →
论文解读

共享一块做精修:ADER 用早停深度与单专家适配省掉冗余迭代

针对固定深度对所有语音做同样多次精修的浪费,ADER 用共享 TS-Transformer 块循环精修并以深度控制器硬早停加每步单专家残差适配,在 VCTK-DEMAND 上以平均 2.15 次迭代达到 WB-PESQ 3.37,代价是相对固定 3 步共享块仍有约 2.6% 的感知质量下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8386 字 阅读 →
论文解读

不碰权重只改掩码:BLINC 用盲估计双峰分布做免训练校准

针对掩码型语音增强在域偏移下掩码双峰性退化的问题,BLINC 冻结模型并用直方图匹配把预测掩码重映射到由含噪信号盲特征决定的双峰目标分布,在几乎不增加耗时的条件下提升了感知质量,但以信号级指标下降和无法修复排序错误为代价。

 · 更新于 2026-09-24 · 约 15 分钟 · 7245 字 阅读 →
论文解读

不用判别器猜分数:并行建模谐波与可微感知损失如何分工

针对带噪语音中浊音谐波易被抹掉且 PESQ 不可微的问题,HAMMER 用时间-频率并行注意力-Mamba 加自相关前馈建模周期性,并用软化 PESQ 加可微 LLR 直接优化,在 VoiceBank+DEMAND 上报告 3.69 PESQ 和 4.41 COVL,推理时对比度拉伸可到 3.79 PESQ 但背景分随之下降。

 · 更新于 2026-09-24 · 约 19 分钟 · 9261 字 阅读 →
论文解读

年轻听众能分开的增强差别,为何在年长听众组平均中变平

该研究用同一套自然对白与九种增强和锚点条件比较年轻正常听力组与四个年长听力组的绝对质量评分,报告年长组系统间可分差异收缩而整体水平随听阈加重下移,最强证据是核心增强两两对比点数范围的缩小与条件平均分差,代价是输出信噪比较高且助听模式高度简化。

 · 更新于 2026-09-24 · 约 17 分钟 · 8277 字 阅读 →
论文解读

不动 ASR 模型,如何把田间嘈杂的多人农问转写做准

针对田间噪声、多说话人和农业词汇三类失败,论文用可开关的增强、说话人分离与词表修复包裹未改动的 ASR 模型,在印地语等三语评估上实现云端相对 16% 至 23% 的词错误率下降,多说话人下达 32% 至 42%,代价是增强与修复只在证据支持时生效且 M4 未被测量。

 · 更新于 2026-09-24 · 约 19 分钟 · 9045 字 阅读 →
论文解读

用稀疏局部图约束跨模态对齐,再让 Mamba 管长时序的轻量音视增强

针对轻量音视语音增强中拼接缺乏结构、先验稠密注意力易错配的问题,SG-Mamba 用±3 帧稀疏异构图做局部内容自适应融合再交由单向 Mamba 建模全局时序,在 LRS3 噪声下取得 13.091 dB SI-SDR,代价为 5.3 M 参数和 3.45 G MACs。

 · 更新于 2026-09-24 · 约 18 分钟 · 8523 字 阅读 →
论文解读

在多通道输出里做掩蔽:增强越强,残留干扰的空间感丢得越多吗

该文用理想比值掩蔽比较麦克风、波束形成器和 Ambisonics 三种域的增强,报告显示波束域语音质量最高而 Ambisonics 域更好地保留残留干扰的空间属性,且所有方法都保留目标声源定位线索,但以混响目标为期望才能保住混响。

 · 更新于 2026-09-24 · 约 15 分钟 · 7495 字 阅读 →
论文解读

低延迟下还要能转向:FiLM-OSN 如何保住指向性与双耳关系

针对助听器 10 ms 延迟与头影效应下的可转向增强问题,论文提出 FiLM 条件化的 OnlineSpatialNet 与 IPD 相位保持损失,在 8 ms 窗条件下恢复指向性并在 PESQ/ESTOI/SI-SDR 上接近 32 ms 基线,代价是仍需固定主瓣宽度与衰减上限且依赖仿真 HARTF 训练。

 · 更新于 2026-09-24 · 约 19 分钟 · 9372 字 阅读 →
论文解读

粗粒度保语义、细粒度保波形:DualSpecSE 为何要双路同时增强 Mel 与复谱

针对单做 Mel 需外接声码器而失真、单做复谱难学且伤识别的问题,DualSpecSE 用 Mel 分支保可识别成分、复谱分支保波形细节并以交互与融合连接,在 DNS2020 上 WB-PESQ 达 3.25、CHiME-4 波形输出 WER 降至 14.76%/13.21%,代价是双分支与多损失联合训练的复杂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8732 字 阅读 →
论文解读

同一套因果 Mamba 核心如何兼顾 16 毫秒流式与高延迟离线增强

该文针对 CHiME-9 Task2 多通道助听增强的延迟与跨通道建模矛盾,采用延迟感知外壳加单向时间 Mamba 核心的解耦结构,在助听器开发集上因果配置以 1.36M 参数和 0.005 实时率超越官方基线,离线加深配置进一步提升指标但延迟增至秒级。

 · 更新于 2026-09-24 · 约 18 分钟 · 8549 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

只漂移分布不对齐波形:DriftSE 为何要用语义加声学双潜空间做一步增强

DriftSE 把语音增强写成潜空间分布对齐问题,用冻结编码器的帧级漂移场在训练时牵引生成分布、推理时丢弃漂移只做一次前向,在四个数据集上以 1 次函数求值取得词错误率最优,但纯声学潜空间会出现幻觉而非配对训练会损失语义保真度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10330 字 阅读 →
论文解读

不动主模型只调混合旋钮:用感知奖励微调多通道语音增强

该文在因果多通道时频网格网络基线不动的情况下,用近端策略优化学习少量混合系数,以感知函数相对基线的提升为奖励,在助听器四通道与眼镜七通道发育集上取得小幅稳定改进,但混合结构保守且奖励依赖预训练评估模型。

 · 更新于 2026-09-24 · 约 18 分钟 · 8625 字 阅读 →
论文解读

不均匀噪声下同时算出传递函数与各通道噪声:可学习的确定性最大似然波束形成

针对麦克风间距未知、增益未校准且各通道噪声功率不同的自组织阵列,论文用确定性最大似然把语音序列与传递函数的闭式解代入似然,只留对角噪声协方差做数值优化,在 4 通道 LibriSpeech 仿真上把阵列信噪比做到 21.18/20.63 dB 而逼近已知噪声的广义特征值波束形成上限,代价是每条语音单独迭代约 2000 轮且混响下客观可懂度与音质提升有限。

 · 更新于 2026-09-24 · 约 22 分钟 · 10633 字 阅读 →
论文解读

低信噪比谐波噪声下先做循环平稳波束形成再做神经网络去噪

针对旋转机械主导的低信噪比谐波噪声,该文用单通道循环平稳最小功率无失真响应做前端抑制谐波再接轻量掩蔽网络,在合成与真实发动机噪声上报告了一致提升,但维纳滤波对照显示增益互补而非可替代,且依赖噪声频率稳定可估计。

 · 更新于 2026-09-24 · 约 17 分钟 · 8446 字 阅读 →