论文解读

生成用短时谱、判别用对数谱:DSME 为何把预测与判别分开

DSME 用短时傅里叶谱显式生成幅值与相位、用恒 Q 谱作八度分段判别并加入色度损失,在独奏音乐的三类仿真退化中改善多数客观指标;主观偏好仅在混合失真任务上优于三个基线,该任务的 FAD 仍劣于 MP-SENet。

 · 更新于 2026-09-24 · 约 19 分钟 · 9394 字 阅读 →
论文解读

耦合失真下不换模型而换管线:StrixAE 用智能体调度专家模型

针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。

 · 更新于 2026-09-24 · 约 22 分钟 · 10852 字 阅读 →
论文解读

失配时只听一条语音:用干净先验把增强输出推向高密度区

针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。

 · 更新于 2026-09-24 · 约 19 分钟 · 9429 字 阅读 →
论文解读

耳塞在震动什么:骨导语音的低频直线与单轴传感器的容差

语音增强 | 6.3/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10402 字 阅读 →
论文解读

在喇叭与犬吠同时响起时听清人声:VAANI 如何把印度田野噪声钉在时间轴上

语音识别 | 5.8/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9553 字 阅读 →
论文解读

开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消?

语音增强 | 7.5/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13172 字 阅读 →
论文解读

相位不再复用:当 Transformer 学会看懂复数谱图

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11532 字 阅读 →
论文解读

干净本身成了开关:当语音增强的理想输出反噬自身

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10275 字 阅读 →
论文解读

把循环拆成并行:用时带混合与自适应回退让增强前端不再拖累识别

语音增强 | 6.2/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9926 字 阅读 →
论文解读

听得更干净,却想得更错:当语音增强把大模型带偏

语音增强 | 8.0/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10322 字 阅读 →
论文解读

相位越不准,幅度越要背锅:用频带加权把流式增强从过衰减里拉回来

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10215 字 阅读 →
论文解读

把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗

语音增强 | 6.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8494 字 阅读 →
论文解读

不用再把 PDM 翻译成 PCM:让状态空间模型直接听懂单比特麦克风

语音增强 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8773 字 阅读 →
论文解读

既要指向性,又要去混响:一次前向如何重建干净的虚拟方向麦克风

空间音频 | 5.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7955 字 阅读 →
论文解读

LipsAM: Lipschitz-continuous Neural Networks for Convergent Plug-and-Play Audio Signal Recovery

音频修复 | 10.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4404 字 阅读 →
论文解读

SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

语音增强 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4594 字 阅读 →
论文解读

Training DeepFilterNet with Accurate Room Acoustic Simulations Improves Single-Channel Speech Enhancement

语音增强 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4932 字 阅读 →
论文解读

μNet: Ultra-Low-Memory and Low-Complexity Speech Enhancement for Embedded Digital Signal Processors

语音增强 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5258 字 阅读 →
论文解读

A Novel Binaural Cue Preservation Loss for DNN-Based Binaural Speech Enhancement

语音增强 | 5.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6438 字 阅读 →
论文解读

Feedforward Active Speech Suppression Based on Time Series Prediction of Speech Signals Using Neural Networks

语音增强 | 5.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5815 字 阅读 →