论文解读

连续编码表示上的分块解码:在一次前向与逐帧之间调节增强代价

论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8929 字 阅读 →
论文解读

不看未来也能补高频:StreamWSR 的因果波形超分

StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。

 · 更新于 2026-09-25 · 约 17 分钟 · 8454 字 阅读 →
论文解读

用最轻的耳蜗换最高的精度:HLP 脉冲编码为何在干净数据上赢、在嘈杂数据上输

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12869 字 阅读 →
论文解读

在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10440 字 阅读 →
论文解读

同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹

音乐转录 | 8.2/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11909 字 阅读 →
论文解读

1500 个音频 token 真的都需要吗?用等间隔抽样戳破 Whisper 的时域冗余

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10278 字 阅读 →
论文解读

把截断搬进频域:用 sinc 重采样让振荡器同步不再混叠

音乐生成 | 7.9/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3105 字 阅读 →
论文解读

把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗

语音增强 | 6.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8494 字 阅读 →
论文解读

把教师的回声残差教给小模型:AEC 蒸馏到底补回了什么

回声消除 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4423 字 阅读 →
论文解读

别把旧类压成一个点:SPECTRA 用低秩几何给 5-shot 音频增量学习留住记忆

音频分类 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5815 字 阅读 →
论文解读

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

声源定位 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5988 字 阅读 →
论文解读

A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels

声源定位 | 9.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4554 字 阅读 →
论文解读

A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation

回声消除 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5120 字 阅读 →
论文解读

PolyChirp: Multi-Species Birdsong Classification Using TinyML on Low-Power Acoustic Sensors

音频分类 | 10.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4900 字 阅读 →
论文解读

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

音视频理解 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4759 字 阅读 →
论文解读

SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

语音增强 | 7.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4594 字 阅读 →
论文解读

Spiking Neural Networks for Energy-Efficient Object Detection in Forward-Looking Sonar Imagery

音频事件检测 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4625 字 阅读 →
论文解读

TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5444 字 阅读 →
论文解读

WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

语音交互 | 9.4/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5062 字 阅读 →
论文解读

A Resource-Efficient CNN-Based EEG Auditory Attention Decoding ASIC

助听器 | 6.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5899 字 阅读 →