论文解读

The 3rd Clarity Prediction Challenge: A Machine Learning Challenge for Hearing aid Speech Intelligibility Prediction

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3264 字 阅读 →
论文解读

Towards Lightweight Adaptation of Speech Enhancement Models in Real-World Environments

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4520 字 阅读 →
论文解读

Towards Real-Time Generative Speech Restoration with Flow-Matching

语音增强 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4390 字 阅读 →
论文解读

Training-Free Inference-Time Scaling for Audio Source Separation

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3556 字 阅读 →
论文解读

Two-Stage Language Model Framework for Acoustic Echo Cancellation

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4401 字 阅读 →
论文解读

UJCodec: An End-to-end Unet-Style Codec for Joint Speech Compression and Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4672 字 阅读 →
论文解读

UNet-Based Fusion and Exponential Moving Average Adaptation for Noise-Robust Speaker Recognition

说话人验证 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5394 字 阅读 →
论文解读

Universr: Unified and Versatile Audio Super-Resolution Via Vocoder-Free Flow Matching

音频超分辨率 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4168 字 阅读 →
论文解读

VChangeCodec: An Ultra Low-Complexity Neural Speech Codec with Built-In Voice Changer for Customized Real-Time Communication

语音转换 语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5237 字 阅读 →
论文解读

What the student learns in knowledge distillation: A subspace view and evidence on Convolutional Recurrent Network

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4287 字 阅读 →
论文解读

Whisper-FEST: Single-Channel Far-Field Enhanced Speech-to-text without Parallel Data

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4962 字 阅读 →
论文解读

Speech Enhancement Based on Drifting Models

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5266 字 阅读 →
论文解读

Dilated CNNs for Periodic Signal Processing: A Low-Complexity Approach

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2311 字 阅读 →
论文解读

Time vs. Layer: Locating Predictive Cues for Dysarthric Speech Descriptors in wav2vec 2.0

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4210 字 阅读 →
论文解读

TokenSE: a Mamba-based discrete token speech enhancement framework for cochlear implants

本文针对人工耳蜗用户在噪声和混响环境下语音理解困难的问题,提出了一种名为TokenSE的语音增强框架。该框架的核心创新在于将语音增强任务从传统的时频域或波形域转换到神经音频编解码器的离散令牌空间中进行

 · 更新于 2026-09-25 · 约 8 分钟 · 3634 字 阅读 →
论文解读

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations

这篇论文旨在解决通用语音增强(USE)中生成模型面临的“高感知质量”与“低内容幻觉”难以兼得的核心矛盾。作者提出了UniPASE框架,它扩展了其先前的低幻觉PASE模型,以处理包括噪声、混响、丢包、风

 · 更新于 2026-09-25 · 约 14 分钟 · 6902 字 阅读 →