论文解读

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

语音识别 | 8.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5325 字 阅读 →
论文解读

Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework

语音增强 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5269 字 阅读 →
论文解读

Don't Listen to Me: A Lightweight, Low-Latency Model for Own-Voice Cancellation in Far-Field Speech Enhancement

语音增强 | 8.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5551 字 阅读 →
论文解读

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11361 字 阅读 →
论文解读

Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement

语音增强 | 7.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5965 字 阅读 →
论文解读

FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS

语音合成 | 10/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5749 字 阅读 →
论文解读

Latency-Configurable Streaming Speech Enhancement via Asymmetric Temporal Padding

语音增强 | 7.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5381 字 阅读 →
论文解读

Time-Unconditional Generative Speech Enhancement via Autonomous Rectified Flow

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5796 字 阅读 →
论文解读

Transcript-Free Flow-Matching Text-to-Speech via Speech Feature Conditioning

语音合成 | 7.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4674 字 阅读 →
论文解读

QC-GAN: A Parameter-Efficient Quaternion Conformer GAN for High-Fidelity Speech Enhancement

语音增强 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6928 字 阅读 →
论文解读

PhASE-Flow: Phonetic-Conditioned Acoustic Flow Matching in SSL Representation Domain for Speech Enhancement

语音增强 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6160 字 阅读 →
论文解读

Single frequency filtering based multi-speaker direction of arrival estimation from stereo recordings

语音增强 | 7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5711 字 阅读 →
论文解读

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

语音识别 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6566 字 阅读 →
论文解读

An Empirical Study on Learning Latent Representations for Emotional Speech Synthesis

语音合成 | 8.2/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4584 字 阅读 →
论文解读

Towards Robust Generative Speech Enhancement Using Vector Quantisation-Based Neural Audio Codec

语音增强 | 5.9/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8860 字 阅读 →
论文解读

HIDVAS: A Hearing Instrument Dataset in Various Acoustical Scenarios for Algorithm Evaluation and Training

语音增强 | 9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4950 字 阅读 →
论文解读

BASENet: Band-Adapted Speech Enhancement Network with Cross-Band Attention

语音增强 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5907 字 阅读 →
论文解读

Generating Training Targets for Real-World Speech Enhancement via Close-to-Distant Microphone Projection

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4533 字 阅读 →
论文解读

HALO: Half-Frame-Rate Adaptive Learnable Operator for Lightweight STFT-Based Speech Enhancement

语音增强 | 8.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4830 字 阅读 →
论文解读

G-MaP-SE: Guided Speech Enhancement via GMM-Based Prior Matching

语音增强 | 9.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5176 字 阅读 →