论文解读

Beyond Binary: Speech Representations Across the Cognitive Score Hierarchy

自监督学习 | 8.1/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6023 字 阅读 →
论文解读

Can We Hear from Events? Generating Speech from Event Camera

语音合成 | 7.8/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6885 字 阅读 →
论文解读

CFMDCTCodec: A Low-Bitrate Neural Speech Codec with Noise-Prior-aware Conditional Flow Matching for MDCT-Spectral Enhancement

语音编码 | 8.4/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5946 字 阅读 →
论文解读

Continual Speaker Identity Unlearning with Minimal Interference

语音合成 | 8.3/10

 · 更新于 2026-09-09 · 约 4 分钟 · 1998 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7769 字 阅读 →
论文解读

cSTMM: A Unified Complex Spherical Student's \(t\) Mixture Model for Directional Statistics in Mask-Based Blind Speech Separation

语音分离 | 7/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4996 字 阅读 →
论文解读

Decoding Stimulus Reconstruction-Based Auditory Attention Robustly in Unbalanced EEG Datasets

Decoding Stimulus Reconstruction-Based Auditory Attention Robustly in Unbalanced EEG Datasets

 · 更新于 2026-09-09 · 约 18 分钟 · 8727 字 阅读 →
论文解读

DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation

语音合成 | 7.5/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6978 字 阅读 →
论文解读

Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception

Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception

 · 更新于 2026-09-09 · 约 13 分钟 · 6047 字 阅读 →
论文解读

Exploration of Perceptual Speech Features for Clinical Decision-Support in Mental Health Care

语音情感识别 | 5/10

 · 更新于 2026-09-09 · 约 22 分钟 · 10543 字 阅读 →
论文解读

FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions

语音识别 | 5.5/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5287 字 阅读 →
论文解读

FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations

语音合成 | 6.5/10

 · 更新于 2026-09-09 · 约 14 分钟 · 7010 字 阅读 →
论文解读

From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models

语音合成 | 6.9/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6488 字 阅读 →
论文解读

G-iMUSIC: Greedy Iterative MUSIC Algorithms for Multi-Target DoA Estimation

G-iMUSIC: Greedy Iterative MUSIC Algorithms for Multi-Target DoA Estimation

 · 更新于 2026-09-09 · 约 13 分钟 · 6152 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

语音合成 | 10/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6556 字 阅读 →
论文解读

Learning When to Think While Listening in Large Audio-Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-09 · 约 5 分钟 · 2186 字 阅读 →
论文解读

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

音频生成 | 6.0/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5779 字 阅读 →
论文解读

LongCat-Video-Avatar 1.5 Technical Report

语音合成 | 7.5/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7471 字 阅读 →
论文解读

MERIT: Learning Disentangled Music Representations for Audio Similarity

音频检索 | 9/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5351 字 阅读 →
论文解读

Music Transcription with (Almost) No Supervision

音乐转录 | 7.5/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5819 字 阅读 →