论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-30 · 约 16 分钟 · 7769 字 阅读 →
论文解读

cSTMM: A Unified Complex Spherical Student's \(t\) Mixture Model for Directional Statistics in Mask-Based Blind Speech Separation

语音分离 | 7/10

 · 更新于 2026-09-30 · 约 10 分钟 · 4996 字 阅读 →
论文解读

Decoding Stimulus Reconstruction-Based Auditory Attention Robustly in Unbalanced EEG Datasets

Decoding Stimulus Reconstruction-Based Auditory Attention Robustly in Unbalanced EEG Datasets

 · 更新于 2026-09-30 · 约 18 分钟 · 8727 字 阅读 →
论文解读

DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation

语音合成 | 7.5/10

 · 更新于 2026-09-30 · 约 14 分钟 · 6978 字 阅读 →
论文解读

Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception

Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception

 · 更新于 2026-09-30 · 约 13 分钟 · 6047 字 阅读 →
论文解读

Exploration of Perceptual Speech Features for Clinical Decision-Support in Mental Health Care

语音情感识别 | 5/10

 · 更新于 2026-09-30 · 约 22 分钟 · 10543 字 阅读 →
论文解读

FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions

语音识别 | 5.5/10

 · 更新于 2026-09-30 · 约 11 分钟 · 5287 字 阅读 →
论文解读

FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations

语音合成 | 6.5/10

 · 更新于 2026-09-30 · 约 14 分钟 · 7010 字 阅读 →
论文解读

From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models

语音合成 | 6.9/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6488 字 阅读 →
论文解读

G-iMUSIC: Greedy Iterative MUSIC Algorithms for Multi-Target DoA Estimation

G-iMUSIC: Greedy Iterative MUSIC Algorithms for Multi-Target DoA Estimation

 · 更新于 2026-09-30 · 约 13 分钟 · 6152 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

语音合成 | 10/10

 · 更新于 2026-09-30 · 约 14 分钟 · 6556 字 阅读 →
论文解读

Learning When to Think While Listening in Large Audio-Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-30 · 约 5 分钟 · 2186 字 阅读 →
论文解读

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

音频生成 | 6.0/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5779 字 阅读 →
论文解读

LongCat-Video-Avatar 1.5 Technical Report

语音合成 | 7.5/10

 · 更新于 2026-09-30 · 约 15 分钟 · 7471 字 阅读 →
论文解读

MERIT: Learning Disentangled Music Representations for Audio Similarity

音频检索 | 9/10

 · 更新于 2026-09-30 · 约 11 分钟 · 5351 字 阅读 →
论文解读

Music Transcription with (Almost) No Supervision

音乐转录 | 7.5/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5819 字 阅读 →
论文解读

PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech

语音合成 | 6.5/10

 · 更新于 2026-09-30 · 约 17 分钟 · 8339 字 阅读 →
论文解读

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

语音合成 | 9.2/10

 · 更新于 2026-09-30 · 约 15 分钟 · 7303 字 阅读 →
论文解读

PitchBench: Measuring Pitch Hearing in Audio-Language Models

基准测试 | 9.7/10

 · 更新于 2026-09-30 · 约 10 分钟 · 4876 字 阅读 →
论文解读

Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

语音识别 | 6.8/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6086 字 阅读 →