论文解读

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

音乐转录 | 7.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6381 字 阅读 →
论文解读

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

音乐转录 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7041 字 阅读 →
论文解读

MuScriptor: An Open Model for Multi-Instrument Music Transcription

音乐转录 | 9.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6309 字 阅读 →
论文解读

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

语音分离 | 8.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7188 字 阅读 →
论文解读

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

语音分离 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5723 字 阅读 →
论文解读

MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

音乐理解 | 8.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12029 字 阅读 →
论文解读

MMGenre: Benchmarking Singing Voice Synthesis across Multiple Musical Genres

基准测试 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6401 字 阅读 →
论文解读

Rag Classification of Tagore Songs using Symbolic Music Notation and Novel Weighted Distance Measures

音乐理解 | 3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4733 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-09

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 47 分钟 · 23491 字 阅读 →
论文解读

Designing Maintainable Hybrid Generative Systems: A Quantum-Inspired Approach to Automated Music Harmony Generation

音乐生成 | 5.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5880 字 阅读 →
论文解读

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7351 字 阅读 →
论文解读

CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6524 字 阅读 →
论文解读

Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities

基准测试 | 7.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6409 字 阅读 →
论文解读

DETECT-3B-Omni is Agnostic of Content and Demographics

语音伪造检测 | 4.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5688 字 阅读 →
论文解读

Doppelganger: Sound Effects and Their Synthetic Twins

音频检索 | 9.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6213 字 阅读 →
论文解读

Physiological Noise Augmentation Improves Non-Invasive Brain-to-Speech

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7173 字 阅读 →
论文解读

SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation

音频伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9156 字 阅读 →
论文解读

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

音频分离 | 9.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6048 字 阅读 →
论文解读

Bioacoustic Geolocation: Species Sounds as Geographic Signals

音频理解 | 5.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6365 字 阅读 →
论文解读

CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction

音乐生成 | 6.4/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4833 字 阅读 →