论文解读

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

语音对话系统 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3884 字 阅读 →
论文解读

UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5273 字 阅读 →
论文解读

YuE: Scaling Open Foundation Models for Long-Form Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5344 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-02

共分析 4 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 15 分钟 · 7026 字 阅读 →
论文解读

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

条件生成 | 8.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3079 字 阅读 →
论文解读

JaiTTS: A Thai Voice Cloning Model

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2500 字 阅读 →
论文解读

Adaptive Rotary Steering with Joint Autoregression for Robust Extraction of Closely Moving Speakers in Dynamic Scenarios

语音分离 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5752 字 阅读 →
论文解读

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4356 字 阅读 →
论文解读

An Event-Based Sequence Modeling Approach to Recognizing Non-Triad Chords with Oversegmentation Minimization

音乐信息检索 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4973 字 阅读 →
论文解读

AR-BSNet: Towards Ultra-Low Complexity Autoregressive Target Speaker Extraction With Band-Split Modeling

语音分离 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4535 字 阅读 →
论文解读

BridgeCode: A Dual Speech Representation Paradigm for Autoregressive Zero-Shot Text-to-Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5196 字 阅读 →
论文解读

Chunkwise Aligners for Streaming Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4405 字 阅读 →
论文解读

Compression meets Sampling: LZ78-SPA for Efficient Symbolic Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5902 字 阅读 →
论文解读

Confidence-Guided Error Correction for Disordered Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4863 字 阅读 →
论文解读

Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5822 字 阅读 →
论文解读

DisContSE: Single-Step Diffusion Speech Enhancement based on Joint Discrete and Continuous Embeddings

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4612 字 阅读 →
论文解读

DSRMS-TransUnet: A Decentralized Non-Shifted Transunet for Shallow Water Acoustic Source Range Estimation

声源定位 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4613 字 阅读 →
论文解读

Etude: Piano Cover Generation with a Three-Stage Approach — Extract, Structuralize, and Decode

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4983 字 阅读 →
论文解读

Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 4005 字 阅读 →