论文解读

MI-MIDI: Mechanistic Interpretability of Text-to-MIDI Generation Models via Probing, Lenses and Steering

音乐生成 | 7.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6408 字 阅读 →
论文解读

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7896 字 阅读 →
论文解读

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

音乐生成 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6469 字 阅读 →
论文解读

Calliphony: A Calligraphy-Driven Interface for Real-Time Generative Music Performance

音乐生成 | 5.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6487 字 阅读 →
论文解读

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

自回归模型 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6968 字 阅读 →
论文解读

dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model

语音编辑 | 7.4/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7954 字 阅读 →
论文解读

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8648 字 阅读 →
论文解读

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

语音识别 | 6.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5685 字 阅读 →
论文解读

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

语音合成 | 5.8/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7230 字 阅读 →
论文解读

VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

歌唱生成 | 7.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7140 字 阅读 →
论文解读

Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

音乐转录 | 6.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5320 字 阅读 →
论文解读

GraphIDyOM: A graph-native Python reimplementation of IDyOM for musical expectation modelling

音乐理解 | 7.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5997 字 阅读 →
论文解读

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

音乐生成 | 6.8/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10649 字 阅读 →
论文解读

RPPNet: Perceptually-Grouped Rhythm-Pitch Primitives for Long-Term Structure Melody Generation via Boundary-Aware Modeling

音乐生成 | 6.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5701 字 阅读 →
论文解读

StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated Stems

自回归模型 | 9.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8092 字 阅读 →
论文解读

Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

音乐生成 | 7.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8543 字 阅读 →
论文解读

MuScriptor: An Open Model for Multi-Instrument Music Transcription

音乐转录 | 9.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6309 字 阅读 →
论文解读

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

语音合成 | 7.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7351 字 阅读 →
论文解读

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

音乐生成 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6251 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

音频水印 | 7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6164 字 阅读 →