论文解读

SketchSong: Hierarchical Song Generation with Sketch Planning and Fine-Grained Multi-Track Modeling

音乐生成 | 8.6/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12623 字 阅读 →
论文解读

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

音乐生成 | 7.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6236 字 阅读 →
论文解读

UniVocal: Unified Speech-Singing Code-Switching Synthesis

语音合成 | 8.9/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2097 字 阅读 →
论文解读

AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing

音乐生成 | 8.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6772 字 阅读 →
论文解读

Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation

音乐生成 | 7.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5329 字 阅读 →
论文解读

检索增强让高层意图变低层声学:用锚点保检索、用描述做转向的标题投毒

针对检索增强的文本到音乐生成中用检索到的标题改写用户高层提示的依赖,论文提出保留高层锚点并注入低层声学描述的双层标题投毒,使投毒后生成音频与攻击目标类别的 CLAP 相似度从 0.21-0.28 提升到 0.41-0.48,同时与原始用户问题的相似度维持在约 0.30 附近。

 · 更新于 2026-09-25 · 约 21 分钟 · 10208 字 阅读 →
论文解读

MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5633 字 阅读 →
论文解读

Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

音频生成 | 8.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7601 字 阅读 →
论文解读

DEMON: Diffusion Engine for Musical Orchestrated Noise

音乐生成 | 6.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7857 字 阅读 →
论文解读

From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models

语音合成 | 6.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6488 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

音频水印 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6460 字 阅读 →
论文解读

Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches

音乐生成 | 8.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7719 字 阅读 →
论文解读

Music of Changing Lines: Toward a Culturally Situated Approach to the I-Ching

音乐生成 | 5.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6040 字 阅读 →
论文解读

Musical Attention Transformer: Music Generation Using a Music-Specific Attention Model

音乐生成 | 5.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8324 字 阅读 →
论文解读

S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9578 字 阅读 →
论文解读

Stable Audio 3

音频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11116 字 阅读 →
论文解读

ARIA: A Diagnostic Framework for Music Training Data Attribution

音乐生成 | 6.1/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9163 字 阅读 →
论文解读

Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis

音频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8349 字 阅读 →
论文解读

Persian MusicGen: A Large-Scale Dataset and Culturally-Aware Generative Model for Persian Music

音乐生成 | 6.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6651 字 阅读 →
论文解读

Text2Score: Generating Sheet Music From Textual Prompts

乐谱生成 | 7.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9318 字 阅读 →