论文解读

Sing2Song: An Accompaniment Generation System Based on Solo Singing

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4905 字 阅读 →
论文解读

Stemphonic: All-At-Once Flexible Multi-Stem Music Generation

音乐生成 | 7.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4942 字 阅读 →
论文解读

Symphony Rendering: Midi and Composer-Conditioned Auto Orchestration with Flow-Matching Transformers

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5626 字 阅读 →
论文解读

SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5548 字 阅读 →
论文解读

Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3668 字 阅读 →
论文解读

Time-Shifted Token Scheduling for Symbolic Music Generation

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3965 字 阅读 →
论文解读

Towards Multi-View Hierarchical Video-to-Piano Generation with MIDI Guidance

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4459 字 阅读 →
论文解读

Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4896 字 阅读 →
论文解读

Virtual Consistency for Audio Editing

音乐生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4718 字 阅读 →
论文解读

Visual Keys to Symphonies: Latent Diffusion for Multi-Scene Video-to-Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5068 字 阅读 →
论文解读

ViTex: Visual Texture Control for Multi-Track Symbolic Music Generation via Discrete Diffusion Models

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3841 字 阅读 →
论文解读

VMSP: Video-to-Music Generation with Two-Stage Alignment and Synthesis

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4643 字 阅读 →
论文解读

When Noise Lowers the Loss: Rethinking Likelihood-Based Evaluation in Music Large Language Models

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4847 字 阅读 →
论文解读

Opening the Design Space: Two Years of Performance with Intelligent Musical Instruments

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4910 字 阅读 →
论文解读

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5170 字 阅读 →
论文解读

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

本文针对符号音乐生成中主流的事件序列(event-based)tokenization方法隐含处理时间规律、导致模型需额外学习时间网格的问题,提出了一种名为**BEAT**的新型网格化tokenization框架。其核心思想是将音乐在时间上均匀离散化为“拍”(beat)作为基本单位,将每拍内每个音高

 · 更新于 2026-09-25 · 约 10 分钟 · 4791 字 阅读 →
论文解读

A novel LSTM music generator based on the fractional time-frequency feature extraction

本文提出了一种基于分数阶傅里叶变换(FrFT)和长短期记忆网络(LSTM)的新型AI音乐生成系统。**核心目标**是利用FrFT在分数阶域(时频平面的旋转表示)中提取比传统时域或频域更丰富的音乐信号特征,以解决传统LSTM在捕捉音乐复杂时频结构上的不足。**关键方法**是将输入音乐信号进行FrFT变

 · 更新于 2026-09-25 · 约 8 分钟 · 3725 字 阅读 →
论文解读

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

这篇论文旨在解决大语言模型在歌词到旋律生成任务中,通过监督微调(SFT)训练出的模型常产生音乐上不可行(如节奏怪异、音域超限)的“约束违反”问题。**核心贡献**是提出了一套无需人工标注、基于规则约束的自动化对齐框架。**关键方法**分为三步:首先对预训练LLM进行SFT以获得基础生成能力;其次,利

 · 更新于 2026-09-25 · 约 10 分钟 · 4941 字 阅读 →
论文解读

Latent Fourier Transform

这篇论文旨在解决现有音乐生成模型难以对**任意时间尺度**上的音乐模式进行精确控制的问题。作者提出了**潜在傅里叶变换(LatentFT)** 框架,其核心是将离散傅里叶变换应用于由扩散自编码器编码得到的**潜在向量序列**,从而得到“潜在频谱”。通过在训练过程中对潜在频谱进行随机频率掩码,迫使解码

 · 更新于 2026-09-25 · 约 10 分钟 · 4514 字 阅读 →
论文解读

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

本文针对现有视频到音乐(V2M)生成模型缺乏对创作者风格、主题等细粒度意图控制的问题,提出了Video-Robin,一个结合文本提示的视频配乐框架。其核心方法是将生成过程解耦为两个阶段:首先,一个多模态自回归规划头(AR-Head)整合视频帧和文本提示,通过语义语言模型、有限标量量化(FSQ)和残差

 · 更新于 2026-09-25 · 约 11 分钟 · 5422 字 阅读 →