📄 BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

#音乐生成 #自回归模型 #实时处理 #多任务学习

7.6/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5

7.6/10 | 前25% | #音乐生成 | #自回归模型 | #实时处理 #多任务学习 | arxiv

👥 作者与机构

  • 第一作者:Lekai Qian(华南理工大学)
  • 通讯作者:Lekai Qian(华南理工大学)、Ziyu Wang(Mohamed bin Zayed University of Artificial Intelligence / 纽约大学)
  • 作者列表:Lekai Qian(华南理工大学)、Haoyu Gu(华南理工大学)、Jingwei Zhao(新加坡国立大学)、Ziyu Wang(Mohamed bin Zayed University of Artificial Intelligence / 纽约大学)

💡 毒舌点评

亮点在于将钢琴卷的稀疏性与节拍网格的规律性注入 token 化设计,用节拍内基‑3 编码和相对音高实现了紧凑、时移/移调具有部分不变性的表示,并天然适配实时因果生成,思路干净利落。短板上,严格依赖量化 MIDI,对演奏 MIDI 几乎直接失效;节拍内模式词汇随分辨率 τ 呈指数长尾分布,细粒度韵律建模受限;实时伴奏对比的基线仅 SongDriver,有自卖自夸之嫌。

📌 核心摘要

本文针对事件型符号音乐 token 化(如 REMI、CPW)隐式建模时间网格、token 跨度不均匀的问题,提出 BEAT(Beat‑wise Encoding for Autoregressive Transformers),以固定节拍为统一时间步。在节拍内部,将同一音高的所有状态(onset/sustain/silence)用基‑3 编码压缩为一个模式 token,配合相对音高和平均力度,形成稀疏、网格化的序列表示;空拍用 REST token 替代。BEAT 在钢琴和多轨延续任务中,FMD 分别降至 436.7 和 420.9,Groove Consistency(JS_GC=0.039)大幅领先所有基线(次优为 Naive Piano‑Roll 的 0.051)。主观评测中所有维度均显著优于 REMI/CPW/ABC 等方法,且在重复‑多样性分析中,生成的累积唯一节拍比曲线几乎与真实音乐重合。在实时伴奏任务上,BEAT 借助其节拍级因果交错结构,主观评分大幅超过专用系统 SongDriver。OOD 实验(POP909)进一步验证了泛化能力:BEAT FMD=365.9,优于同类训练规模下所有基线。

🔗 开源详情

  • 代码:https://github.com/Lekai-Qian/BEAT-ICML2026
  • 模型权重:论文未提及
  • 数据集:Lakh MIDI Dataset (LMD)(https://colinraffel.com/projects/lmd/ );MuseScore 用户上传数据(爬取,未公开链接);POP909(https://github.com/music-x-lab/POP909-Dataset )
  • Demo:https://lekai-qian.github.io/BEAT-ICML2026/
  • 复现材料:附录提供完整编解码算法(Algorithm 1/2)、模型架构表(Table 7)、训练超参数表(Table 8)、数据预处理细节、归纳偏置实验设置(附录 J)、OOD 实验细节(附录 G)等
  • 论文引用并使用的开源项目:MidiTok、MusPy、Anticipatory Music Transformer(含 released models)、LLaMA、POP909 数据集、CLaMP2(用于 FMD)、SongDriver

标签

#音乐生成 #自回归模型 #实时处理 #多任务学习 主任务标签:#音乐生成 主方法标签:#自回归模型 补充标签:#实时处理 #多任务学习

🏗️ 方法概述和架构

BEAT 的核心是将多轨量化 MIDI 按节拍切分为均匀时间步的 token 序列,由标准自回归 Transformer 建模。整体流程分为三步。

第一步:节拍级音高模式编码。 整首乐曲的钢琴卷矩阵 \(X\in\{0,1,2\}^{P \times T}\) (0=silence,1=onset,2=sustain)按节拍边界划分为 \(N\) 个节拍矩阵 \(B^{(i)}\in\{0,1,2\}^{P \times \tau}\),其中 \(\tau\) 是每拍的时间分辨率(默认 \(\tau=4\),对应 16 分音符)。对第 \(i\) 拍内的音高 \(p\),取出其状态向量 \(\mathbf{s}_p = B^{(i)}[p,:]\),按基‑3 编码转换为一个整数模式 token \(s=\sum_{t=0}^{\tau-1} s_p[t] \cdot 3^{\tau-1-t}\),取值范围 \(0\) ~ \(3^\tau - 1\)(默认 0–80)。同时以该音高本拍内所有 MIDI 力度的均值作为力度 token \(v\)。统计显示 99.5% 的拍‑音高模式中仅含单一非零力度值,该近似近乎无损。

第二步:节拍内部组装。 对 \(B^{(i)}\),提取所有活跃音高集合 \(\mathcal{A}\),按音高降序排列 \(p_1 > p_2 > ... > p_M\)。第一个音高用绝对 MIDI 索引 \(d_1=p_1\),后续用与前一个音高的负差值 \(d_j=p_{j-1}-p_j\) 作为相对音高 token,最终形成 \((d,s,v)\) 三元组序列。空拍使用特殊 REST token。降序排列 + 相对编码对移调产生部分不变性(仅 \(d_1\) 受影响),且因每拍独立编码,天然具备时间位移不变性。

第三步:序列构建与多轨扩展。 将所有节拍按时间顺序串联,每拍前插 BEAT 标记,每小节首拍前插 BAR 标记。多轨时,按 MIDI Program Number 排序,在每个 BEAT token 前为各轨道插入 INSx 标记,使序列严格按时间交错:BAR INS1 BEAT (d,s,v)... INS2 BEAT ... BAR ...。这种结构保证了 beat 级别的严格因果性。解码时利用首音高绝对索引自动检测节拍边界;对越界音高、非法模式、意外 token 类型进行跳过以保持时间对齐。

模型。 使用 16 层 Transformer 解码器(LLaMA 风格,150M 参数),RoPE 位置编码,标准下一 token 预测交叉熵损失训练,无额外辅助目标。训练采用 AdamW(lr=1e‑4,余弦退火 + 1 epoch warmup),batch size 256,序列打包至上下文长度 2048,共 50 epoch,硬件为 4× RTX 3090(约 400 GPU 小时)。

设计动机。 与 Naive Piano‑Roll 全 128 音高枚举相比,BEAT 利用音乐稀疏性将序列长度从约 29k 降至 1.8k,复杂度 \(O(N \cdot \bar{M})\)(\(\bar{M}\) 为平均多音数)。节拍局部性避免了跨拍信息泄露,且与人类以脉冲感知音乐的方式契合。

💡 核心创新点

  1. 节拍级均匀时间步 token 化:以节拍为基本单位,从根本上统一了 token 的时间跨度,使模型无需隐式推断时间网格。基‑3 局部模式编码在紧凑性和信息完整性之间取得平衡,保留了网格的显式时间结构。消融实验证实一拍步长(τ=4)在 FMD 和序列长度间达到最优(τ=2 FMD=464.4 且序列变长,τ=8 词汇长尾严重)。
  2. 稀疏编码与相对音高:仅编码活跃音高,按降序排列并用相对音高表示后续音高,实现了对移调的部分不变性和对时间位移的完全不变性。消融实验显示相对音高在 FMD 上优于绝对音高(436.7 vs 451.5),降序与升序等效但显著优于随机排序(459.5)。
  3. 统一因果多轨与实时生成:节拍级交错插入自然实现了多轨严格时间对齐和因果生成,可直接应用于实时伴奏,无需异步对齐处理或专用架构。实时伴奏主观评测显著超越 SongDriver。
  4. 长程结构连贯性:重复‑多样性分析显示,BEAT 生成的累积唯一节拍比曲线几乎与真实音乐重合(120 拍时差异 0.3‑1.2%),而 CPW 多样性过剩,ABC 循环严重,表明 BEAT 有效捕捉了主题重复与变化的自然模式。

📊 实验结果

钢琴延续任务客观指标(Table 2):

MethodJS_GC↓JS_SC↓FMD↓
Interleaved ABC.677.023522.4
REMI(+).552.038550.9
CPW.634.024587.0
AMT‑S†.603.055447.1
AMT‑L†.625.053445.2
Naive Piano‑Roll.051.106582.3
BEAT (Ours).039.021436.7

多轨延续任务客观指标(Table 2):

MethodJS_GC↓JS_SC↓FMD↓
Interleaved ABC.594.036580.0
REMI(+).313.008463.2
AMT‑S†.358.078449.3
AMT‑L†.353.029441.8
BEAT (Ours).043.009420.9

OOD 泛化测试(POP909,Table 9):

MethodInt. ABCREMI(+)CPWAMT‑SAMT‑LBEAT
FMD↓401.1438.7512.6422.8402.5365.9

BEAT 在所有指标上均达到最佳或接近最佳,尤其是 GC 一致性大幅领先(钢钢 JS_GC=0.039,多轨 JS_GC=0.043),表明节奏规律性显著优于所有基线。Naive Piano‑Roll 的 JS_SC 较差(0.106),证实 BEAT 的优势来自稀疏编码而非仅依赖网格。

主观评测(32 名参与者,5 分 Likert,within-subject ANOVA + Holm-Bonferroni 校正):钢琴延续任务中 BEAT 在连贯性、似真性和音乐性三项显著优于所有基线(p<0.05);多轨任务与 AMT‑L 接近但略优,与真实音乐无显著差异。实时伴奏任务中 BEAT 在所有维度显著超越 SongDriver(p<0.05)。

节拍唯一比分析(Figure 3):以 1‑beat 和 2‑beat 粒度、onset‑only 和 full‑state 匹配方式,BEAT 在第 120 拍时的累积唯一节拍比与真实音乐差异仅为 0.3‑1.2%,CPW 约 0.88‑0.99(多样性过剩),ABC 偏低 7‑11%(循环严重)。

消融实验(附录 A):τ=4 平衡最优;相对音高 FMD 优于绝对(436.7 vs 451.5);降序 vs 升序几乎无差异,但均显著优于随机排序(FMD=459.5)。

模式归纳偏置实验(Table 4):在逐拍移位、节拍交错、时移重建三项合成任务上,BEAT 的准确率远高于 REMI(逐拍移位 Seq. 91.92% vs 28.28%),证明确能有效学习局部不变性。

BPE 压缩率(Figure 4):20 次合并时 BEAT 压缩率 64.83%,远低于 ABC 的 80.15% 和 REMI 的 80.18%,表明 token 序列具有更强可复用子结构。

🔬 细节详述

  • 训练数据:钢琴:LMD 中 15K 钢琴曲 + MuseScore 爬取 193K 钢琴曲,共 208K;多轨:LMD 的 148K 曲。所有数据量化至 16 分音符,截断 8‑200 小节,去重(内容哈希),去除异常乐器。80/10/10 按曲目分割,训练时采用移调增广(未说明半音数范围)。
  • 损失函数:标准下一 token 预测交叉熵损失,无额外辅助目标。
  • 训练策略:AdamW (lr=1e‑4, β=(0.9,0.999), weight_decay=0.01),batch size 256,50 epoch,学习率余弦退火+1 epoch 线性 warmup。序列打包至上下文长度 2048([EOS] 分隔),按验证损失选择最优 checkpoint。
  • 关键超参数:模型:16 层 LLaMA 风格 Transformer 解码器,d_model=768,注意力头 12,FFN=3072,dropout 0.1,RoPE base 10000,约 150M 参数。BEAT:τ=4,PAT token 0‑80,VEL 0‑127,PIT 0‑127 及负相对间隔。
  • 训练硬件:4× RTX 3090 GPU,约 400 GPU 小时(50 epoch)。
  • 推理细节:无条件生成 temperature=1.0, top‑p=0.95;时移重建用 top-k=1(确定性)。解码对越界音高/非法模式/意外 token 类型进行跳过以保持时间对齐。上下文窗口 2048。
  • 正则化/稳定技巧:dropout 0.1,余弦退火,无其他特殊技巧。
  • 微调:实时伴奏从钢琴延续模型微调,未说明具体微调轮数或学习率。

⚖️ 评分理由

  • 创新性 (1.2/2):将钢琴卷均匀网格与稀疏性面向自回归 Transformer 做紧凑 token 化,是对符号音乐表示范式的有益拓展。相对音高、节拍局部独立编码、基‑3 模式压缩等设计带来了内置的不变性偏置。但其本质是将钢琴卷按"行稀疏化 + 列分块",核心模块(节拍切分、基‑3 编码、音高排序)均为已知工程手段的组合,缺乏根本性的理论突破。与 MusicVAE/Measure by Measure 等已有网格模型的关系讨论限于附录,削弱了定位清晰度。
  • 技术严谨性 (0.9/1.5):编解码算法(Algorithm 1/2)定义完整,无效 token 处理策略合理。消融验证了 τ 和编码策略;模式归纳实验为不变性偏置提供了受控证据。不足之处:(1) 速度均值近似仅给出"99.5% 无损"宏观统计,未分析 0.5% 异常情况对特定曲风(强渐强/颤音)生成质量的可能影响;(2) τ 增大时模式词汇长尾问题仅承认但未做任何量化实验或提出缓解方案(如分级分解/VQ);(3) 解码鲁棒性策略的消融(跳词对音乐结构完整性的量化影响)缺失。
  • 实验充分性 (0.9/1.5):实验覆盖钢琴/多轨延续、实时伴奏、模式控制、OOD 泛化,对比 REMI/CPW/ABC/AMT/Naive PR 等多种类型基线,含客观/主观/结构性分析。不足之处:(1) 实时伴奏仅对比 SongDriver,未与 RL-Duet 或基于事件表示的条件因果生成基线对比,降低了实时性 claim 的说服力;(2) 主观评价 32 人样本量较小,且声部参与者自我报告分布中专业比例偏高(31.25%);(3) 缺少在大规模模型(如 1B+)或 LLM 联合预训练场景下的实验,无法验证 token 化方案的可扩展性。
  • 清晰度 (0.8/1):论文结构合理,Figure 1 和 Table 1 清晰概括编码流程与 token 类型。核心方法叙述清楚,但部分重要细节(解码鲁棒策略、速度均值统计、OOD 实验、附录中消融实验的完整结论)置于附录,削弱了正文的自包含性。对与 MusicVAE 等已有网格表示方法的关系讨论仅限附录 K,不利于审稿人快速定位贡献边界。
  • 影响力 (0.9/1.5):BEAT 为符号音乐生成提供了一种兼顾紧凑性、时间规律性与实时因果能力的表示范式,有望影响后续的钢琴‑roll 音频生成和交互式音乐系统。论文已被 ICML 2026 接收,且有完整的代码和 demo 页面。但符号音乐生成本身受众相对窄,token 化方案尚未在大规模模型或与音频联合建模中得到验证,长期领域推动力有待观察。作者中有该领域活跃研究者,来自多所国际学术机构。
  • 开源 (1.5/1.5):论文提供 GitHub 代码仓库(完整的 token 化实现、模型训练和推理代码)与 demo 页面,覆盖核心复现所需,符合开源核心内容且有完整文档,给予满分。
  • 可复现性 (0.4/0.5):训练/推理的超参数(优化器、学习率、调度、batch size、上下文长度、模型架构表7‑8)描述完整,并给出训练时长和硬件。缺失在于:移调增广的具体半音数范围未说明;未提供随机种子;数据预处理中过滤规则(如异常乐器检测标准)仅定性描述而缺脚本细节。但整体已足够让有经验的研究者近似复现。
  • 工程/实践价值 (1.0/1.5):提供可直接使用的 token 化流水线,节拍级因果交错结构原生支持实时伴奏,API 设计和因果生成特性具有工程参考价值。但距离工业部署仍缺乏对实时推理延迟、模型量化、流式解码等性能的详细讨论。速度均值近似虽统计上近乎无损,但在需要精细力度控制(渐强/震音)的应用中需扩展,作者仅声称"可扩展"而未提供方案或实验。

🚨 局限与问题

  1. 论文明确承认的局限:BEAT 仅适用于量化 MIDI,不支持未经量化的演奏 MIDI;τ 增大导致模式词汇长尾分布;速度用均值近似,精细力度建模受限;相对音高编码在大规模数据下优势不显著,被视为灵活设计而非严格要求。
  2. 审稿人发现的潜在问题:
    • 模式词汇的基‑3 编码在 τ 增大时呈指数增长(\(3^8=6561\)),论文仅承认问题而未提出任何缓解方案(如分层分解、VQ 码本等),这限制了该方法在需要更高细粒度时间建模场景(如三连音、装饰音)中的扩展性。
    • 速度均值的统计报告"99.5% 无损"掩盖了那 0.5% 可能集中在音乐表现力最强(渐强、震音)的段落,而这些段落的建模恰恰对感知质量影响最大。作者声称"可扩展"但未提供任何具体方案或实验,削弱了说服力。
    • 实时伴奏对比仅选择 SongDriver,未对比基于 REMI 等事件表示的条件因果生成基线(如利用因果 mask),使得"实时因果生成是 BEAT 独特优势"这一核心声明缺乏足够的实验支撑。
    • 文中声称"严格因果",但训练时使用全局上下文截断(2048 token 序列打包),未明确展示在仅见历史上下文(零未来信息)的推理设定下是否仍能保持全局连贯性,理论上可能存在曝光偏差。
    • 实验未涉及复杂节拍变化(如 3/4、6/8、变换拍号)、包含歌词的歌曲,泛化边界不明确。虽然提到"mid-piece time-signature changes are handled",但未提供任何相关实验结果。
    • Naive Piano-Roll 基线虽控制了网格因素,但其极长的序列长度(约 29k token)使公平性存疑——性能差距可能部分源于有效上下文窗口的显著缩减,而非纯粹编码优势。作者未讨论此混杂因子。

← 返回 ICML 2026 论文速递