📄 Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

标签:#音乐生成 #自回归模型 #Transformer #多模态模型 #基准测试

7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5

7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音乐生成 | #自回归模型 | #Transformer #多模态模型 | arxiv

👥 作者与机构

  • 第一作者:Ke Zhang(日本高级科学技术研究所,JAIST)
  • 通讯作者:未说明(论文中未明确标注通讯作者)
  • 作者列表:Ke Zhang(日本高级科学技术研究所,JAIST),Chu-Hsuan Hsueh(日本高级科学技术研究所,JAIST),Kokolo Ikeda(日本高级科学技术研究所,JAIST)

💡 毒舌点评

本文最大的亮点在于将符号音乐生成领域成熟的"事件序列"建模范式巧妙迁移到音乐游戏关卡生成这一实际且有趣的应用中,并通过精心设计的ACS指标量化音频信息的独立贡献,视角新颖,分析深入。主要短板在于实验仅在单一商业游戏(maimai)数据集上进行验证,其结论的普适性存疑,且完全忽略关卡的空间布局(位置)信息,使其作为端到端可玩关卡生成系统的实用性大打折扣。此外,论文发表于ICMR 2026(多媒体检索会议),虽属合理但并非顶级ML/AI会议,且未与最新音频编码器(如BEATs、Audio-MAE)或其他token-level生成范式进行对比,削弱了技术贡献的说服力。

📌 核心摘要

本论文发表于ICMR 2026,旨在解决如何将音乐的音频信号与结构转化为可交互的游戏关卡序列的问题。针对主流方法将时间离散化为帧网格、难以显式建模事件间时序关系和长程结构的局限,作者受符号音乐建模(如PerformanceRNN、Music Transformer中的event-based表示)启发,提出一种基于事件令牌序列的音频条件化建模方法。该方法将关卡生成定义为多模态序列到序列问题,以交替的节拍偏移令牌(beat-shift tokens)和游戏事件令牌显式表示动作及其在节拍空间中的相对时序。基于此,作者构建了一个以预训练音频编码器(Whisper-base或MERT)和12层Transformer解码器为核心的模型。实验在maimai游戏数据集(4187个关卡,1018首歌)上进行,结果表明,在主要的事件级评估指标上,该方法(平均事件级F1: 0.527)显著优于代表性的帧级基线方法DDC(0.254)和GeneLive!(0.298),提升约77%。此外,作者通过消融实验和提出的音频贡献分数(ACS)系统分析了音频信息在元数据条件之外的独立作用,发现音频贡献了约58%的性能增益。论文同时报告了极端密度率和循环坍塌率等退化诊断指标,完整模型在这些指标上均表现最优(极端密度率2.1%,循环坍塌率0.4%)。该工作的实际意义在于为音乐游戏关卡生成提供了一种新的、更具事件中心性的建模范式,并提供了分析音频信息贡献的工具。主要局限性包括:实验仅在单一游戏数据集上进行,模型未建模关卡的空间位置信息,且在复杂高难度关卡上事件多样性仍显不足。

🔗 开源详情

  • 代码:论文明确提及将发布"完整的数据转换和训练代码",但未在论文中提供任何代码仓库的具体URL链接(如GitHub等)。因此,代码的具体可访问性无法从论文中直接确认。
  • 模型权重:论文中未提及任何模型权重的发布地址或链接。
  • 数据集:论文中未提及公开的完整数据集。论文明确说明,因版权原因不发布任何可重建原始游戏关卡的数据,仅发布"非可逆的token序列示例"用于演示该表示格式,但未给出该示例的具体下载链接。此外,论文提到发布事件词汇表和节拍偏移规则的形式化规范。
  • Demo:论文中未提及任何在线演示地址。
  • 复现材料:论文中未提及模型检查点或详细训练配置的公开地址。
  • 论文中引用的开源项目:论文中引用了以下第三方项目:Whisper(音频编码器,OpenAI发布)、MERT(音乐音频编码器)、DDC(基线方法)、GeneLive!(基线方法)、simai/maidata格式(社区采用的关卡文件规范)。

🏗️ 方法概述和架构

本文提出了一种端到端的音乐游戏关卡生成框架,其核心流程为:输入一段音乐音频及其相关的关卡元数据(BPM、技能评级、难度等级),模型输出一个由节拍偏移令牌和游戏事件令牌交替组成的符号序列,该序列可直接映射回结构化的游戏关卡。整体框架由数据准备、音频编码、元数据融合和自回归解码四个主要阶段构成。

下图展示了整个框架的管道概述。

Figure 2. Overview of the proposed pipeline. Left: deterministic data preparation from commercial music-game assets, deriving beat-aligned level representation, metadata mm (e.g., BPM, difficulty tier, skill rating), and the supervision tok

图中左侧为数据准备阶段,从商业音乐游戏资产中提取节拍对齐表示和元数据;右侧为训练阶段,展示了音频特征提取、元数据融合和Transformer解码器的自回归预测流程。

1. 数据准备与事件序列化:原始游戏关卡描述(采用社区通用的simai maidata格式)在节拍空间中对齐,被确定性地转换为一个线性令牌序列。该序列的构建遵循三个步骤:首先,将节拍对齐的关卡描述解析为有序的游戏事件序列及其在节拍空间中的相对位置;其次,在连续事件之间插入节拍偏移令牌来表示它们在节拍空间中的相对时间间隔;最后,得到交替排列的事件令牌和节拍偏移令牌序列。节拍偏移令牌的定义为:设当前节拍位置为 \(b\),每个节拍偏移令牌 \(k\) 将游标推进 \(\Delta b = k/U\) 拍,其中 \(U\) 表示每拍的单位数(本文中 \(U=8\),即每拍细分为8个单位)。这种设计避免了帧级表示中大量空符号的问题,直接编码了事件及其时序关系。输出词汇表由特殊令牌(<pad><unk>)、五类游戏事件令牌(tap、hold_start/hold_end、slide、double、break)和多个节拍偏移令牌组成。Hold动作采用配对的start/end事件表示,在重建时通过确定性规则——将每个hold_end匹配到最近的未配对hold_start——恢复配对关系。论文报告在实验数据集中该规则足以完成重建,未观察到未配对的hold_start事件。

下图具体说明了事件令牌序列的构建过程。

Figure 1. Illustration of the proposed event-based representation construction. A beat-aligned raw level description is interpreted as an ordered sequence of gameplay events in beat space. Temporal progression between consecutive events is

图示显示了从原始关卡描述到节拍网格对齐,再到生成交替的节拍偏移和事件令牌序列的步骤。

2. 音频编码器:使用预训练的音频编码器(Whisper-base或MERT)处理输入音频,提取帧级的声学特征序列 \(h = (h_1, \ldots, h_T)\),其中 \(h_t \in \mathbb{R}^{d_{\text{model}}}\),\(d_{\text{model}}=768\),每个特征向量代表一个时间帧(约20-25ms)的上下文声学信息。两个编码器均产生约50Hz的帧级表示。论文不强制音符-帧对齐,解码器通过交叉注意力机制直接关注帧级声学表示。

3. 元数据嵌入与融合:元数据包含三种互补信息:全局BPM(标量,定义全局节拍空间参考)、技能评级(标量,反映整体技术负荷的连续度量)和难度等级(分类变量,有5个离散等级,反映关卡书写风格)。BPM和技能评级分别通过独立的可学习线性层投影为嵌入向量 \(b_{\text{emb}} = \text{Linear}_{\text{bpm}}(\text{BPM})\) 和 \(d_{\text{emb}} = \text{Linear}_{\text{diff}}(\text{rating})\);难度等级通过专用的可学习嵌入层得到向量 \(t_{\text{emb}} = \text{Embedding}_{5 \times d_{\text{tier}}}(\text{tier})\)。三者拼接形成全局元数据向量 \(m_{\text{enc}} = [b_{\text{emb}}; d_{\text{emb}}; t_{\text{emb}}]\)。融合策略是将这个全局向量广播并拼接到音频编码器输出的每一个时间帧特征上,形成新的条件特征 \(h'_t = [h_t; m_{\text{enc}}]\),然后送入解码器作为键值记忆。论文明确指出不采用将元数据令牌前置到解码器输入的方式,而是选择全局拼接融合。

4. 自回归Transformer解码器:解码器是一个标准的12层Transformer,具有768维隐藏层、2048维前馈层和8个注意力头。每层包含因果自注意力(关注已生成的令牌)和多头交叉注意力(关注音频编码器的条件特征 \(h'\))。使用学习到的位置嵌入表示序列位置。解码器自回归地生成目标令牌序列:每一步预测下一个令牌的概率分布 \(P(y_i | y_{(i)}, x, m)\)。虽然节拍偏移令牌和事件令牌在原则上交替排列,但训练时不强制执行此交替约束,以避免对序列模型施加硬性结构限制。训练使用教师强制,以标准交叉熵损失(标签平滑率为0.05)优化。所有解码器相关的dropout率(包括解码器dropout、注意力dropout和激活dropout)均设为零,正则化通过元数据dropout和文本dropout(比率0.2)结合标签平滑实现。优化使用Adam(\(\beta_1=0.9, \beta_2=0.98\)),学习率采用三阶段调度(预热、保持、衰减),基础学习率为 \(4 \times 10^{-5}\),预热步数为800。批大小按最大目标令牌数4096控制,训练40-80个epoch。

5. 推理与重建:推理时采用贪心解码或束搜索(beam_size=5,配合长度归一化以缓解局部最优但全局不一致的输出)。解码在生成结束序列令牌 </s> 时终止。此外,论文施加基于时间覆盖的硬终止约束:解码过程中,节拍偏移令牌被累积求和以追踪已生成内容在节拍空间中的时间长度,当累积节拍偏移超过输入音频片段的固定节拍长度时,强制终止解码。生成的令牌序列被确定性地重建为事件序列:累积节拍偏移得到每个事件的绝对节拍位置,事件类型由事件令牌决定。

关键设计选择包括:1) 采用事件序列而非帧级预测,以显式建模事件间的时序关系和长程结构;2) 在节拍空间而非绝对时间中操作,与音乐游戏社区的创作实践(如simai格式)高度一致;3) 使用全局元数据拼接而非令牌前置的融合方式;4) 解码时结合时间覆盖约束以确保输出完整性;5) 对hold事件采用确定性配对规则而非增加显式对象ID,简化了序列表示。

💡 核心创新点

  1. 事件序列建模框架:将音乐游戏关卡生成从传统的"帧级分类/检测"问题,重新定义为"事件级序列到序列"问题。创新点在于采用交替的节拍偏移令牌和事件令牌来显式表示游戏动作及其在音乐节拍空间中的相对时序关系,使模型能直接推理事件间的结构,而非在密集帧中隐式检测。该表示借鉴了符号音乐建模(PerformanceRNN的time-shift tokens、REMI等)的成功经验,但针对音乐游戏关卡生成的任务特点进行了适配。
  2. 音频贡献分数(ACS)指标:为解决评估中难以分离音频信息实际作用的问题,提出了ACS指标。它通过比较模型在正确音频(\(S_{\text{true}}\))、随机打乱音频(\(S_{\text{shuf}}\))和教师强制条件(\(S_{\text{forced}}\))下的性能,量化音频信息在元数据和序列先验之外的独立贡献。\(\text{ACS} = (S_{\text{true}} - S_{\text{shuf}}) / (S_{\text{forced}} - S_{\text{shuf}})\)。其中 \(S_{\text{forced}}\) 代表通过教师强制解码(使用ground-truth前序令牌)消除自回归误差后的经验上界。该指标具有可操作性,可用于系统分析多模态序列生成任务中不同模态的相对贡献。
  3. 面向节拍空间的表示:关卡时序直接以节拍为基本单位进行编码(beat-shift tokens,\(U=8\) 单位/拍),与音乐游戏社区的创作习惯(如simai格式)高度一致,避免了到绝对时间或帧网格的有损转换,更好地保留了音乐的节奏结构信息。

📊 实验结果

论文的主要实验在maimai游戏数据集(4187个关卡,1018首歌,按歌曲级别70/15/15划分)上进行,得到21595个训练序列、2808个验证序列和2669个测试序列。平均序列长度120-260个令牌,最大序列长度1024个令牌。主要结果如下:

1. 与基线方法对比:将所提的序列模型与适配后的帧级基线DDC和GeneLive!进行对比,使用事件级F1作为主要指标(容差1/8拍)。

下图提供了生成关卡片段的可视化对比。

Figure 3. Representative generation examples under identical audio and metadata conditions. From top to bottom: a human-designed level segment (not used in training), the output of the proposed model, and the output of a frame-based baselin

图中展示了人类设计、所提模型生成和基线生成的关卡在节拍空间中的对齐,直观比较了事件间隔和时间结构。

模型/方法BeginnerAdvancedExpertMasterRemaster平均
DDC (Event F1)0.3370.2740.2310.2190.1870.254
GeneLive! (Event F1)0.3920.3240.2750.2460.2150.298
Ours (Event F1)0.6510.5750.5260.4810.4570.527

所提方法在所有难度等级上均显著优于基线,平均事件级F1相比最强基线(GeneLive!)提升约77%。

论文同时报告了帧级F1(Onset)作为诊断指标。对于帧级基线(DDC、GeneLive!),Frame-F1在峰值检测前的时间平滑预测上计算;对于序列模型,通过将生成事件光栅化为帧级onset来计算。该onset-level score仅作为二元onset formulation下时间准确性的参考,与本文主要指标event-level F1不直接可比。

模型/方法BeginnerAdvancedExpertMasterRemaster平均
DDC (Onset F1)0.7280.6920.6640.6820.6520.686
GeneLive! (Onset F1)0.7840.7220.6960.7110.6870.734
Ours (Onset F1)0.8190.7280.7740.6920.5800.733

帧级onset指标上,基线保留了合理的时间检测性能,但其显著较低的事件级F1反映了帧级onset formulation与多类动作词汇下事件级重建需求之间的不匹配。

2. 模型变体与消融分析:分析了不同音频编码器和元数据条件的影响。

模型变体事件级 F1↑ACS↑
Whisper (full)0.5270.58
Whisper (zero-meta)0.4980.67
zero-audio0.266
MERT encoder0.5020.54
  • ACS值表明,完整模型中音频信息贡献了约58%的性能增益(超出元数据和序列先验所能解释的范围)。
  • 移除元数据(Whisper zero-meta)后,性能下降(0.527→0.498),但ACS上升(0.58→0.67),说明在非音频条件减少时,音频的相对贡献份额增加,这是因为可用的非音频线索更少。
  • Whisper编码器性能优于MERT(0.527 vs 0.502),作者将其归因于Whisper更高的时间分辨率(约20-25ms/帧 vs 40-50ms/帧),为事件放置提供了更精细的时间线索。
  • 完全移除音频(zero-audio)性能暴跌至0.266,证明了音频条件的必要性。

3. 退化诊断:论文报告了两种退化度量指标。

模型极端密度率(%)↓循环坍塌率(%)↓
Whisper (full)2.10.4
Whisper (zero-meta)3.81.7
zero-audio5.94.3

极端密度率定义为8拍窗口中事件数超过阈值 \(K=40\)(验证集上的99th百分位)的比例。循环坍塌率定义为包含长度 \(L \geq 16\) 个令牌的重复模式连续重复 \(R \geq 4\) 次的片段比例。结果表明,完整模型在这些故障指标上表现最好。

4. 观察到的失败模式:论文报告了四种挑战条件下的失败模式:(1) 在涉及长节拍偏移间隔的过渡段中,onset令牌偶尔偏离精确节拍位置,表现为自回归解码中的累积相位漂移;(2) 在高难度关卡中,生成的关卡在事件类型上表现出有限的多样性,复杂交互模式代表性不足,反映了当前事件词汇表的限制;(3) 在高BPM条件下,生成的事件序列可能违反物理街机设备的人体工学约束;(4) 在某些片段中,生成的事件与特定乐器线索的锚定较弱。

🔬 细节详述

  • 发表会议:International Conference on Multimedia Retrieval (ICMR ‘26), June 16–19, 2026, Amsterdam, Netherlands
  • 训练数据:来自商业节奏游戏maimai的4187个关卡(1018首歌曲),按歌曲级别70/15/15划分(3350训练/421验证/416测试关卡)。音频切分为固定80拍长度的片段,得到21595个训练序列、2808个验证序列和2669个测试序列。平均序列长度120-260个令牌,最大序列长度1024个令牌。节拍偏移令牌约占54%,事件令牌约占46%。
  • 损失函数:标准的教师强制交叉熵损失,标签平滑率为0.05。
  • 训练策略:使用Adam优化器(\(\beta_1=0.9, \beta_2=0.98\))。学习率采用三阶段调度(预热、保持、衰减)。基础学习率为 \(4 \times 10^{-5}\),预热步数为800。批大小按最大目标令牌数4096控制。训练40-80个epoch。
  • 关键超参数:解码器为12层Transformer,隐藏维度768,前馈维度2048,8个注意力头。音频编码器维度为768(Whisper-base, MERT)。元数据嵌入后与音频特征拼接,维度增加。
  • 训练硬件:未说明。
  • 推理细节:默认使用束搜索(beam_size=5)进行解码,并采用长度归一化。解码受累计节拍偏移的硬终止条件约束(超过输入音频片段的80拍长度时强制终止)。
  • 正则化技巧:所有解码器相关dropout率(解码器dropout、注意力dropout、激活dropout)均设为零。正则化通过元数据dropout和文本dropout(比率0.2)结合标签平滑实现。

⚖️ 评分理由

  • 创新性 (1.5/2):论文将事件序列建模范式从符号音乐生成成功迁移到音乐游戏关卡生成,并提出了新的ACS分析指标,具有实质性创新。核心idea(event-based tokenization)虽有先例,但领域迁移和分析工具的提出构成有效创新。

  • 技术严谨性 (1.3/1.5):方法描述完整,ACS定义具有数学可操作性,hold事件重建规则有实证支持。但元数据融合策略(全局拼接)较为简单,未与更复杂融合方式对比;评估容差固定为1/8拍的普适性有待商榷。

  • 实验充分性 (1.2/1.5):实验对比了关键基线,进行了内部消融和ACS分析,并报告了退化诊断指标。主要不足在于:实验仅在单一游戏数据集上进行,泛化性验证不足;基线仅包括帧级方法,未与近期token-level方法或最新音频编码器对比。

  • 清晰度 (0.9/1):论文结构合理,问题定义、方法和实验阐述清晰,图表有效辅助理解。部分术语(如skill rating与difficulty tier)的区分需仔细阅读。整体写作质量良好,符号和公式使用规范。

  • 影响力 (1.0/1.5):该研究对音乐游戏关卡自动生成这一特定应用领域有直接推动作用,提出的事件序列表示和ACS分析工具具有参考价值。但该领域相对小众,且论文发表于ICMR(多媒体检索会议)而非顶级ML/AI会议,影响力主要限于细分领域。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.3/0.5):论文提供了较详细的模型架构、优化器、学习率调度、正则化等关键超参数和实现细节。结合开源代码的承诺,方法流程基本可复现。主要缺陷是未提供训练硬件信息。

  • 工程/实践价值 (1.0/1.5):论文构建了从原始游戏资产到模型训练再到推理重建的完整工程链条,事件序列表示对类似任务有明确参考价值。但忽略了关卡的空间位置信息,使其生成的序列并非完整可玩的关卡,限制了直接工程落地能力。

🚨 局限与问题

1. 论文明确承认的局限

  • 事件词汇仅覆盖核心交互(tap、hold、slide、double、break),无法表示更复杂的复合交互模式,限制了高难度关卡的生成多样性。
  • 生成的事件序列缺少空间位置信息(如触屏坐标或lane索引),因此不能直接构成完整可玩的关卡。论文将此定位为当前研究范围的选择而非表示框架本身的局限,将位置属性扩展留作未来工作。
  • 在高BPM条件下,模型可能生成违反物理设备人体工学约束的冲突动作序列,说明纯符号序列建模未显式考虑空间或物理约束。
  • 音频编码器对特定乐器的瞬态跟踪能力有限,导致生成的事件有时与音乐中的具体线索关联较弱。
  • 全局节拍假设:论文假设每首歌有一个全局标准BPM,虽然实际音乐中可能存在局部速度变化或多个速度段。
  • 观察到的失败模式还包括:长节拍偏移间隔过渡段中的相位漂移,以及高难度关卡中事件类型多样性的不足。

2. 审稿人发现的潜在问题

  • 泛化性验证不足:实验仅在单一游戏(maimai)的数据集上进行。maimai是触屏式街机游戏,其事件类型、空间布局和交互模式与其他类型的音乐游戏(如DDR/键盘式、osu!式、Beat Saber式)有显著差异。该数据集的风格、难度分布、事件类型是否具有广泛代表性未知。
  • 元数据融合方式简单:将BPM、技能评级、难度等级简单地拼接为全局向量并广播到所有帧,可能丢失元数据间更复杂的交互信息。BPM作为标量可能无法很好地捕捉局部节奏变化。论文未与更复杂的融合策略(如交叉注意力融合、元数据前置等)进行对比。
  • 评估容差固定:事件对齐使用的1/8拍固定容差是否适用于所有难度和节奏型值得商榷。不同难度或风格的关卡可能需要不同的评估视角。
  • 缺乏与最新音频编码器的对比:仅比较了Whisper-base和MERT-base,未探索更大规模或更先进的音频/音乐编码器(如BEATs、Audio-MAE、MusicFM等)可能带来的提升。
  • 缺乏与近期token-level方法的对比:基线仅包括帧级方法(DDC, GeneLive!),未与近期的token-level或序列级生成方法进行对比。
  • “事件"的定义粒度:将hold事件拆分为独立的start/end令牌,并在解码时确定性匹配,增加了序列长度和匹配复杂度。是否可以考虑使用单个hold事件令牌配合时长信息,或许更高效。
  • 教师强制分数的合理性:ACS分母 \(S_{\text{forced}}\) 使用教师强制解码作为经验上界,但教师强制与自回归解码之间存在分布偏移,该上界的紧度和在不同模型规模下的稳定性值得讨论。
  • 数据量有限:4187个关卡、21595个训练序列的规模在大规模序列模型训练中相对较小,论文未讨论数据量对性能的影响或数据增强策略。

← 返回 2026-07-13 语音/音乐/音频论文速递