英文题目:Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.1898
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据集 #自回归模型 #扩散模型 #音乐 #符号音乐生成
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Hongju Su:机构信息未能从会议 PDF 纯文本可靠映射
- Ke Li:机构信息未能从会议 PDF 纯文本可靠映射
- Lan Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Honggang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Zhe Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本控制符号音乐生成需以自然语言提示输出多音轨音符序列,难点在于音高、乐器、时值、速度等音符内属性本为无序集合而无天然先后顺序,强行展平为固定单向序列会拉长序列并固化属性依赖,限制可控性与解码效率。Amadeus先由自回归音符生成器沿时间逐音符产生隐向量,以建模全局音符序列的结构演进。其输出经条件信息增强模块通过自注意力提炼判别特征,并以交叉注意力融入起始符承载的全局音乐上下文,得到增强表示后送入音符解码器。音符解码器基于掩蔽离散扩散对当前音符的属性子集并行去噪恢复,训练时随机掩蔽属性子集学习双向依赖,推理时可指定任意已知属性并调节去噪步数以权衡质量与速度。与强制固定属性顺序的自回归及层次自回归方法不同,该两级设计将序列级自回归与属性级双向扩散解耦,实现了属性级并行解码、灵活属性控制与可调推理速度的统一。在MidiCaps测试集文本条件生成任务下,Amadeus的TBT为73.93,高于T2M-InferAlign的39.32,且CLAP为0.20与最强基线持平。该结论适用边界受限于西方流行与古典偏置的预训练语料、10秒渲染音频与工具提取属性的评测协议,尚未验证长曲结构保持与专业作曲家认可等外推场景。推理开销方面8步去噪时吞吐为16.23音符每秒、单步时可达32.12音符每秒,训练采用分布式数据并行与混合精度加速但原文未披露具体硬件型号与时长。
🔗 开源与复现资源
- 代码相关资源:https://github.com/lingyu123-su/Amadeus — 链接可访问(HTTP 200)
- 第三方资源:https://kaggle.com/datasets/googleai/musiccaps → https://www.kaggle.com/datasets/googleai/musiccaps — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么直接套用音频生成不够?
本文的输入是文本提示加符号音乐序列,目标是生成与文本一致、可编辑的符号音乐。符号音乐在这里指以离散演奏信号表示的乐曲,例如 MIDI,每首乐曲被写成按时间排列的音符序列,每个音符再由多个属性唯一确定。初学者可以把五线谱上的一个音符想象成一张卡片,卡片上有音高、时值、力度、乐器、节拍位置、和弦、速度、类型等字段,填满所有字段才算一个完整音符。
与直接生成波形的音频方法相比,符号音乐的优势是紧凑且可无损编辑,改一个音的音高或乐器不需要重新合成整段声音。但难点也在这里:属性之间是否存在固定先后顺序。已有主流做法把一个音符的属性排成固定序列,先预测音高再预测乐器再预测时值,相当于强行规定填卡片的顺序。论文认为这与乐理直觉不符,音高、乐器、时值更像同时互相影响的集合,固定顺序既增加序列长度,又限制并行解码和细粒度控制。
因此本解读的输出目标是让研究生能复述关键动作:如何把乐曲表示为音符序列,如何用 2 级结构分别处理音符间时序和音符内属性,如何训练掩码扩散解码器,如何用文本条件做对齐,以及在什么实验条件下报告了哪些数字。后续例子凡属教学类比会明确标为例子,不作为论文的实测结论。
同输入同目标的前人走了哪两条路,各自卡在哪里?
第一条路是计算机辅助作曲到深度符号生成的演进。从早期的马尔可夫链和规则系统,到循环网络,再到 Transformer,代表性工作包括 Music Transformer 用相对注意力处理长序列,REMI 引入节拍感知的切分方式,Compound Word 把同一时刻的属性合并以缩短序列,Nested Music Transformer 尝试分层自回归。这些工作共享同输入同目标,即给定上下文或控制信号生成符号序列,监督来自真实乐谱的下一个标记。
第二条路是自回归之外的并行生成。离散扩散把连续扩散离散化,通过掩码加噪再逐步去噪实现并行恢复,已有工作将其用于文本和符号音乐。但论文指出,直接搬运会忽略领域特性:有的把属性仍当有序序列,有的只做属性级并行却丢掉音符级时间结构。结果是长结构建模、生成速度、可控性三者难以兼得。
本文与这两条路的区别是显式的:不否认音符之间需要自回归,但否认音符内部需要固定顺序。教学例子:好比写多声部乐队总谱,先决定第几小节出现哪个和弦声部是时间问题,而同一时刻小提琴用什么音高配多大力度更像互相商量。同时,论文用互信息分析支撑该判断,附录报告音高与乐器等属性的归一化互信息处于弱到中等水平,最大依赖也不具备单向强决定性,这为双向建模提供了经验依据。
要解决的具体问题是什么,如何判断是否解决?
具体问题是文本控制的符号音乐生成,要求输出同时满足音乐性、条件一致性、属性可控性和推理效率。音乐性指旋律节奏和声是否自然连贯,可控性指能否在推理时固定某些属性而生成其余属性,效率指每秒能生成多少音符。判断标准在论文中是两套:一是客观指标,包括文本与音频相似度的 CLAP 分数,以及速度容差命中率、调性正确率、拍号正确率、乐器覆盖率、前三情绪覆盖率;二是人工听评,包括音乐质量、整体匹配、风格匹配、情绪匹配。
关键约束是公平比较。论文把 Amadeus 控制在约 170M 参数,与约 160M 的 Text2Midi 和 T2M-InferAlign、约 200M 的 MuseCoco 放在相近参数预算下比较,避免用规模碾压掩盖结构差异。另有一个 500M 参数的 Amadeus-M 用于探索规模上限,但速度会下降。理解这一点才能正确解读后续表格:主表比较的是结构差异,而非单纯堆参数的结果。
Amadeus 的两级结构如何分工,一条样本走完是什么样子?
Amadeus 分为音符生成器和音符解码器 2 级。先沿一条样本走完全程:输入是一段文本,例如一段短促的 E 小调电子片段描述,加上已生成的音符嵌入序列。文本经 Flan-T5 编码为隐状态,音符序列经属性求和加位置嵌入得到音符嵌入。生成器以自回归方式输出下一个音符的隐向量,再经条件信息增强模块提炼,最后由离散扩散解码器把该隐向量并行展开为该音符的全部属性取值。
自回归建模 × 双向离散扩散: 自回归建模负责在时间轴上逐个音符推进,维持乐曲的先后顺序和长程结构;双向离散扩散负责在单个音符内部并行恢复多个属性,不预设音高先于乐器或时值等顺序。二者搭配的理由是音符之间有明确时间先后,而同一音符的属性更像集合需要互相参照,组合后上层保证连贯性、下层获得并行解码和任意属性控制能力。
这种分工把长度压力拆开:若把每个音符的每个属性都当独立标记,序列长度会变成音符数乘以属性数,难以建模长结构;2 级结构让自回归只处理音符数级别的长度,属性级并行由扩散承担。推理灵活性也来自这里:标准生成时输入全掩码音符序列,需要控制时把指定属性设为已知、其余掩码,模型直接以观察到的属性为条件预测被掩码位置。
下面这张图是理解并行与顺序差异的关键,它用 3 个音符乘 4 个属性共 12 个属性格对比顺序解码约束,请按引导观察颜色累积与步数的关系。
看图路径: 1. 先看横轴三个音符 N1 到 N3 与每音符四个属性格,确认总属性数为 12 格;2. 再对比左侧 REMI 逐格对角增长与右侧 NMT 按音符分段逐格增长的差异;3. 观察绿色已解码格在不同步 S1 到 S12 的累积方式,理解为何不能并行;4. 对照正文 T 等于 4、2、1 时 Amadeus 可并行恢复多格,体会步数与延迟的 trade-off
论文图 1。原论文 Figure 1:“visually illustrates the flexible step- adjustable decoding mechanism of our method during the reverse process.”。
从本次收到的像素可见,左侧(a)remi 面板横轴分为 N1、N2、N3 共 3 段,纵轴为 S1 到 S12 共 12 行,每行比上一行多 1 个绿色格,形成对角线式累积,每步只解码 1 个属性,共需要 12 次迭代。右侧(b)nmt 面板横轴同样为 N1、N2、N3,纵轴按 S1、S2、S3 分组,每组内部仍是每步 1 格的对角累积,同样共需要 12 次迭代,只是按音符分段推进。论文进一步报告 Amadeus 消除属性间顺序依赖,允许设置总步数 T 为 4、2 甚至 1,每步按置信度同时固定多个属性格,从而在解码速度与生成质量之间调节。
生成器、增强模块与扩散解码器各自计算什么?
先讲表示。每个音符的属性被当作标记,分别映射为嵌入向量后与可学习绝对位置嵌入相加,得到复合音符嵌入。生成器是基于 Transformer 解码器的结构,读入文本条件与历史音符嵌入,输出下一个音符隐向量。该向量尚未对应具体属性取值,只是一个待展开的压缩表示。
音符生成器 × 音符解码器: 音符生成器是 Transformer 解码器,它读入已生成的音符嵌入序列和文本条件,输出下一个音符的隐向量;音符解码器是以该隐向量为条件的掩码扩散模型,把隐向量展开为具体的音高、乐器、时值等离散取值。搭配原因是把长序列建模与细粒度属性建模解耦,组合意义在于序列长度不再乘以属性数,同时保留对属性间复杂依赖的建模能力。
增强模块的作用是对上述隐向量做提炼。论文用自注意力增强判别特征,再以起始音符隐状态为全局信号做交叉注意力,融入前缀的全局结构信息。提炼后的向量经交叉注意力注入扩散模型,指导掩码属性的逐步恢复。
\[zm+1 = G(c, n0, n1, . . . , nm)\]上式说明生成器的输入输出关系:给定条件与零号到当前音符嵌入,生成下一个音符隐向量。符号含义是条件、历史嵌入为输入,输出为隐空间向量,计算目标是为下一步属性解码提供充分的时序上下文。原文未给出该 Transformer 内部每层的梯度细节,本解读不猜测其残差与归一化实现。
\[ˆzm+1 = CA\]上式是增强模块的计算概要:对当前隐向量做自注意力,再与全局起始状态做交叉注意力。输入是生成器隐向量与全局信号,目标是得到更具判别性和上下文感知的条件向量。原文提到均值池化等替代全局策略是可能的扩展,但本研究实际采用起始标记隐状态。
条件信息增强模块 × 交叉注意力: 条件信息增强模块是对生成器输出隐向量做 2 次提炼的 Transformer 解码器结构,交叉注意力是它引入全局上下文的具体计算方式。该模块先用自注意力增强当前隐向量的判别特征,再用交叉注意力以起始音符隐状态为键值引入全局前缀信息。组合后扩散解码器得到的条件信号同时包含局部预测意图和全局结构约束,有助于维持生成序列的连续性。
扩散解码器的前向是对每个属性独立按步掩码,反向从全掩码或部分掩码出发逐步恢复。每步按均匀恢复调度决定解码多少个标记,对每个被掩码属性预测词表分布,取最大 softmax 概率为置信度,每步固定置信度最高的若干个并重掩其余。
\[Confidence = max\]上式定义置信度为预测分布的最大值,输入是增强后条件与当前掩码状态,目标是为本步选择最可信的属性先固定。原文明确该机制类似局部贪心,适度减少步数有时反而帮助跳出局部最优,这解释了消融中步数为 4 反而在个别指标更好的现象。
\[LCE = −PK v=1 I[N k m+1 = v] log p(v | N k\]上式是掩码加权交叉熵损失的概要,核心是只在有效被掩码且非填充位置计算交叉熵,并用掩码概率的倒数平衡不同属性的掩码频率差异。当全部属性被掩码时,它等价于常规自回归交叉熵。符号中掩码指示、属性词表大小与指示函数共同决定监督来源,梯度只来自被选中的掩码位置,未报告标签平滑等细节则视为缺项。
属性为何可以不设顺序,互信息分析做了什么操作?
论文在附录用 LakhClean 语料做了属性依赖分析,操作可复述为:把 MIDI 转为音符表示,提取节拍位置、音高、力度、时值、乐器、和弦、速度、类型等维度,做标签编码后计算经验互信息,再用边际熵几何均值归一化到 0 到 1 区间,并进一步看非对称条件熵的方向性。
掩码扩散 × 置信度保留: 掩码扩散指前向按步随机把属性替换为掩码符、反向从全掩码逐步恢复的训练推理框架;置信度保留指反向每步只固定预测概率最高的若干属性、其余重新掩码的调度策略。前者提供可并行、可指定已知属性的生成方式,后者提供用步数调节质量与速度的旋钮,组合后推理时可以通过设置总步数 T 和每步解码数来权衡延迟与精度。
报告显示,音高与乐器等核心属性的归一化互信息处于弱到中等,例如音高与乐器约 0.28,节拍位置与速度约 0.45 为最强,但仍不构成强决定关系。条件熵例子显示已知音高对时值不确定性的降低大于反方向,说明存在方向性统计影响,但整体是互相重叠而非层级决定。论文据此认为固定生成顺序并非最优,双向或非自回归策略更适合捕捉对称重叠关系。该分析的性质是支持性证据而非因果证明,不能直接推出去掉顺序必然提升所有指标,仍需主实验验证。
数据如何构造,训练分哪两阶段,优化条件是什么?
数据构造分为预训练语料与微调语料。预训练整合 GigaMIDI、AriaMIDI、SymphonyNet、MidiCaps 除测试集外、XMIDI 以及自爬的高质量片段,经清洗后约 1,900,000 个音乐文件、约 4,000,000,000 个音乐事件,论文称按属性标记折算约 32,000,000,000 个属性标记。处理包括规则过滤、和弦拍号时值乐器检测、事件序列转词表索引,缺失速度默认 120 BPM、缺失拍号默认 4/4,并滤除仅含鼓组的低质文件。微调语料整合 MidiCaps、XMIDI 与自有数据,经 Music21 与 Mido 提取调式拍号速度时值乐器,再合成音频提取风格情绪和弦,用模板加 DeepSeek-v3 生成文本标注,XMIDI 直接用其情绪与风格标签,最终约 320,000 条带文本的高质量样本,且不做乐器合并以保留文本对齐。
预训练 × 监督微调: 预训练在大规模无文本或弱标注的符号音乐语料上学习通用的音符时序与属性依赖;监督微调在带结构化文本描述的高质量子集上学习文本到音乐的对齐。前者负责覆盖多样的节奏调性与配器,后者负责把速度、调号、拍号、乐器、情绪等可评测条件绑定到生成行为,组合后模型既有音乐性基础又能响应文本控制。
训练分 2 个阶段:先在预训练集上预训练,再在微调集上做文本引导微调。优化采用 AdamW 加余弦学习率调度与梯度裁剪阈值 1,用分布式数据并行与混合精度加速,条件生成与预训练微调阶段用梯度累积步数 4。学习率按任务区分:无条件生成最大 1e-4,条件生成与大规模预训练 2e-4,文本微调 5e-5;无条件与条件生成最多 100,000 次迭代,预训练最多 300,000 次,且不直接用预训练最后检查点而是选中间检查点做后续实验。
文本与 MIDI 融合在 Transformer 解码器层用交叉注意力实现,查询来自 MIDI 隐状态,键值来自文本编码输出,使每个音乐标记能关注关键词。代码仓库当前可用,已公开地址见证据资源,权重与可运行状态需以本次可达性为准,本次仅确认代码链接可用。
评测在什么数据与协议下进行,指标方向如何读?
主评测是文本控制的符号音乐生成,测试用 MidiCaps 测试集的 500 条文本标注引导生成,每样本生成 1024 个标记,渲染为波形后截取 10 秒。整体相似度用 CLAP 分数衡量文本与音频嵌入的余弦相似度,越大表示对齐越好。条件精度包括速度容差命中率、调性正确率、拍号正确率、乐器覆盖率、前三情绪覆盖率,均为越大越好,速度容差指预测速度落在真值正负 10 BPM 内,调性忽略八度且未定义按 C 大调处理,乐器覆盖要求预测完全覆盖真值或至少命中其一,情绪覆盖类似。生成速度用每秒生成音符数衡量,越大越快,测试硬件为 RTX3090 24G。
无条件生成在 LakhClean 与 SOD 上每模型生成 500 个固定长度样本,渲染后统一截 30 秒,用音阶一致性、音高熵等符号域指标评估,音阶一致性越大越好,熵类越小通常表示更集中,但需结合音乐性判断。人工听评招募 20 名不同背景参与者,每人随机听 5 组文本对应的多模型 MIDI 同合成渲染结果,按五点量表评价音乐质量、整体匹配、风格匹配、情绪匹配,越大越好,并报告与最强基线的配对 t 检验与评分者一致性。复现时必须对齐数据集划分、每样本标记数、截取时长与合成设置,否则数字不可比。
主结果在可比参数下比了谁,数字支持什么判断?
要回答的问题是:在相近参数预算下,2 级双向结构是否同时改善对齐精度与速度。公平条件是 Amadeus 约 170M 参数,对比约 160M 的 Text2Midi 与 T2M-InferAlign、约 200M 的 MuseCoco,指标方向均为越大越好,速度为每秒音符数。
| 条件 | 指标 | Text2Midi | MuseCoco | T2M-InferAlign | Amadeus | Amadeus-M |
|---|---|---|---|---|---|---|
| 可比参数文本生成 | 速度 notes/s | 4.02 | 1.67 | 4.02 | 16.23 | 10.51 |
| 可比参数文本生成 | CLAP | 0.19 | 0.19 | 0.20 | 0.20 | 0.21 |
| 可比参数文本生成 | 速度容差 TBT | 31.76 | 34.21 | 39.32 | 73.93 | 76.31 |
| 可比参数文本生成 | 调性 CK | 22.22 | 14.66 | 29.80 | 39.31 | 43.07 |
| 可比参数文本生成 | 拍号 CTS | 84.15 | 94.24 | 84.32 | 96.98 | 97.02 |
论文报告 Amadeus 在文本条件保真与细粒度指标上全面领先基线,同时推理加速到 16.23 notes/s,约为既有方法的 4 倍。细粒度上速度与调性提升幅度最大,拍号、乐器、情绪也有改善,支持属性级双向建模有效捕捉节奏与和声功能关系的解释。代价是扩大到 500M 参数的 Amadeus-M 虽然各项继续提升,但速度回落到 10.51 notes/s,仍高于基线的 4.02 notes/s,说明规模带来质量收益但消耗速度。未胜出边界是 CLAP 绝对值仍在 0.20 附近,文本音频对齐仍有提升空间,且固定拍号实验显示 100.0 的拍号分是在给定控制下的结果,不能与无控制设置直接比优劣。
固定属性控制与人工听评是否一致指向可控性?
要回答的问题是:推理时固定部分属性是否不损失其他质量,以及人类是否感知到差异。公平条件是固定拍号为文本指定值、其余属性由模型生成,对比无控制生成;人工听评用相同合成设置、同组文本、五点量表。指标方向均为越大越好。
| 条件 | 指标 | Text2Midi | MuseCoco | T2M-InferAlign | Amadeus |
|---|---|---|---|---|---|
| 人工听评五点量表 | 音乐质量 MQ | 3.45 | 3.32 | 3.47 | 3.82 |
| 人工听评五点量表 | 整体匹配 OM | 3.05 | 3.03 | 3.12 | 3.68 |
| 人工听评五点量表 | 风格匹配 GM | 3.25 | 3.17 | 3.32 | 3.80 |
| 人工听评五点量表 | 情绪匹配 MM | 2.83 | 2.78 | 2.96 | 3.73 |
| 固定拍号控制 | 拍号 CTS | 84.15 | 94.24 | 84.32 | 100.0 |
表后解释是:固定拍号时模型在拍号上达到 100.0,同时其他指标与无控制时相当,支持训练无关的细粒度音符级控制能力,且未以牺牲文本一致性为代价。人工听评中 Amadeus 在音乐性与可控性四项均高于最强基线 T2M-InferAlign,且配对检验显著,评分者一致性 Fleiss kappa 为 0.68,支持改善是稳健的而非随机波动。限制是主观评价依赖 20 人样本,论文局限部分另提到 15 人小样本的表述冲突,复现时应明确标注该不一致,不自行调和人数口径;同时钢琴卷帘定性对比显示基线音符稀疏、持续性差,而本方法纹理更复杂,但该视觉判断不能替代可重复指标。
去掉增强模块或减少扩散步数会发生什么?
要回答的问题是:增强模块是否必要,以及步数与质量速度如何交换。比较条件是同一文本生成任务,只改变是否启用 CIEM 与去噪步数,指标方向为速度越大越快、其余越大越好。
| 条件 | 指标 | 无 CIEM 步数 8 | 有 CIEM 步数 1 | 有 CIEM 步数 4 | 有 CIEM 步数 8 |
|---|---|---|---|---|---|
| 消融速度质量 | 速度 notes/s | 16.24 | 32.12 | 20.11 | 16.23 |
| 消融速度质量 | CLAP | 0.17 | 0.19 | 0.20 | 0.20 |
| 消融速度质量 | TBT | 70.01 | 59.84 | 66.46 | 73.93 |
| 消融速度质量 | CK | 38.76 | 28.19 | 39.00 | 39.31 |
| 消融速度质量 | CTS | 94.33 | 89.30 | 97.38 | 96.98 |
表后解释是:去掉 CIEM 后整体质量明显下降,论文称因缺少全局信息导致序列连续性受损,支持该模块不可或缺的判断,但原文未给出去掉后必然如何的因果证明,应读为在该实验条件下的观察。减少步数可把速度推高到 32.12 notes/s,但性能总体下滑,因为迭代并行解码能逐步整合已解码信息;步数并非越多越好,步数为 4 时在拍号与情绪指标上反而略优于步数 8,论文用置信度保留类似局部贪心的机制解释,适度减少步数有助于跳出局部最优。反例是追求最高质量时仍需 8 步,此时速度 16.23 notes/s 仍远高于对比方法的 4.02 notes/s,而追求极限速度时质量最低但仍与对比方法可比,说明 trade-off 曲线整体占优但每步单调性不成立。
哪些边界没有被测,哪些结论不能推广?
论文明确报告 3 类局限。第一,AMD 虽大规模但以网络爬取为主,可能偏向西方古典与流行,对民族或先锋风格覆盖不足,因此跨风格泛化结论待验证。第二,主观评价样本较小且存在人数表述不一致,正文方法部分称 20 名参与者,局限部分称 15 人小样本,复现时必须标注该冲突,不能自行选择其一掩盖,更大规模与专业作曲家队列的验证尚未完成。第三,大规模生成模型存在记忆效应,可能无意复现训练样本,当前缺乏自动检测与缓解版权伦理风险的机制。
未测量项同样重要:训练资源、推理延迟分布、输出帧率与实际端到端延迟被分开讨论的程度有限,总体速度趋势不等于每组每步都成立。互信息分析的相关性不能当作因果,固定顺序不必要是有限解释而非已证明的普遍定律。伦理声明称仅用公开或许可数据做学术研究,未做涉及人类被试的额外实验,但这不消除版权风格复现的潜在不利影响,论文明确不鼓励用于盗版与侵权。
复现先做什么,需要哪些配置与检查点?
复现主结果先做三件事。第一,准备数据与划分:预训练用约 190 万文件,微调与测试严格排除 MidiCaps 测试集,微调约 320,000 条带文本,测试用 500 条文本每样本生成 1024 标记并截取 10 秒,合成设置保持一致。第二,对齐模型与优化配置:主模型约 170M 参数对比基线约 160M 到 200M,文本编码用 Flan-T5 并经交叉注意力融合,优化用 AdamW、余弦调度、梯度裁剪 1、梯度累积 4,学习率按无条件 1e-4、条件与预训练 2e-4、微调 5e-5 设置,迭代上限按任务取 10 万或 300,000,且预训练选用中间检查点而非最终点。第三,固定评测口径:CLAP 越大越好,速度容差正负 10 BPM,调性忽略八度,乐器与情绪按覆盖率计算,速度在 RTX3090 24G 上以每秒音符数报告。
关键超参数与信息条件是扩散总步数 T 与每步解码数调度,复现速度质量曲线时应分别测 1、4、8 步。代码当前可用,地址为官方仓库,但权重下载与系统可运行状态需自行确认,本次仅验证代码链接可达。缺项是生成器内部归一化、词表细节与合成器具体参数在正文未完全展开,需查补充材料与代码,不能从模型名称推定实现。
何时值得尝试这种两级双向方案,还需补哪项验证?
当任务同时要求长结构连贯、细粒度属性控制与可调速度时值得尝试:例如文本到多乐器符号音乐、固定拍号或乐器后补全其余属性、需要在延迟与质量之间切换的交互作曲。复现优先级是先跑通全掩码标准生成,再试指定属性为已知的控制生成,最后扫扩散步数画出速度质量曲线。若你的语料中属性依赖更强或存在明确书写顺序,应先在自己的数据上重做互信息与条件熵分析,再决定是否沿用完全双向假设。
还需补的验证包括跨风格与小众乐器的覆盖测试、更大规模专业听评、记忆效应与版权相似度检测,以及在不同硬件上的延迟分布而非单点速度。只有补齐这些,才能把论文在可比参数与特定测试集上的优势,推广为可部署的收益判断。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
