英文题目:Is Symbolic Music a Specific Language? Exploring Inspiration-to-Structure Machine Composition via LLMs

会议身份:conference:aaai:2026:conference-paper-id:37163

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #对比学习 #大语言模型 #符号音乐生成

评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhejing Hu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yan Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Aiwei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Sheng-hua Zhong:机构信息未能从会议 PDF 纯文本可靠映射
  • Bruce X.B. Yu:机构信息未能从会议 PDF 纯文本可靠映射
  • Gong Chen:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该任务以用户旋律创意 m 与自然语言段落意图 s(如verse/chorus等8类)为输入,以ABC记谱法(ABC notation)表示的目标段落 y 为输出,难点在于通用大语言模型虽能背诵乐理,却难以把短动机发展为符合段落功能的完整结构。所提由灵感到结构(Inspiration-to-Structure, IoS)模拟作曲家三阶段认知:语义认知学同曲重复段落的动机共享,结构认知学同曲段落强依赖与跨曲同名段落结构独立的不对称性,协作认知用多轮交互迭代打磨。为此先把POP909重组为结构化三元组数据(Structured Triplet Data, STD),再用双实例结构对比优化(Dual-Instance Structural Contrastive Optimization, DiSCO)联合监督微调训练,推理时按旋律加段落标签自回归采样并支持最多3轮改写。与把音乐当纯文本的监督微调相比,该机制显式区分段内重复一致性与跨曲结构独立性,引入了作曲先验。在保留100首歌的600轮对话客观评测与115次盲测人评中,Llama3.2-3B加IoS总体分布与结构分同时领先同基座监督微调与GPT-4o,论文宣称结构连贯性最高提升47.8%、艺术创造力提升21.8%。该结论目前仅在流行体裁单段生成上验证,全曲段落间发展与跨风格泛化尚未证明,原文未披露训练时长、推理延迟与部署成本。

🔗 开源与复现资源

  • 第三方资源:https://openai.com/ — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,哪些信息必须保留?

这篇论文只研究一个可操作的任务:用户给出一小段旋律想法与想要的段落类型,模型要生成对应类型的完整符号音乐段落。输入是二元组,旋律用 ABC 记谱字符序列表示,段落标签来自 8 个类型,包括前奏、主歌、副歌、桥段、前副歌、后副歌、间奏与尾奏。输出同样是 ABC 记谱序列,代表该标签下的目标段落。初学者可以这样理解:输入是种子与图纸,输出是按图纸长大的一间房间,而不是整栋房子。

必须保留的信息有 3 类。第一是旋律想法的音高与节奏走向,因为后续人为评价包含与输入旋律的相关性。第二是段落标签的结构意图,例如主歌与副歌在流行曲式中承担不同功能,不能混写。第三是对话上下文,因为构造与推理都是多轮的,前一轮生成的段落会影响后一轮判断。论文把音乐显示为五线谱只是为了展示,模型实际读写的是符号序列,这一点在复述时不能颠倒。

输出的检验方式也是双轨的。客观上用生成段落与人工 ground truth 在音高分布、时值分布与和弦分布上的重叠面积衡量,越高表示统计特性越接近真人作品。主观上由听众在结构契合、相关性、音乐性、创造力与交互满意度 5 个维度打分,每项 1 到 5 分再取平均。理解这套输入输出与检验,才能明白后面为什么需要三元组与对比学习。

已有路线走到哪里,还缺哪一步?

机器作曲从马尔可夫系统、变分自编码器与生成对抗网络,发展到 Transformer 建模长程依赖,再到强调结构感知的生成,这是第一条线。第二条线是把大语言模型直接用于符号音乐,例如 ChatMusician 通过监督微调学习乐理与作曲,证明符号音乐可以被当作序列语言建模。第三条线是对比学习,在视觉与语言中用于学语义相似与结构区分,在音乐中曾用于分类检索、旋律提取与音频符号桥接,也有人用于动机级表示。

论文的判断是:前人验证了符号音乐像语言,但没有解决从部分符号输入经自然语言交互生成结构化段落的问题。即使 GPT-4o 这类模型能讲乐理,给定旋律想法生成符合主歌预期的段落时仍会出现缺乏发展与结构错位。缺的不是更大的模型,而是面向作曲过程的学习范式。IoS 的定位就是补这一步:不改模型结构,而是改变数据组织与训练目标,让模型学会灵感到结构的认知跳跃。

相关工作的对照要按同输入同目标来读。歌词生成天然是文本任务,与本文的符号音符生成不同。RWKV-Music 与 CRG 等音乐专用模型与通用大模型在本文中是可运行基线,不是同一训练条件下的胜负排名。DiSCO 也不是通用对比学习的直接搬运,而是按曲内与曲间关系重写了正负例定义。

为什么直接微调也写不好一个主歌?

论文用一个最小例子暴露问题:同样的生成主歌指令,不加 IoS 的大模型输出缺乏音乐发展,结构也不符合典型主歌预期;加上 IoS 后输出有更丰富的展开且结构符合预期。这个例子是教学用的定性展示,不是数值证据,但它定义了失败形态:音符合法不等于段落合格。

背后的原因是常规监督微调把符号音乐当普通文本做负对数似然,只要求下一个词元像训练数据,不要求区分主歌与副歌的功能差异。人类作曲的参照是贝多芬《英雄交响曲》草稿中用文字注释引导动机发展,说明作曲包含从灵感到结构化的多步认知。论文据此提出 3 个阶段:语义认知看同曲重复段落如何共享想法,结构认知看曲内段落强关联与跨曲同名段落弱关联的不对称,协作认知看人机多轮如何逐步求精。

下面这张图把同一输入下的两种输出并排放置,初学者应先读输入再读输出差异,不要把它当成可复现的分数。

看图路径: 1. 先看左右两侧是否为同一输入文字,再看下方输出谱例的行数与声部差异;2. 再看左侧黄色警告与右侧绿色对勾分别标注的两个维度;3. 最后确认图注说明展示用五线谱而模型实际交互用符号序列

原论文 Figure 1:Demonstration of generating a verse from a melodic idea using LLMs with and without IoS.

论文图 1。原论文 Figure 1:“Demonstration of generating a verse from a melodic idea using LLMs with and without IoS.”。

这张图左侧是普通大模型路径,输入为基于 ABC 旋律生成主歌的文字指令,上方谱例为输入灵感,下方谱例为输出主歌,标注为缺乏发展与结构不符。右侧是带 IoS 的同一模型路径,输入相同,输出谱例变为多声部织体并标注为发展丰富与结构符合。图注明确说明展示用五线谱,模型交互时转换为符号序列。因此读图结论只能是任务定义与现象示意,不能推出 IoS 在所有段落类型上都同样有效,具体效果要看后文按段落与轮次拆分的实验。

IoS 全景:一个样本如何走完三阶段?

IoS 的全称是灵感到结构,做法是让模型对一个样本依次经历语义、结构与协作 3 种训练信号。先沿一个样本走完全程:用户给出旋律与目标段落类型,例如给定旋律生成主歌;模型把文字提示与 ABC 序列一起分词,送入自回归 Transformer;模型自回归采样生成目标段落的 ABC 序列;训练时该序列既受监督微调约束,也受对比损失约束;推理时只用采样生成,不再计算对比损失。

3 个阶段的分工如下。语义认知对应曲内视角,学习同曲两个主歌应相近、主歌与副歌应分开。结构认知对应曲间视角,学习同曲不同段落仍有整体黏合,而跨曲同名段落虽功能相似但结构独立。协作认知对应多轮对话形式,学习在连续问答中保持上下文并接受修正。支持它们的 2 个组件是结构三元组数据与双实例结构对比优化,前者造数据,后者定目标。

协作认知 × 交互式作曲: 协作认知指模型在多轮中接收用户修订并保持上下文,分工是过程机制;交互式作曲指用户用自然语言指定段落类型并提供旋律想法的任务,分工是应用形态;搭配是因为 1 次生成难以定稿,组合后评测允许最多 3 轮修订再打分。

整体优化目标是分条件相加:若当前样本是曲内三元组,则总损失为监督损失加权重的曲内对比损失;若是曲间三元组,则为监督损失加权重的曲间对比损失。权重记为拉姆达,原文取 0.5。推理时给定旋律与段落类型,从模型分布中自回归采样。这种设计把作曲先验写进数据与损失,而不是写进网络结构。

数据与损失:正负例如何定义,对比算什么?

结构三元组数据的构造起点是包含 N 首歌的数据集。对每首歌,按 8 类段落的人工标注切出段落。曲内三元组包含输入、锚点、同曲同类型正例与同曲不同类型负例;曲间三元组包含锚点、同曲正例与来自不同歌曲的两个负例。锚点是该输入对应的真实目标段落,正例与负例按上述归属选取。论文强调正负不是好坏之分,而是结构关系的远近定义。

表示的计算方法是把整段多轮序列送入大模型得到最后一层隐状态,再按已知的锚点、正例、负例的词元边界切段,对每段做平均池化得到固定维向量。曲内得到 3 个向量,曲间得到 4 个向量。相似度用余弦相似度,间隔超参数记为伽马,原文取 0.1。直觉是拉近应相近的段落表示,推远应分开的段落表示,间隔避免两者挤在一起。

监督微调部分是标准的负对数似然,这是语言建模的原始目标,先把它与对比目标区分开。

\[LSFT = −E(x,y)∼D\]

该式表示在给定输入下模型对目标输出的预测分布取对数再取负期望,目标是让生成流畅且符合真实音乐语法。训练时它对多轮对话中所有回答词元累加,条件包含此前所有查询与回答。

曲内对比损失让锚点与正例的相似度高于锚点与负例,超出间隔则惩罚。

\[Lintra = EDST D\]

该式中期望取自结构三元组数据集,相似度差再加间隔后经柔和的指数对数形式计算,目的是学到同曲重复段落的语义一致性。

曲间对比损失把两个跨曲负例的相似度取平均后再与正例比较。

\[Linter = EDST D\]

该式中锚点与正例来自同一首歌,两个负例来自不同歌曲,目标是捕捉整曲的结构黏合,同时区分跨曲同名段落的结构独立性。

语义认知 × 结构认知: 语义认知负责同一首歌内重复段落是否共享同一旋律想法的判断,分工是内容一致性;结构认知负责同曲段落强依赖与跨曲同名段落弱关联的区分,分工是形式关系;二者搭配是因为流行乐既要主题统一又要段落功能分化,组合后模型同时学到写什么与放在哪里合适。

song 内对比 × song 间对比: song 内对比拉近同曲同类型段落、推远同曲不同类型段落,分工是主题语义;song 间对比拉近同曲不同段落、推远跨曲段落,分工是曲内结构黏合;搭配是因为只做其一会混淆语义相似与结构归属,组合后 DiSCO 同时约束两种距离。

下面这张图展示了上述计算在模型中的位置,初学者应把上半的数据流与下半的两个分支分开读。

看图路径: 1. 先看上半部分两类样本如何分词后进入同一预训练大模型;2. 再看下半部分左侧 song 内分支与右侧 song 间分支的向量分组方式;3. 最后确认右侧引出的监督损失与对比损失是两条不同箭头

原论文 Figure 3:An illustration of DiSCO.

论文图 3。原论文 Figure 3:“An illustration of DiSCO. Each STD sample is tokenized and fed into the LLM πθ, which is trained via SFT and our proposed intra- and inter-song contrastive objectives.”。

该图上半显示曲内样本与曲间样本分别经分词进入同一预训练大模型,得到最终隐特征后做均值池化与切分,右侧引出监督损失。下半左侧为曲内对比分支,3 个向量之间画出拉近与推远箭头;右侧为曲间分支,4 个向量按同曲与跨曲分组。这说明监督管生成词元,对比管段落表示,二者作用于同一主干的不同层面。原文未报告梯度是否截断或分层冻结,复述时不能假设只更新部分参数。

多轮对话如何构造,训练条件是什么?

真实作曲是迭代的,因此三元组被嵌入多轮问答。曲内示例包含 3 对问答:给定旋律生成某段落得到锚点,再生成另一个同类型段落得到正例,再生成不同类型段落得到负例。曲间示例包含 4 对问答:给定旋律生成某段落得到锚点,生成同曲另一类型段落得到正例,再给定另一旋律生成同类型段落得到跨曲负例一,最后生成另一类型段落得到跨曲负例二。组织后曲内样本通常为 6 轮,曲间样本通常为 8 轮,轮数指查询与回答的词元总数划分,不是独立歌曲数。

结构三元组数据 × 多轮对话: 结构三元组数据提供锚点、正例、负例的段落对照,分工是给出可比的结构监督;多轮对话提供按查询与回答逐步生成段落的载体,分工是模拟迭代创作;搭配理由是单轮样本无法表达先写主歌再写副歌的上下文,组合后对比学习发生在有上下文的对话序列内部。

训练表示用 ABC 记谱,理由是更紧凑且已有研究显示大模型能理解。实现上用 Unsloth 训练,最大长度 8192 词元,在 2 块 RTX 3090 上以初始学习率 0.0001、批量 4 训练 200 轮。超参数拉姆达取 0.5,伽马取 0.1,并报告对中等变化鲁棒。测试预留 100 首歌并生成 600 轮对话。论文未给出优化器种类、学习率衰减与早停规则,复现时这是缺项,不能从模型名推定。

ABC 记谱 × 监督微调: ABC 记谱把旋律与段落编码为紧凑字符序列,分工是降低长度与计算开销;监督微调让模型逐词预测回答中的音乐词元,分工是保证流畅与语法合规;搭配理由是对比损失只调表示距离不直接生成音符,组合后生成能力与判别能力共同优化。

下面这张图是构造协议的可视化,应对照文字中的问答模板来读,不要只记颜色。

看图路径: 1. 先沿左侧歌曲到段落再到三元组的箭头看数据流向;2. 再比较左分支 song 内三轮问答与右分支 song 间四轮问答的查询差异;3. 最后看底部汇入结构三元组数据存储的箭头

原论文 Figure 2:Structural Triplet Data Construction.

论文图 2。原论文 Figure 2:“Structural Triplet Data Construction.”。

该图左侧从歌曲集合引出同曲的多个段落块,标注锚点、正例与负例后经箭头落到曲内 3 轮问答模板,每轮为查询加音乐序列回答。右侧从跨曲段落块引出 4 个段落并标注两个负例,落到曲间 4 轮问答模板,底部共同汇入结构三元组数据存储。像素中绿色高亮为旋律与段落类型占位,问答框为示意而非真实 ABC 字符。因此该图证明的是构造逻辑,不是数据规模,规模要看后文实验条件一节的数字表。

数据、划分、基线与指标如何对齐?

数据起点是 POP909 流行歌曲集,选它是因为段落边界清晰、旋律伴奏分离且内部一致性强。3 位受训音乐人独立标注每首歌的段落结构,讨论解决分歧后达成一致。标注后按三元组与多轮对话组织训练数据。数据集包含 909 首完整歌曲与 9132 条段落标注,多数歌曲含 6 到 14 个段落,曲内与曲间对比样本各 4566 条。8 个段落类型在前文已列出,复现时必须保留同一标签集合,否则正负例定义会改变。

基线分两类。音乐专用模型包括 RWKV-Music、CRG 与 ChatMusician,均在符号音乐上训练过。通用大模型包括 DeepSeek-R1、GPT-4o 与 GPT-o3、LLaMA 3.2 与 Qwen 2.5 系列,其中闭源大模型只能提示评测不能微调。论文重点在可部署的小模型上加常规监督微调与 IoS,比较时同一底座比较加 SFT 与加 IoS,这是公平条件的关键。

客观指标是生成段落与人工真值在音高分布、时值分布与和弦分布上的平均重叠面积,越高越接近真人,方向为越高越好。主观评测是与音乐科技公司合作收集 115 个会话,参与者可上传旋律或从 MIDI 测试集选择,写文字指令指定段落类型,模型生成后转 MIDI 播放,最多 3 轮修订后按 5 个维度打分。参与者性别、年龄与训练年限有分布记录,采用盲评。ABC 相对 MIDI 的平均长度从 5803 降到 3229,最大从 22390 降到 7956,这是效率论据不是质量分数。

下表整理训练与数据配置,数字较多,读时先看行含义再看数值,不要把不同行的样本数混为同一聚合对象。

配置维度指标名称基线条件本方法条件比较对象
歌曲与标注规模完整歌曲数与段落标注数POP909 原始歌曲909 首与 9132 条标注数据集
对比样本划分曲内与曲间样本数无三元组划分各 4566 条训练集
对话轮数每样本轮数单轮生成曲内 6 轮与曲间 8 轮构造协议
训练预算显卡与批量与轮数未报告2 卡 3090 与批量 4 训练 200 轮开销
损失权重拉姆达与伽马无对比损失0.5 与 0.1超参数

上表说明 IoS 的代价不在模型结构,而在标注与构造流程:需要段落级人工标注、三元组采样与多轮模板,还需要双路损失训练。未胜出或未评测的边界是流派只覆盖流行乐,整曲跨段发展未建模,全曲依赖多轮交互与用户规划。表格数字来自原文连续句的逐字证据,不能视为自动指标与人评的互换。

主结果:IoS 在什么条件下赢,赢多少?

要回答的主问题是给定旋律与段落标签时,IoS 是否比直接提示与常规监督微调更接近真人结构。比较条件是同一底座上比较基线、加 SFT 与加 IoS,客观指标方向为越高越好,主观分数为 1 到 5 分越高越好。论文报告 IoS 在多个大模型上一致提升,结构连贯性最高提升 47.8%,艺术创造力最高提升 21.8%,且小模型加 IoS 后可超过更大的通用模型。重提这些百分比时必须说明它们是相对提升,不是百分点,也不是每个段落都同等提升。

客观上 IoS 在旋律、伴奏与整体的音高与时值分布及和弦分布上均高于同底座的 SFT。主观上 LLaMA 3.2-3B 加 IoS 总体最高,超过其 SFT 版本与 GPT-4o。分组观察显示训练 6 年以上者更看重结构与相关性,训练较少者更看重旋律吸引力与创造力,但各组对 IoS 的满意度都更高。这一结论的支持范围限于流行乐段落生成与最多 3 轮交互,不能推广到其他流派或整曲自动作曲。

下表聚焦两个可部署小模型的人评分数,列方向为越高越好,行是同一底座的不同训练策略。读表前先确认比较问题是同底座下 SFT 与 IoS 的增量,而不是跨底座的绝对排名。

模型条件结构分相关性音乐性总分
Llama3.2-3B 直接提示2.182.552.752.51
Llama3.2-3B 加 SFT2.963.013.063.00
Llama3.2-3B 加 IoS3.933.573.643.66
Qwen2.5-3B 直接提示2.302.842.572.52
Qwen2.5-3B 加 SFT3.013.042.802.89
Qwen2.5-3B 加 IoS3.713.773.243.57

上表的主要收益是 IoS 在结构分上增量最大,例如 Llama 底座从 2.96 升到 3.93,Qwen 底座从 3.01 升到 3.71,同时相关性与音乐性也提升,说明改进不只来自流畅度。代价与反例是直接提示的基线明显偏低,SFT 已带来大幅提升,因此 IoS 的增量应理解为在 SFT 之上的结构增强。未胜出项是部分模型的音乐性仍低于结构分,且闭源大模型未参与微调对照,不能说 IoS 在所有规模上都最优。自动分布指标与本表人评不能混为同一列,百分点与相对百分比也不同。

下面这组柱状图把提升拆到段落类型与单多轮两个维度,读时先看分组再看颜色。

看图路径: 1. 先看上排按段落类型分组的灰色与橙色柱子高度差;2. 再看下排单轮与多轮两组柱子随轮次的变化方向;3. 最后核对纵轴是音高与时值分布相似度而非主观评分

原论文 Figure 5:(a) IoS Enhances Sectional Structure. (b) IoS Sta- bilizes Multi-Turn Machine Composition.

论文图 5。原论文 Figure 5:“(a) IoS Enhances Sectional Structure. (b) IoS Sta- bilizes Multi-Turn Machine Composition.”。

该图上排按主歌、尾奏、间奏等 8 类分别显示无 IoS 灰柱与有 IoS 橙柱,音高与时值相似度在各类型上均为橙柱更高,其中桥段等基线较低的类型提升更明显。下排比较单轮与多轮,无 IoS 灰柱从单轮到多轮下降,有 IoS 橙柱保持稳定或略升,说明 IoS 缓解了多轮误差累积。像素能辨别的是相对高低与变化方向,不能读出精确到小数第二位的数值,精确主结果以正文表格为准。这支持 IoS 既增强段落结构感知,也稳定协作过程,但每组都成立不等于每一步都成立。

拿掉哪一块会怎样,证据支持什么?

消融要回答结构三元组数据与双实例对比中曲内、曲间分支各自的贡献。基线是直接提示,SFT 指不用三元组的常规微调,再依次加入三元组、曲内对比、曲间对比与两者组合。指标仍是整体的音高、时值与和弦分布重叠,方向越高越好。论文报告只加三元组已超过基线与 SFT,再加任 1 对比分支继续提升,两者合用最高,说明数据组织与对比目标互补。

下表把消融的定量关系单独列出,便于与主结果表对照。注意本表是客观分布指标,不是人评分数,不能与上一张人评表混读。

消融条件整体音高分布整体时值分布整体和弦分布证据指向
直接提示基线低低中未建模结构
常规 SFT 无三元组中中中流畅但结构不足
加三元组无对比较高较高较高多轮结构数据有效
加曲内或曲间之一更高更高更高单分支仍有增益
曲内加曲间全量 IoS最高最高最高双分支互补

上表支持的判断是三元组与对比各自有增益,合用最好。限制是原文消融只报告客观分布,未报告消融对应的人评结构分变化,因此不能把客观最高直接等同于听感最好。未评测的边界包括不同拉姆达与伽马的完整敏感性曲线,原文只说对中等变化鲁棒而未给出全表。复现时应先固定数据划分再调权重,避免把数据增益误归为损失增益。

哪些结论不能下,缺了哪些验证?

论文明确的局限有两点。第一是流派集中于流行乐,原因是缺乏带准确结构标注的符号数据集,不是方法本身只能做流行乐,扩展到其他流派需要新的标注。第二是框架 1 次只生成单个段落,不建模段落之间的结构发展,完整长曲依赖多轮交互与用户规划。这意味着把 IoS 当作整曲自动作曲器是误读,它的产品形态是协作乐段生成器。

未验证的推测要单独列出。符号音乐可被视为特殊语言这一判断得到结构任务上的支持,但不等于证明其全部逻辑都不同于自然语言,也不等于更大模型必然更差。训练资源只报告了显卡数量、批量与轮数,未报告总时长、显存峰值与推理延迟,因此不能承诺成本下降。主观评测有 115 个会话与盲评,但未报告评分者一致性与显著性检验,阅读时应把 3.66 这类均值当作有限样本下的报告值。

资源状态也需要如实说明。本次收到的第三方链接状态为不可用,返回 403,因此不能写该链接当前可用或已公开,只能写本次未能确认可达或当前不可用。论文本身的可用性应以正文开源声明为准,不从模型名或公司名推定代码与权重可下载。

要复现,先准备什么,按什么顺序做?

复现的第一步是数据。获取 POP909 并按 8 类段落标注结构,至少保留 3 人标注加讨论一致的流程,否则三元组无从采样。接着按曲内 6 轮与曲间 8 轮的问答模板组织对话,保证锚点、正例与负例的归属与原文一致,曲内正例为同曲同类型,曲间正例为同曲而负例跨曲。划分上预留 100 首歌用于生成 600 轮测试对话,避免测试歌曲混入训练。

第二步是表示与训练。用 ABC 记谱编码旋律与段落,最大长度设 8192,用 Unsloth 流程训练,初始学习率 0.0001、批量 4、训练 200 轮,拉姆达 0.5、伽马 0.1 作为起点。损失按样本类型切换:曲内样本用监督加曲内对比,曲间样本用监督加曲间对比。推理时只做自回归采样,输入为旋律与段落标签。原文未给优化器与衰减策略,复现时需记录自己的选择并单独报告。

第三步是评测。对齐客观指标的分布重叠计算与主观 5 维打分流程,主观部分需盲评并允许最多 3 轮修订。先复现同底座的直接提示、加 SFT 与加 IoS 三点,再做三元组与双分支的消融,最后才比较跨模型排名。这样才能把数据、损失与底座能力的贡献分开。

何时值得尝试 IoS,还需补哪项验证?

当任务是给定旋律灵感生成指定功能段落,且用户能用语言指定段落类型并参与多轮修改时,IoS 值得尝试。它的价值在于不改结构也能让小模型获得结构感,适合需要部署小模型做交互作曲的场景。当目标是无条件整曲生成或跨流派直接迁移时,不应直接套用本文数字,因为训练与评测都限定在流行乐段落与多轮协作条件下。

还需补的验证包括其他流派的标注与测试、段落拼接成全曲的连贯性评测、以及对比权重与间隔的完整敏感性报告。如果要 claims 效率,应补充训练时长、推理延迟与显存占用,而不是只用 ABC 长度缩减代替。总体上论文显示符号音乐虽有语言特性,但其结构逻辑需要专门的数据与目标来建模,IoS 提供了一条可复述的路径:用三元组讲清结构关系,用双对比讲清远近,用多轮对话讲清过程。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总