英文题目:JazzSAMBA: A Synchronous and Asynchronous Multi-take Band Audio Dataset of Jazz Standards for Live Music Models

标签:#音乐源分离 | #数据集构建 | #数据集 | #音乐生成 | #音乐

评分:7.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Phillip Long:机构信息未在 arXiv HTML 中可靠披露
  • Jacob Nguyen:机构信息未在 arXiv HTML 中可靠披露
  • Jace Hosto:机构信息未在 arXiv HTML 中可靠披露
  • Gage Hosto:机构信息未在 arXiv HTML 中可靠披露
  • Jett Takazawa:机构信息未在 arXiv HTML 中可靠披露
  • Fares Nofal:机构信息未在 arXiv HTML 中可靠披露
  • Sebastian Stade:机构信息未在 arXiv HTML 中可靠披露
  • Nithya Shikarpur:机构信息未在 arXiv HTML 中可靠披露
  • Julian McAuley:机构信息未在 arXiv HTML 中可靠披露
  • Cheng-Zhi Anna Huang:机构信息未在 arXiv HTML 中可靠披露
  • Stephen Brade:机构信息未在 arXiv HTML 中可靠披露
  • Aleksandra Teng Ma:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

爵士标准曲的实时伴奏与分析需要以输入混合音频与书面图表为条件生成或分离目标声部,难点在于即兴与固定和声曲式交织且缺乏干净分轨。作者先以异步叠录与同步合奏两种协议采集鼓、贝斯、钢琴与铜管的分轨与混合,再在统一小节网格上对齐小节线、和弦、段落与独奏者标注并配发MIDI,最后用分离与图表条件伴奏两条基线验证可用性。与流行摇滚多轨及只有和声或独奏转录的爵士语料相比,该机制差异在于同时保留演奏变体与可计分的曲式约束。在异步测试集下,JazzSAMBA微调后HT-Demucs 6s鼓声部的SI-SDR指标为15.09 dB,高于零样本基线的SI-SDR指标13.01 dB。伴奏消融显示图表掩码主要改变节拍对齐而非连贯性,同步合奏因话筒串音使节拍分数更低。结论仅适用于所录编制与标准曲风格,外推至其他编制或自由即兴尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:为什么爵士需要专门的分轨数据集?

这篇论文的输入是真实乐队演奏爵士标准曲的多轨录音与对齐标注,目标是让模型能做爵士编制的分离与跟谱伴奏。初学者必须保留的关键信息是曲目规模、双协议、主副版本与 4 类定时标注,输出则是可训练的分轨混音对与可评测的节拍网格。

常用流行与摇滚分轨库多是事先编配好的作品,乐器角色相对固定,模型学会把人声、鼓、贝斯与其他乐器分开就能应付很多评测。爵士标准曲不同,同一首曲子有公认的和声进行与曲式,但每次演奏的旋律、伴奏织体与独奏都重新即兴,自由只发生在和声与结构划定的边界里。这种约束下的自由是爵士最难建模的部分,也是通用流行数据无法覆盖的部分。

如果训练数据只有混音,模型既看不到每件乐器弹了什么,也不知道当前处于主题还是独奏,就难以学习在约束下即兴。已有爵士资源多偏向和声标签、曲式标签或独奏记谱,要么没有原始录制的乐队分轨,要么分轨是用分离算法倒推出来的,要么只有独奏钢琴。JazzSAMBA 要补的就是干净的原始乐队分轨加上可供条件与打分的演奏对齐谱面。

项目演示页当前可用,数据集、代码与试听都从该页面链接,本文写作时资源状态显示可达。理解这篇论文时要把曲谱当作约束条件,把分轨当作监督来源,把同步与异步当作难度不同的两种录制条件。后续所有实验都围绕这三者的配合展开,而不是孤立地评价音质好坏。

已有路线走到哪里:流行分轨、爵士标注与即兴音频如何分工?

学习依赖上要先分清 3 条路线。同输入的路线是多轨分离库,例如面向流行与合成的库,它们提供分轨但风格与乐器分类不符合爵士组合。同目标的路线是爵士和声、结构与独奏语料,它们有和弦、段落或独奏信息,但缺少原始录制的标准曲乐队分轨。同监督的路线是自由即兴多轨,例如非风格限定的双人即兴库,它有多版本分轨但不固定在标准曲曲式上。

JazzSAMBA 的定位是把三者拼起来:原始录制的爵士组合分轨、双协议与多版本、定时的小节与和弦段落独奏者标注,外加鼓与钢琴的部分真实演奏 MIDI。这种拼法不是简单堆料,而是为了同时支撑分离训练与谱面条件生成。缺少任何一块,后续两个验证实验就无法闭环。

下面这张对照表要回答的问题是:在分轨、多版本、双协议、和弦、段落、独奏者与 MIDI 7 个维度上,JazzSAMBA 与常见相关库各具备什么。比较是按原文表格呈现的有无对照,不是同条件性能胜负,方向是勾选越多表示覆盖越全。

CorpusStemsTakesDualChordsSectionsSoloistsMIDI
MUSDB18 [19]✓
Jazz Trio Database [5]✓†✓∗
Jazz Harmony [7]✓✓
H2H Music Improv [14]✓✓
JazzSAMBA✓✓✓✓✓✓✓

这张表之后要读出的关键是:流行分轨库有分轨但无爵士所需的和弦段落独奏标注,爵士和声与结构库有标注但无原始组合分轨,JazzSAMBA 是唯一在该对照中七项全勾的库。代价是它的规模远小于流行大库,且未胜出项是它没有覆盖人声等流行分类。爵士之外的乐器与唱法不在验证范围内,因此不能把该表的覆盖优势理解为通用分离能力的胜负。

要解决的具体问题是什么:什么样的模型动作需要这些标注?

论文实际研究的不是泛泛的音乐生成,而是两个依赖分轨与标注的具体动作。第一个动作是爵士组合分离:把混音拆成鼓、贝斯、钢琴与管乐四轨,其中钢琴与管乐在通用流行分离器的默认分类里常被并入其他,需要专门微调才能单独输出。第二个动作是看谱伴奏:在只能听到其余声部、且只能用过去信息的前提下生成被遮住的声部。

举例来说,模型在一个样本上先读入过去几秒的混音,再读入当前处于第二段独奏与当前和弦符号,然后 1 次生成 1 帧鼓或贝斯,这就是论文所说的因果伴奏。可选地叠加定时段落与和弦掩码,检验谱面是否带来可测量的差异,这是伴奏消融的核心操作。例子中读谱与听音频是两路独立条件,消融就是逐路开关。

一个容易误解的地方是把和弦符号当成从音频估计的值,原文明确写的是和弦来自书面谱面,先用工具解析内部谱集再由乐手做时间对齐。保留原谱符号与根音、三和弦、七和弦、扩展音、变化音与转位低音等字段,例子如原文给出的变化和弦符号。另一个误解是把段落当成自动切分,原文段落使用爵士曲式标签并允许嵌套字母。

同时还有分段乐手表记录谁在演奏,独奏者行给出有序独奏序列。这种设计让模型既知道何时换段,也知道何人发声。后续伴奏实验正是依赖这种细粒度条件,才能从曲式地标出发做自由生成。

方法全景:一个样本如何从录音走向可训练的数据?

沿一个样本走完全程有助于建立依赖。输入是一首标准曲的谱面与固定速度要求,乐队按异步或同步协议演奏并录下每件乐器的分轨。表示层是共享小节网格上的定时标注,包括小节起始时间与编号,和弦、段落与独奏者用小节加分数偏移表示。组件层是分轨音频、立体声混音与 MIDI,目标层是分离用的干净目标轨与伴奏用的条件掩码。

异步路径先录鼓打底,后续乐器在优选的前序版本上叠录,每件乐器录两个干净版本,优选轨组成主混音,剩余轨组成副层。固定速度使得主混音标注 1 次后可复制到副层,这是异步低成本的关键。同步路径是全乐队同时录两个合奏版本,乐手选出主版本,近距离话筒串音使该条件更难,两个版本各自独立标注。

下图是理解双协议的关键总览,导读时先区分上下两条录制路径,再看主副版本如何构成混音,最后把右侧曲式与左侧录音对应起来。该图是本次收到像素的官方总览,值得逐块对照阅读。

看图路径: 1. 先看上下两条色带:上为异步 50 首、下为同步 26 首,对照各自的录制箭头方向;2. 再看每件乐器下方的 1 与 2 两层方块,确认主副两个版本如何组成混音;3. 最后看右侧 Form 一列从 Intro 到 Outro 的纵向流程,确认段落标注与混音的对应关系

原论文 Figure 1:JazzSAMBA overview (50 asynchronous / 26 synchronous songs; about 8.1 h preferred-take, about…

论文图 1。原论文 Figure 1::“JazzSAMBA overview (50 asynchronous / 26 synchronous songs; about 8.1 h preferred-take, about 16.1 h both tiers).”。

这张图显示上排异步用实线加虚线箭头表示逐件叠录顺序,下排同步用虚线表示同时录制,每件乐器下方都有标号为 1 与 2 的两层。主混音带小节、和弦、段落、乐手与独奏者图标,异步副层标注为复制,同步两层各自标注。右侧从前奏经主题进入与多次独奏到主题再现与尾奏,说明段落是纵向贯穿整曲的条件。

像素细节上鼓轨还区分左右与底鼓单声道,萨克斯在不同曲目中取中音或次中音之一,异步管乐组合在图例中标为小号加萨克斯的二选一关系。底部图例进一步区分单声道分轨、左右单声道、底鼓单声道、真实 MIDI、立体声混音与 4 类标注图标。读图时不要把装饰性乐器图标当成信号流程,真正的流程是箭头与层级关系。

异步录制 × 同步录制: 异步录制指乐手逐个叠录、先录鼓再依次覆盖的分轨方式,分工是保证每轨干净且固定速度下可复用同一套标注;同步录制指全乐队同时合奏、分轨话筒同时拾音,分工是保留实时互动与串音的真实演出条件;二者搭配的理由是同一批标准曲需要在干净可控与真实困难两种条件下都被模型见到,组合意义是分离与伴奏可以在异步上训练、在同步上检验泛化。

标注与音频组件:小节网格如何把谱面钉到演奏上?

小节是白话里的拍号格子,英文为 bars,论文用它作为时间基准。所有定时标注都挂在同一套小节网格上,小节给出起始时间与编号,和弦、段落与独奏者用小节加分数偏移定位。这样和声与曲式始终与实际演奏对齐,而不是停留在纸面谱的速度假设上。

音频组件包括分轨、混音与 MIDI,异步提供干净分轨,同步提供带串音的分轨并附带一种维纳风格的去串音版本。所有音频为 48 kHz,这是复现时必须保持的采样率。MIDI 方面鼓与钢琴有部分真实值,其余来自自动转录,原文用表格区分了干净与串音、定时与共享、鼓与钢琴真实 MIDI 的有无。

下面这张协议内容表要回答哪种协议提供什么,公平条件是按原文的行列原样呈现,方向是勾选表示具备。该表直接决定复现时能否复用标注。

ProtocolStemsStemsAnnotationsAnnotationsGT MIDIGT MIDI
Asynchronous✓✓✓✓✓
Synchronous✓✓✓

表后要强调的收益是异步干净且标注可共享,适合做监督训练的起点,代价是缺少实时互动。同步保留合奏互动但带串音且标注需独立制作,成本更高。未胜出项是同步没有干净分轨与共享标注,不能直接把异步流程搬过去。去串音版本也不能当作干净真值,它只是缓解串音的派生版本。

和弦标注 × 段落标注: 和弦标注记录每小节位置上的谱面和弦符号与构成音信息,分工是给出和声进行约束;段落标注记录前奏、主题进入、独奏、主题再现与尾奏等曲式位置,分工是给出谁在何时独奏的结构约束;二者搭配是因为爵士即兴是在和声与曲式双重边界内自由发挥,组合意义是伴奏模型可以分别消融只听音频、加段落、加和弦的效果。

语料如何建成:曲目、乐手与时长是怎样构成的?

这一节承担数据集论文的方法职责,讲清构造而非神经网络训练。论文没有训练一个统一的生成大模型,训练只出现在后面的两个验证实验里,本节先讲语料本身的采集与统计。这种区分对初学者很重要,避免把语料时长误当成模型训练步数。

语料覆盖 76 首标准曲,由 8 名乐手演奏鼓、贝斯、钢琴、小号与萨克斯,萨克斯按曲目取中音或次中音之一。风格包括摇摆、波萨诺瓦、 ballad、 bebop 与拉丁,多数为四四拍,含摇摆与直拍两种律动。演奏者作为合作者署名并同意录音与公开发布,录音为原始棚内演奏,数据集只含这些录音与作者标注。

下图导读先确认 3 组条形图的单位与颜色,再比较异步与同步的构成,最后看各乐器的有效时长。该图是本次收到像素的语料统计图,横轴单位需要先看清。

看图路径: 1. 先看上中下三组条形图的横轴单位:上两组是曲目数、下组是小时数;2. 再比较每条内橙色异步段与红色同步段的长度比例;3. 最后看 Hours Per Instrument 中钢琴与鼓的有效时长最高,管乐按中音与次中音萨克斯分开统计

原论文 Figure 2:JazzSAMBA corpus statistics by protocol (asynchronous or synchronous): key signatures, genres,…

论文图 2。原论文 Figure 2::“JazzSAMBA corpus statistics by protocol (asynchronous or synchronous): key signatures, genres, and active hours per instrument from section musician annotations over both take…”。

这张图的上组为调号分布,中组为风格分布,下组为各乐器有效小时数,有效时长按分段乐手标注统计并排除休止不演奏的静音。可见 C 大调与摇摆占比最高,鼓、贝斯与钢琴的有效时长明显高于小号与萨克斯,萨克斯还拆分为中音与次中音两行。它的教学价值是提醒复现者不要用混音总时长直接估计某件乐器的监督量,管乐在很多段落是休止的。

颜色上橙色为异步、红色为同步,同步在调号与风格上占比明显更小,但在鼓贝斯钢琴的有效时长上仍有数小时贡献。下组小时数是按两层合计的有效演奏时长,不是混音总时长。读数时只能看相对高低,像素不能精确辨别的数值不要硬写,具体总量以正文原句为准。

主 take × 副 take: 主 take 指乐手挑选出的更优版本混音,分工是作为标注、评测与试听的基准;副 take 指同一首曲子的另一版本,分工是提供同一和声骨架下的演奏差异;二者搭配是因为爵士同一曲式每次即兴都不同,组合意义是模型可以学习曲式约束下的版本变化,而不是把某一次即兴当成唯一答案。

下面这张规模表用原文连续原句做证据,回答主副两层总时长与协议曲目数如何构成,单位保留原文小时与 BPM 写法。该表是整理表,不是原表选择,因此正文写出完整表格。

条件指标数值
主混音总量时长about 8.1 h preferred-take
异步主混音时长5.5 h asynchronous
同步主混音时长2.5 h synchronous
主副两层合计时长about 16.1 h both tiers
速度范围速度75–270 BPM
曲目构成曲目数50 asynchronous and 26 synchronous

表后要说明的代价是主混音仅约 8.1 小时,测试集更小,任何大参数模型的结论都受样本量限制。同步仅 26 首且测试仅 3 首,同步上的波动需要谨慎解读。速度跨度大也意味着节拍跟踪与伴奏难度不均匀,不能用单一平均数代表全集难度。

实验条件:分离与伴奏各自测什么、和谁比、指标方向是什么?

实验按问题组织。分离问题测的是在异步分轨求和混音上恢复鼓、贝斯、钢琴与管乐的能力,对比零样本直接推理、在 JazzSAMBA 上微调与在管乐数据上微调 3 种条件。训练用共享的混音再分离 44 秒片段,包括每轨均方根归一化、随机每轨增益、求和成混音再对混音与目标做联合峰值归一化。

指标为全曲 SI-SDR,方向越高表示估计越接近参考且忽略整体响度,异步测试集为 5 首并用验证损失早停。管乐初始化自其他类,缺少钢琴头的模型把钢琴头复制自其他类,这些初始化细节是公平比较的一部分。破折号格表示无对应监督的不可比格子,不能强行排名。

伴奏问题测的是谱面条件是否优于只听音频,对比只听、加段落、加和弦、两者都加 4 种条件。训练用双协议 10 秒片段并可选 oracle 定时谱面,推理从每首的至多 3 个曲式地标自由生成 60 秒,只以非目标混音与谱面为条件。解码器未来帧为零的因果设置保证每帧只依赖过去,这是适合现场伴奏的关键约束。

指标为 COCOLA 与 Beat Alignment F1,方向均为越高越好,前者衡量与条件混音的对比一致性,后者用标注小节网格生成的节拍器对比生成音频上检测到的节拍。聚合方式为地标上取均值,异步测试 5 首、同步测试 3 首。需要保留的关键超参数是分离裁剪 44 秒、伴奏训练裁剪 10 秒与自由生成 60 秒。

分离结果:爵士微调带来什么、可运行的收益在哪里?

主结果表的比较问题是零样本、爵士微调与管乐迁移微调三者中哪个在异步测试上 SI-SDR 更高。公平条件是同一异步测试集与同一全曲 SI-SDR,单位为 dB,方向越高越好,破折号表示无对应监督的不可比格子。该表是原文核心定量结果,需要逐模型对照。

ModelFTDrumsBassPianoHorns
HT-Demucs 6s—13.0115.074.92—
HT-Demucs 6sJazzSAMBA15.0917.039.4214.62
Open-Unmix—5.245.63——
Open-UnmixJazzSAMBA8.379.746.079.38
BS-RoFormer SW—19.1220.8318.3121.57
BS-RoFormer SWJazzSAMBA18.9720.6217.5421.15

表后解释主要收益与代价。零样本的 BS-RoFormer 在可报告轨上最强,爵士微调后保持在约 0.8 dB 以内,原文把零样本作为该模型的 headline 结果。爵士微调的实际可运行收益体现在另外 2 个模型上:它让 HT-Demucs 的管乐可报告,让 Open-Unmix 的钢琴与管乐可报告,并提升这两者的鼓与贝斯。

具体看 HT-Demucs 鼓从 13.01 到 15.09 dB,贝斯从 15.07 到 17.03 dB,钢琴从 4.92 到 9.42 dB,管乐达到 14.62 dB。Open-Unmix 鼓从 5.24 到 8.37 dB,贝斯从 5.63 到 9.74 dB,钢琴与管乐分别达到 6.07 与 9.38 dB。这些是同一测试集上的直接增益,支持干净爵士分轨可监督训练的判断。

代价与反例是管乐合唱数据微调没有提升爵士测试,例如 BS 管乐从 21.57 掉到 2.00 dB,支持的判断是管乐合唱到爵士组合的迁移有限。未验证的推测是换更大的爵士管乐数据是否就能迁移,原文没有给出该对照。总体趋势不等于每轨都提升,BS 微调后略降就是提醒。

分轨分离 × 谱面条件伴奏: 分轨分离指从混音中恢复鼓、贝斯、钢琴与管乐各自分轨,分工是检验分轨是否干净到可监督训练;谱面条件伴奏指在给定其余声部与曲式谱面的条件下生成被遮住的声部,分工是检验标注是否真能指导生成;二者搭配是因为前者用音频质量、后者用标注可用性分别验证数据集,组合意义是同一套分轨与标注同时支撑理解与生成两类任务。

伴奏消融:谱面条件改变了什么、没有改变什么?

伴奏消融的比较问题是 4 种条件中谁的 COCOLA 与 Beat F1 更高,公平条件是同一组地标出发的 60 秒自由生成与同一均值聚合。由于原伴奏大表在本次证据中表头解析不完整,不宜用选择模式硬拼列名,这里只讲论文报告的趋势而不复制整张大表。这种缺项本身要如实记录。

论文报告显示谱面掩码对 Beat F1 的改变大于对 COCOLA 的改变,Beat F1 随条件摆动更大且最优掩码常随声部变化。加和弦常在 COCOLA 上略优于只听,说明标注能区分不同条件策略。同步的 Beat F1 在实时串音下略低,而 COCOLA 与异步相当。限制是现场音频伴奏仍是困难任务,这些只是基线。

未胜出项很明确:加段落与两者都加并未在所有声部与协议上稳定取胜,不能把谱面条件说成全面提升。举例而言,某声部上加和弦略好,另一声部上加段落更好,这种随声部变化的最优掩码正是原文强调的判别力。教学上要把这种不稳定当作正常现象,而不是实验失败。

COCOLA × Beat Alignment F1: COCOLA 指生成声部与非目标条件混音之间的对比一致性得分,分工是衡量生成内容是否与伴奏语境相干;Beat Alignment F1 指用标注小节网格生成的节拍器与生成音频上检测到的节拍之间的对齐分数,分工是衡量生成是否跟上节拍网格;二者搭配是因为相干不等于卡准拍子,组合意义是可以看出谱面条件主要改变节拍对齐而对相干改变较小。

边界与反证:哪些结论不能推广?

缺失证据不是技术错误,但必须划清边界。第一,测试规模小,分离异步测试仅 5 首,伴奏同步测试仅 3 首,总体趋势不等于每首与每步都成立。小样本上的均值容易被个别难例拉动,解读时要留有余地。

第二,同步带串音,去串音版本只是维纳风格处理,不能当成干净真值,同步节拍分数较低可能与串音与检测误差都有关。论文未分离这两项,因此不能把同步更低简单归因于模型跟不上拍子。第三,伴奏用的是 oracle 定时谱面,即真实时间位置的段落与和弦掩码。

实际部署需要实时跟谱或估计,搜索最优与事后最优不能代替可部署收益。第四,MIDI 只有鼓与钢琴部分为真实值,其余来自自动转录,不能把全套 MIDI 当成人工逐音标注。下游若用自动 MIDI 做强监督,需要先评估转录误差。

第五,论文未报告误判率、延迟、推理开销与输出帧率,不能承诺这些量得到改善。相关性也不是因果,加和弦在 COCOLA 上略优支持标注有用,但不证明和弦是生成的因果驱动。训练资源与推理延迟需要分开讨论,不能从模型名推定开销。

复现先做什么:从可用资源到最小可运行步骤?

复现依赖原文交代的数据划分、采样、指标与预算。先从演示页确认数据集、代码与试听当前可用,再按协议分开存放异步与同步。注意异步副层可复用主标注,同步两层需各自标注,这是数据组织最容易出错的地方。

分离复现先跑零样本基线再做爵士微调,保留 44 秒混音再分离流程、均方根归一化、随机每轨增益与联合峰值归一化。用全曲 SI-SDR 在 5 首异步测试上评分并用验证损失早停,管乐初始化自其他类、缺少钢琴头的模型把钢琴头复制自其他类的细节要保留。不要跳过零样本,否则无法判断增益来自数据还是训练本身。

伴奏复现先跑只听基线再加段落与和弦,保留因果解码、10 秒训练裁剪、60 秒自由生成与至多 3 个曲式地标。指标同时算 COCOLA 与 Beat F1 并在地标上取均值,两个指标要分别报告,不能只报其一。原文表头、图注或算术若冲突应标注冲突,本次伴奏大表因表头解析不完整而未整表复制。

这本身就是需要记录的复现缺项。硬件预算原文未给出具体配置,复现时需自行记录 GPU 与耗时,不能从模型名推定实现与开销。采样率、裁剪长度与聚合口径都要与原文一致,否则数字不可比。

何时值得尝试:这套数据适合谁、不适合谁?

当研究目标是爵士组合的分离、看谱伴奏或曲式感知的检索与分析,且能接受 76 首与约 8.1 小时主混音的规模时,值得尝试 JazzSAMBA。它的独特价值是同一批标准曲上有干净与带串音两种条件、主副两个版本、4 类定时标注,适合做条件消融与版本泛化。小规模在这里不是缺点,而是换取标注精度的代价。

教学例子是:想验证加和弦是否帮助贝斯卡拍,可以固定只听基线再加和弦掩码,比较 Beat F1 的变化,而不是只看整体听感。例子中条件切换是唯一的变量,数据划分与生成长度都要固定。若只比较 1 次生成的听感,就无法把谱面的作用分离出来。

不适合的场景包括需要人声、流行编配、大规模预训练或实时低延迟保证的研究,这些在本文没有测量。把该数据集直接当作通用预训练语料,会高估其规模红利。下一步还需补的验证是实时估计谱面下的伴奏效果、更大同步测试上的稳定性,以及自动 MIDI 的误差对下游的影响。

回到中心判断,JazzSAMBA 不是用规模取胜,而是用协议与标注把即兴的可变部分与不可变的曲式分开。这种分离让模型的可比实验成为可能,也让初学者能沿着同一首曲子的不同版本理解约束与自由的关系。

📎 论文与评分元数据

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-30 语音/音乐/音频论文速递