英文题目:PerFormer: An AI-Driven Approach to Melody Generation in Microtonal Persian Music.
会议身份:
conference:nime:2026:conference-paper-id:nime2026_30
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据集 #主观评测 #Transformer #音乐 #符号音乐生成
评分:4.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:方法研究
👥 作者与机构
- Farzad Hosseinabadi:机构信息未能从会议 PDF 纯文本可靠映射
- Ian Gibson:机构信息未能从会议 PDF 纯文本可靠映射
- Christopher Dewey:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
任务输入为目标调主音语境与种子事件,输出为六八拍单声部微分音旋律,难点在于二十四平均律下四分音离散化与长程调式一致性维持。方法链分三步:先精选三十三首拉迪夫有节拍旋律并经四分音移调增广至五百九十条序列以覆盖全部调中心,再以位置—音高—时值三元事件编码小节内节拍位置与索里、科隆微分音高及时值,随后由六层编码器—解码器Transformer以主音参考序列为条件自回归生成并转MusicXML记谱。相对仅建模局部转移的一阶马尔可夫方法,关键差异在于全局自注意力与主音条件交叉注意力建模长程依赖与相对音高关系,从而维持调式音集与节拍层级。在20首生成旋律评测下,PerFormer的可容许音高准确率为90.18%,高于一阶马尔可夫基线的可容许音高准确率34.71%。主观听测整体质量从1.5升至3.9,节奏分布向长时值偏移等问题仍待改进。结论适用边界受限于C调Chahargah与Reng等六八拍有节拍体裁,向其他达斯特加与自由节奏即兴的外推尚未验证。训练使用NVIDIA Tesla T4硬件完成批量三十二共一百轮优化,推理以离线Top-k采样生成,实时交互吞吐尚未验证。
🔗 开源与复现资源
- 第三方资源:https://github.com/Zjy0401/choir-transformer → https://github.com/WindSpeaker-music/choir-transformer — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么十二平均律模型直接搬到波斯音乐会失灵?
刚进入语音音乐音频方向时,最容易误以为符号音乐生成就是把音符丢给序列模型。波斯古典音乐提醒我们先看声音与记谱的约定。它的织体以单声部为主,调式组织围绕达斯特加与古舍展开,音高包含 1/4 音级别的升降,即索里表示升高约 1/4 音,科隆表示降低约 1/4 音。这些类别在十二平均律钢琴键盘上找不到直接对应键,强行用量化到半音的方式会抹掉调式身份。
论文的起点是这个表示鸿沟。主流符号生成系统长期围绕十二平均律设计词表与评估指标,土耳其音乐虽有 53 平均律等研究,但其马坎结构与波斯达斯特加差异很大,不能直接迁移。波斯音乐还需要同时处理乐句发展、轮廓一致性与节奏组织等长程结构,而早期循环神经网络与长短时记忆网络受梯度消失与记忆容量限制,难以兼顾大跨度依赖。Transformer 用自注意力让每个位置直接访问在前上下文,才为长乐句建模提供了基础。
本解读的目标是让研究生能复述 PerFormer 做了什么、依赖什么条件、证据强度如何。我们只讲论文实际研究的任务:以恰哈尕调式、6/8 节拍的度量性单声部旋律为对象,生成微分音旋律。教学中举的例子会明确标为例子,不把例子当作论文报告的效果。
同类路线比较:从钢琴 Transformer 到微分音尝试
要定位 PerFormer,先按同输入、同目标、同监督、同运行阶段对照。输入都是符号事件序列,目标都是生成或续写,监督都来自已有乐谱语料的自回归预测,运行阶段目前都是离线生成。
第一条路线是通用钢琴与多声部生成。音乐 Transformer、流行音乐 Transformer 与复合同词 Transformer 探索了基于事件的表示,用于表达性生成;钢琴补全、基于图的旋律结构建模、动机条件生成、分层旋律合成,以及爵士 Transformer 在和声层面的扩展,都验证了事件表示加 Transformer 能提升连贯性与风格一致性。但论文指出这些工作大多仍扎根十二平均律框架,词表没有为 1/4 音类别预留位置。
第二条路线是微分音生成,但集中在少数传统。土耳其古典音乐用长短时记忆加自注意力等方法,依赖 53 平均律划分;波斯音乐不采用该体系,其调式组织与音高类别需要专门建模策略。这就是 PerFormer 的差异点:不只是换数据集,而是按瓦齐里提出的 24 平均律重建音高离散化,并为索里与科隆保留类别,再把小节内位置与时值一起编码。相关不等于因果,论文没有声称通用 Transformer 自动解决微分音问题,而是强调表示设计是适配前提。
任务到底是什么:输入什么,输出什么,判据是什么?
把任务说成可执行的形式。输入是一段已编码的历史事件序列,加上编码器端的主音参考序列;输出是后续的单声部微分音旋律事件序列,最终可转为支持微分音变音记号的乐谱格式。研究范围限定为恰哈尕调式、以 C 为调的参考框架,以及伦格与恰哈尔梅兹拉卜这类 6/8 度量性舞曲形式。选择单一调式框架的理由是让模型在明确音乐语境里学习风格一致的音高与节奏模式。
判据分两层。定量层看调式音高库存是否被遵守、节奏时值分布是否接近数据集、小节内节拍位置分布是否呈现层级重音;感知层看音乐连贯性、与波斯古典的风格相似度、音高正确性与总体质量。论文明确用 20 首生成旋律做定量分析,用 10 段各 15 秒音频做听感对比。理解这个任务边界很重要:它不处理多声部、不处理非度量自由节奏的即兴,也不要求实时交互,实时只作为未来工作方向。
全景:一个样本如何走完采集到评估?
先沿一个样本走完全程。假设有一首恰哈尕的伦格旋律,6/8 拍。第一步是采集与增强,保留原曲的音高与节奏结构;第二步是预处理与数据表示,把每个音符转成位置、音高、时值 3 个 token;第三步是序列构建与位置编码,把长旋律切成固定窗口。
第四步是模型结构设置与训练目标,用编码器读主音参考、用解码器自回归预测旋律;第五步是生成、验证与评估,把 token 转回乐谱与音频再打分。
下面这张流程图是理解管线顺序的关键,它把表示先于模型、训练先于生成的依赖关系画成了左右加折返的链条。
看图路径: 1. 先从左上沿箭头数出采集增强、预处理、数据表示、序列构建的主路径;2. 再看右下从模型结构设置到训练目标、生成、验证、评估的回路走向;3. 确认表示与序列构建位于训练之前,说明词表先于模型固定;4. 注意上下两排用竖向箭头衔接,定位编码与结构设置是管线转折点
论文图 1。原论文 Figure 1:“Flow diagram of the proposed modelling pipeline”。
从像素可见的方框链条可以读出两点教学信息。第一,主路径从左到右依次是采集增强、预处理、数据表示、序列构建,再折返到模型设置与训练目标,这意味着词表与窗口切分一旦固定,后续模型容量与训练超参数都要与之匹配。第二,生成位于训练目标之后、验证与评估之前,说明当前系统是先离线训练再批量生成离线评估,没有实时人机交互环路。论文也明确说当前系统离线运行,交互式即兴只是潜在应用,不要把流程图读成实时闭环。
音高怎么离散:24 平均律与 97 个音高 token 如何来?
波斯音程不严格符合十二平均律,论文采用瓦齐里提出的 24 平均律,把八度等分成 24 份,作为微分音程的实用近似。这是一个建模选择,不是声学测量结论:它把连续音高先网格化,再让模型在网格上分类预测。
具体词表按乐器实用音域从 C2 到带索里记号的 B5 构建,每八度 24 个音级,加上休止符,共得到 97 个音高相关 token。教学例子:比如 C 中央附近的 E 科隆与 E 自然音在十二平均律里会被并到相邻半音,但在 24 平均律词表里是两个不同类别,模型必须学会在恰哈尕语境里何时选哪一个。这正是索里与科隆类别的价值。
24 平均律 × 事件表示: 24 平均律负责把连续微分音高离散成每八度 24 个等距台阶,提供可计算的音高网格,其中索里与科隆作为 1/4 音升降类别保留调式语义;事件表示负责把位置、音高、时值拼成统一词表,让 Transformer 在同一序列里同时学习音高类别与节奏落点,两者组合才使非十二平均律的调式库存能被序列模型直接预测。
3 类 token 再加填充、起始与结束符号,总词表为 118。每个旋律被编码为位置—音高—时值事件序列,适合 Transformer 学习。这种三元组不是把 3 个特征拼接成一个向量,而是展开成相邻 token 依次预测,模型在预测音高时已经见过当前位置,天然学到音高与节拍落点的联合关系。
节奏与节拍如何编码:12 个位置与 8 类时值分工何在?
节奏编码分两件事。位置 token 把每个 6/8 小节划分成 12 个十六分音符位置,共 12 个位置 token,标记音符起音落在小节内哪里。论文的动机是不同度量位置在波斯音乐里有不同节奏与表现特性,强拍与弱拍不能混为一谈。时值 token 把最小单位定为十六分音符,含附点在内共 8 类离散时值;超过附点二分音符的长度会被切成附点二分加剩余短时值的组合表示。
这样设计后,一个八分音符出现在小节开头与出现在小节中间是不同上下文。模型看到的不是孤立的时值直方图,而是位置条件下的时值选择。评估时也正好对照这一点:看生成序列的起音是否集中在开头与其他规则间隔的锚点上,而不是均匀铺开。
位置 token × 时值 token: 位置 token 负责标记音符在 6/8 小节内 12 个十六分音符槽中的落点,分工是编码节拍层级与重音结构;时值 token 负责标记从十六分音符到附点等 8 类长度,分工是编码延续时间;两者搭配的理由是落点与长度共同决定节奏型,组合后模型能区分同样是八分音符但出现在强拍与弱拍的不同用法。
需要提醒初学者:位置与时值是互补而非重复。前者回答何时开始,后者回答延续多久。论文没有报告连音、装饰音或速度变化的显式建模,这是复现时不要自行添加的缺项。
模型结构:编码器读什么,解码器写什么?
模型采用编码器—解码器 Transformer,在三元组 token 序列上训练。编码器输入包含主音参考序列,提供调性条件信号;解码器自回归生成旋律,并通过交叉注意力关注已编码的调性上下文。设计灵感来自波斯乐器用空弦持续音伴随旋律的瓦汉做法,持续音像无人机一样锚定相对音高。
生成范式是标准的自回归:每个音乐事件以前面所有事件为条件被预测。与局部或马尔可夫方法不同,自注意力提供全局上下文访问,使乐句发展、轮廓一致与节奏组织等长程依赖可被建模。这对波斯音乐尤其重要,因为旋律结构与调式身份在较长时间跨度上展开。
论文给出结构规模为嵌入维度 256、6 层、词表 118,序列窗口 256 个 token,约对应 85 个音乐事件。解码时音高用核采样 k 为 20、温度 1.0,时值用更高温度 1.2 以鼓励节奏多样性。温度是控制随机性的采样超参数,不是模型学到的参数,复现时应保持这两档不同温度,否则节奏多样性对比会失真。
训练与数据构造:33 首如何变成 590 条,学到什么目标?
本研究确有神经网络训练,不是无训练论文。数据集由 33 首度量性单声部波斯旋律组成,取自拉迪夫典籍及过去百年民间与创作曲目,聚焦伦格与恰哈尔梅兹拉卜。为增加多样性并改善泛化,每首旋律做受控微分音移调增强:在表示有效音域内向上最多 14 个 1/4 音、向下最多 9 个 1/4 音,覆盖所支持的调性,增强后得到 590 条训练序列,再按训练 80%、验证 10%、测试 10% 划分。
训练目标是自回归序列预测,优化器用亚当,学习率 1 乘 10 的负 4 次方,批量 32,丢弃率 0.1,在英伟达 T4 上训练 100 轮。论文用训练与验证准确率及损失曲线显示稳定收敛,但未报告梯度裁剪、学习率衰减或早停细节,也未说明参数冻结情况。复现时只能按已报告部分固定,未报告部分应标为缺项而不猜。
主音参考序列 × 交叉注意力: 主音参考序列负责在编码器端提供持续的主音条件信号,作用类似波斯乐器持续低音弦的瓦汉 dron e,锚定相对音高关系;交叉注意力负责让解码器每一步生成旋律时都能查询该调性上下文,两者搭配使模型学到的是相对音程与调式库存而非绝对音高,新增作用是在 24 个调中心移调增强后仍保持调式一致性。
监督来源是移调后序列自身的下一个 token,主音参考作为条件而非预测目标。窗口切分是固定长度 256 token,不是按乐句切分,因此一个窗口可能截断乐句边界,这是理解乐句连贯性仍不完美的一个结构原因。
实验条件:与谁比,在什么条件下比,用什么量?
对照设计要先看公平条件。基线是 1 阶马尔可夫模型,用来自 C 调恰哈尕的短种子序列初始化,提供调性上下文,以保证比较公平。评估对象是 20 首生成旋律。定量指标从音高符合度、协和度、旋律和弦距离、拍与强拍准确率等域内指标中选取三项适配指标:节拍位置分布、可调性音高比例、节奏时值分布,其中时值相似用余弦相似度汇总。
听感评估用 10 段随机排序的 15 秒音频,5 段来自 PerFormer、5 段来自基线,由 2 位有波斯古典音乐经验的乐手在 5 点李克特量表上对音乐连贯性、风格相似度、音高正确性与总体质量打分。样本量很小,这是解释听感差距时必须保留的限制:2 位评价者、10 段样本只能视为初步感知证据,不能推广为总体人群结论。
硬件与成本只报告训练侧在 T4 上训练 100 轮,未报告推理延迟、实时因子或生成一段旋律的耗时。复现时应分别记录训练资源与推理开销,不要把训练稳定收敛当作推理快速的证据。
主结果一:调式库存守住了吗?节拍层级学到了吗?
先提出比较问题:在同样给定调性种子的条件下,生成旋律在多大比例上遵守目标主音的允许音高集合,起音又是否落在度量性体裁特有的重音位置上?指标方向都是越高越集中于数据集模式越好,可调性比例越高表示越少违反调式库存,位置分布越接近数据集表示越学到节拍层级。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 全 24 调中心增强,20 首生成 | 可调性音高均值 | 34.71% | 90.18% | 1 阶马尔可夫对 PerFormer |
| 同上 | 可调性音高标准差 | 4.46% | 3.69% | 同上 |
| 同上 | 可调性音高最小值 | 25.88% | 83.53% | 同上 |
| 同上 | 可调性音高最大值 | 44.71% | 95.29% | 同上 |
| 单例乐谱检查 | 落入允许集合音符占比 | 未报告 | 92.94% | 代表性生成样本 |
上表显示 PerFormer 在可调性音高上大幅领先基线,均值从 34.71% 到 90.18%,标准差从 4.46% 降到 3.69%,说明不仅平均更准而且跨样本更稳定。论文把部分增益归因于持续无人机式主音参考与模型学习跨调相对音程的能力。节拍位置上基线接近均匀分布,表明仅靠局部时值转移学不到小节级意识;PerFormer 则在小节开头与其他规则间隔锚点形成峰值,与数据集对齐。但要保留代价:模型词表覆盖全音高且无显式约束,仍有约一成越界音,示例中红色框标记的即是这类偏离。
自注意力 × 1 阶马尔可夫基线: 自注意力负责让每个事件直接关联序列中所有在前事件,分工是捕捉乐句发展、轮廓与调式展开等长程依赖;1 阶马尔可夫基线只负责根据紧邻上一个状态转移,分工是检验局部转移是否足够;两者对照的理由是若长程与调性上下文关键,则 Transformer 应在可调性音高比例与节拍分布上明显拉开差距,组合意义是把结构建模能力差异变成可度量的对照实验。
该对照支持长程与调性关系建模必要的判断,但属于有限解释:它没有做去掉主音参考或去掉位置 token 的消融,不能把增益精确归因到某一组件。
主结果二:听感四项与节奏分布支持什么、反对什么?
第二个比较问题是听感是否与定量一致,以及节奏是否被简化。听感方向是分数越高越好,节奏分布方向是越接近数据集直方图越好,余弦相似度越高越相似。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 10 段 15 秒音频,2 位乐手 5 点量表 | 音乐连贯性 | 2.2 | 3.9 | 1 阶马尔可夫对 PerFormer |
| 同上 | 风格相似度 | 1.4 | 4.4 | 同上 |
| 同上 | 音高正确性 | 1.4 | 4.1 | 同上 |
| 同上 | 总体质量 | 1.5 | 3.9 | 同上 |
| 20 首生成对数据集 | 时值余弦相似度 | 未报告 | 86% | 生成分布对数据集 |
听感上 PerFormer 四项全面高于基线,风格相似度从 1.4 到 4.4、音高正确性从 1.4 到 4.1 提升最大,连贯性从 2.2 到 3.9、总体质量从 1.5 到 3.9 也有明显改善。论文报告显示节奏余弦相似度为 86%,保留了主要轮廓,但生成偏向更长时值,四分音符出现率 0.4312 远高于数据集的 0.1652,而十六分音符 0.0729 低于 0.1491、八分音符 0.3971 低于 0.5322,呈现节奏简化与拉长倾向。视觉检查也指出代表性样本的总体轮廓合理但乐句结构连贯性仍不够稳定。
可调性音高准确率 × 节拍位置分布: 可调性音高准确率负责度量生成音高中落入目标主音预定允许集合的比例,分工是检验调式库存遵守程度;节拍位置分布负责度量音符起音在小节内 12 个位置上的归一化分布,分工是检验律动层级是否被学到;两者搭配才能同时回答音高对了没有与节奏放对地方没有,避免只看音高正确却节拍混乱的片面结论。
综合判断是:音高与节拍层级得到保持,听感改善与定量一致,但节奏多样性与乐句组织是具体代价。未胜出项必须点名:短时值与附点节奏的还原不足,以及乐句级连贯性问题,说明当前窗口与目标还不足以完全捕捉高层乐句结构。
如果拿掉关键条件会怎样:论文做了什么,没做什么?
严格意义上论文没有提供消融表。它做的最接近反证的是用 1 阶马尔可夫基线替代 Transformer,相当于同时拿掉自注意力长程访问与主音参考的跨注意力调性条件,结果是可调性比例与节拍层级同时崩塌。这支持长程与调性条件重要的方向,但不能分离两者各自贡献。
缺失的对照应明确列出:没有无主音参考的 PerFormer、没有位置 token 的变体、没有不同采样温度的对比,也没有跨达斯特加的泛化测试。论文未声称拿掉某一项必然怎样,解读也不应补写必然结论。另一个隐性对照是数据增强本身:33 首原曲经移调扩到 590 条,若只用原调训练,跨调稳定性很可能下降,但论文未报告该对比,因此不能把 90.18% 理解为无增强也能达到。
对初学者的启示是把基线当作下界而非同等对手。1 阶马尔可夫只能建模局部转移,它的均匀节拍分布与 34.71% 可调性比例恰好说明波斯度量体裁需要小节级与调式级约束。未来补做应优先加两项:固定其他条件只关主音参考,以及只打乱位置 token,分别看可调性比例与节拍分布如何变化。
边界在哪里:单调式、小样本与离线意味着什么?
论文自述的限制集中在三点。第一,数据集较小且限于单一达斯特加与度量风格,尽管做了跨调中心增强,风格与调式泛化仍受限。增强扩大的是调性覆盖,不是调式种类与节拍种类,因此不能把恰哈尕 6/8 上的结论推广到其他达斯特加或非度量即兴。第二,当前系统离线运行,不支持实时交互,表演与教学中的实时呼应仍是设想。第三,乐句结构连贯性与节奏简化问题在定量与视觉检查中都出现,说明高层乐句建模缺位。
还有方法边界需要强调。24 平均律是实用近似,不是波斯音程的声学真值;超过附点二分音符的切分表示会改变长音的事件切分方式,可能影响长音学习;听感评估仅 2 位乐手与 10 段样本,统计不确定性未报告。伦理与数据方面,论文声明未涉及人类被试数据,数据集来自已出版公开来源且不重新分发,无利益冲突与特定资助。这些不是技术缺陷,但决定了复现时不得重新分发原谱,只能用公开来源自建流程。
复现先做什么:数据、词表、训练与生成的检查单
复现应按学习依赖排序。先重建数据管线:收集 33 首量级的恰哈尕度量旋律,统一到 6/8 理解,标注索里与科隆类别,再实现向上 14、向下 9 个 1/4 音的受控移调,验证扩增后 590 条的量级与 8 比 1 比 1 划分。不要自行扩大到达斯特加之外,否则比较条件改变。
再固定词表:12 个位置 token 对应 12 个十六分音符槽,97 个音高相关 token 覆盖 C2 到带索里 B5 加休止,8 类时值含附点,最小单位十六分音符,长音按附点二分加剩余表示,总词表 118。序列切成 256 token 窗口,约 85 个事件,嵌入 256、6 层、批量 32、丢弃 0.1、亚当 1 乘 10 的负 4 次方训练 100 轮,以训练验证曲线稳定收敛为检查点。编码器必须接入主音参考序列,解码保持自回归与交叉注意力。
生成侧用 MusicXML 落地以保留微分音记号,音高核采样 k 为 20 温度 1.0、时值温度 1.2。评估先复算三项定量:可调性比例、位置分布峰位、时值余弦相似度,再做小规模盲听。代码可用性方面,论文引用第三方合唱 Transformer 仓库链接当前可用,但那是相关工作的实现参考,不是 PerFormer 本体的开源声明,复现时应区分代码开源、权重下载与系统可运行三件事,不要把引用链接当作本模型可一键运行。
何时值得尝试这个方案,还需补哪项验证?
当你的任务也是单声部、度量性、有稳定调式库存的微分音旋律,且能给出可靠的主音条件与小节划分时,这套位置—音高—时值加主音参考的方案值得尝试。它的可复述要点是:用 24 平均律先给微分音类别安家,用位置 token 给节奏安上节拍坐标,用主音参考加交叉注意力给调式安上锚点,再用 Transformer 学长程联合分布。已有证据显示这能在恰哈尕上同时改善调式遵守、节拍层级与听感。
还需补的验证很具体:跨达斯特加测试以检验调式泛化,高层乐句建模以改善乐句连贯性,更大規模听感评估以降低 2 位评价者的不确定性,以及推理延迟与交互实现以验证教学与即兴设想。重提结果时应带上适用条件:90.18% 对 34.71% 是在全调中心增强与 C 调种子下的可调性比例,86% 是时值余弦相似度但伴随向四分音符的拉长,听感四项提升基于小样本。记住这些数字的边界,比记住数字本身更重要。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
