英文题目:Classical Music Mashup System and Compatibility Heuristics

会议身份:conference:icmc:2026:conference-paper-id:paper-546

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#检索增强 #主观评测 #音乐 #符号音乐生成

评分:5.1/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:后50% | 文档类型:系统技术报告

👥 作者与机构

  • Yu Foon Darin Chau:机构信息未能从会议 PDF 纯文本可靠映射
  • Andrew Horner:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理符号古典钢琴混搭,输入为用户给定的符号乐段与大型符号语料,输出为可演奏乐谱与受控MIDI演绎,难点在于同时保持两首素材的可辨识性、调性终止逻辑与对位可听性。管线先将语料标准化为统一记谱并消除音色与速度干扰,再并行提取声部与动机及逐时刻和声与调性线索,随后按终止式进行走向过滤候选并以对位规则惩罚挑选可同时呈现的片段。相对音频混搭强调和声相似与频谱平衡,该机制把兼容性重心转向终止功能匹配与声部进行合法性,因而更贴合共同实践期写作规范。原文未提供可核对的关键定量结果。听测显示受控钢琴回放下被试更偏好终止逻辑匹配与复调式同时呈现,专家定性反馈亦认为素材首听可辨但持续复调易造成听觉负荷。适用边界限于短片段巴洛克至早期浪漫风格与均匀钢琴音色,未验证长曲式、多乐器、后调性与跨文化风格的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,要输出什么,哪些信息必须保留?

这篇论文的输入是符号化的古典钢琴音乐,也就是以音符、声部、节奏与和声结构记录的乐谱数据,而不是已经混响与演奏定型的录音波形。目标输出同样是符号谱:从曲库中找出另一段在速度与终止进行上可比的素材,把两段的主题性旋律以同时发声的方式拼成一个 8 小节左右的短片段,并能直接播放与打印成谱。初学者容易把混搭理解成把两段录音叠在一起,这里的关键区别是符号混搭保留了作曲与演奏的分离,速度、力度、 articulation 与配器可以在拼完之后重新解释,声部之间天然隔离,不需要做声源分离。

为此必须保留的信息有 3 类。第一是可演奏的谱面关系,包括量化后的音值、声部归属与速度基准,否则后续的调性判断与对位检查没有统一时钟。第二是音乐身份信息,包括哪一段是主题动机、当前处于什么调、终止功能走到哪一步,这决定听众能否一眼听出两首曲子的来源。第三是评价条件,包括统一钢琴音色、固定力度与装饰音按谱保留,这样听辨比较的只是音乐结构差异,而不是混音或演奏差异。论文把音色与乐器信息主动丢掉,把速度小波动按弹性速度处理,正是为了把这 3 类信息提纯。

学完这一节,你应能复述一句话:系统吃进一段用户给的古典钢琴符号谱与一个古典 MIDI 子库,吐出一段速度与终止逻辑对齐、对位违反最少、可同时演奏的双主题符号片段。后续所有模块都是为这句话服务的,听辨实验则是检验哪条音乐规则最影响听众觉得拼得是否成立。

音频混搭路线与符号路线各解决了什么?

音频混搭是更成熟的一支。代表性工作把兼容性定义为节奏对齐之后的和声相似度与频谱平衡度,依赖的组件是强拍跟踪、和弦检测与声源分离,后续有用深度网络建模兼容性并用听辨解释设计选择。这条路线在流行与摇滚短片段上被验证为大致够用,但要处理变速与移调就会引入时间拉伸与声源分离伪影,而且混合后的分轨不再干净。论文引用这类工作不是为了复现,而是为了借用问题框架:先对齐节奏,再比和声,再管平衡。

符号路线面对的是另一组工具与另一组困难。调性方面有基于认知与概率的经典模型,旋律身份方面常用序列比对与编辑距离,终止结构方面有人尝试图方法,操作层面有音乐分析与处理工具包,数据层面近年出现了大规模符号数据集与音频谱对齐数据集。困难在于符号语义不统一,MIDI、MusicXML、乐谱编码各有写法,乐句边界、终止、调性与声部进行缺少标准标注,现有工具覆盖面有限,容易抓不住细节。古典混搭还多一个教育与记谱诉求:拼完要能变成可分析、可演奏的谱,而不是 1 次性波形。

两条路线的对照点要按同输入、同目标、同运行阶段来理解。音频路线输入是混音波形,目标是可听的流行拼贴,运行阶段包含分离与拉伸。符号路线输入是分声部的乐谱符号,目标是可读可演的古典对位式拼贴,运行阶段是检索与规则检验。不能因为音频路线在流行歌曲上和声匹配就够用,就直接断言古典符号也一样,论文的听辨正是要检验这个外推是否成立。已有音频文献自己也承认音色与歌曲可辨识度有不可忽视的作用,这为后文把可辨识度与织体单独列为因素埋下伏笔。

兼容性到底在问什么,为何要拆成四个因素?

兼容性在这里不是一个抽象美感分数,而是一个可操作的问题:给定两段各 8 小节的古典钢琴符号谱,在统一钢琴音色与固定力度下同时演奏,听众是否觉得拼得成立且能听出两个来源。论文把它拆成 4 个可单独操纵的因素,目的是做控制比较。和声对齐指纵向和弦是否按原位与转位对应,终止逻辑指调性与和弦功能的进行是否一致,动机可辨识度指用的材料是否经过轻微改动仍可被认出,织体指双旋律同时对位呈现还是甲旋律配乙伴奏的主调呈现。

举一个教学例子帮助理解,但它不是论文的实验数据。假设甲片段是主和弦到属和弦的半终止,乙片段是另一调的主到属,纵向和弦名称可能对不上,但功能走向都是离开主并停在属上,听感可能仍觉得方向一致。反过来,如果只是把和弦名字对上,但一个处于乐句中间,一个处于乐句结尾收束,功能错位就会让人觉得接不上。论文的定性观察与此一致:和声不对但终止逻辑对时仍常被认为兼容,和声对但终止逻辑不对时常被认为不兼容。这个例子只用于建立直觉,真正结论要看受控听辨。

把问题限定在短片段是有理由的。论文明确把兼容性感知看作时间局部现象,因此评价只用 8 小节。这样做的好处是排除了大曲式、情绪起伏与长线张力释放的干扰,坏处是结论不能直接推广到全曲。理解这一点很重要,后文专家反馈中关于全曲需要轮换织体与控制强度的建议,正是对短片段限定的补充。

检索式管线如何从曲库走到混搭片段?

整个系统可以沿着一个样本走一遍。假设用户给了一段 8 小节的古典钢琴 MIDI,系统先把它清洗成与曲库同一基准的符号谱,提取它的速度与终止进行,然后在库中过滤出速度相近且终止进行一致的候选,再对每个候选的主题旋律与用户旋律做同时演奏的对位扣分,扣分最少的一段与用户段拼成最终符号片段输出。曲库用的是 Hugging Face 上的 midi-classical-music 子集,覆盖巴洛克、古典与早期浪漫派,特点是记谱较干净、调性感较清晰,便于分析。

下图是理解全貌的抓手,建议先看主路径再看分支如何汇入检索打分。

看图路径: 1. 先从左到右沿语料到混搭片段的主箭头走一遍,确认三段编号;2. 再看中间特征提取框内四个并列子块的分工与标注;3. 最后看右侧检索引擎内先过滤后打分两个子步骤的顺序与附加的多曲逻辑说明

原论文 Figure 1:Pipeline Architecture. The system processes the Hugging Face MIDI corpus through three stages: (I)…

论文图 1。原论文 Figure 1:“Pipeline Architecture. The system processes the Hugging Face MIDI corpus through three stages: (I) Standardization, (II) Parallel extraction of melodic and harmonic features…”。

上图把流程分成 3 段。第一段是标准化,把 MIDI 经 MuseScore 转成可动态量化音值的统一格式,丢掉乐器信息以消除音色影响,把小幅速度波动按弹性速度抹平,保留统一记谱的 MIDI 文件、速度与谱面节奏关系。第二段是并行特征提取,包括基于图的声部分离、基于几何压缩与词频思想的动机检测、基于图的和声与终止检测,以及用属到主进行跟踪推断调性,其中完全终止通常锚定调性。第 3 段是检索引擎,先按速度与终止过滤,再按声部进行规则打分,输出混搭片段。论文还说明多首混搭可以看作两两兼容之和,因此三首以上的搜索可以在同样的两两扣分框架下扩展。

标准化 × 检索: 标准化负责把不同来源的 MIDI 转成可比的谱面与速度基准,检索负责在库中先按速度与终止进行过滤再按对位扣分排序,二者搭配的原因是未经统一量化的速度与记谱会污染后续调性与对位判断,组合后检索只在记谱与速度可比的子集里比音乐兼容性,而不是比文件格式差异。

这一节留给复现者的关键是顺序不能颠倒:必须先统一记谱与速度,再谈调性与动机,最后才比对位。如果跳过标准化直接比和弦,速度基准不同会导致音位错位,声部分离也会把伴奏误当主题,后续所有分数都会失真。

声部、动机与终止逻辑各自算什么?

声部分离解决的是从钢琴织体中拿出可评价的单线条。论文采用已有基于图神经网络的方法,把同时发声的音符划分到不同声部与谱表,目的是让后续的动机提取与对位检查都作用在干净的单旋律上。如果声部混在一起,对位扣分会把伴奏音误判为主题音,分数失去意义。动机检测解决的是哪一段值得拼。论文先用 COSIATEC 算法找谱面上的重复几何型,再用 TF-IDF 思想筛选,即在本曲出现频繁而在全库出现稀少的型更可能是主题。这种做法的假设写得很直白:主题就是在本曲常见、在别处少见的材料。

终止逻辑解决的是调性与功能是否走在同一条路上。论文用另一种图方法逐时刻判定绝对和声,再通过跟踪属到主进行推断调性,完全终止作为调性锚点。用户输入同样要走一遍清洗与终止提取,然后按相似速度与终止进行过滤候选。对每对旋律再按种对位规则计算不当处理扣分,最终选出可拼的目标段。注意这里的兼容性度量是两步:先看终止逻辑是否匹配,再数同时演奏时的声部进行违反数,两步缺一不可。

终止逻辑 × 和声对齐: 和声对齐负责把两个片段在同一时间点上的纵向和弦按原位与转位对上,终止逻辑负责判断和弦进行在调性内的功能走向与乐句收束是否一致,二者搭配的原因是纵向相同不等于功能相同,组合后系统先用终止逻辑过滤调性与功能冲突,再用和声细节做次级参考,避免把功能错位的片段误判为兼容。

动机 × COSIATEC: 动机指乐曲中能被听众记住的主题性短型,COSIATEC 负责在符号谱面上用几何压缩发现重复型,搭配理由是仅靠出现次数多会混入音阶与伴奏音型,组合后先由 COSIATEC 提出候选重复,再用 TF-IDF 思想强调在本曲常见而在全库少见的型,从而把真正具辨识度的素材留给混搭。

声部分离 × 种对位规则: 声部分离负责把混杂的钢琴织体拆成可独立评价的单旋律线,种对位规则负责给两条同时发声的旋律线的纵向与横向进行打违反分,分工不同但必须串联,原因是没有干净声部就无法逐音检查对位,组合后系统先分离再把两条线的并置当作严格对位习题来扣分,分数越低越适合同时演奏。

把 3 组关系放在一起,复述顺序是:声部分离给出谁和谁比,动机筛选给出比哪一段,终止逻辑给出哪几首有资格比,种对位扣分给出最终选谁。任何把伴奏当主题、把功能错位当和弦相同的捷径都会在这条链上被放大。

过滤加打分两步如何选出候选?

检索的第一步是过滤,条件是速度与终止进行相似。速度相似保证两段能放在同一时钟下同时演奏而不必大幅拉伸,终止进行相似保证调性与功能走向一致。论文没有给出速度差的具体数值门限,只说明过滤用相似速度与终止进行,标准化阶段把小幅速度波动按弹性速度丢掉。第二步是打分,对每对旋律计算同时演奏时的种对位不当扣分,选扣分最小的候选做混搭。用户既可以给一段查全库,也可以让系统在库内两两配对找最佳组合。

这里的计算不是生成新音符,而是检索加检验。系统不写旋律,只选片段并检验并置是否违反对位规则。轻微改动材料的说法出现在听辨设计里,指可辨识度条件假设轻微改动更可取,但管线本身没有描述自动改音高的生成器,拼的过程是把原主题直接并置。理解这一点可以避免误解:系统的创造性在于找到意想不到但规则上成立的配对,而不是写出新主题。

下表把管线各阶段的输入输出与论文给出的规模信息放在一起,帮助按阶段核对实现是否漏件。表前的问题是:每个阶段吃进什么、用什么工具、吐出什么,公平比较的前提是否已统一。表中数字保留原文写法,速度阈值与曲库规模是理解过滤强度的关键。

阶段处理对象关键操作依据与工具输出与规模
语料选择Hugging Face 古典 MIDI 子集选巴洛克古典早期浪漫派记谱干净调性清晰3.2k 首
标准化MIDI 文件与速度标记转 XML 动态量化音值MuseScore 量化统一记谱与节奏关系
清洗乐器与速度波动丢乐器信息平滑速度10% 阈值内视为弹性速度去音色影响的速度基准
特征提取声部动机和声调性图方法加启发式并行提取声部分离与终止图方法主题与终止进行
检索用户查询与候选先过滤后按对位扣分排序速度与终止过滤加种对位混搭片段

表后需要解释收益与代价。收益是分工清晰:语料规模 3.2k 首保证风格集中,10% 阈值内速度波动被抹平保证时钟可比,特征提取把音乐判断拆成可替换模块,检索把音乐性归约为先对功能再数违反。代价是每一步都引入假设:丢乐器信息虽控制了音色,但也丢了真实演奏中的分句线索;把小波动都当弹性速度可能抹掉有意的速度设计;动机等于高频加稀有只是一个启发式,伴奏固定音型也可能被误选。未胜出的替代方案在正文中没有量化比较,例如不用图方法而用传统调性算法会差多少,论文没有报告,这构成复现时需要补的对照。

本研究训练了什么,没有训练什么?

本研究没有报告任何新的神经网络训练过程,没有给出训练集划分、优化器、学习率、轮数或梯度路径,也没有说明参数冻结与更新。管线中出现的图神经网络都是直接调用已有方法:声部分离调用已有基于图的方法,终止与和声调用已有终止检测图方法,调性通过跟踪属到主进行推断。COSIMATEC 与 TF-IDF 是无参或计数的启发式算法,不涉及梯度训练。检索打分是规则扣分,不是可微损失。因此不能把本研究理解为端到端训练了一个混搭模型,也不能从调用了图网络就推定系统输出确定,检索结果仍依赖查询与库内容。

真实计算过程是构造与推理。构造指把 3.2k 首 MIDI 转成统一 XML 并量化,清洗速度与声道,批量提取声部、动机、和声与调性,建成可检索的特征库。推理指用户给一段时同样清洗并提取终止,然后过滤加打分选出最佳配对。论文未报告这套批量处理的时间与硬件预算,也未报告检索 1 次要比多少候选、排序耗时多少,这些是复现时需要自己记录的成本项。缺失训练细节不是技术错误,只是意味着本工作的可复现性系于外部工具版本与参数,而不是自训练权重。

初学者常犯的错误是把无训练等同于确定性求解。实际上规则扣分虽无随机梯度,但声部分离与终止检测本身可能带模型不确定性,不同版本的 MuseScore 量化与不同的动机阈值都会改变结果。复现时应固定工具版本、记录候选数与扣分分布,而不是只记最终选了哪两首。

两次听辨各测什么,条件如何控制?

第 1 次听辨测的是 4 个因素各自是否影响偏好,做法是为每个因素选 2 对候选混搭歌曲,每对做两个版本,只差该因素的有无。和声条件改和声以匹配两歌的和弦含转位,终止条件匹配调性与和弦功能,动机条件用轻微改动更可取的假设,织体条件一边是双旋律同时的对位呈现,一边是甲旋律配乙伴奏的主调呈现。所有片段都用 MIDI 钢琴以默认固定力度、动态与触键播放,装饰音按谱保留,评价长度统一为 8 小节,听众是 30 名音乐训练程度不一的学生。图注还说明误差线是 95% Wilson 区间,虚线是均等偏好,柱顶数字是平均偏好分。

第二次听辨测的是管线端到端能否拼出像样的混搭。做法是在 midi-classical-music 中手选 100 首流行曲子,用系统找出所有跨配对候选,挑出最佳候选,同样用受控 MIDI 设置播放,请 5 名高年级本科音乐学生做定性专家评价。注意 2 次听辨的分工不同:第 1 次是因素分离,第二次是系统验收。前者有对照版本,后者没有基线系统对照,专家意见是定性记录,不是打分排名。

下表把 2 次听辨的协议要素并置,便于核对比较条件是否一致与指标方向。表前的问题是:谁在听、听多长、和谁比、指标朝哪边算好。指标方向是偏好比例越高越支持该因素,专家评价则看是否认出来源且觉得音乐连贯。

实验评价对象与长度呈现与对照评价者规模与指标
因素分离听辨短片段 8 bars钢琴固定力度对照有无该因素训练不一的学生组30 人偏好比例
系统验收听辨跨配对最佳候选同样受控 MIDI 无基线系统高年级本科专家5 人定性意见
语料背景巴洛克古典早期浪漫派统一记谱与速度基准不适用3.2k 首总量
候选池手选流行子集系统全配对搜索不适用100 首
评价单位8 小节片段同时演奏学生与专家偏好与可辨识度

表后要讲清支持与限制。主要收益是第 1 次有明确对照,第二次贴近真实使用,都统一了音色与力度,避免把演奏差异误当结构差异。代价与反例是样本不大,第 1 次 30 人、第二次仅 5 名专家,统计效力有限;第二次缺少可运行基线,不能说系统胜过哪种已有方法;统一钢琴与固定力度虽利于控制,却削弱了真实演奏中分句与音色对可辨识度的帮助。未评测的边界包括长曲式、多乐器与非平均律风格,这些在局限节还要展开。

四个因素的偏好排序与专家验收说了什么?

第 1 次听辨的结果在柱状图中一目了然,4 个条件都高于均等线,但高出幅度不同。按柱顶标注从高到低依次是复调呈现约 76.7%,可辨识度约 70.0%,和声约 68.3%,终止约 61.7%。纵轴是偏好该因素存在的比例,越高越支持该因素,虚线 0.5 是随机偏好。误差线是 95% Wilson 区间,终止条件的下限最接近甚至触及均等线,说明在 30 人样本下它的优势最不稳,复调呈现的优势相对最稳。这个排序不能直接读成终止不重要,因为论文的定性观察恰恰强调终止逻辑的鉴别力:和声不对但终止对时仍常被认为兼容,和声对但终止不对时常被认为不兼容,特别当乐句边界没对齐时纵向相同也会被判不兼容。 理解该图要先确认对象与方向,避免把误差线当成性能下降。

看图路径: 1. 先确认横轴四个条件与纵轴偏好比例的含义,并找到 0.5 均等虚线;2. 再比较四个绿色柱体的高度与柱顶百分比标注的排序;3. 最后观察每根误差线的上下延伸范围,判断哪个条件的下限最接近均等线

原论文 Figure 2:Results of the listening study evaluating listener preference for specific musical features.

论文图 2。原论文 Figure 2:“Results of the listening study evaluating listener preference for specific musical features.”。

上图横轴 4 个条件分别是和声、终止、可辨识度与复调呈现,纵轴是偏好存在该特征的比例。4 个绿色柱体都站在 0.5 虚线之上,复调呈现最高,终止最低。误差线反映二项比例的不确定性,终止的区间最宽且下端贴近虚线,复调的区间整体更高。柱顶百分比是均值,不是显著性标记。结合正文,论文据此主张设计选择应优先保证终止逻辑与调性、用轻微改动的主题材料、并以复调方式呈现,而不是只对和弦名字。

复调呈现 × 主调呈现: 复调呈现指两首曲子的旋律同时作为独立声部交织,主调呈现指只取甲曲旋律配乙曲伴奏或副旋律,前者考验两条主题线能否并存,后者考验旋律与伴奏槽能否互换,听辨把二者并列比较的原因是流行混搭常用主调替换,而古典听感可能更依赖对位交织,组合比较直接决定系统最终输出应并置双主题还是做旋律替换。

第二次的专家验收没有数字表,只有三点定性共识。第一,拼的结果在第 1 次听就能认出来源,算有效混搭。第二,主题线在受控 MIDI 下有时难跟踪,真实演奏的配器与声部处理、选节奏身份与触键反差大的曲子会有帮助。第三,一直用密集对位会让听众吃力,全曲推广时应用不同织体与同时声部数调节强度。这些意见支持系统在受控条件下能拼出可辨识且连贯的短片段,同时指出把短片段结论外推到全曲与舞台演奏还缺验证。

拿掉哪条规则最伤听感,哪些对比还缺?

如果把第 1 次听辨看作广义消融,每次只去掉一条规则,定性结论是拿掉终止逻辑最伤判断。和声名字对上但功能与乐句边界错位会被判不兼容,反过来功能对而纵向有替代如副属与增六互换仍可被接受。这说明系统先按终止过滤再数对位违反的顺序是有依据的,不是随意堆规则。可辨识度条件支持用轻微改动的主题材料,复调条件支持双主题并置优于旋律替换,这与流行混搭常用主调替换形成反差,也是论文强调的古典特殊性。

但必须承认缺的对照还很多。论文没有报告只用和声不过滤终止会选出什么,也没有报告不用种对位扣分只随机选会有多差,更没有与可运行的流行混搭系统在同一古典短片段上的横向比较。因此 4 个因素各自的增量贡献只有偏好比例,没有消融后的端到端成功率。终止条件均值最低且区间贴近均等线,提示在更大样本或分层听众中它的排序可能变化,不能当成已确立的效应量。

对复现者的启示是补两类细节。第一类是把因素分离扩展为系统消融:固定候选池,分别关闭终止过滤、关闭对位打分、关闭动机筛选,看最佳配对如何变化并重新听辨。第二类是记录失败条件:哪些配对虽分数低却仍被专家认为难跟踪,是否集中在节奏同质或音区重叠的组合。这些才是论文特有的、可直接指导改进的证据,而不是重复 4 个百分比。

短片段、均匀音色与小样本带来什么边界?

第一个边界是评价与呈现的受控设定。只用短片段与均匀钢琴、固定动态与触键,虽控制了音色与配器,却削弱了表情线索与更大音乐语境对可辨识度的作用。论文自己举例,实际混搭有时会对旋律做小调整以更顺,但何时破规则难以量化。大曲式、情绪与长线张力释放这些古典聆听的核心因素都没有建模,专家也指出持续对位对听众要求高,全曲需要轮换织体。

第二个边界是语料与风格偏差。曲库限于记谱干净、调性清晰的巴洛克到早期浪漫派,对半音化、调式与后调性语汇的终止逻辑覆盖不足。论文推测方法可推广到主流流行摇滚库,但也承认对晚期与后浪漫派、爵士与其他民族音乐可能不适用或需改启发式。这不是说系统错了,而是说终止跟踪依赖属到主与完全终止锚定调性的假设,换了语汇假设就失效。

第三个边界是评价样本不大。30 名程度不一的学生加 5 名高年级本科专家的定性意见,统计效力有限,无法完整刻画听众判断,也留下了听众 expertise 与训练效应的开放问题。论文没有测量误判率、延迟或计算成本,也没有承诺这些量得到改善。读到这里应形成准确预期:在短片段、均匀音色、小样本下成立的偏好,不能直接当成全曲、多乐器、跨风格都成立的因果结论。

要复现这套系统,先做什么,后补什么?

先做数据与标准化。拿到 midi-classical-music 子集,记录版本与曲目清单,用固定版本的 MuseScore 把 MIDI 转 XML 并动态量化音值,丢掉乐器信息,把速度波动按 10% 阈值内视为弹性速度的规则抹平,输出统一记谱、速度与谱面节奏关系。这一步要存下每首的速度曲线与丢掉的声道信息,以便回查。然后跑特征提取:用固定版本的声部分离图方法拿单线条,用 COSIMATEC 加全库词频拿主题候选,用终止检测图方法拿逐时刻和声并跟踪属到主推断调性。每一步的版本号与阈值都要记录,因为无训练不等于无超参数。

再做检索与听辨。用户查询同样清洗并提取终止,先按速度与终止过滤,再按种对位规则给每对双旋律打违反分,选最低者拼成 8 小节符号片段并以统一钢琴固定力度播放。听辨复现要保留原文条件:8 小节、30 人左右的混合训练组做因素对照、手选 100 首左右做系统验收、5 人左右专家做定性。指标方向是偏好比例越高越好,误差线用 95% Wilson 区间,均等线 0.5。不要把自动对位分当成人评,也不要把不同指标的差值混在同一列下比较。

还需补的验证有三项。第一是成本与规模:批量特征提取耗时、单次检索候选数与排序耗时、硬件环境,这些原文未报告。第二是分层听众:按训练程度分层看终止与复调优势是否稳定,扩大样本重测区间。第三是长片段与真实演奏:在保留原规则的同时加入配器与触键反差,看可辨识度与听觉负担如何变化。资源状态方面,论文引用的第三方链接本次均为可用状态,但这只说明参考文献可达,不等于本系统代码与权重已公开,复现应按无官方代码的假设从描述重做。

何时值得尝试这套方法,如何一句话记住它?

当你的任务是古典钢琴短片段的符号拼贴,且需要可读谱与可演奏性,而不是波形拼贴,这套方法值得尝试。它的适用条件很具体:风格处于共性实践期、调性清晰、记谱干净;评价单位是 8 小节左右的时间局部;呈现可用统一钢琴接受;听众能分辨双主题线。如果要做全曲、多乐器、后调性或爵士与民族风格,需要先改终止假设并加入织体调度,否则不应直接套用。

一句话记住它:先对终止功能再数对位错误,用可认出的双主题同时演奏。这个顺序来自听辨:功能错位比和弦名字错位更伤听感,双主题并置比旋律替换更像古典混搭。未来的工作沿着论文指出的方向走:扩大曲库到更多风格并丰富启发式,扩展到长曲式与多乐器并纳入乐句、情绪与张力管理,探索多首兼容是否等于两两之和,再用更大分层样本与平均意见分或出声思维等混合方法验证。只有补上这些,才能从短片段的成立走向更一般的有效混搭。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 icmc-2026 论文汇总