英文题目:VELOCITY PREDICTION IN AUTOMATIC GUITAR TRANSCRIPTION

会议身份:conference:eusipco:2026:conference-paper-id:0000061

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#数据增强 #迁移学习 #音乐 #音乐转录

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Loth, Jackson:机构信息未能从会议 PDF 纯文本可靠映射
  • Riley, Xavier:机构信息未能从会议 PDF 纯文本可靠映射
  • Dixon, Simon:机构信息未能从会议 PDF 纯文本可靠映射
  • Benetos, Emmanouil:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为吉他独奏音频,输出为带音高与起止时间及力度Velocity的音符级MIDI序列,难点在于吉他缺乏钢琴Disklavier式的真实力度测量且公开数据集均无可信力度标注,力度本身仅为关联音量与音色的抽象强度定义。为此先对FrançoisLeduc对齐MIDI按谐波滤波能量加权估计伪力度并归一化至0至127,再用三种虚拟乐器的五种音色渲染约20小时合成音频以确立虚拟乐器力度曲线为真值定义。接着在合成数据上以高分辨率卷积循环网络的起音偏移帧与力度子模块联合训练学习该力度映射,损失为各子模块二元交叉熵之和。然后将学到的力度子模块参数冻结并迁移至真实数据模型,在GAPS与GOAT上去除力度损失项后继续训练起止帧预测,从而隔离不可信真实力度监督并保留合成域强度映射。与此前直接用常数力度微调同架构的做法不同,该流程以冻结合成力度分支为条件调节帧预测,使低力度处更关注帧激活而非拟合错误标签。在合成FrançoisLeduc歌曲划分测试集下,所提模型的误差指标平均绝对误差为7.04,低于基线的误差指标平均绝对误差32.39。该结论适用边界受限于合成力度定义内,对未知音色与真实演奏强度的外推尚未验证,音色划分下误差已升至11.53且附带力度的F1明显回落。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

吉他转录为什么长期只报音高而不报力度?

输入是吉他演奏的录音,目标是输出类似多声部音乐信息检索中常用的音符列表,每个音符包含音高、起始时间、结束时间,在这篇论文中还要加上力度。力度在这里先用白话理解为弹得多重多轻带来的综合强度感,英文是 velocity,取值按多媒体乐器数字接口标准取 0 到 127。钢琴转录能做力度,是因为有带击键力度测量的自动钢琴和对应数据集,吉他没有可以直接测量的物理量,现有吉他数据集一般把力度写成固定常数,论文报告在真实吉他数据集上该值通常设为 100,因此监督信号缺失是首要矛盾。

第二个矛盾是定义模糊。论文明确指出,在吉他语境下力度不是实测值,而是与响度和音色都相关的抽象强度,不同虚拟乐器开发者自行决定力度控制哪些音量与音色参数,没有统一标准。这意味着即使模型预测出一个数值,它的对错也依赖于采用哪条力度曲线。初学者容易误以为力度等于响度,论文引用已有研究强调力度与响度是非线性关系,更宜理解为强度。教学例子是:同样弹响一个音,用力拨弦不仅声音更大,泛音结构和高频能量也会变化,虚拟乐器正是用这种映射定义真值。

本解读的输入是论文原文证据,目标是让刚入门的研究生能复述方法与实验条件,输出是 1 篇按学习依赖展开的技术讲解。必须保留的信息包括合成数据构造方式、2 阶段训练与冻结安排、损失函数构成、数据划分与评估指标方向。后续先讲相关路线,再走完一个样本从音频到标签的全流程,然后讲训练、实验条件、结果与限制。

钢琴力度、吉他数据集与合成数据各解决了什么?

同输入同目标的参照是钢琴转录。钢琴有多声部转录模型同时预测起始、结束、帧激活和力度,论文采用的高分辨率钢琴转录模型就是这类卷积循环神经网络,英文是 convolutional recurrent neural network,缩写是 CRNN。它在钢琴上成功,部分原因是自动钢琴数据集提供了逐音符力度真值,评估可以直接算误差。吉他转录借用了该架构并在多个吉他数据集上达到较好水平,但微调时力度标签是常数,力度分支实际上没有学到有意义的映射。

同输入不同监督的参照是吉他数据集建设。论文列举的吉他数据集包括 GuitarSet、IDMT-SMT-GUITAR、EGDB、GAPS、GuitarTECHS 和 GOAT,它们提供真实吉他音频与音符级乃至弦级标注,但创建费时费力,且不含力度真值。另一条路线是用乐谱对齐自动生成标注,降低人工成本,但仍未解决力度定义问题。初学者要区分:音符起始结束可以通过人工听辨或对齐得到,力度在吉他上没有公认测量方法,所以不是标注不努力,而是有方法论缺口。

同监督思想不同乐器的参照包括管乐与弦乐表情参数的合成到真实迁移,以及用虚拟吉他学习起始结束的研究。论文的判断是合成数据对起始结束有效,但尚未用于吉他力度预测。本文的定位因此是首次把吉他转录扩展到力度预测,用虚拟乐器定义的力度曲线作为可学习的真值,再通过迁移保留该能力。

要测什么:在没有真值的数据上如何定义成功?

论文要解决的具体任务是:在真实吉他音频上输出带力度的音符转录,且力度预测要与某种可复现的力度曲线一致。由于真实音频没有力度真值,论文把成功拆成两部分定义。第一部分是在合成数据上可验证的力度精度,用正确匹配音符对上的平均绝对误差衡量,误差越小越好,同时报告带力度约束的 F 值,越高越好。第二部分是在真实数据上可验证的音符转录精度,用 50 毫秒容差下的精确率、召回率和 F 值衡量,越高越好,但此时不考核力度数值本身,只考核加入预训练力度权重后音符指标是否变化。

关键约束是评估的相对性。论文明确指出,评估结果依赖于测试集力度标注与训练用虚拟乐器实现有多接近,即使模型完全学会训练数据的力度曲线,也可能在其他实现上表现下降。因此论文设计了两种划分来暴露这种依赖,而不是宣称学到了普适物理量。另一个约束是力度目标更偏向相对强度而非绝对精确值,论文讨论部分以西方记谱中只有若干力度记号为例,说明误差在总范围中占比较小即可满足许多用途。初学者应记住:这里的成功不是测出拨弦的牛顿力,而是复现虚拟乐器的力度映射并给出有用的相对强弱。

两阶段方法全景:先学力度曲线再学真实音色

沿一个样本走完流程有助于建立整体感。取一段 10 秒的吉他音频,先算对数梅尔频谱图,英文是 log mel-spectrogram,作为模型输入。模型内部有 4 个子模块,分别负责起始、结束、帧激活和力度,每个子模块包含若干卷积层、双向门控循环单元和全连接层,英文是 bidirectional gated recurrent units。输出是对每个音高逐帧的激活概率,以及归一化到 0 到 1 再映射到 0 到 127 的力度值。训练目标是让起始、结束、帧和力度 4 个二元交叉熵损失之和最小,其中结束损失乘以 0.1 以降低不精确结束标签的影响。

自动吉他转录 × 力度预测: 自动吉他转录负责把音频中的每个音符的音高、起始和结束时间找出来,力度预测负责估计每个音符的强度等级。两者搭配的理由是转录架构中音符帧判断以起始预测的中间输出为条件,力度分支可以提供响度与音色维度的辅助信息,组合意义是让模型在保留高精度音符检测的同时额外输出可用于表现力分析的力度值。

全景分为两个阶段。第一阶段只在合成数据上训练,目标是学会合成数据对应的力度曲线。第二阶段在真实吉他数据上训练其余模块,目标是让音符起始结束在真实音色上准确且泛化。衔接动作是把第一阶段学好的力度子模块权重载入第二阶段模型并冻结,使其在没有正确力度标签的真实数据训练中不被改变,其余模块继续更新。最终得到的是音符预测来自真实数据训练、力度预测来自合成数据训练的组合模型。论文用示意图展示该流程,但本次未收到图像像素,因此只依据正文描述复述,不推测图中模块位置与箭头样式。

模型组件如何分工:四个子模块算什么?

输入表示是 10 秒对数梅尔频谱图,这是把波形经短时傅里叶变换再经梅尔滤波取对数得到的时频表示,保留音高与响度随时间的变化,适合卷积层提取局部频谱模式。卷积层负责在频率与时间邻域内检测谐波结构,双向门控循环单元负责利用前后文判断音符延续,全连接层负责映射到每个音高的逐帧概率。论文沿用已有高分辨率转录架构,不改变主体结构,重点改变训练数据的监督来源与权重迁移方式。

起始预测子模块 × 帧激活子模块: 起始预测子模块分工是逐音高判断每 1 帧是否为音符开始并回归高分辨率时间,帧激活子模块分工是判断每 1 帧每个音高是否处于发声状态。搭配原因是仅有离散的起始点不足以确定音符持续区间,需要帧级状态把起始和结束连接成完整音符,组合意义是两者联合解码才能输出带起始、结束和持续时间的完整音符列表。

力度子模块的特殊性在于它的监督只在第一阶段有效。第一阶段损失记为 LA,等于起始损失加 0.1 倍结束损失加帧损失加力度损失。第二阶段损失记为 LB,等于起始损失加 0.1 倍结束损失加帧损失,去掉力度项。去掉的原因是真实数据集的力度标签不正确,若继续计算会污染总损失。论文还提到音符预测以起始预测模块的中间输出为条件并与力度拼接,使模型在力度低时更关注帧状态,这是力度可能反哺音符精度的机制假设,但论文未单独消融该连接本身,只比较是否使用预训练力度权重。

合成力度标签如何从音频估计再渲染?

合成数据构造起点是已有对齐数据集,论文使用包含 79 首对齐真实吉他音频与多媒体乐器数字接口标注、总时长约 4 小时的数据集。对其中每个音符,作者先截取其起始到结束对应的音频片段,变换到频率表示后,用以基频与谐波为中心的带通滤波器组滤波,计算各滤波信号总能量,再对谐波按指数衰减权重加权求和,最后归一化到 0 到 127 作为估计力度。这一步的白话含义是:响的音符通常总能量大、高次谐波相对丰富,加权求和试图同时捕捉响度与音色线索。

得到估计力度后,把它写回对应的多媒体乐器数字接口标注,再用 3 种吉他虚拟乐器的 5 种音色渲染,得到约 20 小时合成训练数据。关键性质是渲染时演奏完全对应标注中的力度值,因此虚拟乐器使用的力度曲线成为模型要学的真值曲线。论文强调该曲线定义了何种电平、音色与强度对应每个力度值。初学者要注意:这里的估计力度并非人工测量的金标准,而是为了驱动虚拟乐器产生有动态变化的合成音频,真正的监督来自渲染时写入的力度值,而非估计过程本身的精度。

两阶段如何训练:学什么、冻什么、超参数是什么?

第一阶段在合成数据上用损失 LA 训练,学习率是 0.0001,批量大小是 6,迭代 150000 次,目标是学好力度曲线。第二阶段载入第一阶段的力度组件权重并冻结,然后在真实吉他数据上用损失 LB 训练,学习率改为 0.00001,性能一般在约 20000 次迭代后趋于平稳。所有模型都从预训练钢琴转录检查点开始训练,这是沿用已有吉他转录工作的做法。论文报告曾尝试从第一阶段合成模型检查点直接微调第二阶段,但发现会在看完所有训练数据前极快过拟合,因此最终第二阶段是从钢琴检查点出发再载入冻结力度权重,而不是全模型延续。

合成数据预训练 × 真实录音微调: 合成数据预训练分工是提供与音频严格对齐的力度标签,让模型学到虚拟乐器定义的力度曲线,真实录音微调分工是让起始、结束和帧预测适应尼龙弦与电吉他等真实音色。搭配原因是真实吉他数据集没有可用的力度真值,无法同时学两件事,组合意义是通过冻结力度子模块再训练其余模块,实现力度能力保留与泛化性兼得的 2 阶段迁移。

数据增强在训练时作用于波形,步骤包括在 32 到 4096 赫兹之间随机频率加两个峰值滤波器,品质因数在 1 到 2 之间随机,增益在负 30 分贝到 10 分贝之间随机,接着加混响,干湿比在 0% 到 70% 之间随机,最后以 50% 概率施加不同麦克风录制的脉冲响应,使用 Pedalboard 软件包实现。真实训练数据是 GAPS 与 GOAT,论文报告两者分别约 14 小时尼龙弦吉他与约 6 小时电吉他录音,来自两种不同吉他音色。测试用 GuitarSet 约 3 小时原声吉他与 EGDB 约 2 小时电吉他。硬件是单块英伟达 A100 图形处理器,计算在高校高性能计算设施上完成。

论文未报告梯度在冻结力度分支上的具体截断实现细节之外的逐层学习率差异,因此复述时只说冻结以防改变,不推测内部梯度路径。

实验条件如何划分:歌曲泛化与音色泛化分别怎么测?

力度评估用合成数据的两种划分。歌曲划分在全部 5 种音色上训练,测试只用训练未见过的曲目,用于测内容泛化。音色划分只用 JB-145 音色训练,用 Native Instruments 音色测试,用于测未知音色与未知力度实现上的泛化。所有模型都用 GAPS 与 GOAT 微调后再评估,以保证音符部分来自真实数据训练。基线是不包含预训练力度方法的模型,即力度分支未经过合成力度预训练,其余训练条件相同。

歌曲划分 × 音色划分: 歌曲划分分工是检验模型对未见过乐曲内容的泛化,训练用全部 5 种音色而测试只用未见过的曲目,音色划分分工是检验对未知虚拟乐器力度曲线的泛化,只用 JB-145 音色训练而用 Native Instruments 音色测试。搭配原因是力度定义随乐器实现而变,单一划分无法区分是记住了曲子还是真正学到力度映射,组合意义是两种划分对照可以分离内容泛化与音色泛化。

指标方面,力度误差采用已有钢琴力度工作提出的平均绝对误差,只在正确匹配的音符对上计算估计与真值差的绝对值平均,越低越好,同时报告均值与标准差。带力度约束的 F 值要求音符匹配且力度归一化到 0 到 1 后差值在 0.1 以内,对应 0 到 127 尺度上约 12.8 的容差,越高越好。不带约束的 F 值只考核音符匹配。音符评估用 50 毫秒分辨率下的精确率、召回率与 F 值。统计检验用配对 t 检验,显著性水平取 0.05,并用夏皮罗-威尔克检验核查差值分布的正态性。论文明确指出真实录音没有力度真值,因此对真实数据的力度泛化只能靠轶事性试听判断有用性,不能给出确定性数字,这是必须保留的边界条件。

力度预测在合成集上带来多大改进?

比较问题是:在相同真实数据微调条件下,是否使用合成预训练力度权重会改变合成测试集上的力度精度与整体转录得分,公平条件是两种划分下基线与本方法都经过 GAPS 与 GOAT 微调,指标方向是误差越低越好,F 值越高越好。下表整理论文报告的合成集结果,数值保留原文精度,误差是 0 到 127 尺度上的平均绝对误差,F 值是百分比尺度的 F 度量。

数据划分模型平均误差带力度 F 值不带力度 F 值
歌曲划分基线32.3935.691.19
歌曲划分本方法7.0469.2291.22
音色划分基线33.5934.793.74
音色划分本方法11.5351.9994.14

表后解释需要同时看到收益与代价。本方法在歌曲划分上把平均误差从 32.39 降到 7.04,标准差也同步下降,带力度 F 值从 35.6 升到 69.22,不带力度 F 值基本持平,这报告为力度训练显著优于基线。音色划分上误差从 33.59 降到 11.53,带力度 F 值从 34.7 升到 51.99,说明对未知音色仍有大幅改善,但绝对精度比歌曲划分差,均值误差约占 128 总范围的 9%,而歌曲划分约占不到 6%。未胜出项是基线本身的不带力度 F 值已很高,力度改进没有转化为同等幅度的音符 F 值提升,且带力度 F 值仍明显低于不带力度 F 值,论文指出这与 0.1 阈值较严有关。限制是该结论只在合成力度曲线下成立,不能直接推广到真实吉他力度真值。

预训练力度权重对真实集音符指标有帮助吗?

比较问题是:把冻结的预训练力度权重拼入真实数据训练的模型后,在未见过的真实数据集上的音符精确率、召回率与 F 值是否提升,公平条件是基线与本方法都用相同方式在 GAPS 与 GOAT 上训练且各训练 3 次取平均,以控制论文观察到的轮次间波动,指标方向是三者越高越好且此时不计力度。下表整理论文报告的 GuitarSet 与 EGDB 全集结果,数值保留原文 2 位小数。

数据集指标基线本方法显著性结论
GuitarSet精确率90.3690.45显著
GuitarSet召回率83.9484.04显著
GuitarSetF 值86.7786.87显著
EGDB精确率83.9284.05显著
EGDB召回率83.0483.07不显著

表后解释要区分统计显著与实际幅度。本方法在 GuitarSet 上三项都小幅领先约 0.1 个百分点,配对 t 检验显示精确率、召回率与 F 值差异显著。在 EGDB 上精确率差异显著但召回率与 F 值差异不显著,F 值从 82.86 到 82.95 的提升同样微小。论文的判断是预训练力度权重带来小幅提升,但幅度有限且并非在所有测试数据上都显著。这支持力度信息可能通过条件连接轻微帮助音符判断,但不支持把力度预训练当作提升音符精度的主路径。未评测边界是真实音频的力度本身未被考核,因此不能从音符 F 值微升推断真实力度更准。

平均绝对误差 × 带力度约束的 F 值: 平均绝对误差分工是只在正确匹配的音符对上计算力度估计值与真值的平均绝对差,反映力度数值本身的偏离,带力度约束的 F 值分工是要求音符匹配同时力度归一化后差值在 0.1 以内,反映转录系统整体可用性。搭配原因是前者不惩罚音符漏检误检,后者把音符检测与力度精度绑在一起,组合意义是两者对照才能判断提升来自力度更准还是音符找得更全。

哪些结论不能下:定义、评估与泛化的边界在哪里?

第一个边界是定义依赖。论文反复强调力度在吉他上是抽象强度,与响度非线性相关且随虚拟乐器实现而变,因此学到的是特定虚拟乐器的力度曲线,不是普适物理量。音色划分结果变差很可能源于不同虚拟乐器对力度定义不同,这不是实现错误,而是方法固有的相对性。初学者误解常是把误差 7 或 11 直接理解为拨弦力量测错了多少,正确理解是与所用渲染器定义的映射偏离了多少。

第二个边界是真实数据不可验证。论文明确指出,据作者所知不存在带力度真值的真实吉他数据集,因此无法在真实录音上定量证明力度泛化,只能依据试听认为能反映强弱。缺失证据不是技术错误,但意味着不能承诺在教育或演奏分析场景中每个音符的力度都可靠。第三个边界是提升幅度。音符转录结果与已有零样本最优水平相当而非超越,0.1 个百分点左右的提升可能被数据或架构改动淹没,论文也推测其他方向可能更有潜力。相关性不等于因果,未测量延迟与成本时也不应承诺效率改善。

要复现应先准备什么:数据、损失与冻结顺序

复现先做数据。需要先获取对齐的真实吉他音频与多媒体乐器数字接口标注,按论文方法对每个音符估计 0 到 127 力度并写回,再用 3 种吉他虚拟乐器的 5 种音色渲染出约 20 小时合成数据。注意论文未公开代码与模型的可用性声明,本次也没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,复现者需自行实现估计与渲染管线并记录所用虚拟乐器版本与力度映射。真实训练用 GAPS 与 GOAT,测试用 GuitarSet 与 EGDB,划分要复刻歌曲划分与音色划分的对照思想。

训练顺序是先以 0.0001 学习率、批量 6、150000 次迭代在合成数据上用含力度项的损失训练,再载入力度子模块权重并冻结,以 0.00001 学习率在真实数据上用去掉力度项的损失训练约 20000 次迭代至平稳,全程从钢琴转录检查点出发。评估时合成集报告平均绝对误差及其标准差、带力度与不带力度 F 值,真实集报告 50 毫秒下精确率、召回率与 F 值并做配对 t 检验与正态性检查。还需补的验证是为真实录音建立可复现的力度代理真值,例如基于激励参数或响度参数的明确定义,或采用自监督思路,否则真实场景的力度精度仍处于待验证状态。

何时值得尝试这种两阶段力度方案?

当任务需要同时输出音符与相对强弱,且没有真实力度标签时,该方案值得尝试。它的价值在于用合成数据的精确对齐换取力度监督,再用真实数据保证音符泛化,通过冻结实现两者拼接。论文显示合成集上力度误差大幅下降且能泛化到未知音色,真实集上音符精度保持在先进水平并有微小提升,代价是跨力度实现时误差增大,以及音符提升幅度小且不总是显著。

不值得单独为提音符 F 值而引入该方案,若目标只是把 GuitarSet 或 EGDB 的 F 值提高几个百分点,应优先考虑架构或数据改进。若要用于教学反馈或表现力分析,应先在目标音色与目标曲风上做小规模人工对比,确认相对强弱排序可用,再决定是否依赖绝对数值。未来工作应补上吉他力度的可测量定义与真实评估协议,只有在该协议下验证后,才能把合成集上的成功推广为真实演奏的力度转录能力。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 6 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eusipco-2026 论文汇总