英文题目:RenCon 2025: Revival of Expressive Performance Rendering Competition.
会议身份:
conference:nime:2026:conference-paper-id:nime2026_79
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#主观评测 #音乐信息检索 #音乐 #符号音乐生成
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Huan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Taegyun Kwon:机构信息未能从会议 PDF 纯文本可靠映射
- Anders Freiburg:机构信息未能从会议 PDF 纯文本可靠映射
- Junyan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Hayeon Bang:机构信息未能从会议 PDF 纯文本可靠映射
- Hyeyoon Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Gus Xia:机构信息未能从会议 PDF 纯文本可靠映射
- Akira Maezawa:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Dixon:机构信息未能从会议 PDF 纯文本可靠映射
- Dasaem Jeong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
表情演奏渲染以MusicXML乐谱为输入,输出带有人性化timing、力度与踏板的人性化演奏MIDI或音频,难点在于主观审美难以标准化且MIDI力度无绝对声压含义、不同Disklavier琴响应缺乏校准。先以全部投稿乐谱渲染为输入做线上异步海选,职责是广度筛选并以专长加权投票排序,其输出的入围名单直接作为参赛资格进入现场赛。再以入围系统与48小时限时发放的未见新曲为输入做限时渲染,职责是考验泛化能力并统一物理琴录制以消除乐器差异,其输出的统一琴演奏录音进入最终裁决环节。最后以统一录音为输入做音乐会盲听与计算分析,职责是用5点Likert量表打分并辨认人类基线,随后用DualDTW对齐MIDI提取力度与速度参数以关联评分。相对2002-2013年多用Chopin与Mozart固定曲目加现场评比的做法,本届新增异步线上平台、匿名随机播放与统一物理琴流程,兼顾跨时区参与广度与现场真实感。在线上预选与现场决赛评测设置下,决赛轮的研究者占比指标为71.7%,高于预选轮研究者占比指标的54.5%。人类演奏获4.40/5.0且36/48名听众正确辨认人类,力度分布宽度与听众评分呈最清晰正相关而大幅速度波动无稳定收益。结论适用边界受限于西方古典钢琴独奏短时音乐会场景,大规模曲目与长期聆听效果尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/ismir-mirex/RenCon2025 — 暂时无法访问
- 演示资源:https://ren-con2025.vercel.app/ — 暂时无法访问
- 演示资源:https://ren-con2025-audition-page.vercel.app/ — 暂时无法访问
- 第三方资源:https://github.com/erwald/midihum — 链接可访问(HTTP 200)
- 第三方资源:https://musescore.com/user/ — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文解读的对象是 RenCon 2025 复办总结论文,比赛于韩国大田国际音乐信息检索会议期间举行,任务是表情性演奏渲染,也就是把一份乐谱变成具有人类感的时间、力度与触键处理的钢琴演奏。输入在预赛是音乐 extensible 乐谱文件,输出是 MIDI 或波形音频,决赛则要求在 48 小时内渲染一首赛前未公开的新作。目标读者是刚进入语音音乐音频方向的研究生,因此解读必须可核对与可复述:每一步动作、曲目、时间限制、评价量表与校准操作都要能对应到原文。
对初学者先做白话铺垫:乐谱只规定弹什么音与大致时值,不规定每个音具体提前或拖后多少毫秒,也不规定每个音用多大力气与如何衔接,而人类钢琴家恰恰在这些自由度上做选择。渲染系统就是要自动做出这些选择。输出方面,本文将按学习依赖展开,先讲任务与历史路线,再讲 2 阶段赛制全景,接着讲 9 套系统的组件与计算,然后讲决赛校准与评价条件,最后讲排名、表达参数分析与复现要点。
需要保留的关键信息包括曲目名单、时长上限、评分加权方式、人类基线身份与练习量,以及力度映射这一长期难题。
表情性演奏渲染到底难在哪里?
表情性演奏渲染的英文是 expressive performance rendering,难点在于它没有唯一正确答案。同一首贝多芬变奏主题可以弹得庄重也可以弹得流动,只要在风格与结构上自洽都可能被接受。系统要在 3 个互相牵制的维度上同时做决定:时间维度包括整体速度、局部渐快渐慢与声部间微小错位,力度维度包括乐句起伏、声部平衡与重音位置,发音维度包括连断、踏板深度与换踏板时机。任何 1 维做得极端都可能破坏其他维度的听感,例如速度波动过大即使力度丰富也会显得散乱。
论文把这一任务放回计算机音乐自上世纪八十年代以来的脉络中,指出机器学习与大规模演奏数据集出现后,神经方法大量涌现,但系统评价方法反而缺失,这正是复办比赛的动机。对初学者举一个教学例子:例子是把同一八小节主题分别处理成巴赫式、莫扎特式、肖邦式与拉赫玛尼诺夫式变奏,系统不能只输出一套通用力度曲线,而要随风格切换触键与时间策略。论文决赛正是用这种主题加变奏的新作来考察风格适应能力。
乐谱 × 表情性演奏渲染: 乐谱负责给出音高、节奏与结构的骨架信息,表情性演奏渲染负责把骨架变成带时间伸缩、力度起伏与踏板的具体演奏动作,二者搭配的原因是同一乐谱允许多种合理演奏,组合意义在于把作曲意图与听感上的自然度和风格合适度分开评价。
过去的 RenCon 测过什么,为什么停办又为什么重启?
RenCon 全称是演奏渲染系统竞赛,自 2002 年发起,早期目标是为带有强烈主观性的演奏建立可操作的评价标准。论文回顾了几个关键节点:早期引入图灵测试与逆图灵测试,前者问机器能否冒充人类,后者问人类能否被挑出来;2008 年前后形成自主组与人工辅助组的分组,因为是否允许人事先干预会显著改变成绩归因;2013 年斯德哥尔摩 workshop 后停办,期间恰逢大规模演奏数据集与神经生成方法兴起。历史曲目长期局限于西方古典,以莫扎特与肖邦为主,2013 年用了斯卡拉蒂与罗塔各一首。
历史用琴在真实自动钢琴与采样器之间摇摆,涉及 Disklavier 与贝森朵夫自动演奏系统等不同设备。停办原因论文没有给出单一归因,但强调了评价共识难以维持与系统多样性增加之间的张力。重启的直接背景是国际音乐信息检索评测交换需要新的渲染评测点,以及跨模态与生成式音频方法已经可以绕过 MIDI 直接输出声音,旧的只比 MIDI 的框架不再够用。
图灵测试 × 逆图灵测试: 图灵测试负责检验听众能否把机器演奏误认为人类演奏,逆图灵测试负责检验听众能否把人类演奏识别出来,二者搭配的原因是单向判断容易受偏好干扰,组合意义在于同时考察以假乱真能力与人类演奏的可辨识性。
这次比赛要回答的具体问题是什么?
本次复办要回答的不是哪个模型参数量更大,而是 3 类可操作问题。第一,在相同乐谱输入下,不同技术路线输出的演奏在听众整体感知上如何排序,评价维度包括自然度、表情丰富度与风格合适度,统一收敛为五点量表的一道总体题加五点自信度加权。第二,机器演奏距离人类演奏还有多远,为此专门设置人类基线并让现场听众做辨认,要求报告辨认正确率。
第三,哪些可测量的表情参数与听众评分更一致,为此赛后对 MIDI 做对齐并抽取速度、力度、 timing 与连断等汇总指标,再与评分做散点与相关分析。约束条件同样是问题的一部分:预赛要求三首总量不超过 5 分钟,决赛要求 48 小时内完成 94 小节新作,现场无法让每队逐一试琴,只能由主办方做统一的力度重映射与踏板补救。这些约束决定了成绩解释必须同时考虑算法与播放条件。
对初学者要明确:这不是语音合成那样的客观指标竞赛,没有字错率可比,胜负依赖于听众加权投票与事后参数分析的相互印证。
两阶段赛制是如何组织的?
赛制分为线上预选与现场决赛两个阶段,设计意图是兼顾广泛参与与高质量现场聆听。预赛提交窗口为 2025 年 5 月 30 日至 8 月 25 日,经由评测交换在线通道提交,任务是渲染三首,其中两首从四首指定曲中任选,另加一首自选。指定四首为亨德尔 G 小调随想曲、贝多芬 C 小调 32 段变奏主题加前 5 个变奏、拉赫玛尼诺夫改编为钢琴独奏的歌曲,以及海滩的作品。输入为乐谱文件,输出为 MIDI 或波形,总时长上限 5 分钟。
所有符号输出统一用奥地利林茨约翰内斯开普勒大学维也纳办公室的一台自动钢琴转录为音频,要求披露任何后处理与人工编辑,并尽量减少干预,但也允许直接提交音频以容纳生成式音频路线。决赛在 9 月 25 日会议最后 1 天晚间音乐会举行,曲目是 9 月 23 日才发放的新作,主题取自韩国民谣改编的八小节旋律,全曲 94 小节含 4 个分别模仿巴赫、莫扎特、肖邦与拉赫玛尼诺夫风格的变奏。
决赛共 8 套系统加 1 位人类钢琴家同台匿名随机播放,听众多出一道辨认人类的题目。
自主系统 × 人工辅助系统: 自主系统负责在给定乐谱后不经人工修改直接输出演奏,人工辅助系统负责允许人事先调参或事后修音,二者搭配的原因是早期比赛需要区分算法本身与人的审美干预,组合意义在于明确成绩到底归于模型还是归于操作者。
本段先解释线上听辨页面的组织方式,该页面把每个投稿做成可双击弹出的悬浮卡片,卡片内有方法简介与音频播放条,右上角经由在线表单投票,评审时队名与模型名匿名,公布后再去匿名化。下图即为该页面的实际截图,有助于理解异步跨时区评审的操作界面。
看图路径: 1. 先找到深紫底上并排悬浮的各系统卡片与黄色播放按钮;2. 再看每张卡片内标注的曲目名与录音来源说明;3. 最后确认右上角评委入口与匿名播放的组织方式
论文图 1。原论文 Figure 1:“Online audition platform”。
从像素可见深紫底上有多个并排卡片,黄色标题分别标出不同系统名,卡片内有曲目文字与黄色圆形播放键及进度条,右上角有评委入口按钮。这种设计避免固定顺序播放,但原文也报告部分评委反馈悬浮窗不易抓取与追踪,这是后续界面需要改进的直接证据。
九套系统各自用什么计算做出表情?
9 套投稿来自 6 个国家,按第一作者机构地址计,覆盖从 2002 年前后规则系统到 2025 年新架构约 23 年的技术跨度。论文将其粗分为 4 类。第一类是规则与统计学习:Director Musices 用乐句拱形规则处理时间,再用特征加支持向量回归处理力度;RenConnoisseur 用乐句与旋律轮廓启发式;Midihum 用 400 余维人工特征加梯度提升树做力度人性化,基本保留原谱时间。
第二类是层次与概率模型:VirtuosoNet 用门控循环单元加条件变分自编码器,分音符与乐句层级建模;YQX 加号把表情看作从高斯噪声到表情偏移的传输过程,用条件流匹配建模多尺度概率。第 3 类是变换器架构:ElegantAIPianist 用 4 层双向编码器加 6 层因果解码器,并用风格自适应层归一化注入作曲家特征;ScorePerLockNAR 用非自回归变换器加模板约束管线保证结构忠实;CueFreeExpressPedal 用 5 个变换器编码器集成,从极简输入预测微观时间与踏板。
第 4 类是跨模态合成:Contin-U 把乐谱转为图像,再用残差向量量化词元直接做图像到音频合成,绕过中间符号。对初学者沿一个样本走一遍:输入是贝多芬变奏的乐谱文件,系统先将其转为音符序列或图像表示,再经各自组件输出每音的发音时刻偏移、力度值与踏板,最后落为可在自动钢琴上播放的 MIDI 或可直接播放的波形。
本研究训练了什么,没有训练什么,真实计算是什么?
需要明确区分两层训练。本文本身作为竞赛组织与分析论文,没有统一训练一个新渲染模型,也就没有报告统一的优化器、轮数、损失曲线或梯度路径。各参赛系统的训练或构造过程由各队在自述报告中负责,原文只给出架构级摘要,未给出可复现的学习率、批量、数据划分与早停细节,因此不能从模型名称推定其参数是否冻结或输出是否确定。真实计算主要发生在三处。
第一是各队离线构造渲染:规则系统查表与回归计算,树模型与循环网络及变换器的前向推理,跨模态系统的图像编码加音频词元解码。第二是主办方的统一转录与校准计算:在逻辑软件中用 MIDI 力度处理器做全局偏移与斜率重映射,对无踏板预测的文件加保守半踏板。第三是赛后分析计算:用对偶动态时间规整把演奏 MIDI 对齐到参考乐谱,再用符号音乐工具包抽取速度、力度、时间与连断汇总量,并计算与听众评分的线性趋势与相关系数。
缺项要如实指出:原文未报告各系统的训练数据规模、硬件开销与推理延迟,也未报告对齐与参数抽取的超参数选择,因此复现分析时只能沿用其点名工具与流程,无法断言去掉某组件必然如何变化。
评价与播放条件是如何控制的?
评价工具是结构化在线表单,每套渲染被问一道五点总体题,另加一道一到五点的全局自信度用于加权,还有开放评论与音乐背景等多选人口统计。预赛 24 人、决赛 48 人参与投票,身份以研究者、音乐技术者、演奏者为主,决赛专家比例更高,音乐学院学生两轮均为 6 人。播放条件分两地:预赛符号输出统一在维也纳办公室自动钢琴上转录,决赛在韩国科学技术院约 500 座礼堂的自动钢琴上现场播放。
决赛前做了一轮校准,包括分队音量平衡与踏板响应检查,但因各队无法提前试琴,主办方在监听回放时用了启发式全局力度重映射,并对无踏板文件统一加半踏板。论文指出 MIDI 力度值与可测声压之间没有固定关系,不同合成器与自动钢琴映射各异,这是自早期比赛延续至今的共性难题。提出的长期解法包括提前采样决赛用琴做力度映射库,或提供采样乐器代理供开发时试听,而现场逐队调试则因时间与独占使用限制难以实现。
MIDI 力度 × 声音响度: MIDI 力度负责记录 0 到 127 的输入数值,声音响度负责描述钢琴在厅堂中实际发出的声压听感,二者搭配的原因是不同自动钢琴与采样器对同一力度值的映射各不相同,组合意义在于不做校准就无法公平比较不同系统的动态设计。
为说明为何必须校准,论文给出决赛各队代表性 MIDI 文件的力度分布箱线图,箱体为四分位距,须线为第 5 到第 95 百分位,橙色菱形为均值并标注标准差。下图即为该分布的实际像素。
看图路径: 1. 先横向比较八个箱体的中线、箱体高度与橙色均值点;2. 再重点看 YQX 加号整体偏低且标准差最小的位置;3. 最后对照人类与各系统箱体宽度差异理解校准动机
论文图 4。原论文 Figure 4:“Velocity box plot for live-contest MIDI submis- sions.”。
从像素可见 8 个箱体高度与位置差异显著,YQX 加号整体集中在 40 附近且箱体最窄,人类与多数系统集中在 60 上下但离散度从 8.1 到 15.7 不等。这种离散差异直接支持了统一重映射的必要性,也提示单纯比较原始力度值会混淆算法设计与播放映射两类效应。
线上与现场分别测到了什么排名与差距?
比较问题是:在加权听感总体分下,规则方法与神经方法谁更靠前,人类基线领先多少,以及两轮排序是否稳定。公平条件是同曲目池、同匿名播放、同五点量表加自信度加权,但两轮曲目与听众构成不同,因此跨轮比较只能看名次稳定性而不能直接比绝对分。指标方向是分数越高听感越好,辨认人类正确率越高说明机器与人类越可区分。下表先看人口统计与预赛完整排名,表中保留可运行策略与原始分数写法,共五列以同时交代轮次、系统、技术路线与名次含义。
| Category | Preliminary (N=24) | Final (N=48) |
|---|---|---|
| Researchers | 12 | 33 |
| Music technologists | 10 | 23 |
| Performers | 8 | 21 |
| Conservatory students | 6 | 6 |
上表是人口统计原表,直接呈现两轮听众结构,说明决赛专家浓度更高而预赛参与更分散,这是解释跨轮波动的前提。下表整理预赛完整排名,Director Musices 以 4.33 分居首,VirtuosoNet 以 3.54 分居次,Midihum 第三,其余依次为 ElegantAIPianist、Contin-U,表中同时给出技术路线与当年版本信息以避免把分数误读为单一架构胜负。
| 轮次与条件 | 系统 | 总体分 | 技术路线 | 名次含义 |
|---|---|---|---|---|
| 线上预选加权投票 | DirectorMusices | 4.33/5.0 | 规则加支持向量回归力度 | 预赛第一 |
| 线上预选加权投票 | VirtuosoNet | 3.54/5.0 | 层次循环加条件变分自编码器 | 预赛第二 |
| 线上预选加权投票 | Midihum | 3.32/5.0 | 梯度提升树 400 特征 | 预赛第三 |
| 线上预选加权投票 | ElegantAIPianist | 3.19/5.0 | 变换器加风格自适应归一化 | 预赛第四 |
| 线上预选加权投票 | Contin-U | 3.00/5.0 | 图像到音频跨模态 | 预赛第五 |
表后解释主要收益与代价:规则系统在预赛听感上仍最有效,神经系统虽强但方差大;直接音频合成路线虽新但未进前三,说明绕过符号并未自动带来听感优势,该结论只针对本次曲目与加权投票条件。
现场决赛 8 套系统加人类同台,总体名次大致稳定但有升降,VirtuosoNet 以 3.62 分反超至第一,Director Musices 以 3.06 分居第二,Midihum 与 Contin-U 同为 2.90 分,其余依次下降,人类以 4.40 分居首且 75% 听众正确辨认出人类,报告显示机器表情尚未达到难辨真假的水平。下表呈现决赛结果与预赛名次变化对照。
| 轮次与条件 | 系统 | 总体分 | 预赛名次 | 决赛名次变化 |
|---|---|---|---|---|
| 现场决赛 48 人投票 | Human 人类基线 | 4.40/5.0 | 不参排名 | 最高且 75% 被正确辨认 |
| 现场决赛 48 人投票 | VirtuosoNet | 3.62/5.0 | 预赛第 2 | 上升 1 至第 1 |
| 现场决赛 48 人投票 | DirectorMusices | 3.06/5.0 | 预赛第 1 | 下降 1 至第 2 |
| 现场决赛 48 人投票 | Midihum | 2.90/5.0 | 预赛第 3 | 持平第 3 |
| 现场决赛 48 人投票 | YQX+ | 1.79/5.0 | 预赛第 6 | 下降 2 至第 8 |
表后需强调反例与边界:ElegantAIPianist 从预赛第四跌至第七,YQX 加号跌至末位,说明新曲风格适应与现场映射对部分系统冲击更大;CueFreeExpressPedal 未能参加决赛,因此决赛表天然缺一项,不能据此推断其现场表现。
速度 × 力度: 速度负责控制单位时间内的拍数与局部快慢起伏,力度负责控制击键强度与声部层次,二者搭配的原因是听众同时从时间与能量 2 维感知乐句走向,组合意义在于用速度与力度平面上的轨迹判断演奏是有计划的起伏还是零散抖动。
为检验表情参数与评分的关系,论文给出 4 个散点子图,横轴分别为速度极差、速度波动、力度极差与时间标准差,纵轴为听众评分并附线性趋势与相关系数。下图即为该分析的实际像素。
看图路径: 1. 先看四个子图横轴指标定义与纵轴听众评分的对应关系;2. 再比较红色趋势线斜率与标题中相关系数的大小;3. 最后定位人类与高低分系统在散点中的相对位置
论文图 5。原论文 Figure 5:“Each panel shows a summary metric (tempo, dy- namics, timing, articulation) against audience score, with a linear trend and Pearson correlation rreported in the ti- tle.”。
从像素可见力度极差与时间离散子图的趋势线斜率更明显,速度波动子图几乎水平,人类点多位于右上,高分系统靠近人类而低分系统偏离。这种分布支持力度塑造比大幅度速度起伏更一致地对应高评分,但原文表述为相关而非因果,仍需后续控制实验验证。
哪些表达方式与评分同向,哪些反而没有帮助?
本节按问题组织反证:大速度起伏是否必然加分,稳定速度是否一定减分,动态变化的作用是否更稳健。方法是用对偶动态时间规整对齐后再抽取汇总量,音频直出的 Contin-U 因自动转谱后对齐不可靠被排除在该分析之外,这是明确的未评测边界。结果显示力度相关量与评分的正关联最清晰,速度极差与速度波动的关系弱或不一致,时间可变性也呈正相关但弱于力度。论文据此判断,大幅度 tempo 偏移 alone 不足以换来高感知质量。
另一组反证来自演奏虫轨迹,即把第二变奏小节 22 至 41 的速度与力度随时间连成轨迹并经保形分段 3 次插值,高分的人类与 VirtuosoNet 呈现连贯弧线且在相近速度区有相似力度,低分系统则呈碎片云或竖直窄带。值得注意的是基本保留谱面时间的 Midihum 与 ScorePerLockNAR 仍居中游,说明稳定的速度可以接受,甚至优于选择不当的抖动。下图展示全部 8 个子图的轨迹全貌,是理解连贯性与离散度差异的最直接证据。
看图路径: 1. 先确认每子图横轴为速度纵轴为力度且颜色表示时间先后;2. 再对比人类与高分系统连贯弧线与低分系统竖直窄带的差别;3. 最后观察第二变奏区段内轨迹的方向性与离散程度
论文图 6。原论文 Figure 6:“Each subplot shows tempo (x) versus dynamics (y), with color indicating progression from beginning to end of the second variation section.”。
从像素可见首行人类与 VirtuosoNet 轨迹覆盖宽广且颜色渐变连续,中行两套系统几乎为竖直线,末行两套系统轨迹低矮离散。这种对照支持有意图的动态规划比随意的时间扰动更重要,但同样只是相关性观察,不能推出增大力度极差必然提分的因果结论。
赛制与测量的边界在哪里?
论文用专门章节反思了两类局限。线上听辨的局限包括悬浮界面无固定顺序虽减少顺序偏好,但部分评委反馈窗口难抓取难追踪;为保匿名而隐去技术报告,导致评委只能评输出不能评创新,且多数投稿已发表反而增加身份猜测难度。现场局限包括时间所限无法逐队试琴,只能由主办方统一干预且事前未充分公开;还发生 Director Musices 因首遍过轻而重播 1 次的操作事故,说明需要稳健的播放电平检查流程。
测量局限包括力度映射无标准目标,对生成式渲染如何对准真实厅堂仍是开放问题;表情参数分析样本量小且为赛后相关分析,未做显著性与因果检验;人口统计多选且样本仅 24 与 48 人,不能推广到一般听众。伦理方面,论文声明仅收集高层音乐背景等可选人口信息,汇总分析且经知情同意,无脆弱人群与介入实验,作者声明无 competing 利益。对初学者要记住:缺失证据不是技术错误,相关性也不是因果,未测量延迟、成本与误判率时不应承诺这些量得到改善。
要复现与复核应先做什么,需要哪些信息条件?
复现分 3 条线。第一是比赛流程复现:按预赛四选二加一首自选、总量 5 分钟、乐谱输入与 MIDI 或波形输出组织投稿,再用同一表单的五点总体题加五点自信度加权收集投票,注意匿名与去匿名时点。第二是播放条件复现:预赛与决赛分别对应不同自动钢琴与厅堂,符号输出需经同一转录链,决赛需复刻全局力度重映射与无踏板加半踏板的补救逻辑,并记录逻辑软件中偏移与斜率参数,否则力度差异无法归因。
第三是分析复现:用点名的对偶动态时间规整与符号音乐工具包重做对齐与参数抽取,排除音频直出系统的不可靠对齐,复算散点趋势与相关系数。资源状态方面,论文脚注给出的竞赛站、听辨页与结果仓库链接中,本次核验为比赛仓库未能确认可达,两个展示页同样本次未能确认可达,只有第三方 Midihum 代码库当前可用,另有一处改编谱来源链接当前不可用,因此不要默认所有链接可打开,应先存档可用版本再跑流程。
关键缺项是各队训练超参数、硬件预算与推理开销均未报告,复现时只能先跑推理与评价链,再补测延迟与成本。
何时值得尝试这类方法,还需补哪项验证?
综合两轮证据可以给出务实建议。当曲目为西方古典钢琴且评价依赖现场听感时,精心调校的规则加统计力度仍值得先试,因为它在预赛第一与决赛第二且实现透明;当需要跨乐句层次的连贯起伏时,层次循环加变分结构值得尝试,决赛第一的成绩支持其在新曲上的泛化;当输入只有扫描谱面或需要直接出音频时,跨模态路线值得探索,但要接受转谱对齐与评价链都要重做。
复现时先做三件事:固定同一自动钢琴映射或采样代理,锁定加权投票口径与人口统计,再跑通对齐到散点的完整分析。还需补的验证包括:扩大听众样本并检验评分者间一致性,对力度极差做控制性干预以检验因果,在多厅堂与多琴上重复播放以分离算法效应与映射效应,以及系统报告推理延迟与人力编辑时长以评估可部署性。
最终判断是:RenCon 2025 提供了一个更新的参考点,证明动态塑造比极端揉速更稳健地对应好评,但人类基线仍以 4.40 分与 75% 可辨识度领先,距离真正难辨真假还有明显差距。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 3 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



