英文题目:BoYaEval: Evaluating Multimodal Large Language Models on Understanding Ancient Chinese Musical Scores
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.997
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准测试 #基准设计 #多模态模型 #音乐理解
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Jiajia Li:机构信息未能从会议 PDF 纯文本可靠映射
- Weizhi Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Yao:机构信息未能从会议 PDF 纯文本可靠映射
- Qiwei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Chenchong:机构信息未能从会议 PDF 纯文本可靠映射
- Zuchao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ping Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Hai Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为保留纸张老化与洇墨噪声的古谱切片图像,输出为符号结构选择题答案、演奏技法指令文本与旋律对应选项,难点在于单字同时压缩指法弦位与音高且版式非线性并伴随长尾复合字形。首先由三位音乐学专家从珍稀谱本裁剪图像并交叉核对曲谱文献达成金标准,使原始噪声与稀有组合直接进入题库,随后按结构解析与指令翻译与旋律推理三层构造题目并形成选择与生成答案,最后以零样本与少样本提示调用二十一种多模态大模型作答并用准确率与BLEU与BERTScore自动评分。与面向西方五线谱的光学乐谱识别只做视觉转录不同,该工作强制要求从字形解码到可执行动作再到旋律推导的跨表征映射,因而能检验组合推理而非表面记忆。在BoYaEval基准下,Gemini 2.5 Pro Thinking的准确率为30.18%,高于GPT-5的20.87%。该结论的适用边界仅限于图像到符号文本的离散评测,在可听化演奏与音频一致性上尚未验证且推理链易走结构捷径。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:为什么古谱不是普通的乐谱图片?
这篇解读的输入是论文正文与官方原图像素,目标是让刚进入语音音乐音频方向的研究生能核对原文并复述方法,必须保留的关键信息包括 5 种谱式划分、3 层任务定义、数据规模与标注方式、零示例与少示例评测条件、主结果数字与失败分析结论。论文研究的不是西洋五线谱识别,而是中国古代乐谱的视觉语义理解。西洋谱主要在时间和音高轴上记录听到了什么声音,古谱尤其是古琴减字谱记录的是演奏者该怎么做。
一个复合字把左手按弦手指、徽位、弦序和右手拨弦手法压进一个字形,读者要同时做空间拆分、部首还原和动作映射。工尺谱和律吕谱虽然是按字标音的唱名体系,但字形小、与 surrounding 版式标记易混,且历史用字与现代汉字用法不同。俗字谱只用 10 个左右的草书简字记民歌曲调,文字谱则用整句文言描述动作,极为冗长。正是这种空间压缩加领域知识依赖,使通用多模态大模型在自然图像和现代文档上有效的做法不能直接搬过来。
为建立从看到懂再到推出声音的递进,论文把 5 种谱式放在同一框架下比较。顶部对照先说明线性记音与空间记法的分工差异,中部用原书影展示 5 种版式,底部把评测切成三档。理解这张总览有助于后文按学习依赖展开:先认谱式,再看任务切分,再看数据构造与指标选择,最后看结果与反证。
看图路径: 1. 先看顶部西洋五线谱与古谱的对比说明,确认线性记音与空间记法的区别;2. 再看中部五种谱式卡片,逐个辨认文字谱、减字谱、俗字谱、工尺谱、律吕谱的版式;3. 最后看底部三任务条,沿解析到翻译再到推理的箭头理解难度递增
论文图 1。原论文 Figure 1:“Overview of the BoYaEval benchmark. The hierarchical framework transitions from symbol-level parsing (Task 1) and column-level translation (Task 2) to excerpt-level melodic…”。
上图把论文的论证起点画完整了。最上方一行是西洋五线谱示例与文字说明,强调其线性抽象特征。中间五行卡片分别给出文字谱、减字谱、俗字谱、工尺谱、律吕谱的书影与定义,其中减字谱卡强调复合字由标准汉字偏旁缩叠而成,工尺谱卡列出上尺工凡六五乙等代表音高的用字,律吕谱卡强调一字一音的严格格式。底部三栏分别标出 503 道单符号选择题、1426 道识别与翻译题、1246 道旋律推理题,并用箭头指向解析、翻译、推理的 3 级分类。读图时不要把古装人物插画当成数据,要把注意力放在版式差异和 3 级箭头上。
已有路线走到哪里:文档问答、光学乐谱识别与音乐问答缺了哪块?
与本文同输入的文档理解路线包括文档问答与文字识别评测,例如针对文档图像提问的评测和针对细粒度符号阅读的评测。论文报告这类工作多面向现代印刷文档和图表公式,对书法形态与音乐语法交织的历史手稿覆盖不足。与本文同目标的光学乐谱识别路线长期做把谱面转成机器可读符号的工作,有面向密集小目标检测的大规模合成集、面向手写谱图结构的标注集,以及面向单声部端到端识别的合成与实拍集。
在中文古谱一侧,已有工作用深度学习做减字谱单字识别,用规则方法或改进的目标检测框架做工尺谱字符识别,用历史数据集做俗字谱识别与跨谱泛化标定。这些工作报告的是视觉转写精度,不回答模型是否理解指法语义并推出旋律。与本文同监督形态的音乐问答路线包括音视频时空推理、音频语言评测,以及面向合成谱面问答和完整谱面理解的新评测。
论文指出这些评测多用合成图像或现代谱,对古谱特有的非线性空间结构和高度压缩语义没有系统覆盖。因此本文的定位不是再做一个单字识别器,而是做一个从视觉符号到音乐语义再到旋律推导的多模态推理评测。
要测什么能力:三层任务如何对应从看到懂?
论文把能力拆成 3 层,每层输入输出都不同。第一层是结构解析,即符号识别。输入是一张裁剪出的单个符号图像加一道关于其结构组成或理论含义的问题,输出是从 4 个选项中选一个。考的是能否把复合字拆成部首并对应到指法弦序知识。第二层是指令翻译与列级识别。
输入是一列或一段谱面切片,输出依谱式而定:减字谱要求生成自然语言演奏指法说明,工尺谱与律吕谱要求按顺序输出字符序列。考的是语义理解与顺序转写。第 3 层是音乐推理,即旋律推导。输入是一段古谱摘录图像加若干现代记谱候选项,输出是选出最可能对应的现代谱。考的是综合视觉线索与领域逻辑推出实际旋律的能力。
论文明确把第 3 层作为占比约 39% 的最大部分,理由是计算音乐学的最终目标是从沉默的历史重建声音。举例来说,任务一的例子是问某个古琴符号表示泛起还是泛止散起按起,任务二的例子是把一段减字谱译成左手拇指按七弦十徽之类的动作句,任务三的例子是把一段工尺或减字谱摘录与简谱或五线谱选项对齐。3 个例子都是教学转述,具体题面以原题为准。
方法全景:一个样本如何走完图像到答案?
沿一个样本走完全程有助于建立全局感。以任务二的一段减字谱为例,输入是未经增强的原书影裁片,保留纸张老化与洇墨噪声。模型先要做视觉感知,在列中找到每个复合字的位置,再做语义解压,把每个字拆成左手指法、徽位、弦序、右手手法等要素,最后生成结构化演奏说明。以任务三的一段古谱为例,输入是古谱摘录加多个现代谱选项图像,模型要先识别古谱符号序列,再按调式与定弦逻辑换算成音高序列,最后与每个选项的音高走向比对并给出选项字母。
任务一则更短,输入是单符号图加题干,输出是选项字母加一句解释。3 种路径共享同一前提,即提示词会明确告知谱式类型,任务一的谱式信息含在题干中,任务二与任务三在提示中显式给出,以提供领域上下文。输出格式也被固定,任务三限定用数字简谱便于自动评分。
结构解析 × 乐理问答: 结构解析负责看清单个符号由哪些部首拼成,乐理问答负责用四选一考查符号的历史含义和结构知识,二者搭配的原因是先验证视觉拆分能力再谈语义,组合后构成任务一的单符号选择题形态。
下图把 3 类题型的输入输出形态并排展示,是复述方法时最直接的依据。
看图路径: 1. 看左栏单符号四选一的题面与泛起泛止散起按起四个选项;2. 看中栏整段减字谱图像到左右两份中文与英文指法译文的对应;3. 看右栏一段古谱图像到四个简谱候选项的对齐选择
论文图 2。原论文 Figure 2:“Illustrative examples of the three tasks.”。
上图左中右三栏分别对应 3 层任务。左栏显示单符号图像、中文与英文双语题干、四选一选项与中英文作答指令,底部输出为选项字母。中栏显示整段古琴减字谱图像、中文释读指令与英文翻译指令,右侧输出为中文逐句指法与英文逐乐句动作说明,并用标注强调每个字形由表示弦序徽位与双手手法的简化汉字拼合而成。右栏显示古谱摘录图像、四幅现代谱候选项、中英文对齐指令,底部输出为选项字母。读图时注意输入图像数量逐栏增加,任务三的题干与每个选项都含图像,这是后文部分模型无法评测该任务的原因。
五种谱式各测什么:字形与任务如何搭配?
5 种谱式的分工不同,搭配的任务也不同。文字谱是最早的古琴记法,用整句文言描述手指动作,属于位置制与方法记谱,因冗长而少用于演奏,主要出现在知识题中。减字谱由文字谱简化而来,用偏旁缩叠拼成指令性复合字,一个字同时编码左手指法、徽位、弦序与右手拨法,是翻译任务的核心。俗字谱流行于宋元,用约 10 个草书简字直接标民歌音高,是工尺谱的前身。工尺谱以宫尺等核心字为唱名,在明清用于戏曲与器乐合奏,任务是列级字符识别。
律吕谱用十二律第一字标标准音,因庄重刻板而限于宫廷雅乐与祭祀,任务同样是列级识别。论文在附录中说明减字谱选自 2800 余首中的 322 段,工尺谱选自 5000 余首中的 946 段,时间跨度覆盖 1300 余年,以保证风格与结构多样性。
减字谱 × 操作指令: 减字谱负责把左右手指法、弦序、徽位和拨弦动作压缩成一个复合字形,操作指令负责把这个字形展开成可执行的演奏动作,二者搭配的原因是古琴谱不直接写音高而写做法,组合后模型必须先拆部首再映射到身体动作才算读懂。
工尺谱 × 唱名式识别: 工尺谱负责用合四一上尺工凡六五乙等汉字直接标唱名高度,唱名式识别负责按列顺序读出字符序列,二者搭配的原因是该谱式接近逐字转写而不含复杂手势压缩,组合后成为检验模型基础视觉识别能力的对照分支。
律吕谱 × 宫廷雅乐: 律吕谱负责用十二律第一字标示标准音高,宫廷雅乐负责限定其使用场景为祭祀和礼仪音乐,二者搭配的原因是字形工整且遵循一字一音的严格格式,组合后成为字形最清晰、最利于识别但语料稀缺的分支。
不同谱式在古今对齐中的对应关系可以概括为古谱摘录与现代谱的配对,论文用一个映射式表示 4 组对齐方向。
\[Jianzipu ↔Staff/Numbered Gongchepu ↔Staff Suzipu ↔Staff Lulupu ↔Staff\]该式输入是 4 种古谱类型,输出是其对应的现代记谱形式,计算目标是说明任务三的候选项来自哪种跨记谱对齐。原文未给出该式的梯度或优化含义,它不是可训练目标,只是任务构造的对应说明。研读时不要把它当成损失函数,也不要从中推定模型内部的换算步骤。
有没有训练:本研究实际做了哪些构造与计算?
本研究没有训练新的多模态大模型,也没有更新任何被测模型的权重,因此不存在优化器、学习率、梯度路径与参数冻结安排。论文实际做的计算与构造分为 3 类。第一类是数据收集与裁剪。从珍稀刻本与权威选集收集原书影,手工裁成片段级图像以提高清晰度并去掉无关题跋,除裁剪外不做对比度调整、去噪或锐化,刻意保留纸张老化与洇墨以考查端到端鲁棒性,并优先选用网络爬取中少见的罕见版本以降低数据污染。第二类是专家标注。
3 位各有十年以上经验的音乐学专家按任务分工:任务一全部由专家出题并编写基于常见歧义的干扰项;任务二的减字谱翻译由专家独立释读再经 2 人复核讨论形成共识,工尺谱识别先由大模型生成初稿再由专家逐字校正;任务三由程序从古今配对扫描件自动组装再由专家核对旋律对应并剔除有节奏歧义的条目。第 3 类是评测调用。
以零示例为主调用 21 个通用多模态大模型,温度设为 0 以保证确定性输出,提示词跨模型保持一致并在任务二与任务三中告知谱式。论文未报告训练资源消耗与推理延迟,未测量的成本与速度不能从准确率推定。缺项是明确的:没有音频实现环节,没有把推导旋律与专家演奏录音比对的跨模态任务。
实验条件:数据划分、指标方向与公平性如何保证?
数据规模按任务切分。全文报告总量为 3175 个样本,其中结构解析 503 个样本,指令翻译 1426 个样本,音乐推理 1246 个样本。论文把推理作为最大部分以强调重建声音的目标。标注一致性用 3 人标注的弗莱斯卡帕值报告为 0.95,表明接近完全一致。分布特征被描述为重尾,即少数基础符号高频出现,大量结构复杂的复合字低频出现,且低频符号往往结构密度最高,要求模型做组合泛化而非频率记忆。
评测条件上,开源模型在 80 吉显存的图形处理器上推理,温度为 0,提示模板按任务固定。任务一与任务三用准确率,数值越高越好。任务二用生成指标组合:BLEU-4 考查序列保真,字符级指标考查弦序指法等技术词的字级精度,BERTScore 考查语义一致性,数值越高越好。论文解释不用固定槽位计分的原因是减字谱每个字所含属性数不一致,难以套用统一槽位。
公平性上,所有模型先做零示例评测以考查内在泛化,再对部分模型做任务二的三示例与任务三的两示例评测,示例中给出完整旋律重建与推理链。任务三输出限定为数字简谱以便自动评分。部分模型因单次输入图像数量上限无法完成题干加多选项全是图像的任务三,论文明确标注其缺测而非零分。
BERTScore × 可执行性: BERTScore 负责用上下文向量比较生成译文与专家参考在语义上的接近程度,可执行性负责判断译文是否说清按哪根弦、按哪个徽位、用哪只手指怎么做,二者搭配的原因是减字谱译文允许措辞不同但动作不能错,组合后使自动指标能代理专家对指法正确性的打分。
指标有效性用 100 条翻译输出的人工复核验证。专家按是否可演奏与结构正确打分,再算自动指标与人工分的相关性。论文强调看斯皮尔曼等级相关而非绝对误差,报告 BERTScore 在两个被测模型上都高于 BLEU,从而支持用 BERTScore 代理程序正确性。相关性不等于因果,自动分高不能证明模型真正理解音乐,只是排序上更接近专家判断。
附录核对:少示例表格如何读?
为避免把少示例增益误读为通用提升,这里单独核对任务三的两示例结果。比较问题是增加两个含完整推理链的示例后准确率变化多少,公平条件是同一模型、同一任务三题集、同一准确率指标,增量为百分点而非相对百分比。下表直接选用原表矩阵,行列不做增删,数值保留原表裸值形态。
| Model | Accuracy (%) | Delta (∆) |
|---|---|---|
| Seed-1.6 | 30.08 | +4.00 |
| Seed-1.6 (T) | 27.13 | -0.72 |
| GLM-4.6V | 26.79 | -1.46 |
| GLM-4.6V (T) | 27.24 | -1.33 |
| Qwen3-VL Plus (T) | 25.99 | -0.33 |
上表显示增益微弱且多为负向。种子模型从零示例基线提升 4.00 个百分点到 30.08,其思考版本下降 0.72 个百分点到 27.13,双子座思考版本仅提升 0.69 个百分点到 30.87,其余两行均为负增量。结合正文任务二三示例带来超过 20 点 BLEU 提升的报告,可以得出适应余量集中在识别分支而非推理分支的判断。未评测边界是该少示例表只覆盖 6 种配置,不能推广到全部 21 个模型,也不能把其中最高值当成新最优方法。
主结果:基础识别尚可、推理塌缩在哪里?
要回答的比较问题是:在同一批原貌古谱上,主流模型在 3 层能力上相对谁更强,以及推理相对识别掉了多少。公平条件是零示例、同一提示规范、任务一与任务三用准确率、任务二用 BLEU 与 BERTScore。指标方向均为越高越好。下表整理零示例下 3 个代表性模型的数字,列数满足宽表要求,数值写法保留原表裸值形态,单位在表头与正文中交代。第一组数字为任务一准确率,第二组为减字谱翻译的 BLEU 与 BERTScore 相关分,第三组为工尺识别的对应分,最后一列为任务三准确率。阅读时注意 BLEU 与 BERTScore 量纲不同,不能跨列直接相减,百分点与相对百分比也不同。
| 模型 | 任务 1 准确率 | 减字谱翻译 BLEU | 工尺识别 BERTScore 类分 | 推理准确率 |
|---|---|---|---|---|
| Seed-1.6 Thinking | 65.20 | 17.51 | 46.72 | 27.85 |
| Gemini 2.5 Pro Thinking | 61.40 | 30.29 | 61.92 | 30.18 |
| Qwen-VL-Max | 61.00 | 7.88 | 41.80 | 27.61 |
上表显示的主要收益是基础层相对可用而推理层整体塌缩。种子模型的思考版本在任务一上达到 65.20,为该列较高值,双子座思考版本在翻译 BLEU 上达到 30.29 左右并在工尺识别分上达到 61.92 左右,通义千问大模型在翻译语义分上达到 49.47 左右但 BLEU 仅 7.88 左右,说明措辞保真与语义接近并不一致。具体代价是任务三准确率三者分别仅为 27.85、30.18、27.61,相对任务一掉了约 30 个百分点。未胜出项同样重要:GPT-5 思考版本在推理上仅 20.87 左右,低于多数对照;部分指令模型在任务一超过 60 但在翻译 BLEU 不足 1,表明单符号知识不等于段落级释读能力。任何把末步最优值当成可部署收益的做法都不成立,少示例与思考链的增益见后文反证。
看图路径: 1. 先确认雷达图五个顶点分别为工尺识别、律吕识别、翻译、推理和知识;2. 比较三条折线在工尺识别顶点处的张开幅度;3. 观察三条折线在推理顶点处同时塌缩的位置
论文图 4。原论文 Figure 4:“Performance comparison of MLLMs on the BoYaEval benchmark. BERTScore F1, Acc. represents Accuracy (%).”。
上图是三强模型的雷达对比。5 个顶点顺时针依次为工尺识别、律吕识别、翻译、推理与知识,刻度为 BERTScore 或准确率。紫色双子座在工尺与律吕两顶点明显外扩,黄色种子思考版本在知识顶点略微领先,青色通义大模型在翻译顶点外扩但在律吕顶点内缩。3 条折线都在推理顶点收紧到低位,直观对应表格中 27 到 30 左右的塌缩。读图时不要把面积大小直接当总分,因为各轴量纲与难度不同,且颜色不代表同一模型在所有任务最优。
反证与消融:换谱式、加示例、换指标会改变结论吗?
要回答的第二个比较问题是:同一模型在不同谱式上是否一致,以及增加示例能否修复推理。公平条件是同一图像列切片输入、同一零示例或固定示例数、同一指标。下表把同一批模型在工尺识别、减字谱翻译、律吕识别 3 条分支上的 BLEU 与语义分并排,列数满足宽表要求,数值保留原表裸值。
| 模型 | 工尺 BLEU | 工尺语义分 | 减字翻译 BLEU | 减字语义分 | 律吕 BLEU |
|---|---|---|---|---|---|
| Gemini 2.5 Pro | 28.46 | 60.83 | 4.28 | 38.45 | 42.10 |
| Seed-1.6 | 14.29 | 42.46 | 5.53 | 40.43 | 21.17 |
| Qwen-VL-Max | 6.68 | 42.29 | 9.99 | 49.47 | 14.81 |
上表显示谱式差异稳定成立。减字谱翻译的 BLEU 普遍低于工尺与律吕的识别 BLEU,双子座在工尺上 28.46 而在减字上仅 4.28,种子模型在律吕上 21.17 而在减字上仅 5.53。论文解释一是任务形态不同,减字是解释性释读而非逐字转写,二是字形差异,律吕字大清晰而工尺字小易与 surrounding 标记混淆。思考链对工尺与律吕多有提升,但对减字增益有限,说明当前推理机制不足以补足指法语义推断。未胜出项是部分小模型在 3 分支上 BLEU 均不足 1,表明规模与指令调优不能自动带来古文字鲁棒性。
少示例的反证更关键。任务二的三示例使工尺与律吕的 BLEU 出现超过 20 点的适应余量,任务三的两示例即使给出完整旋律重建与音程推理链,增益仍微弱或为负。论文报告的表格显示双子座思考版本仅从 30.18 到 30.87,种子模型从 26.08 到 30.08 而其思考版本反而下降,说明推理瓶颈不在缺格式示例,而在跨表征的音高换算逻辑未被内化。
看图路径: 1. 看上下面板横轴题号与纵轴 0 到 1 分数的对应关系;2. 比较橙色 BERTScore 曲线与绿色人工曲线的起伏同步性;3. 比较蓝色 BLEU 曲线整体偏低且与人工峰谷错位的情况
论文图 5。原论文 Figure 5:“Distribution comparison between human ex- pert scores and automatic metrics (BLEU & BERTScore F1) for the Gemini 2.5 Pro Thinking model on 100 sam- pled translation instances.”。
上图比较人工分与自动指标随题号的变化。上方面板为双子座,下方面板为种子模型,横轴为题号,纵轴为 0 到 1 分数,蓝色为 BLEU,橙色为 BERTScore,绿色为人工分。可见橙色曲线与绿色曲线的峰谷同步性高于蓝色曲线,尤其在双子座面板中部题号附近两者同时下探后回升。论文进一步报告双子座上 BERTScore 与人工分的斯皮尔曼相关为 0.770,高于 BLEU 的 0.690,种子模型上为 0.451 高于 0.344,从而支持用 BERTScore 代理可执行性。但这只是排序一致性,不是绝对分值准确,更不能把自动分当成人评。
边界与失败机制:模型具体是怎么错的?
论文用 20 例思考链人工审计归纳 4 种机制性失败。第一是单线索偏置与过早承诺,模型被显著符号如泛音记号或滑音记号锚定,未验证完整符号到音高链就提交旋律走向,在种子思考模型中 8 例出现。第二是自上而下模板覆盖,模型把摘录映射到流水阳关三叠等记忆中的名曲,用记忆模板覆盖局部记谱证据并做事后辩解,在双子座中更常见。
第三是不稳定基础与证据链断裂,推理初期频繁出现可能再想想等不确定标记,后期用整体轮廓相似代替音程一致的对齐。第四是调式与徽位映射不一致,起始音算错后不重新校准,而以非标准定弦为由维持错误答案。这些分析来自小样本人工判读,统计效力有限,不能推广为所有模型的精确误判率。基准的另一边界是只有视觉到符号的评测,没有音频实现环节,无法检验模型推出的旋律与专家演奏是否一致。
数据层面保留的噪声是真实档案噪声,但罕见版本优先策略只能降低不能消除预训练污染。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开,复现时应以论文附录的提示模板与评测划分为准。
复现先做什么:数据、提示与评分如何对齐?
复现应先对齐数据口径。再核对总量 3175、任务一 503、任务二 1426、任务三 1246 的划分,以及减字 322 段选自 2800 余首、工尺 946 段选自 5000 余首的历史覆盖说明。再按任务准备输入:任务一为单符号图加四选一题干,任务二为列级切片加谱式显式提示,任务三为古谱摘录图加多个现代谱选项图。提示模板需逐字采用附录写法,任务一要求输出一句解释加选项字母,任务二要求按减字翻译或工尺律吕识别的固定前缀输出,任务三要求输出解释加选项字母并限定现代谱为数字简谱。
推理时温度设为 0,开源模型在 80 吉显存图形处理器上运行,注意部分模型因单次输入图像数上限无法评测任务三,应记为缺测而非零分。评分时任务一与任务三用准确率,任务二同时算 BLEU-4、字符级分数与 BERTScore,并用斯皮尔曼相关检验自动分与人工分的排序一致性。少示例复现时任务二用三示例、任务三用两示例并附完整推理链,不要把搜索最优或事后最优当成可部署增益。
人工复核至少准备 100 条翻译样本的双模型输出,并由具备古文与音乐学背景的专家按可演奏性打分。
何时值得尝试:给新生的行动清单与收束
当你的任务涉及非线性空间符号、领域专用字形与跨模态对齐时,这套 3 层切分值得借鉴。先用单符号选择题验证视觉拆分,再用列级生成验证语义展开,最后用跨记谱对齐验证逻辑换算,每层用不同指标且不混用。减字谱一侧优先补组合泛化测试,因为重尾分布下高频死记不能代表读懂稀有复合字。工尺与律吕一侧优先做版式鲁棒性测试,因为字小易混与竖排列切分是主要误差源。指标一侧优先报告 BERTScore 与人工分的相关性,再看 BLEU 的严格匹配,两者分开讨论。
失败分析一侧优先记录思考链中的锚定符号与模板联想,而不是只看最终选项。还需补的验证包括音频实现比对、更大规模专家复核、以及对污染与划分的显式消融。在这些补齐之前,结论应表述为报告显示基础识别可用而推理塌缩,少示例支持识别适应但不支持推理打通,可能的原因是空间符号依赖未被当前视觉语义训练覆盖,待验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



