英文题目:Novice Users’ Evaluation of Two Multi-track Music Machines for AI-Assisted Music Composition: Usability, User Experience and Acceptance.

会议身份:conference:nime:2026:conference-paper-id:nime2026_128

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #用户研究 #音乐 #符号音乐生成

评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Renaud Bougueng Tchemeube:机构信息未能从会议 PDF 纯文本可靠映射
  • Jeff Ens:机构信息未能从会议 PDF 纯文本可靠映射
  • Keon Ju Maverick Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Philippe Pasquier:机构信息未能从会议 PDF 纯文本可靠映射
  • Jean-Baptiste Rolland:机构信息未能从会议 PDF 纯文本可靠映射
  • Yvan Grabit:机构信息未能从会议 PDF 纯文本可靠映射
  • Maryam Safi:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究处理新手围绕给定16小节节奏轨与指定风格完成多轨编配的任务,输入为已有MIDI上下文、选区小节与风格参数,输出为完整多轨符号音乐,难点在于乐理不足者难以表达意图且难以判断生成质量。方法链由三步构成:首先用户在MMM-Cubase v2嵌入式插件或Calliope在线独立网页中设置全局与局部参数并发起乐谱修复生成,其次在工作区试听并迭代筛选生成结果,该试听筛选输出直接作为后续问卷评价的对象,最后经由系统可用性量表、创造力支持指数、可控性量表、技术接受模型与主题分析完成混合评估。与既往单专家或四声部钢琴研究相比,关键差异在于同时比较两种部署并区分早期新手与熟练新手,从而分离界面复杂度与经验的影响。在新手多轨编配任务评测下,Calliope的感知易用性分数为3.91 ± 0.62,高于MMM-Cubase v2的感知易用性分数3.64 ± 0.84。未来使用意愿上MMM-Cubase v2组30/39人表示会继续使用而Calliope组43/59人表示会继续使用,可发布评价则分别为59%与44.1%同意。上述结论适用边界受限于短时编配任务与北美学生为主的98人新手样本,尚未验证其向原创长曲、现场演出或专家持续使用的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么:新手作曲研究要解决什么采用问题?

这篇论文的输入是两套已经能运行的多轨作曲辅助系统,目标是回答新手是否觉得它们可用、体验如何、以后是否愿意用。研究对象不是提出新生成模型,而是评估已有多轨音乐机器在两种部署形态下的采用情况。第一套是嵌入桌面宿主的 MMM-Cubase v2,它作为插件坐在 Cubase 工程里,用户在原有轨道旁边直接选小节并发起生成。第二套是网页端独立运行的 Calliope,用户在浏览器里管理、查看与播放 MIDI 文件,再选小节并发起生成。

两套系统底层都用同一个多轨音乐机器模型做符号化乐谱填充,也就是根据已有音乐上下文把空缺小节补出来。论文要保留的关键信息是任务、部署差异、用户分层与 3 类因变量。任务固定为编配,也就是围绕一条 16 小节节奏轨道补充多乐器轨道。部署差异是嵌入式桌面与网页独立。用户分为早期新手与熟练新手。

测量覆盖可用性、用户体验与技术接受度。输出是给研究生可复述的方法链与可核对的数字条件,而不是营销式好坏判断。理解这点后,后面所有量表与访谈才有位置,新手门槛降低与控制不足的矛盾也才成立。

同类研究比较过什么:为什么还要做新手多轨评估?

同输入同目标的对照首先是 Magenta Studio 研究,它把深度生成接到 Ableton Live,用 89 名早期采用者的远程问卷报告易用性与生产力感受,论文报告其中多数人觉得输出易用、多数人觉得更有创造力与生产力。这条路线说明把生成做成宿主插件是可行路径,但样本混杂音乐人与机器学习爱好者,且任务偏向续写与鼓组生成,没有按新手程度分层。

另一条同目标对照是 Louie 等人的 Cococo 与 Bachdoodle 比较,21 名新手被试内比较语义滑杆与语音通道等操控方式,报告显示语义相关的操控提升作者感、自我效能与协作感。这条路线说明操控语义越贴近作曲语言,可用性与拥有感越好,但它只做独立网页形态与短片段,没有覆盖多轨配器与曲风泛化。第 3 个直接前序是 MMM-Cubase v1 的 18 名专家评估,报告显示可用性与接受度为正,但专家感到可控性与可预测性受限。

本研究与它的运行阶段相同,都是远程无主持的真实作曲加问卷,但把人群换成 98 名新手,把系统换成参数更丰富的 v2 与网页版 Calliope,把任务固定为多轨编配。因此它的增量不是模型更强,而是补上新手分层、部署形态与多轨曲风条件下的评估缺口。类别差异不能当胜负,例如专家觉得有作者感不等于新手也会有,因为两组起点与期望不同。

研究问题如何拆成可测量的三件事?

论文提出 3 个研究问题,分别对应可用、体验与接受。第一个问题问基于多轨音乐机器的系统对新手做多轨创作是否可用,操作化为系统可用性量表、创造力支持指数的探索与沉浸等因子、以及可控性问卷的易控程度与还想要更多控制的程度。第二个问题问新手体验如何,包括自主感、灵活性、可达性与作者感,操作化为信任、感知质量、作者身份与灵活性的开放题,再加收益与不便的反思题,用主题分析归纳。

第 3 个问题问新手接受度如何,操作化为技术接受模型的感知易用性、感知有用性与未来使用意愿,再加是否可直接发布的判断。一个样本走完全程有助于理解测量依赖关系。假设 1 名爱好者拿到一条 16 小节流行节奏轨,他先选曲风为流行,再选若干空小节,设定密度与重复度后点生成,试听后保留或重生成,最后导出音频或 MIDI。可用性量表记录他觉得好不好操作,开放题记录他信不信任生成、觉得自己算不算作者,接受问卷记录他以后还想不想用。

只有沿这条输入到输出的链路,才能明白为什么易用分数高但作者感仍然低,因为点击生成很顺,但音乐决策主要由模型完成。

方法全景:一次编配任务如何串起系统与问卷?

整体采用并行汇聚的混合方法,定量与定性分开收集再互相印证。流程是先招募并分组,再做编配任务,再填退出问卷并上传作品。任务侧给被试现成曲风 MIDI 文件,可选流行、摇滚、电子与嘻哈,要求围绕 16 小节节奏轨补充配器。系统侧提供全局与颗粒两层参数,用户请求加已有上下文共同决定填充结果。测量侧先做可用性三件套,再做体验开放题与接受问卷。

所有表单与素材放在伴随网页,当前可用状态经核验为可访问,地址为元创作项目页。下面的界面图帮助建立嵌入式部署的心智模型,它显示生成面板如何与宿主轨道并置,这对理解熟练新手为何觉得熟悉很关键。

为理解嵌入式部署的操作上下文,先看插件面板与宿主轨道如何并排工作,再把参数分区与生成闭环对应到任务动作。

看图路径: 1. 先看左侧宿主工程区的多条彩色轨道与小节网格,确认生成是嵌入在编配流程中;2. 再看右侧生成面板的全局参数区与高级参数区如何分层;3. 核对底部替换或叠加选项与生成按钮,理解一次请求的操作闭环

原论文 Figure 1:MMM-Cubase v2 Plugin in Cubase

论文图 1。原论文 Figure 1:“MMM-Cubase v2 Plugin in Cubase”。

从像素可见,左侧是宿主工程的多轨网格,不同颜色区分鼓、贝斯与合成器轨道,右侧是深色生成面板,上方为曲风与织体类型,下方为音符时值、密度、重复度与怪异度,再下方为替换或叠加选项与生成按钮。这说明 1 次操作是先在左侧选中空小节,再到右侧设定要求,最后点生成回填到工程。教学例子是若选中 4 小节空弦乐轨并设密度为高,系统会结合已有鼓贝斯上下文生成更密的填充。对新手而言,这种不离开宿主的流程减少切换成本,但宿主本身的大量轨道与菜单也可能带来压迫感,这正是后文早期新手觉得复杂的原因。

两个系统各管什么:参数与工作流有何不同?

MMM-Cubase v2 的目标是把可控生成嵌入音乐人常用工作环境。它的白话含义是宿主里的生成助手。英文名为 MMM-Cubase v2。参数包括曲风、织体模式、时值选择、密度、重复度、怪异度,以及替换或叠加开关。怪异度的白话含义是生成偏离常规的程度,数值越大越出格,默认居中。

Calliope 的目标是让无代码用户也能在网页上用同一类模型。它的白话含义是浏览器里的多轨生成工作台。功能包括 MIDI 文件管理、轨道可视化与浏览器内播放,外加全局与分轨参数,以及按步进小节数、按步进轨道数与复音上限等采样控制。两者分工不同,前者靠宿主提供录音混音与精细编辑,后者靠简化聚焦界面降低学习曲线。搭配理由是同一模型配两种部署,可分离模型能力与界面负担的影响。

新增作用是能比较熟悉宿主的人与零起点的人在同一任务下的不同门槛。

乐谱修复 × 多轨音乐机器: 乐谱修复指把已有乐谱中空缺小节按上下文自动填补,多轨音乐机器指用 GPT 式变换器生成符号化多声部音乐的模型;前者负责定义任务为给定上下文加参数去补空,后者负责提供能同时处理多乐器轨道的生成能力,二者搭配使编配变成选空小节加调参数再生成,新增作用是把作曲从逐音符写变成提要求加筛选。

全局参数 × 局部填充控制: 全局参数负责设定整次生成的风格框架如曲风与织体类型,局部填充控制负责限定具体补哪里与补多密如音符时值、密度与重复度;前者管方向,后者管落点,二者搭配的理由是只给风格会太随机、只给局部会无风格,组合后用户先定曲风再选小节做精细填充。

Calliope 的像素证据本次非常有限,只能做归因明确的解读,不猜测未见面板的颜色与布局细节。

看图路径: 1. 确认本次像素仅显示一条深色播放控制条与中央红色播放键,不做超出像素的界面推断;2. 把该局部与正文描述的浏览器端浏览、显示与播放 MIDI 功能对应起来

原论文 Figure 2:Calliope \\[37\\]

论文图 2。原论文 Figure 2:“Calliope [37]”。

从实际收到的像素看,该图仅截取到一条深色横条上的播放控制区,中央红色圆形播放键清晰可辨,两侧为若干浅色小图标。由于像素未展示完整的轨道列表与参数面板,正文只能引用论文文字说明其具备浏览、显示与播放 MIDI 文件的能力,以及支持分小节引导生成。这提醒复述时不要把该截图当作 Calliope 全貌,它只证明浏览器端试听入口的存在,而完整的参数与可视化需回到原文描述与伴随网页核对。

本研究训练了什么:没有训练时真实计算是什么?

本研究没有训练任何新模型,也没有微调多轨音乐机器的权重,必须明确说明这一缺项,不能从模型名称推定训练实现。真实计算是调用已有生成模型做推理式填充。输入是用户选定的空小节位置、全局曲风与织体设定、颗粒密度与重复度等参数,加上工程中已有轨道的符号化上下文。模型执行乐谱修复式补全,输出多轨 MIDI 音符,再由宿主或浏览器渲染试听。

论文未报告梯度路径、参数冻结细节、优化器、训练数据划分与超参数,因为这些属于模型前序工作而非本次评估。评估侧的计算是问卷计分与主题编码。系统可用性量表按 0 到 100 计分,低于 50 不可接受,50 到 70 边缘,高于 70 可接受。创造力支持指数本次调整为每因子一题的 5 点量表,并去掉协作因子,共 5 题。技术接受问卷为 12 题 5 点量表,6 题测感知易用性,6 题测感知有用性,分别取均值。

定性侧由 2 名编码者独立编码再合并主题。因此复现时不需要准备 GPU 训练预算,需要准备的是任务包、问卷、编码手册与作品收集流程,不能把无训练等同于输出确定,因为相同参数多次生成仍可能因采样随机而不同。

实验条件:谁参加、做什么、如何分组与补偿?

招募从 2024 年 3 月 15 日到 7 月 19 日分批并行进行,251 人报名,98 人至少完成一个系统。MMM-Cubase v2 组 39 人,其中早期新手 16 人,熟练新手 23 人,男性 29 人,女性 9 人,1 人不愿透露,年龄以 20 到 29 岁为主共 28 人,北美 31 人,欧洲 6 人,大洋洲与非洲各 1 人,35 人无 Cubase 经验,34 人无音乐人工智能工具经验,平均音乐经验 4.88 分满分 10 分。Calliope 组 59 人,其中早期新手 46 人,熟练新手 13 人,女性 37 人,男性 19 人,非二元 3 人,年龄 20 到 29 岁共 52 人,30 人对宿主不熟悉,55 人无音乐人工智能工具经验,35 人对 MIDI 轨道不熟悉,平均音乐经验 4.3 分。单人单系统耗时约 2 到 3 小时,取决于对宿主与研究流程的熟悉度。

补偿为 Cubase Element、Dorico Element 或 Wavelab Element 许可证三选一,声音设计课学生仅给课程加分。任务统一为编配,交付物为工程加音频母带或 MIDI 文件,匿名选段放在伴随网页。分组依据自我报告的作曲画像,下图是理解分组逻辑的关键。

为核对分组口径,先看经验轴与两组四型的划分,再把每型的定义句与后文差异解释对应起来。

看图路径: 1. 先看横轴音乐经验从少到多,纵向区分两大新手组;2. 再核对第一组含早期探索者与爱好者,第二组含初学者与有经验者的四格划分

原论文 Figure 3:Novice User Profiles

论文图 3。原论文 Figure 3:“Novice User Profiles”。

从像素可见,横轴为音乐经验从少到多,上半为第一组早期新手,下含早期探索者与爱好者,下半为第二组熟练新手,下含初学者与有经验者。定义句分别是总好奇试新工具、想写但没真正试过、写过但没完成整轨、至少完成一首整轨。有经验者更可能接触过宿主但不如专家熟练。这种划分使早期组更偏向好奇与向往,熟练组更偏向发展与达成,后文早期新手在嵌入式宿主上分数更低、熟练组两系统持平的模式才可解释。

系统可用性量表 × 创造力支持指数: 系统可用性量表负责回答系统好不好用,分值越高越易学易操作,创造力支持指数负责回答系统支不支持创作,覆盖探索、沉浸、愉悦与表达等因子;前者管操作门槛,后者管创作体验,二者搭配才能区分好用但不好玩与好玩但难用的情况,组合意义是同时检验工具效率与创作价值。

早期新手 × 熟练新手: 早期新手指好奇但几乎没动手写过完整曲子的人,包括早期探索者与爱好者,熟练新手指已写过片段或完整曲子、对宿主软件有接触的人,包括初学者与有经验者;前者代表零起点对易用性更敏感,后者代表有流程经验对控制深度更敏感,二者搭配使研究能检验部署形态是否对不同起点产生不同影响。

测量工具按学习依赖排列为可用性三件套、体验开放题与接受问卷,协议为远程无主持定量可用性测试加主题分析,伦理经西蒙弗雷泽大学伦理委员会批准,申请号 30000223。经费来自加拿大社会科学与人文研究理事会与自然科学与工程研究理事会,合作方为 Steinberg 媒体技术公司。

主结果:可用与接受是否成立,体验卡在哪里?

先按问题组织证据。测什么、与谁比、条件是否一致、指标方向、关键数字与限制都要交代。任务条件一致,都是同一编配任务与同一模型家族,差异在部署与界面。指标方向是可用性越高越好,沉浸与愉悦越高越好,易控越高越好但还想要更多控制越高则代表缺口越大,未来使用比例越高越好。下面的第一张数字表聚焦可用性总分与分组差异,它有完整逐字证据支撑,适合核对。

比较问题是嵌入式宿主与网页独立哪种对新手更可用,公平条件是同一编配任务与同类生成能力,指标方向是系统可用性量表越高越好,满分 100 分且 70 分以上为可接受。

条件指标MMM-C v2Calliope比较对象
全部新手编配任务可用性总分满分 100 分72 分76.27 分两系统总体
早期新手分组可用性分组分68.13 分76.87 分早期组内两系统差异显著
熟练新手分组可用性分组分74.7 分74.15 分熟练组内两系统无差异

表后解释需同时讲收益与代价。总体两系统都达到可接受线,Calliope 略高。分组后差异只出现在早期新手,Calliope 显著高于嵌入式版本,效应量中等,而熟练组几乎持平。这支持网页简化界面降低零起点门槛的判断,但代价是不能推广为网页全面胜出,因为熟练组反例显示熟悉宿主的人不受部署拖累。未胜出项是 MMM-Cubase v2 在早期组落败,质性证据显示 25.6% 的编码提到被 Cubase 功能数量与安装问题压倒,有人只敢碰任务要求的部分。像素层面的柱状图进一步确认误差线在早期组更长,说明零起点内部差异大。

技术接受模型 × 未来使用意愿: 技术接受模型负责用感知易用性与感知有用性解释接受度,未来使用意愿负责直接问用户以后是否还想用;前者管原因分解,后者管结果表态,二者搭配可检验好用是否等于想继续用,组合意义是把量表分数与开放回答的继续使用理由互相印证。

为核对分组差异的形态,先看两组柱高与误差线,再把显著标记的位置与文字统计对应起来。

看图路径: 1. 先看横轴左侧早期新手与右侧熟练新手两组,纵轴为可用性分数;2. 再比较每组内蓝色与红色柱子的高低与误差线长度;3. 确认左侧组上方星号标记的组间差异提示,不把末端数值推广为全程结论

原论文 Figure 4:SUS Results per User Profile across CAC Systems

论文图 4。原论文 Figure 4:“SUS Results per User Profile across CAC Systems”。

从像素可见,横轴左为早期新手右为熟练新手,纵轴为可用性分数,蓝色为 MMM-Cubase v2,红色为 Calliope。左侧红色柱明显高于蓝色柱且上方有星号,蓝色柱误差线更长,右侧两柱几乎等高。这与文字报告的早期组 76.87 对 68.13 显著、熟练组 74.15 对 74.7 不显著一致。它不支持把总体 76.27 对 72 的差距直接读成全面胜出,因为差异主要由早期组驱动。

体验侧的主题显示信任集中于创意启动,作者感普遍偏低,灵活性被评为有但不够深,挑战集中于操控深度与重复生成。接受侧两系统未来使用意愿分别为 76.9% 与 72.9%,但可直接发布认同仅为 59% 与 44.1%,说明想继续用不等于认为已可发布。重提结果时新增对照是专家前序报告高作者感,而新手报告系统拿走主要创意,这构成人群反例,提示作者感取决于用户能贡献多少决策而非模型质量本身。

反证与细节:控制、沉浸与创意支持的代价是什么?

除核心可用性总分,还需展开两类论文特有细节,即可控性双维与创造力支持因子,否则无法理解高接受为何伴随高抱怨。比较问题是好控是否等于够用,公平条件仍是同一任务,指标方向是易控越高越好,还想要更多控制越高代表缺口越大,沉浸与表达越高代表创作支持越好。

条件指标MMM-C v2Calliope比较对象
全部新手易控程度满分 10 分6.13 分6.46 分两系统易控
全部新手还想要更多控制满分 10 分7.72 分7.76 分两系统缺口
全部新手沉浸因子满分 5 分未报告高值3.97 分Calliope 更沉浸
全部新手未来使用意愿76.9%72.9%两系统均超七成
全部新手可直接发布认同59%44.1%发布门槛更高

表后解释要指出具体代价。两系统易控都在 6 分以上,说明按节奏与密度发请求不难,但还想要更多控制都接近 7.8 分,说明易上手不等于够精细。质性要求包括调性、拍号、速度、曲风混合、主副旋律区分、精确复音、音高区间、休止量、文本提示,以及和弦与节奏型、曲式结构控制。有用户说有很多灵活性但缺深度,有用户说想要可选的高级面板而不要堆在主窗口。创造力支持上 Calliope 在沉浸显著高于嵌入式版本,愉悦两系统都是高点,表达都是低点,结果值回票价居中。

这支持网页聚焦流程更易进入心流,但代价是表达受限。未胜出项是表达因子两系统都弱,未评测边界是 4 声部钢琴之外的多轨泛化与长期学习效应。失败条件包括 Calliope 在低端机上的卡顿与播放延迟,以及嵌入式版本的安装与学习负担。

限制:哪些结论不能推广,哪些证据缺失?

论文明确报告 3 类限制。第一是人群代表性,样本多为北美设计学生,不能代表全部新手总体,性别与年龄在两系统组间也不均衡,Calliope 组女性与 20 到 29 岁高度集中,MMM-Cubase v2 组男性占多数。第二是方法度量,作者承认可用性、体验与接受的组合不能给出单一采纳分数,且本次创造力支持指数为调整版,每因子一题并去掉协作,不能与标准版直接等同。

第三是伦理与社会考量只做了简要讨论,包括训练数据不透明带来的归属与版权疑虑、过度依赖导致技能学习减少与音乐多样性下降的担忧。缺失证据不是技术错误,但复述必须用支持与可能区分措辞。数据显示新手觉得高效与新颖,这支持降低门槛的判断。用户说用完觉得没学到作曲、担心变懒与失去创造力,这支持过度依赖可能损害自我效能的解释,但属于有限解释而非因果证明,因为未测量长期技能变化与误判率。

同样,未测量延迟分布、推理成本与输出帧率,不能承诺这些量得到改善。训练资源、推理开销与实际延迟要分开讨论,总体趋势不等于每组每步都成立,例如沉浸优势只在总体显著,不能说每个新手都更沉浸。

复现先做什么:材料、参数与核对清单是什么?

复现这项评估先准备任务包而非训练模型。需要从伴随网页获取表单、曲风 MIDI 文件、16 小节节奏轨模板与问卷,当前可用状态为可访问。系统侧需要可运行的 MMM-Cubase v2 插件加 Cubase 宿主,或可访问的 Calliope 网页与 MIDI-GPT 调用能力,注意区分代码开源、权重下载与系统可运行三件事,论文给出 Calliope 基于 Apache 2.0 用于研究,但本次证据未给出权重直链,不能默认下载即运行。

关键参数要保留原文写法,包括曲风多选、织体自动与复音单音鼓组、时值全选与全音符到 32 分音符、密度与重复度的自动低中高、怪异度 1 到 5 默认 3、替换或叠加开关。流程按招募分组、任务指导、作品上传、退出问卷执行,问卷保留系统可用性量表、调整版创造力支持 5 题、可控性两题 10 点量表、技术接受 12 题 5 点量表与信任作者灵活性开放题。聚合口径按均值与标准差报告分组,组间用 t 检验并报告效应量。

核对清单包括数据集与曲风是否一致、模型是否为同一家族、阶段是否为编配而非变奏或原创、指标单位是 100 分制还是 10 分制或 5 点量表、聚合对象是全部还是分组。百分点与相对百分比不同,不同指标差值不能混入模型列,自动指标不能当人评。若伴随页本次不可达,应写本次未能确认可达,而不是写已公开或已下线。

收束:何时值得尝试新手作曲辅助,还需补什么验证?

当目标是让零起点快速做出可听小样、激发动机与提供结构化流程时,这类工具值得尝试。论文显示两系统都是可靠的创意启动器,支持发散思维,提高流程效率,并让想写歌但缺乐理的人完成第一首。Calliope 更适合纯新手快速进入,嵌入式插件更适合已接触宿主的熟练新手继续深耕。当目标是精细控制和弦、节奏型与曲式,或要求明确作者归属与版权链路时,现在还不值得单独依赖,因为深度控制与模型透明度仍是未解问题。

常见误解是把提示词界面当长期最优,论文讨论明确提醒它难以支撑稳健可扩展的交互,应把人的角色从设参加筛选转向更具表达性的协同分工。还需补的验证包括长期技能学习测量、不同曲风与多轨编制的泛化、延迟与成本预算、以及训练数据披露后的归属判断。若你是研究生,可复述的方法句是 98 名新手分两组做同一 16 小节编配,用 3 套问卷加主题分析比较嵌入式与网页部署,结论是都可用且都想继续用,但都想要更深控制且作者感低。

这个句子保留了任务、分组、方法与代价,可直接用于开题对照。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 33 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 nime-2026 论文汇总