英文题目:Accessible Musical ALife Through LLM Co-Creation.

会议身份:conference:nime:2026:conference-paper-id:nime2026_170

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#开源工具 #提示学习 #检索增强 #音乐生成

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Michael Clemens:机构信息未能从会议 PDF 纯文本可靠映射
  • Piotr Walas:机构信息未能从会议 PDF 纯文本可靠映射
  • Victor Shepardson:机构信息未能从会议 PDF 纯文本可靠映射
  • Jack Armitage:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理从自然语言行为与音乐意图描述到可发声人工生命模拟的映射,输入为物种行为与声音意图语句,输出为可执行的Taichi粒子核函数加开放声音控制输出与SuperCollider伴随补丁,难点在于大模型对低资源领域专用语言缺乏数据且GPU内核类型约束极严。首先分解器将描述拆为物种、状态变量与原子行为专家需求,其输出进入上下文选择器按需挑选3至5个领域模块。随后专家合成器在类型规则约束下逐个生成GPU核函数,其多个专家函数再交由模板组合器用Jinja2组装为完整可运行草图并按音乐关键词触发OSC平滑映射。与直接堆放完整代码库文档的做法不同,该管线强调结构化分解与按需检索而非上下文量,具有冷启动出首版可改草图的实际意义。在8提示词三条件对比评测下,Sonnet 4.5管线条件的执行通过率指标为6/8,高于零样本基线条件的执行通过率指标的0/8。该结论适用边界仅限语法与短时可执行性,行为保真度与音乐效用尚未验证,且本地小模型受限于内核类型约束仍普遍失败。原文披露的推理开销包括重复调用商业托管模型的多次推理与GPU执行Taichi模拟的计算量,单次草图生成尚属适度但多模型多条件迭代评测会累积可观能量消耗。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,先保留哪些关键信息?

本文的输入是一句自然语言行为描述,例如 3 种粒子聚群并用不同音色发声。目标是输出可直接运行的图形处理器加速粒子仿真草图,并附带声音输出。读者需要先保留 3 个关键信息。第一,底层仿真基于托尔韦拉与太极框架,要求核函数与并行数据结构正确,否则连第一帧画面都出不来。第二,声音不是事后贴上去的,系统在检测到发声、声音、节奏、音乐等音乐关键词后会生成开放声音控制映射与超级对撞机参考补丁。第三,评价只看能否无错运行 12 秒,不判断行为像不像描述,也不判断好不好听。

按学习依赖展开,本文先讲音乐人工生命任务与已有可及性路线,再讲 4 阶段管线全景,然后拆开每个组件的计算,最后讲实验条件、主结果、失败条件与复现边界。教学例子在下文会明确标为例子,不把例子中的具体颜色或音色当成普适结论。资源状态方面,证据中唯一给出可用性声明的是金贾模板文档链接,本次校验显示可用,可以写当前可用;论文声称的代码与评估脚本仓库地址在本次证据中没有给出可用性校验,因此正文不写其当前可达,只转述论文声称已公开。

人工生命 × 图形处理器加速粒子仿真: 人工生命负责给出行为隐喻与涌现来源,即大量简单智能体按局部规则交互产生整体运动;图形处理器加速粒子仿真负责把这种大规模并行更新真正算出来,要求核函数编译与并行数据布局正确。二者搭配的原因是音乐人想要的是可演奏的生态而不是一条控制曲线,组合意义在于把生态想法变成实时可视可听的粒子系统,但也引入了音乐人不熟悉的核编程门槛。

人工生命这个词对研究生容易望文生义,这里先用白话固定下来。人工生命指在非生物媒介中合成类似生命的过程,音乐语境下就是养一群按局部规则运动的智能体。图形处理器加速粒子仿真指把成千上万粒子的位置与速度更新放在图形处理器上并行计算。白话理解是前者管想法,后者管算力。论文要解决的矛盾是想法很音乐,但算力实现要求内核编译与类型约束,把许多作曲家挡在第一行可运行代码之外。

已有路线解决了什么,还剩什么没解决?

第一条路线是面向音乐人的交互式机器学习与创造性编码。证据提到的可穿戴式交互学习工具把实时机器学习做成音乐人可用的形式,处理、潮汐循环等环境降低了艺术计算门槛,拼写爆发等大语言模型工具进一步用自然语言辅助创意编码。这条路线解决的是通用创意计算的可及性,但没有抽象掉图形处理器框架特有的核编译与并行数据布局。

第二条路线是领域专用语言与音频编程的特殊困难。证据明确列出超级对撞机、丘克、福斯特、声音合成语言等音乐领域专用语言,并指出大语言模型在这些低资源语言上的训练数据远少于通用语言。图形处理器框架太极加剧了困难,张等人对音频编程代码生成的研究也被引用为结构化方法更可靠的旁证。这条路线说明文档堆量不等于可用,通用代码能力不能直接迁移到专用框架。

第 3 条路线是人工生命与音乐的交叉。证据提到卢卡斯等人在新音乐界面会议上展示的 3 维群振子交互式奏鸣,把群体动力学当作实时声音源。本文沿同一输入输出关系走,即群体运动同时驱动视觉与声音,但监督与运行阶段不同。本文不是手写一个固定群振子模型,而是用大语言模型把自然语言意图翻译成可执行的图形处理器代码。可能的缓解方向在文中只作为文献引用出现,包括类型约束解码、监视器引导解码与在精选领域专用语言语料上做低秩适配,本文没有实现这些方向,不能把它们当成本文的贡献。

论文到底要回答哪个可验证问题?

论文把大问题收敛为一个可验证的工程问题。在不做模型专用调优的前提下,能否用结构化上下文工程让前沿模型稳定生成符合太极约束的可执行粒子仿真,并顺带生成可用的声音映射。验证口径被刻意收窄为二值通过或失败,即能否无错执行 12 秒。这个口径只检查语法与运行时正确,不检查行为保真度与音乐效用,作者明确把后两者的用户研究列为未来工作。

难度被分成四档,每档 2 个提示,共 8 个提示。第一档是单粒子物理,第二档是成对交互,第三档是多物种行为,第四档是复杂多组件系统,每个提示都包含音乐与开放声音控制意图。样本量很小,作者明确说明结果只能展示条件之间的定性差异,不能当作性能断言。初学者容易误读通过率为质量分,复述时必须固定为可运行率。另一个常见误解是把本地小模型失败归因于模型太小,原文证据更强调管线架构是否提供了约束,前沿模型也只有在管线约束下才成功。

四阶段管线如何从一句话走到可运行草图?

管线全景可以沿一个样本走完。输入是 3 种粒子聚群并用不同音色发声这类描述。第一阶段是分解,大语言模型把描述拆成原子行为组件,识别物种、状态变量与音乐意图,例子中得到分离、内聚、对齐、游荡 4 类专家类型。第二阶段是知识选择,第二次大语言模型调用从领域知识库中挑选通常 3 到 5 个相关模块,例子中选中聚群与开放声音控制模块,舍去无关的群集模块。

第三阶段是专家合成,每个组件在所选上下文与类型规则约束下单独合成为一个图形处理器核函数。第 4 阶段是组装,用金贾模板把专家函数拼成完整可执行草图,并按需生成开放声音控制输出与超级对撞机伴随脚本。

下图是理解全景的关键,它把上述输入到输出画成从左到右的 5 个方框,方框之间用双箭头连接,初学者应先看主路径再看分支取舍。

看图路径: 1. 先从左到右沿双箭头走完系统输入到第四阶段的主路径;2. 再看第一阶段中 flocking 如何展开为对齐、内聚与分离三个子行为;3. 最后对比第二阶段中被选中与被划叉舍去的知识模块,理解按需选择含义

原论文 Figure 2:System pipeline. A natural language description is decomposed into atomic behavioral components,…

论文图 2。原论文 Figure 2:“System pipeline. A natural language description is decomposed into atomic behavioral components, enriched with dynamically-selected domain context, synthesized as individual GPU…”。

结合像素继续核对,系统输入框引用了 3 种物种聚群并用不同音色发声的英文原句。第一阶段框内把群集行为展开为对齐、内聚与分离 3 个子项,箭头呈扇形散开。第二阶段框内并排画出两个文档图标,一个被虚线选中,另一个被红叉舍去,直观表达动态选择而非全量灌入。第三阶段框内列出 4 个以专家结尾的函数名,第 4 阶段框内并排给出太极程序文件与超级对撞机脚本文件图标。整图的教学价值在于它同时回答了分解粒度、选择动作与组装产物,缺少其中任何一段都无法解释为何全文档 p 档无效而精选上下文有效。

分解与知识选择具体做什么计算?

分解不是简单的关键词提取。它的计算目标是把一段行为描述变成可独立合成的原子单元集合,并显式标出物种数量、每个物种的状态变量与音乐意图。例子中 3 种物种的设定决定了后文需要 3 个独立开放声音控制通道,每个通道对应一个物种。分解的输出直接决定第三阶段要合成几个专家函数,分解错了后文无法补救。

知识选择相当于 1 次轻量检索。它的输入是分解结果,输出是 3 到 5 个领域知识模块。原文强调选择性上下文优于 1 次性给出全部模块,理由是无关接口会引入噪声而非信息。这个判断有对照支持,即全文档 p 档条件相对零样本没有可测提升。初学者应把选择理解为降噪操作,而不是知识越多越好。

上下文工程 × 领域知识模块: 上下文工程负责决定给大语言模型看什么、按什么顺序看,先分解再按需挑选;领域知识模块负责把托尔韦拉与太极等框架的正确用法切成可复用的小文档块,通常 1 次只选 3 到 5 块。搭配理由是全文档 p 档会引入无关接口噪声,而精准小上下文能约束生成,组合意义是让每个合成步骤只受相关约束,从而减少虚构接口与核语法违规。

需要补一个缺项说明。原文没有报告分解与选择所用模型的具体温度、采样次数、提示词全文与模块库总规模,也没有报告选择准确率本身。因此不能从最终通过率反推某次选择有多准,只能说端到端管线在给定选择机制下达到了报告的通过率。

专家合成与模板组装如何保证能跑起来?

专家合成的输入是单个原子行为加所选上下文与类型规则,输出是一个图形处理器核函数。文中把这些函数称为专家,灵感来自专家乘积 formulation,含义是最终行为来自多个函数组合。约束是关键,每个函数合成时都被限制只能使用框架允许的写法。例如本地模型常犯的错误是在核内写标准随机函数,而框架要求用特定的图形处理器内禀函数。管线通过精选上下文与类型规则把这类错误压下去,但原文没有给出约束解码的具体实现细节,不能复述为实现了类型约束解码。

组装阶段用金贾模板把专家函数拼成完整草图。模板负责补齐主循环、粒子数据结构、扩散痕迹绘制与输出脚手架。声音部分由专用模块负责,按物种选择位置、速度、密度、分离度等指标,并生成平滑核以保证实时控制稳定。参考映射把位置指数映射到 80 到 3000 赫兹,速度映射到幅度,密度映射到滤波截止。因为开放声音控制与宿主无关,任何能接收该协议的环境都能消费这些流,超级对撞机补丁只是参考实现。

专家函数 × 金贾模板组装: 专家函数负责把一个原子行为写成一个独立的图形处理器核函数,例如分离、内聚、对齐、游荡各写一个;金贾模板组装负责把这些分散函数拼成完整可执行草图,并接上主循环与输出脚手架。搭配理由是分而治之降低 1 次生成的复杂度,组合意义是最终行为来自多个专家函数的叠加,行为涌现于组合而非单个大函数,模板保证了拼装过程可重复。

下例是全文唯一的端到端实例,应明确标为例子。系统被提示生成 3 种聚群粒子并用不同音色发声,分解得到 4 类专家,合成后组成完整草图,经由 3 个独立通道输出。路由到超级对撞机侧时配了 3 个合成器定义,分别用锯齿波、频率调制与脉冲振荡,把位置映射到音高、速度映射到幅度。

开放声音控制 × 超级对撞机伴随补丁: 开放声音控制负责以与宿主无关的方式把仿真量实时发送出去,文中按物种选择位置、速度、密度、分离度等指标并加平滑核;超级对撞机伴随补丁负责提供一个可直接发声的参考映射,把位置指数映射到 80 到 3000 赫兹音高、速度映射到幅度、密度映射到滤波截止。搭配理由是视觉仿真需要一个稳定可听的出口,组合意义是每个物种的领头粒子流驱动一个独立合成器,形成三声部随空间运动演化的织体。

下图是该例子的运行输出,阅读时先确认对象再谈效果,避免把颜色偏好当成结论。

看图路径: 1. 先数出黑色背景上三种主色点与拖尾:紫色、青色与橙色各为一个物种;2. 再沿每簇拖尾的方向观察运动的连续性,确认扩散痕迹是轨迹而非静态噪点;3. 最后把亮点密度与交叉聚集区对应到文中领头粒子与多通道输出的说法

原论文 Figure 1:Output of the illustrative example. Three species of flocking particles with diffusion trails.

论文图 1。原论文 Figure 1:“Output of the illustrative example. Three species of flocking particles with diffusion trails.”。

像素显示黑色背景上有大量带拖尾的亮点,紫色、青色与橙色 3 组交织,每组既有离散亮点也有沿运动方向拉长的扩散痕迹。画面中部较空,四周交叉聚集区较多,符合多物种聚群加游荡的视觉预期。图注明确说明每个物种的领头粒子经由开放声音控制向专用合成器发送位置与速度数据,形成三声部随空间运动演化的织体。因此该图只能证明管线能产出可视多物种仿真并按设计发送数据,不能证明音高映射好听或行为严格符合提示,行为保真与音乐效用在评价中本来就没有测量。

本研究训练了什么,没有训练什么?

本研究没有训练任何神经网络模型,也没有微调前沿模型或本地模型。训练节在此的等价内容是构造与推理流程的真实计算。实际发生的计算包括 4 次大语言模型调用链,即分解调用、知识选择调用、多个专家函数合成调用与组装调用,以及太极仿真的图形处理器执行与子进程 12 秒试运行。参数冻结与更新问题不适用,因为调用的是商用托管的前沿模型与本地模型,原文未报告温度、采样与重试策略,不能从模型名称推定实现细节。

监督来源也不是人工标注的乐谱或音频,而是领域知识模块提供的正确用法约束与类型规则,加上端到端能否运行的二值信号。检索时机发生在每次合成之前,选择动作针对当前分解结果动态执行。重置时机方面,仿真每次评估都是独立子进程运行,不跨提示累积状态。不能把无训练等同于确定性求解,大语言模型采样与图形处理器执行的随机性依然存在,原文把通过率报告为在特定管线下的观测结果,而非冻结参数下的确定保证。缺项是完整的提示词、模块库清单与金贾模板的具体版本,复现时需要以论文仓库声称为准并固定模型版本才能比较。

测什么,与谁比,条件是否一致?

实验要回答的是结构化管线是否比无辅助生成更能产出可运行代码。比较对象是 3 个条件。条件一是零样本,只给最小框架上下文。条件二是全文档 p 档,把完整代码库文档作为系统上下文。条件三是本文的上下文工程管线。

3 个条件在同一 8 个提示上测试,每个提示都含音乐与开放声音控制意图,难度覆盖单粒子物理到复杂多组件系统。模型覆盖 3 个前沿模型,分别记为索奈特、奥普斯与深度求索,另有本地模型作为定性对照。指标方向是越高越好,但口径只是 12 秒无错执行。

公平条件方面,提示集合与通过标准在条件间一致,样本量小是主要限制。聚合对象是按模型、条件与难度档统计的通过数,每格是 2 个提示中的通过数,总计是 8 个提示中的通过数。需要区分百分点与相对百分比,原文报告的 75%、62% 与 50% 是管线在 8 题中的通过率,不是对基线的相对提升,因为基线本身是零。硬件与成本方面,原文承认开发与评估期间反复调用商用托管模型并执行图形处理器仿真,单次草图生成开销不大,但多模型多条件基准累积的能源消耗不可忽略,具体千瓦时与延迟未测量。

下表把核心可运行性对照收拢为 5 列,先看条件差异再看模型差异。表前问题是同样提示下哪种上下文策略能跑起来,公平条件是同一提示集与同一 12 秒无错标准,指标方向是通过数与通过率越高越好。

条件指标基线本方法比较对象
零样本最小上下文12 秒无错执行通过率,8 个提示0% 执行,全部模型零通过管线 75%索奈特前沿模型
全代码库文档上下文12 秒无错执行通过率,8 个提示0% 执行,全部模型零通过管线 62%奥普斯前沿模型
上下文工程管线12 秒无错执行通过率,8 个提示零样本与全文档 p 档均为 0%管线 50%深度求索前沿模型

表后解释需要同时给出收益与代价。收益是管线把零通过率提升到五至 70%,且跨模型无需模型专用调优。代价一是全文档 p 档没有带来可测改善,说明堆文档可能引入噪声。代价二是该表只反映可运行性,未胜出项是行为是否符合提示与声音是否有用,这两项在所有条件下都未评测。反例是本地模型即使在管线内仍常违反核约束,说明管线不能完全弥补模型对严格类型系统的不熟悉。

主结果支持什么判断,不支持什么?

主结果显示条件差异远大于模型差异。零样本与全文档 p 档在所有模型与难度档上都是零通过,管线在索奈特上 6 过 8,在奥普斯上 5 过 8,在深度求索上 4 过 8。按难度看,管线在索奈特上第一档 2 过 2、第二档 1 过 2、第三档 2 过 2、第四档 1 过 2,其他模型的分布也在每档 1 到 2 之间波动,没有出现某一档系统性全败或全胜。原文用报告口吻写选择性上下文优于全量模块,用支持口吻写结构化方式比给多少文档更重要,这种措辞差异应当保留。

失败模式提供了机制解释。无管线时的主导失败是虚构接口,例如虚构的开放声音控制客户端创建函数,以及图形处理器特定语法违规。本地模型的典型失败是在核内写标准随机函数而非框架内禀函数。管线成功时通常意味着分解正确、选中了聚群与声音模块、每个专家函数遵守类型规则并被模板正确拼装。

不支持的判断同样重要。通过不等于行为正确,更不等于音乐可用。原文明确说明通过标准只检查语法与运行时正确,用户研究是未来工作。因此不能把 75% 复述为四分之三的音乐质量,也不能把末档 1 过 2 推广为复杂系统已解决。总体趋势是管线有效,但不等于每组提示或每一步采样都成立,8 题样本只能支撑定性差异。

拿掉结构化步骤会发生什么,哪些细节只在特定档出现?

论文没有做逐模块剔除的消融表,但 3 个条件的对比起到了失败条件分析的作用。拿掉分解与选择、只留最小上下文会回到零通过。加上全文档 p 档但仍不做分解与选择,依然是零通过。这个结果支持的判断是问题不在文档量,而在上下文结构。可能但待验证的解释是无关接口增加了噪声,这个解释在原文中用了可能引入噪声的措辞,复述时不能写成已证实的因果。

论文特有细节值得展开两类。第一类是难度分级与音乐意图的绑定。每档 2 个提示且都含音乐意图,意味着声音映射不是附加题,而是必考项。虚构接口多出现在声音部分,说明跨视觉与声音的联合生成比纯视觉更脆弱。第二类是知识粒度的选择。通常 3 到 5 个模块的设定意味着检索不宜过宽,例子中选中聚群与声音模块而舍去群集模块,说明相近术语的模块也需要区分。

下表把协议细节收拢为 5 列,帮助复现者核对自己是否测了同一东西。表前问题是结果数字的适用边界是什么,公平条件是同一难度划分与同一声音映射参考,指标方向是先对齐分母再谈分子。

难度提示量通过口径知识量声音参考
T2 成对交互2 个提示,含音乐意图无错执行 12 秒挑选 3 到 5 个模块速度到幅度
T3 多物种行为2 个提示,含音乐意图无错执行 12 秒挑选 3 到 5 个模块密度到滤波截止
T4 复杂多组件2 个提示,含音乐意图无错执行 12 秒挑选 3 到 5 个模块3 通道独立输出

表后解释要指出未胜出项与边界。未胜出项是全文档 p 档,它在所有难度上都没有把零变为一。边界是每档只有 2 题,T2 与 T4 在索奈特上 1 过 2 的差异可能只是抽样波动,不能解读为第二档一定难于第三档。另一边界是声音参考只给出指数映射与平滑核的定性说明,没有给出平滑系数与发送频率,复现声音质感时需要自行固定这些超参数并报告。

哪些结论还不能下,缺了哪项验证?

第一个限制是样本与指标。8 个提示的二值运行检查能证明冷启动是否越过,但不能证明行为保真、音乐可用性、可访问性提升与延迟成本改善。未测量误判率、延迟与成本时,不能承诺这些量得到改善。相关性也不是因果,管线与通过率的相关不能直接写成某一模块的因果贡献,因为没有逐模块剔除。

第二个限制是开放性与能力的张力。前沿模型闭源且商用托管,本地开放权重模型可离线检查但尚不能满足严格核约束。原文把约束解码与领域专用微调列为有希望的方向,但本文没有实现,不能把它们当成已验证的解法。伦理部分说明评估全自动、无人类被试,创意可供性与可访问性的用户研究需经机构伦理审查,复述时应保留这一边界。

第 3 个限制是可重复性细节缺失。模型版本迭代快,提示优化可能迅速过时。原文未报告完整提示词、模块库全文、模板版本、采样参数与硬件预算,重复实验时即使同一管线也可能因模型更新而漂移。论文声称源码与评估脚本已公开,但本次证据未校验该仓库可达,复现前需要先确认链接状态并锁定依赖版本。

要复现这条管线,第一步先固定什么?

先固定任务口径再跑模型。准备 8 个自写提示太容易引入偏差,更稳妥的起点是按原文四档各写 2 个含音乐意图的提示,并把通过标准固定为子进程无错执行 12 秒。先跑零样本与全文档 p 档两个基线,确认在当前模型版本上是否为零或接近零,再跑管线。这个顺序能避免把模型版本红利误当成管线收益。

再固定知识与组装。把领域知识切成小模块,检索时只取 3 到 5 个,避免把整个代码库 1 次性灌入。专家函数要逐个合成,每个函数只做一个原子行为,合成时显式约束随机数、类型与核装饰器等易错点。组装用金贾模板完成,模板版本要锁定,当前可用的是证据中校验过的金贾文档地址。声音侧先用位置到音高、速度到幅度、密度到滤波截止的参考映射跑通 3 通道,再谈音色审美。

最后固定记录方式。按模型、条件与难度档记录每格 2 题中的通过数与总 8 题中的通过数,保留原始日志与失败堆栈,区分虚构接口、核语法违规与声音映射错误。还要补原文未报告的三项验证,一是行为保真的人工核对,二是音乐可用性的小规模用户试用,三是多次采样的波动范围。只有补齐这三项,才能判断管线是真正降低冷启动,还是只提高了可运行率。

何时值得尝试这套做法,何时先别用?

当你的瓶颈是领域专用语言的冷启动时值得尝试。具体信号是能说清想要什么生态行为,但写不出第一版可运行的太极或托尔韦拉草图,或者每次生成都卡在虚构接口与核类型错误上。这时把提示先分解为分离、内聚、对齐、游荡等原子行为,再按需挑选少数模块逐个合成,比堆全文档 p 档更可能先让画面与声音跑起来。跑起来后的迭代仍需要一定编程熟悉度,但改一份可运行草图远比从零写起容易,生成中的小偏差有时反而能带来可用的意外方向。

当目标是精确复刻某种行为或保证演出稳定时先别直接依赖。8 题通过率不能保证你的提示 1 次通过,更不能保证音高映射符合你的作曲意图。涉及开放权重离线部署、严格演出延迟与能源预算的场景,需要另行测量延迟、帧率与成本,并探索约束解码或领域微调等原文未实现的路线。对研究生而言,可复述的方法是分解加精选上下文加分头合成加模板组装,可核对的证据是 3 条件在同一 8 题上的可运行率差异,不可夸大的部分是行为质量与音乐价值,这些在原文中明确列为未来工作。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 nime-2026 论文汇总