英文题目:SteerMusic: Enhanced Musical Consistency for Zero-shot Text-Guided and Personalized Music Editing

会议身份:conference:aaai:2026:conference-paper-id:37181

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#扩散模型 #零样本 #音乐 #音乐生成

评分:8.0/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Xinlei Niu:机构信息未能从会议 PDF 纯文本可靠映射
  • Kin Wai Cheuk:机构信息未能从会议 PDF 纯文本可靠映射
  • Jing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Naoki Murata:机构信息未能从会议 PDF 纯文本可靠映射
  • Chieh-Hsin Lai:机构信息未能从会议 PDF 纯文本可靠映射
  • Michele Mancusi:机构信息未能从会议 PDF 纯文本可靠映射
  • Woosung Choi:机构信息未能从会议 PDF 纯文本可靠映射
  • Giorgio Fabbro:机构信息未能从会议 PDF 纯文本可靠映射
  • Wei-Hsiang Liao:机构信息未能从会议 PDF 纯文本可靠映射
  • Charles Patrick Martin:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuki Mitsufuji:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

文本引导音乐编辑输入源音频与源/目标文本提示,输出保留原曲旋律结构而按目标语义改变音色或风格的音频,难点在于前向加噪再去噪的反演路径会引入不可逆旋律失真,且粗粒度文本难以精确描述细粒度目标。SteerMusic先以可微渲染在数据空间直接优化源音频,以源提示与目标提示下去噪分数之差提供编辑方向从而避免反演。SteerMusic+将该框架扩展为个性化编辑,引入在参考音频上微调的个性化扩散模型提供概念方向,并以分布偏移正则与时序对比约束平衡概念保真与内容保留,前一步的数据空间优化输出直接作为后两项约束共同作用的待优化变量。与DDIM、SDEdit、ZETA和MusicMagus等同基座前后向流水线相比,该方法链以分数差分替代反演重建,从机制上解耦内容保持与语义转向,因而能更好地兼顾旋律一致性与编辑保真度。在ZoME-Bench基准零样本编辑任务评测下,SteerMusic的CQT1-PCC为0.480,高于DDIM的0.330。该结论受限于基座生成模型表达力与个性化微调充分性,尚未验证高采样率与强分布外概念下的外推,失败条件集中于微调不足或过拟合导致的概念缺失与结构破坏。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/sony/steermusic — 链接可访问(HTTP 200)
  • 演示资源:https://steermusic.pages.dev/ — 链接可访问(HTTP 200) 预印本/扩展版链接未在会议页展示;会议版来源见页首官方记录与 PDF。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,什么必须保留?

这篇论文研究的是已有音乐的改写。输入是一段源音乐加上一句描述它的源提示,输出是按目标提示改写后的一段新音乐。目标提示通常只改一两个词,例如把钢琴换成吉他,或者把雷鬼换成爵士。评价时有两个硬要求。第一,与改动无关的旋律、速度和结构要留住,不能为了换音色把曲子重写。

第二,与改动有关的乐器、情绪、背景或用户自定义风格要听得出来。初学者容易把这个任务当成文本生成音乐,以为给模型一句话就能直接生成。区别在于编辑任务多了一个必须保留的锚点,也就是源音乐本身。论文把保留锚点和执行改动看成 1 对矛盾,后续所有设计都是为同时满足这两端。文中交代代码当前可用,演示页当前可用,扩展版本当前可用,复现时可以先从这三处对照实现与例子。

已有路线为什么容易丢旋律?

在零样本编辑路线出现之前,常见做法是从头训练一个编辑模型,或者在文本生成音频模型上为编辑做微调。这两条路都需要额外数据和算力。更新的零样本路线复用已有的文本生成音频扩散模型,先把源音乐加噪压掉高频细节,再在去噪阶段按目标提示重写。论文把前者称为前向后向管线。它的风险在于反演这一步本身不完美。

源提示往往写不出演奏细节,隐变量一旦偏离,再去噪就会把无关声部也改掉。图像领域用文本反演去逼近无损重建,但在编辑时调好的源嵌入无法再容纳目标词,因此不能直接搬过来。个性化生成路线用参考音频学一个新词,例如某种吉他或某种爵士,再把新词放进提示里生成。论文指出已有个性化编辑仍走同样的反演加去噪管线,所以同样会丢内容。理解这条背景后,才能看懂作者为什么要换掉整个管线,而不是只换一个去噪技巧。

只做二十步反演也会破坏什么?

论文用一个很短的重建实验说明问题不是调参能解决的。即使只做少量去噪扩散隐式模型的反演步数,重建的常数 Q 变换频谱也会与原曲对不上。白话说,常数 Q 变换是按音乐音高刻度做的频谱,适合看旋律线。英文是 constant-Q transform,主旋律相关系数记为 CQT1-PCC。论文报告仅 20 步反演后该值明显低于完全重合,意味着旋律已被改动。

扩散反演 × 反演误差: 扩散反演负责把源音乐加噪成隐变量以便按目标提示去噪重写,反演误差指这一步对原曲高频与旋律细节的不可逆改变,二者搭配说明了传统先反演后编辑管线失真的来源,也成为后文绕开反演、直接在数据空间优化的理由。

下面这张图就是该证据的直观展示。左侧为原始音乐的时频能量分布,右侧为仅经过 20 步反演再重建的结果,红色框标出了同一时间位置上能量延续性发生变化的地方。

看图路径: 1. 先确认左右两块面板分别为原始音乐与重建音乐的时频图;2. 再沿时间轴对比红色框内亮斑的位置与连续性变化;3. 最后结合图注中给出的相关系数值理解失真程度

原论文 Figure 1:The distortion of the reconstructed melody (CQT1- PCC=0.721) after only 20 DDIM inversion steps.

论文图 1。原论文 Figure 1:“The distortion of the reconstructed melody (CQT1- PCC=0.721) after only 20 DDIM inversion steps.”。

从像素上看,左右两图的整体布局相似,但框内亮带的断裂位置、延伸长度和强弱都有差异。这说明失真不是整体音量变化,而是局部旋律线的错位与模糊。论文因此得出判断,只要管线依赖反演得到的隐变量,后续编辑就会在已失真的起点上继续偏离。初学者复述时要记住这个因果链条,反演不准导致起点不准,起点不准导致编辑时无关内容也被改。

新管线如何绕开反演直接改波形?

作者提出两套方法。第一套是 SteerMusic,做粗粒度的零样本文字编辑,只用源提示和目标提示的差异来改。第二套是 SteerMusic+,做细粒度的个性化编辑,额外引入从参考音频学到的用户定义记号。两套方法的共同点是不再做反演加去噪,而是把待编辑音频本身看成可优化的参数。白话说,就是把当前波形当成变量,每一步用扩散模型的分数算出应该往哪个方向改一点,再直接更新波形。

左侧传统管线需要先把音频送进噪声空间,右侧新管线一直在数据空间里沿着一条从源点到目标点的轨迹走。 下面这张总览图把两种管线并排放出,左侧标注了反演误差的位置,右侧标注了优化轨迹与目标提示的作用点。

看图路径: 1. 先沿左侧管线看源音频加噪反演再加目标引导去噪的主路径;2. 再看右侧管线中源点到编辑点的虚线优化轨迹与梯度箭头;3. 最后对比两侧数据空间的位置,确认新管线省掉了反演环节

原论文 Figure 3:Overview of two music editing pipelines: (a) shows the conventional approach, which performs…

论文图 3。原论文 Figure 3:“Overview of two music editing pipelines: (a) shows the conventional approach, which performs editing during de- noising after an inversion process in the diffusion latent space;…”。

从像素上看,左侧有两排蓝色圆点分别表示正向加噪与反向去噪的中间状态,中间用误差线连接,橙色箭头表示目标提示在中间时刻介入。右侧只有一个灰色大数据空间圆盘,蓝色源点经红色虚线走向黄色编辑点,源提示与目标提示从两侧施加约束。这种画法对应的方法含义是,编辑不再依赖某一个中间噪声状态,而是依赖每一轮重新加噪后两个分数的差。初学者可以这样记忆,旧方法是先上楼再按新图纸下楼,新方法是始终站在一楼按图纸差一点点挪家具。

增量分数只更新哪里,为什么更干净?

先说白话。分数蒸馏采样英文是 score distillation sampling,缩写是 SDS,它的做法是给当前音频加不同程度的噪声,让预训练模型预测噪声,再把预测误差变成梯度去改音频。直接用它做编辑会很糊,因为梯度里包含大量与编辑无关的噪声方向。增量去噪分数英文是 delta denoising score,缩写是 DDS,它同时算目标提示下的分数和源提示下的分数,再把两者相减。用同一份随机噪声和同一时间步做 2 次预测,公共部分相减后抵消,剩下的主要是目标词与源词差异带来的方向。

分数蒸馏采样 × 增量去噪分数: 分数蒸馏采样负责用预训练扩散模型的分数把可微函数输出推向目标提示,增量去噪分数负责再减去源提示下的分数以抵消公共噪声方向,二者搭配使优化只更新与目标差异相关的区域,从而在保留无关内容的同时提高编辑保真度。

具体到 SteerMusic,作者把可微函数取成最简单的恒等映射,也就是优化变量直接就是波形,初始值设为源音乐。每一轮随机采样时间步和噪声,分别得到加噪后的当前音频与加噪后的源音频,送入同一个预训练的文本生成音频扩散模型,权重函数对不同噪声水平加权。梯度只回传到当前波形,不更新扩散模型本身。原文明确说该方法此前只在图像领域验证过,这是首次系统研究它在音乐编辑中的潜力。教学例子是源句中只有钢琴换成吉他,其余词不变,理想结果是旋律与速度不变,只有乐器质感变化。这个例子是为说明机制虚构的对照,不代表论文承诺每次只换一个词都能完美解耦。

用户自定义风格如何变成可执行的编辑方向?

文字写不出的风格需要先从参考音频里学出来。个性化扩散模型英文是 personalized diffusion model,缩写是 PDM,它在少量参考音频上微调,参考提示写成类似一段关于新记号的录音的形式,新记号对应一个新词嵌入。个性化增量分数英文可理解为 personalized delta score,它把目标侧换成个性化模型的分数,源侧仍用通用模型的分数。

个性化扩散模型 × 个性化增量分数: 个性化扩散模型负责从少量参考音频中记住用户定义的风格记号,个性化增量分数负责用个性化模型的目標分数减去通用模型的源分数给出编辑方向,二者搭配把文本写不出的音色与流派细节变成可执行的梯度,是细粒度编辑的关键。

但直接相减会有分布偏移,因为个性化模型已偏向参考数据的分布,给出的方向不一定指向通用语义下的目标。于是作者加了分布偏移正则,约束 2 个模型在同一目标提示下的分数不要差太远,并用系数调节强度。还加了个性化对比损失,从自注意力中间特征里取出源分支与目标分支的时序特征,把同一时刻当正样本、不同时刻当负样本做对比,明确鼓励目标风格的频域特征在对应时刻出现。

分布偏移正则 × 个性化对比损失: 分布偏移正则负责约束个性化模型与通用模型在同一目标提示下的分数差距以防止偏离过远,个性化对比损失负责在自注意力时序特征上拉近同时刻、推远不同时刻以强化目标风格,二者搭配分别从分数层面和特征层面保证改得像又不过度破坏结构。

论文强调个性化扩散模型的训练已有大量研究,本工作假设有一个可用的文本生成音乐个性化模型,SteerMusic+ 是可插拔的编辑管线。参考音频的选择很关键,想学某把吉他的演奏,参考就应是这把吉他的演奏录音,想学某种爵士,参考就应是同风格的录音。概念可以是乐器实例,也可以是流派,特点是即使把文字写得很细也难以生成。

哪里在训练,哪里只是优化波形?

这部分初学者最容易混淆,需要把训练和推理时的优化分开。SteerMusic 本身没有训练阶段,它复用已有的文本生成音频扩散模型,编辑时冻结模型权重,只更新波形参数。SteerMusic+ 包含两个阶段。第一阶段是得到个性化扩散模型,需要在参考集上微调。参考集记为包含参考音频与参考提示的数据集,样本数可以少到一个。

优化目标是参考数据上的扩散模型损失,初始权重来自预训练通用模型。论文没有在本研究中重新报告该微调的学习率与步数的唯一最优值,而是在后文用不同微调步数做失败条件分析。第二阶段是编辑时的波形优化,同样冻结两个扩散模型的大部分权重,只更新波形。每一轮的监督来自 3 个梯度源,个性化增量分数给出主方向,分布偏移正则防止偏离通用分布,对比损失强化时序对应的风格特征。

下面这张图把 2 阶段画得很清楚,左侧是微调,右侧是编辑,红色虚线表示梯度流。

看图路径: 1. 先看左侧参考音频与新词嵌入如何进入个性化模型微调;2. 再看右侧源提示与目标提示分别进入两个冻结或微调后的模型分支;3. 最后追踪红色虚线梯度如何回传到待优化的波形表示

原论文 Figure 4:Overview of the SteerMusic+ pipeline: (a) Personalized diffusion model (PDM) fine-tuned using…

论文图 4。原论文 Figure 4:“Overview of the SteerMusic+ pipeline: (a) Personalized diffusion model (PDM) fine-tuned using Dref and a user- defined [guitar] concept token.”。

从像素上看,左侧吉他图标与新词提示进入蓝色模型块,下方写着在参考数据上最小化扩散损失。右侧上方是源音频频谱与源提示进入通用模型,中间得到源特征,下方是目标提示进入个性化模型得到目标特征,两路特征算对比损失,两路分数算个性化增量与偏移正则,最终都指向右侧待优化的波形频谱,并有一条回路把新波形送回个性化模型。复述时要强调梯度不更新模型,只更新波形,模型只是打分器。原文未给出优化器类型、迭代总数与每步时间步采样分布的完整清单,这是复现时需要对照开源代码补齐的缺项,不能从模型名字推定。

用什么数据比,用什么指标算好坏?

零样本文字编辑用 ZoME-Bench 数据集,它取自 MusicCaps 的配对源提示与目标提示。个性化编辑在此基础上把目标提示中的目标词换成学到的风格记号,覆盖乐器与流派。长音频泛化用 MedleyDB 中的 MusicDelta 子集,时长跨度大,提示采用已有工作的标准化写法。基线方面,零样本部分在同一预训练 AudioLDM2 上比较随机微分方程编辑、去噪扩散隐式模型反演、ZETA 和 MusicMagus。个性化部分比较文本反演与 DreamSound,复现时用源提示做浅层反演得到噪声隐变量,再用个性化模型按目标提示去噪。论文说明因缺少源码未纳入部分同期方法,因面向通用声音而非音乐未纳入另外两个方法,这些未评测边界要如实记住。

CQT1-PCC × CDPAM: CQT1-PCC 负责度量源曲与编辑后主旋律在常数 Q 变换主音轨上的相关性,CDPAM 负责度量编辑结果与参考风格在感知表示上的距离,二者搭配分别回答保住了多少原曲和学到了多少目标风格,避免只用整体音质指标掩盖旋律丢失。

客观指标分两类。音乐一致性用弗雷歇音频距离、听感补丁相似度与主旋律相关系数,数值方向分别是越低越好、越低越好、越高越好。编辑保真度在文字任务用音频文本对齐分数越高越好,在个性化任务用参考音频与编辑结果的感知距离越低越好。主观评价用平均意见分,分别问内容保留与目标符合程度,从 1 分差到 5 分优。论文还做了二选一偏好测试,让有音乐训练的听众在保留主要内容的前提下选更符合指令的结果。

数据规模与任务切分到底是多少?

为保证复现时能对上数据口径,这里把数据集的规模单独整理成表。问题是主实验到底在多少样本上测了哪些改法。公平条件是同一来源的配对提示与固定时长的切片,长音频部分单独用另一子集检验泛化。下表数字全部来自原文连续句子,单位保留原文写法,裸数值不擅自添加百分号。

数据集样本规模任务切分时长条件来源说明
ZoME-Bench1000131 clips10-second audio samplesMusicCaps
ZoME-Bench100013410-second audio samplesMusicCaps
ZoME-Bench100010010-second audio samplesMusicCaps
ZoME-Bench10009510-second audio samplesMusicCaps
MusicDelta34 excerptsvarying styles and lengths20 seconds to 5 minutesMedleyDB

表后需要解释用途与边界。

上表说明主实验覆盖换乐器、换流派、换情绪与换背景 4 种改法,样本数各不相同,长音频部分样本少但时长跨度大,适合看方法是否支持变长输入。代价是长音频的提示不如短音频细致,标准化提示可能低估真实指令的多样性。未评测边界是部分同期方法因无源码或面向通用声音未纳入对比,复述胜负时必须限定在已纳入的基线内。聚合口径方面,原文说多随机种子下实验以保证统计可靠,但未给出每个指标是均值还是中位数,引用数字时应注明口径待查。

主结果在什么条件下成立,有什么代价?

先看零样本文字编辑的听众偏好,这是论文最直接的可运行对比。问题是当要求同时保留原曲主要内容并执行指令时,听众更偏好谁。公平条件是同一批原始音乐与指令下两两对比,听众需完成一整套题目且具有一定音乐训练。指标方向是偏好百分比越高越好。下表整理了原文报告的偏好率与测试规模,偏好率来自图中标注,人数与题数来自正文连续描述。

对比设置本方法偏好率对比基线完整作答人数每人题目数
与去噪反演改进方法对比76.40ZETA2520
与文本编辑扩散方法对比71.60MusicMagus2520

表后需要说明收益与代价。表中两个数字都明显高于二选一的随机水平,支持新管线在保留与改写平衡上更受听众认可。但这不等于每个样本都胜出,也不等于对齐分数一定最高。原文提到去噪扩散隐式模型反演在对齐分数上略高,但其主旋律相关低、听感距离高,说明它改得多却留不住原曲。这正是论文要揭示的权衡,只看对齐分数会误判。

下面这张条形图就是上表的可视化,彩色段长度对应偏好率,误差线表示波动。

看图路径: 1. 先确认上下两条分别对应与不同基线的二选一对比;2. 再读出彩色段标注的偏好百分比数值;3. 最后观察误差线长度以判断偏好优势的稳定性

原论文 Figure 5:User preference for SteerMusic: percentage of users preferring our method over ZETA and MusicMagus.

论文图 5。原论文 Figure 5:“User preference for SteerMusic: percentage of users preferring our method over ZETA and MusicMagus.”。

从像素上看,上条橙色段长于下条蓝色段,分别对应与不同基线的对比,右侧白色小段为基线所得份额。结合正文,平均意见分的内容保留与目标符合两项也给出显著性检验,报告显示内容保留均值与目标符合均值均高于基线且检验显著。但显著不等于效应在所有乐器与情绪子任务上一致,子任务切分在数据表中有交代,复述时不应把总体趋势推广到每一组。

个性化编辑是否既留住人声又换掉乐器?

个性化部分的可视化例子回答了一个具体问题。当目标是把吉他教程换成布祖基琴,或把流行歌中的吉他换成陶笛,同时留住讲解人声与女声时,新管线能否做到。论文展示的频谱对比中,SteerMusic+ 一列保留了源音乐中标注为人声的亮带结构,而两个基线要么抹掉细节,要么引入大面积模糊。这支持个性化增量分数加对比损失确实把更新集中在目标乐器上。

客观上论文报告新方法在分布距离、听感距离、主旋律相关与感知距离上全面占优,主观两项平均意见分也显著高于基线。未胜出项也要记住,在长音频子集上部分基线因只支持短音频而被排除,文本反演在复杂长音频上未能产生有意义结果而被排除,这些排除本身说明了适用边界。个性化编辑的保真度上限受个性化模型能否学到风格限制,如果微调学偏了,后续编辑再稳也难以补回,这是后文失败分析的伏笔。

正则系数与微调步数如何改变权衡?

消融研究用布祖基琴这类生僻乐器做探针,因为它必须依赖个性化模型,文字描述很难讲清。第一个变量是分布偏移正则的系数。论文在负一到一之间测试,发现只用个性化增量加偏移正则时,偏移项对朝目标概念的推动作用较小,编辑结果与参考风格的感知距离下降有限。加入对比损失后,偏移项变得更有效,系数为负时更偏向保留原曲,系数为正时更偏向目标概念。实际建议取较小正值以避免改过头。

第二个变量是个性化模型的微调步数。步数太少时概念没学会,编辑保真度低。步数太多时过拟合到参考录音,原曲结构丢失。论文用主旋律相关为横轴、感知距离为纵轴画出权衡曲线,趋势是向目标风格靠近往往以损失原曲一致性为代价。这与文字编辑跟随抽象语义不同,个性化编辑跟随的是具体参考录音,参考越强,原曲越容易被带偏。

复述时不要说拿掉某个损失必然崩溃,原文只报告了在该探针与该取值范围内的移动方向,待验证的是换一个乐器或流派后最优点是否相同。

哪些情况会失败,还缺哪些验证?

论文明确承认两个局限。第一,编辑质量受个性化模型表达能力的上限约束,失败案例多可归因于模型本身没学好风格,而不是编辑管线能无限纠正。第二,微调步数需要在保真与保留之间仔细选择,不存在一组参数通吃所有概念。未测量的量也要点清。原文没有报告推理延迟、显存占用、输出采样率提升后的成本,也没有报告误判率或版权与安全层面的评估,因此不能承诺这些量得到改善。

数据集方面,零样本主实验的子任务切分与长音频子集的规模已有交代,但不同乐器与流派上的分项数字在正文中没有逐字展开,复述时不应编造分项胜负。统计方面,平均意见分给出了方差分析的显著性,但偏好测试的置信区间只在图中以误差线显示,像素无法精确读出数值时不要硬写。这些缺项不是技术错误,而是后续复现需要补的验证。

复现先跑什么,再核对什么?

复现建议按学习依赖倒排。先用零样本管线跑通,因为它不依赖个性化微调。输入准备一段源音乐与一句包含待改属性的源提示,再把其中一个词换成目标词得到目标提示。调用同一个预训练文本生成音频扩散模型,在每一轮采样相同噪声与时间步,分别算目标分数与源分数,相减后更新波形。初始波形设为源音乐,模型权重冻结。

跑通后再做个性化。先按参考音频与新词提示微调出个性化模型,参考数可从很少开始,再冻结通用模型与个性化模型,按个性化增量加偏移正则加对比损失优化波形。正则系数先取论文建议的较小正值,微调步数从小到大扫一遍,观察主旋律相关与感知距离的权衡。核对清单包括是否关闭了反演、2 次分数是否共享噪声与时间步、梯度是否只进波形、对比特征是否取自残差加自注意力后的中间层并按时序对齐。

资源状态方面,代码当前可用,演示页当前可用,扩展版本当前可用,可对照实现细节与试听例子。论文未报告硬件预算与训练时长,复现时需自行记录耗时与显存,以便判断长音频的可行性。

何时值得尝试,何时应该绕行?

当任务是保留旋律只换乐器、情绪、背景或某种说不清的演奏风格,且已有可用的文本生成音频扩散模型时,这套数据空间优化值得尝试。它的价值在于省掉反演,用分数差把改动集中到目标差异上,听感上更容易同时满足保留与改写。当目标风格完全写不出且能找到同风格参考录音时,可以进一步尝试个性化管线,但要接受一个前提,个性化模型先要学好风格,否则后续正则与对比损失难以力挽狂澜。

当输入是很长的复杂混音,或参考录音与源曲差异极大时,应先小步验证,因为强风格迁移天然会冲击原曲结构。还需补的验证包括分乐器与分流派的分项表现、不同骨干模型下的稳定性,以及推理成本与高采样率下的音质变化。记住论文的直接报告是偏好率与一致性指标上的优势,有限解释是分数差与特征对比带来了这种平衡,未验证的推测是换更强骨干一定能线性提升,这些要用报告、支持、可能 3 类语气区分开。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总