英文题目:MuseTimbre: Zero-Shot Timbre Transfer by Controlling a Frozen Music Generator

标签:#音乐生成 | #Adapter | #零样本 | #音乐

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Yuan-Chiao Cheng:Music Informatics Group;Georgia Institute of Technology;Atlanta, GA, USA
  • Zhiyao Duan:Audio Information Research (AIR) Lab;University of Rochester;Rochester, NY, USA

📌 核心摘要

乐器音色迁移需保留复调源演奏的音高组织并替换为另一乐器参考录音的音色,难点在于源录音中音高与音色纠缠且文本标签无法刻画同一乐器内的细腻差别。MuseTimbre冻结预训练音乐生成器Stable Audio 3 Medium,先由多音高估计器Basic Pitch提取源音频的音符与起音二值钢琴卷并经一维卷积编码后以解耦交叉注意力注入,其次由微调后的LAION-CLAP音乐音频分支将参考音频压缩为512维全局嵌入并以自适应层归一化调制各层特征,最后以整流流速度回归目标联合训练两路控制。与冻结编码器加专用生成器或文本指定音色等已有路线相比,该设计以显式音高通路处理复调,以可学习的全局音色通路实现跨内容音色泛化。在PHENICX-Anechoic、MAESTRO v3测试划分、GOAT与Bach10构成的304对跨数据集跨乐器评测中,系统取得57.6%的音色命中率与0.316的帧F1,音色大幅领先而音高保持接近最强基线。该结论仅适用于谐波乐器5秒短片段迁移,依赖转录器与标签器精度,极端复调与强失真音色外推尚未验证。原文披露单张RTX 5090上25步Euler采样约1秒可生成5秒44.1kHz音频,但未披露完整训练耗时与部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,什么必须保留?

这篇论文研究的任务是乐器音色迁移。输入是两段音频,一段是源演奏,提供要保留的音符进行,另一段是参考演奏,提供要模仿的乐器质感。目标输出是一段新音频,它的音高组织来自源,音色身份来自参考。

举一个教学例子帮助理解,源可以是一段钢琴弹的复调旋律,参考可以是一段小提琴独奏,期望输出是小提琴拉出同一段旋律。该例子仅用于说明输入输出关系,不代表论文测试过该具体组合。必须保留的是时间上的音高结构,包括同时出现的多个音、音符起止与静音。

必须改变的是频谱包络与发音方式等构成乐器身份的部分。论文把范围限定在泛音乐器,把音乐内容等同于音高的时间组织,把音色理解为源滤波器视角中的共振滤波器特性。难点在于同一乐器的音色会随音区变化,人对音高的感知也受音色影响,因此从复调录音中直接学到解耦表示很困难。

论文的选择是不去学习一个从混合信号中分离两者的隐变量,而是用外部转录器显式抽取音高,用音频文本编码器显式抽取音色,再把两者送入同一个冻结的音乐生成器。这种显式分工让后续评估可以分别检验音高保持与音色命中。

已有路线如何处理音高与音色的纠缠?

论文把已有工作按解耦的显式程度排列。第一类是扩散反演方法,在源提示下反演源音频再在目标提示下重去噪,逐步去掉源音色,但由于没有显式分离音高与音色,重构时也可能损伤音乐内容。第二类是自监督离散瓶颈方法,把源压缩为离散码,指望瓶颈丢掉音乐内容之外的属性,再换上参考音色解码。

第三类是在预训练生成器上加音乐属性控制,但音色仍用文本乐器名指定,例如指定小提琴或电吉他,无法区分干净爵士音色与重失真音色,也无法区分明亮独奏小提琴与温暖乐队小提琴。第四类是为迁移专门训练的专用模型,从两路条件重建音频,音色干净但系统单一,只能做固定或狭窄乐器集合。

论文指出参考音频比文本更能捕捉细微音色,但参考音频本身纠缠了流派与旋律,所以很多通用生成器退回用文本命名音色。MuseTimbre 的定位是把音频参考音色通过条件控制加到预训练音乐生成器上,并处理复调源的系统。它同时借鉴了解耦适配器的思想,用两条独立通路分别控制音高与音色,而不是训练一个专用生成器。

为什么文本命名不够,音频参考难在哪里?

文本命名不够的具体动作是只给乐器名,生成器只能输出该类乐器的平均音色。论文强调同类乐器内部差异很大,文本无法指定失真度、明亮度或演奏法等细节。音频参考的优势是直接给出一段目标音色的声学实现,包含了频谱包络与发音细节。

但难点有两层。第一层是源侧纠缠,源录音同时包含音高与自身音色,若把源波形直接作为条件,输出会残留源乐器。第二层是参考侧纠缠,参考录音同时包含音色与它自己的旋律内容与风格,若编码器不具备音高鲁棒性,输出会把参考的旋律也带进来。

论文因此提出两个可检验的要求,一是音高通路应几乎不携带音色信息,二是音色编码器应能跨不同音符内容识别同一乐器。前者用转录加二值化实现,后者用在迁移任务上端到端微调 CLAP 实现,并用音色检索任务验证。评估也围绕这两轴展开,一轴测音高保持,一轴测音色命中,避免用整体音质掩盖迁移错误。

冻结什么,训练什么,样本走哪条路?

系统全景可以沿一个 5 秒样本走一遍。源音频进入基本音高转录器,得到 88 个音符通道加 88 个起音通道的二值琴卷,再经 1 维卷积编码为逐帧特征,经解耦交叉注意力进入冻结扩散变换器的每一层。参考音频进入微调后的 CLAP 音频分支,得到单个 512 维全局向量,经线性映射为每层的缩放与偏置,用自适应层归一化调制特征。

冻结的部分是 Stable Audio 3 Medium 的音频自编码器、扩散变换器主干与原有文本控制通路,训练的部分是音高编码器、音高交叉注意力适配器、音色自适应层归一化适配器以及 CLAP 音频分支本身。文本控制被原样保留,可以叠加使用,例如在演示页中控制房间与混响等声学环境。

琴卷输入也直接接受 MIDI 乐谱,因此系统既能做录音到录音的迁移,也能把乐谱渲染成参考音色。下图是论文给出的系统框图,左侧两路输入分别对应蓝色音高与橙色音色,中间虚框展示每一层内部的插入位置,右侧展示从噪声隐变量到波形的生成路径。

系统框图导读与像素核对

阅读该框图前需要先建立预期,主路径是从底部噪声隐变量逐层向上经变换器再经 VAE 解码器到输出波形,两条侧路分别从左右汇入每一层。左侧参考与源是两种不同性质的输入,右侧输出标注为源旋律加参考音色。注意图中用灰色表示冻结,用蓝色表示训练的音高部分,用橙色表示训练的音色部分,三角形表示零初始化门。带着颜色与箭头方向看图,才能区分哪条是时变对齐控制,哪条是全局调制控制。

看图路径: 1. 从左侧参考与源输入框出发,沿橙色与蓝色箭头找到两路编码器;2. 确认中间虚框内自注意力、文本交叉注意力、音高交叉注意力与音色自适应层归一化的上下顺序;3. 核对底部图例中冻结、训练与输出的颜色区分以及零初始化门位置

原论文 Figure 1:System overview. We freeze Stable Audio 3 Medium, its autoencoder, and its text control (gray)…

论文图 1。原论文 Figure 1::“System overview. We freeze Stable Audio 3 Medium, its autoencoder, and its text control (gray) and add two trained modules, pitch (blue) and timbre (orange).”。

从实际收到的像素看,中间虚框自下而上依次是自注意力、文本交叉注意力、音高交叉注意力和音色自适应层归一化,最上方是前馈网络,每层结构在所有层间相同。音高编码器标注为 1 维卷积,输入标注为 176 通道二值卷,其中 88 为音符加 88 为起音。音色分支标注为 512 维嵌入,经缩放与偏置进入自适应层归一化。两处插入点各有一个零初始化门标记,含义是训练初期新增模块对冻结主干影响接近于零,再逐步学到控制作用。右侧主干标注为 N 个相同层加冻结主干与适配器,从噪声隐变量经层 1、层 2 直到层 N,再经 VAE 解码器得到输出波形。该图不支持读出具体层数或维度数值,数值以正文文字为准。

音高通路如何丢掉源音色?

音高通路的输入是二值钢琴卷帘。白话说,钢琴卷帘就是把时间切成帧,把音高切成 88 个键,每个帧标记哪些键在响,另用 88 个通道标记哪些键是新起音,静音则两组通道都为零。论文用 Basic Pitch 转录源音频,得到连续显著度后再二值化,音符阈值为 0.35,起音阈值为 0.50,目的是在精确率与召回率间平衡。

二值化的动作去掉了与源音色相关的谐波结构,使音高通道几乎只剩音符内容。重采样到隐变量帧率约每秒 10.8 帧后,1 维卷积把琴卷编码为逐帧特征。注入方式是每层的解耦交叉注意力,对查询、键与值使用旋转位置编码,并在注意力后设置零初始化门。

论文特意把更准确的 MuScriptor 留给评估,转录器内部仍用 Basic Pitch,以保证与基线的音高输入公平。该通路也因此天然支持复调,因为琴卷允许多个音同时为 1,也天然支持 MIDI 直接输入,因为 MIDI 本身就是符号化的琴卷。

钢琴卷帘 × 音色嵌入: 钢琴卷帘分工是把源音频的时间与音高组织写成二值音符与起音通道,丢掉频谱包络等音色细节;音色嵌入分工是把参考音频压缩成单个不随时间变化的 512 维向量,保留乐器身份。搭配理由是冻结扩散生成器需要互不重叠的控制信号,组合意义是让交叉注意力只看音高何时出现,让自适应层归一化只调制全局音色,从而实现复调源的跨音色重演奏。

音色通路如何保持全局一致?

音色通路的输入是 48 千赫采样的参考波形,输出是一个不随时间变化的 512 维向量。白话说,时不变意味着无论参考演奏了什么音符,编码器只输出一个全局身份描述,不输出逐帧旋律。论文使用在音乐数据上训练的 LAION-CLAP 音频分支作为起点,但与此前冻结编码器的做法不同,这里在迁移任务上端到端微调。

注入方式不是交叉注意力,而是自适应层归一化。具体计算是把音色向量线性映射为每层的缩放与偏置,再对特征做按通道的仿射调制。该归一化位于每层音高交叉注意力之后,同样带有零初始化门。选择全局调制的理由是音色应对整段输出一致,若用逐帧注意力,参考中的旋律起伏可能被当作时变控制而泄漏到输出。

微调的作用是让编码器在音符变化时仍指向同一乐器,后文用受控网格检索验证了这一点。时变与时不变的注入差异是理解该系统的关键,音高需要对齐时间,音色需要覆盖全段。

交叉注意力 × 自适应层归一化: 交叉注意力分工是把逐帧音高特征按时间对齐注入每一层变换器,适合可变长旋律结构;自适应层归一化分工是把单个全局音色向量映射为每层的缩放与偏置,对所有帧施加统一调制。搭配理由是音高是时变信号而音色是时不变信号,组合意义是在同一冻结主干中同时保持旋律进行与统一乐器质感而不互相覆盖。

基本音高转录 × 微调 CLAP 编码器: 基本音高转录分工是把源音频显式转写为二值琴卷,承担去除源音色的解耦动作;微调 CLAP 编码器分工是从参考波形提取抗音高变化的乐器表示,承担捕捉目标音色的动作。搭配理由是源侧与参考侧纠缠来源不同,需要不同预训练工具处理,组合意义是端到端迁移任务把通用音频文本空间重塑为音色相似度空间。

训练目标监督什么,数据如何构造?

训练只更新新增控制模块与 CLAP 音频分支,冻结自编码器、变换器主干与文本通路。每个训练片段取自同一录音的不同分段,一段提供音高条件,另一段提供音色条件,目标是重建当前片段的隐变量。这种构造迫使模型不能靠参考分段的旋律抄答案,因为参考分段与目标分段内容不同,只能靠共享的乐器身份完成重建。

数据为一半合成一半真实的混合。合成一半把 Slakh MIDI 声部分轨用 7 个通用 MIDI 音色库渲染,得到约 1,100,000 段 10 秒以上的单声部分轨,覆盖 13 类乐器。真实一半来自 MoisesDB 与 URMP 的 1208 个单乐器声部分轨,共 18869 个片段,去掉鼓、打击乐、人声与未标注声部,并提供二值化 Basic Pitch 琴卷。

每段训练音频为 44.1 千赫 5 秒。优化器为 AdamW,训练 250000 步,双卡,有效批量 16,权重衰减 0.01,先 1000 步热身再余弦衰减,并使用多条件分类器无关引导丢弃。学习率区分设置,预训练过的音色编码器用 10 的负 5 次方,控制模块用 10 的负 4 次方。推理从噪声出发用欧拉法走 25 步,5 秒音频在单张 RTX 5090 上约 1 秒,音高与音色引导强度均设为 2。

\[\mathcal{L}=\mathbb{E}_{z_{0},\epsilon,t}\,\big\lVert\,v_{\theta}(x_{t},t,c_{\text{pitch}},c_{\text{timbre}})-(\epsilon-z_{0})\,\big\rVert_{2}^{2},\]

整流流 × 分类器无关引导: 整流流分工是定义从噪声到目标隐变量的直线速度回归目标,给出训练监督方向;分类器无关引导分工是在推理时把音高条件与音色条件的引导强度分别放大,提高两路匹配。搭配理由是训练学到条件速度场而推理需要可调权重,组合意义是用同一条件速度模型实现音高与音色可独立加权的采样。

公式中的符号与计算目标是什么?

上式是整流流的速度回归目标。符号含义是目标隐变量为起始点,高斯噪声为终点,中间插值点由扩散时间步加权混合得到,模型预测从当前插值点指向噪声减目标的速度向量。条件包括音高条件与音色条件,分别来自上述两条通路。

计算目标是最小化预测速度与真实速度差的平方范数的期望。原文明确的实现是训练时音高条件取真实音高或 Basic Pitch 估计加编码后的结果,音色条件取同一片段另一分段的编码结果。原文未给出梯度在冻结主干内部的逐层路径细节,只说明冻结与训练的参数划分与学习率差异,因此不应从模型名推定未报告的梯度实现。

这种训练构造的教学要点是监督来源不是外部标注的迁移对,而是同一录音不同分段之间的自监督重建。音高与音色看似来自同一乐器,但在时间内容上错开,从而逼迫网络把可变的内容交给琴卷,把不变的身份交给 CLAP 向量。

在哪些录音上测,与谁比,指标朝哪边?

评估是零样本跨乐器迁移,共 304 对,来自 4 个训练时未见的数据集,包括 PHENICX-Anechoic、MAESTRO 第三版测试划分、GOAT 与 Bach10,共十三件乐器。每段取单乐器孤立片段中最响的 5 秒以避开静音,源与参考取自不同乐器且来自不同数据集,避免共享乐器身份与录制条件。

基线分文本条件与音频参考两组。文本组包括共享同一 Stable Audio 3 主干的 DDIM 反演与 DDPM 反演、在 Stable Audio Open 上的 MuseControlLite,以及用目标乐器文本嵌入条件的 TokenSynth-T。音频参考组包括同样用音高信号加音频音色嵌入但训练独立模型的 CTD、用参考音频 CLAP 嵌入条件的 TokenSynth-A,以及在 16 千赫频谱上分离音高与音色嵌入的 SS-VQ-VAE。

两种 TokenSynth 变体与本模型使用相同的 Basic Pitch 转录,保证差异不来自音高输入。指标有两个,越大越好。音色命中用在 AudioSet 上训练的 PaSST 标注器,若输出顶类落入参考乐器族则计命中。音高保持用 MuScriptor 在目标乐器条件下转录输出,再与源真实 MIDI 算帧 F1,步长 10 毫秒,容差 50 音分。论文同时报告上限,参考片段本身 PaSST 准确率为 88.5%,直接转录源音频的平均帧 F1 为 0.540,说明两指标都有天花板。

帧 F1 × 音色命中率: 帧 F1 分工是衡量输出转录与源真实 MIDI 在 10 毫秒步长与 50 音分容差下的音高保持,是内容轴;音色命中率分工是用 PaSST 标注器判断输出顶类是否落入参考乐器族,是音色轴。搭配理由是单看一轴会掩盖音高与音色权衡,组合意义是用 2 维散点同时检验解耦是否成功,而不是用音质好坏代替迁移正确性。

音色命中如何按乐器族判定?

比较音色命中前必须先明确判定口径,否则弦乐内部或木管内部的混淆会被误判为失败。论文把十三件乐器映射到 AudioSet 标签及其父类,在族级别统一评估所有方法。该口径的公平性在于所有方法使用同一映射,指标方向是命中率越高越好。

ReferenceLabels counted as a hit
violin, violaViolin; Bowed string; String section
cello, double bassCello / Double bass; Bowed string; String section
flute, clarinet, saxophoneown label; Woodwind
oboe, bassoonWoodwind
trumpet, hornTrumpet / French horn; Brass
pianoPiano; Keyboard
electric guitarElectric guitar; Guitar; Plucked string

该映射的主要收益是允许同一族内的合理混淆,例如小提琴与中提琴互判仍算命中,避免过度惩罚音色相近的乐器。主要代价是粒度变粗,族内区分能力不再被考核,系统可能在族级别得分高但在具体乐器型号层面仍有差距。论文未报告按具体乐器拆分的混淆矩阵,因此不能从总命中率推断每件乐器的表现是否均衡。复现时应保留同一映射再算命中,否则跨论文比较会因口径不同而失真。

主结果是否同时保住音高与音色?

主结果按音高对音色的 2 维散点组织,右上为好。基线呈现权衡,帧 F1 高的音色命中低,音色命中高的帧 F1 低。要回答的问题是在 304 对跨数据集零样本条件下,谁在两轴上同时更靠右上。公平条件是同一音高输入、同一族级口径与同一 304 对,指标方向均为越大越好。

系统音色命中音高帧 F1参考类型评估口径
CTD48.7%低于 MuseTimbre音频参考304 对族级命中与帧 F1
SS-VQ-VAE45.4%低于 MuseTimbre音频参考304 对族级命中与帧 F1
TokenSynth-A34.6%0.367音频参考304 对族级命中与帧 F1
TokenSynth-T30.4%0.380文本命名304 对族级命中与帧 F1

表后解释需要同时说收益与代价。收益是本方法音色命中明显高于每个基线,比最近的音频参考基线高约 9 个百分点以上,同时音高保持处于可比区间,没有跌入低帧 F1 区域。代价是音高轴并未夺冠,TokenSynth 两变体的帧 F1 分别为 0.367 与 0.380,高于本方法的 0.316,听感音高分也由 TokenSynth-A 领先。这是一个未胜出项,说明更强的音色控制伴随一定的音高损失。限制是两指标都有上限,参考本身 PaSST 仅 88.5%,源转录帧 F1 仅 0.540,因此剩余差距部分来自标注器与转录器误差,不能全归因于生成模型。

两条通路是否各管各的,反证是什么?

反证实验在推理时去掉一路条件,传入空嵌入,并改用同一音频同时提供音高与音色条件,再在相同对上重评。问题是音高信息是否泄漏进 CLAP,音色信息是否残留在琴卷。若解耦成立,去掉音色应主要塌音色,去掉音高应主要塌旋律。该设计的公平条件是除被去掉的条件外,其余采样步数与引导设置保持一致。

条件音色命中音高帧 F1检索顶 1 准确率条件说明
去音色留音高16.1%0.267 附近未在此条件报告空音色嵌入接近随机猜测 11.8%
去音高留音色保持高位0.041未在此条件报告同一音频供两路条件
微调 CLAP 检索未在此条件报告未在此条件报告0.53 到 0.88最大池提升 35 个百分点

表后判断是双分离成立,去音色塌音色而旋律大体保持,去音高塌旋律而音色保持,说明两模块携带不同信息。另一条证据是受控网格检索,十三乐器乘四十旋律片段渲染全部组合,检索池从 2 到 256,每个池含一个同乐器不同内容的目标与多个干扰,其中至少一个干扰与查询音符相同但音色不同。微调把冻结 CLAP 从 0.53 提升到 0.88 的最大池顶 1 准确率,提升 35 个百分点,且池越大差距越大,远高于香草 AST 与 MERT 类嵌入,支持微调 CLAP 可作为抗音高变化的音色相似度量。

但需注意未测量不等于不存在泄漏,只能说在所用指标与池规模下未观察到可利用的泄漏。去音色后仍有 16.1% 高于随机猜测的 11.8%,说明音域等残余线索仍能轻微提示乐器族。

哪些结论不能从当前证据推出?

首先,总体趋势不等于每组都成立。论文报告的是 304 对上的平均命中与平均帧 F1,没有给出按乐器对拆分的区间与显著性检验,不能推出在每 1 对乐器迁移上都优于基线。其次,自动指标不等于人耳判断。PaSST 族命中与 MuScriptor 帧 F1 各有上限与误差,听感测试仅覆盖 10 组源参考组合与 20 名有音乐训练的听众,采用无锚的多刺激隐藏参考设计,样本量有限,不能推广为普遍听感优势。

再次,冻结参数不等于输出确定。系统推理从噪声出发,采样步数与引导强度会影响结果,论文固定 25 步欧拉与双 2 引导,不能推出其他步数下权衡不变。最后,相关性不是因果。微调 CLAP 检索准确率高支持其作为音色相似度量的候选,但合成网格与真实录音分布不同,未验证在真实跨录音条件下的误判率,因此只能表述为可能与待验证,不能承诺已解决音色评价问题。

像素不能精确辨别的数值不应硬写,原文补充说明需要明确归因。例如系统框图不支持读出具体层数,训练部分未报告显存峰值与多轮调参总成本,因此不能承诺低成本复现。检索用合成渲染保证可控,因为真实录音很少提供同一内容不同音色的配对,论文把进一步音色相似度评估留给未来工作。

要复现应先做什么,需要什么条件?

复现先做三件事。第一,按论文划分准备数据,训练用 Slakh 合成与 MoisesDB 加 URMP 真实,评估严格保留 PHENICX-Anechoic、MAESTRO 测试划分、GOAT 与 Bach10 未见,并按最响 5 秒切段与跨数据集配对,避免同乐器同环境泄漏。第二,固定转录与标注口径,内部用 Basic Pitch 阈值 0.35 与 0.50 并二值化,评估用 MuScriptor 加目标乐器条件,音色用 PaSST 族映射,帧 F1 用 10 毫秒步长与 50 音分容差,否则数字不可比。

第三,冻结 Stable Audio 3 Medium 主干、自编码器与文本通路,只训练 1 维卷积音高编码器、解耦交叉注意力、自适应层归一化与 CLAP 音频分支,注意两组学习率不同。资源状态是正文开源声明的唯一依据,当前代码链接可用,演示页链接可用,可获取代码、权重与音频样例。推理需单卡跑 25 步欧拉,论文报告 5 秒音频约 1 秒。

文本控制仍可用,可在音高音色之外叠加房间混响等环境描述,但论文只在演示页展示,未纳入主指标。琴卷输入接受 MIDI 直接驱动,复现时可先用乐谱加固定参考做冒烟测试,再进入 304 对的完整评估,避免一开始就调试跨数据集配对。

何时值得尝试这个方案?

当任务同时满足 3 个条件时值得尝试。第一,源是复调且需保留多声部进行,符号琴卷比波形反演更能显式保住音符。第二,目标音色难以用一句话说清,例如同一乐器内的失真度、明亮度或演奏法差异,此时一段音频参考比乐器名更直接。第三,希望复用大规模预训练音乐生成器的音质与多样性,而不想为每类乐器训练专用生成器,此时冻结主干加两条轻量控制是更省力的路径。

若目标只是单音、固定小乐器集合,或已有高质量专用迁移模型,专用系统的音高精度可能更高,不必强行切换。本方法的实测代价是音高帧 F1 为 0.316,低于 TokenSynth-A 的 0.367 与 TokenSynth-T 的 0.380,听感音高分也未领先,因此对音高零容忍的场景需要额外后处理或人工校对。

还需补的验证是更大规模听感、按乐器对拆分的误差分析,以及真实录音上的音色检索误判率。只有补齐这些,才能把当前在 304 对上的平均优势转化为可部署的稳定收益。初学者复述时应抓住一句话,冻结生成器保音质,琴卷管何时响,微调向量管像谁响,两路用不同归一化方式汇入同一主干。

📎 论文与评分元数据

排名:前25% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-28 语音/音乐/音频论文速递