英文题目:Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
会议身份:
conference:aaai:2026:conference-paper-id:40907
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准测试 #提示学习 #自监督学习 #音频深度伪造检测
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Yuankun Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Ruibo Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaopeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Songjun Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Long Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Haonan Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Long Ye:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理全类型音频深度伪造检测(Audio Deepfake Detection,ADD),输入为规整至固定长度的原始波形,输出为真伪二分类分数,难点是单类型训练的鉴别器在语音、声音、歌声与音乐之间泛化急剧退化。方法链分为三步:首先冻结自监督学习(Self-Supervised Learning,SSL)前端并在每层Transformer输入前拼接可学习提示词;其次对其中4个提示词做Haar离散小波变换(Discrete Wavelet Transform,DWT),显式构造低频与高频子带;最后将提示增强的序列送入AASIST后端做谱时图注意力分类。相比全量微调(Fine-Tuning,FT),该机制不更新主干而只学习频率感知的提示分布,相比普通提示调优(Prompt Tuning,PT)则增加了全频带结构偏置。在四类数据联合训练下,WPT-XLSR-AASIST在全部评测集上平均等错误率(Equal Error Rate,EER)为3.58%,优于同结构FT基线的4.98%。该结论依赖相对干净且无部分伪造的基准划分,未验证噪声、压缩与未知生成器的外推能力。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:四类音频造假为何要统一处理?
这篇论文的输入是任意一段待判定的音频波形,目标是输出它是真实录制还是合成伪造。初学者要先建立的概念是,音频造假检测英文常称作音频深伪检测或反欺骗,核心指标是等错误率,数值越低表示误判越少。过去的研究多是分赛道进行,语音有自动说话人验证伪造竞赛,歌声有歌声伪造检测挑战,声音和音乐也各自有数据集与方法。
在真实部署中,系统事先不知道来的是人说话、环境声音、歌唱还是音乐,直接把单类训练的模型拿来用会出现明显落差。论文用实验说明,只在语音上训练的模型在声音和音乐上接近随机猜测,只在音乐上训练的模型在其他 3 类上也很差。即使语音和歌声之间有一定迁移,例如冻结的跨语言语音表示在歌声上有相对较好的表现,整体平均错误率仍然很高。
因此作者提出全类型音频造假检测任务,要求一个对策模型同时处理上述 4 类。学习依赖上,这要求表示既能保留每类各自的听觉结构,又能抽出跨类型共享的真假线索。论文把寻找这种类型不变的频率线索作为主线,后续的小波提示、联合训练与可视化都是围绕这条主线展开的。
已有路线在比什么:冻结、微调与音乐专用表示有何分工?
当前最有效的对策多采用自监督学习前端加后端分类器的结构。自监督学习前端指在大规模无标注音频上预训练的网络,例如跨语言语音模型、语音任务模型和音乐理解模型,它输出带有上下文的帧级表示。后端常用的是基于谱时图注意力的二分类网络,直接在前端表示上学习真假边界。
自监督学习前端 × 反欺骗后端: 自监督学习前端负责把原始波形变成有上下文的声学表示,例如 XLSR 通过卷积加 Transformer 学到跨语言语音结构;反欺骗后端 AASIST 负责在该表示上做真假二分类,用谱时图注意力捕捉伪造痕迹;二者搭配的理由是前端提供通用听觉基础,后端提供针对伪造的判别结构,组合后只需更换或适配前端即可迁移到新的造假类型。
在训练方式上,冻结指预训练参数完全不动,只训练后端;微调指连同预训练网络一起更新,能取得更好的域内性能,但需要数百兆可训练参数,且对学习率等超参数敏感。论文还考察了传统路线,包括直接吃频谱图的残差网络和直接吃波形的后端网络,以及 3 种自监督表示在冻结与微调下的表现。音乐专用表示在音乐域内有优势,语音表示在语音和歌声上有优势,但没有一种冻结表示能同时解决 4 类跨类问题。
相关工作的空白在于,已有跨类型研究最多只涉及两类,没有覆盖语音、声音、歌声、音乐 4 类的基准,也没有系统回答是否存在跨类型不变的真伪特征。论文的第一项工作就是补上这个基准,把 4 类数据集统一到相同的采样率、时长与后端,便于公平比较。
任务难在哪里:单类训练为何跨类就失效?
论文把问题形式化为两类实验。第一类是单类训练跨类测试,即只用一类训练集训练,在 4 类测试集上分别报告等错误率,用平均值衡量泛化。第二类是 4 类联合训练,即把 4 类训练集拼在一起训练,再在 4 类测试集上分别评估。两类实验共用同一后端与同一预处理,便于分离数据多样性与方法改进各自的贡献。
单类训练失效的原因可以从数据与特征两方面理解。从数据看,不同类型的生成器完全不同,语音是文本转语音与声音转换,声音是基于文本描述生成的环境声,歌声是歌唱合成与转换,音乐是文本生成音乐,伪造痕迹分布不一致。从特征看,语音预训练模型偏重时序与语音频段,缺乏对全频段的显式建模,遇到音乐与环境声时容易把类型差异误当成真假差异。
下图直观展示了这种挑战的设定,左侧是造假者可产生任意类型音频,中间是单类对策只在对角线上有效,右侧是期望的联合训练的小波方法在 4 类上都有效。阅读时不要把该图当作性能证明,它只是任务定义的示意,真正的证据在后面的数字表与可视化中。
看图路径: 1. 先看左侧从造假音频分出语音、声音、歌声、音乐四个图标的主干;2. 再逐行检查单类训练的盾牌矩阵中对角线以外是否为红叉;3. 最后对比最右侧联合训练的小波方法一列是否全为绿勾
论文图 1。原论文 Figure 1:“The challenge for current single-type trained CMs toward cross-type ADD task, highlighting the effectiveness of our proposed WPT-SSL CM.”。
该示意的教学价值在于明确复述口径:所谓全类型不是做四分类判断音频类型,而是对任意类型都做二分类判断真假。后续所有表格中出现的语音、声音、歌声、音乐四列,都是同一真假任务在不同数据子集上的分项错误率,平均值用于汇总,但不能掩盖某一类的严重失效。
方法全景:一个样本如何走完冻结主干加可学习提示?
论文提出 2 级方法。第一级是提示调优的自监督范式,做法是在每个 Transformer 层的输入前拼接少量可学习提示向量,其余主干参数全部冻结,后端分类器正常训练。推理时,一个样本先被填充或截断到固定长度,经冻结卷积特征提取器得到初始嵌入,再与每层提示一起逐层通过编码器,最后把提示位置与音频位置的输出一起送入后端得到真假打分。
提示调优 × 微调: 提示调优只学习每层输入前附加的少量可学习向量而冻结主干,微调则更新整个自监督网络的全部参数;前者分工是给冻结模型加任务指令,后者分工是直接改写模型本身;搭配比较的意义在于验证冻结大模型加小提示是否足以完成真假判别,从而大幅降低训练参数并加快收敛。
第二级是小波提示调优,区别只在提示的初始化与构造。作者把提示分成普通提示与小波初始向量两部分,对后者做哈尔小波离散变换,得到低频与 3 个方向高频共 4 个子带,再拼接成小波提示。这种设计不增加可训练参数量,因为变换本身没有可学习权重,只是把同样的参数量重新组织成有频率含义的结构。
下图是两座塔的对照,左侧是普通提示,右侧是小波提示,底部虚线框说明了从初始向量到小波提示的构造过程。沿样本路径阅读时,重点看冻结与可调的标记分工,以及小波分支在何处汇入主路径。
看图路径: 1. 先沿底部波形经冻结特征提取器到多层编码器再到顶部分类器的主路径看数据流向;2. 再对比左右两塔在每层输入处普通提示与小波提示的颜色与数量差异;3. 最后看底部虚线框内从初始提示经离散小波变换到四个子带再拼接的变换步骤
论文图 2。原论文 Figure 2:“Our proposed PT-SSL-AASIST (left) and WPT-SSL-AASIST (right).”。
该图解释后可以复述完整流程:波形进入冻结特征提取器,每层编码器都接收上一层音频表示加上本层普通提示与小波提示,顶层输出进入可训练的后端,用加权交叉熵优化。小波分支的作用是让冻结的语音模型获得显式的频率感知能力,以便快速适应不同类型的频域分布。
提示如何逐层传递:公式中的符号与替换规则是什么?
先把符号讲清。设输入音频经填充截断后长度固定,冻结卷积输出的第一层输入记为音频嵌入,时间长度与隐层维度分别记为序列长度与特征维度。每层有各自的提示向量,提示数量是预设超参数,初始化采用 Xavier 均匀分布。编码器层本身冻结,只通过注意力与前馈计算改变表示,但提示位置的输出在进入下一层时会被本层新的可学习提示替换,这是深层提示调优的关键细节。
第一层的计算是把第一层提示与初始音频嵌入拼接后送入第一层编码器,得到提示位置输出与音频位置输出。原文把该过程写成拼接输入输出的映射关系,理解时抓住输入是可学习提示加冻结提取的嵌入,输出是更新后的两部分,其中提示部分下一层会被替换。
\[[Z1, E1] = L1([P1, E0]),\]从第二层开始,计算模式相同,只是音频输入换成上一层的音频输出,提示换成当前层的提示。逐层递推到最后一层后,把最后一层的提示输出与音频输出一起送入后端。这种每层都插提示的深层做法,与只在第一层插提示的浅层做法形成对照,后续消融会验证深层更优。
\[[Zi, Ei] = Li([Pi, Ei−1]), for i = 2, 3, ..., l.\]小波提示 × 普通提示: 普通提示是直接随机初始化并学习的向量,负责提供可调的任务偏置;小波提示是先初始化一组向量再做离散小波变换得到 4 个频带分量,负责显式携带低频与高频结构;二者拼接使用的原因是普通提示保留灵活的时序适配能力,小波提示补上语音预训练模型缺失的全频段感知,组合后模型可在不增加可训练参数的前提下关注类型不变的频率线索。
结合公式复述时要强调梯度路径:损失来自后端的真假监督,反向传播只更新提示向量与后端参数,不更新编码器与特征提取器。提示数量不宜过大,论文发现音频标记数为 201 时,提示取 10 左右最平衡,过多会稀释音频自身信息。
小波分支做了什么:四个子带如何变成可学习的频率提示?
小波分支的输入是另一组同样用 Xavier 初始化的向量,数量记为小波初始标记数。作者选用最简单的哈尔小波,其低通与高通滤波器是固定的系数向量。离散小波变换把该初始矩阵分解为低频分量与垂直、水平、对角 3 个方向的高频分量,每个分量尺寸减半,再重排成与其他提示同维度的向量,最后按顺序拼接成完整的小波提示。
从听觉动机看,不同音频类型的主要感知差异在频域分布,语音预训练模型偏重语音频段,而音乐与环境声需要更宽的频率覆盖。把部分提示显式组织成 4 个频带,相当于给每层提供 4 个有频率分工的可调槽位,模型可以通过训练决定更依赖哪个频带做真假判断。论文报告最优配置是 4 个小波标记加 6 个普通标记,恰好每个频带对应一个标记,但这是一个实验发现而非先验规定。
得到小波提示后,每层的输入变为小波提示、普通提示与上一层音频表示三者拼接,再送入冻结编码器。原文把该 3 路拼接的递推写成统一公式,最后一层的拼接输出同样送入后端。
\[[Zi, Ei] = Li([Wi, Pi, Ei−1]), for i = 1, 2, ..., l.\]需要指出,原文未报告小波变换内部是否参与梯度更新的具体实现细节,可验证的是变换滤波器固定、可训练量与普通提示相同。复述时不要声称模型学到了小波基函数,只能说模型学到了每个频带提示向量的取值,尤其是对角高频分量对应的位置在注意力中表现突出。
训练与推理如何组织:冻结谁、更新谁、用什么损失?
训练分为单类训练与联合训练两种协议,但优化机制相同。冻结对象是自监督前端的卷积特征提取器与全部 Transformer 编码器,更新对象是每层提示向量、小波初始向量对应的提示部分以及后端分类器。损失是加权交叉熵输出的 2 维真假打分,用于缓解真假样本不均衡。推理时不需要知道音频类型,同一模型对任意输入直接输出真假分数,再按阈值计算等错误率。
超参数按训练范式区分。微调采用较小的初始学习率与较小的批量,冻结、普通提示与小波提示采用较大的学习率与较大的批量。单类训练跑较多轮并按固定步数减半学习率,联合训练因数据量更大而轮数较少、减半更频繁。所有音频统一降采样到 16000 赫兹并截断或填充到相同采样点数,自监督特征对 4 秒音频的形状固定,便于批量处理。
论文还记录了收敛行为,冻结、提示与小波提示收敛明显快于微调,且提示类方法在训练曲线上波动较小。这对研究生复现的启示是,若计算预算有限,应先跑通冻结与提示基线,再尝试微调;微调在音乐等类型上还出现过不如冻结的情况,说明不能默认微调一定更好,需要按类型调参。
实验条件是什么:数据、划分与基线如何保证可比?
基准包含 4 类数据集。语音采用经典的语音伪造竞赛集,含大量真实与伪造样本,训练用部分攻击类型,测试用不重叠的攻击类型。声音采用编解码伪造集的子集,真实来自环境声描述集,伪造由音频生成模型按标题生成,再按比例随机划分为训练、验证与测试。歌声采用受控歌声伪造检测集,基于中文与日文歌唱数据与多种合成转换系统,按原协议划分训练与测试。音乐采用合成音乐检测集,真实来自带专业标注的音乐片段,伪造由多种文本生成音乐方法合成,真实按比例划分,伪造按生成方法划分以测试泛化。
基线覆盖传统与自监督两类。传统包括吃频谱图的残差网络和直接吃波形的后端网络;自监督包括音乐理解模型、语音任务模型与跨语言语音模型分别接同一后端,并区分冻结与微调。所有对策共用同一后端结构与同一预处理,单类与联合训练的评估都报告 4 类分项与平均等错误率。
复现时必须核对的关键条件是采样率、截断长度、频谱参数、批量与学习率是否与原文一致,以及音乐与声音的划分是否按生成方法隔离。论文未公开代码与模型权重,资源状态栏显示无可用链接,因此不能声称代码已公开,只能按文字描述复现。统计显著性与多次随机种子的方差在原文中未报告,比较时应留有余量。
主结果回答什么:在联合训练下谁最好、代价是什么?
主结果的核心问题是,当 4 类数据联合训练时,哪种前端加哪种训练范式能同时做好 4 类。公平条件是所有方法共用同一后端与同一数据拼接,指标是 4 类测试集上的等错误率越低越好。论文报告跨语言语音前端加小波提示在联合训练下平均等错误率最低,在语音、歌声与音乐上都取得最优或接近最优,只在声音上略高于微调。
下图展示了最后一层注意力在 4 类样本上的分布差异,是理解为何小波提示更稳定的直接证据。阅读时先看微调在 4 类上亮带分散且模式不同,再看普通提示集中在前部但跨类仍有变化,最后看小波提示是否在 4 类上都稳定聚焦同一高频位置。
看图路径: 1. 先按列确认语音、声音、歌声、音乐四种输入的注意力图是否纵向对齐;2. 再按行对比微调、普通提示、小波提示三行的亮带位置与分散程度;3. 最后放大观察小波提示行在前 10 个提示位置中哪一列最亮且是否跨类稳定
论文图 6。原论文 Figure 6:“Attention map of the final transformer in co-trained XLSR-AASIST.”。
该注意力图的解释是,微调对语音和歌声的注意力模式相近且整体偏高,对声音和音乐则呈现高低混杂,这与单类实验中语音与歌声互相迁移较好、声音与音乐互相迁移较好的现象一致。普通提示主要关注第一个提示位但数值不高,小波提示则稳定聚焦对应对角高频子带的第 4 个位置。论文据此提出,小波提示学到了类型不变的高频真伪线索,但这属于有限解释而非因果证明,仍需更多干预实验验证。
联合训练本身的收益也要单独说明。相比单类训练动辄百分之几十的跨类错误率,联合训练把平均错误率降到个位数,说明数据多样性是第一驱动力。在此基础上,小波提示相对微调仍有进一步降低,且可训练参数减少约 458 倍,这是方法附加值。代价是联合训练需要同时获得 4 类标注数据,且在声音单项上小波提示并未全面超越微调,不能声称每类都最优。
消融在验证什么:提示数量、位置与小波配比如何选择?
消融要回答 3 个操作问题。第一是提示数量取多少,论文在语音训练的跨语言语音模型上尝试从 2 到 200,发现取 10 时语音域内与平均值最平衡,过多提示会稀释音频标记。第二是提示放在何处,比较了只在第一层放、放在音频之后、最后一层丢弃提示等变体,发现每层前置且最后一层保留提示加音频的默认做法最优。第三是小波标记与普通标记的配比,发现 4 个小波加 6 个普通时平均最优,且恰好对应 4 个子带各一个。
下表是语音训练下冻结、微调、普通提示三者的对照,用于说明在单类训练跨类测试这种困难条件下,各范式的起点与差距。表前问题是,在只见过语音时,哪种调优方式跨类平均更稳。公平条件是同一前端与同一语音训练集,指标方向是等错误率越低越好。
| Countermeasure | Parm Speech | Sound | Singing | Music | AVG |
|---|---|---|---|---|---|
| FR-XLSR-AASIST 0.45M | 1.28 | 49.51 | 29.72 | 49.82 | 32.58 |
| FT-XLSR-AASIST 315.89M | 0.38 | 49.57 | 29.76 | 31.01 | 27.68 |
| PT-XLSR-AASIST 0.69M | 0.22 | 47.26 | 33.84 | 41.85 | 30.79 |
该表显示,微调在语音域内最好,但在声音与音乐跨类上仍然很高;普通提示在语音域内接近微调且平均略差于微调,说明仅靠普通提示不足以补上频率短板。未胜出项是冻结基线,它在跨类上最不稳定。结合正文可知,小波提示在该语音训练条件下的平均值进一步低于微调,且参数量与普通提示相同,这是引入小波的直接动机。
另一组对照比较提示的不同连接范式,同样在语音训练下评估 4 类分项。表前问题是,提示的深度与位置是否影响跨类稳定性。公平条件是提示数量相同、只改变插入与输出方式。
| Paradigm | Speech | Sound | Singing | Music | AVG |
|---|---|---|---|---|---|
| Shallow-PT | 0.75 | 45.29 | 39.87 | 44.24 | 32.54 |
| After-PT | 0.53 | 46.88 | 41.55 | 44.05 | 33.25 |
该表显示,默认的每层前置方案平均最优,浅层、后置与丢弃变体在歌声与音乐上各有损失。论文还报告全用小波标记时语音域内可更低,但其他类型明显变差,因此不取极端配比。复述时要强调,这些消融都是单类训练的结果,不能直接推广为联合训练下的最优,联合训练的最优仍需单独验证。
证据的边界在哪里:可视化支持什么、不支持什么?
论文用两类可视化支持类型不变的说法。第一类是后端分类层前嵌入的降维散点,每个类型随机抽取真实与伪造各 1000 条。报告的現象是,微调的真假区域内仍按类型分成小簇,而小波提示的真假区域内 4 类颜色互相重叠。第二类是上述注意力图,小波提示跨类聚焦同一高频位。两类证据方向一致,支持小波提示比微调更少依赖类型信息的判断。
下图是降维散点的像素证据,左侧为微调,右侧为小波提示。阅读时不要硬读具体坐标数值,只能比较簇的结构差异,并注意降维本身会扭曲距离,不能当作分类边界的证明。
看图路径: 1. 先看图例中颜色代表音频类型、叉号与圆点代表真实与伪造的分工;2. 再对比左右两幅散点中真实簇与伪造簇是否都形成左右分离;3. 最后检查左图簇内是否按颜色再分小团而右图同类颜色是否互相重叠
论文图 4。原论文 Figure 4:“T-SNE visualization for FT-XLSR-AASIST (left) and WPT-XLSR-AASIST (right).”。
该图的解释是,左右两图都实现了真实与伪造的大体分离,区别在簇内结构。左图同一真假侧内还能看出按颜色聚集的小团,右图则混合更充分。这种混合支持类型不变,但也带来局限:混合不等于错误率为零,联合训练的小波模型在歌声与音乐上仍有数个百分点的错误率。
类型不变性 × 注意力分布: 类型不变性指真假样本的嵌入按真假分开而不按语音、声音、歌声、音乐分簇,注意力分布指最后一层 Transformer 对不同输入位置的加权模式;前者是希望达到的表示性质,后者是观察模型是否做到该性质的窗口;论文把二者联系起来是因为若注意力在 4 类音频上都稳定聚焦同一小波高频提示位,则为类型不变判别提供了可检查的机制证据。
其他未验证边界包括,未测量推理延迟与显存占用随提示长度的变化,未报告多次种子的波动,未测试含噪声、压缩或部分伪造的更脏场景。论文的干净环境结论不能直接推广到野外,实际部署前需补上这些验证。
要复现先做什么:数据、超参与检查点如何对齐?
复现的第一步是按原文重建 4 类数据划分。语音按攻击编号隔离训练与测试,声音按 7 比 1 比 2 随机划分,歌声沿用原挑战协议,音乐对真实随机划分、对伪造按生成方法隔离。所有音频统一到 16000 赫兹并对齐到相同长度,频谱基线用固定的傅里叶点数、跳长与窗长,自监督特征的帧数与维度固定,便于检查数据管道是否正确。
第二步是对齐训练范式。先跑通冻结基线,再加普通提示,最后加小波提示。提示用 Xavier 均匀初始化,小波分支用固定哈尔滤波器做变换,编码器与特征提取器保持冻结,只更新提示与后端。微调单独用小学习率与小批量,其他范式用大学习率与大批量,学习率按轮数减半的策略也要区分单类与联合训练。
第三步是按问题组织评估。先做单类训练跨类测试,复现语音与歌声互迁较好、声音与音乐互迁较好的模式;再做 4 类联合训练,检查小波提示是否在平均值上优于微调与普通提示。记录训练参数量与收敛曲线,验证提示类方法收敛更快且参数更少的说法。由于原文未给出代码链接与随机种子,复现报告应写清环境、批量、轮数与划分脚本,并保留失败条件,例如音乐微调不稳定、提示过多导致下降等负结果。
何时值得尝试这种方法:结论、适用条件与下一步验证是什么?
综合全文,可复述的结论是,全类型检测需要数据多样性加频率感知两部分。数据多样性通过 4 类联合训练提供,把跨类错误率从单类训练的高位拉低;频率感知通过小波提示提供,在不增加可训练参数的前提下,让冻结语音模型获得 4 个频带的显式槽位,并在实验中稳定利用对角高频信息。这种组合在论文的干净基准上取得最低平均等错误率,且收敛更快。
适用条件很明确。当已有较强的语音自监督模型但缺乏针对每类的调参预算,或希望一个模型同时覆盖语音、声音、歌声与音乐时,优先尝试冻结加小波提示的联合训练。当只有单类数据时,不应期待跨类泛化,论文的单类结果已显示跨类错误率仍然很高,此时更务实的做法是先收集其他类型数据,而非只调方法。
下一步验证应补上原文缺项。包括在噪声、编解码与部分伪造下的鲁棒性,多次随机种子的稳定性,提示长度与批量对延迟显存的影响,以及小波子带真正因果性的干预实验,例如屏蔽某一子带后观察分项错误率的变化。只有补上这些,才能把类型不变从相关性观察推进为可部署的保证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



