英文题目:VerAno: Speaker Anonymization via Self-Supervised Tokenization and Conditional Flow Matching
会议身份:
conference:interspeech:2026:conference-paper-id:le26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#流匹配 #向量量化 #跨语言 #说话人匿名化
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Ngoc Hung Le:机构信息未能从会议 PDF 纯文本可靠映射
- Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
- Thien An Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Kyujin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人匿名化需输入原始波形并输出隐藏身份但保留内容与情感的语音,难点在于细粒度音色与语言韵律在连续特征中高度纠缠。VerAno先用语音编码器WavLM Large第18层抽取帧级连续特征,再经向量量化变分自编码器(Vector Quantized Variational Autoencoder,VQ-VAE)以受限码本离散化为内容令牌,过滤音色细节后与外部说话人池采样的目标说话人嵌入一起输入条件流匹配(Conditional Flow Matching,CFM)Transformer生成Mel谱,最后由声码器合成波形。与依赖语言相关自动语音识别(Automatic Speech Recognition,ASR)瓶颈或连续自监督特征的方法不同,该框架以码本大小 \(K\) 作为可调信息瓶颈来显式控制隐私与保真度的取舍。在VoicePrivacy Challenge 2024的LibriSpeech与IEMOCAP评测中,CB128配置在等错误率(Equal Error Rate,EER)平均达31.73%,显著高于B1的7.64%并接近B5的34.36%,同时词错误率(Word Error Rate,WER)保持2.53%的次优水平,情感无加权平均召回率(Unweighted Average Recall,UAR)达54.62%。该结论仅在英语训练与VPC半知情攻击及多语言LibriSpeech(Multilingual LibriSpeech,MLS)德葡意西四语有限测试下验证,未覆盖强自适应攻击与实时部署约束。原文未披露训练硬件与时长、推理时延与吞吐等部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,为什么不能直接混淆波形?
本文的输入是一段原始语音波形,目标是输出另一段匿名语音波形。匿名不是静音或加噪,要求听起来仍是自然人声,说的内容不变,情感和韵律尽量保留,但自动说话人验证系统难以判定原来说话人是谁。初学者容易把匿名理解为把波形整体变换一下,例如变调或加混响。论文指出这类信号处理方法易被重新识别,且容易损伤内容。
原因在于语音信号把多层信息叠在同一波形里:音素序列决定说什么,基频能量时序决定韵律情感,而频谱包络细结构携带音色身份。若只在波形层面做整体扰动,身份线索与内容线索仍纠缠,攻击者换一个验证模型就可能恢复。因此需要先解耦再重建:把与说话人无关的内容韵律抽出来,把说话人相关的音色替换掉,再合成新波形。评价也必须 3 维并行:隐私用等错误率衡量,越高表示越难识别;内容用词错误率衡量,越低表示可懂度越好。
情感用无加权平均召回衡量,越高表示情感保留越好。三者缺一不可,否则只看 1 维会误判。
已有路线卡在哪里,VerAno 与它们有何不同?
论文把已有工作分为信号处理与神经语音转换两大路线。信号处理路线如基于麦克亚当斯系数的变换,操作直接但论文认为易受重识别且内容失真较大。神经语音转换路线通常拆出音色与内容韵律,再用目标音色重建,在隐私和内容保留上整体更优。在内容表示的选择上,又分自动语音识别瓶颈特征与自监督特征。自动语音识别瓶颈依赖语言和文本标注,跨语言受限,且容易丢失副语言保真度。
连续自监督特征信息量大,能保留语义情感,但论文引用前人工作指出它会无意编码说话人音色,导致身份泄漏。合成侧则在自回归模型的误差传播与标准扩散模型的复杂随机采样之间摇摆,近期流匹配被用来求更直接的确定性路径。VerAno 的差异在于不换更大的识别器或声码器,而是把自监督连续特征先做受限向量量化,用码本大小做可调信息瓶颈,再用非自回归条件流匹配做声学重建。
跨语言基线选择了多语言变体的 B3-Mul,而非只与单语基线比较,这为后文跨语言泛化提供了同阶段对照。
要解决的核心矛盾是什么,什么算成功?
核心矛盾是隐私保护与下游可用性之间的拉扯。把身份抹得越狠,往往把发音和情感也抹掉;把保真度做得越高,又容易把音色残留带回来。论文把成功定义为在语音隐私挑战 2024 协议下综合排名靠前,而非单指标最高。具体做法是同时报告等错误率、词错误率和情感召回,并按平均排名与加权排名汇总,加权中隐私占 50%,内容与情感各占 25%。
这种加权明确惩罚偏科系统,例如只保内容不保隐私,或只保隐私不保可懂度。举例来说,一个把语音变成机械音的系统可能隐私很高,但词错误率和情感召回会崩,不算成功。反之,一个几乎复制原声的系统内容情感满分,但等错误率接近原始语音,也不算匿名。因此后文所有比较都要同时看三列,不能只挑一列。
沿一个样本走完全流程:从波形到匿名波形
假设输入是一句英文朗读。系统先做两路提取。一路把波形送入冻结的 WavLM 大模型,取第十八层输出,得到连续帧级特征,包含音素、风格与音色混合信息。另一路把同一波形送入说话人编码器得到 utterance 级嵌入,并在训练时还提取目标梅尔谱用于监督。连续 WavLM 特征进入向量量化变分自编码器分词器,被编码为连续隐变量,再按欧氏距离最近原则映射到码本中的某个向量,输出离散口令序列。
训练阶段,离散口令、原始说话人嵌入、加噪梅尔谱状态与时间步共同进入流匹配变换器,学习预测直线路径速度。推理匿名阶段,关键替换发生:不再用源说话人嵌入,而是从外部说话人池中随机采样一个目标说话人向量,每个 utterance 选一个不同的目标身份。离散口令与该目标向量共同条件化流匹配变换器,从噪声出发经由常微分方程求解生成目标梅尔谱,再经由声码器转成波形。最终听感是内容韵律接近原句,但音色变为池中另 1 人。
下图为论文给出的整体架构,是理解训练与推理分支如何共用同一变换器的关键,建议先看主路径再看颜色图例。
看图路径: 1. 先沿左下黄色原始音频出发,分别走向语音编码器与梅尔谱提取、说话人编码器三条分支;2. 再看上方黄色虚线框内 VQ-VAE 如何输出绿色离散口令并汇入中间红色流匹配变换器;3. 对照右上图例区分虚线独立训练、红色仅训练、蓝色仅推理以及雪花冻结符号;4. 最后沿蓝色推理箭头看目标说话人池、声码器到右下棕色匿名音频的闭环
论文图 1。原论文 Figure 1:“The overall architecture of VerAno.”。
该图显示左下黄色原始音频分出 3 条红黑箭头:向上经冻结的 WavLM 进入上方黄色虚线框的 VQ-VAE 并输出绿色离散点序列;向中经梅尔谱提取进入红色流匹配变换器;向下经冻结的说话人编码器同样进入该变换器。变换器下方还有时间步与初始噪声输入,上方标出条件流匹配损失。推理时蓝色箭头从底部紫色说话人池接入变换器,再向右经虚线声码器生成右下棕色匿名音频。
冻结雪花标记明确落在语音编码器与说话人编码器上,虚线框表示独立训练,红色表示仅训练,蓝色表示仅推理。这种画法把内容分支、身份分支与声学目标分支的汇合点讲清楚了,后文组件节将分别展开分词器与变换器的计算。
分词器如何做可调过滤,变换器如何做条件生成?
分词器部分,记连续特征为编码器输出,码本为可学习的 K 个向量。编码得到连续隐变量后,对每 1 帧计算与所有码向量的平方距离,取最小者索引作为离散口令,再用对应码向量重建。损失由三项加权组成:重建损失迫使离散后仍能还原输入,码本损失把码向量拉向编码输出,承诺损失把编码输出拉向所选码向量,其中后两项通过停止梯度实现双向解耦更新。
论文把标准结构 repurposed 为身份过滤器:优化目标迫使网络优先编码方差最大的成分,即音素内容与宽泛韵律结构。当 K 受限时,码本带宽不足以编码高频细粒度音色细节,这些细节被迫丢弃;当 K 放大时,瓶颈放松,更多说话人特征泄漏进口令,保真升而隐私降。用自监督分词替代自动语音识别瓶颈的好处是避免刚性语言依赖。
自监督特征 × 向量量化变分自编码器: 自监督特征指 WavLM 从波形学到的连续帧级表示,信息容量大,同时混有音素、韵律和音色;向量量化变分自编码器负责把该连续向量映射到最近的码本向量,实现强制离散。二者搭配的理由是连续自监督特征保留细节但会泄漏身份,离散瓶颈则只保留重建所需的主导方差,从而在保留语义韵律的同时滤除细粒度音色,组合意义是得到可调的信息过滤器。
变换器部分,目标是从简单先验噪声生成复杂梅尔谱分布。给定噪声样本、目标梅尔谱与噪声参数,经线性插值构造中间流状态,时间步在零到一均匀采样,其导数给出恒定目标速度。网络输入包括对齐的离散口令序列与说话人嵌入。口令经嵌入矩阵投影为语义嵌入,加噪状态经多层感知机投影为声学嵌入,二者相加形成隐序列。
全局条件采用解耦策略:时间步经正弦位置编码加多层感知机得到时间特征,说话人嵌入经另一多层感知机得到身份特征,二者逐元素相加形成统一全局向量,再通过自适应均方根层归一化调制网络激活。训练目标是回归预测速度场与目标直线路径速度的均方误差。推理时求解常微分方程得到梅尔谱,再用预训练声码器转波形。
离散口令 × 说话人嵌入: 离散口令是经过码本量化后的内容侧符号序列,负责携带说什么和大致怎么说;说话人嵌入是来自说话人编码器的 utterance 级全局向量,负责提供要合成谁的声音。二者搭配是因为匿名需要拆开内容与身份,组合时把内容口令与目标说话人嵌入共同作为流匹配变换器的条件,从而用 чужой 音色说原内容,实现身份替换而非简单失真。
条件流匹配 × 常微分方程求解器: 条件流匹配负责学习从噪声分布到梅尔谱分布的确定性速度场,给定口令、说话人嵌入和时间步预测直线插值路径的速度;常微分方程求解器负责在推理时沿该速度场积分,从噪声逐步生成梅尔谱。二者搭配避免了自回归的误差累积和标准扩散的随机复杂采样,组合意义是非自回归、高保真地把离散条件还原为连续声学特征。
匿名策略强调不用人工操纵的说话人嵌入,而是从外部池随机采样,以避免高估保护能力。池子按论文实现来自训练集的一部分,每说话人取随机一句的嵌入,推理时每句换一个目标。
哪些参数训练,哪些冻结,优化如何组织?
论文明确分开 3 个模型的训练。分词器采用 RepCodec 实现,把基础卷积编解码块换成 Vocos 骨干,输入为 WavLM 大模型第十八层特征。分词器训练 152000 步,批量三十二,用 AdamW 优化器,学习率等超参数在实现细节中给出,损失权重分别对应重建、码本与承诺三项。声学模型为 16 层十六头、隐维度 768、前馈维度 3092 的变换器,训练 400000 步,批量三十二,同样用 AdamW,噪声参数设为极小值。
语音编码器 WavLM 与说话人编码器在训练期间冻结,图中用雪花标记表示,声码器采用预训练的基于 HiFi-GAN 的实现。流匹配训练时需要三元组:噪声、目标梅尔谱与条件,时间步均匀采样,目标速度为解析导数,网络只做回归,不做随机采样。这种组织把内容解耦与声学建模解耦:分词器先独立训练好,再固定其输出作为变换器的条件,避免联合训练时身份泄漏路径难以归因。论文未报告梯度是否回传到 WavLM,未报告处即为缺项,不从冻结符号外推其他实现。
推理求解用 10 步欧拉法,属于确定性积分步骤少、速度较快的配置,但论文未给出延迟与实时率实测,后文限制节会说明。
数据、划分、指标与基线如何保证可比?
训练数据为 LibriSpeech 与 CREMA-D 的标准训练划分,分词器、声学模型与声码器均在此上训练。评估遵循语音隐私挑战 2024 协议,用 LibriSpeech 开发集与测试集的干净子集评估隐私与语言内容,用 IEMOCAP 开发集与测试集评估情感保留。隐私指标为半知情攻击下的等错误率,由在匿名化训练集上训练的验证系统计算,越高越好。内容指标为官方识别模型的词错误率,越低越好。情感指标为官方情感识别系统的无加权平均召回,越高越好。
跨语言泛化按前人评估方案,用多语言 LibriSpeech 的德语、葡萄牙语、意大利语、西班牙语子集,隐私同时对半知情验证与在原始 VoxCeleb 上预训练的 ECAPA 模型评估,语言效用用 Whisper 大模型评估。基线为官方 B1 到 B6 完整套件,跨语言时用 B3 的多语言变体。说话人池来自训练干净集,每说话人取随机一句的嵌入。实现上分词器码本从三十二到一万两千八百八十八多个取值,分别记为 CB 加数字,主报告聚焦 CB128 与 CB8192 两个 operating 点。
下表整理论文报告的训练与推理关键配置,数字均来自实现细节连续原句,用于复现时核对批量、步数、优化器与损失权重。
| 配置对象 | 训练步数与批量 | 优化器与学习率 | 损失权重或模型维度 | 推理求解与声码器 |
|---|---|---|---|---|
| 分词器 | 152k 步,批量 32 | AdamW,2e-4 | 权重 30,0.2,0.9 | 独立训练 |
| 声学变换器 | 400k 步,批量 32 | AdamW,8e-5 | 16 层 16 头,768 维 3092 维 | 10 步欧拉 |
| 编码与声码 | 冻结 WavLM 与说话人编码器 | WavLM 第 18 层 | ReDimNet 编码,外部池采样 | HiFi-GAN 声码器 |
上表说明复现时先准备冻结的特征与身份编码,再按步数与批量训练分词器与变换器,最后用 10 步欧拉与预训练声码器推理。未给出的权重下载链接与硬件耗时属于缺项,资源状态证据显示本次没有验证到可用的代码模型数据链接,因此不能声称已公开可运行。
主结果:谁在隐私与效用上同时站住了?
比较的问题是,在相同开发测试集与相同三指标下,VerAno 的两个码本配置相对 6 个官方基线是否同时保住隐私与效用。公平条件是均按挑战协议的半知情等错误率、官方识别词错误率与官方情感召回计算,开发测试取平均。指标方向为等错误率越高越好,词错误率越低越好,情感召回越高越好。
| 系统 | 词错误率平均值 | 情感召回平均值 | 等错误率平均值 | 内容排名 | 隐私排名 |
|---|---|---|---|---|---|
| B5 个基线 | 4.55 | 38.13 | 34.36 | 第 5 | 第 1 |
| CB128 | 2.53 | 54.62 | 31.73 | 第 2 | 第 2 |
| CB8192 | 2.20 | 57.51 | 23.13 | 第 1 | 第 5 |
上表显示 CB8192 在语言与情感效用上拿下第一,词错误率平均 2.20,情感召回平均 57.51,但等错误率平均 23.13 落到第五,说明保留更多声学细节时残留了说话人线索。CB128 更均衡,词错误率平均 2.53,情感召回平均 54.62,均排第二,等错误率平均 31.73 排第二,仅比第一的 B5 低约 3 个百分点左右,而 B5 的内容与情感明显塌陷。原始语音的词错误率(%)平均 1.82、情感召回 70.07、等错误率 5.16 可作上限与下限参照:任何匿名系统的效用不应远离原始语音的内容水平,隐私必须远高于原始语音。
论文进一步按平均排名与加权排名汇总,加权隐私占一半,CB128 与 CB8192 拿下综合前 2 名,而偏科的 B1 与 B2 偏向效用牺牲隐私,B4 与 B5 偏向隐私牺牲可懂度。未胜出项同样重要:B2 词错误率平均 10.20 明显差,B6 三项均靠后,说明不是所有神经路线都自动兼顾。限制是这些平均只覆盖英语干净集与 IEMOCAP 情感集,未测量噪声、口音与实时延迟,不能推广到所有部署条件。
跨语言:只用英语训练能否处理没见过的语言?
跨语言要回答的是,仅在英语上训练的分词器与变换器,面对德语、葡萄牙语、意大利语、西班牙语时是否仍能压住原始验证并保持可懂度。对照是多语言训练的 B3-Mul,条件包括对原始预训练验证与半知情验证两种攻击,以及 Whisper 评估的词错误率。论文报告在标准验证下两系统都把等错误率推到 40% 以上,接近随机猜测,说明基本匿名有效。在更严格的半知情攻击下,CB128 更稳定,持续优于 B3-Mul。
效用侧,纯英语训练的 CB128 词错误率与多语言基线可比,但 B3-Mul 在部分语言仍有优势,例如德语与西班牙语的词错误率更低。这支持论文的判断:自监督分词捕捉的是通用声学音素结构而非特定语言音素,因此有一定跨语言能力,但不能声称全面超越多语言系统。未评测边界包括没见过的语系、代码切换与低资源语言,表中原始验证在某些语言接近零的极低等错误率只说明原始系统极易识别,不代表匿名后绝对安全。
码本从小到大,隐私与效用如何此消彼长?
消融要验证的机制是码本大小作为信息瓶颈是否单调可调。论文扫描从 32 到 12888 的多个取值,固定其他训练推理条件,观察等错误率、词错误率与情感召回的变化。预期是码本增大带来更细的声学粒度,效用升而隐私降;码本减小则反之。
下图是论文的码本消融曲线,上为隐私,下为内容与情感,是全文权衡证据的核心。
看图路径: 1. 先看上方面板蓝色等错误率曲线随码本增大而单调下降的斜率变化;2. 再看下面板橙色词错误率下降与紫色情感召回上升是否同步;3. 对比 32 到 128 区间效用陡变与隐私微降的拐点位置
论文图 2。原论文 Figure 2:“Ablation study of applying different codebook size.”。
该图上方面板纵轴为等错误率百分比,越高表示隐私越好,横轴为码本大小,蓝色曲线从 32 时的 32.76 经 128 时的 31.73、1024 时的 27.54、4096 时的 25.05、8192 时的 23.13 一路降到 12888 时的 18.5,呈单调下降。下面板左轴为词错误率(%)越低越好,橙色曲线从 2.9 降到 2.53、2.49、2.35、2.2、2.18;右轴为情感召回越高越好,紫色曲线从 50.46 升到 54.62、55.3、56.68、57.51、58.63。关键非线性在于 32 到 128 区间效用大幅改善而隐私只微降,而 8192 到 12888 区间隐私指数级恶化而效用收益递减。论文据此建议隐私敏感应用选 32 到 128 的低位 operating 点,既剥离音色判别特征,又保留必要音素韵律。
码本大小 × 隐私效用权衡: 码本大小指可学习码本中向量个数 K,决定瓶颈带宽;隐私效用权衡指等错误率越高越好而词错误率越低越好之间的此消彼长。K 受限时网络只能优先编码音素和宽泛韵律,细粒度音色被丢弃,隐私升而保真略降;K 放大时更多说话人残留泄漏,效用升而隐私降。组合意义是 K 成为可调旋钮,论文用 32 到 12888 的扫描验证了该单调与非线性关系。
该消融不支持无代价改进的说法,任何效用提升都有隐私代价,反之亦然。未验证的是码本与其他超参数的交互,例如变换器容量或求解步数变化时曲线是否平移,需要补做联合扫描才能确认。
综合排名如何惩罚偏科,VerAno 为何拿前两名?
排名问题是单指标第一是否等于系统最好。论文用平均排名与加权排名汇总情感、词错误与等错误三项排名,加权隐私占 50%,另两项各占 25%,显式惩罚牺牲 1 维换另 1 维的做法。公平条件是所有系统都取相同三项的排名再聚合,不单独剔除不利基线。
| 系统 | 情感排名 | 词错误排名 | 等错误排名 | 平均排名 | 加权排名 |
|---|---|---|---|---|---|
| B5 | 6 | 5 | 1 | 3 | 3 |
| CB128 | 2 | 2 | 2 | 1 | 1 |
| CB8192 | 1 | 1 | 5 | 2 | 2 |
上表显示 B5 虽隐私第一,但内容情感排名靠后,综合只能到第三。CB8192 效用双第一但隐私第五,综合第二。CB128 三项均为第二,综合第一。这支持论文打破僵局的表述:CB128 达到接近 B5 的隐私而没有出现效用崩塌,CB8192 在语言清晰度与情感保留上全面超过基线。反例是 B1 内容第三但隐私第七,B2 情感第三但内容第八隐私第八,综合均靠后,说明偏科在加权下被放大。限制是排名依赖所选基线集合与权重,若换权重或加入更强的新基线,名次可能变化,不能把排名当成绝对性能证明。
哪些结论有直接证据,哪些还只是推测?
直接报告的是英语干净集上的三指标均值与排名,以及码本扫描的单调权衡曲线,这些有表格与曲线支撑。有限解释的是跨语言泛化,证据限于 4 个欧洲语言子集与两种验证设置,支持通用声学结构的说法,但未覆盖远距离语系与真实噪声,不能推广为任意未见语言都有效。未验证推测包括实时部署与设备端隐私应用,论文未来工作提到用蒸馏加速流匹配推理,但本次未报告延迟、计算量、内存与输出帧率,因此不能承诺更快或更省。
资源方面,本次收到的证据未绑定可验证的代码模型数据链接,不得声称已公开,只能按论文文字复现流程。评价方面,未测量主观听感、误判率置信区间与显著性检验,总体趋势不等于每组每句都成立。相关性不等于因果:码本与隐私的相关不能证明所有身份泄漏都经由该瓶颈,仍可能有韵律残留。
要复现,先做什么,需要哪些信息条件?
复现先做数据与协议对齐:准备 LibriSpeech 与 CREMA-D 训练划分,按挑战 2024 协议切出开发测试干净集与 IEMOCAP 情感集,固定半知情验证、官方识别与官方情感 3 套评估,避免自换模型导致指标方向混乱。其次准备冻结模型:WavLM 大模型取第十八层,ReDimNet 说话人编码器冻结,从训练干净集每说话人取随机一句构建外部池。接着训练分词器与变换器,核对批量、步数、优化器与损失权重,码本先做 128 与 8192 两个点,再扩展到 32 到 12888 的扫描。推理时每 utterance 随机采样不同目标身份,用 10 步欧拉求解梅尔谱,再经 HiFi-GAN 声码器转波形。
关键超参数包括分词器损失权重三十、0.2、0.9,变换器 16 层十六头隐维度 768,噪声参数极小值。缺项是论文未给出随机种子、硬件预算与训练时长,未给出池大小与采样细节的完整脚本,复现时需记录这些才能保证可比。若要验证跨语言,需另备多语言子集与 Whisper 评估,保持与 B3-Mul 相同的攻击设置。
何时值得尝试,还需补哪项验证?
当任务要求同时保住可懂度、情感与隐私,且希望有一个可调旋钮在不同场景间切换时,值得尝试该路线。例如隐私要求极高时选小码本,内容情感要求极高时选大码本,而不是维护两套异构系统。当目标语言超出英语时,可先用英语 checkpoint 做零样本试探,但必须在目标语言上重测半知情攻击与可懂度,不能直接部署。还需补的验证包括噪声与远场下的三指标、主观自然度与说话人相似度听测、推理延迟与内存实测,以及码本与变换器容量的联合消融。
常见误解是把离散等同于完全脱敏,实际上大码本仍会泄漏细粒度音色;把流匹配等同于更快,实际上步数与网络规模共同决定延迟,未实测不能断言。总体上,论文的贡献是用受限自监督分词把权衡显式参数化,再用条件流匹配保证重建质量,综合排名与码本曲线是其最强证据,代价是任何 1 维的提升都要在另 1 维付费。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

