英文题目:VoiceFX: CLAP-Based Audio Quality Improvement for Singing and Speech
会议身份:
conference:dafx:2026:conference-paper-id:DAFx26_demo_62
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#众包评测 #多模态学习 #音乐 #语音 #语音增强
评分:5.0/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Elena Georgieva:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理演唱与朗读录音的自动质量改善,输入为含噪声、齿音、浑浊、低频轰鸣与混响的15秒人声片段,输出为经效果器补救后更接近干净隔离人声的音频,难点在于非专家难以选择合适处理且嵌入指标未必符合听感。方法链第一步由降质构造负责注入5类失真以拉开质量差异,输出1000个原始片段进入嵌入评估。第二步由嵌入评估负责用对比语言音频预训练CLAP计算音频与6条文本提示的相似度,其推荐的补救类型进入补救应用。第三步由补救应用负责对全部文件施加8种中强两档去噪去混响去齿音去轰鸣去闷处理,输出8000个补救片段进入人工验证。第四步由人工验证负责以参考对比打分检验嵌入选择是否成立,从而回判推荐有效性。与依赖工程师试听修音的已有方法相比,该机制差异在于用语义相似度替代人工干预来推荐处理,具有零专家介入即可批量筛选的实际意义。在含234名听众的听感评测任务下,强档去噪条件的听众得分为-0.26,高于中档去噪条件的听众得分-0.32。结论适用边界仅限人工合成降质与固定参数补救组合,尚未验证真实手机录音、音乐混音与连续参数优化的外推效果。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://sourceforge.net/projects/sox/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.ffmpeg.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
这篇解读的输入是 2026 年数字音频效果大会展示论文的正文与两张官方热图像素,目标是让刚进入语音音乐音频领域的研究生能够核对关键做法并用自己的话复述完整方法。必须保留的信息包括数据来源与切分数量、5 种劣化的具体参数、4 种补救的中档与强档设置、六句文本提示的写法、听感实验的招募与筛选流程、两类主结果的数字与方向。
输出按学习依赖展开,先讲任务为什么需要自动质检,再讲相关路线如何用语言描述控制效果,然后走完从原始录音到劣化再到补救再到嵌入打分与人工打分的全链路,最后讲复现时先做什么。文中白话例子会明确标为例子,不把例子当作论文报告的数值。凡是说报告或显示,指论文正文或表格直接给出的内容,凡是说支持,指有对照但证据有限的判断,凡是说可能或待验证,指原文没有测量因而不能承诺的推测。
人声在日常听觉中最容易抓住注意力,手机与廉价话筒让录音数量大增但质量参差不齐,传统做法是请音频工程师用均衡去嘶降噪等工具逐个修补。作者想解决的问题是内容太多时无法每次都靠人工质检,而且非专业用户也不会调效果器,因此提出不依赖听众输入也不依赖工程师介入的自动改善流程。做法是先用可控的劣化把质量差异放大,再用对比语言音频预训练模型估计录音与理想描述的接近程度,并据此推荐补救。
关键矛盾在摘要已经点出,嵌入模型能编码部分质量信息,但它偏爱的强降噪恰恰是听众不喜欢的版本,说明增强带来的感知伪影没有被嵌入分数抓住,所以感知验证仍然必要。
同输入同目标的前人做了什么,本文接在哪一步?
语义音频制作这条路线想让用户用自然语言描述想要的感知变化,例如让声音更温暖,然后把描述映射到均衡或混响等参数。社交采集与众包词表研究说明人们如何用自由词汇描述效果前后的差异,界面工作则把温暖明亮等词与底层参数绑定。另一条路线是语音增强本身,包括去噪与去混响的长期研究,以及面向清晰度和语音命令识别的框架,还有面向人声的商业插件。作者的定位是把语义控制的思路从控制效果推广到估计质量并推荐补救。
直接前身是文本到效果器的工作,该工作用对比语言音频预训练嵌入以开放语言提示控制均衡与混响,用了 30 条音频刺激。本文把刺激规模扩大到 940 条录音的量级,并把焦点收窄到歌唱与朗读两类人声。需要提醒初学者,同输入同目标的比较才有意义,类别不同的效果控制实验不能直接当成本文质量推荐的基线胜负。本文也没有把商业插件作为可运行基线来同条件对比,因此不要把相关工作段落读成谁赢了谁。相关工作的价值在于给出术语与评估习惯,例如用成对试听加自由描述来积累语料,以及用李克特量表收集更像理想录音的程度,这些习惯在后文方法中都有对应。
要回答的具体问题是什么,理想录音如何定义?
具体问题是对于已经劣化的人声录音,4 种补救能否让它在感知上更接近理想,以及对比语言音频预训练给出的相似度排序是否与人耳排序一致。理想被写成一句英文提示,大意是隔离良好、录制良好的人声,所有评分都围绕是否更像这句话展开。劣化覆盖背景噪声、刺耳齿音、低频轰头、混响过多、发闷 5 类,补救对应为降噪、去嘶、去轰头、去闷 4 类,每类补救分中档与强档。
举一个教学例子帮助理解流程但不代表论文数值,例如一条朗读先被加入粉噪,再分别做轻度降噪与重度降噪,模型可能给重度更高分,而听众可能觉得重度有断续感反而打低分。这个例子只是说明代理指标与感知可能背离,真正数字以后文表格为准。问题的难点在于录音内容本身有朗读与卡拉 OK 两种风格,话筒与环境差异大,效果器参数稍有不同就可能引入新的可闻痕迹,因此必须同时报告嵌入分数变化与人工评分变化,并检查两者是否同向。
从一条录音到推荐结果,全链路经过哪些站?
先沿一条样本走完全程。输入是一条 15 秒的人声片段,来自有声书朗读或卡拉 OK 演唱,先做响度归一化。然后按预设进入劣化或保持干净,劣化用粉噪参量均衡低架提升高架衰减与混响等手段实现。接着对同一条原始劣化版本生成 8 个补救版本,4 种类型各两种强度,做完再做 1 次响度归一化。每个音频文件都被送入对比语言音频预训练的音频编码器,六句文本提示被送入文本编码器,双方在共享空间计算相似度,其中与理想句的相似度决定所谓整体最优。最后在听感实验中让参与者先听劣化前版本,再逐个评价 4 个补救加一个重复原版的隐藏对照,给出负二到正二的相对评分。
白话先行,对比语言音频预训练是一种把声音和文字放进同一向量空间的模型,英文名为 Contrastive Language-Audio Pretraining,后文简称 CLAP。共享嵌入空间指声音向量与文字向量可以直接算相似度的地方。六句提示都以这是某种声音开头,分别对应干净、发闷、刺耳、有背景噪声、有回声、低频轰头。作者为每种劣化写了一句匹配的描述,例如闷对应低架滤波的描述,轰头对应低频提升的描述,这样相似度变化才有可解释的对照。整个链路没有训练新模型,而是调用已有 CLAP 做推理加规则化推荐,听感实验用来检验推荐是否成立。
劣化是如何施加的,参数与工具是什么?
劣化阶段的目的是让不同版本之间的差异对非专业听众也明显。1000 条 15 秒片段中 500 条有声书 500 条卡拉 OK,其中 800 条被施加 5 种常见问题,200 条只做归一化作为干净对照。噪声用 SoX 生成的粉噪按两种幅度比加入,低噪声 80 条高噪声另外 80 条,每组各含 40 条朗读与 40 条卡拉 OK。刺耳用参量均衡在 6.5 千赫提升 24 分贝完成,共 160 条。轰头用低架在 150 赫提升 24 分贝完成,共 160 条。
混响用 SoX 两种配置做轻重两档,发闷用高架在 4 千赫衰减 24 分贝完成,各 160 条。所有片段都用 FFmpeg 做欧洲广播联盟响度归一化。第三方工具链接本次可达,其中 SoX 与 FFmpeg 资源状态为可用。
对比语言音频预训练 × 共享嵌入空间: 对比语言音频预训练负责把音频片段和文字描述分别编码为向量,共享嵌入空间负责让这两类向量可以直接比较相似度,二者搭配的理由是作者想用一句理想描述作为标尺来给录音打分,组合后新增的作用是无需人工试听就能对每个补救版本排序并挑出所谓整体最优。
劣化 × 补救: 劣化负责把录音质量差异放大到非专业听众也能察觉的程度,补救负责用相反方向的效果器把特定问题拉回来,二者搭配的理由是只有成对出现才能检验推荐是否找对了原因,组合后新增的作用是形成劣化类型与补救类型的对应关系表,便于分别考核每对组合的嵌入分数变化和听感评分。
理解劣化参数时要注意单位保留原文写法,例如提升用正分贝加中心频率与品质因数一起描述,不能只记一个数字。劣化不是为了模拟所有真实场景,而是为了让每种补救都有明确要修的对象,这种成对设计是后文表格按意图配对分析的前提。
补救是如何施加的,中档与强档差在哪里?
补救同样每种对应一种劣化,每种分中档与强档。噪声与混响都用同一个降噪库处理,中档比例下降参数为 0.7,强档为 1.0,作者称之为降噪。轰头用 1 阶高通处理,截止频率分别为 80 赫与 260 赫,作者称之为去轰头。发闷用高架在 4 千赫分别提升 12 分贝与 24 分贝,作者称之为去闷。刺耳用 FFmpeg 去嘶工具阈值 0.5 与 1.0 处理,作者称之为去嘶。每个补救做完都重新做响度归一化,8 个补救乘以 1000 条得到 8000 个补救后文件,另有 1000 个原始文件。
降噪 × 频谱门控: 降噪是本研究要达成的功能目标,频谱门控是所用降噪库的真实计算手段,分工是前者定义要去掉背景噪声和混响残留,后者按比例压低估计为噪声的时频单元,搭配理由是作者想用同一工具同时处理噪声和混响两类劣化,组合的实际意义是强弱两档压制比例不同,听感上强档更容易出现断续感。
高架滤波 × 去嘶声: 高架滤波负责在 4 千赫附近整体提亮或压暗以处理发闷问题,去嘶声负责在 6 千赫附近压制齿音过强导致的刺耳感,分工是一个管整体明暗,一个管局部齿音,搭配理由是闷和刺耳在频谱上位置不同需要不同工具,组合后覆盖了两种与高频能量分布直接相关的劣化。
初学者常问为什么噪声与混响共用降噪,原文确实如此安排,理由是同一频谱门控工具既能压背景噪声也能压部分混响尾巴,但后文结果显示这种复用在听感上代价很大。去轰头用 1 阶高通属于比较温和的处理,如果录音本身低频噪声不多,听众可能难以察觉,这也解释了作者在讨论中说中档阈值可能设得太低。
本研究训练了什么,没有训练什么,真实计算是什么?
本研究没有训练阶段,没有报告新的神经网络权重更新、优化器、轮数、损失曲线或梯度路径,也没有冻结与解冻的说明,不能从模型名称推定实现细节。
真实计算分为 3 类,一是用现成音频效果与库做仿真,包括 SoX 粉噪与混响、FFmpeg 均衡高通去嘶与响度归一化、降噪库的频谱门控,二是调用已有 CLAP 做推理,把每个音频与六句文本分别编码并算相似度,三是按规则挑选整体最优,即在同一组内取与理想句相似度最高的文件,若它不在随机抽到的 4 个补救与原版重复项之中,就替换掉同类对应项。听感数据的收集与清洗属于标注流程而非模型训练,包括资格限制、知情同意、耳机检查、隐藏对照与异常剔除。
因此复现时不需要准备训练算力,需要准备的是音频处理环境与 CLAP 推理环境,以及在线问卷与被试招募渠道。缺项要明确指出,原文未给出 CLAP 具体版本权重与相似度归一化细节,未给出混响器除轻重之外的完整参数,未报告推理耗时与系统延迟,这些缺项不算技术错误,但在复现时必须自己固定并记录,否则分数无法对齐。
数据如何划分,听感任务如何组织,量表方向是什么?
数据侧的比较问题是不同劣化与补救是否在相同内容分布上比较,公平条件是朗读与卡拉 OK 在各劣化组内大致均衡且都做响度归一化,指标方向在 CLAP 侧是与理想句相似度越高越好,在听感侧是相对原版更像理想录音得分越高越好。下表把原文分散在段落中的构造数字整理成五列,便于核对每类劣化各有多少条以及两种内容如何分配,表中数字与单位均来自原文连续句,表头为整理者所加但不改变数值本身。
| 劣化分组 | 处理方式与参数 | 组内总数 | 其中朗读 | 其中卡拉 OK |
|---|---|---|---|---|
| 低背景噪声 | 粉噪幅度比 0.02 | 80 条 | 40 条 | 40 条 |
| 高背景噪声 | 粉噪幅度比 0.1 | 80 条 | 40 条 | 40 条 |
| 轰头与发闷等 | 低架高架与混响 | 160 条每类 | 80 条每类 | 80 条每类 |
| 干净对照 | 仅归一化 | 200 条 | 未单独报告 | 未单独报告 |
上表主要解决可核对性,收益是能快速定位每种意图配对的分母,代价是干净组的内容分布原文没有单独拆分,不能自行脑补。未胜出项在后文结果中出现,例如强档去闷与强档去嘶在 CLAP 侧反而下降,这与构造时以为对症就能加分的直觉不同。听感任务组织为每轮先听劣化前录音,再逐个评价 5 个文件,其中 4 个是随机抽取中档或强档的补救,一个是原版重复作为捕获试次,评价维度是相对原版更像还是更不像理想录音。量表为负二到正二,正二表示更像理想,负二表示肯定不更像,零为既不更也不少,量表中正一与负一原文没有展示文字,只保留刻度位置。
嵌入分数说了什么,哪个补救在 CLAP 下涨得最多?
嵌入侧要测的是意图补救是否在同劣化组内带来最高相似度,比较对象是同一劣化下的无处理与 7 种非意图补救,公平条件是同一批音频同一句理想提示同一相似度计算,指标方向是分数越高越接近理想。下图是全部劣化与补救交叉的平均 CLAP 相似度热图,颜色按补救前后平均变化着色,越蓝表示应用补救后与理想句更相似,阅读时先看行列布局再看最下一行的深蓝。
看图路径: 1. 先看横轴六种劣化列与纵轴九种补救行的交叉布局,确认左下到右下的数值含义;2. 再对比最下一行强档降噪与其他行的颜色深浅,判断哪种补救在嵌入分数上最突出;3. 最后观察去闷与去嘶声行在闷和刺耳列的颜色偏暖位置,确认嵌入分数下降的格子
论文图 1。原论文 Figure 1:“Heatmap of average CLAP similarity scores for all degradation–remedy pairs.”。
从像素可见最下一行强档降噪在六列全部深蓝,数值在 11.20 到 11.28 之间,明显高于无处理行在 8.48 到 9.91 之间的水平,中档降噪行在闷列达到 10.89 也偏蓝,而去闷强档在闷列为 9.06 偏红,去嘶中档在噪声列为 7.80 偏红,说明并非所有对症处理都能提升嵌入分数。下表按意图配对汇总平均变化,强档降噪在高噪声上平均提升最多,其次是强档降噪处理重混响,中档去嘶处理刺耳与中档降噪处理轻混响有中等增益,而去闷两档与强档去嘶在各自意图组内平均下降,去轰头强档几乎为零。
| High Noise noisereduce_strong | +2.81 | 1.56 |
|---|---|---|
| Heavy Reverb noisereduce_strong | +2.11 | 1.89 |
| Harsh deess_med | +0.59 | 1.77 |
| Light Reverb noisereduce_med | +0.47 | 2.17 |
| Boomy deboom_med | +0.37 | 1.49 |
| Boomy deboom_strong | 0.00 | 1.63 |
表后解释要强调收益与代价,收益是 CLAP 确实对噪声与混响类问题敏感,强压制能稳定抬高相似度,代价是这种抬高主要来自强档降噪对所有列的普遍抬升,而非只修对症问题,图中最下一行跨列全蓝就是证据。反例是发闷组,听众后文给了正向评价,但 CLAP 侧两档去闷都是负向变化,说明嵌入分数与感知在该频段背离。限制是原表只报告均值标准差与样本量,没有报告显著性检验与置信区间,不能据此宣称每条录音都变好。
把补救换成人耳打分,排序是否还一样?
听感侧要测的是同一意图配对是否让人觉得更像理想录音,比较条件是同一劣化前版本作为参照,同一量表同一耳机要求,指标方向是平均评分越高越好。下图截图仅保留降噪两档在 6 种劣化上的平均评分,更完整的全部交叉见原文另一张热图,阅读时先确认行只有两档降噪,再比较中档的浅蓝与强档的红色。
看图路径: 1. 先确认该截图只显示降噪两档在六种劣化列上的平均听感评分;2. 再比较中等降噪行的浅蓝与强档降噪行的红色,判断听众对强处理的态度;3. 最后核对噪声列与混响列在强档降噪下的具体数值,记住与嵌入结果相反的方向
论文图 2。原论文 Figure 2:“Heatmap of average user ratings for all degrada- tion–remedy pairs.”。
从可见像素看中档降噪行在干净混响等列为 0.34 与 0.32 等正值,强档降噪行在干净闷刺耳混响轰头列为负 0.90 到负 0.74 之间的大面积红色,仅在噪声列为负 0.26 相对最轻,说明听众对强档降噪普遍不满。下表是全部意图配对的听众平均分,按评分排序,去轰头强档处理轰头与去闷两档处理发闷排在前列,中档降噪处理混响与中档去轰头去嘶也有小幅正向,而强档降噪处理噪声与混响均为负向,其中处理混响低至负 0.97。
| Boomy deboom_strong | 0.56 | 0.52 | 83 |
|---|---|---|---|
| Dull dedull_medium | 0.55 | 0.51 | 74 |
| Dull dedull_strong | 0.43 | 0.67 | 76 |
| Reverb noisereduce_medium | 0.32 | 0.41 | 39 |
| Boomy deboom_medium | 0.26 | 0.44 | 68 |
| Harsh deess_medium | 0.22 | 0.46 | 68 |
| Harsh deess_strong | 0.13 | 0.45 | 76 |
| Noise noisereduce_strong | -0.26 | 0.70 | 153 |
| Noise noisereduce_medium | -0.32 | 0.62 | 3 |
| Reverb noisereduce_strong | -0.97 | 0.56 | 105 |
听感评价 × 对比语言音频预训练相似度: 听感评价负责记录人是否觉得更像一句隔离良好、录制良好的人声,对比语言音频预训练相似度负责记录音频向量与理想文本向量在共享空间中的接近程度,前者是感知真值,后者是自动代理指标,搭配理由是作者想验证代理指标能否代替人工质检,组合的意义在于两者背离时暴露出嵌入模型捕捉不到的处理伪影。
表后必须点出未胜出项与失败条件,未胜出的是 CLAP 侧最强的强档降噪,它在听感侧恰恰垫底,支持作者的判断即门控带来的断续感让人觉得更不干净。另一类细节是中档降噪处理噪声只在 3 条音频上被评价,样本极少,解读时要谨慎。还有阈值问题,中档去嘶与中档降噪可能太轻以至于听众分不清与参照的区别,去轰头的 1 阶高通在低频噪声不多时也很微妙,这些都是原文讨论中承认的边界。
哪些结论站得住,哪些还缺验证?
站得住的是方向性背离,CLAP 偏爱强降噪而听众偏爱原版或温和的高频与低频修正,这个背离在噪声与混响组同时出现,且在发闷组反向出现,因此报告为嵌入模型能编码部分质量信息但捕捉不到增强伪影是有依据的。支持程度有限的是具体增益大小,因为听感每文件平均被评价 4.68 次且 63 个只被评价一两次的文件已被剔除,不同配对样本量从 3 到 153 不等,方差较大,没有显著性与多重比较校正,不能把 0.56 与 0.55 的先后读成确定的胜负。
缺验证的要逐项指出,未测量误判率与延迟成本,不能承诺该方法改善了质检效率,未报告 CLAP 版本与运行环境,不能承诺换一个权重仍是同样排序,未系统评价内容类型交互,例如卡拉 OK 混响容忍度是否高于朗读,原文只在构造时均衡但没有分开报告。相关性不等于因果,强档降噪抬高相似度不代表它修好了录音,更可能是压低噪声能量后向量整体靠近干净簇。总体趋势不等于每组每步都成立,图中最下一行全蓝不代表每条录音都变好,听众平均负分也不代表没有个别录音受益。
要复现这套流程,先固定哪些信息条件?
复现先做三件事,一是固定数据与切分,二是固定效果参数与归一化,三是固定 CLAP 推理与听感协议。数据用同样来源的 15 秒片段并记录朗读与卡拉 OK 各自编号,劣化按原文粉噪幅度比、均衡频率增益与品质因数、混响轻重、归一化标准逐项落实。补救按降噪比例下降参数、高通截止频率、高架提升量、去嘶阈值逐项落实,做完再次归一化以免响度差污染评分。CLAP 侧固定六句提示的英文原文与前缀写法,对同一组内所有版本算与理想句的相似度并取最高者为整体最优。
听感侧固定年龄与语言要求、耳机检查、隐藏原版捕获试次、负二到正二量表,以及剔除规则。下表把招募与清洗数字整理成五列,便于对照自己实验的通过率与每文件评价次数。
| 阶段 | 人数与次数 | 筛选与任务标准 | 量表与平台 | 结果与备注 |
|---|---|---|---|---|
| 招募 | 369 人 | 流利英语 18 到 40 岁 | 在线平台 | 初始样本 |
| 耳机检查 | 去掉 70 人 | 错 3 题以上剔除 | 6 道检查题 | 保证佩戴耳机 |
| 捕获试次 | 去掉 58 人 | 错 5 题以上剔除 | 20 个捕获试次 | 另有 7 人听力自报异常剔除 |
| 保留 | 234 人 | 通过全部筛选 | 问卷播放 15 秒 | 最终有效样本 |
| 覆盖 | 平均 4.68 次每文件 | 4600 次评价总量 | 负二到正二 | 少于 3 次的文件剔除 63 个 |
表后解释,收益是这套清洗保证了基本听音条件,代价是流失率较高,从 369 到 234 意味着招募预算要留余量。未评测边界包括非英语母语者比例、播放设备差异、补偿方式对评分的影响,原文只报告母语与年龄均值标准差,没有做分层分析。代码与系统可运行性方面,降噪库与效果器是第三方可用,但 CLAP 权重与完整流水线没有在本证据中给出可运行链接,演示页链接在原文脚注出现但本次资源清单未将其列为可验证可用,因此复现时应先跑通单条样本的劣化加补救加打分闭环,再扩大到全量。
何时值得尝试这个思路,还需补哪项验证?
当你的任务是海量人声初筛且能接受误推荐时,值得尝试用一句理想描述加 CLAP 相似度做第一遍排序,因为它对噪声与混响类问题确实敏感,实现成本主要是跑通效果器与嵌入推理。当你的目标是直接面向听众的成品增强时,不要单独依赖嵌入分数做决策,至少要加一轮小规模盲听,重点检查强降噪的断续感与高频修正的齿音残留。选择参数时优先从温和档起步,原文中档在混响与轰头刺耳上有小幅正向而强档更容易翻车,这个不对称值得记住。
还需补的验证很具体,一是换 CLAP 权重与提示措辞的稳健性,二是按朗读与歌唱分开报告,三是补充统计检验与每文件分布而非只有均值,四是报告推理开销与人工成本以便判断是否真省人力。常见误解是把无训练等同于确定性求解,实际上效果器随机性、响度归一化实现、嵌入版本都会改变排序,固定这些才是可核对的复述。另一误解是把自动指标当成人评,本文恰恰证明两者可以反向,复述方法时必须把两套数字放在同一配对下对照,而不是只讲其中一套。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 3 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

