英文题目:ES-3DF: Editable Speech-Driven 3D Face Reconstruction via Geometry Texture Disentanglement
会议身份:
conference:interspeech:2026:conference-paper-id:wang26i_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#对比学习 #生成对抗网络 #多模态学习 #语音 #音视频生成
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jianrong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kaibin Bi:机构信息未能从会议 PDF 纯文本可靠映射
- Jinghui Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ju Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ying Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为约3秒短语音,输出为带纹理的可编辑3D人脸,难点在于语音与人脸几何纹理之间的模态鸿沟非常巨大且身份映射高度病态。先以3DDFAV3特征与StyleGAN2纹理生成器构建解耦的几何纹理空间,明确分离形状系数与高维纹理特征。再用ECAPA-TDNN提取说话人嵌入,并以双分支MLP分别回归3DMM身份系数与纹理特征,经类感知多槽记忆做对比对齐以保持身份判别性。最后将回归的身份系数与纹理特征送入冻结纹理生成器,经可微渲染器融合成像,并以人脸感知损失约束身份一致性。与级联先生成2D再重建3D的已有方法不同,该框架消除了2D误差传播并允许几何纹理独立编辑,具有可解释操控意义。在VoxCeleb1与VGGFace交集的301人测试集下,ES-3DF的Landmark L1指标为1.33,低于CMP的Landmark L1指标1.97。结论仅适用于受控近正面人脸重建,未验证噪声语音、跨语言与大姿态外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入一段语音要输出什么?可编辑又意味着什么?
这篇论文研究的输入很明确:只用一段短语音信号,不给人脸图像、不给文本描述,目标是重建出属于该说话人的带纹理 3 维人脸。输出必须保留两类信息,一是几何形状,也就是脸的轮廓、下颌、鼻形与表情无关的身份形状,二是纹理外观,也就是肤色、年龄感与身份细节。所谓可编辑,是指形状部分要用参数化模型表示,使得研究者可以在重建后单独改形状、表情、姿态与平移,而不破坏纹理。初学者容易把这个任务误解为语音识别或语音转 2 维头像,实际上这里要求的是跨视角几何一致的 3 维表达,并且能做语义明确的细粒度编辑。
为什么不用先生成 2 维图再重建 3 维的省事办法?原文指出,级联做法会把 2 维阶段的生成错误累积并传播到 3 维重建,而 2 维方法本身缺乏显式 3 维约束,难以保证多视角一致,也难以精确控制形状与表情。因此作者把任务定义为从语音直接到解耦后的 3 维几何与纹理,再用渲染器合成图像。这个定义决定了后文所有设计:必须先把几何与纹理分开表示,再分别解决语音到二者的映射难度差异。
同输入同目标的已有路线卡在哪里?
按同输入、同目标、同运行阶段来对照,已有语音到人脸工作大多停留在 2 维合成。早期用简单生成对抗网络或编码器解码器结构,常得到模糊图像。近期工作引入 StyleGAN2 潜空间对齐或潜扩散模型提升了 2 维质量,代表是 VoiceStyle 这类基于跨模态原型对比的方法。另一条线是跨模态感知者 CMP,它是原文点名的唯一带有 3 维监督的开源方法,但做法仍是先做 2 维生成再做 3 维重建,属于级联管线。还有一类编辑方法在特征层引入控制,但原文认为其控制粗糙,做不到几何与纹理的细粒度分离操作。
直接映射 × 级联管线: 直接映射指从语音特征一步回归 3DMM 系数与纹理特征再渲染,级联管线指先用语音生成 2 维图像再做 3 维重建,二者对照的理由是级联会把 2 维生成错误带入 3 维,组合意义在于本文选择直接映射正是为了切断这种误差传播,但也因此必须自己解决语音与纹理之间的模态鸿沟。
这个对照说明公平比较必须分两层看:与 VoiceStyle 比,要看缺乏 3 维约束时几何误差是否更大;与 CMP 比,要看同样有 3 维信息时直接映射是否减少了误差累积。原文的判断是,CMP 受限于 2 维生成质量,几何精度反而落后于 2 维的 VoiceStyle,而本文方法要在几何与身份两方面同时超过二者。初学者不要把类别差异当成同条件胜负,关键是理解 2 维质量好不等于 3 维几何准,级联多一步就多一处误差源。
难在哪里:模态鸿沟与维度不对称如何具体化?
第一个难点是模态鸿沟。语音是随时间变化的 1 维声学序列,受情感、语速、内容影响;人脸纹理是高维空间细节,包含大量与声音弱相关的视觉因素。直接回归容易学到平均脸,身份判别性不足。第二个难点是维度不对称。
身份形状系数只有 80 维,解空间小而稳定;纹理特征维度高得多,对身份区分更关键但更难对齐。如果用同一套回归损失处理两者,要么纹理欠拟合,要么形状被高维噪声带偏。
作者把问题拆成两个子问题:低维几何如何稳定回归,高维纹理如何在潜空间保持身份可分。前者依赖说话人验证预训练编码器过滤非身份变化,后者依赖为每个说话人维护多个演化中的原型,做判别式对比。这种拆分不是修辞,而是后文双分支与不同损失权重的直接依据。举例来说,同样一句 3 秒语音,情感起伏会影响声学细节,但说话人验证编码器更关注稳定的声纹,形状分支因此更容易收敛,而纹理分支仍需对比学习来抓住肤色与年龄等稳定视觉属性。
ES-3DF 让一个样本走完语音到三维脸的全路径
先沿一个样本走完全流程。输入是一段标准化为 3 秒的语音,先提取 80 维梅尔滤波器组特征,再经 ECAPA-TDNN 语音编码器得到语音特征 Fs。Fs 同时进入两个分支:上支 ShapeMLP 直接回归 80 维身份系数预测值,下支 TexMLP 预测纹理特征。纹理特征送入冻结的 StyleGAN2 纹理生成器得到 UV 贴图,身份系数送入几何生成器得到 3 维网格参数,二者经可微渲染器融合成带纹理 3 维脸。这个设计保证了从输入到表示到组件到目标再到输出的链条完整,几何与纹理在映射阶段就已分开。
为理解整体结构,先看总览图左半为解耦训练、右半为语音对齐、下半为监督与记忆更新的布局,再带着分支汇合问题去读图。
看图路径: 1. 先从左上 Disentangle 的人脸输入沿 Ef 到 F3D 再到 Guv 与 Gα 两条分支看解耦路径;2. 再看右上 Align 中 Es 到 Fs 后分叉为 ShapeMLP 与 TexMLP 的双分支汇入渲染器 R;3. 最后看右下 Memory Queue 中 k1 到 k4 与 InfoNCE 虚线及 Upgrade 回路的更新关系;4. 对照左下 Masked GT 与 Recon Face 经 FaceNet 得到的 Lpix 与 Lperc 监督位置
论文图 1。原论文 Figure 1:“Overview of ES-3DF. The Disentangle module (left) explicitly decouples 3D facial features into 3DMM geometry and high- fidelity UV maps.”。
从像素可见,左上 Disentangle 把真实人脸经 Ef 得到统一 3 维特征 F3D,再分叉为 Guv 生成 UV 与 Gα 生成身份、表情、姿态等系数,并在橙色渲染块 R 中合成,右接判别器 D 做真假判断;右上 Align 把语音频谱经 Es 得到 Fs,再分为 ShapeMLP 到身份系数与 TexMLP 到纹理特征后共同进入 R;右下用 InfoNCE 把预测纹理与记忆队列中同身份槽拉近、与他类推远,并有 Upgrade 回路动态更新原型;左下用掩膜真值与重建脸计算像素损失,再经 FaceNet 得到感知与余弦损失。这种布局把解耦、映射、判别式对齐与渲染监督放在一张图中,是后文所有公式与损失的执行位置图。
解耦与对齐各自分工什么?多槽记忆如何更新?
解耦模块的作用是把预训练 3DDFAV3 提取的 3 维特征拆开。几何分支 Gα 生成 3DMM 系数,保证重建精度并支持编辑;纹理分支 Guv 基于 StyleGAN2 学习高保真 UV,不再直接使用传统反照率与光照系数。白话说,几何管形状对不对,纹理管看起来像不像。3DMM 本身是用主成分分析建模 3 维人脸,均值脸加身份基乘身份系数加表情基乘表情系数,本文使用顶点数 35709 的版本,身份 80 维、表情 64 维等,几何编辑就是改这些系数。
3DMM 几何系数 × UV 纹理贴图: 3DMM 几何系数负责用人脸均值加身份基与表情基的低维系数描述 3 维形状,UV 纹理贴图负责在展开的 2 维 UV 空间描述肤色与细节颜色,二者搭配的理由是形状需要可参数化编辑而纹理需要高频细节,组合意义是语音映射时可以对低维形状做回归、对高维纹理做判别式对比,避免同一特征同时承担两种难度不同的任务。
对齐模块的作用是把语音映射到上述两个空间。形状因维度低,直接用多层感知机回归并用均方误差监督,编码器选用预训练说话人验证模型以过滤情感语速等变化。纹理因维度高,先用纹理均方与余弦相似度做直接监督,再引入类别感知的多槽记忆库。记忆库为每个说话人类别存 4 个潜原型,训练时对属于该类的语音纹理嵌入找到最相似槽,按动量 0.9 做指数滑动平均更新。多槽 InfoNCE 把同类所有有效槽当正键、他类槽当负键,最大化与同类原型的余弦相似并拉开类间距离。
语音嵌入 × 说话人原型: 语音嵌入是由 ECAPA-TDNN 从 3 秒语音中提取的身份向量,说话人原型是记忆库中为每个说话人类别保存的多个纹理潜原型,二者搭配的理由是单句语音多变而说话人身份相对稳定,组合意义是用多槽 InfoNCE 把当前语音纹理嵌入拉向同类多个原型、推离他类,从而在潜空间保持身份判别性。
形状回归 × 纹理对比学习: 形状回归指用 MLP 把语音特征直接映射到 80 维身份系数并用均方误差监督,纹理对比学习指对高维纹理特征同时用均方与余弦监督再加多槽对比,二者搭配的理由是形状空间小而稳定、纹理空间大而身份敏感,组合意义是给简单任务用简单约束、给困难任务用判别式约束,避免用同一损失同时要求几何准确与身份可分。
预测的纹理特征送入冻结的纹理生成器,结合回归的身份系数经可微渲染器成像,再用 FaceNet 感知损失保证高层身份一致。初学者要注意,冻结意味着纹理生成器在对齐阶段不更新,只有映射 MLP 与记忆槽在学;原文未明确给出温度系数与重置时机等细节,这部分属于缺项,不应从模型名推定实现。
两阶段如何训练?损失权重与冻结关系是什么?
训练分为两个独立阶段。第一阶段训练 UV 生成器,目标是在掩膜人脸区域内同时满足像素保真、身份保持、结构一致、UV 取值合法与对抗真实感。像素损失管逐像素接近,两个基于 FaceNet 的损失分别管身份嵌入余弦对齐与中间特征均方,UV 正则把 UV 值约束在 0 到 1 之间以防渲染伪影,对抗损失采用 StyleGAN2 的对抗形式并带 R1 与路径长度正则以稳定训练与平滑插值。UV 生成器与对齐 MLP 用 Adam 独立训练,学习率分别为 2 乘 10 的负 3 次方与 1 乘 10 的负 4 次方。
可微渲染器 × FaceNet 感知损失: 可微渲染器负责把预测的 3DMM 系数与 UV 纹理合成为 2 维人脸图像并保持梯度可回传,FaceNet 感知损失负责在该渲染图与真值图之间比较身份嵌入与中间特征,二者搭配的理由是 3 维监督难以直接评价视觉身份,组合意义是让语音到 3 维的映射也能接受 2 维人脸识别空间的高层约束。
下表整理了解耦阶段总目标中 5 个权重的原文取值,阅读时注意权重差异反映了任务侧重,感知权重远大于其他项说明更强调高层结构而非逐像素相等。
| 解耦损失项 | 像素权重 | 余弦权重 | 感知权重 | UV 正则权重 | 对抗权重 |
|---|---|---|---|---|---|
| 原文取值 | 5.0 | 1.0 | 50.0 | 2.0 | 1.0 |
上表显示感知损失权重最大,意味着训练更看重 FaceNet 中间特征的结构一致性,而非单纯像素相等;代价是像素细节可能为身份与结构让路。UV 正则与对抗权重相对小,起约束与真实感辅助作用。需要复现时应先按此比例搭建总损失,再核对掩膜区域计算逻辑,因为背景干扰已被掩膜排除。
第二阶段训练语音到 3 维的对齐映射,形状回归、纹理均方、纹理余弦、对比与渲染感知五项加权。原文给出的权重分别为形状 0.5、纹理均方 5.0、纹理余弦 0.25、对比 0.05、感知 0.05,纹理均方权重最高说明直接监督仍是主信号,对比与感知是小权重的判别性与高层修正。下表集中呈现该组取值,便于对照实现。
| 对齐损失项 | 形状权重 | 纹理均方权重 | 纹理余弦权重 | 对比权重 | 感知权重 |
|---|---|---|---|---|---|
| 原文取值 | 0.5 | 5.0 | 0.25 | 0.05 | 0.05 |
上表表明纹理的直接均方约束是主导,对比损失权重虽小但在消融中被证明对身份细节关键;若复现时只调大对比权重,可能破坏主回归的稳定性。原文明确说明预测纹理送入冻结阶段一纹理生成器,因此梯度只更新映射分支与记忆机制,不回传到生成器;未报告采样器、轮数与硬件预算,属于复现缺项。
数据、划分、预处理与评价指标如何保证可比?
数据来自 VoxCeleb1 语音与 VGGFace 人脸的交集,共 1225 人。按首字母 F 到 Z 的 924 位说话人做训练集,剩余 301 人做验证与测试集。这种按人划分保证了测试身份在训练中未见,测的是跨说话人泛化而非记忆。语音统一为 16 千赫采样,25 毫秒窗、10 毫秒移位提取 80 维梅尔特征,音频段标准化为 3 秒,不足补齐、过长裁剪,并做 utterance 级归一化。人脸处理遵循 3DDFAV3 管线,用 RetinaFace 类方法裁剪对齐,损失只在掩膜人脸区域计算以避开背景。
下表把数据集规模、划分、语音特征与人脸预处理的关键条件放在一起,便于核对复现时是否一致,任何一项改变都会影响可比性。
| 项目 | 数据来源与规模 | 划分方式 | 语音特征条件 | 人脸处理条件 | 优化器条件 |
|---|---|---|---|---|---|
| 原文条件 | 1225 人交集 | 924 人训练、301 人验证测试 | 16 kHz、80 维、25 ms 窗 10 ms 移位、3 秒标准化 | 遵循 3DDFAV3、掩膜计算 | UV 生成器 2e-3、对齐 MLP1e-4、Adam 独立训练 |
上表说明比较的前提是同一批人划分与同一语音前端,若改用更长语音或不同人脸对齐,指标会失去可比性。原文未给出验证测试的具体切分比例与随机种子,这是复现时需补记的缺项。
评价分 3 类。几何一致性用面部关键点距离、3DMM 身份系数 L1 与 L2 距离、面部分割交并比衡量,身份系数通过 3DDFAV3 从图像获得,本文方法则直接从语音回归。身份一致性用真实图与生成图经 FaceNet 提取特征后的余弦相似度、L1 与 L2 距离衡量。主观质量辅以定性图。基线选择 CMP 与 VoiceStyle,前者是唯一带 3 维监督的开源级联方法,后者是 2 维语音生成代表,比较时需注意二者运行阶段不同,不能把 2 维视觉好直接等同于 3 维几何准。资源状态方面,本次未发现来源绑定且完成验证的开源代码模型数据,不得声称已公开可用。
主结果测什么:在什么条件下谁的几何与身份更好?
主比较要回答两个问题:在相同测试身份下,谁的形状更准,谁的身份保持更好。几何用关键点与身份系数距离越低越好,分割交并比越高越好;身份用 FaceNet 特征距离越低越好、余弦越高越好。原文报告,在几何精度与身份一致性上本文方法同时优于两个基线,原因是语音与解耦后的 3DMM 及 UV 特征直接对齐,并用多槽对比挖掘身份信息。CMP 虽有 3 维监督,但受 2 维生成质量拖累,几何误差甚至落后于 2 维的 VoiceStyle;VoiceStyle 2 维质量尚可,但缺显式 3 维约束,几何误差仍高于本文方法。
为建立直观印象,先按行读定性对比,重点看肤色脸形是否随说话人保持,再回来看数字是否支持同样的判断。
看图路径: 1. 按行对比 GT、CMP、VoiceStyle、Ours 各行在同一列的肤色与脸形保持情况;2. 重点观察第四列深肤色说话人在不同方法下的身份漂移程度;3. 对比 Ours w/o ctr 与 Ours 在年龄与细节上的差异;4. 查看最后一行 W/GT α 在表情开口度上与 GT 的接近程度
论文图 2。原论文 Figure 2:“Qualitative Experiment”。
从像素可见,该图共七行五列,首行为真值,后续依次为 CMP、VoiceStyle、无对比变体、无 3 维变体、完整方法与用真值形状的方法。CMP 在第一列出现明显灰白偏色,第四列出现偏橙偏色,说明级联在颜色与身份上不稳定;VoiceStyle 多列偏白偏年轻,与真值年龄感差距较大;完整 Ours 在第二列金发、第四列深肤色等难例上更接近真值的肤色与脸宽,而无对比与无 3 维变体在这些列上仍有漂移;最后一行用真值形状时开口表情与真值最接近,支持了几何解耦编辑的有效性。但需注意,这只是单样本可视化,不能推广为全程每组都成立。
原文进一步用生物学解释支撑几何结果:鼻子交并比最高,与其作为稳定主要共鸣腔的角色一致;皮肤交并比高,抓住稳定的下颌结构;上半脸与韵律相关;唇部虽有提升但绝对值较低,反映了从动态语音推断静态安静唇形的内在不适定性。这属于有限解释,报告的是相关性而非因果,支持模型学到真实语音人脸映射,但未验证跨语言或跨采集设备的泛化。
拿掉解耦或对比会发生什么?多视角能否稳定渲染?
消融围绕两个机制展开。拿掉几何纹理解耦的变体记为 Ours w/o 3D,它共享同样的 3 维重建特征但绕过网格渲染直接生成图像。定性上缺乏显式解耦会损害脸部几何,定量上该变体持续落后于完整方法,有时甚至不如基线。原文据此认为,关键不仅在于用 3 维特征,更在于把几何与纹理拆成独立生成路径,才能最大限度利用语音对齐特征中的几何线索,得到结构忠实且视觉连贯的重建。拿掉对比学习的变体记为 Ours w/o ctr,定性上对年龄与种族等细粒度身份属性捕捉不如完整方法,定量上特征相似度也低于完整模型,说明多槽对比对从语音中挖掘鲁棒身份线索确有作用。
多视角能力是可编辑性的另一面。完整方法参数化几何后,可在保持纹理下调整形状、表情、姿态与平移,并做多视角渲染。下图给出同一身份 3 个视角的渲染连贯性检查。
看图路径: 1. 确认三张图为同一身份在左偏、正视、右偏三个视角下的渲染结果;2. 观察鼻梁与嘴唇在转视角时是否保持几何连续而不塌陷;3. 检查肤色纹理在不同视角下是否稳定而无明显漂移
论文图 3。原论文 Figure 3:“3D multi-view rendering results”。
从像素可见,3 张图为同一人脸的左偏、正视与右偏渲染,鼻梁嘴唇在转视角时保持连续,肤色纹理稳定,没有出现明显的塌陷或漂移。这支持了解耦后纹理在几何编辑下稳定的说法,但原文只展示了单一样本的多视角,未报告多身份的统计量与失败率,因此不能承诺所有身份都同样稳定。定量上,用真值形状的 Ours w/GT α 在特征一致性上高于标准 Ours,进一步确认了编辑机制的有效性,但这属于事后最优条件,不能代替可部署的语音直接预测收益。
哪些边界未被测到?什么结论还只是可能?
首先是评价边界。原文报告了几何与身份指标,但未测量误判率、延迟、训练资源与推理开销,也未报告输出帧率与实际延迟,因此不能承诺这些量得到改善。总体趋势优于基线不等于每组每步都成立,定性图只是抽样。其次是数据边界。1225 人交集与按首字母划分是特定条件,未验证跨数据集、跨语言、跨年龄段与跨采集设备的泛化,也未说明噪声、混响与短于 3 秒语音下的鲁棒性。
下表把原文明确讨论过的部位级交并比放在一起,用生物学可解释性反查模型的局限,数字方向是越高越好。
| 部位条件 | 鼻子交并比 | 皮肤交并比 | 上脸眼眉交并比 | 唇部交并比 | 解读方向 |
|---|---|---|---|---|---|
| 原文报告 | 84.55% | 87.94% | 60-67% | 54-55% | 鼻与皮肤稳定、上脸中等、唇部不适定 |
上表显示未胜出项很清楚:唇部绝对值最低,即使有提升仍只有 54 到 55% 左右,原文自己归因为从动态语音推断静态唇形本质上不适定;鼻与皮肤的高值支持了共鸣腔与下颌结构的稳定性解释,但这仍是相关性而非因果。原文未来工作也承认,需进一步优化高维身份特征的跨模态对齐以提取更多细节属性,这意味着当前纹理身份仍有欠拟合风险。对初学者而言,缺失证据不是技术错误,但在复现与选型时必须把未测的延迟成本与未验证的泛化当作待验证项,用可能而非确定来表述。
要复现应先做什么?哪些超参数必须原样保留?
复现先做三件事。第一,按原文重建数据管线:取 VoxCeleb1 与 VGGFace 交集的人划分,语音 16 千赫、80 维梅尔、25 毫秒窗 10 毫秒移位、3 秒裁剪或补齐加 utterance 归一化,人脸按 3DDFAV3 管线裁剪对齐并只在掩膜区算损失。第二,分阶段训练:先按第一组权重训练 StyleGAN2 纹理生成器并冻结,再按第二组权重训练语音映射 MLP 与记忆库,优化器均用 Adam,学习率分别用 2 乘 10 的负 3 次方与 1 乘 10 的负 4 次方。第三,固定记忆与回归的关键超参数:每类 4 槽、动量 0.9、形状 80 维、顶点 35709,这些是信息条件,改动会直接改变任务难度。
其次要保留监督来源:形状用均方回归,纹理用均方加余弦再加多槽 InfoNCE,渲染后用 FaceNet 感知与余弦约束身份,UV 值约束在 0 到 1 之间。对齐阶段纹理生成器冻结,只更新映射分支与记忆槽。原文未报告温度系数、训练轮数、批量大小与硬件预算,复现时需自行记录并做敏感性分析,不能从模型名推定实现。资源方面,本次无可用开源声明,应按链接当前不可用处理,先实现论文描述的管线再谈系统可运行。
何时值得尝试 ES-3DF?一句话收束方法与证据
当任务需要从语音直接得到可多视角查看、可改形状表情姿态的 3 维头像,且能接受 3 秒语音与受限身份集时,ES-3DF 的解耦加双分支加多槽对比路线值得尝试。它的可复述要点是:用 3DDFAV3 特征拆出低维形状与高维纹理,对前者直接回归、对后者对比对齐,再经可微渲染与 FaceNet 感知保持身份,最后用参数化系数做编辑。最强证据是几何与身份指标同时超过级联与 2 维代表,以及拿掉解耦或对比后性能下降的反证;主要代价与限制是唇部等动态部位本质难推、未测延迟成本与泛化边界。后续验证应补跨数据集测试、短语音与噪声鲁棒性、以及推理开销与失败率统计,再谈虚拟化身等落地。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


