英文题目:DIVINE : Coordinating Multimodal Disentangled Representations for Oro-Facial Neurological Disorder Assessment
会议身份:
conference:eacl:2026:conference-paper-id:2026.eacl-long.248
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#多模态学习 #多任务学习 #变分自编码器 #音视频 #病理语音评估
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究
👥 作者与机构
- Mohd Mujtaba Akhtar:机构信息未能从会议 PDF 纯文本可靠映射
- Girish:机构信息未能从会议 PDF 纯文本可靠映射
- Muskaan Singh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为同步口面部视频与语音波形,输出为三分类诊断(健康对照 Healthy Control、肌萎缩侧索硬化 ALS、卒中 Stroke)与严重程度估计,难点在于病理运动信号微弱、双模态时序耦合且临床评分主观易变。所提解耦变分信息网络 Disentangled Variational Information Network(DIVINE)先用冻结的视觉基础模型 Vision Foundation Model(VFM)与语音基础模型 Speech Foundation Model(SFM)抽取表征并做一维卷积局部时序精炼,再经窗口级变分自编码器 Variational Autoencoder(VAE_window)压缩短时动态并全局平均池化,随后在话语级变分自编码器 VAE_utterance 中以权重共享的共享编码器与模态独立的私有编码器分离跨模态神经运动共性与通道噪声,接着用轻量解码器做视频共享到音频共享的循环一致对齐与基于私有向量计算的稀疏门控融合动态加权可靠流,最后拼接可学习临床症状令牌 Clinical Symptom Token 经全连接推理并同时输出分类与严重程度。与整体拼接相比,该机制显式约束共享子空间一致并惩罚门控冗余,从而在缺失模态下仍可回退到单流证据。在 Toronto NeuroFace 数据集受试者无关 5 折交叉验证下,DeepSeek-VL2 与 TRILLsson 组合全模态准确率达 98.26%、F1 值达 97.51%,高于同组合简单拼接的 94.65% 与 93.87%。结论仅在该小规模单中心数据上成立,跨站点泛化与临床可用性尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/Helixometry/SIGNAL.git → https://github.com/Helixometry/SIGNAL — 链接不可用(HTTP 404)
- 模型相关资源:https://github.com/Helixometry/SIGNAL.git → https://github.com/Helixometry/SIGNAL — 链接不可用(HTTP 404)
- 第三方资源:https://huggingface.co/microsoft/wavlm-base — 暂时无法访问
- 第三方资源:https://github.com/deepseek-ai/DeepSeek-VL2 — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/TadasBaltrusaitis/OpenFace — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/1adrianb/face-alignment — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,哪些信息必须保留?
这篇解读的输入是同步采集的说话人音频与面部视频,目标是同时给出诊断类别与严重度等级。诊断类别在原文中固定为 3 类:健康对照、肌萎缩侧索硬化、卒中。严重度在摘要与任务描述中涉及轻度、中度、重度分级,正文同时提到由言语病理学家在对称性、运动范围、速度、变异性与疲劳 5 个维度打分,总分范围为 5 到 25,模型端用分类与严重度两个概率头联合输出。
必须保留的信息包括数据集的被试级划分方式、编码器是否冻结、融合与解耦模块是否可训练、评测是完整双模态还是单模态输入,以及准确率与 F1 越高越好、平均绝对误差与均方根误差越低越好的方向。举例来说,一个被试完成快速音节重复或买小狗绕口令等任务时,系统拿到一段波形加一段人脸视频,就要输出一个三选一诊断和一个严重度分布,而不是只给一个二分类标签。理解这一点后,后续所有关于表示、融合与损失的讨论才有共同基准。
此前路线把什么混在一起,本文要拆开什么?
此前的口面部评估路线可以分为 3 类。第一类是纯视频路线,用手工时空特征或面部关键点图网络刻画面部不对称与僵硬,优点是直接观察运动,缺点是易受遮挡与光照影响。第二类是纯音频路线,用声学模型量化构音障碍,优点是对细微发音变化敏感,缺点是看不到唇舌与下颌的可见运动。
第 3 类是简单多模态拼接,把两路嵌入直接连起来送分类器,优点是利用了互补信息,缺点是把模态共有病理因素与各模态私有噪声放在同一个向量里,无法说明当前判断更依赖哪一路,也难以在缺一路时保持稳定。本文要拆开的正是共享的神经运动特质与私有的观测噪声。原文明确指出已有融合把所有特征当作单一块处理,没有分离每个模态的贡献,并引用多模态变分混合专家自编码器等解耦思路作为对照。
本文的不同在于做完全解耦的多任务流水线,同时处理分类与严重度估计,并在训练与测试中系统考察缺失模态。
任务的形式化与评测条件如何定义?
任务的输入是时间同步的原始视频与原始音频,记为视频张量与音频波形。系统先用冻结的视觉基础模型与语音基础模型抽取帧级或片段级嵌入,再做融合与预测。输出是两个概率向量,一个对应 3 类诊断,一个对应严重度等级。评测条件在原文中分为 3 层:完整模态即说话视频的音视频同时输入,部分模态涉及说话与非说话片段的区分,缺失模态指测试时只给视频嵌入或只给音频嵌入。
数据层面采用被试级五折交叉验证,同一被试的所有录音只出现在训练、验证、测试其中一折,避免说话人泄露。指标层面同时报告分类的准确率与 F1,以及回归或多任务的平均绝对误差与均方根误差,所有数值按五折平均。需要提醒初学者的是,数值相同不代表同一指标,分类精度与严重度误差不能互相替代,百分点差异也不能读成相对百分比提升。
DIVINE 让一个样本走完哪条路?
沿着一个同步样本走一遍是最清楚的。原始视频先经过冻结的视觉编码器得到视频嵌入序列,原始音频先经过冻结的语音编码器得到音频嵌入序列。两路分别做基于 1 维卷积的局部时序细化,包括卷积、批归一化、激活与池化,目的是增强短时构音动态。细化后的序列进入局部窗口变分自编码器做逐时刻压缩与重构,再经全局平均池化得到定长话语嵌入。
话语级再分两条变分路径:权重绑定的共享编码器抽取跨模态共性,模态独立的私有编码器保留各自特性。共享表示之间做跨模态循环对齐解码以限制子空间泄露,共享表示之间再做稀疏门控加权融合,最后与可学习的症状令牌拼接送入密集层,由两个头分别输出诊断与严重度。下面的研究总览图把这条从双输入到双输出的主路径画了出来,适合先建立整体位置感。
看图路径: 1. 先从左侧找到人脸视频与音频波形两个输入分支;2. 再沿中间视觉语言模型与音频语言模型的特征抽取块向右看;3. 确认两路在中间拼接模块汇合后再分出两个输出头;4. 对照输出端是否同时给出诊断类别与严重度两类结果

论文图 1。原论文 Figure 1:“Overview of the study setup.”。
这张总览图的可读方法是把左右分成 3 段。左侧是人脸框与声波图的双输入,中段是视觉与音频两条特征抽取与各自网络处理,右侧是拼接后的双输出。可以看到两路不是一开始就混合,而是在各自建模后再汇合,这与后文先解耦再门控融合的设计是一致的。右侧同时引出两类输出,正好对应多任务同时预测诊断与严重度的设定。初学者不要把中间的拼接块直接等同于本文最终的稀疏门控融合,总览图是简化示意,真正的解耦、对齐与令牌机制在详细架构图中展开。
两级变分瓶颈与对齐门控如何分工?
详细架构把计算分成了局部与话语 2 级。局部级对每个时刻的细化特征估计高斯均值与对数方差,用重参数化采样得到隐变量,再解码重构输入,损失由重构误差加标准正态的散度约束组成。话语级在池化后的定长向量上并行运行共享与私有编码器,同样输出均值与方差并采样,损失由重构项加两个可加权的散度项组成,权重控制共享与私有正则的相对强度。
跨模态对齐把视频共享表示解码到音频共享空间,用均方误差惩罚两者偏离,目的是减少私有信息漏入共享子空间。稀疏门控对两路私有表示分别做线性加激活得到门值,再对两路共享表示做逐元素加权求和,另加门值的稀疏惩罚,促使模型在每条样本上偏向更可靠的一路。症状令牌是一组与融合维度相同的可学习向量,与融合向量拼接后送密集层,并加令牌专用正则以鼓励分工。
共享表征 × 私有表征: 共享表征负责抽取语音与面部运动背后同一神经运动过程的跨模态共性,由跨模态权重绑定的编码器产生;私有表征负责保留各模态独有的噪声与测量特性,由各模态独立编码器产生;二者搭配的理由是病理信号同时出现在声音和表情中但观测噪声不同,组合意义在于融合时只让可靠的共享证据主导判断,同时用私有门控抑制不可靠流,从而在缺失或退化模态下仍能推理。
局部变分自编码器 × 话语级变分自编码器: 局部变分自编码器分工是压缩短时窗内的构音与面部动态,输出逐帧隐变量;话语级变分自编码器分工是在全局平均池化后把整段话的共性与个性因子化为共享与私有高斯变量;搭配原因是短时压缩先去冗余、长时分解再做归因,组合后形成 2 级瓶颈,使模型既保留时序细节又得到可融合的定长话语表示。
看图路径: 1. 先区分上下两条分别处理音频与视频的局部时序细化与窗口变分路径;2. 再找到中间全局平均池化后的话语级共享与私有编码器方框;3. 观察跨模态对齐模块连接共享分支而私有分支绕行的走向;4. 确认最右侧融合与令牌聚合之后才进入分类与严重度输出

论文图 2。原论文 Figure 2:“Proposed modeling architecture : DIVINE”。
对照详细架构图可以定位这些模块。上下两条横向流水线分别对应音频与视频的局部卷积、窗口变分与全局池化,中间蓝色大框内并列的私有与共享编码器对应话语级解耦,右侧竖条的跨模态对齐连接共享分支,而私有分支绕行后参与门控。初学者容易误以为共享编码器是两个独立网络,原文明确它是跨模态权重绑定的,目的是让同一病理因素在两路映射到相近位置。另一个常见误解是把门控看成注意力权重,实际上门是从私有表示算出的标量或向量门,与共享表示相乘,稀疏项会推动门值变小,从而实现选择性使用。
症状令牌与双头输出接在融合之后做什么?
融合向量本身维度有限,直接分类容易把所有临床线索压成一个平均效应。症状令牌的作用是提供多个可学习的聚合槽位,与融合向量一起构成一个小网格,再经密集层变换。这样网络可以把不同方面的口部运动线索分配到不同令牌上,最后取融合位置的输出做预测。输出头是两个独立的线性加激活映射,一个经归一化给出 3 类诊断概率,一个经归一化给出严重度等级概率。
训练时两个头都有监督,分类用交叉熵,严重度按原文实现也用概率分布形式并以权重系数平衡。总损失还包括局部与话语级的重构与散度项,以及循环对齐、稀疏门控与令牌正则的加权和。需要强调的是,原文没有给出令牌数量与密集层宽度的完整消融,复述时只能说令牌提供了结构化聚合,不能断言令牌数越多越好。
稀疏门控融合 × 症状令牌: 稀疏门控融合分工是按当前样本动态决定视频流与音频流共享表示的权重,并用稀疏惩罚避免两路同时大开;症状令牌分工是提供一组可学习的临床聚合槽位,引导密集层关注口部运动等显著区域;搭配原因是门控解决用谁的问题、令牌解决看哪里的问题,组合后融合表示既有模态选择性又有临床可解释的聚合结构。
理解这部分的一个可操作检查是:遮住一路输入后,看门值是否向另一路倾斜,以及令牌输出是否仍能保持诊断稳定。原文的缺模态实验正是这种检查的宏观版本,虽然没有公开逐样本门值,但用精度保持程度间接支持了门控与令牌的鲁棒作用。
哪些参数训练,优化与早停如何执行?
训练安排的关键是冻结与更新的边界。所有语音与视觉基础模型都以冻结方式抽取表示,包括单语自监督、 multilingual 监督、韵律与说话人嵌入等多类模型,以及视频掩码自编码、视频变换器与视觉语言模型等多类视觉模型。真正用梯度更新的是局部细化卷积、2 级变分编码器与解码器、跨模态对齐解码器、门控线性层、症状令牌与密集层,以及两个输出头。优化器统一用自适应矩估计,学习率为千分之一,批量大小为 32,最多训练 50 轮并配合早停与丢弃正则以缓解过拟合。
解耦融合实验固定了多任务与正则权重,分类与严重度平衡系数、整体正则系数与令牌正则系数的取值是根据初步验证性能选定的,并在所有融合与消融中保持一致。实现基于常见深度学习框架,在单块消费级图形处理器上完成。
分类头 × 严重度头: 分类头分工是输出健康对照、肌萎缩侧索硬化、卒中 3 类的概率分布;严重度头分工是输出轻中重等严重度等级的概率分布;二者搭配组成多任务学习,理由是诊断类别与严重程度共享同一口面部运动损伤机制,联合优化可以互相约束表示,组合意义是在 1 次前向中同时完成定性诊断与定量分级。
冻结基础模型 × 可训练解耦网络: 冻结基础模型分工是直接用预训练语音与视觉模型抽取 utterance 级声学与面部嵌入,训练时不更新其参数;可训练解耦网络分工是学习局部细化卷积、2 级变分编码器、门控与令牌等全部融合参数;搭配原因是借助大规模预训练获得鲁棒特征同时把学习集中在小规模临床数据的解耦与融合上,组合后降低了过拟合风险并使 40 余种编码器组合的可比实验成为可能。
初学者要注意,冻结不等于确定性求解。冻结只是基础模型参数不更新,变分采样、丢弃、数据顺序与早停轮数仍会带来随机性。原文报告在多个随机种子与五折上平均,并用配对非参数检验对比最强基线,这正是为了说明结果在随机性下依然稳定。复现时应固定种子、记录早停 patience 与验证划分,否则单次运行的高点不能代表方法收益。
数据、预处理与基线如何保证可比?
数据来自多伦多神经面部数据集,共 36 名认知 intact 的志愿者,包括肌萎缩侧索硬化、卒中后与年龄匹配对照 3 组。每人完成九项说话与非说话任务,涵盖快速音节重复、绕口令、最大张口、噘嘴与微笑等,在统一光照与拍摄距离下以约每秒 50 帧采集。2 名言语病理学家对每次试验的 5 个维度打 5 分制,总分 5 到 25,评分者一致性为中等范围。约 3300 帧有 68 点人工面部关键点标注。数据不公开,研究经授权获取。
预处理方面,面部视频用 2 维人脸对齐网络检测 68 点以确认人脸居中可见,音频做幅度归一化并按段时间戳做话语级强制对齐。单模态基线对每个基础模型表示分别训练全连接网络与卷积网络,全连接为 3 层密集加输出层,卷积为两块 1 维卷积加批归一化与池化后再接同样密集结构。融合基线是简单的嵌入拼接,解耦方法是本文框架。所有比较都在同一被试级五折下进行,指标聚合口径一致,这是判断融合收益是否公平的前提。
关于资源可得性,原文给出代码与模型链接但本次核查显示代码与模型链接当前不可用,第三方视觉语言模型、人脸工具与对齐工具链接中部分可用、部分本次未能确认可达,因此复现时不能默认权重一键下载。
完整与缺失模态下谁在赢,代价是什么?
要回答的主问题是:在输入完整与缺失时,解耦融合是否同时优于单模态与简单拼接。比较的公平条件是同一数据集、同一被试级五折、同一组基础模型表示,指标方向为准确率与 F1 越高越好。单模态层面,视觉中最强的是视觉语言模型,音频中最强的是面向副语言任务的轻量语音模型,卷积头普遍优于全连接头,手工运动学与时序注意力特征落后于预训练视觉编码器。
简单拼接已经能利用互补信息,最优组合在完整输入下达到较高精度,但在只给一路时明显下滑。解耦融合在完整输入下进一步提升,最优组合达到全文最高点,且在缺模态下保持相对更好。下表把最优组合在 3 种测试条件下的分类结果放在一起,便于 1 次看清完整输入的上限与缺一路时的保持程度。
| 评测条件 | 准确率 | F1 分数 | 条件说明 | 是否可部署 |
|---|---|---|---|---|
| 双模态完整输入 | 98.26% | 97.51% | 音视频嵌入同时提供 | 是 |
表中双模态行的准确率与 F1 来自解耦融合最优组合的完整输入评测,另两行来自同一模型在测试时只给一路嵌入的评测。主要收益是完整输入精度最高且缺一路时仍明显高于单模态基线与拼接基线的对应缺模态结果,说明解耦与门控确实减少了对单一强编码器的过度依赖。具体代价是缺音频时下滑约 9 个百分点,缺视频时下滑约 14 个百分点,说明两路并非完全冗余,视觉对当前任务的贡献更大。未胜出项也要说明:手工运动学与部分视频变换器组合在完整与缺失条件下都落后,简单拼接在非说话纯视觉输入下也弱于解耦融合,这些反例表明不是任意两路拼接都能赢。
看图路径: 1. 先确认每张小混淆矩阵横轴为预测类、纵轴为真实类且均为三类;2. 比较左上最优配置与右下单模态基线对角线数值的明暗差异;3. 观察健康对照与肌萎缩侧索硬化之间非对角误分格的变化;4. 核对缺视频或缺音频条件下卒中类的保持程度

论文图 3。原论文 Figure 3:“Representing DIVINE configurations. Each displays true versus predicted class distributions across the combined diagnosis and severity categories: (a) DeepSeek-VL2+TRILLsson; (b)…”。
这组混淆矩阵把误差模式说得更细。左上最优配置的 3 类对角线接近满格,只有健康对照有少量被判为卒中;右上换音频编码器的配置开始把部分健康对照判为肌萎缩侧索硬化;中间缺模态的两张矩阵对角线进一步下降,健康对照与肌萎缩侧索硬化的互判明显增多;右下单模态手工与弱语音基线的非对角更分散。
纵轴是真实类、横轴是预测类,对角越高越好,不能把颜色深浅直接当精度,必须读格内百分比。像素能辨别的百分比已在格内标出,但原文未给出每格的样本数,因此不能把百分比换算成例数来做显著性断言。
去掉对齐、稀疏与令牌后性能掉在哪里?
消融要回答的是正则与结构各自贡献了多少。比较的问题是:在固定最优编码器组合与训练超参数下,逐个移除循环一致性、稀疏门控与令牌重构后,分类与误差指标如何变化。公平条件是同一数据划分与同一多任务权重,只动被测模块。指标方向与主结果一致。下表是原文报告的正则消融,包含完整模型与 3 个移除变体,便于对照每一项的边际作用。
| against simpler | variants: Flat | Fusion | and | Single- |
|---|---|---|---|---|
| Architecture Variant | A | F1 | M | R |
| DIVINE (2-Level VAE) | 98.26 | 97.51 | 1.12 | 1.93 |
| Flat Fusion (No Bottleneck) | 93.87 | 92.10 | 2.11 | 2.88 |
| Single-Level Latent Fusion | 95.22 | 93.80 | 1.85 | 2.62 |
表后解释需要同时说收益与代价。完整模型的准确率与 F1 最高、误差最低,移除任一项都导致分类下降与误差上升,其中移除令牌重构的下降幅度最大,移除稀疏门控次之,移除循环一致性相对最小。这支持令牌聚合与门控选择对最终精度的直接作用,也支持对齐对限制子空间泄露的辅助作用。但不能反推出拿掉后必然在所有组合上都掉同样幅度,因为消融只在最优组合上报告,未给出全部 40 余种组合的逐项分解。
另一个结构消融比较了 2 级变分、无瓶颈的平坦融合与单级隐变量融合,2 级结构同样领先,说明分层压缩与因子化不是可有可无的装饰。未评测的边界是令牌数量、门稀疏强度与对齐权重的联合网格,原文只固定了一组验证最优值,复现时若改数据划分可能需要重调。
哪些结论有边界,什么还没有被验证?
已验证的边界首先是数据规模与分布。36 人的单中心数据在被试级五折下能避免说话人泄露,但样本量决定了对罕见严重度与口音、年龄、录音条件的覆盖有限,总体趋势不等于每组每步都成立。跨数据集验证在原文中明确受限于缺乏同步音视频的外部语料,计划中的外部单模态基准也以数据可得为前提,因此当前最强数字应读成域内基准而非跨中心保证。其次是纯视觉非说话任务的泛化。
虽然解耦融合在非说话视频上仍领先简单拼接与单模态,但绝对精度低于说话视频,说明没有音频先验时仅靠面部运动的判别力会下降,不能把说话任务的结论直接推广到所有非说话任务。第三是临床可用性。数据经匿名化并获机构批准,研究明确为科研用途、未经临床诊断验证,社会影响部分提醒了录音条件、人口因素与分布偏移可能带来偏倚,部署需要临床监督、不确定性沟通与人工复核,不能用于自动分诊或资格判定。
缺失的证据不是技术错误,但复述时要用报告显示表达已测结果,用可能或待验证表达外推,例如门控是否真正定位到唇舌区域仍需可视化与扰动实验补足。
要复现先做什么,需要补哪项验证?
复现的第一步是重建数据管线而不是直接调模型。按原文用 2 维人脸对齐网络做 68 点检测与居中裁剪,用常见音频工具做幅度归一化与话语级对齐,并严格按被试 ID 划分五折,确保同一人不在多折出现。第二步是冻结抽取表示。语音侧覆盖自监督、弱监督多语、说话人与副语言等多类模型,视觉侧覆盖视频掩码自编码、视频变换器、视觉语言模型与手工运动学基线,全部以冻结方式输出话语嵌入,再分别训练全连接与卷积单模态头以确认基线强度。
第三步是实现解耦融合,包括局部 1 维卷积细化、窗口变分、全局池化、共享与私有话语编码器、跨模态解码对齐、稀疏门控、症状令牌与双头,总损失按分类加权严重度再加对齐、稀疏与令牌正则以及 2 级重构与散度项组织,用千分之一学习率、批量 32、至多 50 轮加早停训练。非说话纯视觉评测要单独跑,因为它检验的是无音频先验时的保持能力,下表整理了该条件下单模态最强与解耦最优的对照。
| 评测条件 | 准确率 | F1 分数 | 平均绝对误差 | 均方根误差 |
|---|---|---|---|---|
| 非说话视频单模态最强 | 89.26% | 88.29% | 6.02 | 8.06 |
| 非说话视频解耦最优 | 92.58% | 91.63% | 3.84 | 5.55 |
表中第一行是视觉语言模型单模态在非说话视频上的分类与误差,第二行是同一视觉模型加语音模型经解耦融合后在纯视觉测试下的结果。主要收益是即使测试时没有音频波形,预计算的音频特征经解耦训练仍能提升纯视觉推理,误差同步下降。具体代价是该提升依赖训练阶段见过双模态,不能理解为模型凭空补出缺失音频。还需补的验证包括跨站点录音的稳定性、不同严重度分层的校准曲线、推理延迟与显存开销,以及门值与令牌注意的可解释性检查。资源方面不要默认代码与权重可一键获取,应先确认链接可达再规划下载与版本锁定。
何时值得尝试这种解耦融合?
当任务同时满足 3 个条件时值得尝试:输入是同步的语音与面部视频,输出需要兼顾诊断类别与严重程度,测试时可能遇到缺一路或质量退化的情况。这时先用冻结基础模型拿到鲁棒嵌入,再用 2 级变分把共享病理因素与私有观测噪声分开,用稀疏门控动态选择可靠流,用症状令牌做结构化聚合,比直接拼接更符合临床对可解释与鲁棒的要求。如果只有单模态或数据完全干净且充足,解耦的额外复杂度收益会变小,不如先把单模态基线与简单拼接做扎实。
学习依赖上应按输入输出定义、相关路线对照、双路走通、模块分工、冻结与训练边界、数据划分与基线、主结果与消融、边界与复现的顺序推进,每一步都回到被试级划分、冻结范围与缺模态条件这 3 个可核对点。这样既能复述方法,也能在自己的数据上判断该方法是否适用。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses