英文题目:Impact du bilinguisme français-anglais sur les performances de la reconnaissance automatique du locuteur
会议身份:
conference:jep:2026:conference-paper-id:cecchini26_jep
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#统计分析 #跨语言 #语音 #说话人验证
评分:5.1/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Margaux Cecchini:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Ferragne:机构信息未能从会议 PDF 纯文本可靠映射
- Laurianne Georgeton:机构信息未能从会议 PDF 纯文本可靠映射
- Christophe Stecoli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究面向法庭语音学中的自动说话人识别,输入为同一双语人在法语与英语下分别录制的语音对,输出为系统给出的相似度似然比分数,实际难点在于语内语言切换带来的声学变异会被系统误读为说话人身份变化。方法链由三步衔接:先组织法英双语人朗读语料并构造单语比较与双语比较条件,其成对组合直接作为待评样本。再调用法医商用系统对其成对计分得到原始似然比,并按单语与双语分别使用独立参考人群归一化以消除条件间量纲差异。随后将归一化分数送入线性混合模型,以语言类型与身份及其交互为固定效应并控制两端信噪比,说话人设随机截距,其估计结果直接支撑结论判断。相对已有小样本双语个案,关键机制差异在于以大样本与性别分组重复验证语言与身份交互,将论证从偶发误差转向系统性混淆及其实际法庭评估意义。原文未提供可核对的关键定量结果。该结论适用边界受限于朗读体长时录音与单一系统,尚未验证自发语音短时噪声与跨信道的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么:法庭语音比较为什么难?
这篇解读的输入是论文正文提供的确定性证据,目标是让刚进入语音、音乐与音频领域的研究生能够核对方法并用自己的话复述实验逻辑。必须保留的信息包括数据规模与语料形式、比较系统名称、归一化方式、统计模型结构、主效应的方向与量级,以及作者明确承认的局限。本文的输出是一套按学习依赖展开的讲解,不增加原文没有的模型结构、参数量或性能承诺。
法庭语音比较的任务可以白话理解为:给定两段录音,判断它们在多大程度上支持来自同一个人的假设。英文名是 forensic speaker comparison,自动版本是 reconnaissance automatique du locuteur,缩写为 RAL。后文统一用 RAL 指代该自动系统。它的输入是两段音频波形,输出是一个相似度分数,更准确地说是似然比类的分数,用来表达证据强度。法官或鉴定人不会只看分数大小,还要考虑录音条件、说话方式和人群背景。
初学者容易把 RAL 想象成声纹指纹比对,认为同一人的声音在任何情况下都稳定接近。论文开头强调的难点是 variability intra-locuteur,即说话人内变异,白话就是同一个人前后 2 次说话也可能差别很大。感冒、情绪、信道、年龄都会带来变异,而双语人的语言切换是一种特别强的变异来源。当一个人先说法语再说英语时,发音目标、节奏、元音空间和用词习惯都发生变化,系统可能把语言差异误读为换了一个人。
reconnaissance automatique du locuteur × phonétique criminalistique: reconnaissance automatique du locuteur 负责计算两段录音来自同一人的相似程度并输出分数,phonétique criminalistique 负责把该分数放在法庭语音比较的评估框架里使用,二者搭配的原因是法庭场景要求分数可解释且考虑说话人内变异,组合意义是把技术分数转化为是否支持同一来源假设的证据权重。
因此本研究的问题不是笼统地提高识别率,而是有针对性地测量语言切换对相似度分数的压低程度。理解这一点后,后续的方法全景、统计建模和结果解读才有明确的对照基准:单语比较是参照,双语比较是待检验的条件,同一人与不同人是另 1 维度的分组。
已有路线如何看待双语条件下的误差上升?
在进入本研究的具体做法之前,需要先定位它在文献中的位置。论文引用的相关工作形成一条比较一致的路线:当训练、参照人群或测试语言不匹配时,自动说话人识别的错误率会上升。作者引用了 Nuttall 等人在 2023 年关于女性双语语音匹配与失配条件的工作,Morrison 在 2014 年关于法庭语音比较有效性检验的讨论,以及 Tomić 与 French 在 2019 年关于跨语言长期共振峰频率的工作。这些工作从不同角度指向同一个担忧,即语言失配会引入系统性偏差。
结果部分还明确提到与 Lo 在 2023 年的博士论文结论一致。Lo 的工作讨论的是基于似然比的法庭语音比较中的双语问题,与本文使用的归一化似然分数思路直接可比。把本文放在这条线上看,它的增量不在于提出新的神经网络结构,而在于用法语与英语这对具体语言组合、较大规模的双语朗读语料和混合效应建模,给出可复述的效应方向和量级。
对初学者而言,相关工作的对照维度应当按同输入、同目标、同监督和同运行阶段来理解。同输入意味着都是语音比较而非语音识别或语种识别,同目标意味着都是判断是否同一说话人,同运行阶段意味着都是测试阶段出现语言切换。论文没有声称在多种信道、自然对话或第三种语言上重复验证,因此不能把法英结论直接推广到任意语言对。这一点在复现与收束部分还会回扣。
要回答的具体问题是什么:语言切换压低了多少分?
论文要回答的问题可以拆成 3 个可检验的子问题。第一,在控制其他因素后,双语比较的相似度分数是否显著低于单语比较,低多少。第二,同一说话人比较是否显著高于不同说话人比较,高多少。第三,也是最关键的,语言切换是否特异地削弱了同一说话人的优势,也就是语言类型与说话人身份之间是否存在交互作用。
举一个教学例子,但明确标为例子而非论文数据:假设有说话人甲的法语录音甲法、英语录音甲英,以及说话人乙的法语录音乙法。那么单语同人比较是甲法对甲法的另一段,单语异人比较是甲法对乙法,双语同人比较是甲法对甲英,双语异人比较是甲法对乙英。理想系统应当让两类同人比较都明显高于两类异人比较。论文担忧的失败模式是甲法对甲英的分数掉到与甲法对乙英相近的位置,即系统混淆了换语言与换人。
这种提问方式决定了后续实验必须同时操纵两个因子,而不是只报告总体正确率。只报告总体正确率无法区分是系统本身分辨力差,还是语言切换特异地伤害了同人比较。因此论文选择以分数为因变量的回归建模,而不是只给出错误率数字,这为初学者理解交互效应提供了直接入口。
方法全景:从一段朗读到一个可比分数经历了什么?
沿着一个样本走完全流程有助于建立全局观。假设取出 1 名双语人的两段朗读,一段法语约数十秒,一段英语约数十秒。第一步是把这两段音频送入已有系统 VOCALISE,英文全称在参考文献中给出为 forensic automatic speaker recognition system,中文可理解为面向法庭场景的自动说话人识别系统。论文没有重新训练该系统,而是直接调用它产生比较分数。
第二步是归一化。原文明确写道,系统产生的是 scores de vraisemblance normalisés à l’aide d’une population de référence distincte pour des comparaisons monolingues et bilingues,白话就是用参照人群完成归一化的似然分数,且单语比较与双语比较使用各自独立的参照人群。参照人群的作用是告诉系统当前相似度在背景人群中算高还是低,从而把原始相似度校准为可比的证据值。单双语分别使用不同参照人群是一个重要的方法细节,复现时必须保留,不能混用同一个背景集。
第三步是统计分析。所有比较得到的分数被汇总到 R 语言环境中,用线性混合模型分析语言类型、说话人身份、交互项和信噪比的影响,并为每个说话人设置随机截距。这意味着最终回答问题的不是单次比较的 anecdote,而是控制了个体基线和录音质量后的总体效应。初学者应当记住这个 3 段链条:音频对输入、VOCALISE 输出加归一化分数、混合模型估计效应。
系统与分数组件:VOCALISE 输出的是什么?
VOCALISE 在本文中是一个既有工具组件,不是本研究训练的新模型。论文引用 Alexander 等人在 2016 年的系统描述,说明它支持频谱、语音学和用户提供的特征。原文没有给出该系统的内部网络结构、训练数据、特征维度或打分公式,因此本解读不推测其内部是嵌入向量余弦距离还是概率线性判别分析。能复述的是它的功能接口:输入两段音频,输出一个经过参照人群归一化的似然分数。
似然分数需要白话解释。英文是 likelihood ratio 或 vraisemblance,白话就是比较两个假设的相对支持度:假设一是两段录音来自同一人,假设二是来自不同人。分数为正通常表示更支持同一人,分数为负表示更支持不同人,但具体零点含义取决于归一化方式。论文结果部分提到归一化后系统倾向于给跨语言同人对赋负分,这正是需要警惕的信号:分数的符号翻转意味着证据方向被语言切换带偏。
scores de vraisemblance × population de référence: scores de vraisemblance 负责量化在同人假设与异人假设下观察到当前相似度的相对支持强度,population de référence 负责提供背景人群分布以完成归一化校准,二者搭配的原因是原始相似度不能直接跨条件比较,组合意义是得到可在单语和双语条件下分别归一化后的可比分数。
另一个组件是参照人群。单语与双语分别使用不同参照人群的做法,初学者可以理解为分开校准尺子。这样做的好处是避免用单语背景去校准双语分数时引入额外偏差,但代价是两类分数的可比性依赖于各自校准的质量。如果双语参照人群本身规模或构成不同,结果可能混入校准差异。原文没有报告参照人群的具体人数与构成,这是复现时需要补记的缺项,不能自行假设。
比较设计组件:语言类型与说话人身份如何交叉?
论文的比较设计包含两个正交因子。第一个因子是 type de comparaison linguistique,即语言比较类型,白话就是这次比较是单语还是双语。单语又细分为法语对法语和英语对英语,双语是法语对英语。第二个因子是 identité du locuteur,即说话人身份,白话就是这次比较的真相是同一人还是不同人。两者交叉形成至少 4 类试验:单语同人、单语异人、双语同人、双语异人。
这种交叉设计的搭配理由是直接可比。只有同时知道单语同人与双语同人的差距,以及单语异人与双语异人的差距,才能判断语言切换是整体压低所有分数,还是特异地伤害同人比较。如果只是整体压低,阈值平移或许可以补偿;如果是特异交互,简单的阈值调整难以同时保住两类正确率。论文发现的正是后者更严重的情况。
type de comparaison linguistique × identité du locuteur: type de comparaison linguistique 负责区分比较是单语还是跨法英双语,identité du locuteur 负责区分比较的是同一人还是不同人,二者搭配的原因是要分离语言变化与说话人变化各自对分数的影响,组合意义是通过交互项检验双语条件是否特异地削弱了同一说话人的分数优势。
还需要说明信噪比的作用。原文把两段音频各自的 SNR 作为协变量纳入模型,白话就是控制录音清晰度的影响。SNR 英文是 signal-to-noise ratio,即信号与噪声的能量比。做法是无论语言条件如何,先扣除因录音质量不同带来的分数波动,再估计语言效应。这一步对初学者很重要:在真实法庭录音中,信道与噪声常常与语言切换同时出现,不控制 SNR 会把噪声惩罚误算到语言头上。
本研究训练了什么:无训练阶段时真实计算是什么?
本研究没有训练新的神经网络,没有报告优化器、学习率、轮次、损失函数或梯度路径,也没有冻结与更新部分参数的描述。因此本节必须明确说明不存在训练阶段,不能把调用既有系统等同于确定性求解,也不能从系统名称推定其内部是深度嵌入还是传统模型。
真实发生的计算分为两类。第一类是既有模型推理:把每对音频送入 VOCALISE 得到原始相似度,再用各自条件下的参照人群完成归一化,得到可用于统计的分数。这个过程对本文而言是黑盒调用,论文未报告其内部随机性、版本号细节或运行硬件,因此不能断言重复运行会得到比特级一致的结果。第二类是统计建模计算:在 R 中拟合线性混合模型,以分数为因变量,以语言类型、说话人身份、交互项和两个文件的 SNR 为固定效应,以说话人为随机截距分组因子。
modèles linéaires mixtes × intercepts aléatoires pour les locuteurs: modèles linéaires mixtes 负责在控制信噪比等协变量的同时估计语言类型和说话人身份的固定效应,intercepts aléatoires pour les locuteurs 负责吸收每个说话人基线水平不同的随机变异,二者搭配的原因是同一说话人贡献多个比较对时观测不独立,组合意义是避免把个体差异误读为语言效应并得到更稳健的效应估计。
对初学者而言,这里的学习依赖是先理解推理产生数据点,再理解回归估计效应。每个数据点是 1 次比较的分数,每条回归系数回答一个问题:双语比单语低多少,同人比异人高多少,交互项又抵消了多少。论文未报告模型公式的完整数学形式、随机斜率是否纳入、收敛判据或多重比较校正,因此复现时只能按文字描述搭建最小可运行版本,并在报告中明确标注这些缺项。
实验条件:数据、时长与分析口径如何固定?
实验条件部分按数据、协议与聚合口径组织。数据来自 383 名法英双语人的朗读句,每段录音时长在数十秒量级。语料形式是朗读而非自然对话,这意味着发音更规范、语速更平稳、背景噪声更可控,有利于分离语言效应,但也限制了向法庭常见的电话录音或自然交谈的推广。说话人数量较大是本研究的优点之一,为随机截距估计提供了基础。
协议方面,每次比较涉及两段音频,系统输出一个分数。归一化使用与比较条件匹配的独立参照人群,单语用单语背景,双语用双语背景。统计在 R 中完成,因变量是分数,自变量包括语言比较类型、说话人身份、交互项和两个文件的 SNR,分组因子是说话人。这种口径意味着报告的效应已经扣除了个体基线差异和录音质量差异,不是原始均值差。
下表把可核对的数据条件整理为五列,便于复现时逐项对照。阅读时注意区分说话人数量、语料形式、时长范围、比较系统与分析工具,它们属于不同维度的条件,不能互相替代。
| 条件维度 | 具体内容 | 数量与单位 | 系统与工具 | 比较分组 |
|---|---|---|---|---|
| 说话人规模 | 法英双语朗读人 | 383 人 | VOCALISE 系统打分 | 单语与双语对照 |
| 录音时长 | 每段朗读时长范围 | 40 秒至 1 分钟 | 参照人群分别归一化 | 同人与异人对照 |
表前提出了比较问题:在什么数据规模和时长下测量语言效应,公平条件是单双语分别校准并控制信噪比,指标方向是分数越高越支持同一人。表后需要解释主要收益与代价:较大规模的朗读语料让语言主效应和身份主效应易于检出,这是收益;代价是朗读体的可控性换来了生态效度的损失,且原文未报告采样率、信道、性别分布细节和参照人群构成,复现时若使用不同信道或自发语音,效应量可能变化。未胜出的边界是自然对话、噪声电话和第三语言对均未评测,不能默认结论不变。
主结果:双语压低多少,同人优势还剩多少?
主结果围绕 3 个回归效应展开。第一是语言比较类型的主效应:双语比较的相似度分数显著低于单语比较,回归系数约为负 2.4,显著性水平小于千分之一。这意味着在其他变量相同的情况下,仅把比较从单语换成跨语言,分数平均下移约 2.4 个单位。方向是明确的惩罚,量级需要结合分数的整体分布来理解,论文通过分布图显示这种下移足以把许多同人对推过零点进入负分区。
第二是说话人身份的主效应:同人比较显著高于异人比较,系数约为正 8,显著性同样小于千分之一。这说明系统本身具有基本的分辨能力,同人分数平均高出约 8 个单位。这是重要的基线,没有这个基线就无法判断双语惩罚是否足以抵消身份优势。
comparaisons monolingues × comparaisons bilingues: comparaisons monolingues 负责给出同一语言内比较的基准分数分布,comparaisons bilingues 负责给出跨法英比较时的分数分布,二者搭配的原因是只有在同一系统和同一归一化逻辑下对照才能定位语言切换的代价,组合意义是揭示跨语言比较把同人分数系统性拉向负值并与异人分布混叠。
第三是交互效应,也是论文强调的发现:同人优势在双语条件下被大幅削弱。原文表述为同一说话人带来的优势在双语比较中强烈减少,归一化后的分布显示即使真相是同一人,跨语言时系统仍倾向于给出负分。这在教学上对应混淆矩阵的特定恶化:不是所有错误都均匀增加,而是同人跨语言被判为异人的错误特异增加。作者还说明该模式在按性别分别分析时依然稳健,排除了效应完全由某一性别驱动的简单解释。
下表把两个核心主效应的方向、量级与显著性整理为五列,便于与基线对照。阅读时注意系数单位是分数单位而非百分比,百分点与相对百分比在此不适用,不同指标的差值不能混入同一列比较。
| 效应名称 | 比较方向 | 系数估计 | 显著性 | 证据含义 |
|---|---|---|---|---|
| 语言类型主效应 | 双语低于单语 | β ≈ −2.4 | p < .001 | 跨语言系统性惩罚 |
| 说话人身份主效应 | 同人高于异人 | β ≈ +8 | p < .001 | 系统保留基本分辨力 |
表前提出的比较问题是:在控制说话人和信噪比后,语言惩罚与身份优势各自有多大,指标方向是分数越高越支持同人。表后解释主要收益与代价:收益是两个主效应量级清晰且显著,为交互解读提供了锚点;代价是交互项的具体数值未在正文给出,只能定性复述为优势被强烈削弱,不能自行编造交互系数。未胜出项是双语异人分布并未成为焦点,论文的警示集中在双语同人被低估,而非双语异人被高估。
分布意味着什么:为什么说系统混淆了换语言与换人?
论文用图 1 展示全语料上的分数分布,按单语英语对英语、单语法语对法语和双语比较分组,并区分真相为不同人与同一人的分数。依据图注与正文归因引用,该图用不同颜色区分同人与异人,作者的文字结论是归一化后双语同人对也多为负分。需要明确说明的是,本次解读没有收到该图的图像像素,因此不描述坐标轴刻度、曲线形状或颜色位置,只复述作者报告的分布含义。
分布含义的教学要点是区分均值下移与分布重叠。均值下移只说明双语分数平均更低,分布重叠才说明决策困难:如果双语同人分布整体左移到与异人分布大量重叠的位置,那么任何单一阈值都难以同时保证低漏判与低误判。论文的措辞是同人跨语言分数接近异人分数,正是重叠加重的表述。这比单独报告系数更直观地解释了法庭风险:证据方向可能被语言切换反转。
重提结果时需要增加新的对照维度。除了单双语对照,还应注意法语内比较与英语内比较是否完全一致。原文把两者都归为单语,但没有报告两者之间是否存在差异。如果某种语言内部本身分数更高,那么双语惩罚中可能混入特定语言的基线差异。原文未展开这一分解,因此在复述时应标注为待验证的细分,不能默认两种单语条件完全等价。
哪些对照支撑稳健性:性别分组与信噪比控制说明了什么?
论文明确报告的稳健性对照有两类。第一类是按性别分别分析,结论是上述语言主效应、身份主效应与交互效应在分组后依然观察到。这一步的作用是排除效应由单一性别的发音特点或数据不平衡主导的可能性。对初学者而言,这类似于消融中的分组验证:把全集拆成两个子集,看结论是否同向成立。原文没有给出分性别的具体系数与样本量,因此只能复述方向性稳健,不能比较男女效应谁更大。
第二类是把两个音频文件的 SNR 纳入模型。这相当于控制录音质量的对照。如果不控制 SNR,双语录音恰好噪声更大时,语言惩罚会被高估;控制后仍显著,才能更放心地归因于语言本身。原文引用了 Kim 与 Stern 在 2008 年的信噪比估计方法作为背景,但正文没有报告 SNR 的分布、估计窗口或双语与单语之间 SNR 是否平衡。这是复现时必须补记的细节:需要报告各条件下的 SNR 均值与方差,否则无法判断控制是否充分。
未评测的边界同样重要。论文没有报告去掉参照人群分别校准后结论是否成立,也没有比较不同阈值下的错误率变化,更没有测试自然对话、短时片段或信道失配下的表现。因此不能声称该双语惩罚在所有部署条件下恒定成立,只能说在朗读长句、分别校准、控制 SNR 的条件下稳健。
哪些结论不能下:数据、指标与推广的边界在哪里?
区分直接报告、有限解释与未验证推测是阅读本论文的关键。直接报告的是:在 383 人朗读语料上,用 VOCALISE 经条件匹配的参照人群归一化后,双语分数显著低于单语,同人分数显著高于异人,且同人优势在双语下被削弱,模式在性别分组中同向成立。这些是论文显示的内容,可以复述。
有限解释的是系统混淆了换语言与换人。这句话有分布重叠的支持,但严格来说混淆是机制解释,回归与分布只能显示分数模式一致,不能证明系统内部把语言特征当成了说话人特征。要验证机制,需要进一步分析嵌入空间、特征重要性或跨语言说话人向量的偏移方向,而原文没有提供这类分析,因此用支持而非证明来表述更准确。
未验证的推测包括向其他语言对、自发语音、短语音、电话信道或另一套 RAL 系统的推广。原文数据限定为法英朗读、时长数十秒、单一系统,指标限定为归一化分数与回归系数,没有报告等错误率、误判率、延迟或计算成本。相关性不等于因果,总体趋势也不等于每对比较都成立。复现时不应承诺降低误判率或提升庭审可靠性,只能承诺在相同条件下重现分数惩罚的方向与大致量级。
复现先做什么:保留哪些条件才能重走实验?
复现的第一步是准备可比数据。需要收集一批法英双语人的朗读录音,每人至少提供法语与英语各一段,每段时长尽量落在原文的数十秒范围内,并记录采样率、量化精度、录音设备与环境噪声。说话人数量不必恰好 383,但应足够支撑按说话人设置随机截距的混合模型,过少会导致随机效应估计不稳定。朗读文本最好控制难度与长度,避免某一语言的文本系统性更难。
第二步是固定比较协议。用同一套 RAL 系统对所有配对打分,单语比较与双语比较分别用各自独立的参照人群归一化,不能混用背景集。参照人群的人数、性别构成与语言背景必须记录并报告,因为校准质量直接影响分数零点。每个比较对需保存两个文件的 SNR 估计值,并在建模时作为协变量纳入。分析在 R 中用线性混合模型实现,因变量为分数,固定效应包括语言类型、同异人标签、交互项与两个 SNR,随机效应至少包括说话人截距。
第三步是报告与核对。至少报告语言主效应系数、身份主效应系数、交互方向、显著性水平、分数分布图与分性别稳健性。关于代码、模型与数据是否公开,本次收到的资源状态显示没有发现来源绑定且完成验证的资源,因此不能声称代码、模型或数据已公开,只能写本次未能确认可达或未提供链接。训练资源与推理开销在原文未报告,复现时应自行记录运行时间与硬件环境,但不归因于原文。
何时值得重视双语惩罚:给新人的行动清单是什么?
综合全文,何时值得尝试本文的思路可以归纳为 3 条。当你的应用涉及双语说话人且需要在法庭或高风险场景解释分数时,应当把语言条件作为一等变量纳入评估,而不是只报告总体正确率。当你发现跨语言同人分数偏低时,应先检查是否使用了与条件匹配的参照人群,再检查 SNR 是否平衡,最后才考虑模型本身的跨语言泛化。当你需要向非技术人员解释风险时,可以用同人跨语言分数向异人分布靠拢这一分布语言,而不只是引用回归系数。
论文特有的误解需要澄清。第一,负分不等于系统判定一定不是同一人,分数是证据权重,需要结合先验与阈值理解,但在本文分布下负分增多确实意味着支持同人的证据被削弱。第二,单语性能好不等于双语性能好,不能用单语评测代替双语评测。第三,没有训练新模型不等于工作量小,设计正交比较、匹配参照人群与控制混杂本身就是方法贡献。
还需补做的验证包括:在自发对话与短时语音上重复实验,在另一套 RAL 系统上检验惩罚是否同向存在,报告等错误率等决策指标随阈值的变化,以及公开参照人群构成与 SNR 分布以便他人精确复现。记住本文的边界:在法英朗读、VOCALISE 分别校准、混合模型控制个体与噪声的条件下,语言切换是主要的分数混杂源。离开这些条件,结论需要重新测量而非直接引用。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses