英文题目:Résumé automatique abstractif de la parole de bout en bout, bimodal et translingue
会议身份:
conference:jep:2026:conference-paper-id:chellaf26_jep
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#多模态学习 #跨语言 #端到端 #语音 #口语理解
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Chaimae Chellaf:机构信息未能从会议 PDF 纯文本可靠映射
- Salima Mdhaffar:机构信息未能从会议 PDF 纯文本可靠映射
- Yannick Estève:机构信息未能从会议 PDF 纯文本可靠映射
- Stéphane Huet:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为连续长语音或多语语音,输出为法语抽象摘要文本,难点是缺乏大规模音频摘要配对数据且级联转写会传播识别错误。方法先将输入音频按话轮或自动切分切为语句级片段并用SENSE编码为1024维语言无关语义向量以统一双模态表示。接着经线性投影加GeLU激活映射到BARThez的768维编码空间,再由保留词元解码器的语义BARThez自回归生成摘要。训练分两阶段:先在法语MLSUM文本句嵌入上学习摘要,再在DECODA上用文本或语音嵌入微调适配。与词元级联相比,该机制跳过离散转写并依赖语言无关句嵌入空间实现双模态与跨语言共享,同时提升对分割变化的鲁棒性并降低对手工转写的依赖。在DECODA测试集下,文本训练SBARThez的Rouge-L为24,09,高于语音训练的Rouge-L 22,80。该结论适用边界限于法语呼叫中心对话与合成朗读类跨语言数据,尚未验证真实噪声、自发多语会议与长摘要忠实度。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/snakers4/silero-vad — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,哪些信息不能丢?
这篇论文处理的输入是一段连续的人声录音,典型例子是法语呼叫中心的客服与用户对话,时长可达数分钟,包含轮流发言、停顿和口语重复。目标输出是一段法语书面摘要,要求更短、连贯,并保留通话中最重要的请求、答复和结论。必须保留的信息是对话的语义要点,而不是逐字转写;允许改写和压缩,但不能编造未出现的事实。
对刚入门的读者,白话解释是:机器先听懂每一段在说什么,再用自己的话写出中文或法语纪要。论文选择法语作为摘要的目标语言,输入语音可以是法语,也可以是其他语言。输出始终是法语文本摘要。学习依赖上,先要理解语音摘要与文本摘要的区别,再理解为什么缺少语音加摘要成对数据会成为瓶颈,最后才能理解用文本摘要数据预训练、再用少量语音数据微调的 2 阶段安排。
一个可复述的样本流程是:取一段法语通话录音,按说话轮次或自动切分得到若干语音段;每段被编码成一个语义向量;这些向量按时间顺序排成序列;序列进入改造后的编码器解码器;解码器逐词输出法语摘要。
这个流程中没有显式输出全文转写,摘要直接来自语音向量的序列。这就是后文所说的端到端,英文为 end-to-end,缩写为 E2E。
已有路线为什么先转写再摘要,新路线想改变什么?
已有主流路线是级联,英文为 cascade。做法是先用自动语音识别把语音转成文字,再用文本摘要模型压缩。论文提到的文本摘要模型包括 BART、T5、Flan-T5,以及更近的大语言模型。级联的好处是两个模块都可以利用大量单任务数据,但缺点是转写错误会进入摘要,且系统由两个大部件串联,结构复杂。
另一条路线是端到端语音摘要。它直接从语音特征生成摘要,不输出中间转写。论文回顾了用受限自注意力处理长音频、用人造语音扩充数据、以及用语音编码器加问答式桥接器连接大语言模型等做法。这些工作大多依赖近 2000 小时的英语 How2 数据,说明有效端到端系统通常需要大量音频加摘要成对数据。
第三条相关线索是语音片段嵌入,英文为 speech utterance embeddings。它不再保留每 10 到 20 毫秒的声学帧,而是把 5 到 10 秒的语音段表示成一个语义丰富的向量,并与多语言语句嵌入对齐。论文提到的对齐模型包括 SAMU-XLSR、SONAR 和 SENSE,它们用教师学生训练把语音向量拉近文本教师模型的句子空间。还有一类大概念模型直接在句子向量空间建模,替代词元级建模,但此前未用于语音摘要。
端到端语音摘要 × 级联式语音摘要: 端到端语音摘要负责从原始音频直接生成文本摘要,省去显式转写中间步骤;级联式语音摘要先用自动语音识别得到转写文本,再用文本摘要模型压缩。搭配理由是级联把转写错误带进摘要,而端到端希望减少这种传递并简化架构;组合意义在于论文把级联作为必须保留的对照条件,用以判断新端到端方法在相同摘要训练来源下是否成立。
论文的定位是:在缺少大规模语音摘要数据时,能否只靠大量文本摘要数据加少量语音数据,做出双模态且跨语言的改写式语音摘要。双模态指同一摘要器既能读文本句子向量,也能读语音段向量;跨语言指输入语音可以是多种语言,输出固定为法语。
同输入同目标的工作应如何对照,而非跨类比胜负?
按同输入、同目标、同监督和同运行阶段对照,相关工作可分为 3 类。第一类是同为语音到文本摘要的端到端工作,输入同样是长音频,目标同样是文本摘要,区别在于它们多用帧级声学特征和词元编码,需要大量音频摘要对;本文用句子级语义向量和 2 阶段文本预训练,适合低语音数据条件。第二类是级联工作,输入同样是语音、目标同样是摘要,但运行阶段包含显式转写,监督包括转写文本。
本文在测试阶段不依赖转写,因此不应把类别差异直接当作同条件胜负,而应说明各自代价。第 3 类是文本侧的大概念模型,同样在句子向量空间建模,但输入是文本而非语音;本文把该思想扩展到语音,但未直接复现其英语文本摘要实验,因此不能声称全面超越。
这种分类有助于初学者避免误解:参数量小不等于一定差,因为输入表示和训练数据的量级不同;零样本大模型分数低不等于模型本身弱,因为它没有经过任务微调;合成语音上跨语言有效不等于真实通话跨语言同样有效,因为合成语音更干净且按句子生成。
论文把任务切成哪几个可验证的问题?
论文把大任务拆成 3 个可验证的子问题。第一,单语语音摘要是否可行:在只有法语文本摘要大规模数据和少量法语通话数据时,能否训练出直接读法语语音、写法语摘要的模型。第二,切分是否稳健:真实录音没有人工给出的精确边界,用语音活动检测、说话人切分或固定时长切分代替时,摘要质量是否保持。第三,跨语言是否可行:在只用法语文本训练摘要器的条件下,能否直接读英语、西班牙语、葡萄牙语和日语的语音并输出法语摘要。
例子是明确标为教学例子:假设一段法语通话包含用户报修、客服确认地址、约定上门时间三件事,理想摘要应保留这三件事并压缩口语寒暄。若模型只复制了很长的原话,虽然字面重叠高,但改写性差;若模型用自己的话重述三件事,字面重叠可能低一些,但复制更少。论文因此同时报告内容重叠指标和复制程度指标,避免只用一个维度下结论。
不经过转写的一次完整前向过程是怎样的?
方法的全景可以沿一个样本走完。输入是一段原始波形,先被切成若干段,每段记为语音段。切分在训练阶段可以用人工轮次边界,在测试阶段可以用自动方法。每段经过冻结的语音片段嵌入模型,得到一个向量,记为该段的语义表示。所有段的向量按时间顺序组成序列,再经过一个线性投影加激活函数,把维度调整到摘要模型编码器需要的尺寸。改造后的编码器读入这个向量序列,解码器按词元逐个生成法语摘要词,直到结束。
下段是该结构图的阅读引导,读图时先看整体自下而上的数据流向,再看左右标注区分语音侧与模型侧的分工,有助于把文字描述与图中模块对应起来。
看图路径: 1. 从底部波形向上追踪切分段到语义向量的主路径;2. 确认语音片段嵌入模型输出的向量序列如何进入投影层;3. 对比基于嵌入的编码器与基于词元的解码器在图中的上下分工;4. 数出示例中五个并行分支的对应关系是否一一对齐
论文图 1。原论文 Figure 1:“Architecture de notre modèle.”。
图中自下而上可见连续波形先被离散为 5 个示例段,每段向上对应一个语义向量,再并行进入同一投影与激活模块,最后进入上方的嵌入编码器与词元解码器。可见的关键是语音嵌入模型在图中被画成横跨 5 个分支的共享模块,说明每段用同一模型独立编码;投影层之上才进入序列到序列模型,说明跨段的上下文建模发生在摘要模型内部而非嵌入模型内部。解码器仍按词元输出,与编码器侧处理连续向量的方式形成对照,这正是双模设计在结构上的落点。
语音向量、文本向量和摘要器各自负责什么?
先解释术语。语句嵌入,英文为 sentence embedding,是把一句话映射为一个定长语义向量的表示;语音片段嵌入是把一段语音映射为同一语义空间向量的表示。序列到序列模型,英文为 sequence-to-sequence,缩写为 seq2seq,由编码器读入序列、解码器生成序列组成;这里选用法语 BARThez,它基于 BART 结构。
线性投影指一个矩阵乘法加偏置,用于调整向量维度;激活函数 GeLU 为其后的非线性。
语音片段嵌入 × 语句嵌入: 语音片段嵌入负责把几秒长的语音段压缩成一个语义向量,语句嵌入负责把一个文本句子压缩成同空间的语义向量。二者通过教师学生蒸馏对齐到同一多语言语义空间,搭配理由是文本摘要数据远多于语音摘要数据,对齐后可以用大量文本的语句向量序列先训练摘要器,再把语音向量序列直接替换输入。组合意义是摘要编码器看到的不再是声学帧或词表记号,而是一串跨模态可互换的句子级语义向量。
具体实现上,语音侧选用 SENSE 模型。它基于多语言预训练的语音编码器,先得到帧级表示,再用注意力池化把一整段的帧序列聚合成一个段级向量。其教师模型是与语言无关的文本编码器 BGE-M3,因此法语文本的语句向量与多语言语音的段向量在语义上靠近。文本侧在第一阶段直接用 BGE-M3 把每句转成语句向量。两个阶段的嵌入模型都保持冻结,只有投影层和改造后的序列到序列模型参与训练。
序列到序列模型 × 线性投影层: 序列到序列模型负责读入向量序列并用解码器逐词生成法语摘要,线性投影层负责把 1024 维的语义向量变换到该模型编码器要求的 768 维。搭配理由是原文沿用基于词元预训练的法语 BARThez,但去掉了原来按词元查表的输入层,投影层成为连接语义向量与编码器的唯一尺寸适配器。组合意义是编码器侧处理连续语义向量,解码器侧仍按词元生成,从而实现双模输入与文本输出的拼接。
改造细节是:去掉原编码器中按词元查表生成向量的一层,替换为接收语音或文本语义向量的投影输入;解码器结构不变,仍按词元生成。这种不对称设计使训练时可以用文本向量序列,测试时换成语音向量序列,而生成侧始终是法语词元。按原文安排,冻结与更新的分工是明确的,但梯度在编码器内部如何流动、注意力是否全部更新等更细实现未进一步展开,复现时应以原文给出的冻结范围为准,不从模型名称推定其他冻结。
两阶段训练每一步吃什么数据、更新谁、用什么监督?
训练分为两步。第一步吃大规模法语文本摘要数据。文本先按句子切分,每句用冻结的语句嵌入模型编码成向量,向量序列送入改造后的序列到序列模型,监督信号是人工参考摘要,损失为交叉熵。优化器为 AdamW,序列到序列部分与投影层使用不同学习率,并带有权重衰减。第二步吃小规模语音摘要数据。音频先按与句子类似的语音单元切分,每段用冻结的语音嵌入模型编码成向量,再送入同一摘要模型继续微调,监督仍是参考摘要。
原文明确 2 阶段都冻结嵌入模型,只训练投影层和改造后的序列到序列模型。未报告的内容包括学习率衰减 schedule、早停 patience、随机种子和梯度裁剪阈值,这些缺项应在复述时明确指出缺失,而不是猜测默认值。监督来源始终是摘要文本,没有使用中间转写作为辅助损失,也没有报告是否对嵌入模型做解冻实验。
教学例子是:第一步好比让摘要器先在文本语义空间学会抓重点和改写;第二步好比把输入从文本向量换成发音不同但语义相近的语音向量,做小幅适应。由于两类向量已通过蒸馏对齐,论文假设这种替换不需要大量语音数据,这个假设由后文单语和跨语言实验检验,而不是由训练损失本身证明。
数据、划分、模型配置和评测条件是什么?
数据安排按阶段区分。第一阶段用 MLSUM 的法语子集做文本摘要训练,规模约为数十万篇法语文章及其参考摘要。第二阶段用法语呼叫中心对话 DECODA,包含录音、人工转写和摘要。跨语言部分用 CrossSum 的多语言文本摘要数据做文本训练,再把其他语言的测试文本合成为语音做跨语言语音测试。合成时把每篇输入按句子拆开,每句生成一个波形文件,英语、西班牙语、葡萄牙语和日语分别使用不同的预训练合成模型。
下表整理论文明确给出的训练数据规模与划分,比较问题是预训练与微调的数据量是否悬殊,公平条件是同一划分沿用先前研究以保证可比,指标方向在此表不涉及优劣,只核对数据条件。
| 数据集 | 语言与模态 | 训练集规模 | 开发与测试规模 | 在本研究中的阶段用途 |
|---|---|---|---|---|
| MLSUM 法语子集 | 法语文本 | 约 392 000 篇文章及参考摘要 | 按原数据集划分 | 第一阶段文本摘要训练 |
| DECODA 法语对话 | 法语语音 | 1 390 段对话,68h59 | 开发 396 段 17h49,测试 200 段 10h19 | 第二阶段语音微调与测试 |
| CrossSum 多语言 | 多语言文本转合成语音 | 法语文本子集用于训练 | 英西葡日合成语音用于测试 | 跨语言文本训练加语音测试 |
上表的主要信息是文本预训练数据远大于语音微调数据,代价是跨语言语音为合成而非真实录音,反例是日语合成链与其他语言不同,因此跨语言比较需考虑合成质量差异,未评测边界包括真实多语言通话和噪声环境。
模型配置方面,摘要器选用约一百余 M 参数的法语序列到序列模型,语义向量维度与模型输入维度不同,因此加入投影加激活。下表整理原文给出的可复现配置,比较问题是哪些超参数已明确、哪些缺失,公平条件是 2 阶段共用同一嵌入对齐关系,指标方向不适用。
| 配置项 | 模型或部件 | 取值与说明 | 优化与损失 | 冻结与更新 |
|---|---|---|---|---|
| 摘要主干 | BARThez 法语序列到序列 | 165 millions 参数,基于 BART | AdamW,taille de lot 16 | 参与训练 |
| 输入维度 | 语句与语音嵌入 | dimension 1024,对应模型输入 dimension 768 | 经投影加 GeLU 适配 | 嵌入模型冻结 |
| 学习率 | 序列到序列与投影层 | 1 × 10−5 与 1 × 10−3,权重衰减 1 × 10−5 | 交叉熵损失 | 仅投影层加序列到序列更新 |
上表说明复现时应先按给定维度、批量和学习率搭建 2 阶段流程,主要代价是原文未给出训练轮数与早停规则,未胜出项是无法从表格判断计算成本,限制是不知道硬件预算和训练时长,因此不承诺训练开销得到改善。
评测指标包括内容重叠类的 Rouge-L 与 BertScore,越高越好,以及复制程度类的抽取片段覆盖率与密度,越低表示改写性越强。复制类指标需要文本源,因此用人工对话标注作为源文本计算。基线包括先转写后摘要的级联系统和可直接处理语音的多模态大模型,后者在论文中仅做零样本评测,因为当时不支持微调。
单语语音摘要的主结果支持什么判断?
主结果围绕同一测试条件展开:训练可以用纯文本、纯语音或两者混合,但测试统一用语音输入,以检验是否真正学会从语音生成摘要。论文报告,用纯文本微调再测语音的配置在内容重叠指标上最好,且复制程度最低,改写性最强。有趣的是,加入音频数据参与训练并没有进一步提升,这支持了一个有限判断:在该数据条件下,文本数据 alone 已足以得到稳健的语音摘要器,而不必大规模扩充音频成对数据。但这只是该数据集上的观察,不能推广为所有语音任务都不需要音频训练。
抽取片段覆盖率 × 抽取片段密度: 抽取片段覆盖率负责度量摘要中有多大比例可从源文本逐字找到,抽取片段密度负责度量这些复制片段的平均长度和排列连续程度。二者都越低表示越偏向改写式生成,搭配理由是只看字面重叠指标会奖励复制,而这两个指标能揭示模型是否真正改写。组合意义是论文同时报告内容重叠指标与复制程度指标,以解释为什么新方法字面分数略低但复制更少。
与外部系统的比较中,新方法作为端到端系统超过了零样本的多模态大模型,也超过了参数量相近的较小级联系统,但略低于最强的大规模级联组合。论文用改写性解释了部分差距:新方法依赖语义向量,更少复制原文措辞,因此在依赖字面重叠的指标上可能吃亏。这属于有限解释,不是因果证明,因为没有控制改写程度的对照实验。未胜出项必须保留:最强级联仍是内容重叠分数最高的系统;负结果是双模混合训练未带来增益;未评测边界包括人工转写质量变化、口音和噪声的影响。
需要区分直接报告与推测:论文直接报告了各系统的分数高低;有限解释是语义理解更深但处理改写时字面分数受损;待验证推测是这种改写性是否在人工评价中同样被认为是高质量,原文没有人工评价,因此不能把自动指标当作人工判断。
跨语言语音到法语摘要的证据有多强?
跨语言任务的难度被论文明确点出:模型最初在法语句子向量上训练,测试时同时切换模态和语言,直接读其他语言的语音向量。这是一个双重迁移,既换了输入形式,又换了语言。训练只用 CrossSum 的法语文本子集,测试用合成的其他语言语音,基线仍是零样本的多模态大模型。
报告的结果是:新方法在英语、西班牙语和葡萄牙语上同时在内容重叠和语义相似度上超过基线;在日语上内容重叠略低于基线,但语义相似度仍略高。支持的判断是,即使不针对特定语言或模态做适配,模型也能生成有质量的改写式跨语言摘要。限制同样明确:测试语音是合成的,每种语言的合成模型不同,日语链路与其他语言不同,因此语言间分数差异可能混入合成质量差异;也没有真实口语的跨语言评测。
比较条件是否一致需要小心:双方都是零样本跨到新语言和新模态,但基线完全没有在该任务上微调,而新方法经历了法语文本摘要训练,因此这不是同等预训练下的公平对照,而是可部署策略之间的实用对照。搜索最优或人工转写上界未报告,不能用事后最优值代替可部署收益。
把人工边界换成自动切分,性能会崩吗?
切分实验固定使用已训练好的模型,只改变测试语音的切分方式。内容敏感切分包括语音活动检测和说话人日志,前者按有声起点终点切,后者按说话人变化切;时间驱动切分包括固定 3 秒、5 秒和 8 秒三档。论文同时报告了各方法在数据上的平均段长,用于判断切分粒度。
语音活动检测切分 × 说话人日志切分: 语音活动检测切分负责按有声与静音边界把连续音频切开,说话人日志切分负责按说话人身份变化把音频切成同说话人片段。二者都属于按内容切分,与固定时长切分对照,搭配理由是真实部署没有人工时间边界,需要检验摘要质量是否依赖切分方式。组合意义是论文把两种内容敏感切分与 3 秒、5 秒、8 秒固定切分放在同一已训练模型下测试,以判断语义向量输入是否对切分长度和边界漂移稳健。
报告的趋势是:内容敏感切分保持了与人工边界相近的质量,说话人切分甚至在语义相似度指标上略高;固定时长切分整体仍然可用,只有 3 秒段出现语义分数的轻微下降,5 秒和 8 秒与人工边界相当。论文把这种稳健性归因于语义表示允许模型处理较长语音单元。这属于有限解释,因为没有逐段分析长段是否丢失细节。反证意义在于:若方法高度依赖精确边界,则自动切分应大幅掉分,但实际没有出现这种崩塌,因此支持该方法适用于边界不可靠的真实场景。
工具层面,语音活动检测使用当前可公开的第三方实现,资源状态为可用,链接当前可达;说话人切分使用已发表的工具包。复现时应记录工具版本和阈值,因为不同阈值会改变平均段长,进而影响向量序列长度。原文未报告切分错误的误判率与延迟,因此不承诺切分本身更快或更准,只讨论摘要质量随切分的变化。
哪些结论不能下,哪些验证还缺?
首先,自动指标不能当作人工评价。内容重叠和语义相似度只度量与参考摘要的接近程度,复制程度指标只度量是否照抄,都不能证明摘要 factual 正确或对用户有用。原文没有人工评价和事实一致性检验,因此不能承诺摘要更忠实或更可用。
其次,总体趋势不等于每组都成立。切分稳健是平均分数上的结论,不代表每个长对话或每个 3 秒段都不掉分;跨语言有效是 4 种语言平均意义上的结论,日语的内容重叠反例提醒我们语言和合成链路会影响结果。训练资源、推理开销、输出速度与实际延迟在原文未测量,总体参数量小不等于每步推理都快,更不能推定延迟改善。
第三,缺失证据不是技术错误,但复述时要明确标出缺项。缺项包括随机种子与统计显著性、训练轮数与早停、解码超参数如束搜索宽度、合成语音的说话人与 prosody 设置、以及切分工具的阈值版本。这些都会影响可复现性,还需补做的验证是真实多语言通话测试、噪声与口音测试、人工质量与事实性评价,以及与可微调大模型在同等微调条件下的对照。
要复现应先做什么,需要保留哪些关键条件?
复现的第一步是重建数据条件。先准备法语文本摘要数据做第一阶段训练,再准备法语对话数据的文本转写做第二阶段微调,测试统一用语音向量。划分应沿用原文的训练、开发和测试切分,以保证与先前研究可比。跨语言部分需先用目标语言文本合成句子级波形,再按句编码成语音向量,避免把整篇长音频 1 次性送入嵌入模型。
第二步是重建模型条件。文本侧用与语音模型配对的教师语句编码器,语音侧用对应的学生语音编码器,二者必须配套,不可随意替换,否则对齐假设失效。摘要主干用同一法语序列到序列结构,去掉词元查表输入层,加入投影加激活,并冻结两个嵌入模型,只更新投影层和序列到序列。优化按原文给出的批量、学习率、权重衰减和交叉熵损失搭建,缺失的训练轮数和解码设置应先做小网格搜索并如实记录。
第三步是重建评测条件。内容重叠与语义相似度越高越好,复制覆盖率与密度越低越改写。计算复制类指标时用人工标注对话作为源文本。切分对照应包括人工边界、语音活动检测、说话人切分和固定时长三档,并在报告中同时给出平均段长。代码开源、权重下载和系统可运行是三件不同的事:即使嵌入与摘要权重可得,若切分工具版本和合成模型不同,系统仍可能跑出不同结果,因此复现报告应分别说明三者的来源与版本。
何时值得尝试这种方法,何时应选级联?
当语音摘要成对数据很少、但同目标语言的文本摘要数据很多,且测试时没有可靠人工切分时,这种方法值得尝试。它的核心动作是用已对齐的语义向量把文本训练迁移到语音测试,省去大规模人工转写和精确边界标注。当输入语言多样但输出语言固定,且能接受合成语音与真实语音之间的差距作为初步验证时,跨语言链路也可作为起点。
当转写质量很高、文本摘要器很强,且系统允许维护两个大模块时,级联仍是务实选择,尤其在追求字面重叠分数的场景中。当任务要求严格事实一致、需要人工可用性保证,或运行环境噪声大、口音杂时,两种路线都需要补做人工评价和稳健性测试,不能仅凭自动分数部署。
对研究生的学习建议是:先复述单样本的数据流,再核对冻结与更新、监督来源和评测方向,最后用切分和跨语言两个反证检验迁移假设。记住论文直接报告的是分数高低,有限支持的是低数据下的可行性与切分稳健性,待验证的是真实多语言通话、人工质量和部署成本。只有补上这些验证,才能把 1 次可核对的实验结果变成可用的系统结论。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
