英文题目:Hybrid Continual Learning for Low-Resource Australian Aboriginal Language Identification
会议身份:
conference:interspeech:2026:conference-paper-id:mylvaganam26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#持续学习 #低资源 #多语言 #语言识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Pravina Mylvaganam:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Eliathamby Ambikairajah:机构信息未能从会议 PDF 纯文本可靠映射
- Vidhyasaharan Sethu:机构信息未能从会议 PDF 纯文本可靠映射
- Jingyao Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音到语言标签的语言识别任务,难点是澳大利亚原住民语言极度稀缺且说话人极少,直接微调会引发对高资源语言的灾难性遗忘。方法链分三步:先以VoxLingua107预训练的ECAPA-TDNN提取声学表征并替换末层分类器纳入新语言,再用重要性约束或教师软目标保留旧知识,最后以新语言负对数似然驱动目标语言判别。回放增强弹性权重巩固用Fisher重要性加小回放缓冲稳定旧参数,约束引导知识蒸馏则冻结教师并用温度为2.0的软分布对齐高资源输出。与单一持续学习相比,关键差异是将参数级正则与样本或输出级保留显式耦合,在回放极少时仍兼顾可塑性与稳定性。在Warlpiri单语适配中约束引导知识蒸馏取得93.38%综合F1,高于知识蒸馏基线的93.02%并远高于微调的65.38%。在Warlpiri单语适配任务下,CG-KD的Overall F1-score为93.38%,高于KD的Overall F1-score 93.02%。结论适用边界受限于仅3个原住民语言与33类高资源评测子集,跨信道与大规模语种序列场景尚未验证,极低资源下联合训练仍可能失败。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/PraviMyl/AAL — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么高资源模型的办法不能直接搬过来?
这篇解读的输入是论文正文给出的任务、方法、实验条件和数字,目标是让刚进入语音与音频方向的研究生能复述做法并核对条件。必须保留的信息包括研究对象是 3 种澳大利亚原住民语言的语种识别,基座是在大规模多语种数据上预训练的识别模型,评测同时看新语种是否学会和高资源语言是否被忘记,以及训练时冻结与更新了哪些部分。
任务是自动语种识别,也就是听一段语音判断它属于哪一种语言。论文把这个任务放在语言记录、语料整理、语音识别与翻译等下游应用的前面,因为只有先分对语言,后续工具才能调用正确的模型。对于澳大利亚原住民语言,语种识别的意义更直接,即帮助记录和教学工具把零散录音归档,减少人工整理的负担。
白话先说数据处境。所谓低资源,指可用的说话人很少、录音时长很短、标注专家稀缺。论文研究的 3 种语言中,Warlpiri 相对多一些,Dalabon 更少,Dharawal 只有几十条短句。这种量级与动辄上 1000 小时的高资源语种完全不同,因此不能指望从零训练一个大模型。
为什么高资源模型的成功不能直接搬过来。论文指出,基于大规模语料的多语种建模在高资源语种上已接近很好,但在低资源上明显更差。直接在新语种上做微调,也就是朴素迁移学习,虽然能把新语种学到很高的分数,但会把原来会的高资源语言忘掉很多。论文把这种现象称为灾难性遗忘,英文是 catastrophic forgetting。后续所有方法设计都是围绕同时做到两件事,即学会新语种并且记住旧语种。
已有的持续学习路线各管什么,为什么论文说单用一种不够?
先解释持续学习,英文是 continual learning。它的目标是让模型在陆续见到新任务时,既能吸收新知识,又能保留旧任务的性能。与 1 次学完所有数据的做法不同,它要求模型在只有新数据加少量旧信息可用的情况下更新。
论文把已有方法归成 3 类。第一类是基于正则的方法,以弹性权重巩固为代表,英文是 Elastic Weight Consolidation,缩写是 EWC。它的想法是估计哪些参数对旧任务重要,然后在学新任务时限制这些重要参数大幅改动。第二类是基于回放的方法,以经验回放为代表,英文是 Experience Replay,缩写是 ER。它的想法是保留一小部分旧任务样本,在学新任务时混在一起重新训练。
第 3 类是知识蒸馏,英文是 knowledge distillation,缩写是 KD。它的想法是用旧模型做教师,让新模型在旧类别上的输出向教师的软目标看齐。
论文认为单用一种在极低资源原住民语言上会有困难。正则方法在长期适应多种口音和声学条件不同的语言时效果下降,累积的惩罚还可能带来数值不稳定。回放和蒸馏则对新旧数据不平衡敏感,而原住民语言恰好是新语种样本极少、旧语种样本很多的典型不平衡,因此只靠回放或只靠蒸馏不足以防止遗忘。论文还提到已有混合方法多集中在自然语言或口语理解的类别增量场景,对语种识别尤其是极度欠资源语言探索很少,而且已有的回放加蒸馏混合仍对不平衡敏感,所以需要为极低资源专门设计混合框架。
论文把问题拆成哪两个适配任务,评测时看哪几组分数?
论文把适配拆成 2 个任务。第一个是单语种适配,即把预训练模型扩展到区分高资源语言加一个目标原住民语言。第二个是顺序适配,即把多个原住民语言按顺序一个一个加入,每学一个新语言都从上一个语言适配后的模型出发,要求最终同时会高资源语言和之前学过的原住民语言。举例来说,若有 3 个语言,第一步先学第一个,第二步从第一个的模型出发学第二个,第三步再学第 3 个。
灾难性遗忘 × 持续学习: 灾难性遗忘指模型学新语言后在已学高资源语言上性能明显下降的现象,分工是描述问题;持续学习指让模型在不断加入新数据时保留旧任务能力的一类方法,分工是提供解决框架;二者搭配的原因是直接在新语种上微调会改写共享参数而导致旧语种被覆盖,组合意义在于把适配新语种与保留旧语种写成联合优化目标,而不是只追求新语种准确率。
评测时论文同时报告 3 组分数。第一组是高资源语言上的分数,用来衡量遗忘程度,记为 HRL。第二组是目标原住民语言上的分数,用来衡量是否真正学会新语种。第 3 组是总体分数,把新语种和高资源语言放在一起评,记为 overall。指标用 F1 分数,数值越大越好。顺序适配时遗忘的评测还会把之前学过的原住民语言也算进保留对象。
教学上可以这样理解。只看新语种分数会掩盖遗忘,只看旧语种分数会掩盖没有学会新语种,因此必须 3 组一起看。论文后续所有比较都保持这个口径,这也是核对数字时不能只摘一个最高分的原因。
两种混合方法各自把哪两条路线拼在一起,整体思路有何不同?
论文提出两种混合持续学习框架。第一种叫回放增强的弹性权重巩固,英文是 Replay-Augmented Elastic Weight Consolidation,缩写是 RA-EWC。它把弹性权重巩固和经验回放拼在一起。第二种叫约束引导的知识蒸馏,英文是 Constraint-Guided Knowledge Distillation,缩写是 CG-KD。它把知识蒸馏和弹性权重巩固拼在一起。
先沿一个样本走完流程。输入是一段 8 到 10 秒的语音,先经过编码器变成表示,再经过分类器得到各个语言的打分,最后取分数最高的语言作为输出。训练目标同时包含学会新语种和记住旧语种。RA-EWC 的路径是新语种数据走分类损失,少量旧高资源样本走回放损失,重要参数走正则约束,三项一起优化。CG-KD 的路径是新语种数据走分类损失,旧高资源类别的输出走与冻结教师的分布对齐损失,重要参数同样走正则约束,三项按权重一起优化。
两者的不同在于旧知识从哪里来。RA-EWC 的旧知识来自真实旧样本加参数重要性,CG-KD 的旧知识来自冻结教师的软目标加参数重要性。论文给出的安排理由是 RA-EWC 即使回放缓存很小也能稳定学习,CG-KD 则能同时保护重要参数和保留旧模型行为,更适合极度稀缺场景。两种方法都要替换最后的分类层,使其同时包含新旧语言类别,这是复述时不能漏掉的构造动作。
回放增强的弹性权重巩固是如何组织数据和约束的?
这一节只讲 RA-EWC。它的输入由两部分组成,一部分是新观察到的低资源数据,另一部分是从高资源语言中保留的小回放缓存。每个训练批次同时包含新语种样本和回放样本。对应的目标是两项负对数似然损失,一项管新语种分类正确,另一项管回放样本分类正确。
弹性权重巩固 × 经验回放: 弹性权重巩固负责约束关键参数不大幅偏离旧值,分工是守住已学高资源语言的知识;经验回放负责从高资源语言中取出少量旧样本重新参与训练,分工是给模型再看一遍源域分布;二者搭配的理由是只靠参数约束在长期多语种适配中会不稳定,只靠少量回放又不足以稳住重要权重,组合后新增的作用是在回放缓存很小时仍能稳定学习并减轻灾难性遗忘,这正是回放增强的弹性权重巩固的设计。
参数约束部分用 Fisher 信息矩阵的对角元素估计每个预训练参数的重要性。直观理解是如果某个参数的微小改动会让旧任务损失变化很大,就认为它重要。正则损失要求重要参数保持接近旧值,不重要的参数允许较大改动。总损失是新语种损失加回放损失加正则损失,其中回放和正则各有一个权衡系数。论文报告调参后选择的系数包含 lambda 和 beta 的具体取值,复现时应按原文取值而不是自行猜测。
实现上有两个必须核对的细节。第一,RA-EWC 只微调更新后的分类器,编码器保持冻结。这样做是保住已有的声学表示,只调整决策边界来容纳新语言。第二,分类层被替换为包含新旧语言的联合分类层,因此输出维度发生变化。论文没有报告逐层梯度范数或 Fisher 矩阵的具体计算开销,这部分属于缺项,复述时应说明未给出,而不是从模型名称推定实现细节。
约束引导的知识蒸馏是如何让学生向教师对齐的?
这一节只讲 CG-KD。它的角色分为冻结的教师模型和待更新的学生模型。教师是持续学习之前的预训练模型,学生是要适配新语言的模型。学生一方面要学好新语种的分类,另一方面要在高资源语言类别上向教师看齐。
知识蒸馏 × 弹性权重巩固: 知识蒸馏负责让学生模型在高资源语言上的输出分布向冻结教师模型对齐,分工是保留旧模型的行为;弹性权重巩固负责限制学生模型中重要参数的改动,分工是保留旧模型的参数位置;二者搭配的理由是极低资源下新语种数据与旧语种数据严重不平衡,只对齐输出或只约束参数都容易偏向新语种,组合后新增的作用是在表示层适配的同时兼顾输出行为稳定,这正是约束引导的知识蒸馏的设计。
对齐的具体做法是对高资源语言的 logits 做温度平滑后的 softmax,得到教师和学生的软概率分布,再用两者之间的散度作为蒸馏损失。白话解释是温度越高,分布越平滑,非目标类别的相对概率被放大,类别之间的相似结构更容易被传递。温度、蒸馏权重等超参数经网格搜索在验证集上选择,论文报告温度取 2.0,平衡系数取 0.7。弹性权重巩固的正则项同样加入总损失,用来约束学生的重要参数。
实现上与 RA-EWC 不同,CG-KD 同时微调学生模型的编码器和更新后的分类器,教师模型保持固定。这样做允许表示层也为新语言做适配,同时用蒸馏牵住旧行为。复述时要区分原始目标、近似与优化步骤,论文给出的是联合加权损失的优化目标,没有单独给出蒸馏分支是否截断梯度的逐句说明,因此不应猜测教师侧的梯度路径,只能按证据说教师保持固定。
训练时真正更新什么、冻结什么,优化过程如何组织?
训练组织先说可复现的设置。每个模型训练 3 个轮次,批次大小为 32,优化器用 AdamW,学习率调度用 ReduceLROnPlateau,初始学习率为 0.001。超参数经验证集网格搜索选择,论文报告的取值为温度 2.0,平衡系数 0.7,正则系数为 10 的 6 次方,回放系数为 1.0。性能用目标原住民语言上的 F1 和高资源语言上的 F1 分别报告。
ECAPA-TDNN 编码器 × 分类器: ECAPA-TDNN 编码器负责把语音波形变成区分语言的声学表示,分工是提供可复用的多语种特征;分类器负责把表示映射到 107 种加新原住民语言的语言标签,分工是做最后的决策边界;二者搭配的原因是预训练编码器已在大量高资源语音上学到通用表示,组合意义在于适配时可以只调分类器以保住旧表示,也可以连编码器一起调以获得更强的表示适配,论文两种方法在这点上做了不同选择。
参数冻结与更新必须分开说。RA-EWC 中编码器冻结,只调分类器。CG-KD 中教师整体固定,学生编码器和分类器都调。监督来源也不同,RA-EWC 的旧知识监督来自回放样本的真实标签加参数正则,CG-KD 的旧知识监督来自教师软目标加参数正则。新知识监督都来自新语种样本的真实标签。
基座模型是先在 VoxLingua107 上训练的模型,包含 ECAPA-TDNN 编码器加一个分类器,用于 107 种语言识别。适配时分类层被替换以包含新旧语言。论文没有报告每个持续学习阶段的训练时长、显存占用或推理延迟,因此训练成本一节只能说原文未测量这些量,不能把轮次少等同于开销一定小。
数据从哪里来、切成多长、划分与高资源对照如何保持一致?
数据条件是这篇论文最需要核对的部分。原住民语言数据中,Warlpiri 和 Dalabon 来自 DoReCo 数据集,Dharawal 来自公开的 Dharawal 词语网站资源。所有录音都经过人工检查,去掉语音不清、静音、噪声过大或损坏的文件,然后下采样到 16 千赫兹并切成 8 到 10 秒的片段。
下面这张表把 3 个语言的规模放在一起比较,比较问题是 3 个目标语言的稀缺程度是否相同,公平条件是它们都经过同样的清洗、下采样、切分和划分流程,指标方向是话语数和时长越大通常越有利于学到稳定的表示。
| 语言 | 说话人数 | 切分后话语数 | 总时长 | 数据划分 |
|---|---|---|---|---|
| Warlpiri | 18 人 | 1125 条 | 3 小时 | 80 比 10 比 10 |
| Dalabon | 4 人 | 284 条 | 40 分钟 | 80 比 10 比 10 |
| Dharawal | 8 人 | 63 条 | 11 分钟 | 80 比 10 比 10 |
上表说明稀缺程度并不相同,Dharawal 只有 63 条约 11 分钟,远少于 Warlpiri 的 1125 条约 3 小时。这种不平衡直接影响后文联合训练与顺序训练的对比,未胜出项主要集中在 Dharawal 上。需要说明的是高资源对照在所有实验中保持一致,即从 VoxLingua107 中每种语言选 1000 条 8 到 10 秒的语音,与原住民语言数据一起使用。基线也保持一致的数据划分与模型结构,包括朴素微调和传统的弹性权重巩固、经验回放、知识蒸馏。
代码可用性方面,论文脚注给出代码仓库地址,但本次收到的资源状态显示该链接当前不可用,返回 404,因此不能写已公开可运行,复现只能依据正文描述的模型来源、切分与超参数进行。
基线包含哪些可运行策略,顺序适配的起点如何确定?
基线分为两类。第一类是朴素迁移学习,即在目标低资源数据上直接微调预训练模型,不加持续学习。第二类是传统持续学习方法,包括弹性权重巩固、经验回放和知识蒸馏,所有实验保持一致的数据划分与模型结构。这是比较公平性的关键,复述时要强调对照不是换了数据或换了基座。
顺序适配的起点规则是每个新语言都从上一个语言适配后的模型出发。例如先学第一种语言,再以该模型为起点学第二种,以此类推。这种做法允许累积学习,也要求模型在每一步都不丢掉高资源语言和之前学过的原住民语言。联合训练基线则是把 3 种原住民语言的训练集合在一起 1 次学完,用来对照顺序学习的优劣。
论文还说明预训练模型来自基于 VoxLingua107 训练的 ECAPA-TDNN 加分类器结构,包含超过 6000 小时的 107 种语言语音。适配时分类层替换为包含新旧语言的层。超参数选择基于验证集网格搜索,评测用总体分数同时看新旧语言。这些条件是判断后文数字能否直接比较的前提。
单语种适配中谁记住了高资源语言,谁真正学会了新语种?
这一节按问题组织。测的是把预训练模型适配到单个原住民语言后,新语种分数是否高、高资源分数是否保住。与谁比,包括不适配的源模型、朴素微调和 3 种传统持续学习基线。条件一致指同一数据划分与同一基座结构。指标方向是 F1 越高越好。
先看 Warlpiri 的总体情况,比较问题是在学会 Warlpiri 的同时谁遗忘最少,公平条件是同一预训练起点与同一评测口径,指标方向是高资源、新语种与总体 3 组 F1 越高越好。
| 任务 | 评测对象 | 朴素微调 | 知识蒸馏基线 | 约束引导知识蒸馏 |
|---|---|---|---|---|
| Warlpiri 适配 | 高资源语言 | 62.47% | 91.56% | 92.89% |
表后解释主要收益与具体代价。论文报告显示朴素微调在 Warlpiri 上达到 98.70%,但高资源掉到 62.47%,总体只有 65.38%,说明严重遗忘。传统知识蒸馏基线在 Warlpiri 上总体达到 93.02%,已明显好于弹性权重巩固与经验回放。论文提出的约束引导知识蒸馏进一步把总体做到 93.38%,高资源做到 92.89%,新语种保持 100%。回放增强的弹性权重巩固总体为 87.41%,好于弹性权重巩固的 85.36% 和经验回放的 85.26%,但未超过知识蒸馏类方法,这是一个需要保留的未胜出对照。
在更稀缺的 Dalabon 和 Dharawal 上,论文报告显示约束引导知识蒸馏总体分别为 85.68% 和 76.41%,同样高于对应知识蒸馏基线的 84.60% 和 75.99%,且新语种均为 100%。这支持该方法在极少样本下仍能学会新语种,但总体分数随数据减少而下降,说明高资源保留仍是主要瓶颈。
把三种语言放在一起一次学会更好,还是一种一种学更好?
这一节把联合训练与顺序适配当作关键对照。测的是当 3 种语言数据严重不平衡时,1 次混合训练是否会压制极少样本语言。与谁比,是同一方法下的联合基线与多种顺序。条件是否一致,论文用同一数据与同一方法,只改变是一起学还是按顺序学。指标方向仍是 F1 越高越好。
单语种适配 × 顺序适配: 单语种适配负责把一个预训练模型扩展到区分高资源语言加一个目标原住民语言,分工是检验 1 次学会一个新语种的能力;顺序适配负责把多个原住民语言一个接一个地加入,起点是上一个语言适配后的模型,分工是检验长期累积学习而不丢旧知识的能力;二者搭配的原因是只看单语种会掩盖多语种不平衡带来的干扰,组合意义在于同时回答能不能学会一个极少样本语言,以及能不能在加入第二个第 3 个语言后仍然记住前面语言。
比较问题是联合优化是否被多数语言主导,公平条件是同一方法与同一评测集合,指标方向是总体与各语言 F1 越高越好。
| 方法 | 设置 |
|---|---|
| 回放增强巩固 | 三语联合 |
| 回放增强巩固 | Warlpiri 到 Dalabon 到 Dharawal |
| 约束引导蒸馏 | 三语联合 |
| 约束引导蒸馏 | Dalabon 到 Warlpiri 到 Dharawal |
| 约束引导蒸馏 | Dharawal 到 Warlpiri 到 Dalabon |
表后解释收益、代价与反例。论文报告显示联合训练下 Dharawal 只有 50.00% 和 66.67%,而顺序适配下两种方法在所有顺序中对 Dharawal 都达到 100%。这支持把极少样本语言当作独立任务分配容量的做法更有效,因为联合优化会被 Warlpiri 等多数类主导。顺序适配的总体也更高,例如约束引导蒸馏在较优顺序下总体达到 89.43%,高于联合的 87.50%。
需要保留的边界是顺序不同结果有波动。论文报告的 6 种顺序总体在 78.69% 到 80.20% 以及 86.76% 到 89.43% 之间变化,说明顺序有影响但都能保持较好水平。论文据此解释为框架不强烈依赖数据量大小或特定顺序,但这属于有限解释,还需要更多语言和更多随机种子的验证,不能当作已证明的因果结论。
哪些结论证据不足,哪些代价没有被测量?
先区分直接报告、有限解释与未验证推测。直接报告的是单语种和顺序适配的 F1 数字,以及联合训练在 Dharawal 上明显更差的现象。有限解释是论文对为什么顺序更好、为什么蒸馏传递软目标更有效的讨论,这些讨论与数字一致,但没有单独的因果实验把每个因素拆开。未验证推测是把当前 3 种语言的结论推广到所有原住民语言或长期几十个语言的持续加入,论文没有给出这种规模的证据。
缺失证据不是技术错误,但复述时要明确。论文只用 F1 评价识别正确性,没有报告误判率分布、推理延迟、显存占用、训练时间或人工听感评价,因此不能承诺这些量得到改善。训练资源与推理开销要分开讨论,论文给出轮次与批次等训练设置,但没有给出硬件预算与每步耗时,总体趋势不等于每组每步都成立。
另一个限制是数据本身。3 种语言已是当前可用的最大原住民语音数据集,但绝对量仍然很小,且说话人很少。Dharawal 只有 8 位说话人共 63 条,划分后测试集更小,因此 100% 的新语种分数可能受测试规模限制,解读时应说明这是小样本评测的特点,而不是断言真实部署中必然完美。
要复现这篇工作,第一步先固定什么,后续还需补哪项验证?
复现先做三件事。第一,固定基座与数据口径。基座用论文说明的在 VoxLingua107 上训练的 ECAPA-TDNN 加分类器,高资源对照每种语言取 1000 条 8 到 10 秒语音,原住民语言按清洗、下采样到 16 千赫兹、切成 8 到 10 秒、80 比 10 比 10 划分的流程处理。第二,固定适配构造。替换分类层使其包含新旧语言,RA-EWC 冻结编码器只调分类器,CG-KD 固定教师并调学生编码器与分类器。
第三,固定优化与评测。用 3 轮次、批次 32、AdamW、初始学习率 0.001 与 ReduceLROnPlateau,按论文报告的温度 2.0、平衡系数 0.7、正则系数与回放系数取值,同时报告高资源、新语种与总体 3 组 F1。
还需补的验证包括更换随机种子与划分的稳定性、更换语言顺序的完整重复、以及在更多说话人与更多噪声条件下的表现。论文已给出 6 种顺序的结果,可作为对照起点,但没有报告方差与显著性,因此复现时应自己补均值与波动范围。
可用性要如实写。论文脚注的代码仓库链接在本次核对中当前不可用,状态为 404,因此不能当作可下载运行的依据。权重与数据方面,预训练模型与 DoReCo 数据集在正文中有明确来源说明,Dharawal 来自公开网站资源,但具体可访问性需使用者自行确认,不应把正文提到等同于一键可运行。
何时值得尝试这两种混合方法,如何一句话记住它们的分工?
何时值得尝试可以按条件回答。当已经有一个多语种识别模型,又必须加入样本极少的新语言,同时不能丢掉旧语言时,值得尝试持续学习而不是朴素微调。当只能保留很少旧样本时,优先考虑回放增强的弹性权重巩固,因为它为小缓存设计了参数约束。当还能保留旧模型做教师并允许调编码器时,优先考虑约束引导的知识蒸馏,因为论文中最强的保留效果来自该方法。
一句话记住分工是回放给旧样本,蒸馏给旧行为,正则守住重要参数。RA-EWC 是旧样本加守参数,CG-KD 是旧行为加守参数。两种方法都用新语种损失保证学会新语言,区别只在旧知识的来源不同。
收束时回到可核对的事实。论文在 3 种原住民语言上显示混合方法优于朴素微调与传统持续学习基线,约束引导知识蒸馏的总体最高,顺序适配比联合训练更能保护极少样本语言。这些判断的支持范围限于论文报告的数据、基座、划分与指标,超出该范围的推广属于可能但待验证,不能当作已证明的部署收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses