英文题目:Sequential Adapter Stacking for Cross-Lingual Low-Resource ASR
标签:#语音识别 | #Adapter | #跨语言 | #低资源
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
👥 作者与机构
- Thai Thi Thanh Thao Dang:机构信息未在 arXiv HTML 中可靠披露
- Mengjie Qian:机构信息未在 arXiv HTML 中可靠披露
- Kate Knill:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
大规模多语言自动语音识别(Automatic Speech Recognition,ASR)向Whisper未支持语言扩展时输入为低资源语音、输出为转写文本,难点在于预训练表示偏向高资源语言且目标标注稀缺时全量微调易破坏原有表示。本文先用编码器表示相似度、解码器词符覆盖与谱系相似度三轴度量对待选源语言排序,再在冻结Whisper主干上单语训练源语言瓶颈适配器并冻结,随后在其输出之上串联训练目标适配器并仅优化该顶层模块。相比暖初始化复用权重与注意力融合动态加权,串联堆叠(Sequential Adapter Stacking,SeqStack)以固定源条件变换加残差传递避免了注意力权重漂移。在FLEURS全量目标数据上配对最相近源语言时SeqStack相对全量微调在3个目标上词错率(Word Error Rate,WER)相对降低5%至8%,在1小时目标数据上对Assamese和Xhosa相对降低12%和26%。该结论限于Whisper Medium与3个目标语言及120小时级源适配器条件,未验证其他基座与零样本外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么低资源会难?
本文输入是目标低资源语言的转录语音,输出是该语言的自动语音识别文本,评价用词错误率,越低越好。研究对象是已经在大规模多语言数据上预训练的 Whisper 模型,任务是把它扩展到预训练中没有作为识别语言出现过的 3 种语言。论文选择阿斯图里亚斯语、阿萨姆语和科萨语,理由是它们的原始 Whisper 基线都很弱,词错误率在 50% 以上,同时三者代表了最近亲缘语言在 Whisper 中覆盖程度不同的三档情况。
对刚入门的读者,白话是这样:大模型见过很多大语种,但没见过这 3 个小语种,直接拿来识别会错得很厉害。如果只有几小时到十几小时的标注语音可用,又把全模型都改一遍,就容易把原来有用的表示改坏。于是问题变成如何在冻结主干的前提下,只动很少的参数,并把富资源源语言学到的东西搬运给目标语言。
本次解读的输入是论文标题与正文证据,目标是把方法讲到可复述,输出是 1 篇按学习依赖展开的技术解读。必须保留的信息包括 3 种迁移机制的冻结与更新安排、源语言选择的三轴相似度、受控实验条件、主结果数字与统计显著性,以及 1 小时极低资源对照。本文不评价代码与数据是否公开,因为本次未获得可用资源状态,不得声称已公开。
已有路线各自解决了什么,又留下了什么?
第一条路线是全量微调,直接更新整个模型。它的优点是表达能力不受限,缺点是在目标数据稀少时容易覆盖预训练表示。论文把它作为强参考,而不是默认最优解。
第二条路线是参数高效微调,包括瓶颈适配器、低秩适配、提示类方法等。瓶颈适配器的特点是每个语言可以独立训练一个小模块,冻结主干,只训练插入的下投影与上投影,因此模块可以复用和组合。这为跨语言搬运提供了载体。
第 3 条路线是跨语言复用源适配器。论文回顾了 3 类做法:双适配器结构、暖初始化迁移、基于融合的方法。暖初始化把目标模块从源模块复制过来再训练,融合方法用学习到的权重动态组合多个语言适配器。论文指出,在大规模多语言识别主干上,如何最好地利用预训练源适配器仍未充分探索。
第四个相关问题是选哪个源语言。自然语言处理中已有较多源选择研究,语音识别中以往多凭可用性或语言学直觉选源。即使事先量化相似度,也多用于预测固定流程的结果,而不是驱动适配决策。论文因此把如何迁移与选哪个源放在同一受控比较中研究。
与同输入同目标的工作如何对照?
在同输入、同目标、同监督与同运行阶段下,暖初始化迁移的可比对象是低秩适配 Whisper 的源初始化做法,本文的对照显示它在多语言主干上起点优势有限。目标内融合的可比对象是 SimAdapter 与适配器融合变体,本文的对照显示它在近源对上有时优于单语适配器,但会因编码器注意力漂移而稀释近上限系统。顺序堆叠的可比对象是 MAD-X 的堆叠设计,区别在于本文堆的是两个语言适配器且源条件化在推理时保留,而不是推理时替换语言适配器做零样本迁移。
类别差异不能当作同条件胜负。例如以往融合正则化在少预训练主干上有效,不能直接搬来断言在 Whisper 上也有效;以往按可用性选源的做法也不能与本文三轴排序后的最近源直接比大小。只有在相同目标划分、相同参数量控制与相同早停标准下,顺序堆叠最近源显著超过全量微调的结论才成立。
论文把问题收窄到哪三件事?
第一,迁移机制比较。在相同的训练条件下比较暖初始化、目标内融合与新提出的顺序堆叠,看哪一种能稳定利用源适配器。第二,源选择框架。在适配前用 3 种互补的相似度量对候选源排序,区分最近源、中等源与远端对照普通话,再看排序是否与实际增益一致。第三,极低资源稳健性。把目标训练数据压缩到 1 小时子集,检验优势是否仍然存在。
举例说明,但例子不代表论文数值:假如目标是科萨语,候选源有祖鲁语、斯瓦希里语和普通话,框架先给出亲疏排序,再分别用 3 种机制做适配,最后比较词错误率。论文的实际结论是只有最近源配合顺序堆叠在 3 个目标上都显著超过全量微调,中等源并不稳定优于远端对照。
三条路线与选源框架如何分工?
论文以 Whisper 中型模型为案例主干,主干参数冻结是 3 条适配路线的前提。目标独适配器微调是基线,只训练一个近零初始化的目标适配器。暖初始化迁移沿用源自低秩适配 Whisper 研究的思路,先把目标适配器初始化为源适配器,再在目标数据上训练。目标内融合受 SimAdapter 启发,把已训练的源适配器与目标适配器用逐层学习的注意力组合,论文的变体把查询与键投影到远小于模型维度的维度,并直接重加权适配器输出而不做值投影,使新增参数量与单个适配器可比。
新提出的顺序堆叠受 MAD-X 的堆叠思想启发,但做了关键改动。MAD-X 是可替换的语言适配器加任务适配器,推理时可替换;本文是两个语言适配器串行,源条件化在推理时保留。先在源数据上单语训练源适配器并冻结,再在其上堆一个近零初始化的目标适配器作为唯一在目标数据上优化的部件。
编码器表示相似度 × 词符覆盖率: 编码器表示相似度负责从 Whisper 编码器隐状态度量源与目标语音表示的接近程度,词符覆盖率负责从解码端字节对编码词符流度量目标词符在源语料中的出现比例,二者搭配的原因是语音声学接近与解码词表共享属于不同通道,组合意义是与系谱相似度一起在适配前对候选源做三轴排序而非仅凭直觉选源。
系谱相似度 × 编码器表示相似度: 系谱相似度负责用与模型无关的语系树向量度量语言亲缘关系,编码器表示相似度负责用模型自身隐状态度量实际表示接近程度,二者搭配的原因是前者不受预训练暴露量影响而后者反映模型已学到的内容,组合意义是当三者给出一致的最近、中等、远端排序时再进入受控适配比较。
选源框架在适配前计算编码器表示相似度、词符覆盖率与系谱相似度。编码器相似度用每语言 100 条语音做均值池化、分层带平均、去各向异性后算余弦相似;词符覆盖率看目标词符流出现在源语料的比例,并按完整码点数与文字类别分解;系谱相似度用来自 URIEL 的语系树向量算余弦相似。论文报告三者在每个目标上给出相同的源排序,再取最高、次高与普通话作为近、中、远对照。
适配器插入哪里,前向与梯度如何走?
先沿一个样本走完一层。设某 Transformer 层的馈送前向网络输出为向量 h,瓶颈适配器先把 h 下投影到很小的瓶颈维度,经过非线性激活,再上投影回模型维度,得到修正量 Φ(h),最后残差相加输出 h 加 Φ(h)。上投影采用零初始化,论文说明这是因为默认初始化在初期实验中损害了 Whisper 自回归生成。适配器按 Pfeiffer 配置插入每个 Whisper 编码器与解码器层,只作用于前向网络输出。
瓶颈适配器 × 全量微调: 瓶颈适配器负责在冻结主干上用下投影、非线性和上投影学习少量语言相关修正,全量微调负责更新 Whisper 全部参数以拟合目标语言,二者搭配的原因是目标数据稀少时全量更新容易覆盖预训练表示,而适配器把可训练量限制在残差分支,组合意义是把实验基线分为强参考与参数高效参考后再评估跨语言迁移是否真正增值。
该单适配器计算的目标是学习一个接近恒等映射起点的残差修正,输入是冻结主干的层表示,输出是叠加语言修正后的表示,监督来自目标语言转录,梯度只进适配器参数。
\[\mathrm{Adapter}(\mathbf{h})=\mathbf{h}+f(\mathbf{h}\mathbf{W}_{\mathrm{down}})\mathbf{W}_{\mathrm{up}}=\mathbf{h}+\Phi(\mathbf{h}).\]暖初始化与顺序堆叠都复用源适配器,但梯度路径不同。暖初始化只复用起点,训练时源参数已被复制覆盖,不再有冻结源分支。顺序堆叠保留冻结源分支,前向先过源适配器得到源条件化状态,再把该状态送入目标适配器做 2 次修正,梯度只穿过目标适配器。
暖初始化迁移 × 顺序适配器堆叠: 暖初始化迁移负责把目标适配器参数从源适配器复制过来作为优化起点,顺序适配器堆叠负责把已冻结的源适配器保留在前向通路中再串行训练目标适配器,二者搭配的原因是前者只提供起点而不保留源变换,后者同时保留源变换与新增修正,组合意义是论文用以检验起点优势与结构化条件化哪一种更能带来稳定增益。
目标内融合 × 顺序适配器堆叠: 目标内融合负责用逐层学习的注意力权重动态加权多个已训练适配器的输出,顺序适配器堆叠负责按固定先后顺序先过源适配器再过目标适配器,二者搭配的原因是前者需要每层分配权重因而可能出现注意力漂移,后者用串行残差绕开分配问题,组合意义是对比动态组合与固定串行在多语言预训练主干上的鲁棒性差异。
顺序堆叠的计算目标是让冻结源提供固定的源条件变换,目标适配器学习在该变换之上的增量。论文强调残差连接的包裹方式反映设计目标:目标适配器的残差包裹的是源条件化状态,而不是原始主干状态,因此源条件化持续存在。
\[\mathbf{h}_{s_{k}}^{(l)}=\mathbf{h}^{(l)}+\Phi_{s_{k}}\big(\mathbf{h}^{(l)}\big),\qquad\mathbf{h}^{\prime(l)}=\mathbf{h}_{s_{k}}^{(l)}+\Phi_{t}\big(\mathbf{h}_{s_{k}}^{(l)}\big).\]哪些参数更新,哪些冻结,训练何时停止?
目标独适配器训练时 Whisper 主干冻结,只优化近零初始化的目标适配器。暖初始化训练前把目标适配器从源适配器初始化,之后同样只在目标数据上优化目标适配器。顺序堆叠分 2 个阶段:先在约 120 小时源语音上单语训练源适配器,再冻结它,堆上新的目标适配器并只优化该目标适配器。融合方法冻结源与目标适配器,优化轻量融合层的注意力参数。论文未报告除学习率、批量、轮数与早停之外的优化器细节缺项之外的逐层解冻或重置安排,因此解读只按证据说明冻结与更新,不推定其他实现。
优化使用 AdamW 与混合精度,线性学习率衰减加预热,早停依据验证集词错误率,解码用贪心搜索且无外部语言模型重打分。显著性用配对句子片段词错误检验,阈值为 p 小于 0.05。
下面整理训练与解码的受控条件,比较问题是 3 类方法的参数量与优化条件是否可比,指标方向是词错误率越低越好,公平条件是适配器维度与融合投影维度对齐、早停标准一致。
| 组件 | 适配器维度 | 学习率安排 | 批量与精度 | 训练轮数与早停 |
|---|---|---|---|---|
| 全量微调 | 不适用,主干全更新 | 峰值学习率较小一档 | 有效批量 32,混合精度 | 最多 20 轮,按验证词错误率早停 |
| 适配器类方法 | 瓶颈维度 256 | 峰值学习率较大一档 | 有效批量 32,混合精度 | 最多 20 轮,按验证词错误率早停 |
| 融合层 | 投影维度 256 | 峰值学习率中间一档 | 有效批量 32,混合精度 | 最多 20 轮,按验证词错误率早停 |
| 解码 | 不适用 | 不适用 | 贪心搜索 | 无外部语言模型 |
上表把可运行策略的训练预算讲清,主要收益是参数量受控使比较更公平,代价是不同方法的最优学习率不同,论文用小网格搜索分别为 3 类方法设定不同峰值学习率。未胜出项是融合方法即使参数量可比仍不稳定,说明参数量一致不等于机制等价。原文未给出硬件时长与推理延迟测量,因此不能承诺延迟或成本改善。
数据、语言代理与预处理如何控制变量?
实验在 FLEURS 上进行,目标为阿斯图里亚斯语、阿萨姆语和科萨语。论文控制训练量的方法是每个源适配器都用约 120 小时语音训练,由该语言完整 FLEURS 训练集加按公开可得性采样的补充语料组成,西班牙语、法语、普通话和斯瓦希里语用 Common Voice,孟加拉语和印地语用 IndicVoices,祖鲁语用 Swivuriso。目标端用各自 FLEURS 训练、验证与测试划分。
语言标记处理是复现关键。对于缺少原生 Whisper 语言标记的语言,论文用经验上相关的代理标记,阿斯图里亚斯语用西班牙语标记,科萨语用斯瓦希里语标记,阿萨姆语虽未进入识别预训练,但用来自语音翻译数据的原生标记。音频重采样到 16 千赫兹并过滤到 0.5 到 30 秒时长,文本在打分前做 2 级归一化,包括统一码、大小写与标点标准归一化,以及保留变音符号与省音的语言特定规则。
下面整理基线与强参考的实际表现,比较问题是原始模型有多弱、全量微调能修复多少,公平条件是同一测试集与同一归一化后打分,指标方向是词错误率越低越好。
| 目标语言 | 原始 Whisper 词错误率 | 全量微调词错误率 | 相对降幅 | 证据含义 |
|---|---|---|---|---|
| 阿斯图里亚斯语 | 52.5% | 15.7% | 70% | 原始可用但弱,全量微调大幅修复 |
| 阿萨姆语 | 高于 130% 区间 | 36.3% | 74% | 原始崩溃,全量微调仍留较高误差 |
| 科萨语 | 高于 130% 区间 | 41.9% | 69% | 原始崩溃,全量微调仍留较高误差 |
上表的主要收益是确立全量微调为强参考而非弱基线,具体代价是阿萨姆语与科萨语即使全量微调后误差仍在 35% 以上,说明跨语言迁移仍有空间。未胜出项是单语适配器微调虽大幅优于原始模型,但论文报告它仍弱于全量微调,因此后续迁移方法必须超过全量微调才算增值。
最近源加顺序堆叠为何能超过全量微调?
主结果的比较问题是 3 种迁移机制在近、中、远源上能否稳定超过单语适配器与全量微调,公平条件是相同主干、相同目标划分、受控参数量与早停标准,指标方向是词错误率越低越好,显著性阈值为 p 小于 0.05。论文报告暖初始化表现不一致,有的源目标对优于单语适配器,有的变差,即使最近源的阿斯图里亚斯与西班牙语组合仍未达到全量微调。解释是暖初始化只提供更好的起点,而单语适配器已从近恒等起点取得强表现,因此起点优势可忽略,该解释属于有限解释而非因果证明。
目标内融合在阿萨姆与孟加拉语、科萨与祖鲁语等近源对上优于单语适配器,但所有目标上都落后于全量微调,在阿斯图里亚斯与西班牙语上甚至低于单语适配器。论文分析深层解码器注意力对目标适配器超过 70%,而编码器注意力漂到 40% 左右,持续依赖西班牙适配器稀释了已接近上限的系统。论文提到以往有用融合引导损失或点积混合加权缓解漂移的方法,但那些方法在少预训练或无多语言预训练主干上验证,在当前场景是否有效仍待验证,因此优先用结构替代而非正则化。
顺序堆叠配合每个目标的最近源在 3 个目标上都显著优于单语适配器与全量微调,相对全量微调的幅度随亲缘语言预训练覆盖减弱而增大,在全量目标数据上为 5 到 8%。论文同时报告排序有效性,即最近源一致优于中等与远端对照,但在科萨语上中等与远端持平。
| 目标语言 | 最近源 | 可运行策略 | 全量数据相对全量微调 | 适用条件 |
|---|---|---|---|---|
| 阿斯图里亚斯语 | 西班牙语 | 顺序堆叠 | 5% 区间增益 | 亲缘语言预训练覆盖最充分 |
| 阿萨姆语 | 孟加拉语 | 顺序堆叠 | 6% 区间增益 | 亲缘语言覆盖部分 |
| 科萨语 | 祖鲁语 | 顺序堆叠 | 8% 区间增益 | 相关覆盖最弱,增益最大 |
| 全体 | 最近源 | 顺序堆叠 | 5-8% 相对降低 | 需先训练并冻结源适配器 |
上表的主要收益是顺序堆叠是唯一在三目标上都显著超过全量微调的策略,具体代价是需要额外训练源适配器并保留双层残差。未胜出项是暖初始化与融合在部分组合上低于单语适配器或全量微调,说明动态加权与起点复用不如固定串行稳健。论文对中等源的有限解释是法语的罗曼斯通用知识与 Whisper 已有罗曼斯预训练冗余,而斯瓦希里语与科萨语分属较远班图分支,不如同属恩古尼语的祖鲁语,该判断应读作可能而非已验证因果。
只剩一小时目标数据时谁还站得住?
低资源对照的比较问题是把目标训练压缩到 1 小时子集后,顺序堆叠是否仍优于全量微调与单语适配器,公平条件是目标端同为 1 小时子集而源适配器仍用完整约 120 小时语料训练,指标方向是词错误率越低越好。论文报告全量微调在三目标上仍可运行,单语适配器明显变差并在阿萨姆语上完全崩溃,而顺序堆叠基本保持优势。
| 目标语言 | 可运行策略 | 1 小时子集相对全量微调 | 稳定性含义 | 适用条件 |
|---|---|---|---|---|
| 阿萨姆语 | 顺序堆叠加最近源 | 12% 相对降低 | 优于全量微调 | 源适配器保持完整训练 |
| 科萨语 | 顺序堆叠加最近源 | 26% 相对降低 | 优势扩大 | 相关覆盖弱时更依赖源 |
| 阿萨姆语 | 单语适配器 | 崩溃 | 缺源条件时不稳定 | 无冻结源分支 |
| 全体 1 小时 | 顺序堆叠 | 12-26% 相对降低 | 大致保持全量趋势 | 目标 1 小时,源完整 |
| 阿斯图里亚斯语 | 顺序堆叠 | 与全量微调接近 | 未显著拉开 | 亲缘覆盖充分时增益小 |
上表的主要收益是冻结源适配器同时提供跨语言知识与结构稳定性,使 1 小时条件下的阿萨姆语与科萨语相对全量微调分别降低 12% 与 26%。具体代价是阿斯图里亚斯语在 1 小时下未拉开差距,说明趋势不等于每组都显著。未胜出项是单语适配器在 1 小时阿萨姆语上崩溃,提醒极低资源下仅靠目标数据训练小模块可能不足。
增益来自语言迁移还是单纯参数变多?
该消融要回答的反证问题是堆两层是否只是因为参数多了。比较条件是同一科萨语目标、同一受控维度与同一评估,指标方向仍是词错误率越低越好。论文把单语适配器瓶颈维度加倍作为容量对照,再与受控维度的祖鲁源顺序堆叠比较。
| 方法 | 瓶颈维度 | 科萨语词错误率 | 对照对象 | 支持的判断 |
|---|---|---|---|---|
| 单语适配器基线 | 256 | 49.6% | 受控维度起点 | 未加容量时的强基线 |
| 单语适配器加倍 | 512 | 45.6% | 容量增大的对照 | 容量带来部分改善 |
| 顺序堆叠加祖鲁源 | 256 | 38.5% | 同维度语言迁移 | 改善远超单纯加容量 |
| 顺序堆叠 | 256 | 38.5% | 语言特异性检验 | 支持迁移而非仅参数量 |
| 结论 | 受控维度 | 容量对照不足以解释 | 需最近源 | 亲缘迁移是主因 |
上表的主要收益是证明科萨与祖鲁语组合的改善主要来自语言特异性迁移而非原始参数增加,因为同维度堆叠的误差明显低于加倍容量的单语适配器。具体代价是该消融只在科萨语上报告,不能推广到所有源目标对。未评测边界是若换成中等或远端源堆叠,是否仍优于加倍容量,论文未在该消融中给出同等容量对照,因此不能声称任何堆叠都优于加参数。
哪些结论不能推广,哪些开销没有测量?
第一,相似度框架更适合做最近源的序数选择,而非迁移幅度的预测器。论文报告中等源并不稳定优于远端对照,因此不能把相似度数值直接读成增益大小。第二,结构替代融合的结论受计算预算限制,论文明确在受限预算下优先结构替代而非正则化融合,因此不能声称已证明融合正则化在该主干上无效。第三,消融只覆盖科萨与祖鲁语的容量对照,不能推广为所有语言对的因果结论。第四,论文聚焦 Whisper 中型模型,虽称架构上可用于其他兼容适配器的语音基座模型,但受计算限制未验证泛化,留作未来工作。
训练资源、推理开销、输出帧率与实际延迟在证据中未分别测量。论文控制了可训练参数量,但未报告训练时长、显存峰值、推理延迟或误判率分布,因此不能承诺这些量得到改善。总体趋势不等于每层每步都成立,例如融合的注意力漂移只分析了深层带,不能推广到全层。
要复现先做什么,需要哪些信息条件?
先固定评估口径。用 FLEURS 的目标划分,音频重采样到 16 千赫兹并过滤时长,文本对参考与假设做同样的 2 级归一化后再算词错误率,用配对检验判断显著性。语言标记必须与论文一致,阿斯图里亚斯语用西班牙语标记,科萨语用斯瓦希里语标记,阿萨姆语用原生标记,否则解码起点不同会导致不可比。
再固定训练流程。Whisper 中型主干冻结,瓶颈维度与融合投影维度按受控值设置,3 类方法用各自峰值学习率,有效批量与早停 patience 一致,解码用贪心搜索且无外部语言模型。源适配器每个约 120 小时单语训练并冻结,目标适配器近零初始化后只优化目标分支。复现顺序堆叠时注意残差包裹的是源条件化状态,而非原始主干状态。
还需补的验证包括在另 1 随机种子与另一一小时采样下重复低资源对照,记录训练时长与推理延迟,补充中等源与远端源的容量对照,以及在另一语音基座上检验串行是否仍然稳健。本文未获得代码与权重可用性验证,因此复现应从论文文字与超参数出发,不假设存在可直接下载的系统。
何时值得尝试顺序堆叠?
当目标语言不在识别预训练中、目标标注只有几小时到十几小时、且能找到亲缘较近的富资源源语言并为其准备约 100 小时级训练数据时,顺序堆叠值得优先尝试。操作顺序是先用三轴相似度排出最近源,再单语训练并冻结源适配器,最后在其上串行训练目标适配器。若无法确定最佳源,论文的证据支持顺序堆叠是更安全的默认策略,因为它在所有报告的源目标对上未低于单语适配器,而暖初始化与融合出现过低于基线的情况。
不值得盲目尝试的情况包括把中等相似源当作次优保证,或把相似度数值当作增益预测器。科萨语上中等与远端持平、阿斯图里亚斯语上法语优势有限,都说明只有最近源的结论较稳。若目标只有 1 小时数据,更应保留完整训练的源适配器,因为单语适配器可能崩溃。未来验证应补足另一主干、多次采样与成本测量,再判断该结构是否可作为通用扩展方案。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses