英文题目:Automated Gradient-Driven Parameter Sharing for Low-Resource Multilingual Speech-to-Text Translation

会议身份:conference:interspeech:2026:conference-paper-id:sun26d_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多任务学习 #低资源 #多语言 #语音翻译

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Ruiyan Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Satoshi Nakamura:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

低资源多语言语音翻译需将突尼斯语等四语种语音波形统一转写译为英语文本,语种异构与每语种仅约两万句以下数据使均匀共享易引发梯度冲突与负迁移,优化曲面噪声大且收敛困难。该文提出梯度驱动参数共享框架,先以层级梯度相似聚类划分出贝姆巴独立成组与另三语成组。再用自相似与跨相似差值确定百分之五十共享私有比例,分组输出决定比例计算的聚合单元。随后经联合奇异值分解与能量加权残差初始化生成共享与分组私有分支,最后执行分组微调,前步分组与比例直接决定后步路由与容量分配。相较人工设计共享结构或纯梯度投影优化,该机制把训练动力学直接转化为结构决策并保留跨语言迁移通道。在IWSLT 2025低资源评测基准下,GDPS的BLEU为8.39,高于JHU的BLEU 8.20。结论目前仅限SeamlessM4T-Medium模型与4个低资源语对,未验证大规模语种扩展与跨架构泛化。其适用边界受限于上述模型与语料规模,尚未验证大规模语种扩展与跨架构泛化。原文未披露训练、推理或部署成本

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么低资源多语很难?

本次解读的输入是论文原文与 3 张官方原图像素,目标是让刚进入语音翻译的研究生能核对条件并复述方法。必须保留的信息包括 4 对语言、数据量与划分、骨干模型配置、分组结论、共享比规则、改造位置与主结果数字,输出是 1 篇按学习依赖展开的中文技术解读。

任务是多语语音到文本翻译,用白话说就是输入一段语音波形,输出对应英文文本。英文名是 speech-to-text translation,缩写 S2T。低资源指每种语言只有约几千到两万行平行语料,模型既要学会声学到语义的映射,又要在多语言之间共用参数。论文研究的不是通用大语种,而是突尼斯语到英语、奔巴语到英语、爱沙尼亚语到英语、爱尔兰语到英语 4 对低资源方向,全部译向英语。

难点在于统一共享带来的表征冲突。统一参数共享指所有语言共用同一套编码器参数,好处是小语种能借用大语种的表示,坏处是不同语言的梯度方向不一致时,平均更新会互相抵消。论文把这种现象称为负迁移,在低资源下更严重,因为数据少导致优化景观噪声大,错误的共享结构会被放大。举例来说,如果把奔巴语和爱沙尼亚语强行绑在同一专用分支,梯度余弦距离大的 1 对会拖累收敛,这正是后文要用聚类先分组的原因。

已有路线如何处理梯度冲突,本文与它们是什么关系?

已有路线分两类。第一类是优化期修正,例如 PCGrad、GradOPS 与 GDOD,白话说就是在反向传播时把冲突梯度投影或正交分解,让更新方向不再打架。第二类是结构解耦,例如共享专用表示与任务解耦,白话说就是把网络拆成大家共用的部分和每个任务私有的部分,从结构上隔离干扰。

本文与它们是互补而非替代。同输入都是多任务语音翻译,同目标都是减少干扰,同监督都是平行语音文本,同运行阶段都是微调期。不同在于前人多靠人工设定哪层共享多少,而本文要回答共享结构本身如何自动搜出来。论文明确把第二前馈网络作为改造对象,理由是它参数密度高且负责非线性特征变换,比注意力模块更适合做语言专属适配。这个选择是方法全景的前提,需要记住它只动编码器第 11 层 FFN2,其他层保持统一微调。

要解决的三个具体障碍是什么?

论文把问题拆成三点。第一是语言异质性,统一共享导致破坏性干扰,不同语系的梯度行为差异大,硬共享会降低任务隔离度。第二是低资源约束,数据少使梯度统计噪声大,直接搜结构容易过拟合噪声。第三是可扩展性,语言集合扩大时人工设计每层共享比不可行,需要端到端把原始梯度统计翻译成共享配置。

为此论文提出梯度驱动参数共享框架,英文名 Gradient-Driven Parameter Sharing,缩写 GDPS。它的输入是骨干模型在各语言样本上的层级梯度,输出是语言分组、共享专用比与能量分配,再实例化为具体的分组微调结构。贡献按原文是两点,一是建立梯度分析到配置生成的自动化流水线,二是实例化只特化冲突瓶颈层的新结构。后续所有公式与实验都围绕这条流水线展开。

GDPS 流水线如何从波形走到英文转录?

先沿一个样本走完全程。输入是一段 16 kHz 语音波形,进入 SeamlessM4T-Medium 语音编码器,经过 12 层 Conformer 编码器层与中间前馈和适配器,再进入文本解码器输出英文转录。训练时每个样本在目标层留下梯度,论文收集这些梯度做 3 次分析,再把分析结论写回结构,最后做分组微调。

流水线按原文是 3 段。第一段是梯度驱动决策,分析语言间梯度行为以决定分组与共享比。第二段是动态参数配置,把编码器第 11 层 FFN2 拆成共享分支与组专用分支。第 3 段是分组微调,用组内更新优化新结构。图 1 把这 3 段画在同一张总览中,左侧是波形与模型,右上是决策,左下是参数拆分细节,右侧是编码器解码器纵览。

阅读该图时要注意它不是训练流程图,而是决策加配置加微调的逻辑图。统一微调带早停是基线分支,GDPS 是实验分支,二者共用同一骨干起点,最终都输出目标转录以便比较。下文先看图再拆每段计算。

看图路径: 1. 先从左上音频波形沿箭头走到 SeamlessM4T 模型框,确认主干输入位置;2. 再看右上梯度决策框内三行分别指向分组、共享比与能量分布;3. 接着看左下 FFN2 大框内共享分支与分组选择器加分组专用分支如何汇合到输出 y;4. 最后看右侧从统一微调经 GDPS 到分组微调再到目标转录的纵向流程

原论文 Figure 1:Overview of the GDPS framework combining the in- corporation of gradient-driven decision-making,…

论文图 1。原论文 Figure 1:“Overview of the GDPS framework combining the in- corporation of gradient-driven decision-making, dynamic pa- rameter configuration, and fine-tuning.”。

该图显示音频经骨干得到 3 组决策输出,分别是语言分组、共享专用比与能量分布,然后分别控制分组选择器、共享维度切分与残差分配。左下大框内共享矩阵用奇异值分解保留主成分,组专用矩阵用剩余容量按能量加权初始化,前向时按语言标识选择组分支并与共享分支相加输出。这种画法对应后文第 3.4 节的维度拆分与能量驱动残差初始化,记住共享维度与专用维度的数值关系是理解公式的基础。

分组、比值与子空间三件套各自算什么?

第一件是方法 A 聚类分组。先在特定层计算语言平均梯度间的余弦相似度得到相似矩阵,再转成距离矩阵,用距离向量表示每种语言,接着用 K 均值与层次聚类找结构。K 取 2 的依据是奔巴语组间距离 0.243 远大于组内 0.157,呈现天然 2 分。结果是第 1 组只有奔巴语,第 2 组是突尼斯语、爱沙尼亚语与爱尔兰语,其中突尼斯与爱沙尼亚距离最近为 0.157,说明二者子空间兼容。

统一参数共享 × 负迁移: 统一参数共享指所有语言共用同一套编码器与前馈参数,分工是最大化跨语言迁移和节省参数;负迁移指不同语言梯度方向冲突时共用更新互相抵消,分工是解释低资源下收敛变差的原因;二者搭配的理由是共享越彻底冲突越容易被放大,组合意义在于 GDPS 只在冲突最重的第 11 层 FFN2 保留一半共享、一半分组专用,从而保留迁移又隔离干扰。

第二件是方法 B 自交叉相似度定共享比。对每层计算自任务相似度与跨任务相似度,前者是同语言不同样本梯度余弦平均,后者是不同语言样本间余弦平均,差值记为冲突标量。阈值按骨干梯度干扰基线设定,小于 0.05 取 75% 共享,0.05 到 0.15 取 50% 共享,大于等于 0.15 取 25% 共享。实测冲突分数约 0.075,加上第 11 层纯度下降,落入中间档,故取 50% 共享以平衡迁移与特化。

自任务相似度 × 跨任务相似度: 自任务相似度 Sself 度量同一语言内不同样本梯度余弦平均,分工是刻画该层信号强度与任务内一致性;跨任务相似度 Scross 度量不同语言样本间梯度余弦平均,分工是刻画跨语言信号重叠;二者搭配的理由是单看其一无法区分是噪声还是真实冲突,组合意义在于用差值 δ=Sself-Scross 定量冲突并映射到共享比,δ 约 0.075 时取 50% 共享。

第三件是方法 C 联合奇异值分解加正则典型相关分析。把各语言梯度矩阵纵向拼接做奇异值分解,取前 k 个右奇异向量张成子空间,再在该子空间上用岭正则典型相关最大化语言间归一化交叉协方差,得到主相关方向与能量占比。第一主成分捕获约 55% 梯度能量,基尼系数 0.63 到 0.72 证实信息集中在顶部向量,因此用这些方向初始化专用模块是合理的。

联合奇异值分解 × 正则典型相关分析: 联合奇异值分解把多语言梯度矩阵纵向拼接后求右奇异向量,分工是找到所有语言共用的高能量子空间方向;正则典型相关分析在该子空间上最大化语言间归一化交叉协方差,分工是度量子空间是否线性对齐且可用于初始化;搭配理由是 SVD 只给能量大小不给对齐程度,组合意义是用能量占比 p1、p2 按比例分配残差给两个语言组,避免冷启动。

三者是互补的。聚类回答谁和谁共享,相似度回答共享多少,子空间回答剩余容量如何按能量分配。缺少任一件都会导致分组对但比例错,或比例对但初始化冷启动。下节讲它们如何共同指向第 11 层。

共享分支 × 分组专用分支: 共享分支由统一 FFN2 权重的 SVD 主成分重构,分工是承载跨语言通用变换;分组专用分支由残差按能量比例抽取的前 1024 个成分初始化,分工是吸收各组冲突残差;搭配理由是冲突分析指出第 11 层既需要通用表示又需要隔离,组合意义是前向时输入同时过共享和所属组分支再拼接激活输出,实现按语言标识路由。

任务纯度 × 纯度悖论: 任务纯度定义为 1-Scross/Sself,分工是度量某层梯度子空间保持任务专属的程度;纯度悖论指深层自相似度升高但纯度反而下降的现象,分工是指示表征重叠与梯度冲突共存的瓶颈;搭配理由是只看自相似度会误判深层更好,组合意义是论文据此锁定第 11 层 FFN2 为唯一改造点,而放过第 10 层与 FFN1。

为何只动第 11 层 FFN2,证据中的纯度悖论是什么?

论文定义任务纯度为一减跨任务相似度除以自任务相似度,数值越高说明该层梯度子空间越专属、跨任务干扰越小。比较第 10 层与第 11 层发现,第 11 层自相似度更高,约为 0.42 到 0.51,而第 10 层仅 0.22 到 0.30,说明深层任务内更一致,但纯度反而下降 6.6% 到 12.6%,平均下降 7.9%。这就是纯度悖论,即任务内越抱团、跨任务越打架,二者共存指示高表示重叠与梯度冲突同时出现。

图 2 用三面板呈现该判断。面板 A 是相对纯度柱状对比,面板 B 是自相似度对纯度的散点迁移,面板 C 是联合奇异值分解的累计能量曲线。阅读时不要把柱子变矮直接理解为模型变差,它度量的是梯度统计特性而非翻译分数,变矮恰好是定位瓶颈的信号。面板 B 中从第 10 层蓝色圆点到第 11 层粉色方块的右下迁移越明显,说明该语言对在深层冲突越重。

看图路径: 1. 先看面板 A 中每组语言蓝色第 10 层柱与红色第 11 层柱的高低关系;2. 再看面板 B 中蓝色圆点与粉色方块在横轴自相似度与纵轴纯度上的迁移方向;3. 最后看面板 C 中黑色联合曲线与彩色各语言投影曲线随 k 增大的收敛趋势

原论文 Figure 2:Gradient Bottleneck Analysis.

论文图 2。原论文 Figure 2:“Gradient Bottleneck Analysis. (A) Relative Purity comparison: Layer 11 shows a decline in task isolation across all languages (avg.”。

从像素看,面板 A 4 个语言对的红色第 11 层柱都低于蓝色第 10 层柱,爱沙尼亚语落差最大;面板 B 4 条虚线都指向右下方,奔巴语终点最靠右;面板 C 彩色各语言投影曲线快速爬升到 0.6 以上而黑色联合曲线爬升缓慢,说明联合空间秩高而各语言投影能量集中。这种对照支持只特化第 11 层 FFN2,而把第 10 层 FFN2 与第 11 层 FFN1 留作消融中的低冲突对照,后文消融证实改错位置收益消失。

动态配置如何切分维度并初始化,微调时什么更新?

本节即训练与构造过程。论文没有从零训练新骨干,而是复用 SeamlessM4T-Medium 并重构目标层,因此要讲清冻结、更新与监督来源。原文只明确目标层被分解为共享与组专用分支后做分组微调,未逐层报告其余参数是否冻结,也未给出梯度是否截断的说明,这两项是缺项,不能从模型名推定为全参数或参数高效微调。监督来源是官方低资源语音到英语平行数据,目标是英文转录,优化器为 AdamW,混合精度 FP16。

维度切分按 50% 共享执行。统一 FFN2 权重可视为两个矩阵乘积的等效方阵,对其做奇异值分解,取前 512 个奇异成分经 2 次因子化与高斯噪声填充扩展到目标共享维度,再转置匹配前馈形状。剩余容量按组数平分,每组 1024 维。专用分支的输入输出因子按能量占比加权残差后取前 1024 个成分初始化,能量高的组分得更强的残差模式。

前向时输入向量与语言标识同时进入,语言标识经分组选择器决定走第 1 组还是第 2 组专用分支,输入分别过共享分支与所选专用分支激活后拼接输出。反向时组内样本只更新所属组专用分支与共享分支,跨组干扰被结构隔离。组学习率单独设为 10 的负 4 次方,高于基础学习率 4 乘 10 的负 5 次方,其余超参数见实验配置表。

数据、划分与硬件预算如何保证可比?

实验要回答的第一个问题是数据条件是否一致。数据源是 IWSLT2025 低资源语音到文本赛道,全部音频按 16 kHz 与官方协议预处理。为平衡梯度分析,把较大的 3 种语料下采样到与最小的爱尔兰语可比的规模。划分按约 10 比 1 比 1 切分训练验证测试。下表整理 4 对语言的方向、任务类型、数据量与来源,表中数据量单位为行,来源为原始数据集名称,划分比例在表后段落交代。

语言对任务数据量来源划分
突尼斯语到英语双向语音翻译20k linesIWSLT202210:1:1
奔巴语到英语双向语音翻译20k linesBIG-C10:1:1
爱沙尼亚语到英语双向语音翻译20k linesLoResMT10:1:1
爱尔兰语到英语双向语音翻译7k linesIWSLT202310:1:1

上表提出的数据问题是各组样本是否均衡,公平条件是同赛道同预处理同划分,指标方向在此不涉及分数而是数据规模。表后解释是前三者经下采样后同为 20k 行,爱尔兰语仅 7k 行因而最易受统一共享负迁移影响,这为后文爱尔兰语增益最大埋下伏笔。未评测边界是未报告每种语言的时长小时数与说话人分布,不能把行数直接等同于音频时长。

硬件与优化条件见下表,表中学习率、批量、丢弃率、权重衰减、随机种子与预热步数均按原文写法保留,骨干为 12 层编码器解码器共 1,200,000,000 参数,训练在 A100 上以 AdamW 执行。

项目骨干与硬件优化器与精度学习率正则与批量随机与预热
配置1.2B 参数 12 层 A100AdamW FP164×10−5 组 10−4批量 4 丢弃 0.05 衰减 0.05种子 2343 预热 2000

该表说明复现时必须固定种子与预热,否则低资源下梯度统计波动会改变分组阈值判断。原文未报告训练时长与显存占用,因此不能承诺成本改善,推理开销也未测量。

主结果相对统一微调提升多少,代价与反例是什么?

主结果要测的是在相同骨干与相同数据下,GDPS 分组结构是否优于统一微调与原始模型。比较对象是可运行的 SeamlessM4T-Medium 直接推理与统一微调,指标方向为 BLEU 越高越好、TER 越低越好、BERTScore 与 COMET 越高越好。下表按语言对列出三方法的 4 个指标,数值保留原文精度,COMET 相对增益最高 3.26% 是原文直接报告的上限。

语言对方法BLEUTERBERTScoreCOMET
突尼斯语到英语统一微调7.6497.170.24530.5326
突尼斯语到英语GDPS8.7492.360.27450.5500
奔巴语到英语统一微调18.4574.740.52520.6866
奔巴语到英语GDPS19.6973.500.53880.7012
爱尔兰语到英语统一微调43.5951.080.57010.7257
爱尔兰语到英语GDPS46.2048.190.59590.7473

表前提问是分组特化是否在 4 对语言上一致获益,公平条件是同骨干同数据同指标,指标方向如上。表后解释是 GDPS 在所列 3 对上全面提升,突尼斯语 BLEU 从 7.64 到 8.74 相对增幅最大,爱尔兰语绝对值最高且 TER 下降最明显,支持共享专用分解隔离干扰的判断。具体代价与反例是爱沙尼亚语 BLEU 从 16.68 微降到 16.49,未胜出,说明总体趋势不等于每组都成立,论文仍称一致改善时应理解为多数指标而非全部数字。摘要中 14.4% 相对 BLEU 与 11.9% 相对 BERTScore 是 4 对上的上限表述,不代表平均值。

与 IWSLT2025 系统的对照需谨慎。原文称 GMU 系统因使用大规模辅助数据而分数更高,为求可比未列入主表,GDPS 的优势是在数据受限下提升迁移效率,而非绝对分数超越所有系统。百分点与相对百分比不可混淆,阅读增益时要核对分母是统一微调还是原始模型。

跨语言表示对齐是否真的变好了?

除翻译分数外,论文用平均跨语言相似度检验表征层面是否对齐。做法是比较 GDPS 与基线在每种语言上的平均相似度,数值越高表示跨语言共享更顺畅。该分析不是人工评分,不能当作人类可懂度证据,但能佐证分组初始化促进了知识迁移。

下图按语言给出两方法对比,深蓝为基线橙色为 GDPS,柱顶标注相似度数值,虚线标注相对增幅。阅读时先确认纵轴是平均相似度原始值而非增量,再结合升高为好的方向判断优劣,不要把个别语言增幅小误读为退化。

看图路径: 1. 先对照图例确认深蓝为基线、橙色为 GDPS 架构;2. 再逐语言比较两柱高度与柱顶数值 0.811 到 0.891 的变化;3. 最后观察柱间虚线与百分比标注在 bem、est、gle 上的增幅差异

原论文 Figure 3:Average cross-language similarity per language be- tween GDPS and the SeamlessM4T-Med baseline.

论文图 3。原论文 Figure 3:“Average cross-language similarity per language be- tween GDPS and the SeamlessM4T-Med baseline.”。

从像素看,4 组橙色柱都高于深蓝柱,平均提升 0.085。奔巴语从 0.770 到 0.887 增 15.1%,爱尔兰语从 0.774 到 0.891 增 15.2%,爱沙尼亚语从 0.790 到 0.886 增 12.2%,突尼斯语从 0.811 到 0.820 仅增 1.1%。这种不均衡与数据量和冲突程度一致,原文解释是爱尔兰语语料最小因而统一共享时负迁移最重,针对性特化后相对收益最大。该图支持而非证明因果,因为相似度提升与 BLEU 提升相关但未做因果干预实验。

拿掉哪一块会掉点,换位置或换比例会怎样?

消融要回答结构选择的必要性。论文 consolidated 消融覆盖组件、比例、子空间维度、数据规模与改造位置 5 类,指标为 BLEU 与 COMET。核心发现是去掉聚类、相似度或子空间任一块都会掉点,说明三件套协同;50% 共享最优,75% 与 25% 都在至少 1 对语言上次优;数据量从 50% 到 66% 到全量单调上升,说明 GDPS 提供稳定归纳偏置而非依赖特定数据量。

关键反证是位置敏感性。把同样的分解搬到低冲突的第 10 层 FFN2、第 11 层 FFN1 或子采样适配器时,收益变小甚至退化,例如适配器分支在多对语言上明显低于完整 GDPS。这支持冲突定位的准确性,而非说明适配器本身无用。阈值敏感性在 4.5 节讨论,原文提醒阈值是按干扰基线设定的,换骨干需重估。

教学例子是若把共享比误设为 75%,相当于给冲突层太多共用容量,跨任务干扰回升;若设为 25%,则跨语言迁移不足,小语种借不到表示。例子不附带新数值,仅帮助理解权衡,实际数值以原文消融表为准。未测量延迟与参数量变化,因此不能从结构变复杂推定推理变慢,只能说训练与推理流程多了 1 次分组路由。

哪些结论尚未被验证,不能推广到哪里?

首先是范围限制。只验证了 SeamlessM4T-Medium 单骨干、4 对译向英语方向、只改造编码器第 11 层 FFN2,未验证解码器、其他层组合或更大语言集合。把结论推广到百语言或流式模型属于待验证推测,应表述为可能而非报告。

其次是度量限制。主指标是自动指标 BLEU、TER、BERTScore 与 COMET,未做人工评估,不同指标差值不能混放比较,自动指标提升不等于人工可懂度同等提升。原文表头与图注在个别数值上存在舍入差异,阅读时以表内精度为准,不自行四舍五入或计算新百分比。

最后是资源声明。资源状态是本次未能确认可达,论文首页给出代码链接但按本次校验规则不得声称为已公开可用,只能说原文给出仓库地址而本次未验证可达。缺失证据不是技术错误,后续复现需先补可达性与版本核对。

复现先做什么,需要固定哪些信息条件?

复现第一步是取官方 IWSLT20254 对数据,按 16 kHz 预处理并按约 10 比 1 比 1 划分,对大语料下采样到 20k 行量级以复现梯度分析的均衡条件。不要跳过下采样直接用全量,否则聚类距离与冲突分数会偏移。第二步是用同一骨干抽取第 10 层与第 11 层样本梯度,复算自交叉相似度与纯度,确认第 11 层是否仍是瓶颈,再决定是否沿用分组与 50% 比例。

关键超参数按原文固定。基础学习率 4 乘 10 的负 5 次方、组学习率 10 的负 4 次方、批量 4、丢弃 0.05、权重衰减 0.05、种子 2343、预热 2000 步、FP16 与 AdamW,硬件为 A100。改造时目标共享维度 2048、每组专用 1024、取 512 个奇异成分扩展的写法要与原文一致,残差按能量占比分配。评估时同时报告 BLEU、TER、BERTScore 与 COMET 并注明越高或越低越好,避免只报单指标。

还需补的验证是阈值鲁棒性、多种子方差与统计显著性,原文未报告显著性检验,因此复现时应多次运行再判断提升是否稳定。若换骨干或加语言,需重做聚类与能量分析,不能直接套用奔巴语单列一组的结论。

何时值得尝试这套方法,如何一句话记住它?

当你的多语语音翻译出现小语种被大语种拖累、统一微调在某深层梯度冲突明显、且无力做大规模神经结构搜索时,值得尝试先做层级梯度诊断再定分组与共享比。做法是先算纯度找到瓶颈层,再用聚类定谁和谁一组,用冲突差值定共享多少,用联合子空间能量定残差怎么分,最后只改造瓶颈层做分组微调。

一句话记住它是先用梯度统计定位冲突,再把一层前馈拆成一半共享加两组专用并按能量初始化。该方法在 4 对低资源英语方向上多数指标优于统一微调,但爱沙尼亚语 BLEU 微降提醒你要按语言对单独验收。未来工作应补人工评估、跨骨干验证与开销测量,再谈更大语言集的可扩展性。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总