英文题目:GigaAM Multilingual: Foundation Model for Underrepresented Languages
会议身份:
conference:interspeech:2026:conference-paper-id:kuzmenko26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#自监督学习 #低资源 #多语言 #预训练 #语音识别
评分:7.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:模型报告
👥 作者与机构
- Andrei Kuzmenko:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandr Maximenko:机构信息未能从会议 PDF 纯文本可靠映射
- Aleksandr Kutsakov:机构信息未能从会议 PDF 纯文本可靠映射
- Georgii Gospodinov:机构信息未能从会议 PDF 纯文本可靠映射
- Dmitrii Bolotov:机构信息未能从会议 PDF 纯文本可靠映射
- Oleg Kutuzov:机构信息未能从会议 PDF 纯文本可靠映射
- Pavel Bogomolov:机构信息未能从会议 PDF 纯文本可靠映射
- Fyodor Minkin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理多语言自动语音识别在中亚长尾语言上的严重退化,输入为多域多语言语音,输出为哈萨克语、吉尔吉斯语、乌兹别克语及俄英语字符序列,难点是预训练与微调均被头部语言主导且尾部转写稀缺。该方法先将2M小时音频切分并做语音活动检测与语言识别后按共现图聚为5个簇,再用HuBERT式掩码单元预测在簇级重加权下预训练Conformer编码器,接着以多源混合数据做联结时序分类微调并在语言内做域感知采样。与朴素均匀上采样不同,簇级加权避免了低资源单语权重估计不稳,而域感知采样抑制了大规模合成语音主导课程。预训练编码器还可直接复用于极低覆盖尾部语言的少样本适配而无需重构流程。在内部自发语音集上吉尔吉斯语词错率为9.8%,显著低于Omnilingual 1B的25.0%与Seamless M4T large的78.3%。结论仅在5个目标语言及Common Voice、FLEURS与自采野外集上验证,对其他语系与真实部署噪声的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/salute-developers/GigaAM — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决什么不均匀?
这篇解读的输入是论文正文给出的模型、数据配比和评测条件,目标是让研究生能复述做法并核对关键数字。必须保留的信息包括预训练规模与采样单位、微调语言与数据来源、解码与文本归一化条件,以及词错误率的方向是越低越好。论文研究的是多语言自动语音识别,也就是把连续语音波形转写成对应语言文字的任务。作者关注的不均匀是头部高资源语言识别已经可用,而哈萨克语、吉尔吉斯语、乌兹别克语等中亚长尾语言错误率高到难以进入应用。
造成这种差距的一个直接原因是数据分布偏斜:自然收集的音频时长高度集中在俄语和英语所在的簇,而目标语言占比很小。如果简单粗暴地把尾部复制多遍,又容易过拟合或损害头部语言。因此本文的教学主线是配比如何设计,而不是单纯把模型做大。最终公开发布的是基础编码器和语音识别模型,代码当前可用,链接为官方仓库地址,资源状态显示可达。本文不做营销式判断,只讲原文实际做了什么、在什么条件下测出什么数字。
已有路线做到哪里,为什么单靠扩大规模不够?
已有路线可以按输入、目标和监督方式分成 3 类。第一类是大规模弱监督,例如 Whisper,用大量带噪转写直接训练识别模型,零样本泛化强,但论文表 1 显示它在吉尔吉斯语和乌兹别克语的开放测试上错误率极高,说明弱监督的覆盖并不等于长尾可用。第二类是大规模多语言预训练加微调,例如 USM 和 MMS,把无标注语音先学成表示,再用有标注数据适配,覆盖语言数可以做到上千,但同样面临头部主导问题。
第 3 类是强调快速扩展的 Omnilingual,目标是用很少数据适配一千六百多种语言,本文用其 1,000,000,000 参数带大语言模型解码器的变体做对照。表示学习一侧,mHuBERT-147 把 HuBERT 式训练扩展到 147 种语言,明确提出要做多语言上采样和分批,否则头部语言会主导训练,这直接启发了本文的组感知重加权。数据管线一侧,GigaSpeech 2 展示了用 Whisper 初转写加 MMS 强制对齐再迭代提纯来构建低资源语料,OWSM 系列则分析了异构数据源的过滤与归一化。
本文的定位是把数据混合与加权从经验做法变成可量化的预训练加微调 2 级策略,并在相同微调配方下受控比较编码器,避免把数据红利误算成结构优势。
要回答的具体问题是什么,什么算改进?
论文要回答 3 个可检验的问题。第一,在预训练语料高度偏斜时,能否通过簇级重加权提高中亚语言的识别效果,同时不明显损害俄语和英语。第二,在微调阶段,自然分布采样、语言平衡采样和领域感知采样各带来什么变化,特别是对自发语音内部测试集的影响。第三,换编码器但固定微调数据、目标和解码时,GigaAM 编码器是否比 Whisper Large 和 Omnilingual 编码器更适合向哈萨克语、吉尔吉斯语、乌兹别克语以及更少见的巴什基尔语和格鲁吉亚语迁移。
改进的判定标准是词错误率下降,同时要报告代价和边界。评测覆盖 Common Voice、FLEURS 和每种语言 6 到 20 小时语音密集的内部野外集,排除超过 30 秒的长句和参考文本含数字的样本,参考文本做小写和去标点归一化,英语还统一英美拼写并展开缩写。解码统一用贪心解码,Whisper Large v3 对不支持的吉尔吉斯语不加语言标记,Seamless-M4T v2 large 显式指定语言以免翻译到高频语言,Omnilingual 按句指定语言。这些条件是理解后文数字可比性的前提。
两级配比的全景:预训练管什么,微调管什么?
方法全景可以沿一个样本走一遍。输入是一段 1 分钟切分的原始录音,先过语音活性检测切出纯语音片段,再用 MMS 语言识别模型对每个片段打语言标签,最后对整段录音多数投票决定语言归属,低于阈值的记为不确定。表示阶段是 600M 参数的 Conformer 编码器,24 层、隐层 1024 维、自注意力用旋转位置编码,帧率为 25 赫兹即 40 毫秒步长。预训练阶段随机遮住 40% 输入帧的连续片段,要求学生模型在被遮位置预测教师模型聚类得到的离散单元。
微调阶段把预训练好的编码器接上 CTC 目标,用英语、俄语和 3 种中亚语言的共享字符表学习帧到字符的对齐。2 级的分工是预训练用簇级权重解决头部簇淹没尾部簇的问题,微调用语言加领域 2 维权重解决语言间不平衡和语言内合成大子集主导课程的问题。最终发布模型采用预训练实验 E2 的编码器加领域感知微调。整个流程不依赖翻译式数据增强,目标语言在预训练中已有少量出现,但份额很小,这正是需要加权的原因。
编码器、教师单元和质量门控各自做什么?
编码器是教师和学生共用的结构,都是 600M 参数 Conformer。教师负责产生目标单元:抽取训练切分上的教师表示,做 1000 类的 K 均值聚类,每个表示映射到最近质心得到离散标签。学生负责在掩蔽位置预测这些标签,从而学到上下文相关的声学结构。论文还训练了一个 240M 的小编码器,用于验证效率。数据质量门控分布在 3 个地方。
预训练前用两个 0.7 阈值卡语言归属:多数投票置信度和选中语言片段平均模型置信度,任一低于阈值则该录音在对应语言下记为不确定,后续只在簇级别加权,不对单个低资源语言单独估计权重。合成数据用内部多说话人语音合成系统从 mC4 的哈萨克语和吉尔吉斯语文本生成 100 种以上音色的音频,再用初步识别模型解码,只保留提示文本与识别假设间字符错误率低于阈值的 utterance。弱监督数据用 MMS 做时间对齐切出短片段,同样用初步模型解码过滤。
众包数据对每条语音请 5 人独立转写,用黄金集和人与聚合结果的一致性筛掉不可靠标注者,再用基于可靠性的 ROVER 投票加文本归一化得到终稿。
自监督学习 × 掩蔽单元预测: 自监督学习负责在没有人工转写时从大量无标注音频中学习通用语音表示,掩蔽单元预测负责给出具体的学习任务:遮住一部分声学帧并要求模型预测被遮位置的离散单元标签,二者搭配的原因是前者提供数据规模,后者提供可优化的预测目标,组合后编码器既见过 2,000,000 小时的多样语音,又被迫建模上下文相关的音素级结构。
编码器 × CTC 微调: 编码器负责把 40 毫秒步长的梅尔频谱序列变成上下文相关的表示,是预训练阶段沉淀跨语言知识的地方,CTC 微调负责在冻结或更新编码器表示之上学习从帧到共享字符序列的对齐,不需要显式音素切分,二者搭配的原因是编码器提供可迁移的起点、CTC 提供多语言统一的弱对齐目标,组合后可以用同一套流程比较 GigaAM、Whisper 和 Omnilingual 编码器的迁移能力。
伪标签过滤 × 合成语音校验: 伪标签过滤负责从长录音强制对齐切出的短片段中去掉错位和噪声,做法是用初步识别模型解码并只保留字符错误率低于阈值的片段,合成语音校验负责对多说话人语音合成生成的哈萨克语和吉尔吉斯语音频做同样的解码比对,搭配的原因是两者都用模型自身一致性做质量门控,组合后才能把弱监督和合成数据安全地加入微调而不引入大量错转写。
200 万小时如何变成五个簇,权重如何作用到每一轮?
预训练语料是内部 2,000,000 小时音频。作者先虚拟切成 1 分钟块,做语音活性检测和片段级语言识别,再多数投票得到整段语言。直接平衡 70 多种高频语言很困难,因为低资源语言的权重估计不准且易过拟合。做法是建语言共现图:顶点是语言,边权不是原始共现次数,而是归一化权重,用共现次数除以两种语言各自计数的几何平均,使高于偶然共现的语言对获得更高权重。剪掉低权重边和低度顶点后,用社区发现算法聚成 5 个簇,否则图会碎成小的离群组而难以平衡。
权重作用方式是在每个轮次开始前按目标簇分布重构训练池,属于轮次级重采样,而不是步内加权损失。默认用经验簇分布,消融中逐步把权重移向中亚所在的 C3 簇。微调默认跨语言均匀采样、语言内按域分层采样。预训练做 300,000 步,学习率 2 乘 10 的负 4 次方,每步音频批量为 2048 乘 32 秒约 18.2 小时。微调用 AdamW 做 200,000 步,峰值学习率 6 乘 10 的负 5 次方,5000 步热身,余弦衰减到 1 乘 10 的负 7 次方,梯度累积做到虚拟批量 3200。
下面的图展示了 5 个簇的语言时长分布,是理解为何需要簇级加权的直接依据。图前导读:该图横轴是语言、纵轴是对数小时数,分 5 个面板显示 C1 到 C5,每个面板标注总时长,柱上斜线为低置信不确定部分,加粗为实验涉及语言。
看图路径: 1. 先看横向五个簇的标题与总时长,确认 C1 到 C5 的数量级递减;2. 再看纵轴为对数小时刻度,比较俄语、英语、哈萨克语柱高的真实差距;3. 观察每根柱子上方斜线阴影代表的不确定低置信片段占比;4. 找到加粗参与实验的语言,定位目标语言所在的 C3 突厥簇
论文图 1。原论文 Figure 1:“Language duration distribution by cluster.”。
图后解释:像素显示 C1 斯拉夫欧洲约 992470 小时、C2 全球核心约 499328 小时、C3 突厥约 133092 小时、C4 罗曼与非洲约 57394 小时、C5 西亚与印度约 26193 小时,头部俄语和英语单语言柱显著高于 C3 的哈萨克语、乌兹别克语、吉尔吉斯语等,证实自然分布下目标语言处于长尾。C4 和 C5 中斜线阴影占比更高,说明低置信片段多,若按单语言平衡会放大噪声,这支持了论文只在簇级别加权的安排。C3 内部还包含巴什基尔语等尾部语言,为后文向巴什基尔语和格鲁吉亚语迁移的实验提供了预训练覆盖很少的背景。
语言簇 × 簇级采样权重: 语言簇负责把 70 多种高频语言按同录音共现关系聚成 5 个可管理的组,避免对单个低资源语言单独估计权重时的不稳定,簇级采样权重负责在每个训练轮按目标分布重构预训练池、提高中亚簇的贡献比例,二者搭配的原因是簇提供了稳定的加权单位、权重提供了调节头部主导的旋钮,组合后预训练目标不再被俄语和英语淹没。
语言平衡采样 × 领域感知采样: 语言平衡采样负责让英语、俄语、哈萨克语、吉尔吉斯语、乌兹别克语在微调时被均匀抽到,解决自然分布下尾部语言几乎学不到的问题,领域感知采样负责在每种语言内部再按子域加权,防止大规模合成子集主导课程,搭配的原因是前者管语言间公平、后者管语言内结构,组合后自发语音等难域的泛化更好。
微调三类数据源如何配比,合成何时帮忙何时添乱?
微调池由 4 类来源构成:开源提供多样录音条件,众包提供目标语言的真实口音和自发风格,弱监督从长录音切出更多监督片段,合成专门补哈萨克语和吉尔吉斯语的文本覆盖。论文对比了不平衡自然分布、语言平衡和领域感知 3 种采样。不平衡对英语最优但尾部 representation 不足,语言平衡让尾部大幅回升而英语只小幅回退,领域感知在哈萨克语和吉尔吉斯语内部集上再进一步,原因是它压住了合成大子集的主导,让自发域有足够梯度。
乌兹别克语是个反例:总量小且无合成增强,领域感知相对语言平衡无明显额外收益,这恰好支持了领域感知的机制解释,即它的增益来自调节合成占比,而非普遍正则。操作上复现者应先做到语言平衡,再在有合成的语言上加域权重,并单独监控内部自发集,而不是只看朗读集。原文未报告各域的具体权重数值,只说明在语言内做分层采样,这是复现时需要自行搜索的缺项,应记录搜索过程而不把某组权重当成原文值。
微调数据、基线配置和指标如何保证可比?
微调数据按语言和来源列出小时数,覆盖开源、众包、弱监督和合成 4 类。开源部分包括 Common Voice、FLEURS、Golos、Russian LibriSpeech、Europarl-ASR、LibriSpeech、People’s Speech、SLURP、SPGISpeech、TED-LIUM、VCTK、VoxForge、乌兹别克语音语料、哈萨克语音语料 2、KazakhTTS 和 Yodas,特点是朗读加会话、录音条件多样。众包覆盖俄语、吉尔吉斯语、哈萨克语和乌兹别克语,英语开源 26738 小时、俄语开源 1767 小时加众包 3363 小时,哈萨克语合成 7896 小时、吉尔吉斯语合成 6415 小时,乌兹别克语总量相对小且无合成增强。
基线包括 Omnilingual 1B 带大语言模型解码器、Seamless M4T large、Whisper large v2 和 large v3,论文表 1 用它们各自原始解码流程报告,编码器消融则把 Whisper Large 和 Omnilingual 1B 的编码器拿出来,用与 GigaAM 相同的 CTC 流程、相同微调配方和贪心解码重训,以隔离编码器贡献。指标统一为词错误率,越低越好,按语言和切分报告,不做跨指标平均的神化。文本归一化条件前文已述,英语的拼写与缩写处理会同时作用于参考和假设,避免把拼写差异算成识别错误。内部集为众包收集的野外自发语音,更能反映部署条件。
复现时需注意微调表中的小时数是训练池规模,实际每轮按采样策略重构,看到的语言比例不等于小时比例。
主结果:在什么集上赢,输在哪里?
主结果的比较问题是最终系统相对公开多语言系统在目标语言上有无实质增益,公平条件是各自按原文推荐的语言指定方式解码、统一贪心解码和文本归一化,指标方向为词错误率越低越好。论文报告最终模型在哈萨克语、吉尔吉斯语、乌兹别克语的 Common Voice、FLEURS 和内部集上全面低于 Omnilingual、Seamless M4T large、Whisper large v2 和 large v3,尤其在内部自发集差距拉大,例如哈萨克语内部 15.8%、吉尔吉斯语内部 9.8%、乌兹别克语内部 12.7%,而 Whisper large v3 在这些集上高达 65% 以上甚至超过 100%,说明通用大模型在该长尾区并未有效覆盖。
代价是英语 Common Voice 为 21.5%、FLEURS 为 9.4%,弱于 Seamless 和 Whisper large v3,俄语保持在 5.1% 到 6.0% 区间基本持平。这符合设计目标:优先抬尾部,头部小幅回退。未胜出项必须指出:英语所有切分均非最优,俄语 FLEURS 也只是持平而非领先,说明簇级加权不是对所有语言免费午餐。另一个边界是主结果表用的是各系统原始流程,不是统一 CTC 后的编码器能力,编码器本身的贡献要看受控消融,下一节用数字表展开预训练权重和尾部迁移的证据。
预训练权重移动了多少,尾部迁移还能走多远?
第一个消融问题是预训练簇权重向 C3 倾斜是否单调改善中亚语言,公平条件是固定微调配方只换预训练编码器,指标为各语言多切分平均词错误率,越低越好。从自然分布 E0 到 E2,吉尔吉斯语从 9.4 降到 8.5、乌兹别克语从 10.5 降到 9.7,俄语几乎不变,英语小幅上升,E3 试图回调英语却牺牲了目标语言增益,因此最终选 E2。这说明权重的作用是把表示容量让给尾部簇,但过度回调会稀释效果。
第二个问题是微调采样如何影响结果:自然分布对英语最优但显著损害尾部,语言平衡大幅抬尾部且英语只小幅回退,领域感知进一步改善哈萨克语和吉尔吉斯语内部自发集,因为它防止合成大子集主导课程,而乌兹别克语因无合成增强而无额外收益。第 3 个问题是编码器本身:统一 CTC 后 240M 和 600M 的 GigaAM 都优于 Whisper 和 Omnilingual 编码器,平均词错误率 600M 为 10.2%、240M 为 12.2%,而 Whisper 为 14.1%、Omnilingual 为 16.6%,且 240M 除英语外全语言领先,支持效率判断。
| 预训练 | 指标 | E0 自然分布 | E2 偏向 C3 | 变化方向 |
|---|---|---|---|---|
| 吉尔吉斯语 | 平均词错误率 | 9.4 | 8.5 | 下降 |
| 乌兹别克语 | 平均词错误率 | 10.5 | 9.7 | 下降 |
| 俄语 | 平均词错误率 | 4.6 | 4.7 | 基本持平 |
| 英语 | 平均词错误率 | 14.4 | 15.4 | 小幅上升 |
| 哈萨克语 | 平均词错误率 | 12.3 | 11.4 | 下降 |
该表整理自正文连续句报告的 E0 到 E2 变化,数值与单位以原句为准,表头单位为词错误率百分比,裸值不另加百分号。
表后解释:主要收益是中亚两语言约 0.8 到 0.9 个百分点的下降,代价是英语约 1.0 个百分点的上升,俄语 0.1 个百分点可视为噪声,反例是 E3 回调英语后目标语言回退,说明不存在同时最优的单一配比。未评测边界是该平均未给出方差和显著性,且只覆盖 5 个目标语言,不能推广到 C4 和 C5 的非洲与印度语言。
| 尾部语言 | 指标 | Whisper Large v3 CTC | Omnilingual 1B CTC | GigaAM CTC |
|---|---|---|---|---|
| 格鲁吉亚语 | Common Voice 词错误率 | 13.4 | 7.8 | 3.8 |
| 巴什基尔语 | Common Voice 词错误率 | 11.1 | 8.2 | 3.6 |
| 训练量 | Common Voice 训练小时 | 93h for Georgian | 143h for Bashkir | 93h for Georgian, 143h for Bashkir |
| 预训练覆盖 | 原文描述 | minimal coverage | minimal coverage | less than 500 hours |
| 模型方式 | 原文描述 | same CTC setup | same CTC setup | separate per-language CTC model |
该表整理自正文对巴什基尔语和格鲁吉亚语的受控迁移描述,每语言单独训一个 CTC 模型、只用其 Common Voice 训练数据。表后解释:GigaAM 以 3.8 和 3.6 显著低于 7.8 到 13.4 的基线,支持其表示对预训练不足 500 小时的语言仍可快速适配。代价和限制是该实验每语言单独建模、数据量仍有近 100 小时,不等于零样本或 few-shot 可用,且未报告解码延迟与训练成本,不能从词错误率推定部署开销。
哪些结论有边界,什么还没有被测量?
论文直接报告的是在给定归一化和贪心解码下的词错误率对比,有限解释是簇级加权缓解了头部主导、领域感知防止了合成主导,这些有消融支持。未验证的推测是把趋势推广到全部长尾:实验只覆盖中亚三语言加巴什基尔语和格鲁吉亚语,C4 和 C5 的大量语言未评测,不能断言同配比对所有簇有效。
缺失的证据包括统计显著性、多次种子的方差、推理延迟、内存占用和训练能耗,原文给了步数、批量和学习率,但未换算成 GPU 小时或成本,因此不能承诺效率之外的延迟改善。数据侧的限制是 2,000,000 小时内部音频的构成、语言识别模型的误差和不确定片段的真实语言分布未完全公开,复现者只能用公开部分加权衡。文本归一化排除了数字句和长句,实际应用中的数字、人名和代码切换可能表现不同。
相关性不等于因果:E2 更好与 C3 权重更高同时出现,但教师聚类质量、微调合成比例也在变化,论文未做完全正交分解,解读时应说支持而非证明。
要复现先做什么,需要哪些超参数和数据?
复现先做数据核对,再做 2 阶段训练。数据上先按论文列出开源语料清单配齐 Common Voice、FLEURS 及哈萨克语和乌兹别克语专用集,再确认众包、弱监督和合成 3 类内部数据的可得性,若无内部数据则只能复现开源子集,预期内部自发集增益会打折。超参数按原文保留:预训练 300,000 步、学习率 2 乘 10 的负 4 次方、每步 2048 乘 32 秒批量、遮蔽 40% 帧的连续片段、教师 1000 类 K 均值;微调 200,000 步、AdamW、峰值 6 乘 10 的负 5 次方、5000 步热身、余弦衰减到 1 乘 10 的负 7 次方、虚拟批量 3200、共享字符表 CTC。
采样实现要在每轮前按目标分布重构训练池,预训练按簇、微调按语言均匀加域内分层。评测要复刻排除大于 30 秒和含数字、统一小写去标点、英语拼写与缩写归一化的流程,并用贪心解码。下面的表把可直接抄写的训练配置集中列出,便于对照。
| 阶段 | 目标与优化器 | 学习率与调度 | 批量与步数 |
|---|---|---|---|
| 采样 | 预训练按簇,微调跨语言均匀加域内分层 | 每轮前重构训练池 | 经验分布为默认 |
| 编码器 | 600M 与 240M Conformer,24 层,1024 维,旋转位置编码,25 赫兹 | 教师 1000 类 K 均值 | 遮蔽 40% 帧 |
该表数字与描述均来自正文连续句,学习率与步数保留原文写法。
表后解释:该配置是复现公平性的锚点,换编码器对比时必须保持微调表不变,否则无法区分数据红利与编码器优势。若算力不足,可先复现 240M 编码器加统一 CTC 的消融,因为原文显示它已能超越更大基线,更适合验证配比思想。代码当前可用,权重按仓库说明获取,但内部 2,000,000 小时音频不可得,需用公开多语言音频替代并重新聚簇,这是复现中最大的待补验证。
何时值得尝试这套配方,还需补哪项验证?
当你的任务也是头部时长占比极高、尾部有少量预训练覆盖但有一定众包或合成能力时,这套配方值得尝试:先做语言识别加多数投票摸清分布,再按共现聚簇、只在簇级别调权重,微调时先语言平衡再对合成大域做域内压制。论文特有的误解需要澄清:240M 超越更大基线不等于小模型普遍更好,它是在相同 CTC 微调和相同数据配方下的受控结果,换解码器或换数据可能改变排序;词错误率超过 100% 不是笔误,而是插入错误多导致的,恰恰说明基线在该语言上不可用。
不确定片段不是丢弃,而是在簇级别参与加权,单语言平衡会放大其噪声。还需补的验证包括在 C4 和 C5 语言上的迁移、多次种子的方差、数字与代码切换句的评测,以及用公开音频重做 2,000,000 小时聚簇后的效果。若只能做一件事,优先复现统一 CTC 下的编码器消融,因为它最能回答表示本身是否更适合长尾迁移,而不被各家原始解码流程的差异所混淆。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
