英文题目:PUMA: Projected Universal Multilingual ASR for Low-Resource Settings. Application to Diverse African Languages

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.17

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#提示学习 #低资源 #多语言 #语音 #语音识别

评分:6.2/10 | 创新 1.1/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Ilyes Oukid:机构信息未能从会议 PDF 纯文本可靠映射
  • Bilal Faye:机构信息未能从会议 PDF 纯文本可靠映射
  • Hanane Azzag:机构信息未能从会议 PDF 纯文本可靠映射
  • Mustapha Lebbah:机构信息未能从会议 PDF 纯文本可靠映射
  • Said Yacine Boulahia:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为重采样至16 kHz的原始语音波形,输出为统一字符词表上的转写文本,难点是每语平均仅约15小时标注且形态丰富音系差异大,全共享模型易语言间干扰而独立adapter则参数随语言线性增长。冻结的特征抽取器与特征投影先将波形映射为声学序列h,以保留预训练声学表征并降低可训量。通用语言投影将可学习语言token t_l拼接到h前端,经4层共享Transformer建模后切除首位得到语言偏置u,以单向量路由共享子空间实现语言感知。残差融合h+u送入冻结的wav2vec 2.0编码器建模长时上下文,再经可训练线性加softmax头输出z并用CTC损失训练解码。与MMS每语言独立adapter的本质差异是以共享投影加单token替代多套adapter,新增语言仅增加一个向量,总量维持1B而可训量约30M,避免参数线性膨胀。在同步多语言训练设置下,PUMA的WER为0.314,低于MMS的0.419。该结论适用边界仅限已见10语及其训练域内跨语料泛化,对未见语言、强口音与域偏移尚未验证,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

这篇解读的输入是 ACL 2026 Findings 第 371 至 382 页的 PUMA 论文正文,目标是让刚进入语音识别的研究生能不看原文复述出方法与实验条件。必须保留的信息包括 5 组件的数据流、可训练与冻结的划分、3 种训练 regime 的构造方式、10 种非洲语言的实验设置、同时训练与零样本的对照条件,以及可训练参数量的数量级。输出是一套按学习依赖展开的说明,先讲任务与相关路线,再讲结构与计算,然后讲训练与评测,最后讲代价与复现。

论文研究的任务是低资源多语自动语音识别,具体是把 16 kHz 采样的语音波形转写为字符序列。难点在于每种语言平均只有约 15 小时的标注语音,且形态和发音差异大,高资源语言上训练的模型直接迁移效果差。评价用词错误率衡量转写准确性,数值越低越好,同时用 BLEU 和 ROUGE 衡量句子级对齐与流畅性,数值越高越好。需要提前说明,本文没有收到代码、模型或数据可达性验证,因此不声称任何链接当前可用,所有复现讨论只依据论文文字报告的设置。

已有路线在什么相同任务上做了什么,为何还不够?

在相同的多语语音转写任务上,已有 4 条路线。第一条是全共享多语模型,用一套参数处理多种语言,优点是能从高资源语言向低资源语言迁移,缺点是难以刻画相距较远语言的音系和形态差异。第二条是自监督表示学习,例如 wav2vec 2.0、XLSR、XLS-R 和 USM,先在大量无标注语音上学习声学表示,再有监督微调,缺点是下游多为适配而缺少显式的语言身份建模。

第三条是基于适配器的方法,例如 MMS 在共享骨干上为每种语言加专用适配器,效果好但参数随语言数线性增长,论文指出每个适配器带来超过两百万的额外参数,新增语言和部署都不轻便。第 4 条是大规模与零样本路线,例如 Whisper 通过大规模多任务训练获得广覆盖,Omnilingual 等系统面向未见语言,但需要非常大的容量和训练资源。PUMA 的定位是在不引入语言专用组件的前提下实现语言感知,新增语言只学习一个轻量语言令牌。

适配器 × 全参数共享: 适配器指为每种语言单独加一套专用模块的做法,全参数共享指所有语言共用同一套投影和编码参数的做法,二者搭配比较的理由是前者用参数增长换取语言特化,后者用语言令牌换取可扩展性,组合意义是 PUMA 试图证明不加适配器也能通过共享投影实现语言感知,从而使新增语言只增加一个轻量令牌。

要解决的矛盾是什么,成功的标准是什么?

矛盾是语言感知与参数共享之间的张力。一方面要让模型知道当前处理的是卡拜尔语还是豪萨语,否则不同语言的梯度会互相干扰。另一方面不能为每种语言单独开模块,否则支持 10 种语言时参数膨胀,支持上 100 种语言时更难维护。论文把成功标准定为三点。第一,在单语、渐进多语和同时多语 3 种训练方式下都相对强基线降低词错误率。

第二,总参数预算不随语言数增长,可训练参数保持在约 30M 量级。第三,在换语料的跨库零样本评测中保持竞争力。理解这个矛盾后,才能明白为什么后文要把语言信息做成一个可学习的向量拼进声学序列,而不是做成独立分支。

一个样本从声音到文字走过哪五个部件?

先沿一个样本走完全程。输入是一段重采样到 16 kHz 的音频波形。第一步特征提取器把波形变成包含音素和韵律线索的中间声学表示。第二步特征投影把该表示映射到固定维度并做归一化,得到 h,使不同语言的表示先对齐到同一空间。第三步通用语言投影根据目标语言取出对应的可学习语言令牌,与 h 拼接后再用共享 Transformer 处理,得到语言偏置表示 u。

第四步把 u 与原始 h 相加后送入编码器建模时序与长程上下文,得到 e。第五步语言建模头把 e 线性映射到 204 个字符组成的统一词表并做 softmax,得到每帧的概率分布 z,训练时用 CTC 损失学习对齐,推理时解码为文本。冻结与可训练的划分是复现关键,特征提取器、特征投影和编码器来自预训练 wav2vec 2.0 且全程冻结,只有通用语言投影、语言令牌和语言建模头参与更新。下面的结构图把这条主路径与冻结可训练标记画在了一起,读图时先看主路径再看拼接点。

读图前先明确任务:该图要回答音频如何分叉为声学支路和语言条件支路,又在何处汇合进入编码器,以及哪些模块冻结、哪些模块可训练。图注指出该图包含特征提取器、特征投影、通用语言投影、编码器和语言建模头 5 个组件。

看图路径: 1. 从左下音频经特征提取器和特征投影找到两路 h 的去向;2. 观察左上语言令牌与 h 在拼接点汇合为 h’的位置;3. 对照右上图例区分冻结雪花与可训练火焰模块;4. 跟踪 ULP 输出 u 与 h 相加进入编码器再到语言建模头的路径

原论文 Figure 1:Overview of the PUMA architecture with its five components: Feature Extractor (FE), Feature…

论文图 1。原论文 Figure 1:“Overview of the PUMA architecture with its five components: Feature Extractor (FE), Feature Projection (FP), Universal Language Projection (ULP), Encoder, and LM Head.”。

从像素可见,底部从左到右是音频经特征提取器到特征投影再到加号进入编码器的主链,左上语言令牌与中部 h 在蓝色拼接符号处汇合成 h’后进入上方通用语言投影堆叠,堆叠内标注了 RMSNorm、多头注意力和前馈结构以及残差回路,投影输出 u 向下回到底部加号处与 h 相加。图例用雪花表示冻结,用火焰表示可训练,语言令牌、通用语言投影和语言建模头带有火焰标记,特征提取器、特征投影和编码器带有雪花标记。

右侧语言建模头分出训练时到 CTC 损失的实线和推理时到文本的虚线,说明同一概率输出在两种阶段的不同去向。这一结构直接对应后文先拼接再去掉语言位置、先投影再残差相加的实现顺序。

语言令牌如何拼入声学序列,又为何要及时去掉?

通用语言投影的核心动作是拼接、变换、切除。设某语言为 l,其语言令牌是维度与投影特征相同的可学习向量。给定投影后声学特征 h,模型把该令牌拼在序列长度维的最前面,使长度从 L 变为 L 加 1,得到 h’。然后用 4 个共享 Transformer 块处理 h’,块内使用 RMSNorm。处理后把属于语言令牌的第一个位置切掉,只保留与原始音频帧对应的 L 个位置,得到 u。

切除的理由在原文有明确安排解释:语言令牌不对应真实音频段,保留它会破坏模型输出与转写在 CTC 或注意力损失下的对齐。编码器输入是 h 与 u 相加,输出 e 再经线性加偏置与 softmax 得到 z。

声学表示 × 语言令牌: 声学表示负责携带语音中与发音和韵律有关的连续信息,语言令牌负责携带当前目标是哪一种语言的离散身份信息,二者搭配的理由是同一套共享参数需要一个每语不同的入口条件才能分开处理,组合意义是把语言令牌拼在声学序列最前面一起送入共享 Transformer,使后续注意力在不增加适配器的情况下产生面向该语言的偏置表示。

下面是原文给出的拼接关系,符号含义是 h 为投影后声学特征,tl 为语言 l 的令牌,h’为拼接待处理序列,Dfp 为投影维度,N 为批大小,L 为序列长度。计算目标是构造一个比原序列多一个位置的输入,使共享注意力能同时看到语言身份和全部声学帧。原文明确的实现是只拼一个令牌,块数为 4,处理后再切片。

\[h′ = concat(tl, h) ∈RN×(L+1)×Dfp.\]

需要区分的是,MMS 的推理被写成在共享参数之外再依赖该语言专用适配器,而 PUMA 把语言信息压缩进令牌后全程只用共享参数加令牌。这种差异不是修辞,而是参数增长方式的差异:前者每加一语加一个适配器,后者每加一语加一个向量。

通用语言投影 × 编码器: 通用语言投影负责在共享参数内完成语言条件化变换,编码器负责建模时间上下文和长程依赖,二者搭配的理由是前者先解决语言间干扰问题,后者再解决时序建模问题,组合意义是投影输出与原始声学特征做残差相加后再送入编码器,既保留原始声学细节又叠加语言偏置。

编码器与输出头各自做什么,参数谁动谁不动?

编码器对应预训练 wav2vec 2.0 的 Transformer 编码器块,负责在相加后的表示上捕捉时序动态和长程依赖。论文明确用预训练权重初始化并在训练中保持冻结,目的是降低计算成本并在低资源下借助迁移。语言建模头是一个线性投影加偏置再 softmax,权重维度为编码维度到词表大小,负责输出可解码的概率。训练中更新的部分只有通用语言投影、语言令牌和语言建模头,合计约 30M 可训练参数,总参数预算保持 1B 不变。

这一划分意味着梯度主要流经投影堆叠和输出头,不更新底层声学特征提取与主编码器。论文未报告学习率调度、预热步数、梯度裁剪阈值和随机种子,这些是复现时的缺项,不应从模型名称推定。特征投影的归一化细节也只写到保证兼容后续模块,未给出具体归一化公式,因此同样按缺项处理。

三种训练方式如何构造数据,损失如何对齐?

论文用 3 种互补方式训练同一结构。单语训练是每种语言单独训练一个模型,目标是最小化该语言数据集上的损失,可作为衡量多语增益的基线。渐进式多语训练是按顺序引入语言,先在初始语言上训练,再用已学权重初始化并与新语言令牌一起微调,同时用少量旧语言数据回放以防灾难性遗忘,形式上是对已见语言集合的联合损失。论文未给出回放比例和采样策略的具体数值,这是复现渐进设置时的缺项。

同时多语训练是把所有语言数据取并集,每个小批量从并集中采样并按样本所属语言选用对应令牌,目标是最小化该批损失,优点是促进跨语言泛化,风险是语言间梯度干扰。3 种方式共用 CTC 损失,输入为对数概率、目标标签、编码后输入长度和标签长度,并用空白符建模未对齐帧,从而无需帧级标注即可学习隐式对齐。

语言建模头 × CTC 损失: 语言建模头负责把编码器输出映射到词表上的每帧概率分布,CTC 损失负责在没有帧级对齐标注时学习语音帧与字符序列的隐式对齐,二者搭配的理由是前者提供可解码的分布,后者提供可训练的对齐目标,组合意义是用空白符吸收未对齐帧,使模型只需句子级转写即可训练。

渐进式多语训练 × 同时多语训练: 渐进式多语训练负责按顺序逐个引入语言并用小量旧数据回放防止遗忘,同时多语训练负责把所有语言并成一个大数据集后每批混合采样,搭配比较的理由是前者更贴近现实中不断加语言的部署过程,后者更考验共享模型抵抗梯度干扰的能力,组合意义是论文用两种 regime 共同检验同一套共享参数的可扩展性。

数据、词表、优化器和硬件的真实条件是什么?

实验覆盖卡拜尔语、沃洛夫语、豪萨语、约鲁巴语、伊博语、绍纳语、科萨语、丰语、契维语和阿拉伯语共 10 种语言,每语平均约 15 小时转写语音。所有音频重采样到 16 kHz,并划分一致的训练验证测试集。文本侧把各语言字符集合并为 204 个字符的统一词表,用同一分词器处理,保证文本处理一致。优化器为 AdamW,学习率为 1 乘 10 的负 3 次方,权重衰减为 1 乘 10 的负 3 次方,有效批大小为 32 并通过梯度累积实现。通用语言投影为 4 个 Transformer 块,隐藏维度 768,自注意力头数 8,投影维度 1280。

所有实验在一块 80 GB 的 A100 上完成。基线方面,主要对照是 MMS,同时报告 Whisper 小中大 3 个尺寸,但因计算约束 Whisper 只在同时多语下微调,单语和渐进设置只与 MMS 比较。阿拉伯语因变音符号和切分问题不报告 ROUGE,这是原文明确的评测边界。下面的表格把这些分散在正文中的条件集中为可核对清单,读表时注意单位与裸值的区别,学习率与权重衰减的负 3 次方是原文写法,不应改写精度。

下表要回答复现前必须锁定的 5 个条件:数据量、词表规模、优化器设置、投影结构和硬件预算,公平性体现在所有模型在相同条件下训练,指标方向为词错误率越低越好。

条件分组具体项目原文报告值单位与口径适用范围
数据每语平均时长15 小时转写语音10 种语言平均
数据统一词表204 字符合并字符集所有语言共用
优化学习率与衰减1 乘 10 负 3 次方AdamW 两项同值全实验
优化有效批大小32梯度累积后全实验
结构投影块与维度4 块,768 维,8 头,1280 维ULP 编码器PUMA 专用
硬件计算设备单卡 80 GBA100全实验

上表把容易遗漏的复现要素固定下来。代价是论文未报告训练轮数、早停 patience、回放集大小和随机种子,因此即使照表设置仍可能因采样顺序产生波动。未胜出项的边界也要记住:阿拉伯语的 ROUGE 缺失不是模型失败,而是分词评估不可靠,复现时不应自行补算该指标去比较。

同时训练下谁的平均误差最低,代价在哪里?

同时训练是把十语并集混合训练,最能检验共享模型的抗干扰能力。论文报告 PUMA 平均词错误率最低,同时 ROUGE 最高,BLEU 保持竞争性。Whisper-large 表现较强但仍高于 PUMA 的平均误差,MMS 与 Whisper-medium 更低,Whisper-small 在低资源下困难较大。按语言看,PUMA 在多数语言上优于 MMS 和中小尺寸 Whisper,在绍纳语和科萨语上 Whisper-large 略好,在丰语和契维语上双方接近。理解时要注意平均值不等于每语都胜,总体趋势不能推广为每组都成立。

参数代价是本节重点:PUMA 总预算 1B 不变,可训练约 30M,MMS 在十语下也可训练约 30M 但随语言数线性增长,而 Whisper、Seamless 和 Omnilingual 的可训练量从 244M 到 7B,高出数量级。下面的参数柱状图直观显示了这种数量级差距,读图时先看纵轴单位再比较柱高。

读图前先明确问题:该图要回答达到相近转写质量时各系统需要付出多少可训练参数,横轴为不同系统,纵轴为可训练参数量,单位为百万。

看图路径: 1. 先确认纵轴为可训练参数量并注意单位为百万;2. 比较最右侧 PUMA 与 MMS 柱高与其他大模型的柱高差异;3. 观察 Whisper 与 Omnilingual 系列柱高随规模放大的趋势

原论文 Figure 2:Comparison of the number of trainable param- eters between baseline models and PUMA.

论文图 2。原论文 Figure 2:“Comparison of the number of trainable param- eters between baseline models and PUMA.”。

从像素可见,纵轴从 0 到 7000,最右侧 PUMA 与 MMS 的柱几乎贴近横轴,而中部 Omnilingual 的 7B 配置柱高达 7000 附近,Whisper 与 Seamless 的中高柱也在数 100 至 2000 区间。这种视觉差距支持论文的节俭性判断,但也提示零样本一节中大模型的精度优势是有代价的。不能从该图读出推理延迟或显存占用,因为可训练参数不等于推理开销,论文也未测量延迟与帧率。

下表要回答在相同同时训练条件下各系统的平均精度与流畅性排序,公平条件是相同数据划分与统一词表,指标方向为词错误率越低越好,BLEU 与 ROUGE 越高越好。

ModelWERBLEUR-1R-2R-L
Whisper-small0.5940.3120.6120.4400.609
Whisper-medium0.4020.4390.7060.5510.704
Whisper-large0.3390.4990.7450.6060.743
MMS0.4190.4110.7430.5870.741
PUMA0.3140.4740.7660.6220.764

表后需要同时看到收益与反例。收益是 PUMA 以 0.314 的平均词错误率报告低于 MMS 的 0.419 和 Whisper-large 的 0.339,且 ROUGE 三项也最高,说明语言条件化表示缓解了共享模型的语言间干扰。代价与反例是 BLEU 上 Whisper-large 的 0.499 仍高于 PUMA 的 0.474,说明在部分流畅性维度大模型仍有优势,且分语言结果显示绍纳语和科萨语上 Whisper-large 略优。因此该表的支持结论是节俭共享可以在平均误差上取胜,但不是在所有指标和所有语言上全面压制。

参数预算如何做到不随语言数增长?

参数预算的差异来自架构选择。MMS 骨干为 1B 参数,每语专用适配器带来超过两百万的额外参数,因此十语时可训练量与 PUMA 相近但随语言增加而线性放大。PUMA 同样维持 1B 总预算,但新增语言只需学习一个轻量令牌,可训练量恒定在约 30M 附近。其他大系统可训练量从 244M 到 7B,比 PUMA 高出数量级。下表把原文中分散的参数陈述集中为可核对对照,读表时注意原文的约数与范围写法,不自行四舍五入或补单位。

下表要回答每加一种语言系统要多付多少参数,比较对象为 MMS 与大模型系列,公平条件是同一十语设置下的原文报告口径,数值方向为越小越节俭。

条件指标MMS 原文PUMA 原文大模型范围
十语设置骨干与总预算1B 参数1B 参数244M 至 7B
十语设置可训练量约 30M约 30M高出数量级
新增语言边际代价超过两百万一个轻量令牌随规模放大

上表支持的判断是 PUMA 的节俭性主要来自边际代价而非十语当下的绝对值,因为当下两者都约为 30M,差距在语言数继续增加时才会拉开。限制是论文未报告推理显存、吞吐和延迟,因此不能把可训练参数少直接等同于推理更快或部署更便宜,复现时需另测这三项才能谈部署收益。

拿掉语言令牌后哪里退化最多,哪里还能撑住?

消融在同时多语下比较保留语言令牌与去掉语言令牌的同一结构。总体上去掉后性能下降,但在沃洛夫语、伊博语、绍纳语和科萨语子集上仍保持可比,论文据此认为共享注意力本身能捕捉部分跨语言规律。退化最明显的是语言距离较远的难语言,尤其是阿拉伯语,相对词错误率上升 12.1%,BLEU 下降 11.3%,反映跨语言干扰增大。其他如丰语和约鲁巴语也有明显下降,而契维语下降较小。下表只聚焦原文明确给出相对变化的阿拉伯语案例,避免把不同指标的差值混入模型列,也避免用自动指标代替人评。

下表要回答语言令牌的增量作用有多大,对照是同一 PUMA 结构有无令牌,指标方向为词错误率相对上升为坏,BLEU 下降为坏。

条件指标保留令牌去掉令牌相对变化
阿拉伯语消融词错误率基准恶化上升 12.1%
阿拉伯语消融BLEU基准下降下降 11.3%

上表支持的解释是语言令牌起路由作用,把共享表示导向面向该语言的子空间,从而在保持知识迁移的同时缓解干扰。但要区分直接报告与推测:相对变化数值是直接报告,路由向量是有限解释,而 typologically diverse 语言必然受益则是待验证推测。未胜出项是部分语言去掉后仍可比,这恰好说明令牌并非在所有语言上都不可或缺,复现时应分语言报告而非只看平均。

哪些结论有边界,哪些量根本没测?

论文在结论与局限中明确承认零样本性能受轻量设计约束。在 FLEURS 跨库零样本上,PUMA 平均词错误率 0.407,优于 Whisper 各尺寸、MMS 的 0.482 和 Seamless,但落后于 Omni-CTC-1B 的 0.372 及更大的 7B 与 LLM 版本,后者以显著更大的容量和计算为代价取得更强结果。跨库的含义是训练见过的沃洛夫语、豪萨语等 7 种语言换到 FLEURS 语料上评测,因此是语料分布偏移而非完全未见语言。未测量的量包括误判率分解、推理延迟、输出帧率、训练能耗和统计显著性,论文未报告方差或显著性检验,因此不能承诺这些量得到改善。

另一个边界是阿拉伯语评估因分词问题缺失 ROUGE,任何跨语言平均都应说明该缺失口径。未来工作提出多令牌表示以刻画音素、正字法和韵律,以及混合专家以增强特化,但这些在本文未验证,只能记为待验证方向。

要复现先锁什么,还缺哪项验证?

复现先锁数据与文本条件:十语各约 15 小时、16 kHz、统一 204 字符词表和一致划分,缺失时先对齐这四项再谈模型差异。再锁冻结划分:特征提取器、特征投影和编码器冻结,只训练通用语言投影、语言令牌和语言建模头,可训练约 30M,优化器用 AdamW 且学习率与衰减同为 1 乘 10 负 3 次方,有效批 32,投影结构为 4 块 768 维 8 头 1280 维,硬件为单张 80 GB A100。训练时分别实现单语、渐进与同时 3 种数据构造,渐进需自定回放比例并记录,因为原文未给数值。

损失用 CTC 并保留空白符处理,语言令牌在投影后切除的切片位置要与长度计算一致,否则对齐会错位。还需补的验证是多次随机种子的方差、学习率敏感性、回放比例扫描,以及推理延迟与显存的实测,才能把节俭性从可训练参数推广到部署成本。资源状态方面,本次未发现完成 HTTPS 验证的开源绑定,因此不写代码已公开或可下载,若需使用原文提到的地址应自行核对可达性。

何时值得尝试 PUMA 式的共享投影?

当任务是多种低资源语言共用一个转写系统,且新增语言频繁、部署预算有限时,PUMA 式的单投影加单令牌值得尝试,因为它把语言特化压缩到最小增量。复现顺序应是先跑通同时训练的平均指标,再做渐进引入与回放,最后做去令牌消融以确认难语言是否真的依赖条件化。若目标是跨库零样本的最强精度且算力充足,大容量系统仍有优势,此时不应期待 30M 可训练量在所有语言上反超。常见误解有三。

其一,把可训练参数少等同于推理一定快,实际上冻结参数仍参与前向,延迟需另测。其二,把平均词错误率低等同于每语都好,实际上绍纳语等仍有反例。其三,把去掉令牌后部分语言可比理解为令牌无用,实际上阿拉伯语等难语言的退化恰好说明条件化在缓解干扰上的价值。带着这三点去读原文表格,才能把报告、支持与待验证分开。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总