英文题目:PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs
会议身份:
conference:interspeech:2026:conference-paper-id:zhang26aa_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#课程学习 #多语言 #语音 #语音识别 #语音翻译
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Pei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Andong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Xi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Baosong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Derek F. Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Huang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言语音到文本需把多语言语音映射为转写或翻译文本,常规冻结大语言模型(Large Language Model,LLM)并混训多语言自动语音识别(Automatic Speech Recognition,ASR)与语音到文本翻译(Speech-to-Text Translation,S2TT)易使各语言音频表征坍缩到共享空间,丢失语言特异性。该工作提出渐进对齐表征训练(Progressive Alignment Representation Training,PART),将语言内对齐与跨语言对齐解耦为三步渐进链条。第一阶段冻结语音编码器与大语言模型,仅在单语多语言自动语音识别数据上训练轻量适配器,完成向大语言模型嵌入空间的粗粒度语言内对齐并提供稳定初始化。第二阶段以上一步已对齐的适配器为起点,渐进解冻语音编码器并与其联合优化,以扩充表征容量实现精细语言内对齐并保留语言特异性。第三阶段以前两阶段的语言内对齐表征为基础,联合自动语音识别与语音到文本翻译数据优化编码器与适配器,并用低秩适应(Low-Rank Adaptation,LoRA)激活大语言模型以利用跨语言迁移能力。与常规冻结大语言模型混训多任务的做法不同,该先保特异性再做迁移的设计缓解了表征坍缩并增强跨语言鲁棒性。全部三阶段共享自回归负对数似然目标。在Fleurs上PART-2B相对同数据同规模两阶段基线平均词错率从6.4%降至4.7%,相对下降约26.6%,在Common Voice 15上从9.2%降至7.4%,在CoVoST2英译上平均BLEU高1.4点。该结论限于10种训练覆盖语言的维基朗读与众包域,未验证未见语言、噪声对话泛化,训练与推理成本未披露。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么多语更难?
这篇论文的输入是一段语音波形,输出是文本。输出有两种:一种是与语音同语种的转写,称为多语自动语音识别;另一种是与语音不同语种的译文,称为语音到文本翻译。研究对象覆盖中文、英文、日文、韩文、粤语、德文、法文、俄文、西班牙文和意大利文共 10 个语种,翻译评测则聚焦到英译方向。
对刚入门的读者,白话解释是:模型要先听懂声音,再用文字写出来。单语转写只要求听准,多语翻译还要求跨语言转换。难点在于语音与文本长度天然不一致,语速、口音、朗读与自发语音的差异都会改变表示粒度。如果把 10 个语种和 2 个任务的数据一次性混在一起训练,音频表示容易在特征空间里挤到一起,论文称之为坍缩到共享空间,结果是编码器抓不住细粒度的语种差异。
本解读的输入是论文正文证据与 3 张官方原图像素,目标是让你能复述方法、条件与结果。必须保留的信息包括模型结构、3 个阶段冻结与解冻安排、数据规模、评测集与指标方向、主结果数字与消融代价。输出是 1 篇按学习依赖展开的技术解读,不做超出证据的营销判断。论文脚注给出了一个代码链接,但本次没有完成可达性验证,因此不声称代码或权重已公开可用。
常见做法是什么,它在哪里吃亏?
论文梳理的主流结构是语音编码器加适配器加大语言模型。语音先提取对数梅尔谱特征,再经预训练多语语音编码器得到语言学表示,再经随机初始化的轻量适配器投影到大语言模型的嵌入空间,最后与指令标记的嵌入拼接,送入多语大语言模型生成文本。这条路线在单语识别、翻译和合成上已有不少工作,关键挑战是如何把语音表示与大语言模型的文本表示对齐。
常规训练做法是冻结大语言模型参数,只在多语多任务数据上训练编码器,使其向大语言模型输入层对齐。论文指出这种做法只做到粗粒度的模态级对齐,没有有效对齐跨语言的任务目标。引用证据中提到的对比对象包括 Whisper-large-v3、Qwen2-Audio、Qwen2.5-Omni、MinMo、Speech-LLaMA 和 LLaST,以及一个同数据预算的 2 阶段变体 Baseline-2stage。教学例子是:把 10 种语言的转写和翻译样本倒进同一个池子,只调编码器,就像让一个人同时学 10 种口音的听写加翻译,但不允许负责语言知识的大脑参与调整,短期省事,长期容易把口音差异抹平。
需要区分的是,相关工作的类别差异不等于同条件胜负。论文用 Baseline-2stage 来控制模型尺寸和训练数据预算,以验证渐进训练本身的收益;与其他开源大模型的比较则属于不同数据与规模下的参考,不宜直接读作方法碾压。
任务如何形式化,监督从哪里来?
论文把多语语音到文本形式化为给定语音输入生成对应文本输出。记语音为输入,文本为输出,优化目标是最大化条件概率。训练数据分为两类:单语数据集用于多语识别,音频与文本同语种;跨语数据集用于语音翻译,输出语言与源语不同。所有 3 个阶段共享同一个负对数似然损失形式,区别在于参与优化的参数集合和数据混合。
自动语音识别 × 语音到文本翻译: 自动语音识别即 ASR,输入与输出同语种,目标是转写,论文用单语数据集 Dmimo 训练;语音到文本翻译即 S2TT,输入与输出跨语种,目标是翻译,论文用跨语数据集 Dcross 训练。搭配理由是两者共享语音到文本的模态桥但目标粒度不同,组合意义是 PART 先用 ASR 建模态对齐,再用 ASR 加 S2TT 联合优化来处理语音与文本长度不一致和语速多样性带来的粒度失配。
监督来源按证据交代为两部分。识别数据总量为 810k 小时的商业采购数据,覆盖上述 10 个语种。翻译数据总量为 434k 小时,覆盖中英、日英、德英、法英、西英、意英、俄英以及英中、英日、英德等方向,来源包括 CoVoST2、TED-LIUM、MuST-C 等开源集、用识别转写翻译构造的数据,以及 48k 小时商业采购。原文没有给出每语种小时数的细分,也没有给出采样比例与去重规则,这是复现时需要补记的缺项,不能从模型名称推定。
PART 的三阶段全景如何分工?
PART 的核心判断是多语多任务同时对齐太难,应该把语内对齐与多语对齐分开。第一和第二阶段只用多语识别数据做跨模态对齐,第 3 阶段在模态已对齐的基础上同时用识别与翻译数据做跨语任务微调,以更好地利用大语言模型的多语能力。参数激活策略是任务依赖的:语内阶段冻结大语言模型,多语阶段再自适应放开。
语内对齐 × 跨语对齐: 语内对齐指在 ASR 单语任务上让音频与同语种转写文本对齐,输入输出语言一致;跨语对齐指在 S2TT 任务上让源语语音与目标语文本对齐,需要跨语言转换。搭配理由是若一开始就混训,音频表示会在特征空间过度收敛、丢失细粒度多语差异,组合意义是 PART 把两者分离到不同阶段,先稳定模态桥,再利用大语言模型做跨语迁移。
下图对比了传统做法与本文做法的训练流程,左侧为混合训练,右侧三列对应渐进阶段的数据与模块激活状态,是理解分工的关键。
看图路径: 1. 先沿底部 ASR 数据与语音翻译数据的色条走向,确认输入到音频编码器的主路径;2. 再对比左侧传统做法与右侧三列中提示框与火焰图标的出现位置,判断哪一阶段解冻了哪些模块;3. 最后追踪从输入投影器经大语言模型到顶部输出框的回环箭头,确认对齐信号的流向
论文图 1。原论文 Figure 1:“Our proposed training recipe v.s. traditional training approach”。
从像素可见,图下方用蓝色单色条表示识别数据、用多色拼接条表示语音翻译数据,箭头自下而上经过音频编码器、输入投影器、提示框和大语言模型到达顶部输出框。右侧三列中火焰图标标记了当前阶段可训练的模块,提示框只在后两列出现,说明指令理解是在后期引入的。顶部输出框分别为识别输出与翻译输出,与底部数据类型对应。这种画法支持论文的分工叙述:先用识别数据稳定语音到文本的桥,再用翻译数据调动大语言模型。论文还报告这种分工保留了语言特异性,同时增强了复杂多语任务,没有声称解决了所有口音或噪声条件。
编码器、适配器和大语言模型各自算什么?
按论文交代,模型细节是:语音编码器用 SenseVoice-large 编码器初始化,规模约 700M;大语言模型基于 Qwen2.5 并事先做了多语继续预训练,实验用 1.5B 和 7B 两个尺寸,对应 PART-2B 和 PART-8B;适配器由两层 Transformer 加一层 CNN 组成,随机初始化且未经预训练。计算流程是:波形经特征提取得到对数梅尔谱,再经编码器得到语言学表示,再经适配器得到对齐特征,再与指令标记嵌入拼接送入大语言模型生成。
语音编码器 × 大语言模型: 语音编码器负责把对数梅尔谱变换后的声学变化映射为语言内语义表示,保留语速、口音和语种差异;大语言模型负责利用其多语建模能力做跨语理解与生成。搭配理由是前者擅长细粒度声学区分、后者擅长跨语迁移,组合意义在于前 2 阶段冻结大语言模型让编码器先对齐,后 1 阶段再放开大语言模型做任务对齐,形成分工。
适配器 × 语义空间对齐: 适配器是由两层 Transformer 加一层 CNN 组成的轻量投影模块,负责把编码器输出的语言学表示投影到大语言模型的嵌入空间;语义空间对齐指让同语种语音特征与对应文本表示在语义上可拼接输入。搭配原因是适配器随机初始化、容量小,适合先做粗粒度跨模态桥接,组合意义是为后续解冻编码器提供稳定的起点,避免一开始就扰动预训练编码器和大语言模型。
沿一个样本走一遍有助于记忆。假设输入一段德语朗读,先算对数梅尔谱,再经编码器得到保留德语发音细节的向量序列,再经适配器投影到大语言模型能接受的维度并拼接上翻译或转写指令的嵌入,最后由大语言模型逐词生成。第 1 阶段只调适配器做粗对齐,第二阶段逐步放开编码器做精对齐,第 3 阶段连同大语言模型一起联合优化,以应对语音与文本长度不一致和语速变化带来的粒度失配。原文未报告适配器隐藏维度、卷积下采样倍数与学习率等超参数,这些是复现缺项。
三个阶段具体冻结谁、用什么数据?
第 1 阶段称为仅适配器语内对齐。语音编码器与大语言模型都已在大规模数据上预训练,因此只在单语识别数据上微调适配器,做初始粗粒度对齐,为后续联合优化提供起点。此时梯度只更新适配器参数。
第二阶段称为语内对齐下的编码器渐进解冻。在适配器已调好的基础上,为弥补其轻量设计容量不足,逐步解冻语音编码器并与适配器联合优化。具体是两步:先解冻编码器最后 8 层与适配器一起微调,再激活整个编码器做全网优化,且继续只用多语识别数据集。论文把渐进激活的对比放在第 4.2 节讨论。
第 3 阶段称为带大语言模型自适应的联合优化。当前 2 阶段已让语音特征与对应语种文本表示在语义空间对齐后,引入跨语任务以利用大语言模型的多语能力。此时解冻大语言模型,对编码器、适配器和大语言模型三者一起联合优化,数据为识别加翻译的混合。论文的解释是语音与文本粒度无法严格匹配,需要模型的鲁棒性来吸收差异。
渐进解冻 × 任务依赖激活: 渐进解冻指先只训适配器,再解冻编码器后 8 层,最后解冻整个编码器;任务依赖激活指在语内 ASR 阶段冻结大语言模型、在多语多任务阶段用 LoRA 方式激活大语言模型。搭配原因是编码器需要逐步增加容量而不破坏预训练,大语言模型只在需要跨语生成时才介入,组合意义是让编码器专注语义映射、大语言模型专注多语指令理解,各自发挥所长。
需要如实说明,论文在消融中提到第 3 阶段的大语言模型采用 LoRA 方式的轻量适配,但方法主文只写解冻大语言模型并联合优化,没有给出 LoRA 秩、目标模块与学习率,复现时只能先按全参联合或常见 LoRA 默认去试,并记录差异。训练预算按证据为 256 张 A800 训练 3 个轮次,推理用贪心解码。
在哪些数据上测,用什么指标,哪边是好?
评测按问题组织为两类。识别在 Fleurs 和 Common Voice 15 上测,领域分别为维基百科朗读和众包语音,语言均为上述 10 个语种。对中文、日文、韩文和粤语报告字错率,其余语言报告词错率,且在计算前应用 Whisper 归一器。翻译主要在 CoVoST2 上测,该集构建于 Common Voice,方向为 7 个非英语源到英语,用 BLEU 评测,英文分词用 13a。指标方向是识别错率越低越好,翻译 BLEU 越高越好。
公平条件方面,论文设置了同尺寸同数据预算的 Baseline-2stage,用于隔离渐进策略的收益;与其他外部模型的比较则数据与规模不一致,只能作参考。数据划分与采样细节在证据中未完整交代,开源集版本与商业数据的切分、翻译构造数据的质量过滤、每阶段轮次分配均未报告。硬件预算只给了卡数与轮次,没有给出总时长与显存占用。统计显著性与多次随机种子也未报告,因此平均值的微小差异应谨慎解读。
主结果在识别与翻译上各赢了多少?
先提出比较问题:在控制尺寸与数据预算时,渐进对齐是否同时改善识别与翻译,以及与同量级公开模型相比处于什么位置。公平条件是 PART 与 Baseline-2stage 同为 2B 量级且同数据预算,指标方向为识别错率越低越好、翻译 BLEU 越高越好。
下表整理论文直接报告的平均值改进,不展开每语种明细,避免把不同指标混在同一模型列下比较。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| Fleurs 识别平均 | 平均 WER | 6.4 | 4.7 | PART 相对 Baseline-2stage |
| Common Voice 15 识别平均 | 平均 WER | 9.2 | 7.4 | PART 相对 Baseline-2stage |
| Fleurs 识别平均 | 平均 WER | 6.0 | 4.7 | PART-2B 相对 Whisper-large-v3 |
| CoVoST2 七方向翻译平均 | 平均 BLEU | 基线加 1.4 | PART 更高 1.4 | PART 相对 Baseline-2stage |
上表显示,在同预算下 PART 把 Fleurs 平均错率从 6.4 降到 4.7,相对下降 26.6%,把 Common Voice 15 平均错率从 9.2 降到 7.4,相对下降 19.6%;同尺寸下 PART-2B 比 Whisper-large-v3 在 Fleurs 低 1.3 个点;翻译上 PART 比 Baseline-2stage 平均高 1.4 个 BLEU。论文还报告 PART-8B 在可比规模基线中错率最低、翻译有竞争力,但外部比较的数据条件不一致,不能读作确定性超越。未胜出项方面,原文表格显示部分语种上 MinMo 或 Qwen 系列仍有更好单点,说明总体趋势不等于每语种都成立。
看图路径: 1. 先确认三个阶段热力图的横纵轴为 ASR 与 S2TT 任务的语言方向,颜色条从蓝到红表示余弦相似度;2. 再对比阶段一到阶段三对角线深红格的保持情况与非对角浅红区域的扩展,判断语内融合趋势;3. 最后观察下半部分 S2TT 行与上半部分 ASR 列的交叉块,确认跨任务相似度的阶段性变化
论文图 2。原论文 Figure 3:“Gradient cosine similarity matrices across the three training stages of PART. The 2×2 panel visualizes the evolution of task-level alignment between ASR and S2TT tasks.”。
该梯度余弦相似度热力图用于从机制上佐证对齐过程。像素显示阶段一左上对角深红、其余偏灰蓝,阶段二、三非对角浅红区域扩大,但对角仍最深;下半部分翻译任务行与上半部分识别列的交叉块随阶段变红,但最右侧列仍偏蓝。论文的解读是识别任务内不同语言的梯度相似度随训练稳步增强,说明语音表示在融合,而翻译与识别的交互呈阶段依赖,语言边界依然可辨。这支持渐进策略有序组织了迁移梯度,但相关性不是因果,且像素无法精确读出每格数值,不宜硬写具体步数。
为进一步看翻译增益是否覆盖多个方向,下表对比同尺寸基线与 PART 在 CoVoST27 个英译方向上的部分语言点与平均值,列间均为原文直接报告的 BLEU 值,不做跨指标换算。
| 翻译方向 | Baseline-2stage BLEU | PART-2B BLEU | PART-8B BLEU | MinMo BLEU |
|---|---|---|---|---|
| zh→en | 21.5 | 23.2 | 27.0 | 26.0 |
| ja→en | 23.2 | 26.8 | 30.0 | 28.9 |
| 七方向平均 Avg | 34.0 | 35.4 | 39.1 | 38.4 |
该表显示所选两方向与平均值上 PART-2B 均高于同尺寸 Baseline-2stage,且 PART-8B 在平均值上仍保持竞争力;但 MinMo 在部分单点上数值更高,说明翻译增益是多方向平均趋势,不能读作每个方向都全面领先,外部数据条件差异也限制了跨规模直接排名。
拿掉分阶段、LoRA 和渐进解冻会怎样?
消融以 PART 为基准,做 3 步累积式移除。第一步去掉分阶段的识别到翻译调度,改为 3 阶段全程识别加翻译联合训练;第二步在此基础上再关掉大语言模型的 LoRA 微调;第 3 步再去掉编码器渐进解冻,改为训好投影后直接解冻整个编码器。报告方式是相对 PART 的增量,识别用错率增量、翻译用 BLEU 增量,正值表示比 PART 更好,负值表示退化。 下图展示了各语种与平均列上的增量柱,是判断代价分布的关键。
看图路径: 1. 先看上方面板 ASR 增量与下面板 S2TT 增量的纵轴定义,确认高于零为相对 PART 的改善;2. 再按红黄绿三色图例区分三种累积式消融,重点观察平均列上黄绿柱的下探幅度;3. 最后定位德语与日英等异常长的柱子,判断单语种代价与平均趋势是否一致
论文图 3。原论文 Figure 2:“Ablation deltas relative to PART on ASR WER (top) and S2TT BLEU (down).”。
从像素可见,上方面板纵轴为相对 PART 的识别改善量,绝大多数柱为负,仅韩语红色柱略为正;德语黄色柱下探最深,黄绿平均柱明显为负。下方面板纵轴为翻译改善量,几乎全为负,日英方向的绿柱下探最深。论文报告的平均值是去掉分阶段调度导致识别退化 0.4、翻译退化 0.3 个 BLEU;再关掉 LoRA 后累计退化到识别 1.6、翻译 1.1。
再去掉渐进解冻后翻译进一步到 1.4 而识别保持 1.6。这支持先用识别稳定对齐、再用轻量大语言模型适配提升生成质量、渐进解冻尤其帮助翻译的判断。反例是韩语在第一步消融中出现正增量,说明单语种上分阶段并非处处最优,也提示平均值掩盖了语种差异。原文未报告方差与显著性,单语种异常不宜过度解读。
哪些边界没有测,哪些结论不能推?
首先是数据与协议边界。训练依赖 810k 小时识别与 434k 小时翻译的混合,其中商业数据占比大、开源构造数据的翻译质量与过滤规则未交代,复现者无法用公开数据直接对齐。其次是评测边界,识别只在朗读与众包两类域上测,没有报告噪声、远场、口音与自发对话条件;翻译只报告到英语方向,没有报告英到中、日、德等方向的多语生成能力。
其次是成本与统计边界。论文给了 256 卡 3 轮训练但未给时长、显存与推理延迟,错率与 BLEU 的改善不能推定为延迟或成本改善。自动指标不能当作人工评价,BLEU 的提升不等于流畅度与忠实度同等提升。百分点与相对百分比不同,26.6% 是相对下降,1.3 个点是绝对差值,不能混用。
最后是机制解释的限度。梯度余弦相似度分析显示了阶段性变化,支持对齐有序组织的说法,但属于有限解释,不是拿掉某阶段必然失败的证明。语言边界可辨不等于每语种表示都保留了可用的细粒度特征,还需补探针或错误分析来验证。
要复现先做什么,需要补哪些验证?
值得尝试的时机是当你有多语识别数据充足但翻译数据有限,且已有预训练语音编码器与多语大语言模型,希望先稳定模态桥再做跨语迁移时。复现第一步是按论文结构搭出编码器加适配器加大语言模型:编码器用多语预训练权重初始化,适配器随机初始化为两层 Transformer 加一层 CNN,大语言模型选用已做过多语继续预训练的版本。
第二步是严格执行数据与冻结调度:第 1 阶段只用识别数据训适配器,第二阶段先放开编码器后 8 层再放开全部且仍只用识别数据,第 3 阶段混入翻译数据并以轻量方式适配大语言模型。评测先复现 Fleurs 与 Common Voice 15 的识别平均值与 CoVoST2 到英语的 BLEU 平均值,再看每语种明细,避免只看平均。
还需补的验证包括每语种数据量与采样比、LoRA 秩与目标模块、学习率与每阶段轮次、Whisper 归一器的具体应用位置、BLEU 的 13a 分词版本,以及多次种子的方差。代码与权重方面,论文脚注提供了链接,但本次未验证可达,不应视为已公开可运行,复现应先记录所用权重版本与数据哈希。
一句话收束:分开对齐换来了什么?
回到中心矛盾:一次性混训省事但会抹平语种差异,分阶段费事但能保住区分度。PART 的选择是用时间换空间,先让编码器在单语任务上学会听准,再让大语言模型在跨语任务上学会转换。最强证据是同预算下识别与翻译平均值的同步改善,以及消融中关掉任一组件都带来可测退化。主要代价是数据规模大、训练阶段多、超参数与统计细节报告不全,迁移到新语种或新领域前需要补验证。
对研究生而言,可带走的方法是任务依赖的激活思想:容量小的桥先调,预训练强的模块后动,需要跨语生成时再调动大语言模型。复述时沿样本走完谱特征到编码器到适配器到指令拼接到生成,再说清 3 阶段的数据与冻结变化,最后用平均值加语种反例来限定结论,就能做到可核对而不夸大。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


