英文题目:NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

会议身份:conference:iwslt:2026:conference-paper-id:2026.iwslt-1.17

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #多语言 #语音识别 #音频问答 #语音翻译

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Marcely Zanon Boito:机构信息未能从会议 PDF 纯文本可靠映射
  • Hemant Yadav:机构信息未能从会议 PDF 纯文本可靠映射
  • Jean-Luc Meunier:机构信息未能从会议 PDF 纯文本可靠映射
  • Ioan Calapodescu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理英语语音输入下的多语言指令跟随,输出涵盖英语转写、德语与意大利语及中文语音翻译和多语言语音问答,难点在于受限数据下同时保持转写精度、翻译质量和问答泛化并应对科学演讲领域偏移与突发指令。方法链分为三段:先用纯自动语音识别数据训练语音映射器 SpeechMapper,将 SeamlessM4T-v2-large 编码器特征映射到冻结大语言模型嵌入空间;再并行用机器翻译与问答文本训练低秩适配器 LoRA,以注入多语言生成能力;最后将两者装配并在语音加文本混合数据上做短程监督微调以对齐模态与指令格式。与上届直接前向投影器相比,新目标只用分词器与嵌入层即可训练,省去大语言模型前向并加入对比与连接时序分类约束以强化词级可分性。在 MCIF 评测中主提交语音翻译平均 COMET 达到 0.772,自动语音识别词错率为 12.0%,整体超过上届最优短赛道系统。该结论限于 IWSLT 2026 短赛道受限语料与科学演讲评测分布,对自发对话、噪声环境及未见语种的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 第三方资源:https://github.com/naver/bergen — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,哪些信息必须保留?

这篇论文处理英语语音输入加多语文本指令引导的语义任务。输入一端是连续英语讲话音频,另一端是写在用户提示中的任务说明,任务说明本身已是目标语言。输出要求按指令语言作答,具体包括 3 类:把英语语音转写为英语文本的识别,把英语语音翻译为德语与意大利语和中文的翻译,以及听英语语音并用 4 种语言之一回答问题的问答。

还有 1 个在测试时才公布的惊喜指令任务,目标语言为德语和中文,正式评测中体现为质量估计选择题形式。对于刚入门的读者,关键是理解必须保留什么信息。识别必须保留逐词内容完整性,不能改写或扩写。翻译必须保留源语义并符合目标语言表达。问答必须只依据语音内容作答,当问题与语音无关时应识别为不可答。

指令语言与答案语言要求一致,这个设计是为了减少识别与翻译之间的任务混淆。整个系统允许使用的基础模型受到约束:语音侧使用多语多模态模型的语音编码器,文本侧使用 4 B 规模的指令微调语言模型。从复现角度看,输入输出组织形式同样重要。语音任务提示由语音前缀加任务问题加公共后缀构成,文本任务则由文本前缀加任务问题加后缀构成。

与哪些同输入同目标的工作对照,类别差异在哪里?

在语音加语言模型路线上,已有工作分别面向语义任务和声学任务。论文把自身定位为语义助手,直接从语音完成转写与翻译和问答,而不是生成语音波形或处理说话人声学特性。基准层面最直接的对照是第 2 届指令跟随语音处理评测,它提供统一的多任务与多语指令测试,要求同一模型按指令切换任务。

另一个必须对照的是作者团队上一年在同一短赛道的提交。该提交在上届排名第 1,同样采用多阶段训练管线,先分别训练语音投影器和文本低秩分支,再做短多模态联合适配。今年约束发生变化,语言模型主体变得更小且更弱,因此不能直接沿用去年轻量投影器。论文报告复现去年管线时纯投影器模式的词错率超过 200%,作者把原因归于更小的嵌入维度需要更高的映射精度。

与语音映射器本身相关的对照是同期提出的原始语音映射器方法。原始方法的特点是训练时只需要语言模型的分词器和嵌入层,不需要做语言模型前向传播,因此语言模型规模不再显著增加训练显存。论文沿用这一思想但修改训练目标和卷积步长,并增加中间层的分类头。这种对照属于同输入同目标下的组件替换,而不是把不同任务类别的优劣直接当成胜负。

为什么小语言模型让语音投影变得更难?

问题可拆成 2 个相互牵制的部分。第 1 是语音表示为连续帧序列,长度远大于目标文本词元序列,模型必须同时解决模态映射和长度对齐。第 2 是文本任务能力需覆盖德语与意大利语和中文的翻译问答,而今年语言模型主体参数量约为去年的一半,论文报告其在意大利语上尤其弱。

沿 1 个样本走一遍有助于理解依赖关系。以 1 段英语演讲为例,先经冻结语音编码器得到帧级表示,相邻 2 帧取平均以缩短序列,再送入可训练语音映射器,得到与语言模型输入嵌入同维度的语义嵌入。用户提示中的目标语言问题经词嵌入层转为文本嵌入,2 者在用户轮中拼接后送入带低秩分支的冻结语言模型。监督来自配对的转写与译文或问答参考,训练损失只作用于需要生成的部分。

教学上可把难点记成 1 句话:投影器负责把语音变得像语言模型能读懂的词嵌入,适配器负责让语言模型愿意按多语指令输出,而小嵌入空间放大了投影噪声对生成的影响。论文还观察到多任务之间的权衡,提升识别往往损害问答,反之亦然,因此最终只能按问答优先原则选模型。这意味着不存在 1 组参数在所有任务上同时最优,选型标准本身就是方法的一部分。

3 段式管线如何分工,又在何处汇合?

整体管线分为并行的 2 路训练加 1 次短联合适配。第 1 路训练语音到嵌入的投影器,只用识别数据。第 2 路在冻结语言模型上训练文本低秩分支,只用文本翻译和文本问答数据。第 3 路把 2 个模块重新装回同一系统,在语音和文本混合数据上做短时间指令微调。

语音基础模型和语言模型主体在全程冻结,可训练的是投影器和低秩权重,这种划分是为了控制显存并保留基础能力。下图把 3 列的汇合关系画得很清楚,阅读时应先看数据从下往上走的主路径,再看冻结与可训练标记。

看图路径: 1. 先从底部任务框向上看 3 列的数据流向;2. 再对照左下图例区分圆形语音模态与五边形文本模态;3. 再核对火焰可训练与雪花冻结标记落在哪些模块;4. 最后看 C 列中语音映射器输出如何与文本分支汇合进入语言模型

原论文 Figure 1:Our training pipeline. A speech projector (SpeechMapper) (A) and text LoRA adapters (B) are…

论文图 1。原论文 Figure 1:“Our training pipeline. A speech projector (SpeechMapper) (A) and text LoRA adapters (B) are trained in parallel using ASR and text-to-text data, respectively.”。

图中左侧蓝色框是语音映射器训练,底部识别数据经冻结语音基础模型进入可训练映射器。中间绿色框是低秩分支训练,底部翻译和问答数据同时进入冻结语言模型和可训练低秩分支。右侧紫色框是多模态训练,底部同时有文本翻译问答和语音识别翻译问答,语音支路经过语音基础模型和语音映射器后再与文本前后缀拼接进入语言模型。左下图例说明圆形为语音模态与五边形为文本模态,火焰为可训练与雪花为冻结。可见的动作是语音通路始终经过同一投影器,文本能力始终由同一低秩分支提供,联合阶段才让 2 者在同一前向中相遇。

语音映射器把语音变成什么,4 个损失各管什么?

语音映射器的白话含义是语音到语言模型嵌入空间的投影器。英文名为 SpeechMapper,结构上包含 2 个连续块,每块由卷积与多个自注意力层和向更高维的前馈投影构成。为了在第 1 块末端接分类头,作者把 2 块卷积步长由原来的每块 2 改为第 1 块 1 与第 2 块 4。输入是冻结语音编码器最后一层表示并做 2 帧平均,输出维度与所用语言模型嵌入维度对齐。

语音基础模型 × 大语言模型: 语音基础模型分工是把英语语音编码为连续帧表示,大语言模型分工是按目标语言指令生成转写译文或答案,搭配理由是前者保留语音内容而后者提供多语指令跟随能力,组合意义是用投影器把连续语音表示映射到语言模型输入嵌入空间从而让同一模型处理多任务。

语音映射器 × 低秩适配器: 语音映射器分工是学习语音到文本嵌入的模态对齐,低秩适配器分工是在冻结大语言模型上学习文本翻译和问答任务能力,搭配理由是 2 者可并行训练且不改动主模型参数,组合意义是在最后的短多模态阶段把语音通路和文本任务能力接在同一前向中。

自动语音识别 × 连接时序分类损失: 自动语音识别分工是提供语音与转写文本的配对监督,连接时序分类损失分工是在映射器中间层提供时序对齐约束,搭配理由是语音序列远长于文本序列需要显式长度与对齐信号,组合意义是让最终输出在语义嵌入之外隐式携带序列长度信息并稳定训练。

训练目标由 4 个损失加权求和。第 1 是逐元素的绝对值对齐损失,直接拉近语音嵌入与目标文本嵌入。第 2 是余弦相似度损失,鼓励角度方向一致。第 3 是词表级归一化对比损失,对每个语音位置计算与全部词嵌入的余弦相似度作为得分,以正确词元为正类做交叉熵。第 4 是在中间层加的连接时序分类损失,用于稳定训练和提升输出嵌入质量。

目标文本序列不足语音长度的部分用语言模型的保留填充词元补齐,模型输出因此是前段语义嵌入加后段填充嵌入,隐式携带长度信息。论文说明该训练只需要分词器和嵌入层,不需要语言模型前向,从而显著降低计算和硬件需求。实验设置中自注意力层数为 6,维度分别取 1024 与 2048 和 2560,低秩分支的秩为 8。

数据如何构造,采样和提示如何操作?

训练数据覆盖约束集中的全部可用数据,包括语音翻译语料与议会演讲语料和大规模伪翻译语料和基于有声书的问答语料,并用语音基础模型的机器翻译能力合成缺失目标语言。凡是从英语文本合成翻译的情形,都经过免参考质量估计模型过滤,只保留打分不低于 0.85 的样本。识别切分通过合并已有语言切分并按音频去重得到,翻译切分通过把译文与英语语音和参考转写对齐得到。

语音翻译 × 文本翻译: 语音翻译分工是以语音为输入生成目标语言文本,文本翻译分工是以转写文本为输入生成目标语言文本,搭配理由是 2 者共享相同的目标语言映射关系,组合意义是在多模态训练中交替采样语音批次和对应文本批次以稳定目标语言生成。

口语问答 × 无效问答: 口语问答分工是根据语音内容回答可回答问题,无效问答分工是训练模型在问题与语音无关时不编造,搭配理由是只有可回答样本会让模型过度猜测,组合意义是用不匹配的语音与问题对教会模型区分可答与不可答。

有声书问答分为直接问答和与之对应的单选题。单选题原始答案只有 1 个字母,参与损失的词元太少,作者把目标扩展为字母加完整选项文本。多语问答把英语问题答案翻译到 3 个目标语言,直接问答只保留问题和答案翻译都过质量阈值的样本。单选题则翻译问题和选项并用解析器剔除选项结构被破坏的样本,同时通过对齐恢复正确选项。

作者还用转写与问题的语义相似度构造不匹配对,先随机打乱配对再用句子向量算余弦相似度,只保留相似度不大于 0.1 的低相似对,得到直接问答 48346 对和单选题 58682 对。另用语言模型生成 62040 个英语通用无效问题,经同样翻译过滤后随机配语音。为缩小训练与评测的领域差距,作者构造合成科学演讲数据集,先让语言模型列出 56 个子领域,再生成 2527 个论文标题,然后为每个标题写 12 句口头报告脚本。脚本按 2 句到 3 句分块,用语音合成得到平均约 8.6 s 的语音,每段配 2 个基于内容生成的极短问答,最终得到 38968 个问题。

用什么基线指标和解码条件比较才算公平?

实验设置需要先讲清比较对象和度量方向。基线包括语音基础模型自身的识别与翻译,以及所用语言模型的零样本翻译问答,还有上届短赛道最优系统,以及加上文本低秩分支后的语言模型。评价指标按任务区分:识别用词错率,越低越好。翻译用基于神经网络的翻译质量分,越高越好。问答用基于大模型裁判的是否正确判断,报告 3 个裁判模型的平均准确率。

最终模型选择另用科学演讲多语指令基准,该基准包含识别与翻译和多语问答,更接近评测领域。推理统一用贪心解码,批量为 1,最多生成 100 个新词元,所有实验一致。语音表示取自语音编码器第 24 层即最后一层,并做 2 帧平均而非去年的 3 帧平均。文本低秩作用于全部层的注意力查询键值输出投影和前馈模块。

联合训练的任务采样比为识别 0.3 与翻译 0.4 和问答 0.3,翻译语言比为德语与意大利语和中文取 0.4 与 0.4 和 0.2。验证用议会与通用语音翻译和有声书问答的验证集,最终选型用科学演讲多语指令基准。训练预算方面,投影器训练 500000 步,低秩训练 30000 步,联合训练 3000 步,硬件为 80 GB 显存的 A100。资源状态需要如实交代,本次收到的第三方代码链接在本次读取中暂时不可达,只能写本次未能确认可达。

主结果测了什么,谁在什么条件下更好?

主结果要回答 3 个问题:识别能否保住,翻译是否跟上,问答是否提升。比较必须保留实际可运行的策略,包括纯投影器与上届最优系统和 2 种多模态联合配置。指标方向是识别词错率越低越好,翻译质量分越高越好,问答准确率越高越好。下表先看科学演讲多语指令基准上的平均分,它是最终选型的依据,最后一列为关键控制变量。

模型条件识别词错率越低越好翻译质量分越高越好问答准确率越高越好关键控制变量与成本说明
上届最优系统12.60.7430.417去年大语言模型加轻量投影器
纯语音映射器32.20.7110.225只用识别数据训练未做联合
联合配置 112.00.7720.428问答优先选型的主要提交
联合配置 210.50.7810.400识别翻译更强但问答回落

联合配置 1 在该基准上识别为 12.0,翻译为 0.772,问答为 0.428,问答最好且识别优于上届的 12.6。联合配置 2 识别为 10.5 与翻译为 0.781,但问答回落到 0.400,不如配置 1。纯投影器识别高达 32.2,问答仅 0.225,报告显示它在命名实体和跨域条件下处理较差。

论文因此优先保证问答而选择配置 1 作为主要提交,并在另一处报告配置 2 在识别和翻译上更强。另一组证据来自通用测试切分的加权平均,论文报告联合模型能追平上届系统,尽管语言模型更小。文本侧低秩训练大幅改善弱语言模型的翻译问答,但零样本小模型本身对输入嵌入噪声敏感,会出现改写转写与回答冗长等问题。重提结果时要加新对照:通用切分上的追平不等于跨域科学演讲上的全面最优,选型基准与通用基准方向并不完全一致。

哪些对照说明改进来源,失败条件是什么?

论文没有给出逐个去掉损失项的完整消融表,但提供多组可比对照来支撑判断。第 1 组是投影器替换的动机对照:复现去年轻量投影器在今年小嵌入空间下表现很差,而更大容量语音映射器在域内设置下可用。第 2 组是文本低秩对照:同一语言模型加上低秩权重后,翻译与问答在通用切分上明显改善。第 3 组是联合配置 1 与配置 2 的对照:不同的数据组合与低秩学习率导致识别翻译与问答的此消彼长。

失败条件同样明确。纯投影器加零样本小模型的解码常出现改写与冗长和命名实体幻觉,论文用示例展示把人名拼错与把议会发言改写等行为。这些行为会直接损害词错率和裁判评分。另一类失败是跨域:纯投影器在科学演讲基准上明显弱于联合模型,说明仅靠识别数据训练的投影器不足以覆盖科学演讲词汇。正式比赛结果进一步验证上述权衡,下表为官方结果中德语与中文和英语行的关键数字。

提交系统与语言翻译质量分越高越好问答语义分越高越好质量估计准确率越高越好格式准确率越高越好与识别说明
主要提交德语0.7650.4700.7860.997 识别未报告
主要提交中文0.7940.4870.8941.000 识别未报告
对照上届系统德语0.7490.4620.3330.005 识别未报告
对照上届系统中文0.7550.4660.5000.014 识别未报告
主要提交英语未适用0.531未适用识别词错率 0.136

官方结果报告主要提交在翻译各语言上优于上届对照,问答除意大利语外也有提升,但英语识别词错率落后 0.2 个百分点。最鲜明的反例是惊喜质量估计任务:主要提交因训练过单选题而能遵守选项格式,德语格式准确率 0.997 与中文为 1.000,而上届对照格式准确率仅 0.005 和 0.014。这说明格式跟随能力来自明确的单选题训练,而非模型规模本身。

证据的边界在哪里,哪些结论不能推广?

首先是语言覆盖的不均衡。论文明确指出语言模型在意大利语上特别弱,联合训练为此上采样意大利语,但官方结果中意大利语问答仍是主要提交弱于上届对照的语言。这说明上采样缓解了翻译,但没有完全补齐问答所需的知识与表达,不能把整体平均提升推广为每种语言都提升。

其次是任务权衡没有被消除。2 个联合配置分别在问答和识别翻译上占优,论文原话是提升 1 个任务常以损害另一个为代价。因此总体趋势不等于每组都成立,选模型时必须先定优先级。论文把问答作为首要标准,这是 1 个任务选择假设,换成识别优先会得到不同结论。

再次是测量范围的缺项。证据中没有报告误判率与延迟的系统测量,没有给出投影器与低秩分支在推理时的额外开销分解,也没有报告输出帧率与实际延迟的关系。训练预算只给出步数与批量和显存与大致小时数,不能据此推定推理成本下降。合成数据的质量控制依赖机器翻译打分阈值和人工抽查,但论文未报告合成语音的词错率或问答对的幻觉率,相关性不能当成因果。

要复现应先做什么,哪些参数必须原样保留?

复现的第 1 步是按原文重建数据切分与过滤,而不是先调模型。需要准备通用语音翻译与议会演讲和大规模伪翻译和有声书问答 4 类数据,对合成翻译统一用免参考质量估计过滤并保留不低于 0.85 的样本。单选题答案必须扩展为字母加完整选项文本,无效问答需同时保留语义相似度构造的不匹配对和语言模型生成的通用无效问题。

合成科学演讲数据需保留脚本生成与分句清洗和语音合成问答生成的 3 段流程,首尾寒暄句在问答生成前丢弃,问答输出按前缀自动过滤后再人工剔除明显幻觉。第 2 步是按冻结与更新划分搭建模型。语音编码器取最后一层并做 2 帧平均,语言模型主体冻结,只训练语音映射器和低秩分支。

语音映射器用 2 块卷积加自注意力结构,卷积步长为 1 和 4,自注意力 6 层,维度分别取 1024 与 2048 和 2560。低秩作用于全部层的注意力与前馈模块,秩为 8,缩放为 16,不用丢弃。联合训练时学习率要分开设置,映射器与低秩使用不同的调度器和优化器状态。第 3 步是按原文采样与解码跑通流程。训练先按任务级比例采样再按领域切分采样,多模态阶段以语音定周期大小并交替采样对应文本批次。推理用贪心解码与批量 1 和最多 100 个新词元。

何时值得尝试这条路线,还需补哪项验证?

当约束只允许小语言模型而任务又要求多语指令跟随,这条路线值得尝试。它的核心是用大容量投影器弥补小嵌入空间的精度损失,用文本低秩分支补齐弱语言的多语生成,再用短联合阶段让 2 路对齐。合成科学演讲数据的价值在于领域词汇和问答风格更接近评测,而不是简单增加时长。如果评测领域本就是有声书或通用演讲,这部分收益可能缩小。

复现时最容易误解的是把投影器当成识别器。投影器输出的不是词,而是语言模型可读的嵌入,识别能力要在接到语言模型后才显现,单独看中间嵌入无法直接评分。另一个误解是把翻译质量分与问答裁判分混为一谈,前者衡量译文与参考的语义接近,后者衡量答案是否正确,数值相同也不是同一指标。百分点与相对百分比也不同,论文报告的 0.2 个百分点落后与百分之多少提升不可直接换算。

还需补的验证包括 3 项。第 1 是对意大利语问答单独做错误分析,区分是语音映射与语言知识还是裁判偏差导致。第 2 是对合成问答做幻觉率抽检,给出可答与不可答的混淆矩阵,而不是只报告平均准确率。第 3 是报告推理延迟与显存占用随音频时长的变化,确认投影器容量增加带来的是否为可接受的部署代价。只有补齐这些,才能把当前平均分上的追平转化为可部署的结论。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 4 页

区域 1 · 查看论文原页

另有 9 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 iwslt-2026 论文汇总