英文题目:BSC’s Submission to the Instruction Following Track of IWSLT 2026

会议身份:conference:iwslt:2026:conference-paper-id:2026.iwslt-1.19

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#指令微调 #多语言 #语音识别 #音频问答 #语音翻译

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Oriol Pareras:机构信息未能从会议 PDF 纯文本可靠映射
  • Joan Llado:机构信息未能从会议 PDF 纯文本可靠映射
  • Pol Buitrago:机构信息未能从会议 PDF 纯文本可靠映射
  • Marc Casals-Salvador:机构信息未能从会议 PDF 纯文本可靠映射
  • Federico Costa:机构信息未能从会议 PDF 纯文本可靠映射
  • Cristina Espana-Bonet:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作面向英语语音输入与英中意德指令下的统一口语理解,需同时完成自动语音识别、语音翻译、语音问答与未知惊喜任务并严格遵从输出格式。系统先以语音编码器加线性映射将音频嵌入翻译专用大语言模型,再强制模型先输出转写思考块后生成答案,使语音与纯文本共享同一推理路径。纯文本问答与翻译数据以伪转写形式混入训练,配合多语言多样化提示模板实现跨模态能力迁移。推理时先用五束搜索解码并剥离思考块,再以大模型后编辑校正格式不一致。相比直接端到端映射,显式转写分解降低了声学到语义的跨度并复用了文本监督,因而在翻译与问答上更稳健。在IWSLT 2025测试集下,SEAMLESS模型加后编辑的COMET为0.78,高于Phi4-Multimodal的COMET 0.77。该结论适用边界受限于科学演讲域与四个目标语言,且主力模型仅完成约0.8轮训练,惊喜任务泛化尚未验证并依赖后编辑校正。训练成本涉及在32卡定制H100硬件上以全局批量256进行最长2048序列的混合精度训练,推理开销包含五束搜索与后编辑带来的额外延迟。

🔗 开源与复现资源

🧭 深度解读

输入是什么,系统要输出什么?

这篇论文要解决的输入很具体:一段英文语音,加上用英文、中文、意大利文或德文写成的自然语言指令。输出必须用指令对应的语言写成,且任务类型由指令临时决定。举例来说,同样一段英文讲座录音,指令可能是转写成英文,也可能是翻译成德文,还可能是根据语音内容用意大利文回答问题。到了正式评测,还会出现事先不公开细节的惊喜任务,用来检验模型是不是真的在跟随指令,而不是背住了某几种固定题型。

对刚进入语音和语言领域的研究生来说,关键是理解为什么这比单个任务更难。自动语音识别只管听准,语音到文本翻译要听准再翻准,语音问答还要在听懂长上下文后推理作答。如果为每个任务各训练一个模型,每个模型只见过一种输入输出格式,换一句指令措辞就可能失效。而统一系统的目标是只用一个端到端模型同时处理这 3 类任务,并能泛化到没见过的第四类格式。这就要求训练时既要给语音数据,也要给纯文本数据,还要用多样的提示模板防止模型记住表面措辞。

论文选择了无约束条件,允许使用任意模型和数据。作者明确说采用基于语音编码器加大型语言模型的端到端架构,主干是一个为文本到文本翻译调优过的大模型,并在语音任务和纯文本任务上继续微调。评估沿用前一年的测试集做开发验证,指标分别是识别用词错率、问答用语义相似度、翻译用自动质量估计分数。理解这套输入目标和评估口径,是后面复述数据构造和训练安排的前提。

已有路线提供了哪些可复用的部件?

在相同输入和相近目标下,前人已经验证了几条路线。第一条是把语音基础模型和大语言模型用投影层连接起来的语音大模型做法,论文明确说跟随了类似思路,先用编码器把语音变成向量,再用线性层投到语言模型的嵌入空间。这种做法的好处是语音端和文本端可以分别借用预训练权重,不必从零学习声学和语言。

第二条是思维链提示用于语音翻译,做法是强迫模型先输出转写再输出翻译,原文引用了相关工作并指出这种分解能显著提升语音翻译性能。第三条是指令跟随评测本身,前一年已有基线和参赛系统,包括多模态基线以及约束和非约束条件下的多个提交,论文把它们直接拿来做比较对象。

同监督和同运行阶段的对照更有学习价值。在监督来源上,语音识别数据量大但多为英文,语音翻译数据只有约 1000 小时,语音问答数据则需要把文本问答改写并合成语音来扩充。在运行阶段上,所有系统都必须在推理时只看 1 次音频和指令就给出答案,不允许针对惊喜任务单独调参。因此论文的增量不是提出全新声学建模,而是把翻译能力强的主干、转写优先的生成顺序、多样化提示和后编辑格式修正组合起来,让文本监督能迁移到语音任务。

初学者容易把类别差异当成同条件胜负。例如约束条件系统只能用限定数据,非约束系统可以用任意数据,两者的数字不能直接证明架构优劣。论文在比较时保留了条件和提交名称的区分,阅读时要同时核对模型、条件、语言和指标,才能判断某次领先是数据优势还是方法优势。

为什么先转写再作答值得单独研究?

核心矛盾在于语音长度和指令多样性同时带来难度。英文语音通常持续数十秒,对应的声学帧数远多于文本词数,模型既要对齐又要理解。而指令可以用 4 种语言写成几十种措辞,模型如果只记住训练见过的句子,遇到新说法就会把翻译做成转写,或把问答做成翻译。论文假设把任务拆成两步会更容易:第一步只做听写,第二步在转写文本和原指令的基础上做翻译或回答。这样第二步退化成纯文本任务,可以直接吃进文本翻译和文本问答的大量监督。

举一个教学用的例子,不代表论文的真实数值。假设音频说的是关于论文作者数量的一句话,指令要求用德文回答作者人数。直接端到端模型要一步完成声学理解加跨语言回答,而拆分后模型先输出英文转写,再根据转写和德文指令生成德文回答。第二步与纯文本问答的形式完全一致,因此文本问答数据就能帮到语音问答。这种例子只是为了说明信息流向,实际效果必须看论文报告的词错率、语义分和翻译质量分。

另一个问题是格式合规。惊喜任务往往要求固定格式,例如判断题只允许输出特定标记。语音大模型在训练时没见过这种格式,即使内容答对也可能因多写一句话而被判错。论文因此在解码后加了一个只修格式的后编辑步骤,专门处理这类问题。理解内容正确和格式正确是两个不同层次,有助于后面解释为什么后编辑对翻译分数几乎无影响,却能提升问答和惊喜任务的格式准确率。

系统全景:一个样本如何走完输入到输出?

先沿着一个样本走完全程。输入是一段英文语音和一句自然语言指令。语音先进入语音编码器变成特征序列,再经过线性投影变成与语言模型嵌入维度 1 致的向量。指令文本经过分词器变成词嵌入。两部分拼接后一起送入骨干大语言模型。

模型先生成思考块,里面是音频转写,然后生成最终回答。最终回答还会经过一个独立的后编辑大模型,只做格式和指令符合性修正,不接触原始音频。整个链条中只有投影层是随机初始化后从头学习的,语音编码器按所选型号决定冻结还是微调,骨干大模型继续微调。

下面的系统示意图展示了上述 3 段式结构,阅读时重点看语音通路和文本通路在哪里汇合,以及思考块在生成顺序中的位置。

看图路径: 1. 先从左侧输入区找到语音编码器、线性投影与分词器的并行箭头;2. 再看底部骨干大模型向上生成思考转写再生成回答的顺序;3. 最后确认右侧后编辑大模型只作用于最终文本而不回流到语音端

原论文 Figure 1:System Diagram

论文图 1。原论文 Figure 1:“System Diagram”。

从图中可见,底部是骨干大语言模型,承担所有生成工作;左侧是语音编码器加嵌入的输入通路,负责把声音变成模型能读的向量;中部是带特殊开始和结束标记的思考转写区,构成了先听写后作答的顺序约束;顶部右侧是后编辑输出,只对文字结果做修正。这种安排的理由在原文中有明确交代:复用翻译导向主干的语言能力,用转写步骤桥接语音和文本监督,用多样化提示减少对特定措辞的过拟合,最后用后编辑补齐未见任务的格式要求。需要注意,图中箭头只表示推理时的信息流向,不代表梯度回传路径,训练时的冻结和更新策略要到训练小节单独核对。

编码器、投影层和主干各自管什么?

语音编码器有两种备选,分别对应两个提交版本。一种是较大规模多语言语音编码器,另一种是较小规模的自监督语音编码器。前者在训练时冻结权重,只提供稳定的声学特征;后者全量微调,可以更适应本任务的英文语音分布。两种选择都会接到同一个线性投影层,该层把变长语音特征映射到语言模型的输入维度。

投影层随机初始化,是连接听觉和语言的关键适配器。骨干大模型选用了在 40 种语言上翻译能力较强的指令模型,本身已经具备文本到文本翻译能力,论文只用高质量文本翻译子集维持该能力,而不是重新教它翻译。

语音编码器 × 骨干大语言模型: 语音编码器负责把英文语音波形变成连续特征序列,解决声音变长且与文本词表不对齐的问题;骨干大语言模型是已经擅长文本到文本翻译的 SalamandraTA-7b-instruct-WMT25,负责理解指令并生成目标语言文本。二者用一个线性投影层衔接,把语音特征映射到大模型的输入嵌入空间,组合意义是让翻译能力强但听不见声音的大模型获得听觉输入,同时保留其原有的多语言生成能力。

提示模板是另一个核心组件。非识别类语音任务使用统一的基础模板,用户轮包含音频占位符和指令,助手轮先输出思考转写块再输出回答。识别任务则省略思考块,直接输出转写,避免重复劳动。纯文本问答训练时,把文字上下文伪装成转写块放进用户轮的推理区,使文本任务和语音任务共享同一种先读上下文再回答的格式。指令措辞覆盖英文、德文、意大利文和中文的多样写法,目的是让模型学会看意图而不是背句子。

下面的基础模板图把这种格式说得很直白,初学者可以照着它复述 1 次输入输出的拼接顺序。

看图路径: 1. 先对照用户轮中的音频占位符与指令占位符的上下顺序;2. 再数助手轮中思考开始符、转写行、思考结束符与最终回答的四层结构

原论文 Figure 4:Base template used to train the model. CoT process is omitted in ASR tasks.

论文图 4。原论文 Figure 4:“Base template used to train the model. CoT process is omitted in ASR tasks.”。

图中用户轮先放音频起止符包裹的语音向量,再放自然语言指令;助手轮先用思考开始符打开转写区,写明转写内容后用思考结束符关闭,最后才写最终回答。这种固定顺序就是论文所说的思维链生成策略。它的新增作用有两点:一是把声学对齐压力集中到转写步,减轻翻译和问答步的负担;二是让文本数据能直接训练第二步,从而在语音问答数据不足时仍能提升理解能力。

思维链转写 × 指令跟随: 思维链转写指模型在回答前先在特殊思考标记内输出音频的文字转写,再输出最终答案,把难题拆成听清说什么和按要求做什么两步;指令跟随指模型按自然语言提示在识别、翻译、问答和未知惊喜任务之间切换。二者搭配的理由是转写步为后续步骤提供了统一的文本锚点,使纯文本问答和翻译数据也能帮助语音任务,组合后模型对新措辞指令的鲁棒性更强。

数据如何构造,模型如何训练和推理?

训练数据按任务分别准备。语音识别用了约 11500 小时的英文数据,来源包括多个公开英文语音库。语音翻译只有约 1000 小时,覆盖英到德、意、中。文本翻译只保留高质量子集,用质量估计模型按分数阈值筛选,目的是维持主干的翻译能力而不引入噪声。语音问答在英文语音问答基础上,加入了改写答案、翻译问题和答案、以及把文本问答扩展成语音输入的多步构造。

指令跟随数据用了英文的精确指令和对话域,加上多语言的通用指令数据。最终训练时按各数据文件占总样本的比例采样,保持原始分布。

数据预处理中有三处论文特有的细节值得复述。第一是文本翻译的质量筛选,不同语言对用了不同的分数阈值,只保留高分样本。第二是语音问答的翻译流水线,用翻译模型把问题和答案翻成目标语言,并把简短依赖上下文的答案改写成更完整自包含的风格,以匹配评测集的回答风格。第三是把长文本上下文先用大模型摘要到 40 秒以内可合成的长度,再用语音合成模型生成英文语音,从而把不可回答的文本问答扩展成语音输入。为避免重复,每个样本只出现在一种目标语言中。

下面的识别专用模板说明了训练格式的一个例外,理解它才能正确复现损失计算范围。

看图路径: 1. 先确认该模板用户轮与通用模板相同的音频加指令结构;2. 再确认助手轮直接输出回答而省略思考转写块

原论文 Figure 5:Base template used to train the model for ASR tasks

论文图 5。原论文 Figure 5:“Base template used to train the model for ASR tasks”。

该图显示识别任务的用户轮与通用模板一致,但助手轮直接输出回答,没有思考转写块。这是因为识别任务本身就是转写,再套一层转写属于重复。训练时模型只对助手轮的输出计算损失,思考块在非识别任务中属于监督的一部分,在识别任务中则不存在。推理时先用五束的束搜索解码生成完整序列,再去掉思考序列,只保留最终回答送入后编辑。后编辑模型被明确要求不接触原始音频、不重做任务,只修格式,提示词中强调若无明显格式问题就原样返回。

语音问答 × 纯文本问答: 语音问答的输入是语音加文字问题,模型必须先听懂语音上下文再回答;纯文本问答的输入直接是文字上下文加问题,监督信号更充足且易于获取。二者搭配时,论文把文本上下文伪装成转写块塞进思考区,使两种任务共享先读上下文再回答的推理格式,组合意义是让中文等语音问答数据不足的语言能借用文本问答数据补齐理解能力。

训练超参数按原文交代:训练一轮,优化器用自适应权重衰减优化器,学习率用余弦调度,最高十万分之一,最低百万分之一,前 10% 步数预热,最大序列长度两千零四十八,混合精度,梯度裁剪范数为 1.0,全局批量二百五十六,在三十二块定制显存显卡上运行。需要特别说明,最强的基于大语音编码器的模型因技术限制只训练了约 0.8 轮,论文假设训满一轮会进一步提升,但这属于待验证的推测,不能当成已证结论。

束搜索解码 × 后编辑: 束搜索解码负责在推理时保留 5 个候选序列并选出整体概率最高的输出,保证转写加回答的长序列不至于过早走偏;后编辑是用另一个大模型只修格式不重做任务,解决惊喜任务中模型未见过的严格格式要求。二者分工是前者管内容质量、后者管格式合规,组合后可以在不重新训练语音大模型的情况下补齐指令格式短板。

用什么数据、基线和指标来验证?

评估分两个阶段。开发验证用前一年的测试集,来自多模态跨语言指令跟随评测框架。正式结果是当年官方评测,包含翻译质量、问答语义分、质量估计准确率和格式准确率以及识别词错率。论文在开发集上比较了 4 个外部系统:作为基线的多模态模型、约束条件下表现最好的提交,以及两个非约束提交。自家系统有两个编码器版本,每个版本又分是否加后编辑,共 4 个内部对照。这种安排可以分别回答编码器选择和后编辑是否有用的问题。

指标方向必须先讲清,否则数字升降会读反。词错率越低越好,语义相似度和翻译质量分越高越好,格式准确率越高越好。语言覆盖上,识别只测英文,语音翻译测英到德、意、中,语音问答测英、德、意、中 4 种指令语言。比较的公平条件在原文中有保留:约束与非约束的数据允许范围不同,作者的无约束系统与约束系统的直接分数对比只能说明整体效果,不能证明架构在同等数据下必胜。

硬件和评测工具也按原文交代。训练用了三十二块显卡,后编辑用了另一个大模型,语音合成和翻译流水线分别用了指定的开源模型。资源状态方面,本次核对时翻译、改写和合成所用的 3 个外部模型链接本次未能确认可达,只有评测框架的代码仓库当前可用。因此复现时应优先保证评测框架可运行,外部大模型的权重可达性需要另行确认,不能默认它们当前可用。

主结果:在哪些任务上追平或超过了基线?

要回答的核心问题是:在相同的测试集上,新系统是否在识别、翻译和问答上达到了有竞争力的水平,以及后编辑是否改变了结论。公平条件是同一年的测试集、相同的指标方向,比较对象包括多模态基线和当年最强的约束与非约束提交。指标方向重申 1 次:词错率越低越好,问答语义分和翻译质量分越高越好。

条件指标基线本方法比较对象
英文识别词错率越低越好词错率0.070.110.13 与 0.15
英到德翻译质量越高越好翻译质量分0.770.78持平或领先
英到意翻译质量越高越好翻译质量分0.810.81持平
英到中翻译质量越高越好翻译质量分0.810.80相差 0.01
多语言问答语义分越高越好德文 0.42 中文 0.37 意大利文 0.41 英文 0.44基线德文 0.36 中文 0.37 意大利文 0.40 英文 0.46本方法德文最优 中文持平最强约束系统英文 0.50

表后需要解释主要收益与具体代价。翻译上,最佳系统在英到德取得领先,在英到意持平,在英到中只差 0.01,整体与基线相当。问答上,德文取得最优,中文与基线持平,意大利文接近最优,英文则明显落后于基线和最强约束系统。识别上,虽然落后于基线的 0.07,但优于其他所有对照,说明听写能力处于第二梯队头部。

代价是英文问答的差距表明转写优先策略并没有自动解决所有语言的理解问题,中文翻译能力的维持也依赖高质量文本数据的筛选,数据构造的工作量不可忽略。未胜出项必须点名:英文问答 0.44 低于基线的 0.46 和最强系统的 0.50,这是后续需要补验证的短板,不能用总体趋势掩盖单项落后。

后编辑和编码器选择到底改变了什么?

这一节要分离两个因素:后编辑是否只修格式,以及大编码器与小编码器谁更强。比较问题很具体:在保持解码和主干不变的情况下,加上后编辑后分数如何变化;在保持数据和模板不变的情况下,换编码器后问答和翻译是否同步变化。公平条件是同一测试集和同一指标,后编辑模型固定,编码器版本单独命名。

条件指标无后编辑有后编辑说明
意大利文问答语义分越高越好语义分0.360.41格式修正带来提升
中文问答语义分越高越好语义分0.340.37格式修正带来提升
德文惊喜任务格式准确率越高越好格式准确率低高大幅改善格式合规
翻译质量分越高越好翻译质量分不变不变内容不受影响
训练完整度训练轮数约 0.8 轮约 0.8 轮未训满一轮待验证

表后解释必须区分内容改善和格式改善。原文报告显示,后编辑对多数指标影响有限,但在意大利文和中文问答上带来了从 0.36 到 0.41、从 0.34 到 0.37 的提升,作者将其归因于修正输出格式错误,而非模型底层预测变强。定性检查也发现后编辑有助于强制执行严格输出格式,纠正了原始输出中频繁的格式错误。对翻译性能则没有影响,对英文问答甚至略有损伤,说明后编辑主要管输出约束,偶尔会改坏原本正确的答案。

这种效果高度依赖后编辑模型自身的指令跟随能力和提示词,不能推广为后编辑必然有用。编码器方面,最佳系统在问答上全面领先,尽管只训练了约 0.8 轮,作者推测训满会更好,但这仍是待验证的假设。反例是语音识别词错率并没有同步显示出同样的优势,说明转写质量优势并未完全反映在词错率上,单看一个指标会误判编码器的贡献。

哪些结论还不能下,边界在哪里?

首先是训练不完整的限制。最强的系统只训练了约 0.8 轮,所有关于训满会更好的说法都是假设,没有对照实验支撑。在复述时必须用可能和待验证来表达,不能写成已经证明。其次是后编辑的双刃性。它在德文惊喜任务的格式准确率上大幅提升,但对英文问答略有损伤,对翻译无影响,说明它不是通用增益,而是有条件的格式补救。如果换一个后编辑模型或换一套提示词,效果可能完全不同,原文也明确指出这种依赖性。

其次是评估边界。开发集上的结论不能自动推广到当年的惊喜任务,因为惊喜任务的细节在提交时才公开,指令措辞和格式要求都可能不同。当年官方结果中还有因技术错误未能评测的语言子集,缺失的数字不能用开发集数字填补。不同指标的差值也不能混放,例如词错率降低 0.02 与翻译质量分提高 0.01 是不同量纲,不能放在同一列比较大小。百分点和相对百分比也不同,阅读时要保留原文的小数精度,不自行四舍五入。

最后是资源与成本的缺项。论文报告了训练显卡数量和批量大小,但没有报告推理延迟、输出帧率和后编辑带来的额外开销,也没有测量误判率随指令措辞变化的分布。因此不能承诺该方法改善了延迟或降低了成本,训练资源、推理开销和实际延迟需要分别讨论。总体趋势不等于每组都成立,英文问答的落后就是一个提醒,说明转写优先加文本数据复用的思路在某些语言上仍需补验证。

要复现这套系统,先做什么?

复现的第一步是准备数据和评测框架,而不是直接调模型。按原文顺序,先获取英文识别语音、语音翻译、文本翻译、语音问答和指令数据,再用质量估计模型筛选文本翻译,用翻译模型和改写模型完成问答数据的翻译与改写,用摘要模型把长上下文缩短到可合成长度后合成语音。评测框架的代码仓库当前可用,应优先跑通前一年的测试集,确认词错率、语义分和翻译质量分的计算口径与论文一致。外部大模型的权重链接本次未能确认可达,需要在动手前逐一确认可达性,不可默认下载成功。

第二步是搭建模型。语音编码器二选一,线性投影随机初始化,骨干用翻译导向的指令模型。训练时按样本占比采样,保持原始分布,超参数保留原文的关键设置:训练一轮、余弦调度、最高和最低学习率、预热比例、最大序列长度、混合精度和梯度裁剪。提示模板要严格区分识别任务省略思考块、其他任务保留思考块,纯文本问答要把上下文伪装成转写块。推理时用五束搜索,解码后去掉思考序列再送入后编辑,后编辑提示词要强调只修格式、不重做任务。

第三步是验证顺序。先复现识别词错率,确认听写通路无误;再复现翻译质量分,确认主干能力未被破坏;最后复现问答语义分,重点检查意大利文和中文在后编辑前后的变化是否来自格式修正。还需补的验证包括训满一轮后的变化、换用不同后编辑模型的效果,以及在新措辞指令下的稳定性。只有补齐这些,才能判断收益来自转写分解本身,还是来自数据和格式修正的叠加。

何时值得尝试这条路线?

当你的任务同时满足 3 个条件时,这条路线值得尝试。第一,已有一个在目标语言上翻译或问答能力较强的大模型,但它听不见语音;第二,语音翻译和语音问答数据不足,但纯文本的翻译和问答数据相对充足;第三,评测中会出现措辞多变或格式严格的指令,需要模型先稳定听写再按要求作答。这时先转写后作答的顺序能让文本监督迁移到语音任务,多样化提示能减少对固定措辞的依赖,后编辑能补齐格式合规。

不适合的情况也要讲清。如果语音本身噪声很大导致转写经常出错,错误会向后传递,第二步再强也难以挽回,此时应先提升声学鲁棒性而不是加更复杂的指令模板。如果评测只看单一任务的绝对精度,且已有大量该任务的语音监督,那么为通用性付出的模板和后编辑开销可能不划算。论文的英文问答落后和翻译持平已经提示,通用化并不等于每个子任务都提升。

回到中心判断:这项工作的价值不在于某一个数字最高,而在于用统一的生成顺序把语音和文本监督对齐到同一推理格式,使一个模型能同时处理识别、翻译和问答,并在未见格式上靠后编辑兜底。复现时抓住转写块的位置、文本上下文的伪装方式和后编辑只修格式三处细节,就能复述出方法全貌;评价时盯住基线条件、指标方向和未胜出项,就能避免把格式收益误读成理解能力的提升。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 iwslt-2026 论文汇总