英文题目:LIUM Submission for IWSLT 2026 Low-resource Speech Translation Track

会议身份:conference:iwslt:2026:conference-paper-id:2026.iwslt-1.15

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#数据增强 #低资源 #语音 #语音翻译

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Mohammad Mohammadamini:机构信息未能从会议 PDF 纯文本可靠映射
  • Marie Tahon:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

中库尔德语到英语端到端语音到文本翻译输入为自发库尔德语语音,输出为英语文本,难点在于人工平行语音稀缺且自发语音存在口误韵律变体与方言码切换。该工作先走伪标注链,能量语音活动检测切分4300小时有声书得到语音段,再用177小时人工数据微调的Seamless Large V2生成源语言伪转写,最后用222k句对微调的NLLB 1.3B生成英语伪译文并经时长置信度与长度比过滤后训练Fairseq-S2T。另一条合成链先在约13小时单说话人录音室数据与多说话人有声书上微调3个F5-TTS模型,再分别由已有平行文本与新闻单语文本加机器翻译生成源侧合成语音以训练Whisper-L-V3。与朗读受控场景下合成数据有效的既有结论不同,本文强调在自发媒体域真实声学覆盖决定成败而非单纯文本域适配。在COMMUTE-Kurdish测试集下,伪标注Fairseq-S2T分支的BLEU为21.09,高于合成平行扩展Whisper-L-V3分支的BLEU 10.36。该结论适用边界受限于库尔德语自发媒体域与所用过滤阈值,尚未验证跨语言与跨自发风格的外推,合成与伪标注简单混合反而下降至16.24 BLEU构成失败条件。合成模型各在1张48GB显存RTX8000硬件上微调约2天构成训练成本,端到端大模型总计算量与推理开销延迟未完全披露。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,哪些信息必须保留?

本文的输入是中库尔德语语音,目标是输出英语文本,属于语音到文本翻译。学习对象是刚进入语音与语言处理的研究生,因此先把任务边界讲清楚:系统听的是源语言声音,交出的是目标语言文字,中间需要同时处理声学变异和语言转换。论文聚焦低资源情形,含义是几乎没有人工标注的语音加译文平行数据可以直接训练端到端模型,评测使用自发语音性质的库尔德通勤数据集,包含训练、开发和测试划分。

必须保留的信息包括数据从哪里来、识别和翻译模型是否经过微调、过滤条件是什么、端到端模型用哪些数据训练、评分时是否统一转小写并去掉标点。后续所有方法都可以理解为在不依赖人工标注语音翻译数据的前提下,用已有语音识别、机器翻译和语音合成能力拼出可训练的平行语音数据。

端到端语音到文本翻译 × 级联语音翻译: 端到端语音到文本翻译负责把源语言语音直接映射为目标语言文本,级联语音翻译负责先用语音识别得到源语言文本再用机器翻译转写为目标语言文本,二者搭配的原因是级联可以在无端到端平行数据时提供可用的翻译路径并生成伪平行数据,而端到端负责减少级联的误差传递和延迟,组合意义是用级联的两个模块造出三元组再训练端到端模型。

论文把两条技术路线并列提出。第一条是伪标签路线:收集大量真实库尔德语语音,切分成短句,用微调后的识别模型得到源语言转写,再用微调后的翻译模型得到英语译文,从而形成语音、转写估计、译文估计三元组。第二条是合成路线:从文本出发,用微调后的语音合成模型生成源语言语音,同时用翻译模型生成目标文本,从而形成合成语音、源文本、目标文本三元组。两条路线都不要求人工标注新的语音翻译数据,但对已有模型和文本资源的依赖不同,这决定了后文实验条件的组织方式。

同输入同目标的前人工作比较了什么?

在相同输入输出下,前人对合成数据的结论偏谨慎。一项针对本巴语和北黎凡特语的研究报告,用合成数据与真实语音混合只带来很小的提升。另一项面向语音大语言模型的研究指出,只用合成数据性能有限,与真实语音按平衡比例混合才可能改善。还有关于合成语音缩放规律的研究强调,只有训练数据足够大并且合成模型以真实语音分布为条件时,合成数据集的效果才接近真实语音。这些对照说明合成语音不是天然等价于真实录音,声学多样性和领域匹配是关键变量。

伪标签是另一条活跃路线。已有工作指出稳健教师模型生成的伪标签有时比人工标注更一致,合理的过滤对最终性能影响很大。相关方法包括多视角剪枝一致性、动量伪标签的在线离线模型互相学习,以及直接把伪标签用于自训练。在孟加拉语、北萨米语、印地语等低资源识别任务中,伪标签自训练也被报告有明显改善。顶级语音翻译系统对伪标签的依赖进一步说明这条路线在工程上已被广泛使用。本文的差异在于把伪标签和合成两条路线放在同一个中库尔德语到英语自发语音任务上对照,并分别考察从真实语音出发和从文本出发两种构造方式。

为什么低资源语音翻译不能只做级联?

训练端到端语音翻译需要大量源语言语音与目标语言文本对齐的数据,而低资源语言恰好缺少这种资源。自然的替代是级联:先识别再翻译,每个模块可以各自利用语音识别数据和机器翻译数据。但级联存在误差传递,上游识别错误会直接进入翻译,同时 2 级串行也会增加延迟,对同传式应用不利。论文并不满足于只提交一个级联系统,而是把级联中的识别和翻译模块当作数据工厂,用它们把无标注语音或纯文本转化为端到端模型可用的训练数据。

举一个教学用的例子:假设有一段 3 秒的库尔德语市场对话录音,没有任何文字标注。级联做法是先转写再翻译,输出英语译文即结束。论文的做法是把这段录音、机器转写、机器译文一起存为一个训练样本,积累数百万条后再训练一个直接从语音到英语的端到端模型。这个例子只是帮助理解流程,不代表论文报告过该样本的分数。真正的难点在于机器转写和机器译文都有噪声,如何通过模型选择和过滤保证存下来的样本总体可用,是后文组件与实验要回答的问题。

两条数据增强路线如何各走完一个样本?

先沿伪标签路线走完一个样本。输入是一段未经标注的库尔德语长录音,先经过语音切分得到短句语音。切分后的短语音送入微调后的识别模型,得到源语言转写估计。该转写再送入微调后的翻译模型,得到目标语言译文估计。最终保存的是三元组,包含原始短语音、转写估计和译文估计。整条路线只消耗真实语音,不消耗人工翻译,文本侧完全由模型生成,因此过滤质量决定了数据是否可用。

再沿合成路线走完一个样本。输入是一句库尔德语文本,分为两种情形。若已有平行双语文本,则源文本直接对应现成目标文本,只需用合成模型把源文本读成合成语音,得到合成语音、真实源文本、真实目标文本。若只有单语源文本,则同一句源文本分别走两条支路,一路经合成模型得到合成语音,一路经翻译模型得到目标文本估计,得到合成语音、真实源文本、译文估计。两种情形的共同点是语音模态来自合成模型,区别在于目标文本是否现成,这决定了噪声来源是只有声学侧还是声学与翻译两侧都有。

以下导读针对伪标签管线图,先看清从左到右的主路径和下方三元组框的汇入关系,再对照符号理解真实与估计的分工。

看图路径: 1. 先从左到右沿原始语音到语音切分再到微调识别再到微调翻译的主箭头走一遍;2. 再看下方虚线框内的伪标签三元组是从哪两处虚线汇入的;3. 确认识别输出同时向上游翻译和向下游三元组各贡献了什么符号;4. 对照正文把框内三元组中语音、转写、译文的真实与估计属性标清楚

原论文 Figure 1:Pseudo-labeling pipeline composed of ASR and MT from real speech

论文图 1。原论文 Figure 1:“Pseudo-labeling pipeline composed of ASR and MT from real speech”。

该图显示原始语音先进入语音切分,再进入微调识别模型得到转写估计,然后进入微调翻译模块。下方虚线框为伪标签三元组,左侧虚线汇入切分后的语音,中间虚线汇入识别输出,右侧虚线汇入翻译输出。从像素可见主路径为实线箭头,汇入三元组为虚线箭头,框内明确写出语音、转写估计、译文估计 3 个符号。这对应正文用三元组大规模训练端到端模型的安排,说明该图不是推理时的翻译流程,而是离线构造训练数据的流程。

切分、识别、翻译、合成各自算什么?

语音切分负责把长音频变成适合模型处理的短句。论文使用基于能量的语音活动检测,当连续超过 30 个 10 毫秒帧为静音时切分,并在边界保留 15 帧静音。这个操作不产生文字,只产生短语音,是后续识别与训练的输入单位。识别模型选用微调后的大模型,论文对比了多种识别模型并最终用效果最好的模型生成伪标签。翻译模型基于微调后的多语言翻译模型,负责把转写估计译为英语。

合成模型基于语音合成模型,在库尔德语录音上微调得到 3 个单说话人系统,分别对应男性有声书、女性有声书和男性录音室数据,并在训练和推理都做了文本归一化和字音转换以兼容原词汇表。

伪标签 × 语音识别: 语音识别负责把切分后的真实库尔德语语音转写为源语言文本估计,伪标签负责把该转写及其机器翻译结果与原语音打包成可训练三元组,二者搭配的原因是真实语音提供了自发语音的声学多样性而识别模型提供了无需人工标注的文本,组合意义是把大量无标注音频转化为端到端翻译的监督信号,但质量完全受制于识别模型的可靠性。

语音合成 × 机器翻译: 语音合成负责把源语言文本合成为源语言语音估计,机器翻译负责把源语言文本翻译为目标语言文本估计,二者搭配的原因是从纯文本出发可以同时补齐语音模态和目标文本模态,组合意义是把单语文本或平行双语文本扩展为语音翻译三元组,但两路都是生成模型因而会引入合成声学单一性和翻译噪声。

以下导读针对合成管线图,重点看同一份源文本如何分叉为语音和译文两路,再汇成一个训练三元组。

看图路径: 1. 先从左侧原始文本出发分别沿上支翻译和下支合成两条箭头走;2. 再看两条虚线是如何汇入右侧语音翻译三元组虚线框的;3. 确认框内语音带帽子而源文本不带帽子的含义;4. 最后看三元组框向下指向翻译模型框的实线表示的训练关系

原论文 Figure 2:Synthetic data pipeline composed of TTS and MT models generating parallel speech from raw text.

论文图 2。原论文 Figure 2:“Synthetic data pipeline composed of TTS and MT models generating parallel speech from raw text.”。

该图左侧为原始文本,上支经微调翻译模型得到译文估计,下支经微调合成模型得到合成语音估计,两路虚线汇入右上三元组框,框内符号为合成语音、源文本、译文估计,框下实线指向语音翻译模型。这说明合成路线 1 次前向同时补齐两个缺失模态,训练目标是让下游的语音翻译模型学会从合成语音预测目标文本。像素显示翻译支路和合成支路并列,汇入均为虚线,只有三元组到模型为实线,对应离线造数据与在线训练的分界。

哪些模型被训练,参数如何更新,伪标签如何过滤?

需要训练的模型包括识别、翻译、合成和最终的语音翻译模型,不存在无训练的环节。识别侧把大模型在约 177 小时人工标注库尔德语语音上微调,使用 80 维梅尔滤波器组特征,批量十六,学习率十的负 4 次方,训练 10 个轮次。翻译侧把 1300000000 参数的翻译模型在约 220000 对中库尔德语到英语平行句上微调,使用优化器更新,学习率十的负 4 次方,权重衰减十的负 3 次方,训练 500000 步。

合成侧把英文基线模型分别在 3 个库尔德语数据集上独立微调,每个留出 500 条做测试,其余训练,每次在一块显存较大的显卡上耗时约 2 天。最终语音翻译侧有两类训练:一类是微调大语音模型,另一类是从零开始训练基于变换器的语音翻译模型。

微调 × 数据过滤: 微调负责让通用的识别、翻译、合成和翻译模型适应中库尔德语及目标领域,数据过滤负责按语速、时长、置信度、重复和长度比剔除低质伪标签,二者搭配的原因是微调提高生成标签的平均质量而过滤截掉尾部坏例,组合意义是保证三千多小时伪标签数据在规模放大的同时仍可用于训练端到端模型。

过滤是伪标签路线保证质量的核心。论文报告的过滤条件包括按每分钟词数剔除部分转写样本、按时长和词数剔除过短过长样本、按识别平均置信度剔除低置信样本、用重复片段检测幻觉、用源目标长度比保证一致性,以及剔除目标侧命名实体占比过高的样本。这些阈值是经验优化的结果,目的是在数千小时量级上保留高质样本。原文没有给出每条过滤各自去掉多少数据的消融,也没有报告梯度是否在过滤阶段回传,过滤只是离线数据选择,不参与反向传播,这是复现时不应误解的一点。

数据、划分、指标与评分条件是什么?

共享任务数据为库尔德通勤数据集,包含训练、开发和测试划分,论文表格中给出各划分的时长量级,约束场景只用该数据集的训练部分微调模型。人工标注识别数据来自通用语音数据集与本地库尔德语识别语料,共约 177 小时,用于微调识别模型。合成模型的训练数据包括录音室男声和男女有声书数据。伪标签的原始音频为数千小时有声书,经切分识别翻译和过滤后保留大规模三元组。合成数据包括从已有平行语料生成的数十万条合成语音,以及从新闻领域文本中选取十万句生成的面向领域的合成数据,后者与评测数据的媒体来源更接近。

指标方面,语音翻译用自动翻译指标报告,语音识别用字错率和词错率报告。论文明确评分按共享任务规则把大写转小写并去掉标点,识别评分前也做了字符统一、标点去除和数字转文字等归一化。比较公平性需要注意:不同数据路线训练的端到端模型结构可能不同,训练数据量级也不同,因此数字差异同时反映数据质量和数据量,不能只归因于某一个模块。以下两张表分别整理翻译效果与数据规模,表内数字均来自正文连续原句,单位与精度保留原文写法。

下面第一张表比较不同数据生成策略训练端到端语音翻译的效果,比较问题是在相同自发语音评测上哪种构造数据的策略更有效,公平条件是同为中库尔德语到英语且按统一规则评分,指标方向是翻译指标越高越好。

数据策略系统开发集 BLEU测试集 BLEU备注
伪标签Fairseq-S2T25.7321.09最优端到端结果
约束微调Whisper-L-V318.8514.94仅用共享任务训练集
伪标签Whisper-L-V3未在句中报告开发集17.93真实语音伪标签
合成平行扩展Whisper-L-V3未在句中报告开发集10.36合成语音加现成译文
合成原始文本Whisper-L-V3未在句中报告开发集12.69合成语音加机器译文
合成加伪标签混合Whisper-L-V3未在句中报告开发集16.24简单混合后下降

该表显示伪标签路线明显高于两条合成路线,从零训练的专用变换器在伪标签数据上达到最高值,而合成与伪标签的简单混合反而低于纯伪标签,说明数据并非越多越好。未胜出的合成平行扩展虽然拥有高质量平行文本,但因语音侧完全合成而效果最低,这为后文讨论自发语音变异埋下伏笔。需要强调开发集数值只在最优结果和约束结果的原句中完整报告,其余策略的开发集数值在正文连续句中没有给出,因此表中不硬填,这是证据边界。

下面第二张表整理各阶段数据的来源与规模,比较问题是各策略的数据量级是否可比,公平条件是区分人工标注、伪标签与合成 3 类数据的监督来源,规模越大不自动等于质量越高。

数据类型来源规模用途训练条件
人工标注识别数据通用语音与本地语料177 hours微调识别模型批量 16 训练 10 轮
人工平行翻译数据中库尔德语英语平行句222k微调翻译模型训练 500k 步
原始长音频库尔德语有声书4,300 hours伪标签输入切分识别翻译后过滤
过滤后伪标签有声书管线输出1.71M triplets训练端到端模型对应 3,231 hours
合成平行语音已有平行语料合成340k微调语音翻译对应 514 hours
原始新闻文本媒体文本语料100k sentences合成加翻译领域接近评测

该表说明伪标签在时长和样本数上都远大于合成数据,过滤后仍保留三千多小时,这是专用模型从零训练可行的前提。合成数据的优势在于领域可控,可以选取与评测相近的新闻文本,但声学侧仍受限于少量说话人的合成模型。复现时应先核对数据量级与监督来源,再比较翻译分数,否则容易把规模红利误读为方法红利。

主结果支持什么判断,代价是什么?

约束场景下,只用共享任务训练部分微调大语音模型,开发集与测试集的翻译分数处于中等水平,说明小规模自发语音数据可以启动模型但不足以充分建模。开放数据增强后,伪标签路线显著领先合成路线。用伪标签微调大语音模型已明显高于合成数据,而用伪标签从零训练专用变换器进一步达到开发集 25.73、测试集 21.09 的最好端到端结果。合成路线中,从已有平行文本合成语音的效果最低,从领域相近的原始文本同时合成语音并机器翻译的效果稍好,但仍明显低于伪标签。把合成与伪标签简单混合反而使分数回落,说明两种分布直接混合没有互补增益。

识别侧的结果支持伪标签质量的解释。未经库尔德语微调的通用多语言模型误差较高,经过 177 小时人工数据微调后的模型明显更好,其中表现最好的识别模型为伪标签生成提供了相对可靠的转写。用该识别模型生成的伪标签训练的专用识别变换器,其误差接近但略差于教师模型,符合知识蒸馏的预期。级联系统的翻译分数与最优端到端模型接近,说明伪标签端到端模型已达到与级联相当的水平,同时在推理时不需要 2 级串行。

代价方面,伪标签依赖一个足够强的识别模型和翻译模型,以及大量真实语音和严格过滤,缺少任一环节都难以复制。合成路线虽然不依赖大量真实语音,但需要训练高质量合成模型并做文本归一化和字音转换,且合成语音的说话人多样性主要靠提示采样人为扩大,与真实自发的韵律和口音多样性仍有差距。论文还报告合成加伪标签混合带来下降,这提示简单拼接会引入分布冲突,复现时不应默认混合即增益。

哪些对照算反证,过滤阈值具体是什么?

论文的反证主要来自 3 组对照。第一组是合成平行扩展对照:即使目标文本是现成的高质量平行文本,只要语音是合成的,测试集分数仍然最低,这反证了瓶颈在声学侧而非文本侧。第二组是领域对照:用与评测领域相近的新闻文本同时合成语音并机器翻译,分数高于平行扩展但仍远低于伪标签,这说明领域匹配有帮助但不能弥补合成声学的单一性。第 3 组是混合对照:合成与伪标签混合后分数下降,这反证了 naive 混合不是安全的默认操作,需要加权、课程或分布对齐等额外设计,而论文没有报告这类设计的增益。

下面一张表把伪标签过滤条件逐条整理,比较问题是哪些样本会被丢弃,公平条件是同一批识别与翻译输出,方向是去掉低质与幻觉样本。

过滤维度对象阈值目的处理
语速ˆTs90–200剔除部分转写删除样本
时长词数SsSs < 1s剔除过短删除样本
时长词数SsSs > 30s剔除过长删除样本
置信度ˆTsbelow 0.9剔除低置信删除样本
重复ˆTs 或ˆTtmore than 2 repetitions检测幻觉删除样本

该表显示过滤同时约束语速、时长、置信度、重复、长度比和命名实体比例,任何一条不满足都会丢弃样本。代价是有效数据利用率下降,但换来训练集更干净。未报告的边界是每条规则各自的贡献和阈值敏感性,复现时若直接放宽阈值,可能会引入更多噪声而抵消规模增益,这是需要补做的验证。

什么条件下结论不成立,还有哪些缺项?

结论的适用条件需要讲清。伪标签更优的判断是在自发语音评测上成立,论文同时指出在朗读或录音室等受控场景中,合成数据曾达到与伪标签相当的效果,因此不能把合成数据无效推广到所有任务。自发语音包含犹豫、韵律变化、语码混合、方言差异和会话领域偏移,而合成数据缺少这些变异,这是论文给出的有限解释,属于支持性分析而非严格因果证明。

合成数据 × 自发语音: 合成数据负责提供发音规范、信道干净的朗读式语音,自发语音负责带来犹豫、韵律变化、语码混合、方言和领域偏移,二者搭配比较的原因是检验合成语音能否覆盖真实会话的变异,组合意义是解释为何合成数据在朗读基准上可行而在本次自发语音评测上明显落后,从而指出需要对真实分布建模的合成方法。

缺项方面,论文没有报告统计显著性、多次随机种子的方差,也没有测量延迟、推理开销和训练能耗,因此不能从翻译分数直接承诺实时性改善。资源状态方面,正文引用的第三方文本处理工具链接在本次核查中未能确认可达,应写为本次未能确认可达,不能写成已公开可用。引用他人数据集与模型时,应区分代码开源、权重可下载和系统可运行 3 类状态,论文没有逐一给出可运行证明,复现时需要自行核对版本与许可。

要复现应先做什么,需要哪些超参数?

复现的第一步是准备数据与评分环境。先按共享任务取得库尔德通勤数据的训练、开发和测试划分,并统一评分规则为转小写、去掉标点。再准备约 177 小时人工标注识别数据和约 220000 对平行翻译数据,分别用于微调识别与翻译模型。第二步是跑通切分与过滤:用能量语音活动检测切分长音频,保留边界静音,再按语速、时长、置信度、重复、长度比和命名实体比例实现过滤脚本,先在小批量上检查丢弃率是否合理。

第三步是生成伪标签:用微调后的识别模型转写,用微调后的翻译模型翻译,保存为语音、转写估计、译文估计三元组。第四步是训练端到端模型:可以先微调大语音模型验证管线,再用大规模伪标签从零训练专用变换器。

关键超参数应保留原文写法:识别微调使用 80 维特征、批量十六、学习率十的负 4 次方、10 个轮次;翻译微调使用学习率十的负 4 次方、权重衰减十的负 3 次方、500000 步;端到端变换器训练 25 个轮次;大语音模型微调用较小的学习率与小批量多轮次。合成复现还需准备 3 个单说话人合成模型的训练数据与文本归一化流程,并用提示池增加说话人多样性。建议先复现约束基线,再复现伪标签主结果,最后才尝试合成与混合,避免一开始就陷入大规模合成的计算开销。

何时值得尝试这套方法,收束判断是什么?

当手头有大量无标注源语言语音、少量人工标注识别数据和一定规模平行翻译数据,但没有语音翻译平行数据时,伪标签路线值得优先尝试。它的前提是能先得到一个可用的识别模型,否则转写噪声会污染整个训练集。当只有文本而几乎没有真实语音时,合成路线可以作为冷启动,但应预期在自发语音上效果有限,更适合朗读式或领域受控任务。若评测领域已知,可以像论文那样选取同领域文本做合成,以获得有限的领域增益,但不应期待它替代真实语音。

收束判断是:在本次中库尔德语到英语自发语音任务中,用真实语音经识别加翻译构造的伪标签数据训练端到端模型,达到与级联相当的水平并显著高于纯合成数据,而合成数据的局限主要来自声学变异不足,简单混合两类数据没有带来互补增益。后续值得补的验证包括过滤消融、混合加权策略、以真实分布为条件的合成建模,以及在更多自发语音集上的重复性检验。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 iwslt-2026 论文汇总