📄 Simultaneous Speech-to-Speech Translation Without Aligned Data

#语音翻译 #强化学习 #多语言 #低资源 #流式处理

8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5

🔥 8/10 | 前25% | #语音翻译 | #强化学习 | #多语言 #低资源 | arxiv

👥 作者与机构

  • 第一作者:Tom Labiausse(Kyutai, Paris, France)
  • 通讯作者:未指定个人通讯作者,提供团队邮箱 hibiki@kyutai.org
  • 作者列表:Tom Labiausse(Kyutai)、Romain Fabre(Kyutai)、Yannick Estève(LIA, University of Avignon)、Alexandre Défossez(Kyutai / Gradium)、Neil Zeghidour(Gradium)

💡 毒舌点评

通过消除词级对齐数据并用单BLEU奖励驱动RL,Hibiki-Zero简化了同时语音翻译的训练范式,并在多语言环境下取得了有竞争力的质量-延迟折衷,尤其在新语言适应方面展现出潜力。但过程奖励完全依赖BLEU,回避了对翻译自然度、韵律和语义保真度的直接建模;且评测数据及训练目标语音均为合成数据,存在生成-评估偏差风险,在实际场景下的泛化能力仍存疑。

📌 核心摘要

  1. 本文核心贡献是提出一种无需词级对齐数据即可训练同时语音翻译模型的新范式,移除了为不同语种设计特定对齐启发式规则的工程瓶颈。
  2. 提出Hibiki-Zero,采用“句子级对齐数据预训练+GRPO强化学习优化延迟”的两阶段框架。预训练阶段通过可控TTS在目标语音中制造多样性延迟,使模型学会变化的听-说节奏;RL阶段则通过单BLEU奖励引导模型寻找最优的同时翻译策略。
  3. 与Seed LiveInterpret 2.0等最新工作的多分量复杂奖励不同,本文将翻译质量和延迟统一到基于BLEU的过程奖励中,避免了多奖励权重调参困难和奖励黑客问题,并首次将GRPO适配到多流RQ-Transformer架构。
  4. 在多语言X-to-English任务上,Hibiki-Zero在长文评估上ASR-BLEU领先Seamless超5个点,说话人相似度提高超20个点,同时保持更低延迟;主观评测结果显示,在音频质量、说话人相似度和自然度上均显著优于Seamless。适应新输入语言(意大利语)仅需不到1000小时数据即可达到与Seamless相当的质量-延迟折衷。
  5. 该方法显著降低开发多语言同时语音翻译系统的数据门槛,展现了向新语言快速迁移的能力,具有明确的落地潜力。
  6. 主要局限包括无法在推理时动态控制质量/延迟权衡,无法控制目标语音中的口音强度,目前仅支持翻译为英语的单向设定,且训练和评估均依赖合成目标语音。

🔗 开源详情

  • 代码:https://github.com/kyutai-labs/hibiki-zero

  • 模型权重:https://huggingface.co/collections/kyutai/hibiki-zero (包含模型检查点)

  • 数据集:评估基准 Audio-NTREX-4L(45小时多语言语音翻译评估数据)通过上述 HuggingFace 集合发布:https://huggingface.co/collections/kyutai/hibiki-zero ;训练所用的大规模合成语音翻译数据集(约40k小时)未公开。

  • 复现材料:论文第4.1节和4.2节提供了详细的架构和四阶段训练超参数,但未附带专门的复现脚本。

  • 论文中引用的主要开源项目:Mimi(Kyutai moshi项目)、Helium-2B、Whisper、MADLAD-3B、NTREX、Europarl-ST、CML-TTS、UniSpeech/WavLM等。

  • 补充链接(自动提取):

    • HuggingFace:https://huggingface.co/datasets/kyutai/Audio-NTREX-4L
    • HuggingFace:https://huggingface.co/kyutai/hibiki-zero-3b-pytorch-bf16
    • HuggingFace:https://huggingface.co/spaces/kyutai/hibiki-zero-samples

🏗️ 方法概述和架构

Hibiki-Zero是一个端到端的、同时生成语音和文本翻译的解码器模型,基于增强的RQ-Transformer多流架构。整体流程分为五阶段:

  1. 音频编解码与多流建模:输入和输出语音波形均通过预训练的Mimi神经音频编解码器转换为离散token序列(帧率12.5Hz),包含1层语义token和15层声学token。模型主体由一个参数量为2B的Temporal Transformer(28层,处理时间维度)和一个Depth Transformer(每个codebook 6层)组成,后者沿量化轴自回归生成多层token。模型引入了“内心独白”文本流,在时间维度上与输出声学token一起建模,以增强生成语音内容的稳定性。推理时,输入流token被强制为实际音频编码。
  2. 粗对齐数据构建:从句子级对齐的源-目标语音对出发,通过在目标语音句子间(参数 \(\delta \sim U(0, \delta \cdot d_i)\))和句内标点处(参数 \(\mu\))插入随机时长的静音,生成具有多样延迟模式的粗糙同时翻译数据。随后利用可控TTS,根据源说话人音色和静音指令合成带自然停顿的目标语音,提升训练语料的逼真度。
  3. 多阶段预训练(文本初始化、音频预训练、翻译训练、精调):文本主干网络使用Helium-2B初始化。之后进行1M步多语言单流音频预训练,随后扩展Depth Transformer以适应多流建模(Q=16,输入/输出流各8层)。利用生成的40000小时粗对齐数据进行50万步的有监督语音翻译训练,再使用少于200小时的自然停顿合成数据进行精调,最后通过权重共享蒸馏将模型压缩至约3B参数。
  4. RL延迟优化:引入基于GRPO的单BLEU过程奖励机制。对于生成过程中的每个评估帧 \(t\),将模型已生成的文本与已完成源句对应的参考译文计算局部BLEU,并与整句BLEU通过 \(\alpha\) 加权得到过程奖励。以每 \(n_w\) 个源词为单位计算并标准化奖励,累加后续时间的标准化奖励作为优势值,使用PPO-style的剪辑目标(\(\epsilon=0.2\))更新策略。该方法仅依赖BLEU指导模型学习“何时开口”。
  5. 蒸馏与轻量化:在监督训练和RL阶段后,通过权重共享蒸馏减小模型尺寸,使得最终版本适合部署。推理时,模型以流式方式接收输入token,并在强制输入<EOS>(End-of-Sentence)后自回归生成,直至产生文本<EOS>

💡 核心创新点

  1. 无词级对齐的同时翻译训练范式:完全摒弃了词级/短语级对齐数据,仅用句子级对齐数据训练基础模型,再通过RL自主习得同时翻译策略,消除了为每种语言设计和计算对齐启发式的工程壁垒。
  2. 统一延迟与质量的单BLEU奖励RL设计:提出仅基于BLEU的过程奖励公式,将翻译质量与延迟隐式统一在同一信号中,避免了已有工作中多奖励分量组合带来的训练不稳及奖励黑客问题。
  3. GRPO适配多流RQ-Transformer:首次将GRPO算法用于多流离散音频token的生成场景,无需KL正则项即可稳定训练,降低了RL训练的复杂度和计算开销。
  4. 新语言快速适应流水线:展示了在不足1000小时数据下,通过微调+RL即可使新输入语言达到与Seamless相当的质量与延迟,并保持对原有语言的支持,具有强可迁移性和抗遗忘性。
  5. 高质量可控粗对齐数据合成:通过可控TTS,根据源说话人音色和随机化延迟指令生成带自然停顿的目标语音,为粗对齐预训练提供了高效、逼真的训练数据。

📊 实验结果

主要对比(Table 1)

测试场景模型法语西班牙语葡萄牙语德语
Short-form ASR BLEU↑Seamless
Hibiki
Hibiki-Zero
33.8
32.4
35.0
34.4

33.8
34.1

33.6
27.8

28.7
Long-form ASR BLEU↑Seamless
Hibiki
Hibiki-Zero
27.8
29.5
30.6
29.9

32.3
29.0

33.2
27.8

29.1
Long-form Spk.SIM↑Seamless
Hibiki
Hibiki-Zero
44.4
52.8
61.3
42.6

64.6
35.7

62.1
47.8

66.0
Long-form LAAL↓Seamless
Hibiki
Hibiki-Zero
6.2
6.8
6.1
6.5

5.6
6.6

6.3
7.3

5.9

人评结果(Table 2):Hibiki-Zero在音频质量、说话人相似度、自然度上全面大幅超越Seamless,在法语对上与Hibiki取得相当或更好的表现。评测采用MOS,范围0-100,每个模型收集约1000次打分。

新语言适应(意大利语, Table 3):经仅850小时微调+RL后,Hibiki-Zero在短表单ASR-BLEU达32.1,LAAL 3.5,与Seamless持平,同时说话人相似度大幅领先。重要的是,适应后的模型在原始四种语言上的性能几乎无退化。

消融实验:

  • \(\alpha\) 值控制过程奖励中整句BLEU与局部BLEU的权重,\(\alpha\) 越大翻译质量越高但延迟也越高,\(\alpha=0.4\) 时取得最佳折衷。
  • 过程奖励计算频率 \(n_w\) 在1到8之间对最终折衷影响不显著。
  • 直接用全句译文(无前缀)作为局部BLEU的参考会导致延迟优化困难,因奖励噪声过大。
  • 粗对齐阶段若句子间延迟等于完整句子时长(\(\delta_i = d_i\)),RL完全无法有效降低延迟,证明训练数据中必须存在早期翻译的信号(\(\delta < 1\))。
  • 不在句子间插入句内停顿(\(\mu=0\))也会导致更高的延迟。

🔬 细节详述

  • 训练数据:从大型多语言语料中提取400万条30-75秒的单人语音,Whisper large-v3转录,MADLAD-3B翻译,可控TTS合成目标语音,构建了40000小时以上的粗对齐多语言翻译数据;精调额外使用少于200小时的自然停顿TTS合成数据。音频预训练混合了约12%各源语言、50%英语等数据。合成目标语音用于评估的TTS包括ElevenLabs, Cartesia, Gradium等。
  • 损失函数:监督阶段为标准交叉熵;RL阶段为GRPO目标,即概率比 \(clip(\epsilon=0.2)\) 与累积标准化过程奖励的乘积。文本流权重 \(c_0=100\),音频流权重 \(c_{1...Q}=1\),以平衡二者损失规模。
  • 训练策略:文本主干初始化Helium-2B;音频预训练1M步,batch 144, lr=2e-4;粗对齐翻译训练50万步, batch 96, lr=3e-5;精调1K步, batch 16, lr=1e-6;蒸馏20K步;RL 2000步, batch 32, G=4, lr=2e-7, τ=20。所有阶段均用cosine调度、AdamW优化器, weight decay 0.1, β=(0.9,0.95)。
  • 关键超参数:Temporal Transformer 28层 dim 2048 (SiLU gate 8192),16头,局部注意力跨度3000 token(约4分钟上下文);Depth Transformer每个codebook 6层 dim 1024 (gate 4096),16头;Q=16(输入流加输出流编码);Mimi frame rate 12.5Hz;过程奖励 \(n_w=8, \alpha=0.4\);推理温度0.8,top-k 250,生成至多1500帧。
  • 训练硬件:未说明。
  • 推理细节:使用流式编码器接收输入token,生成语义、声学及文本流,声学token相对于语义token有2个时间步的延迟以对齐。输出<EOS>后停止。
  • 正则化/稳定技巧:蒸馏权重共享,训练时对输入流加噪声增强,显式建模输入<EOS>以终止序列。

⚖️ 评分理由

  • 创新性 (1.3/2):将同时语音翻译从依赖词级对齐解耦为“粗对齐预训练+RL策略精炼”,思路清晰,并首次将GRPO用于多流语音生成。但RL和架构均基于现有工作,范式转变的新颖性足够,但并非突破性技术里程碑。
  • 技术严谨性 (1.2/1.5):RL目标与过程奖励的数学表述清晰,消融实验覆盖了关键设计选择,并图示了过程奖励的计算流程。然而,过程奖励完全依赖BLEU,对奖励信号偏差和训练稳定性的深入分析不足,缺乏对策略梯度方差的定量评估。
  • 实验充分性 (1.1/1.5):与主流基线Seamless、Hibiki在多语言、长短表单及主观评测上进行了全面对比,新语言适应实验是亮点。但主要基线Seamless较旧,缺少与Seed LiveInterpret 2.0等更近工作及非英语目标语言的对比,且所有评测数据及训练目标语音均为合成数据,无统计显著性检验,限制了结论向真实场景的泛化性。
  • 清晰度 (0.8/1):整体结构清晰,图示有效。但RL部分符号定义和计算细节对读者不够友好,且关键硬件信息完全缺失,影响完整性。
  • 影响力 (0.8/1.5):为同时语音翻译提供了一种低数据依赖、易扩展的训练方案,在新语言适应上具有吸引力,代码和模型均已开源。但由于领域较窄且仅支持英语输出,影响力范围有限。
  • 开源 (1.2/1.5):提供GitHub代码仓库、HuggingFace模型权重以及45小时的多语言评估基准。但未公开大规模40k小时训练数据,扣减一定分数。
  • 可复现性 (0.4/0.5):超参数、训练步骤、数据配比、过程奖励计算方式均详列,可据此复现大致流程。硬件信息缺失,为此扣分项。
  • 工程/实践价值 (1.2/1.5):展示了从数据合成、多阶段训练到蒸馏部署的完整工程链路,显著降低了为新语言构建同时翻译系统的成本和复杂度,对产品化有参考价值。

🚨 局限与问题

论文明确承认的局限:

  • 无法控制生成语音中源语言口音的强度。
  • 翻译质量与延迟的折衷无法在推理时动态调整。
  • 仅面向英语作为目标语言。

审稿人发现的潜在问题与质疑:

  • 合成数据偏差:训练和评估均重度依赖合成目标语音与翻译文本(MADLAD-3B),模型可能学习到合成数据的分布偏差(如特定的翻译风格或韵律),在真实口语场景下的泛化性存疑。
  • 单奖励信号缺陷:单BLEU过程奖励虽简化了RL,但无法评价语音的韵律适切性、自然度或语义保真度,可能会鼓励逐字翻译或书卷气的表达,长期看可能损害语音翻译的自然对话感。
  • 基线对比不足:与2025年中后出现的Seed LiveInterpret 2.0等最新的、同样采用RL优化策略的S2ST系统缺乏直接比较,削弱了SOTA声明的说服力。
  • 尺度与目标语言单一:未探索从英语到其它语言的翻译任务,以及多对多翻译场景的扩展能力。
  • 论文中披露了潜在利益冲突:作者N.Z.和A.D.受雇于Gradium,而Gradium的TTS正是用于生成长文评估数据集的三个TTS引擎之一。

📷 论文图片


← 返回 ICML 2026 论文速递