DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs
📄 DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs #语音翻译 #流式处理 #多模态模型 ✅ 7.8/10 | 前25% | #语音翻译 | #流式处理 | #多模态模型 | arxiv 学术质量 5.7/7 | 影响力 1.6/2 | 可复现性 0.5/2 | 置信度 高 👥 作者与机构 论文作者是Sara Papi和Luisa Bentivogli,隶属于意大利的Fondazione Bruno Kessler (FBK)。 💡 毒舌点评 这篇论文提出了一个简单而有效的思路:既然decoder-only的SpeechLLMs没有显式的交叉注意力,那能不能从自注意力中“借用”对齐信号来做流式决策?答案是“可以”,而且效果还不错。核心思想(从自注意力矩阵中截取前S列作为代理交叉注意力)直观且易于实现,实验也证明了其在长时序翻译上的有效性,甚至优于一些AED基线。然而,方法的“新颖性”更多体现在“首次将”这个概念应用于该架构,而非方法论上的重大突破。实验虽然充分,但局限性(如单一源语言、缺乏计算延迟分析)限制了结论的普适性。总体是一篇扎实的、解决实际问题的系统论文,但离改变范式还有距离。 📌 核心摘要 本文针对decoder-only架构的语音大语言模型(SpeechLLMs)在长时序同步语音翻译(SimulST)中的应用,提出了一种名为解码器注意力策略(DOA)的无训练方法。该方法的核心思想是,从decoder的自注意力权重中提取一个代理交叉注意力矩阵,用以推断生成文本与源音频的对齐关系,并基于此对齐信号动态决策读取和生成时机。研究旨在回答一个关键问题:decoder-only模型的自注意力是否能像encoder-decoder模型的交叉注意力一样,提供足够稳定的对齐信号以指导流式推理?在Phi4-Multimodal和Qwen3-Omni两个开源SpeechLLMs上的实验表明,DOA策略能够有效地支持低延迟的长时序SimulST,生成质量接近离线解码,且无需对模型进行任务特定的重训练。此外,研究发现基于标点符号的文本历史选择策略在decoder-only架构上优于传统的固定词数策略。 🔗 开源详情 代码:https://github.com/hlt-mt/simulstream (Apache 2.0 License) 模型权重: Phi4-Multimodal: https://huggingface.co/microsoft/Phi-4-multimodal-instruct Qwen3-Omni: https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct SeamlessM4T (基线): https://huggingface.co/facebook/hf-seamless-m4t-medium 数据集: MCIF (测试集):作为IWSLT评测数据集公开,论文中未提供直接链接。 ACL 60/60 (开发集):作为IWSLT评测数据集公开,论文中未提供直接链接。 复现材料:论文在附录A中提供了详尽的实验设置��包括所有模型的具体版本、权重、推理提示模板、超参数(\(f\)值范围、音频块大小、最大音频长度、最大生成令牌数、最大文本历史长度)以及硬件环境信息。 论文中引用的开源项目: SimulStream toolkit: https://github.com/hlt-mt/simulstream (推理框架) OmniST-Eval: https://github.com/CTTAT/OmniST-Eval (用于计算LongYAAL, LongLAAL) StreamAtt: (基线方法,原始代码库未在本文中提供直接链接) HuggingFace Transformers: https://github.com/huggingface/transformers (实验所用版本见表1) 🏗️ 方法概述和架构 DOA(Decoder-Only Attention)是一个无训练的流式推理策略,旨在将现成的decoder-only SpeechLLMs应用于长时序同步语音翻译(SimulST)。其核心是将解码器的自注意力(self-attention)机制重新解释为源-目标对齐的信号,并基于此对齐信号构建一个读写决策策略。该方法包含两个主要部分:流式策略设计和长时序适应。 ...