英文题目:CUHKSZ Simultaneous Speech Translation System for IWSLT 2026

会议身份:conference:iwslt:2026:conference-paper-id:2026.iwslt-1.13

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#LoRA #高效推理 #多语言 #流式处理 #语音翻译

评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Zeyu Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Satoshi Nakamura:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

同时语音翻译(Simultaneous Speech Translation,SimulST)要求在无切分长音频流式到达时增量输出目标语言文本,难点在于无先验句子边界下的读写时机与计算感知延迟约束。作者以原生对齐音文大模型Qwen3-Omni-30B-A3B为单骨干,先用文本指令模型Qwen3-32B合成伪平行译文并切分为句法感知块,再以低秩适配(Low-Rank Adaptation,LoRA)只微调语言侧思考器(Thinker)使其在声学前缀不完整时自主输出等待符 <wait>。推理时轻量流式智能体以固定音频窗多轮对话驱动经vLLM服务的模型,并用最小提交长度、尾部截断、空格归一化等护栏控制提交。该路线与级联编码器-投影-解码器方案的机制差异在于取消显式投影与外部启发式策略,将对齐与时机内化为模型生成行为。在官方MCIF开发集919个无切分样本上,低延迟英译中达到40.46 BLEU、73.54 XCOMET-XL且计算感知延迟为1954 ms,高延迟英译德达到30.54 BLEU、86.56 XCOMET-XL且延迟为2288 ms。该结论仅在该开发集与单卡A800贪婪解码设置下验证,未报告盲测集成绩与统计显著性。原文未披露训练时长、推理成本与失败案例。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,本文解决了哪段链路?

本文的输入是连续且没有人工句子切分的英文语音流,时长可达数十分钟,输出是中文或德文的增量文本翻译。目标是在说话人还在说话时就不断提交译文,用于直播口译与广播字幕这类场景。必须保留的信息包括源音频的时间推进、已提交的译文历史、以及模型真实计算耗时,因为官方用计算感知的长音频延迟协议来考核。

输出不是等整段音频结束后再 1 次性翻译,而是读一点音频就决定读还是写。如果决定写,就向评测器提交一段目标语言文本;如果决定读,就再等下一个固定时长的音频块。这种边听边决策的链路是全文的学习对象。举例来说,听到英文前半句主语尚不完整时,正确动作是等待而不是猜测补全。

同时传译 × 计算感知延迟: 同时传译的分工是在源语音还没有说完时就开始产生目标语言文本,追求边听边翻;计算感知延迟的分工是把模型真实推理耗时计入延迟,不只计理想等待音频的时长。搭配理由是无切分长音频下如果只算音频等待会低估单卡大模型的负担,组合意义是所有读写决策都必须在包含解码开销的预算下被检验。

论文把任务难点归纳为两点。第一是无切分条件,没有可靠的句子边界可以直接套用离线切句翻译。第二是延迟度量包含推理时间,在单卡上跑大模型时每 1 次调用的开销都会直接转化为延迟。因此方法必须同时回答何时等待的语言学判断,以及每次调用做多少计算的工程控制。

已有路线为什么在单卡流式下会变重?

相关的已有路线是把声学编码器、文本解码器和连接两者的投影模块组合起来。声学部分负责把语音变成向量,投影部分负责把语音向量映射到文本词向量空间,文本部分负责生成译文。这条路线在离线评测中有效,因为可以分段调用且不严格计入流式等待。

在流式条件下,每来一个音频块都要经过多个模型的前向,投影层又把组件紧耦合在一起,整体显存与时间占用难以压缩到严格的延迟预算内。另一个限制是数据瓶颈,高质量的语音到翻译平行语料比纯语音识别文本或纯文本数据少一个数量级,难以支撑对数十亿参数解码器的大规模全量适配。

原生对齐 × 级联架构: 级联架构的分工是把声学编码器、投影层和文本解码器分开训练再拼接,投影层负责桥接两种表示;原生对齐的分工是在大规模多模态预训练中就把音频和文本表示融合在一起。搭配理由是流式下多次跨模型前向和投影耦合会放大延迟,组合意义是本文用单个 Qwen3-Omni-30B-A3B 替代编码器加投影加解码器的管线以减少推理路径。

本文的对照思路不是改进投影层,而是换掉整条组合管线。做法是使用已经在多模态预训练中融合音频与文本表示的单个大模型,再在外层包一个轻量执行器。这样读写时机的学习与延迟控制被拆开,前者由模型参数承担,后者由执行器的块大小与发射规则承担。

无切分与计算感知给方法提了什么具体要求?

无切分要求系统自己在音频流上维护窗口与历史,不能依赖外部给出的句子起止点。系统需要处理跨句的连续波形,在收到结束标志前不断循环,并在结束后来一个排空循环把声学尾巴翻完。历史不能无限增长,否则提示变长会拖慢每一步推理。

计算感知要求每一步的模型调用、提示长度与输出长度都受预算约束。字符级的延迟惩罚意味着不能频繁提交单个字符,因为每次调用都有固定开销。同时输出必须避免分词假象,例如中西文交界多余空格,否则会被质量指标惩罚。

因此问题被分解为 3 个可操作的子问题。第一是如何让模型在语义不完整时主动输出等待信号。第二是如何用固定块输入与有界对话历史把单步计算量封顶。第三是如何在不改流式逻辑的前提下注入外部上下文以改善科学词汇。

系统全景:一次音频块进来后经历了哪四个区?

全景可以按一个样本走一遍。假设一段未切分的英文会议音频不断流入,系统先按固定时长切块,例如低延迟英中用 0.92 秒左右。每一块作为 1 次新的用户轮次送入模型,同时系统提示中带有任务指令、翻译方向、风格约束以及从论文抽取的实体或摘要。模型 1 次调用只产生一段输出,执行器据此决定读还是写。

下面这张原图把上述流程画成 4 个区,读图时先看从输入经主干到策略再到发射的主箭头,然后再看红色虚线返回读下一块的回路,这样才能理解等待不是丢弃而是移窗重读。

看图路径: 1. 先从左到右沿未切分音频流经固定块滑窗到系统提示的箭头看主路径;2. 再看音频编码器冻结与语言 Thinker 做 LoRA 微调两条支路如何汇入同一次模型调用;3. 接着看策略菱形向右写出与向下红色虚线返回读下一块的分叉条件;4. 最后看三个发射过滤器串联到评估器的顺序

原论文 Figure 2:The end-to-end streaming pipeline of the CUHKSZ SimulST system.

论文图 2。原论文 Figure 2:“The end-to-end streaming pipeline of the CUHKSZ SimulST system.”。

从像素可见,第一区是输入与上下文,左侧是未切分波形与滑窗固定块,右侧是论文元数据注入到系统提示;第二区是原子主干,音频编码器标注冻结而语言思考器标注可调,且语音合成与视觉模块关闭以省显存;第三区是内部策略菱形,向上是模型输出,向右是有效目标语言文本则写,向下红色虚线是输出等待或非法则读并移窗;第四区是 3 个串联的发射守卫,分别做最小长度检查、尾部截断与空格归一化,最后送往评估器。读完图后再看正文,可以把 4 个区对应到后文的组件与训练小节,执行器只做执行而不学习时机,时机由微调后的主干输出等待符号来内化。

主干与执行器各自做什么,为什么这样分工?

主干是 Qwen3-Omni-30B-A3B,其中音频编码器参与前向但参数冻结,语言思考器插入低秩适配器进行训练,语音合成与视觉分支在训练与推理中关闭。关闭的理由是任务只从音频到文本,不经过这些模态,保留它们只会增加显存与计算图开销。激活参数量级为三 B 的混合专家结构,被描述为可在单卡的紧预算下运行。

执行器是一个轻量循环,用贪心解码调用模型,把最近 16 轮或 20 秒音频之外的历史裁掉。每个音频块到来时先做读控制,若剩余未处理音频不足一块则等待;否则取当前窗口构造消息并调用 1 次模型。若输出为空、不含目标语言字符、与上一轮重复或陷入近期循环,则计为读动作并移窗。否则把输出拼入缓冲,再经过发射守卫决定是否提交。

句法感知分块 × <wait>标记: 句法感知分块的分工是按依存结构把源文切成语义相对完整的块,保证每块可独立判断能否翻译;<wait>标记的分工是模型在声学前缀信息不足时输出的控制符号,表示本次不提交而继续读。搭配理由是固定时长切分会切断语义而需要语言结构指导何时等待,组合意义是把读写的时机监督从外部启发式变成模型可学习的输出行为。

这种分工的理由是把语言学判断留给大模型,把计算量控制留给确定性代码。模型学会在前缀不可提交时输出等待符号,执行器只拦截该符号而不重写策略。好处是切换延迟档时一般只需改块时长而不必重新训练,论文用一条权衡曲线证明了这一点。

三个发射守卫与排空逻辑如何避免被指标惩罚?

第一个守卫是最小长度检查,要求待提交缓冲达到字符阈值才考虑输出,避免在字符级延迟惩罚下做昂贵的单字提交。第二个守卫是尾部裁剪,剥离句末标点之后的不完整片段并放回缓冲,只保留完整语言短语。第 3 个守卫是空格归一化,删除中西文交界处的虚假空格,论文指出否则会造成严重的人工质量下降。

收到源结束标志后,执行器进入简短排空循环,此时绕过目标语言检测,确保声学尾巴不被丢掉。测试中空输出被报告控制在极低比例,且仅出现在超短尾部,这支持了守卫没有过度拦截有效输出的判断。

需要区分的是,守卫不决定读写的语言学时机,只决定已接受输出中哪部分现在可以交给评测器。时机仍由主干的等待输出决定,守卫只是在写动作内部做 2 次过滤。这种两层结构让延迟与质量的折中更清晰,调块大小主要影响延迟档,调守卫阈值主要影响提交粒度。

训练数据从哪里来,等待监督如何一次生成?

所有训练音频只来自官方受限加语言模型名单中的 4 个语料,分别是朗读语音、有用户贡献的单句语音、多语言议会语音,以及唯一自带人工英德对照的语料。前三者只有英文文本没有目标译文,因此用指令模型合成中德目标,把丰富的英文转录变成伪平行监督。合成与分块对齐被放在同一管线内完成,而不是事先准备好离线平行库。

统一标注的做法是用单个文本大模型 1 次调用同时产出源端句法分块、块级双语对齐、目标侧必要重排,以及块边界的等待决策。输出是结构化数据,每个源块对应一段部分翻译或字面的等待符号。约束包括每块至多 7 个源词、源块拼接等于原文、非等待目标块拼接等于参考译文、最后一块不能是等待。时间戳则由语音识别模型对源文本做强制对齐得到,这是管线中唯一的非语言模型信号。

低秩适配 × Thinker 模块: Thinker 模块的分工是 Qwen3-Omni 中负责语言理解与生成的部分,承担目标语言生成和<wait>发射;低秩适配的分工是以小参数增量只调整该模块而不动音频编码器。搭配理由是在受限数据下全量微调 30B 级解码器不现实且会破坏已有的语音理解能力,组合意义是把全部适应容量集中到需要学新行为的语言侧。

质量过滤用 4 个维度加权,分别是时间戳完整单调性、文本长度复杂度与完整性、对齐一致性,以及整句读写比是否接近约 3 比 1 的语料均值。只有总分超过严格阈值的样本被保留,同时按类别保留固定比例的边界样本,例如极短极长、疑问句、多块句与特殊标点,以防分布过窄。微调时每个目标语言训练一个独立的低秩检查点,架构与超参数相同,仅合成目标语言与系统提示中的目标语言字符串不同。

在什么数据、指标与硬件条件下比较延迟与质量?

评测在官方无切分开发集上进行,共 919 个未切分话语,另有盲测集。质量用跨语言质量估计与词面重合度两类指标,延迟用包含硬件解码时间的计算感知长音频指标。所有比较都按低延迟 0 到 2 秒与高延迟 2 到 4 秒两档组织,硬件为单张显卡。推理时主干经由高吞吐服务框架提供,执行器只调块时长这一个延迟主参数。

LongYAAL × XCOMET-XL: LongYAAL 的分工是度量无切分长音频下的计算感知延迟,包含硬件解码时间,数值越小表示实时性越好;XCOMET-XL 的分工是度量翻译质量,数值越大表示越好。搭配理由是同传必须同时看质量与延迟,组合意义是论文用两档延迟上限组织所有主结果与权衡曲线。

公平条件的关键是块时长与上下文窗口在同一档内固定,历史裁剪与贪心解码保持一致,额外上下文只通过系统提示注入而不改流式逻辑。低延迟子赛道注入约 40 词元的启发式命名实体,高延迟注入约 300 词元的全文摘要。这种设计让主赛道与子赛道的差异只来自提示中的先验,而不是不同的解码器。

复述时要注意指标方向不同,质量越高越好而延迟越低越好,且延迟是计算感知而非纯音频等待。因此不能把块时长直接当延迟,真实延迟还包含每步调用与输出长度带来的开销。

主结果:在两档延迟下质量与延迟各是多少?

比较的问题是,在相同的无切分开发集与相同的计算感知协议下,系统在两档延迟上限内能否同时满足延迟并给出有竞争力的质量。公平条件是同一主干与同一执行器,只换目标语言与块时长。指标方向是质量越高越好,延迟越低越好。

下表是原文的结果矩阵,保留了主赛道无上下文与子赛道注入上下文的对照,以及计算感知延迟。阅读时先看语言对与延迟档,再看质量与延迟是否同时达标,不要把不同延迟档的数字直接比较为模型能力差异,因为它们对应不同的块大小与等待预算。

Pair Regime Target CALatency Context Prompt XCOMET∆ BLEULongYAALCA
None (Main Track)73.5440.461954
None (Main Track)75.7442.142164
None (Main Track)85.0427.721721
≤2000 Entities (Sub-track)84.6328.421649
None (Main Track)86.5630.542288
≤4000 Abstract (Sub-track)85.9330.222135

表后解释需要同时看到收益与代价。从主赛道看,从低档到高档质量稳定提升,英中与英德都证明显著增益,说明放宽预算后模型能利用更多声学上下文。子赛道的注入在英中带来一致的词法保真提升,高延迟档增益更大,而在英德出现轻微负向质量变化,但子赛道延迟反而更低,论文解释为提前提交消歧实体减少了重复重读。这是一个典型的质量与延迟交换而非单边胜利。

为便于按语言对复述,整理如下宽表把两档的数字放在同一行系中,单位保留原文写法,延迟均为计算感知。阅读时注意英中的质量基数高于英德,但这不代表英德更差,因为目标语言难度与指标尺度不同。

语言对延迟档BLEUXCOMET-XL计算感知延迟
En→Zh0–2 s40.5 BLEU73.5 XCOMET-XL1.95 s
En→De0–2 s27.7 BLEU85.0 XCOMET-XL1.72 s
En→Zh2–4 s42.1 BLEU75.7 XCOMET-XL2.16 s
En→De2–4 s30.5 BLEU86.6 XCOMET-XL2.29 s

表后补充一个未胜出项以避免只报喜。英德子赛道的额外上下文没有带来质量正增益,说明零样本注入并非对所有语言对都有效。复现时若只在英中上验证上下文收益,会高估方法的通用性,必须同时报告英德的负向或持平结果与延迟变化。

下面这张原图展示了只改块时长而不重新训练时的质量延迟权衡,读图时先确认横轴是计算感知延迟而非块时长本身,纵轴分别是词面分与模型估计分,再看每个点旁标注的块时长如何推动延迟移动。

看图路径: 1. 先确认四个子图的行列布局是英中与英德分别对应 BLEU 与 XCOMET 随延迟变化;2. 再沿横轴计算感知延迟从小到大看纵轴指标的升降并读出每个点旁标注的块时长;3. 比较英中曲线在中间段的回落与英德曲线的单调爬升有何不同

原论文 Figure 3:Quality–latency trade-off curves parameterized by chunk_sec.

论文图 3。原论文 Figure 3:“Quality–latency trade-off curves parameterized by chunk_sec. The model gracefully traverses the operating space without retraining.”。

从像素可见,上排英中两条曲线在小块时快速爬升,随后在中等块区间出现回落再回升的非单调形态;下排英德两条曲线随块增大总体爬升更平滑,大块后趋平甚至轻微回落。所选工作点位于曲线的自然拐点附近,既压住延迟上限又拿到大部分质量增益。论文还报告改变块大小不改变等待比例,支持了等待策略已内化而非依赖固定切分的判断,但像素不能精确读出每个点的数值,复述时只讲趋势与工作点选择,不硬写图中未标注的中间值。

只改块大小会发生什么,策略是否真的内化了?

要检验的问题是,读写策略是否已经进入模型参数,还是仍依赖外部启发式阈值。操作是固定同一个微调检查点,把音频块从 0.64 秒扫到六点 4 秒,观察质量与计算感知延迟的轨迹。条件一致性在于训练完全不变,只在推理时换块大小。

结果显示模型能平滑遍历工作空间而无需重新训练,所选低高档工作点恰好落在曲线拐点处。这支持了策略内化的解释,因为如果等待仍由外部规则硬编码,换块大小时往往需要重调阈值才能保持单调。另一个证据是等待比例不随块大小改变,说明模型按语言完整性而非固定边界做决策。

为把运行条件讲清,整理如下宽表列出论文报告的实际可运行配置,块时长是唯一延迟主参数,其余为固定执行细节。阅读时注意块时长越大一般延迟越高但调用次数越少,因此延迟不是块时长的线性函数。

语言对延迟档chunk_sec上下文窗口解码方式
En→Zhlow-latency0.92 s16 turns or 20 s of audiogreedy decoding
En→Delow-latency1.60 s16 turns or 20 s of audiogreedy decoding
En→Zhhigh-latency1.28 s16 turns or 20 s of audiogreedy decoding
En→Dehigh-latency2.56 s16 turns or 20 s of audiogreedy decoding

表后必须指出限制。英中曲线的非单调回落表明增大块并不总是提升质量,可能与长块下的缓冲与截断交互有关。论文没有给出拿掉某个守卫后的对照,因此不能断言每个守卫各自贡献了多少增益。复现时应保留全部守卫再做单变量替换,否则无法归因。

哪些结论尚未被验证,哪些边界没有测?

论文直接报告的是开发集上的质量与计算感知延迟,以及额外上下文在英中上的正增益与英德上的轻微负增益。这些是测量值,可以复述为报告或显示。把上下文增益解释为实体消歧减少重读,属于有限解释,因为没有词级对齐或消融来证明因果,只能写为支持或可能。

未验证的推测包括合成目标的质量上限、单次大模型标注的一致性误差,以及长尾口音与噪声下的鲁棒性。训练只保留了二十二万块级样本,过滤阈值与边界样本配额的具体数值在附录表中,正文没有展开误判率或每步延迟分布,因此不能承诺误翻率或最坏延迟得到改善。

另一个边界是硬件与服务依赖。结果基于特定显卡与高吞吐推理框架,换硬件后计算感知延迟会变化,权衡曲线的拐点位置也可能移动。复现时应固定硬件型号与批量设置,并重新校准块时长,而不是直接照搬秒数。

要复现先做什么,需要哪些数据与参数?

先按名单准备 4 个英文语音语料与唯一的英德人工对照,其余目标用同系列指令模型合成。合成后用同一文本大模型 1 次生成分块、对齐、重排与等待标记,并施加每块至多七词、拼接一致、末块非等待的约束,再用识别模型做强制对齐得到时间戳。过滤时保留总分高且读写比接近 3 比 1 的样本,并按比例保留极短极长与特殊标点等边界类。

训练时冻结音频编码器,只在语言思考器插入秩为 16 左右的低秩适配器,每个目标语言独立训练。推理时关闭语音合成与视觉分支,用贪心解码并把历史裁到最近 16 轮或 20 秒音频。低延迟与高延迟只改块时长,英中与英德分别使用不同的秒数,收到结束标志后加排空循环。

资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码模型或数据已公开。复现前应先确认能否获得主干权重与评测脚本,再补做守卫消融与不同硬件下的延迟重测。

何时值得尝试这种做法,记住哪条链路?

当任务是无切分长音频、延迟预算包含真实推理时间、且平行语音翻译数据不足时,这种做法值得尝试。记住的链路是合成目标解决数据瓶颈,句法分块加等待标记解决时机监督,冻结编码器加语言侧低秩解决大模型适配,固定块加有界历史加 3 级守卫解决计算感知控制。

适用条件是单卡可运行原生音频大模型,且能接受按语言对训练独立适配器。额外上下文只建议作为系统提示注入,不改流式逻辑,低延迟用命名实体而高延迟用摘要。若目标语言与英语语序差异大,应先在小规模上验证上下文是否带来负增益,再决定是否启用。

还需补的验证是守卫各自的贡献、合成偏差对实体翻译的影响,以及更长会议音频下的历史裁剪策略。总体趋势不等于每一步都成立,调大块时长前应在开发集上重画权衡曲线,找到当前硬件下的拐点后再锁定提交点。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 5 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 5 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 5 页

区域 3 · 查看论文原页

原文数学表达区域 4,PDF 第 5 页

区域 4 · 查看论文原页

另有 7 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 iwslt-2026 论文汇总