英文题目:HW-TSC’s Submissions to the IWSLT 2026 Offline Speech Translation Task

会议身份:conference:iwslt:2026:conference-paper-id:2026.iwslt-1.9

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#SFT #大语言模型 #长音频处理 #语音 #语音翻译

评分:6.0/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Boqi Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Daimeng Wei:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiaxin GUO:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuanchang Luo:机构信息未能从会议 PDF 纯文本可靠映射
  • Hengchao Shang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zongyao Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhiqiang Rao:机构信息未能从会议 PDF 纯文本可靠映射
  • Jinlong Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhanglin Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu He:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiaoqing Lan:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理无预切分的长时英语语音到中文与德语文本的离线语音翻译(Offline Speech Translation),难点在于无语音活动检测(Voice Activity Detection,VAD)边界时长序列易幻觉,且句子截断误差会传导至翻译。该系统先以 Silero VAD 滤除非语音,再以流式自动语音识别(Automatic Speech Recognition,ASR)加约 12 秒上下文缓存产生带换行符的初排句子,接着以 Qwen3-ForcedAligner-0.6B 生成句子级时间戳。基于时间戳重切分为不超过 30 秒的片段后调用 Qwen3-Omni 做第二遍精转写,最后将文本合并为不超过 150 词元的语义块送入 Qwen3-8B 翻译。与单遍流式加标准机器翻译(Machine Translation,MT)的常规级联相比,关键差异在于用模型学到的语义边界替代人工切分并以长上下文同时约束识别与翻译。在 tst-2022 上完整流水线相对单遍基线英语到中文词错率(Word Error Rate,WER,越低越好)从 6.31% 降至 3.01%,翻译质量 COMET(越高越好)从 0.7924 提升至 0.8462;英语到德语 WER 从 6.54% 降至 3.25%,COMET 从 0.7409 提升至 0.7854。结论仅在 TED 类朗读演讲域与离线非实时条件下验证,重口音强噪声与多说话人重叠场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 第三方资源:https://github.com/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,哪些信息必须保留?

这篇论文处理的是离线语音翻译。输入是一段完整的长时英文音频,测试时没有人事先切好句子边界,音频可能是会议发言或媒体内容,包含静音、非语音片段、口音与快语速。目标是输出中文或德文的目标语言文本,参加的是英语到中文和英语到德文两个无约束赛道。无约束意味着允许使用大规模预训练模型与外部数据,重点考验在真实长音频与噪声环境下的鲁棒性。学习时必须保留 3 类信息。

第一是声学证据到文字的对应关系,转写错了后面翻译无法挽回。第二是句子与篇章边界,哪里换行、哪里停顿决定了翻译模型能看到多少上下文。第三是时间戳精度,它决定了第二遍重切音频时是否把一个完整语义单元放在同一个片段里。论文开场就交代输出形态是目标语言文本,评价用词错误率看转写,用 COMET 看翻译质量。后续所有模块都围绕这 3 类信息的传递展开,先过滤无效音频,再保证转写完整,最后给翻译足够上下文。

例子是为了帮助理解教学例子:比如一段 3 分钟的英文演讲,系统不能等听完全部才开始处理,也不能每 2 秒硬切 1 次,而是要边听边缓存历史,最后交出连贯的中文译文。

级联与端到端路线各自解决了什么,又留下了什么?

论文把相关路线分成两类。第一类是端到端模型,以 Whisper 与 SeamlessM4T 为代表,直接从语音生成译文。白话说就是一个模型包办听与翻。它的好处是结构紧凑,论文承认这类模型近年进展明显。但论文指出它们在数据可扩展性与无约束场景鲁棒性上仍有限制,特别是在零样本设置下容易出现幻觉,也就是音频中没有的内容被模型编造出来。

第二类是级联系统,先做自动语音识别,再做机器翻译。白话说就是先把英文语音听写成英文文字,再把英文文字翻成中文或德文。它的好处是灵活可解释,可以复用成熟的语音编码器与大语言模型。近年研究显示用大语言模型做翻译引擎比传统神经机器翻译在语义一致性上有提升。论文选择级联,正是因为 IWSLT 2026 测试集复杂,长音频与噪声多,需要把声学精度与语义连贯分开处理。

需要区分的是,论文没有声称级联在所有条件下都优于端到端,报告的比较只在自身基线与完整管线之间进行。

级联架构 × 端到端模型: 级联架构负责把任务拆成语音识别与机器翻译两段并分别优化,端到端模型负责从语音直接生成译文,二者对照的意义在于论文认为在无约束长音频与零样本幻觉控制上级联更具可解释性与可替换性,搭配大语言模型做翻译引擎后,级联新增的作用是兼顾成熟预训练模型的声学鲁棒性与篇章语义一致性。

论文的定位是工程优化的级联,而不是提出全新的翻译模型结构,创新集中在如何切分、如何对齐、如何合并上下文。

长音频无切分为什么难,幻觉与不一致从哪里来?

难点来自测试条件。系统拿到的是原始波形,没有官方分句。长语音有很强的上下文依赖,代词指代、省略与话题延续都跨越句子。如果按固定长度硬切,很容易从句子中间切断,识别器看到的是半句话,翻译器看到的也是半句话。另一个来源是无效音频。

长时间静音与非语音片段如果送入生成模型,模型可能在无意义输入上继续生成,造成幻觉转写。第三是感受野与语义完整性的矛盾。多模态大语言模型需要足够长的连续语音才能利用语言推理纠错,但 1 次送入过长又会带来计算与显存压力。论文把问题分解为 3 个待解决动作。第一是如何在流式处理中维持句子完整性。

第二是如何得到可靠的时间边界用于重切。第三是如何在翻译前恢复篇章级上下文。这 3 个动作分别对应后文的第一遍流式识别、强制对齐与分段合并。理解这一点后,就能明白为什么论文要做两遍转写,而不是把第一遍结果直接送去翻译。

整个管线如何从长音频走到目标译文?

管线按顺序分为 4 个大段。第一段是音频预处理,用 Silero 语音活动检测过滤静音与非语音,只把有效语音往后传,目的是减少冗余计算并防止在无意义片段上生成。第二段是两遍语音识别。第一遍是带上下文缓存的流式推理,用 2 秒为单位顺序处理并保留约 12 秒历史,输出带换行符的粗文本。接着用 Qwen3-ForcedAligner 对粗文本做细粒度时间对齐,得到句子级时间戳。

再按时间戳把音频合并重切为不超过 30 秒的连续片段,送入 Qwen3-Omni 做第二遍片段级精修。第三段是翻译前合并,把精修文本拼成不超过 150 词元的语义块。第四段是用 Qwen3-8B 大语言模型做翻译,输出中文或德文。

拿一个样本走完全程有助于建立直觉教学例子:假设输入是一段 5 分钟英文访谈,先被语音活动检测去掉开场静音,剩下有效语音进入流式识别,模型在遇到语义停顿时输出换行,对齐器记下每句话的起止时间,重切器把相邻短句拼成约二十多秒的片段做第二遍纠错,最后把纠错文本按 150 词元拼块翻译。

下面这段导读帮助你在看总览图时抓住主线,图中从左到右依次是输入、预处理、语音识别与机器翻译四大色块,语音识别框内部包含循环缓存、粗文本、对齐与精修的分支汇合,虚线表示时间戳作为控制信号同时影响重识别与合并,请按输入到输出的箭头顺序阅读并注意控制信号的走向。

看图路径: 1. 先从最左侧长音频输入沿箭头向右追踪到目标文本输出的主路径;2. 再看自动语音识别大框内第一遍流式识别、对齐器与第二遍片段识别的连接顺序;3. 确认虚线时间戳控制信号同时指向第二遍识别与翻译前合并模块;4. 对比预处理浅蓝框与翻译浅绿框的颜色分区与各自包含的子模块

原论文 Figure 1:The overall architecture of the HW-TSC offline speech translation system.

论文图 1。原论文 Figure 1:“The overall architecture of the HW-TSC offline speech translation system.”。

从像素可见的结构看,最左侧是长音频波形图标,接着是青色语音活动检测模块,中间浅蓝大框内从左到右是第一遍流式推理、对齐器与第二遍片段识别,第二遍下方外挂 Qwen3-Omni 小框,右侧浅绿框内是合并与翻译两个绿色模块,最终指向目标文本图标。顶部有一个 12 秒上下文缓存的循环箭头,两条虚线从对齐器引出,分别指向第二遍识别与合并模块,表明时间戳同时控制声学重切与文本合并。实线表示数据主路径从粗文本到时间对齐片段再到精修文本,虚线表示控制路径,这种数据与控制分离的设计是理解两遍策略的关键。

第一遍流式识别如何做到边听边保持句子完整?

第一遍的任务是在没有预切分的条件下产生语义完整的初始分段。白话解释流式语音识别,就是音频流进来一点就处理一点,而不是等整段结束。英文名是 streaming inference。白话解释上下文缓存,就是把最近的历史音频与已生成的文本前缀存下来,每次处理新块时一起送入模型。英文名是 context caching。

实现上用滑动窗口机制,以 2 秒为单位顺序处理,动态缓存区最大约 12 秒历史。触发输出的条件是模型生成换行符或到达音频块末尾。换行符不是随意添加的,模型在训练时被监督在完整语义单元末尾输出换行符,因此第一遍输出的不是固定长度块,而是语义完整的句子。这种句子感知分段为后续时间戳对齐提供了可靠文本基础。语音编码器来自 Qwen3-Omni,负责提取高层声学特征,文本骨干是 Qwen3-4B,负责自回归生成转写。

两者通过可训练音频适配器连接,声学表示经映射后通过提示嵌入机制替换特殊音频占位符的嵌入,实现语音与语言模型的直接融合。

流式语音识别 × 上下文缓存: 流式语音识别负责把长音频按 2 秒窗口顺序读入并逐步输出文字,上下文缓存负责保存约 12 秒的历史音频与已输出文本前缀,二者搭配的理由是长语音存在跨句依赖,单看当前小块容易断句与前后不一致,组合后新增的作用是在不等待整段音频的前提下维持句子级连贯,为后续对齐提供完整语义单元。

该阶段还承担了抑制幻觉的第一道防线,因为只有有效语音片段会被送入,而静音已被语音活动检测过滤,减少了模型在无意义输入上的生成机会。

对齐与第二遍精修如何纠正第一遍的错误?

对齐与精修是论文的核心。白话解释强制对齐,就是把已有的文字与波形逐句对准,算出每句话的开始与结束时间。英文名是 forced alignment,论文使用 Qwen3-ForcedAligner-0.6B 模型。它输入第一遍的粗文本与原始波形,输出句子级时间戳。白话解释第二遍转写,就是按新的时间边界把音频重切后再识别 1 次。

英文名是 second-pass transcription。操作是基于时间戳把音频合并重分为不超过 30 秒的连续片段,每个片段送入 Qwen3-Omni 做端到端识别。论文报告这种做法能有效纠正重口音与快语速片段的错误。关键洞察是重切边界比人工标注的官方分段更适配模型的感受野,因此在无官方分段的真实条件下,两遍策略的词错误率甚至能超过使用官方分段的单次识别。时间戳在这里起了控制作用,既指导音频重分段,也为后续翻译合并提供句子边界。

强制对齐 × 第二遍转写: 强制对齐负责把第一遍粗转写文本与波形在时间上对准并给出句子级时间戳,第二遍转写负责按时间戳把音频重切为不超过 30 秒的连续片段再用 Qwen3-Omni 重新识别,二者搭配的理由是第一遍的边界是文本语义边界而非声学最优边界,组合后新增的作用是用模型更适配的切分纠正口音与快语速片段的识别错误。

从计算角度看,第二遍是片段级独立推理,不再维持流式缓存,换来的是每个片段内部有完整声学上下文,适合大语言模型发挥语言推理纠错能力。

翻译前为什么要合并,不直接逐句翻译?

翻译模块的输入是第二遍精修后的英文转写。如果逐句送入翻译模型,每句只能看到孤立信息,代词指代与跨句逻辑会丢失。论文采用分段合并策略。白话解释分段合并,就是把多个精修短句拼成一个语义块,但限制最大长度为 150 词元。英文对应 segment merging。

白话解释上下文感知翻译,就是把整块源文连同提示一起送入大语言模型生成译文。英文对应 context-aware translation。实现上用 Qwen3-8B 分别处理英中与英德 2 个方向,合并时保持上下文连贯,同时避免输入过长带来的建模困难。论文比较了句子级翻译基线与合并后翻译,报告合并在两个语言方向上都提升了 COMET 分数。机制上是因为更大的语义块让模型能捕捉长距离依赖与跨句逻辑,减少语义碎片化。

需要说明的是,合并长度 150 是上限而非固定值,实际块大小取决于句子边界,论文未报告超过该上限时的截断细节。

分段合并 × 上下文感知翻译: 分段合并负责把精修后的短句按语义拼成不超过 150 词元的块,上下文感知翻译负责把整块源文 1 次送入 Qwen3-8B 生成目标语言译文,二者搭配的理由是逐句翻译会丢失篇章指代与逻辑衔接,组合后新增的作用是在控制输入长度的同时保留长距离依赖,缓解语义碎片化。

该模块的代价是输入变长带来的推理开销增加,以及一旦转写中残留错误,错误也会在更大上下文中传播。

语音适配器与翻译模型各自用什么数据与监督训练?

训练分为语音与翻译两条线。语音侧使用 6 个大规模语音数据集训练音频适配器并微调解码能力,包括 MuST-C V2、LibriSpeech、TED-LIUM 3、CoVoST 2、VoxPopuli 与 Europarl-ST,总时长 5236 小时。白话解释音频适配器,就是连接语音编码器与语言模型的轻量映射网络。英文名是 audio adapter。论文明确它不是现成组件,而是两层前馈多模态投影器,结构是线性层、ReLU 激活、Dropout 再加第二线性层,把 Qwen3-Omni 编码器的帧级声学表示映射到 Qwen3-4B 的隐层嵌入空间。

监督是标准的自回归交叉熵损失,目标转写中在完整语义单元末尾显式插入换行符,以训练句子感知转写能力。论文还提到用拼接相邻音频片段的数据增强来模拟连续无切分输入。关于参数冻结,论文只说明联合训练适配器与解码模块,未明确编码器是否冻结、学习率与训练步数,这些属于缺项,不应从模型名称推定。

音频适配器 × 大语言模型解码: 音频适配器负责把 Qwen3-Omni 语音编码器输出的帧级声学表示映射到 Qwen3-4B 的隐层嵌入空间,大语言模型解码负责在该嵌入条件下自回归生成带换行符的转写,二者搭配的理由是语音与文本表示空间不一致无法直接拼接,组合后新增的作用是让语言模型能直接利用声学证据做句子感知的转写与分句。

翻译侧为英中与英德分别训练两个 Qwen3-8B 模型,避免双语混合。英中监督微调阶段用约 400 万平行句对,对应约 5.54B 训练词元,另构建 12.8 万偏好对做对比偏好优化。英德监督微调阶段用约 0.9B 训练词元。训练数据是网络爬取双语文本与任务官方数据的混合。质量控制分多阶段,先用语言识别、长度比、异常字符过滤与句子去重等启发式规则去噪,再用语义对齐过滤丢弃低对齐分数句对,最后在官方任务数据上继续微调以适配领域与话语风格。论文未报告偏好优化的具体损失形式与超参数,这是复现时需要补的验证点。

在什么数据与指标上测,条件如何保持一致?

所有实验在 tst-2022 基准上进行,英中与英德的音频子集不完全相同,因此论文对 2 个方向分别报告词错误率与 COMET。语音模块用词错误率衡量,数值越低越好。翻译与集成系统用 COMET 衡量,数值越高越好。模型族统一为 Qwen3,预处理统一用 Silero 语音活动检测。语音评估分 2 个阶段。

第一阶段是理想条件下的模型选择,用官方真实分段建立性能上界,并测试把官方分段合并为不超过 30 秒长块的效果,以考察长距离依赖利用能力。第二阶段是真实无约束条件,从原始未切分波形出发,比较单遍流式基线与完整两遍管线。翻译评估固定使用最优两遍系统产生的转写作为输入,比较句子级翻译与不超过 150 词元的合并翻译。集成评估比较单遍加标准机器翻译的基线与完整管线。

硬件预算、解码超参数与统计显著性在现有证据中未报告,复现时应记录这些条件以保证公平。资源状态方面,本次收到的第三方链接状态为暂时不可达,因此不能断言代码当前已公开或不可用,只能说本次未能确认可达。

完整管线比基线好多少,数字在什么条件下成立?

先看翻译合并的效果。比较的问题是固定高质量转写输入时,句子级翻译与语义合并翻译谁的 COMET 更高,公平条件是同为 Qwen3-8B、同为两遍转写输出、仅合并策略不同,指标方向是 COMET 越高越好。原表显示合并在 2 个方向上均有提升,英中从句子级基线提升到合并后,英德提升幅度更大,说明跨句上下文对德文翻译同样重要。

sentence translationbaseline and ourproposed ap-
Qwen3-8B (Sentence-level)0.83970.7628
Qwen3-8B + Merging0.84620.7854

表后解释需要同时看到收益与代价。收益是合并让模型看到篇章逻辑,减少逐句翻译的碎片感。代价是输入变长与错误传播风险并未被量化,论文也没有给出未胜出项的失败样例。需要指出该表只覆盖翻译阶段,不能单独证明端到端最优,还需结合转写质量一起看。 下面用可重放的参数表把管线关键阈值放在一起,便于复现时对照检查。

比较的问题是各阶段的长度控制是否一致,公平条件是同一套离线管线,指标是原文明确给出的秒数与词元上限。表中数值均来自正文连续原句,单位保留原文写法。

模块输入步长上下文缓存重分段上限合并上限
流式识别与精修翻译管线2-second12-second30 seconds150 tokens

表后解释是这些阈值共同决定了声学感受野与语义窗口的平衡。2 秒步长保证流式效率,12 秒缓存维持跨句连贯,30 秒重分段给第二遍足够声学上下文,150 词元合并给翻译足够篇章上下文。

改变任一阈值都可能影响词错误率与 COMET,但论文未报告阈值敏感性,这是未评测边界。 最后用总体结果表收束可部署收益。比较的问题是在无官方分段的真实条件下,完整管线相对单遍基线在转写与翻译上带来多少可运行提升,公平条件是同一 tst-2022 音频子集与同一评价指标,词错误率越低越好,COMET 越高越好。

轨道语音策略转写词错误率翻译 COMET对照说明
En-ZhTwo-pass 相对 Single-pass3.01% 优于 6.31%0.8462合并翻译完整管线
En-DeTwo-pass 加合并翻译待验证0.7854合并翻译完整管线

表后解释是英中方向证据最完整,两遍把词错误率从 6.31% 降到 3.01%,对应 COMET 达到 0.8462,支持转写保真度提升直接带动翻译质量的判断。英德方向报告 COMET 为 0.7854,支持合并策略跨语言有效,但其转写细节在现有连续原句证据中不完整,应标注为待验证,不把自动指标当作人工评价。

哪些对照证明长上下文与第二遍是必要的?

论文做了两组关键消融。第一组是模型选择与上下文容量。在官方分段下比较 Qwen3-ASR-0.6B、Qwen3-ASR-1.7B 与 Qwen3-Omni,官方分段时词错误率分别为 7.31%、5.40% 与 5.55%,把官方分段合并为不超过 30 秒长块后分别降到 5.79%、3.93% 与 3.14%。这支持的判断是更大模型与更长语义上下文能显著提升识别精度,其中 Qwen3-Omni 声学建模与语言推理最强。限制是该组仍依赖官方边界,属于性能上界,不能直接代表无切分部署。

第二组是两遍策略验证。从原始波形出发,单遍流式基线词错误率为 6.31%,完整两遍为 3.01%,甚至超过官方分段下最优的 3.14%。论文解释为基于强制对齐的时间戳重切产生了比人工标注更适配模型感受野的边界。这是一个有限解释,显示而非证明所有人工边界都不如模型边界,因为未测量边界质量分布与对齐失败率。两组对照共同支持长上下文重要的趋势,但总体趋势不等于每组每步都成立,重口音与快语速片段的个案改善未单独量化。

还有哪些没有测、不能承诺的事项?

首先是成本与延迟缺项。论文未报告训练资源、推理开销、输出帧率与实际延迟,不能承诺两遍推理更快或更省。直观上两遍意味着更多计算,第二遍的 30 秒片段独立推理与 150 词元合并都会增加显存与时间,但具体倍数未测量。其次是统计与泛化边界。论文只在 tst-2022 上报告单点词错误率与 COMET,没有统计显著性、多次运行方差与人工评价,不同指标的差值不能混放,百分点与相对百分比也需区分。

英中与英德音频子集不同,跨语言数字不能直接比较大小。第三是模块失败条件未展开。例如语音活动检测漏检有效语音会怎样,对齐器在噪声下时间戳漂移会怎样,合并超过 150 词元时如何截断,这些都未报告。第四是开源与可运行区分。现有证据只给出模型名称与数据规模,没有给出代码权重是否可下载、第三方链接本次未能确认可达,因此不能写当前已公开。

缺失证据不是技术错误,但复现时必须补上延迟、对齐失败率与人工抽查,才能把自动指标的提升转化为可部署结论。

要复现这条管线,先做什么、参数如何保留?

复现应按数据流顺序搭建最小可运行链。第一步做语音活动检测,用 Silero 过滤静音,只保留有效语音,记录过滤比例以防漏检。第二步搭建第一遍流式推理,音频编码器取 Qwen3-Omni,文本骨干用 Qwen3-4B,中间接两层前馈适配器,推理时按 2 秒窗口顺序读入并维护约 12 秒历史缓存,输出带换行符的粗文本。第三步用 Qwen3-ForcedAligner-0.6B 对粗文本做时间对齐,得到句子级时间戳。第四步按时间戳合并重切为不超过 30 秒的片段,送入 Qwen3-Omni 做第二遍识别,得到精修文本。

第五步把精修文本拼成不超过 150 词元的语义块,分别送入已微调的 Qwen3-8B 英中与英德模型生成译文。关键超参数与信息条件必须保留:2 秒步长、12 秒缓存、30 秒重分段上限、150 词元合并上限、语音侧 5236 小时混合数据与换行符监督、翻译侧英中约 4,000,000 句对与 12.8 万偏好对、英德约 0.9B 词元。训练时需注意论文未明确编码器冻结与优化器设置,复现时应先固定适配器与解码器的联合训练假设,并记录学习率与步数以便对照。

评价时固定 tst-2022 划分,分别报告两方向的词错误率与 COMET,不把不同子集的数字混排比较。

何时值得尝试这套做法,还需补哪项验证?

当任务是长时无切分、允许离线多遍处理、且转写错误会显著拖累翻译时,这套做法值得尝试。它的适用条件是能承担串行推理成本,并能获得可靠的强制对齐器。如果场景要求低延迟流式输出或端到端单模型部署,则两遍重识别与大块合并的开销可能不合适。复现后还需补三项验证。一是阈值敏感性,扫描 12 秒缓存、30 秒重分段与 150 词元合并的变化,观察词错误率与 COMET 的权衡。

二是鲁棒性抽查,在噪声、重口音与快语速子集上分别统计对齐失败率与幻觉率,避免被平均指标掩盖。三是成本测量,记录端到端延迟、显存峰值与第二遍调用次数,把质量收益换算成单位成本。总的来说,论文用可核对的对照说明了一个工程判断:在无约束离线条件下,把切分问题交给模型自身的语义换行与时间戳重切,比依赖固定切分或人工边界更能兼顾声学精度与篇章连贯,而翻译前的语义合并是把转写保真度转化为翻译质量的关键一步。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 iwslt-2026 论文汇总