英文题目:HW-TSC’s Submission to the IWSLT 2026 Subtitling Track

会议身份:conference:iwslt:2026:conference-paper-id:2026.iwslt-1.10

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#自回归模型 #大语言模型 #流式处理 #语音识别 #语音翻译

评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Xiaoqing Lan:机构信息未能从会议 PDF 纯文本可靠映射
  • Daimeng Wei:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiaxin GUO:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuanchang Luo:机构信息未能从会议 PDF 纯文本可靠映射
  • Hengchao Shang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zongyao Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhiqiang Rao:机构信息未能从会议 PDF 纯文本可靠映射
  • Jinlong Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhanglin Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Boqi Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu He:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为英语长音频与低质量视频轨,输出是满足每块至多两行、每行至多16字符、每秒至多9字符的中文字幕,难点在于口语冗长与高信息密度新闻文本难以同时兼顾翻译保真、可读速度与时间同步。方法链第一步是基于Qwen3系列的流式语音识别负责切分长音频并生成带词级时间戳的英文转写,结合语音活动检测、滑动窗与强制对齐保证时间精度。第二步文本预处理按句末标点合并碎片并按英中长度先验做贪心重组形成可翻译单元,保持时间戳不变为翻译提供规范输入。第三步机器翻译保持时间戳不变生成中文初稿后由大模型压缩改写负责修复超限片段,采用先松后紧两阶段策略保留专有名词与核心语义。相对传统级联方案的关键差异在于以同一系列大模型统一识别对齐翻译压缩,并将压缩约束与翻译保真联合考虑,从而减少误差传播并提升合规性。在IWSLT2026开发集英译中ITV任务评测设置下,启用压缩条件的SubER指标为62.94,低于未压缩基线条件的SubER指标63.50。结论适用边界仅在英译中与三类新闻综艺语料开发集上验证,向多语与强噪声重叠语音的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,哪些信息不能丢?

这篇论文处理的是英语发音的长视频音频,目标是生成中文配字幕文件。输入只有音频轨,视频轨画质低,只用来核对时间同步和显示效果,不能靠画面补语义。输出不是一段流畅译文,而是带开始与结束时间戳的字幕块序列,每个块要能直接上屏播放。

对初学者,先建立字幕与普通翻译的区别。普通机器翻译只关心译得准不准,字幕还要关心能不能在规定时间内读完、会不会遮挡画面。原文把合格中文块定义为 3 个硬约束的交集:每块最多两行,单行最多 16 个汉字,阅读速度最多每秒 9 个汉字。合规程度用达标块占全部块的比例来量化。

必须保留的信息有两类。一是语义核心,尤其是人名、地名、国名、机构名等专有名词,压缩时不允许改写或省略。二是时间信息,从语音识别阶段产生的词元级时间戳要一直带到翻译和压缩,压缩只改字不改时间。输入是连续英语口语,中间表示是带时间戳的英文文本块,目标是中文文本块,输出是满足显示约束且时间不变的中文 SRT 类文件。

本文采用无约束条件下的级联路线。所谓无约束,指可以使用外部大模型而不只限于官方数据。级联指分步做识别、预处理、翻译、压缩,每步独立运行。学习依赖是先理解任务约束,再看系统如何保证时间准,最后看如何把超长译文压短而不丢专有名词。

级联与端到端两条路线各解决什么问题?

自动字幕的传统做法是级联流水线。按原文回顾,一般依次完成语音识别、字幕切分、机器翻译和文本压缩。好处是每个子任务可以独立选模型和调阈值,时间戳和译文质量分开治理。坏处是前一步错了会传到后一步,例如识别错一个词,翻译和压缩都跟着错,这就是级联的误差传递问题。

另一条路线是端到端。目标是在统一框架内从音频或音视频直接生成字幕,实现多子任务联合学习与优化。原文引用了相关工作来说明这种思路能缓解误差传递,但也意味着需要统一建模声学、语言和版式约束,实现门槛更高。

本次比赛背景值得单独说明。国际口语翻译会议自 2023 年起开设自动字幕任务,要求同时满足时间对齐、合理切分和阅读速度。2026 年取消了单独的文本压缩赛道,把目标语扩大到包含中文和日语的多语设置,并对不同语言细化了字数与语速限制。本文只报告英译中方向。

级联策略 × 端到端策略: 级联策略负责把语音识别、字幕切分、机器翻译和文本压缩拆成独立模块依次执行,便于分别优化时间戳和译文;端到端策略负责在统一框架内从音频直接生成字幕,以联合优化减少模块间误差传递;本文选择级联是因为要复用 Qwen3 在识别与翻译上的现成能力,并把合规压力集中到最后的压缩改写阶段处理。

对刚入门的读者,记住对照维度:同输入都是英语长音频,同目标都是可上屏中文块,同运行阶段都是离线生成文件。类别差异本身不能当胜负证据,本文也没有报告同数据下的端到端对比,因此不要把选择级联理解为证明级联优于端到端。

为什么识别加翻译的直出字幕往往不合格?

语音识别加机器翻译的直接输出通常是忠实但冗长的。口语里有重复、修正、填充词,逐字翻成中文后长度容易超过屏幕宽度和阅读速度。受视觉显示限制,字幕要适配播放节奏和观众阅读速度,所以压缩是必需环节,而不是可选美化。

以中文为例,不合格有 3 种典型形态。一是块内行数超两行,会纵向遮挡过多画面。二是单行超 16 字,会横向溢出或字号过小。三是语速超每秒 9 字,观众在该块播放时长内读不完。原文的处理逻辑是先定量算出每条字幕的实际播放时长,再自动找出超长或超速的片段,只对这些片段改写,合格片段不动。

每秒字符数 × 每行字符数: 每秒字符数负责约束阅读速度,即字幕显示时长内平均每秒呈现多少个汉字,中文上限为 9;每行字符数负责约束显示空间,即单行最多放多少个汉字,中文上限为 16;两者必须与每块最多两行一起同时满足,因为行数管纵向遮挡,行宽管横向溢出,语速管观众能否读完,缺一都会被判不合规。

教学例子要明确标为例子:假设某块中文译文 34 字,时长 3 秒,则语速约 11.3 字每秒,同时总字数也超过 32 字的压缩提示阈值,这就是例子中的双超标,需要进入压缩。这组数字只是帮助理解计算关系,不是论文报告的实测样本。真正判定是否超标,必须用解析出的该块起止时间戳算出的实际时长逐条计算。

整个系统分哪几步走,时间戳在哪里固定?

系统全景分两大部分。左边是自动字幕部分,依次是流式语音识别、文本预处理、机器翻译。右边是字幕压缩部分,把待压缩字幕与英文原文一起送入 Qwen3-32B 大语言模型,得到压缩后字幕。中间用箭头连接,表示前 3 步的输出整体进入压缩。

沿一个样本走一遍有助于建立依赖。输入一段英语新闻音频,先被切成固定时长片段并检测语音活动,识别出英文词序列与词级时间戳。接着按句末标点合并碎片,超长块按中英长度比做贪婪重组,但保留时间戳。然后英文块被翻译成中文,时间戳原样复制。最后只对超 CPS 或 CPL 的中文块做改写,时间戳仍不动,输出满足约束的文件。

下面这张图是理解分工的关键,请先看导读再看图本身。导读的任务是确认主路径顺序和左右 2 阶段的交接物:左侧输出的是带时间的英文加中文初译,右侧只改字不改时间。

看图路径: 1. 先从左向右沿左侧粉色大框内的三个小框看主路径顺序;2. 再看中间蓝色箭头如何把左侧整体指向右侧压缩框;3. 接着确认右侧框内从上到下是否为待压缩字幕加英文原文到模型再到压缩结果;4. 最后核对左右两部分虚线框标题是否对应自动字幕与字幕压缩两个阶段

原论文 Figure 1:Overall architecture of the proposed cascading subtitle system.

论文图 1。原论文 Figure 1:“Overall architecture of the proposed cascading subtitle system.”。

从实际收到的图像素看,左侧是一个粉色底的大虚线框,标题为自动字幕,框内从左到右有 3 个小矩形,依次标为流式语音识别、文本预处理、机器翻译,箭头向右。中间是一个蓝色粗箭头指向右侧。右侧是一个浅蓝色底的大虚线框,标题被截断但可辨认为字幕压缩,框内从上到下是待压缩字幕与英文原文、中间带图标的 Qwen3-32B 模型、下方压缩后字幕,箭头向下。这证实了时间戳在左侧识别阶段产生、在右侧压缩阶段被冻结的安排:右侧没有重新对齐模块。

流式识别如何做到长音频又准又有时间?

流式语音识别子系统的目标是给长音频产出标准化字幕英文底稿。基础模型是 Qwen3 系列,周围配了 4 个功能模块:语音活动检测、流式分块推理、强制对齐和幻觉过滤。白话说,检测负责找人声,分块负责切流,对齐负责定时间,过滤负责删编造。

具体动作按原文顺序展开。先把输入音频按固定时长切段,用 Silero 语音活动检测模型实时检测并过滤静音段。随后用 2 秒滑动窗口做流式切分与增量处理,动态维护缓存的上下文音频和文本信息,保证识别输出连贯。在识别推理阶段,编码器抽取的音频特征与文本提示融合,用 vLLM 推理框架高效解码大语言模型,并用基于长度的阈值过滤抑制幻觉。最后引入 Qwen3 的强制对齐模块,实现转写文本与音频的词元级时间同步。

语音活动检测 × 滑动窗口上下文缓存: 语音活动检测负责用 Silero VAD 实时发现有人声的片段并过滤静音段,避免对长静音做无效解码;滑动窗口上下文缓存负责用 2 秒滑动窗口切分流式音频并保留已缓存的音频与文本上下文,保证增量识别连贯;两者搭配使长音频既能分段处理又不丢失句子级连贯,为后续强制对齐提供干净且连续的输入。

术语首次出现需要解释。语音活动检测的英文是 Voice Activity Detection,缩写 VAD,指判断每一小段音频是否含人声。滑动窗口上下文缓存指每次只看 2 秒新音频,但把之前的音频特征和已识别文本留作条件,避免句子被切断。强制对齐指已知文本和音频求每个词的时间边界,与从零识别不同。幻觉过滤指大模型在噪声段可能编出原文没有的词,需要按长度等规则丢弃。

英文碎片如何拼成可翻译的字幕块?

流式识别的直接输出往往是短碎片,不适合直接翻译。文本预处理负责做语义级合并与长度约束调整,产出结构标准化的英文文本单元。先按句末标点合并连续片段,把属于同一句话的短输出拼成完整话语,同时完整保留每段的时间戳信息。

接着处理过长块。依据英语与中文的事先长度比设定词数上限,对超过阈值的长文本块用贪婪策略重组内部子段,使每个字幕块的词量满足约束。这个做法同时兼顾语义完整、时间戳准确和显示空间,为机器翻译提供高质量输入。白话说,合并是把碎句子拼整,贪婪重组是把太长的整句再切成合适上屏的小块,但切分不丢时间。

强制对齐 × 幻觉过滤: 强制对齐负责用 Qwen3 的对齐模块实现转写文本与音频在词元级的时刻同步,产出可直接用于字幕的时间戳;幻觉过滤负责用基于长度的阈值过滤抑制大模型在静音或模糊段的编造输出,提高可靠性;两者组合的意义是先保证有字,再保证字的时间可信,才能让翻译阶段冻结时间戳只翻文本。

机器翻译阶段的安排很克制。考虑到识别系统的时间戳精度已经较高,翻译时只把英文源句翻成目标语言,所有时间信息保持不变。输入是标准化英文单元,模型是基于 Qwen3 的翻译模型,输出是与源内容严格对齐的译文。这里没有重新切分时间,也没有融合多句压缩,压缩留给下一步专门处理。

压缩改写如何只改字不改时间?

字幕压缩的任务定义是句子级改写且保留原字幕文件的时间戳信息。原文明确要求避免多句融合压缩,即 1 次只处理一个字幕块,不把相邻两条拼成一条。这保证了时间轴不动,显示节奏与原视频一致。

处理流程是渐进式的。先解析每条字幕的起止时间戳并算出实际播放时长,自动识别超长或超速的不合格片段。对这些片段采用 2 阶段约束优化。第一阶段用温度为 0 的贪婪解码做确定性生成,只删冗余助词和连词,保留完整语义和句式。如果仍不满足约束,启动第二阶段深度压缩,把温度调到 0.3。整个过程严格参照英文原文,用指令约束保留人名、地名、机构等专有名词,不修改或省略核心语义。

贪婪解码 × 2 阶段压缩: 贪婪解码指温度为 0 的确定性生成,负责在第一阶段只删冗余虚词和连词而不引入随机改写;2 阶段压缩负责先做保守简化,若仍超限再以温度 0.3 启动深度压缩并严格参照英文原文保留专有名词;这种搭配的理由是先保语义和可复现,再用有限随机性换取更短表达,避免 1 次压过头丢失核心名词。

提示词设计是可复现的关键。角色设定为专业新闻字幕精炼专家,任务是参照英文原文压缩中文译文,并遵守 5 条规则:总字符数不超过 32,每秒显示字符不超过 9,完整保留人名地名国名机构名等专有名词,只删冗余助词连词不改核心名词,保证表达连贯语义完整且优先新闻准确性。每次推理同时输入英文原文与中文译文,模型在规则下做精简改写。

本研究训练了什么,没有训练什么?

这是 1 篇系统提交论文,没有报告新的神经网络训练过程。原文没有给出训练数据规模、优化器、学习率、梯度路径、参数冻结或更新范围,也没有给出损失函数或消融训练轮数。因此不能把 Qwen3 系列称为本研究训练的模型,只能说本研究调用了 Qwen3 系列作为基础模型和改写模型。

真实计算过程是既有模型推理加规则处理。语音端是 Silero 语音活动检测推理、2 秒滑动窗口增量推理、vLLM 解码、长度阈值过滤和 Qwen3 强制对齐。文本端是按标点合并、按长度比贪婪重组、Qwen3 翻译推理、按时间戳算语速并筛选超标块、Qwen3-32B 2 阶段改写推理。没有训练不等于确定性求解:第一阶段温度为 0 趋向确定,第二阶段温度为 0.3 会引入采样随机,同样的输入可能得到不同压缩结果。

缺项要明确指出。未报告 Qwen3 翻译模型与 Qwen3-32B 是否微调、冻结哪些层、监督来源是什么、何时重置缓存、滑动窗口之外的分块时长具体是多少。这些缺项意味着复现时只能用公开权重做推理复现,不能声称复现了训练。

在什么数据和指标下测,条件如何对齐?

任务要求为 3 类音视频文档自动生成字幕,口语均为英语。Asharq-Bloomberg 与 ITV 的开发集和评测集以 MP4 提供,YODAS 以 WAV 提供。比赛要求只用视频中的音频轨。ITV 来自英国商业广播机构旗下工作室,内容是电视剧、娱乐与纪录片,语言口语化、语速自然多变。Asharq-Bloomberg 来自中东北非大型媒体集团的财经新闻,风格正式、信息密度高、经济金融术语多。YODAS 来自 YouTube 多语真实语音,风格高度口语化,声学条件复杂,常有背景噪声、音乐和多人重叠说话。

指标分两类。翻译与整体质量用 SubER、BLEU、BLEURT。SubER 是主要指标,综合反映翻译准确、时间一致与字幕规范。BLEU 基于 n 元精确率衡量与参考的匹配,BLEURT 是深度神经指标,两者反映准确与流畅。合规用 CPS、CPL、LPB 达标率。中文上限分别是每秒 9 字、每行 16 字、每块两行。

实验条件按原文交代:在 2026 开发集上做实验,SubER 采用区分大小写且考虑标点的版本,算 BLEU 前用 mwerAlign 把生成字幕与参考字幕重对齐,这是 AS-WER 的一种变体,合规指标用相关工作提供的脚本计算。比较的公平条件是同一开发集、同一管线,只切换是否做压缩改写,因此压缩前后的差值可以直接归因到压缩策略。

下表先把官方中文约束与本文压缩提示中的数值约束放在一起,帮助核对复现时要写进代码的阈值。比较问题是哪些数字是硬性评测线,哪些是提示词内的执行线。表前已说明 3 类数据的差异,表后将解释压缩为何能同时改善合规与整体分。

压缩前后主结果变化是什么,代价在哪里?

下表整理 3 类任务英译中在开发集上的压缩前后结果,指标方向为 SubER 越低越好,BLEU 越高越好,CPS、CPL、LPB 达标率越高越好。需要同时核对数据集、是否压缩、实验阶段为开发集、指标与聚合对象为全开发集平均。数值相同不能混为同一指标,百分点变化不能说成相对百分比。

条件指标Asharq 无压缩Asharq 有压缩ITV 无压缩ITV 有压缩YODAS 无压缩YODAS 有压缩
开发集英译中SubER 越低越好60.1059.2963.5062.9454.8654.24
开发集英译中BLEU 越高越好28.9529.0022.7722.4029.4329.63
开发集英译中CPS 达标率越高越好94.3398.8170.0887.1675.4887.60
开发集英译中CPL 达标率越高越好87.6598.9796.2599.2993.1499.62
开发集英译中LPB 达标率越高越好100.00100.00100.00100.00100.00100.00

上表显示压缩后 3 类任务的 SubER 都下降,Asharq 从 60.10 到 59.29,ITV 从 63.50 到 62.94,YODAS 从 54.86 到 54.24,说明整体字幕质量按主指标变好。合规列中 CPS 与 CPL 在压缩后均升高且 CPL 升到 98% 以上,LPB 本来就是 100.00 并保持不变。反例是 ITV 的 BLEU 从 22.77 降到 22.40,是唯一 BLEU 下降的组,说明压缩并非在所有组都同时提高 n 元匹配。未胜出项要保留:ITV 无压缩的 CPS 仅 70.08,是 3 组中最差的起点。

为聚焦可读性合规,下表只整理 CPS、CPL、LPB 三列达标率,任务与压缩标记与上表一致,便于对照阅读速度与单行长度约束的满足情况。

任务压缩标记CPS% 越高越好CPL% 越高越好LPB% 越高越好
Asharq无压缩94.3387.65100.00
Asharq有压缩98.8198.97100.00
ITV无压缩70.0896.25100.00
ITV有压缩87.1699.29100.00
YODAS无压缩75.4893.14100.00
YODAS有压缩87.6099.62100.00

上表把合规三列单独列出后可以看到,有压缩行的 CPS 与 CPL 均高于同任务无压缩行,LPB 六行均为 100.00。ITV 无压缩 CPS 为 70.08 是全表最低起点,有压缩后为 87.16 仍低于另两任务的有压缩值,说明口语化与语速多变的内容最需要压缩但单靠压缩仍未追平新闻类任务。

为什么压缩没有按常识拉低分数?

常识认为压缩会损伤翻译质量,但本实验显示 SubER 与 BLEU 总体呈上升趋势,原文给出两点有限解释。第一,大语言模型在压缩时有效保留核心语义并去掉冗余表达,使生成字幕在风格、句式和用词上与参考更一致。第二,参考字幕本身是标准化精简的,比逐字口语翻译更短,压缩后输出与参考的文本特性更接近,因此评测指标受益。这两点是支持性解释,不是因果证明,原文也没有做去掉专有名词保留或去掉英文参照的对照。

从机制看,2 阶段设计是关键对照。第一阶段温度为 0 只删助词连词,保语义;第二阶段温度 0.3 才做深度压缩,且始终参照英文原文。这种保守优先的顺序解释了为何 BLEU 没有大跌:大部分块可能在第一阶段就达标,不需要冒险改写。但原文没有报告 2 阶段各自触发比例、平均压缩率或人工语义保留率,因此无法量化每阶段贡献。

至少要指出一个未评测边界。压缩只在中文 CPS、CPL、LPB 上限下验证,没有报告日语或其他语速与行宽下的表现,也没有报告延迟、计算开销与误改率。总体趋势不等于每条都变好,ITV 的 BLEU 下降就是具体反例。未来若要 claims 泛化,必须补多语阈值与人工可读性评价。

哪些结论还不能下,缺了什么验证?

直接报告的是开发集上的自动指标与合规率提升,支持的是压缩策略在该管线内有效。未验证的推测包括压缩是否普遍提高翻译质量、是否改善观看体验、是否降低延迟或成本。原文没有测量误判率、推理耗时、输出帧率与实际延迟,因此不能承诺这些量得到改善。

数据边界也很清晰。3 类数据覆盖了正式财经新闻、口语化影视与 noisy 的 YouTube 语音,但都只是英译中开发集结果,没有给出测试集分数,也没有统计显著性方法。LPB 达标率全是 100%,说明行数约束在该管线中本来就满足,真正的挑战在 CPS 与 CPL。把总体趋势推广到每组每步都不成立,ITV 起点最低、提升最大,Asharq 起点最高、提升最小,说明收益与原始语速和风格强相关。

资源状态必须按证据写。未发现来源绑定且完成 HTTPS 状态验证的资源,不得声称代码、模型或数据已公开。本次解读依据的只是论文正文与一张系统架构图的像素,没有可用仓库链接,因此复现只能按文字描述重搭,不能直接下载本研究的完整系统。

要复现这套管线,先做什么,后补什么?

复现先做可运行的最小链路。第一步准备音频:只取 MP4 中的音频轨,YODAS 直接用 WAV,保持长音频原样输入。第二步搭流式识别:用 Silero VAD 过滤静音,用 2 秒滑动窗口做增量识别并缓存上下文,用 vLLM 解码 Qwen3 系列模型,加长度阈值过滤,再用 Qwen3 强制对齐产出词级时间戳。第 3 步做文本预处理:按句末标点合并碎片,按中英长度比设词数上限并贪婪重组超长块,保留时间戳。第四步翻译:把英文块送 Qwen3 翻译模型,时间戳原样复制。第五步压缩:解析每块时长并算语速,筛出超 CPS 或 CPL 的块,用 Qwen3-32B 按给定角色与 5 条规则改写,温度先 0 后 0.3,同时输入英文原文。

关键超参数与信息条件要保留。滑动窗口 2 秒,总字符不超过 32,每秒不超过 9 字,保留全部专有名词,只删冗余助词连词。评测时 SubER 用区分大小写且考虑标点版本,BLEU 前先用 mwerAlign 重对齐,合规用原文所引脚本口径。还需补的验证是压缩触发率、2 阶段分布、人工语义完整性检查,以及在测试集与日语阈值下的表现。训练资源与推理开销在原文未报告,复现时要自测显存与耗时,不要把无训练误认为低成本。

何时值得尝试这套做法,如何一句话记住它?

当你的字幕已经能翻准但总因太长太快而不合规,且时间轴不能动时,这套做法值得尝试。它的核心判断是把时间问题留给识别与对齐,把长度问题留给最后的受控改写,中间翻译只做忠实转换。这种分工适合新闻类正式文本,因为专有名词多、句式规范,保守删除虚词就能达标。

对口语化与语速多变的影视或 YouTube 内容,预期 CPS 提升会更大,但也要接受 BLEU 可能小幅回落的风险,如 ITV 组所示。复现时优先保证时间戳精度,再调压缩阈值,不要一开始就加大改写温度。还需要补人工评价来确认精简没有丢失关键信息,因为自动指标偏爱与参考相似的短文本,可能掩盖个别语义损失。

一句话记住:先用流式识别定时间,用翻译保忠实,再用参照英文的 2 阶段改写把超标中文压进每秒 9 字与每行 16 字,而时间戳全程不动。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 2 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 iwslt-2026 论文汇总