标签:#语音翻译 | #大语言模型 | #多语言 | #基准测试
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Vilém Zouhar:机构信息未在 arXiv HTML 中可靠披露
- Niyati Bafna:机构信息未在 arXiv HTML 中可靠披露
- Mukund Choudhary:机构信息未在 arXiv HTML 中可靠披露
- Maike Züfle:机构信息未在 arXiv HTML 中可靠披露
- Sara Rajaee:机构信息未在 arXiv HTML 中可靠披露
- Pinzhen Chen:机构信息未在 arXiv HTML 中可靠披露
- Jannis Vamvas:机构信息未在 arXiv HTML 中可靠披露
- Sara Papi:机构信息未在 arXiv HTML 中可靠披露
- Ona de Gibert:机构信息未在 arXiv HTML 中可靠披露
- Bhavitvya Malik:机构信息未在 arXiv HTML 中可靠披露
- Eliya Habba:机构信息未在 arXiv HTML 中可靠披露
- Orfeas Menis Mastromichalakis:机构信息未在 arXiv HTML 中可靠披露
- Patrícia Schmidtová:机构信息未在 arXiv HTML 中可靠披露
- Michelle Wastl:机构信息未在 arXiv HTML 中可靠披露
- Sheriff Issaka:机构信息未在 arXiv HTML 中可靠披露
- Leshem Choshen:机构信息未在 arXiv HTML 中可靠披露
- Stella Biderman:机构信息未在 arXiv HTML 中可靠披露
- Antonis Anastasopoulos:机构信息未在 arXiv HTML 中可靠披露
- Jan Niehues:机构信息未在 arXiv HTML 中可靠披露
- Rico Sennrich:机构信息未在 arXiv HTML 中可靠披露
- Mrinmaya Sachan:机构信息未在 arXiv HTML 中可靠披露
- Ondřej Bojar:机构信息未在 arXiv HTML 中可靠披露
- Kenton Murray:机构信息未在 arXiv HTML 中可靠披露
- Jörg Tiedemann:机构信息未在 arXiv HTML 中可靠披露
- Alham Fikri Aji:机构信息未在 arXiv HTML 中可靠披露
- Philipp Koehn:机构信息未在 arXiv HTML 中可靠披露
- Christof Monz:机构信息未在 arXiv HTML 中可靠披露
- Alexandra Birch:机构信息未在 arXiv HTML 中可靠披露
- Sowmya Vajjala:机构信息未在 arXiv HTML 中可靠披露
- Chalamalasetti Kranti:机构信息未在 arXiv HTML 中可靠披露
- Cristina España-Bonet:机构信息未在 arXiv HTML 中可靠披露
- Nobin Sarwar:机构信息未在 arXiv HTML 中可靠披露
- David Kaczér:机构信息未在 arXiv HTML 中可靠披露
- Shunta Asano:机构信息未在 arXiv HTML 中可靠披露
- Malik Marmonier:机构信息未在 arXiv HTML 中可靠披露
- Daban Q. Jaff:机构信息未在 arXiv HTML 中可靠披露
- Vaisakhi Mishra:机构信息未在 arXiv HTML 中可靠披露
- Hend Al- Khalifa:机构信息未在 arXiv HTML 中可靠披露
- Gabriele Sarti:机构信息未在 arXiv HTML 中可靠披露
- Sourajit Saha:机构信息未在 arXiv HTML 中可靠披露
- Nils Rehlinger:机构信息未在 arXiv HTML 中可靠披露
- Juan Daniel Cuervo Villa:机构信息未在 arXiv HTML 中可靠披露
- Jonathan Tonglet:机构信息未在 arXiv HTML 中可靠披露
- Saugata Purkayastha:机构信息未在 arXiv HTML 中可靠披露
- Dominik Macháček:机构信息未在 arXiv HTML 中可靠披露
- Jagannathan Ramanujam:机构信息未在 arXiv HTML 中可靠披露
- Heejin Do:机构信息未在 arXiv HTML 中可靠披露
- Zuzana Nadova:机构信息未在 arXiv HTML 中可靠披露
- Fred Philippy:机构信息未在 arXiv HTML 中可靠披露
- Fabian Retkowski:机构信息未在 arXiv HTML 中可靠披露
- Maria Lymperaiou:机构信息未在 arXiv HTML 中可靠披露
- Silvia Casola:机构信息未在 arXiv HTML 中可靠披露
- Hanna Yukhymenko:机构信息未在 arXiv HTML 中可靠披露
- Shubhashis Roy Dipta:机构信息未在 arXiv HTML 中可靠披露
- Sangwon Ryu:机构信息未在 arXiv HTML 中可靠披露
- Andrés Jerez:机构信息未在 arXiv HTML 中可靠披露
- Ron Keinan:机构信息未在 arXiv HTML 中可靠披露
- Shuaib Shuaib Yusuf:机构信息未在 arXiv HTML 中可靠披露
- Avantica Vempati:机构信息未在 arXiv HTML 中可靠披露
- Maria Carmen Staiano:机构信息未在 arXiv HTML 中可靠披露
- Sukannya Purkayastha:机构信息未在 arXiv HTML 中可靠披露
- Adrian Cosma:机构信息未在 arXiv HTML 中可靠披露
- Vitalii Babenko:机构信息未在 arXiv HTML 中可靠披露
- Erivan Inan:机构信息未在 arXiv HTML 中可靠披露
- Aviral Nigam:机构信息未在 arXiv HTML 中可靠披露
- Wafa Aissa:机构信息未在 arXiv HTML 中可靠披露
- Fatima Haouari:机构信息未在 arXiv HTML 中可靠披露
- Venkata Prasanth Kumar Gummadi:机构信息未在 arXiv HTML 中可靠披露
- Mehdi Jafarzadeh:机构信息未在 arXiv HTML 中可靠披露
- Valentin Scourneau:机构信息未在 arXiv HTML 中可靠披露
- Lukas Edman:机构信息未在 arXiv HTML 中可靠披露
- Kaiser Sun:机构信息未在 arXiv HTML 中可靠披露
- Shaomu Tan:机构信息未在 arXiv HTML 中可靠披露
- Mohammad Sadegh Gholizadeh:机构信息未在 arXiv HTML 中可靠披露
- Johannes-Rudolf David:机构信息未在 arXiv HTML 中可靠披露
- Dipankar Srirag:机构信息未在 arXiv HTML 中可靠披露
- Javier García Gilabert:机构信息未在 arXiv HTML 中可靠披露
- Ruta Binkyte:机构信息未在 arXiv HTML 中可靠披露
- Manar Ali:机构信息未在 arXiv HTML 中可靠披露
- Ana-Maria Bucur:机构信息未在 arXiv HTML 中可靠披露
- Sabry E. Farrag:机构信息未在 arXiv HTML 中可靠披露
- Youssef Saber:机构信息未在 arXiv HTML 中可靠披露
- Yihong Liu:机构信息未在 arXiv HTML 中可靠披露
- Jean Maillard:机构信息未在 arXiv HTML 中可靠披露
- Cojocaru Nicoleta:机构信息未在 arXiv HTML 中可靠披露
- Xiaochuang Yuan:机构信息未在 arXiv HTML 中可靠披露
- Sina Ahmadi:机构信息未在 arXiv HTML 中可靠披露
- Philipp Mondorf:机构信息未在 arXiv HTML 中可靠披露
- Kaustubh Dhole:机构信息未在 arXiv HTML 中可靠披露
- Roman Wixinger:机构信息未在 arXiv HTML 中可靠披露
- Shenbin Qian:机构信息未在 arXiv HTML 中可靠披露
- Manuel Tuor:机构信息未在 arXiv HTML 中可靠披露
- Sergey Troshin:机构信息未在 arXiv HTML 中可靠披露
- Jonathan Yahav:机构信息未在 arXiv HTML 中可靠披露
- Fida Mohammad Thoker:机构信息未在 arXiv HTML 中可靠披露
- Amir Arsalan Rezapour:机构信息未在 arXiv HTML 中可靠披露
- Lance Calvin Lim Gamboa:机构信息未在 arXiv HTML 中可靠披露
- Manon Reusens:机构信息未在 arXiv HTML 中可靠披露
- Kätriin Kukk:机构信息未在 arXiv HTML 中可靠披露
- Koel Dutta Chowdhury:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
要解决的翻译评估困境是什么?
输入是用户真实会遇到的翻译请求,可能是短文本、长文本,也可能附带图片、音频或视频,以及风格或长度等附加要求。想改变的是当前评估看不出差距的局面:常用测试集对强模型太容易,分数挤在高位,自动指标与人的判断在高质量区间对不上,还容易被针对性优化钻空子。必须保留的是对错误的严肃性,一处关键误译就足以破坏信任,不能用平均流畅度把它平均掉。
输出是一个长期可用的难例集合加一套可自动执行的判分方法。每个输入都附带人类参考译文和一到多条手写检查句,模型译文必须逐条通过才算过关,最终报告通过的例子占比。这个占比有明确的天花板,理想模型应接近 100 分之 100,与封闭式问答用准确率一样直观。该基准是压力测试,不是日常平均质量的估计。
论文 Example 1 帮助定位难度。英文说 2 位新护士共享男子百米世界纪录,译成捷克语时护士一词有性别形态,若选了阴性形式就与后文男子矛盾。多个顶尖系统恰好在这里选错,而人类译者选用中性或阳性形式通过检查。这个例子是论文自带例证,不是额外的教学虚构。它说明论文要抓的不是通篇文笔,而是这种一票否决的关键点。人类参考译文的高通过部分由收录条件保证,不能外推为日常人机准确率。
已有基准和指标走到了哪里?
传统做法是用固定测试集加参考译文比对。早期用词面重叠度量,白话是数译文与参考译文在字词层面有多像,官方英文名称是 overlap-based metrics,例如 ChrF 和 BLEU。随着模型变强,这类比对越来越没有区分度,因为翻译是开放任务,合理译法很多,盯住一个参考译文的表面相似会误伤好译文。
后来转向神经指标和大模型当裁判,白话是训练一个模型去模仿人打分,或直接让大模型给零到一百分,官方英文名称是 neural metrics 与 LLM-as-a-judge,例如 Comet 与 MetricX。这类方法与人的相关性更高,但解释性差、不同裁判之间分歧大、有偏爱自己输出的倾向,在分布外输入上不可靠,也不适合拿来当训练奖励反复优化。
人工评价是外在金标准,但同样有成本与复现问题。不同批次的打分没有校准,旧分数不能直接复用,来一个新模型就要把老模型拉回同一批重评。错误分类体系如多维质量指标,白话是把译文错误按误译、漏译、增译等归类,官方英文名称是 MQM-like taxonomies,能描述输出错在哪里,但不直接回答输入为何难。论文的位置是换一条路:不预设哪类语言现象最难,而是从用户实际撞到的失败出发归纳,再为每例定制可验证的检查。
为什么通用高分会放过致命错误?
问题可以拆成两层。第一层是测试集不够难,自然采样的大多是模型已经能处理的句子,强模型之间拉不开差距,人工合成的对抗文本又往往不自然,不能反映真实使用。第二层是指标不够准,通用裁判看到流畅译文就给高分,对关键词误译不敏感,而人类打分又受主观与批次影响。
论文用对照说明这一点。同一批难例上,验证器通过率把最强模型压到 4 成左右,而通用裁判仍给出八十分上下,按量表文字对应接近完整传达、只需轻微校对。另一组对照是给模型看验证规则后重翻,验证器分数大幅上升,通用指标却几乎不动。这说明通用分数既不能暴露弱点,也不能反映真实修复,继续用它指导研究会走偏。
因此需要的不只是更难的句子,还有不对称的评价。评价者应比生成者多知道一件事:这道题到底在考什么。只有把考点写成明确规则,评价者才可能在自己也翻不对的情况下依然判对错。
从输入到分数的完整链路是怎样的?
起点是贡献者提交的一个待翻译输入。先选定源语言与目标语言,允许细到方言、变体与文字,例如苏黎世瑞士德语或西里尔塞尔维亚语。然后给出输入本体,可以是纯文本,也可以是图片、音频、视频,或文本加多模态上下文,还可附带翻译要求,例如使用口语或控制长度。贡献者同时写出自己认为正确的参考译文,证明该输入可翻且能通过后续检查。
中间是机器试翻与规则撰写。平台调用至多 10 个翻译模型对同一输入产出译文,贡献者观察共性失败,把失败模式写成英文的验证规则。规则要求原子且通用,一条只查一个概念问题,措辞要能放过一切合理正确表述,同时卡住错误表述。写完后用验证模型逐规则逐译文判通过或失败,只有参考译文全过、且至多两个自动译文全过,该提交才有资格进入评审。
末端是同行评审与版本发布。评审人从贡献者池中招募,要求通晓对应语言对,检查输入是否公平可翻、错误是否显著可感知、规则是否不过宽或过严。通过后进入滚动基准,当前发布版本收录截止到 2026 年 9 月 1 日前接受的贡献。评分时对新模型只给输入,逐规则验证后统计全过比例,支持按文本、模态、语言对或困难类型切分子集报告。
验证规则如何写出又严又不冤枉人?
规则的输入是源文本、候选译文与可选上下文,输出只有通过或失败。撰写动作是把观察到的失败抽象一层,不点名某个模型的某句措辞,而描述必须满足的语义条件。例如哥伦比亚西班牙语方言句中,两个俚语分别表示发疯与对人的中性指称,规则就写成检查是否传达发疯且不带贬义,而不是背诵某个标准答案。
评审动作保证公平性。评审人要判断换 1 位合格译者能否在同样输入下产出通过译文,错误是否值得用户在意。若规则写得过泛,所有模型都过,则失去诊断价值;若写得过窄,只有参考译文的措辞能过,则变成背答案。实践中接受的提交平均每例约 1.9 条规则,多数是一到两条聚焦规则。
验证规则 × 验证器通过率: 验证规则是针对单个输入手写的一条条可判对错的检查句,只盯住该例的已知易错点,例如护士一词是否用了隐含女性的形式;验证器通过率是把模型译文逐条送给大模型验证器判通过或失败,一个例子必须全部规则通过才算通过,最后统计通过例子占全部例子的百分比。二者搭配的原因是规则把评价者与生成者拉开信息差,评价者被明确告知要查什么,而生成者盲翻时并不知道,组合后得到的是可复现、可解释、可定位到具体失败的分数,而不是一个说不清含义的总体好坏分。
这种设计的代价是规则只覆盖意图中的难现象,不保证译文其他方面完美。论文明确表示,该基准是压力测试,不是日常平均质量的估计,不能用它推断普通用户请求的平均体验。
多模态输入和附加指令如何参与翻译?
多模态有两种角色需要区分。若只给图或音频而不给文本,内容本身就是待翻译对象,例如路牌照片、标牌录音、手语视频,模型要直接转写并翻译其中的信息。若同时给文本与多模态,图声视频是消歧上下文,例如食物图片帮助判断社交文本中的指称,音频语调帮助判断反讽。提示词会把上下文类型与附加指令一并传入翻译模型。
附加指令的例子包括保持无元音风格、总字符数少于二十、语气必须明确传达讽刺。英文无元音句译成德语时,既要保留原意又要全句无元音;英文报错句要求二十字符内,正确做法是改写压缩而非逐字翻译。验证规则会分别检查语言是否正确、含义是否保留、约束是否满足。
多义现象 × 文化制品: 多义现象指同一个词形在不同语境下指向不同含义,翻译时必须先消歧再选词,例如英语论文一词在德语里要区分学术文章与纸张;文化制品指只有亲历者才熟悉的人物称呼、习俗、网络梗或专名用法,例如韩语里对陌生年长顾客的称呼不能直译成亲属关系。二者分工不同,前者考语境理解与词义选择,后者考语言之外的生活经验,组合后说明难点既在词典内部也在词典外部,切换目标语言时前者往往可迁移而后者可能因目标语言类型不同而失效。
这类约束把翻译从字词对应变成带约束生成,失败往往不是看不懂,而是顾此失彼。有的模型保住含义却丢了约束,有的保住约束却跑错语言,这正是通用流畅分最容易误判的地方。
不训练新模型时现有模型如何逐项验证?
这项工作没有训练新的可学习翻译模型,本节只说明复用与验证的执行过程。所有计算来自两类复用:贡献阶段调用现成翻译模型产出候选译文,验证阶段调用现成推理模型按规则判通过或失败。需要更新的不是权重,而是数据集内容与规则文本;本研究未训练模型,也不控制第三方模型的内部参数时变。
跟着一个样本走一遍真实顺序更清楚。贡献者先写输入与参考译文,点击全部模型翻译,得到 10 个候选译文;接着写规则并点击验证,系统对每个规则与每个译文组合单独调用验证模型;若参考译文未全过则改规则或改译文,若通过的自动译文超过两个则说明题目太容易,需换更难的输入或收紧规则;最后提交进入单评审人评审,通过才入库。评估新模型时,只执行翻译加验证两步,不再改规则。
盲测模式 × 谕示模式: 盲测模式指翻译模型只能看到原始输入,看不到验证规则和人类参考译文,对应真实部署时的条件;谕示模式指允许把验证规则、人类译文或其他特权信息一并给模型,对应只为探查能力上限的诊断条件。二者必须搭配使用才能区分两种失败:不知道考什么与知道了也做不到,前者靠切到谕示模式后分数变化来诊断,后者靠给了规则仍失败的例子来保留,组合后避免把可提示的知识缺口误判为不可解的生成能力缺口。
成本按调用量计。论文报告平均每接受 1 例需约 10 次翻译尝试,1000 例翻译约 0.2 美元,1000 例验证约 1.0 美元,折合每接受例约 0.12 美元。翻译与验证分开计价,验证更贵是因为提示更长、每条规则都要跑 1 次且用推理模型,平台 1 次展示 10 个译文的交互成本即按此累加。该数字只覆盖模型调用,不含全部人工撰写与评审成本。
数据集规模与评估协议如何固定?
要回答的比较问题是:在统一输入与统一裁判下,哪些模型真正避开了已知陷阱。统一条件包括固定语言对、固定输入、翻译时不给规则、验证时逐规则独立判定。基线覆盖传统系统、专用翻译模型与通用大模型,以及人类参考译文。指标方向很直白:验证器通过率越高越好,通用裁判与神经指标分数越高越好但仅作对照,人评分数越高越好但只在子集上采集。
下表整理该版本最核心的规模事实,回答这个基准到底有多大、多杂。它不是原表截图,而是依据正文整理的对照表,数字与单位保留原文写法,千分位与小数不改写。
| 版本 | 样本量 | 语言数 | 文本占比 | 平均长度 | 平均规则数 |
|---|---|---|---|---|---|
| LTBv1 | 3456 | 109 | 94% | 19 words or 104 characters | 1.9 |
表后 3 段分别讲收益、短板与边界。最公平的读法是把它当作难例集合的快照,3456 跨 109 种主要语言,文本占九成四,平均每例 1.9 条规则,另有 1 成含翻译指令,平均长度约 19 词或 104 字符。失败项是语言分布仍不均衡,含英语的语言对占多数,非英语到非英语约 1 成三,英语到非英语约 1 成四,非英语到英语约七成三。不能推出的是这些比例代表自然使用分布,它们只反映众包收集的结果,后续版本会滚动更新并保持挑战性。
评估协议另有两条必须记住。报告成绩要注明验证器,例如用某个开源模型作验证以保证可复现,且验证器选择对排序影响小。提交到公开榜要区分盲测与谕示,比较真实翻译质量只用盲测,谕示只用于诊断上限。LTBv1-eval 是 911 个纯文本难例的子集,按难度、输出多样性与语言对均衡挑选,更适合快速迭代。
收集成本与难度门槛如何控制?
第二个要回答的问题是:难例是如何被证明难,而不是自称难。统一条件是同一输入下参考译文必须全过,而自动译文至多两个全过。基线是平台展示的至多 10 个模型,覆盖流行系统与当时最强模型,另有 19 个未展示过的模型留作事后检验,以防只对平台模型过拟合。
下表把调用开销拆开,回答众包在保证难度的前提下是否负担得起。它依据正文整理,不冒充原表,单位保留原文写法,翻译与验证分开计价且不含全部人工成本。
| 尝试次数 | 1000 例翻译成本 | 1000 例验证成本 | 单接受例成本 | 平均规则数 |
|---|---|---|---|---|
| 10 | $0.2 | $1.0/1000 | 0.12 美元 | 1.9 |
表后解释如下。净收益是门槛可执行且调用便宜,平均 10 次尝试换 1 例接受,单接受例约 0.12 美元,使得大规模征集成为可能,其中 1000 例翻译花费 0.2 美元,1000 例验证花费 1.0 美元,两者分开结算。失败项是该门槛依赖当时的模型列表与验证器,若模型整体变强或验证器误判,难度的含金量会变化,需要滚动更新模型列表与版本。不能推出的是成本等于质量,真正保质量的是单评审人语言审核与公平可翻要求,成本数字只说明调用开销,不说明规则好坏,也不含全部人工成本。
最强模型在硬规则下还剩多少分?
主结果的比较条件必须先固定:在 LTBv1-eval 的 911 个纯文本难例上平均,排除因语言不支持而未译出的例子,翻译时不给规则,验证器取 Gemma 4 一列。模型名是论文评测对象,不作外部产品核验。下表给出准确端点,原表表头量程为 0 到 100,数据格保留裸值,而不是约 4 成或 3 成。验证器和通用裁判统一取 Gemma 4;人评列另取向标注者展示规则后的子集评分,其样本范围小于前两列,不能把原表 ChrF 指标当成人评。
| 评测对象 | Gemma 4 验证器通过率(0-100) | Gemma 4 通用裁判(0-100) | 人评看规则后(0-100) | 验证器/裁判样本 |
|---|---|---|---|---|
| human | 99.1 | 78.3 | 90.8 | LTBv1-eval |
| Gemini 3.1 Pro | 43.8 | 83.3 | 68.1 | LTBv1-eval |
| GPT-5.6 Sol | 34.4 | 87.2 | 缺失 | LTBv1-eval |
| GPT-5.6 Luna | 21.0 | 84.7 | 缺失 | LTBv1-eval |
| Google Translate | 2.9 | 61.9 | 27.7 | LTBv1-eval |
表后第一段讲净收益。人类参考译文在该列接近满分,说明规则是人可通过的,但部分由收录时要求参考译文通过带来,不能外推日常准确率。最强的 Gemini 3.1 Pro 为 43.8,GPT-5.6 Sol 为 34.4,Luna 为 21.0,传统系统仅 2.9,量程均为 0 到 100。换用不同验证器重排,名次高度稳定,验证器内 Kendall 为 86.9,而通用裁判内仅 71.3,报告为排名相似而非逐例准确。
通用裁判打分 × 规则验证判定: 通用裁判打分指让大模型按好到坏给一个总体分数,例如八十多分代表接近完整传达;规则验证判定指让大模型只回答某条具体规则是通过还是失败,不做总体发挥。前者负责给出流畅度和整体印象,后者负责卡住关键对错,搭配的原因是高分流畅译文常常在关键词上恰好翻错,通用裁判会放过而规则验证能抓住,组合后兼顾可读性印象与可追责的硬错误,避免用平均高分掩盖致命误译。
表后第二段讲失败项与反例。通用裁判下几乎所有强模型都在七八十分区间,人类与模型差距很小;神经指标在人类避开失败点或模型拿到规则后几乎不涨,说明它们对关键修复不敏感。人评对照只在 317 例、19 个语言对、22 名双语标注者的小规模实验中采集,不是全 109 个语言,把人类排在顶部,与规则验证一致,而与通用裁判和指标不一致。看到规则后,人与第 2 名的差距进一步拉大,说明贡献者眼中的考点与普通标注者第一眼的权重并不完全相同。
表后第 3 段讲不能推出什么。正如方法节强调,这是专挑失败的压力测试,逐例要求全部规则通过,分数低只说明弱点密集,不能换算成普通请求的平均可用性。自偏好方面,Gemma 4 验证下自偏好为 8.9,通用裁判下高达 28.2,Gemini 3.1 Pro 验证下为负 8.9 呈自抑制,说明偏差变小但并未消失。
把答案提示给模型后分数会怎样变?
该对照回答失败来自不知考什么,还是知道了也做不到。条件是把人类验证规则直接放进翻译提示,其余输入不变,再用同一验证器打分。下表给出三行的原通过率,量程均为 0 到 100,数据格保留裸值,不是提升的百分点数。
| 翻译条件 | 验证器通过率(0-100) | 通用裁判(0-100) | 神经指标(0-100) | 备注 |
|---|---|---|---|---|
| LLM | 7.2 | 68.5 | 78.1 | 盲翻 |
| LLM with synthetic rules | 12.9 | 69.5 | 78.4 | 自生成规则 |
| LLM with human rules | 89.8 | 86.0 | 85.5 | 人工规则 |
表后第一段讲最公平的解释。普通盲翻原通过率为 7.2,自生成规则后为 12.9,人工规则后为 89.8,量程均为 0 到 100。这支持有限解释:多数失败是因为模型没有准确识别题眼,而非完全缺乏执行能力。但人工规则是谕示特权信息,不能当作自生成生产能力,谕示只用于诊断上限。
源端困难 × 目标端困难: 源端困难指难点在理解源语言输入,例如识破习语、双关、花园路径句或方言词,换一个目标语言难点依然存在;目标端困难指难点在目标语言如何表达,例如性数配合、敬语层级、特定词汇空缺或长度限制,换目标语言后原来的考点可能不复存在。二者搭配才能解释跨语言移植实验为何有的成功率高有的成功率低,组合后给出扩展基准的策略:优先移植源端困难的例子以构造可比的多目标测试集,而目标端困难的例子更适合保留为单语言对的诊断探针。
表后第二段讲反例与边界。并非所有规则都能直接兑现,例如要求保留创意双关的规则只说了目标没给做法,模型仍需自己想出双关。另一面是自写规则接近思维链加长带来的小幅提升,远未触及金规则上限,因为写出好规则本身就需要先消歧、先识别陷阱,这与做对题目一样难。
表后第 3 段讲跨语言移植的分母。把 100 个源例换到 5 种目标语言,先过自动过滤,自动保留 48%,只在保留项中人工抽查,接受 64.1%、拒绝 29.4%、不确定 6.5%,两个百分比的分母分开。移植后的参考译文是模型生成的非人译,最常见的拒绝原因是新规则不再适用。源端理解型如习语、双关、花园路径句迁移成功率高,目标端表达型如性数配合、词汇空缺则常因新目标语言没有对应形态而失效。
哪些边界会限制结论的外推?
第一个边界是覆盖不均与模态偏斜。文本占绝大多数,图像、音频、视频合计只占少数,低资源与零资源语言占比有限,英语相关语言对占主导。若只看总体通过率,会掩盖某些语言对与模态上的特殊弱点,报告时应按子集拆分,例如只报文本、只报某困难类型或某语言方向。
第二个边界是评价仍依赖大模型验证器。尽管跨验证器排序稳定、自偏好小于通用裁判,且与小规模人评更一致,但验证器仍可能误判,规则措辞仍可能有歧义。论文用开源验证器换可复现性,用评审流程换规则质量,但没有声称验证器等于人。遇到争议例子,应回到源文本、规则与译文逐条复核,而不是只看百分比。
第 3 个边界是活基准带来的污染与时变。若模型训练见过公开例子,分数会虚高;若平台模型列表不更新,难度会随模型进步而稀释。论文的应对是滚动收集、更新展示模型、发布版本快照,引用成绩时必须注明版本与验证器。缺少的测量是长期追踪同一批冻结例子的通过率变化,以及更大规模的人评复核,这些尚不能判断,需要后续版本补齐。
复现与投稿应先做哪几步?
值得尝试的条件很具体:手里有待测翻译系统,能跑文本与多模态输入,且关心关键误译而非平均流畅分。先从文本评估子集起步,该子集按难度、输出多样性与语言对均衡挑选,约九百余例,比全量更适合快速迭代。翻译时只给输入与必要的上下文类型和附加指令,不给规则与参考译文;验证时逐规则独立调用验证器,一个例子全过才计分。
投稿难例的动作顺序与平台一致:选语言对、写输入、写参考译文、拉模型试翻、写一到两条原子规则、跑验证、提交评审。常见误解有 3 个。其一以为规则越多越好,实际上聚焦的一到两条更易通过评审,泛泛而谈的规则会被退回。其二以为用大模型批量生成输入与规则可快速凑数,论文报告这类产出多因过于通用或抓不住题眼而被拒。其三以为通过率高等于日常可用,前文已说明这是难例通过率,只能用于找弱点与比排序。
开源状态要分开表述。有证据的是数据集按知识共享署名许可发布,代码按宽松开源许可放在代码托管平台,榜单接受盲测与谕示两种提交。没有证据的是可下载权重与可一键运行的完整评测包,不应自行断言。若验证器换成其他模型,应同时报告所用验证器名称,因为分数绝对值会随验证器轻微浮动,但排序应保持稳定。
这项工作把翻译研究推向哪里?
它把评估从比平均好坏转向查具体弱点。归纳出的困难谱系覆盖语义相关、跨语言、非组合创意、非典型结构,以及知识与约束两大类,另有宽泛语言层级与模型阻断标签用于追踪。数量上多义词、隐喻、文化制品与变体特异占大头,但新增的元推理、网络文化制品与语音文字游戏更值得注意,因为它们在现有专项测试中较少被系统覆盖。
对构建者的启示是先补识别再补生成。既然给了人工规则能从 7.2% 到 89.8%,说明许多错误不在解码器执行,而在没有意识到要查什么。训练与提示应加强对方言俚语、习语隐喻、语气风格与多模态线索的显式建模,而不是只优化通用裁判分数。对评估者而言,应把规则验证作为主尺,把通用裁判与神经指标降为辅助印象分,并用自偏好更小的验证方式报告排序。
收束时回到可核对的事实:在 LTBv1-eval、盲测、排除不支持项、Gemma 4 验证器下,人类 99.1% 而最强模型 43.8%,给出人工规则后可达 89.8%,自写规则仅 12.9%,验证器排序更稳且更贴近人评。下一步是持续贡献难例、补齐低资源与多模态、冻结版本防污染,让接近 100 分之 100 成为长期目标。
📎 论文与评分元数据
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses