英文题目:Balancing Linguistic Intelligibility and Speaker Identity in Zero-Shot Cross-Lingual Voice Cloning

会议身份:conference:iwslt:2026:conference-paper-id:2026.iwslt-1.12

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#评测协议 #模型比较 #跨语言 #零样本 #语音克隆

评分:5.3/10 | 创新 0.8/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:后50% | 文档类型:系统技术报告

👥 作者与机构

  • Mo Ahtasam:机构信息未能从会议 PDF 纯文本可靠映射
  • Jamal uddin:机构信息未能从会议 PDF 纯文本可靠映射
  • Mohammad Nadeem:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

跨语言语音克隆以英语参考音频与目标语言文本为输入,输出保留源说话人音色与风格的目标语言语音,难点在于英语韵律与目标音系的语音分歧及可懂度与说话人相似度的权衡。该工作构建统一零样本评测管线而非提出新合成器,第一步按模型原生分词路径做分语言文本归一化,阿拉伯语去变音符号、中文转字符级处理,输出规整化Unicode文本直接送入各模型推理。第二步仅用英语音频做说话人调制,经重采样与单声道规整后提取说话人表征,MOSS-TTS与Qwen3-TTS走多模态音频标记或向量调制,VoxCPM2走波形条件扩散,CosyVoice3走流匹配路径。第三步以隔离子进程在各自环境调度四系统推理,经峰值归一化存为波形后,用Whisper large-v3转写计算WER/CER并用ECAPA-TDNN余弦相似度统一打分,使架构偏置暴露为可比结果。与强制共享音素空间的做法不同,该管线刻意保留各模型原生G2P与声学调制路径,其实测意义在于区分自回归语言建模与扩散及流匹配在多语言泛化上的归纳偏置差异。在阿拉伯语评测条件下,VoxCPM2的WER为0.25,低于MOSS-TTS的WER 0.31。其结论适用边界受限于英语源、六语自动指标与所测四系统版本,情感韵律迁移与人耳听感外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么难?

这篇论文研究的输入很具体:一端是英语源说话人的几秒参考音频,该说话人在目标语言中没有任何录音,另一端是目标语言的文本,目标语言覆盖阿拉伯语、德语、法语、日语、俄语和中文。要输出的是用源说话人音色读出目标文本的语音。必须保留的信息有两个:一是语言可懂度,即合成语音转写回来要与给定文本一致,不能幻觉或漏读,二是说话人身份,即音色、韵律和说话风格要还能被识别为同一个人。

难点来自三处。第一是语音学错位,英语与目标语言音素不对等,论文点名阿拉伯语强调音和汉语声调这类英语中不存在的发音。第二是身份与韵律纠缠,音高节奏本身带有语言特有的韵律模式,换语言后容易走样。第三是零样本约束,系统不能为新说话人重新训练,只能靠参考音频做条件生成。论文把任务放在 IWSLT 2026 跨语种语音克隆赛道下,用统一管线比较自回归与扩散两类架构如何处理这对矛盾。

零样本语音克隆 × 跨语种语音克隆: 零样本语音克隆负责在只有几秒未见过说话人参考音频时抽取音色与韵律依据,跨语种语音克隆负责把这份依据搬到目标语言文本上发音,二者搭配的原因是任务要求同时跨说话人与跨语言泛化,组合后新增的作用是必须在英语参考与阿拉伯语、中文等目标发音之间建立可迁移的说话人表示。

初学者容易误以为模型越大或支持语言越多就自动解决跨语克隆,论文的证据恰好反驳这一点。后文会沿着一个样本走完全流程:英语波形如何被保存,说话人条件如何送入 4 套不同模型,生成音频如何被转写和比对嵌入,最后聚合为可复述的数字。

同输入同目标的前人路线有何不同?

在相同输入与相同目标下,前人主要有两条路线。第一条是说话人编码路线,用外部编码器抽取条件信号,早期工作把离散音频编解码码字或表达性隐嵌入作为说话人表示,优点是结构清晰,缺点是对未见语言的音素覆盖不足。第二条是大规模基座模型路线,例如把文本到语音建模为语言模型预测离散声学码,或在隐空间中做细粒度情感与风格操控,优点是高资源语言上自然度高,缺点是跨语言时内容与音色容易互相拖累。

论文还点名了 3 类针对低资源与解耦的尝试。用发音特征向量代替音素身份以获得更语言无关的输入空间,用解耦表示空间分别捕捉内容、音色和风格,以及在基座模型隐空间中旋钮式调节情感。这些工作与本文是互补关系:它们提供表示层面的工具,本文提供在同一数据、同一协议下对 4 套完整系统的横向测量。不能把类别差异直接读成胜负,因为预训练数据量、是否支持某语言、采样步数都不同。

理解这段对照后,再看方法全景就清楚了:本文不提出新声学模型,而是把数据准备、说话人表示和模型推理解耦,用相同的输入条件隔离出架构差异的影响。

论文把权衡问题如何形式化为可测比较?

论文把抽象的取舍转化为两个可计算的方向。内容一致性方向越低越好,用自动语音识别转写后计算错误率,字母语言用词错误率,中文用字符错误率。说话人相似度方向越高越好,用说话人嵌入之间余弦相似度衡量,取值裁剪到合法区间。两个指标方向相反,放在同一批合成音频上同时测量,才能看出一个系统是偏向读得准还是偏向像本人。

举一个教学用的例子,不代表论文数值:若同一说话人克隆到法语,系统甲转写错误少但嵌入相似度中等,系统乙相似度高但转写错误多,这就构成 1 次可复述的权衡观察。论文的贡献是把这类观察系统化:固定英语源、固定 6 种目标文本、固定评估工具,只更换生成模型,然后看 4 条权衡曲线如何随语言变化。阿拉伯语被单独强调,因为它形态复杂且只有两套系统宣称支持,最能暴露覆盖度与架构的短板。

统一管线如何保证四套系统吃到相同输入?

论文设计了一个多层统一管线,把数据预处理、说话人表示和模型推理分开。顶层是 ACL-60/60 多语语料,源语言固定为英语,目标文本取自平行语料字段并做 Unicode 一致性归一化。参考音频从波形数组抽取后转为单声道浮点格式,以 16 位脉冲编码调制波形文件保存,明确不做静音裁剪与响度归一化,目的是保留自然韵律。文本侧采用模型原生预处理策略,不强制统一音素空间,各模型用自己的分词器或字音转换,推理时保留归一化后的原始 Unicode 文本以兼容各自流程。

中间是子进程编排器,每套模型跑在独立环境中,通过标准输入输出交换结构化数据,避免依赖冲突。下层是生成与评估,生成音频做峰值归一化后存为 16 位波形文件,再分两路评估:一路用大识别模型做语言定向解码算错误率,一路用说话人嵌入模型算余弦相似度,最后汇总为明细表格与分语言图形。下面的系统结构图把这条主路径画了出来,从上到下依次是输入、编排、4 个模型、生成音频、双路评估与汇总输出,读图时抓住输入到输出的主箭头即可复述全流程。

看图路径: 1. 先从顶部数据集沿箭头向下找参考音频与文本归一化两条输入支路;2. 再看中间子进程编排器如何把四套模型隔离开并行调用;3. 最后确认底部内容一致性与说话人身份两条评估支路的汇合方式

原论文 Figure 1:System architecture for zero-shot cross-lingual voice cloning.

论文图 1。原论文 Figure 1:“System architecture for zero-shot cross-lingual voice cloning.”。

从像素可见,顶部是数据集横条,向下分出参考音频、文本归一化与说话人嵌入 3 个框,再汇入子进程编排器横条。编排器向下分出 4 个模型框,分别标注 MOSS-TTS 自回归编解码标记、Qwen3-TTS 自回归向量、VoxCPM2 扩散与分类器无关引导步数、CosyVoice3 流匹配零样本等字样。继续向下是生成音频横条,注明按模型、语言与说话人存放,再向下是内容一致性与说话人身份两个评估框,分别注明识别模型与错误率口径、嵌入模型与余弦区间,最底部是汇总输出横条。这种分层画法对应正文所说的解耦思想:输入条件相同,差异只应来自架构与预训练。

四套模型的条件机制与文本处理各管什么?

4 套系统的规模与偏置不同。MOSS-TTS 约 8B 参数,是大语言模型式自回归系统,靠音频标记条件与长上下文生成,支持拼音、音素与时长控制,也支持多语与语码切换。Qwen3-TTS 约 1.7B 参数,是多语自回归系统,强调高效声学标记、多码本端到端结构与低延迟流式,支持多方言风格与自然语言控制音色情感韵律。VoxCPM2 约 2B 参数,是免分词的扩散自回归系统,论文图注写作 0.8B,支持较多语言与高采样率输出,波形条件加 10 步去噪与引导系数 2.0。CosyVoice3 约 0.5B 参数,是基于流匹配的轻量系统,直接建模波形流形,强调真实场景下未见说话人与语言的鲁棒零样本合成。

文本处理上论文做了语言相关归一化:阿拉伯语去掉变音符号以降低正字法方差,中文按字算错字率,字母语言转小写并去标点。说话人条件严格只用英语参考音频,保证零样本设定。MOSS 与 Qwen 靠多模态条件经音频标记或向量嵌入送入,VoxCPM2 靠波形条件在扩散过程中送入,CosyVoice3 靠流匹配条件,可带或不带参考转写。

自回归语言建模 × 扩散去噪: 自回归语言建模负责按离散音频标记逐帧预测内容序列,分工偏向语言准确性,扩散去噪负责从噪声出发经多步去噪恢复波形或声学流形,分工偏向声学连续性与音色保持,二者搭配比较的原因是论文要检验离散预测与连续生成哪条路线更能兼顾可懂度与身份,组合意义在于揭示架构归纳偏置如何改变权衡曲线。

流匹配 × 声码器标记: 流匹配负责直接学习从文本条件到波形流形的连续映射,分工是轻量高效的零样本合成,声码器标记负责把语音离散化为语言模型可预测的记号,分工是复用大语言模型的长上下文能力,二者搭配的原因是论文纳入了 CosyVoice3 与 MOSS-TTS 两条不同技术路线,组合意义在于比较连续建模与离散建模在多语种下的泛化差异。

初学者应先沿一个样本走完:一段英语参考波形与一句法语文本进入管线,文本经归一化后按各模型分词,说话人依据经各自条件通道送入生成器,输出一段法语波形,再被识别与嵌入模型打分。这样就能把后文的数字与具体组件对应起来,而不是只记平均值。

本研究训练了什么,没有训练什么?

本研究没有训练 4 套语音合成模型中的任何一套,也没有微调它们的权重。论文明确把工作定位为系统评估与基准比较,计算过程是调用已有模型做推理、再用已有识别与说话人模型做测量。原文没有报告梯度路径、参数冻结与更新、优化器、学习率、训练轮数或重置时机,缺失这些信息不是技术错误,而是因为本研究不包含模型训练阶段,不应从模型名称推定其训练实现。

真实发生的计算分为 3 类。第一类是数据构造与格式转换:抽取英语参考波形、转单声道浮点、存 16 位波形,抽取平行目标文本并做 Unicode 与语言相关归一化。第二类是既有模型推理:批量推理为主、显存不足时回退到单样本,VoxCPM2 按 10 步去噪与引导系数运行,其余模型按各自默认推理配置运行,生成音频做峰值归一化后落盘。第 3 类是自动评估计算:重采样到 16 千赫兹后缓存说话人嵌入并算余弦相似度,用大识别模型做语言定向解码后算词错率或字错率。部署在消费级 3 卡 2080 基础设施上的优化主要是环境隔离与批量调度,不改变模型权重。

因此复现时不应寻找训练脚本,而应准备推理环境、核对输入条件与评估工具版本。后文实验条件节会把数据集规模、指标口径与硬件约束讲清,保证他人能重走同一条推理加测量链路。

数据、协议、指标与聚合口径是什么?

数据用 ACL-60/60 多语语料,覆盖 11 种语言,本研究固定英语为源语言以满足严格零样本要求,内部评估 6 种目标语言:阿拉伯语、德语、法语、日语、俄语和中文。共生成约 3144 条合成话语,分布在 6 种目标语言上。划分上源说话人来自该数据集的英语部分,目标文本来自平行字段,评估时不给模型提供目标语言的说话人录音。采样与预处理已在前文交代,关键是保留自然韵律而不做静音裁剪与响度归一化。

指标分两路。内容一致性用 Whisper large-v3 做语言定向解码,字母语言算词错误率,中文算字符错误率,数值越低表示越可懂。说话人相似度用 SpeechBrain 工具包抽取 ECAPA-TDNN 嵌入,重采样到 16 千赫兹,按说话人缓存嵌入后算余弦相似度并裁剪到合法范围,数值越高表示越像本人。聚合时先按模型、语言与说话人落盘,再跨语言与说话人取均值并用误差线表示方差。硬件预算明确为消费级 3 卡 RTX 2080,批量推理加单样本回退以保证显存鲁棒性。

内容一致性 × 说话人相似度: 内容一致性负责检验合成语音是否忠实读出目标文本,分工由语音识别转写后算错词率承担,说话人相似度负责检验合成语音是否还像源说话人,分工由说话人嵌入余弦相似度承担,二者必须同时测量的原因是跨语种克隆的两个目标可能冲突,组合意义在于用 1 对方向相反的指标把取舍量化出来。

词错误率 × 字符错误率: 词错误率负责在按空格分词的字母语言中统计整词转写错误,字符错误率负责在中文这类按字表意的语言中统计单字错误,二者分工不同是因为中英文书写单位不可比,搭配的原因是要在 6 种目标语言下给出可比的可懂度口径,组合意义在于避免用单一指标掩盖中文与字母语言的差异。

需要提醒的是,评估完全依赖自动指标,没有人类听感评分,不能把自动指标直接当作自然度或情感保真度的证明。阿拉伯语支持本身就是不均衡条件:只有两套系统宣称支持,其余两套缺席该语言比较,跨系统平均值因此口径不同,读数时必须回到分语言表核对。

总体上谁读得更准,谁更像本人?

总体比较要回答的公平问题是:在 6 种目标语言的相同管线下,4 套系统的平均错误率越低越好、平均余弦相似度越高越好,各自的代价是什么。下表先看分语言明细的原表选择,保留了德语、法语与阿拉伯语等关键行,指标方向为相似度越高越好、错误率越低越好,单位按原文为裸数值,相似度为余弦值,错误率为词错率或字错率。表后解释会指出总体权衡与例外。

ModelLanguage SimilarityError Rate Metric
de0.680.18
fr0.670.15
ja0.700.15
ru0.700.20
zh0.690.17
ar0.540.31
de0.500.22
fr0.500.09
ar0.720.25
de0.650.30

上表覆盖了 CosyVoice3 在德法日俄中的高相似度与低错误率行、MOSS 在阿拉伯语与德法上的中等行、Qwen 在德法上的低错误率行以及 VoxCPM2 在阿拉伯语与德法上的高相似度行。它支持的一个判断是分语言差异远大于系统间稳定排序,不能只记平均名次。未胜出项也很清楚:MOSS 在大参数下并未在多数语言取得最低错误或最高相似,说明规模不是跨语迁移的充分条件。

为把总体权衡讲成闭环,下表用原文连续句整理的宽表给出四系统平均画像,列数达到五列以同时呈现架构、错误率、相似度与阿拉伯语支持,表前已说明指标方向,表后将解释平衡点与代价。

系统架构路线平均内容错误率平均说话人相似度阿拉伯语支持情况
VoxCPM2扩散0.280.70支持
MOSS-TTS自回归0.350.52支持
Qwen3-TTS自回归0.160.50不支持
CosyVoice3流匹配0.180.69不支持

上表的主要收益是把取舍说具体了:Qwen 平均错误最低但相似度中等,Vox 相似度最高且错误居中,Cosy 错误低且相似度强,MOSS 错误最高且相似度中等。代价是平均值掩盖了语言覆盖不均,Qwen 与 Cosy 的平均值不含阿拉伯语,直接跨系统比平均会高估它们的全语种能力。分语言证据显示中文与法语在多系统下错误更低,而阿拉伯语错误高出 2 到 3 倍,这是高资源与低资源预训练覆盖差距的直接体现。

下面的总体性能图把同样的结论可视化,左侧错误率越低越好,右侧相似度越高越好,读图时注意误差线代表跨语言与跨说话人方差。

看图路径: 1. 先对比左侧错误率柱高判断哪套系统平均可懂度最低;2. 再对比右侧余弦相似度柱高判断哪套系统身份保留最强;3. 最后观察每根柱顶误差线长度判断跨语言与跨说话人方差大小

原论文 Figure 2:Overall system performance comparison across four zero-shot cross-lingual voice cloning systems…

论文图 2。原论文 Figure 2:“Overall system performance comparison across four zero-shot cross-lingual voice cloning systems evaluated on six target languages (AR, DE, JA, FR, RU, ZH).”。

从像素可见,左侧错误率柱中橙色 Qwen 最矮,绿色 Cosy 次矮,黑色 Vox 居中,蓝色 MOSS 最高且误差线最长,说明 MOSS 跨语言波动最大。右侧相似度柱中黑色 Vox 最高,绿色 Cosy 次高,蓝色 MOSS 与橙色 Qwen 明显更矮且接近。这种左右镜像关系就是论文所说的典型权衡:读得准的往往不够像,很像的往往读得不够准,但 Cosy 在支持语言上相对兼顾,而 Vox 的高相似并未付出最大的可懂度代价。像素不能精确读出小数后 2 位时以正文报告的均值为准,图形只用于判断排序与方差。

分语言看,阿拉伯语为何是例外?

分语言比较要回答的是:在同一目标语言内、相同评估工具下,架构差异是否改变权衡,以及缺席支持的系统如何影响结论。下表聚焦最具区分度的阿拉伯语,用五列同时呈现系统、目标语言、错误率、相似度与权衡含义,数字全部来自原文连续句,指标方向为错误率越低越好、相似度越高越好。表后将解释扩散架构为何在此打破典型模式。

系统目标语言内容错误率说话人相似度权衡含义
VoxCPM2阿拉伯语0.250.72错误最低且相似最高
MOSS-TTS阿拉伯语0.310.54两项均落后
差值阿拉伯语0.060.18MOSS 落后幅度
Qwen3-TTS阿拉伯语不支持不适用缺席比较
CosyVoice3阿拉伯语不支持不适用缺席比较

上表的主要收益是量化了例外:Vox 在阿拉伯语上同时拿下最低错误与最高相似,MOSS 落后 0.06 词错误率与 0.18 相似度点。代价是比较基数小,只有两套系统参评,不能推广为扩散一定优于自回归。未评测边界必须点明:Qwen 与 Cosy 缺席阿拉伯语,它们的优秀高资源成绩不能外推到阿拉伯语用户场景,这正是论文强调的语言支持瓶颈。

下面的分语言图把 6 种语言的逐组对比画全,左侧为各语言错误率,右侧为各语言相似度,读图时按语言组内比较颜色柱高。

看图路径: 1. 先在左侧按目标语言逐组比较四色柱的错误率高低;2. 再在右侧同语言组内比较黑色与绿色柱的相似度优势;3. 最后检查阿拉伯语组缺失颜色对应的系统不支持情况

原论文 Figure 4:Per-language breakdown of content consistency (left) and speaker identity preservation (right)…

论文图 4。原论文 Figure 4:“Per-language breakdown of content consistency (left) and speaker identity preservation (right) for all four systems across six target languages.”。

从像素可见,左侧按目标语言分组,阿拉伯语组只有黑蓝两色柱,德法日俄中组多为四色柱,橙色 Qwen 在德法俄中组普遍最矮,蓝色 MOSS 在多组偏高。右侧同语言组内黑色 Vox 普遍最高,绿色 Cosy 次高,蓝色与橙色偏低。阿拉伯语组的特殊性一目了然:黑色柱在左右两图同时占优,打破了其他语言组中矮错误柱对应矮相似柱的镜像关系。论文将其解释为扩散架构对形态复杂低资源语言的更好泛化,但仍属有限解释,需待更多低资源语言验证。

哪些边界会限制结论的外推?

第一个边界是语言支持不均。只有 MOSS 与 Vox 宣称支持阿拉伯语合成,Cosy 与 Qwen 缺席,这导致总体平均值口径不一致,也使阿拉伯语上的架构比较只有一组对照。论文明确指出这是面向低资源应用的重大局限,不能把高资源语言的排序直接套用到阿拉伯语场景。

第二个边界是评估手段单一。内容只用自动转写错误率,说话人只用嵌入余弦相似度,没有人类对自然度、口音地道程度、情感与细粒度韵律的评价。自动指标能捕捉幻觉与漏读的大错,但对重音、语调是否自然不敏感。第 3 个边界是数据源单一。源说话人只来自 ACL-60/60 的英语部分,不能代表全部口音、年龄与录音条件,真实应用中的信道与风格多样性未被覆盖。

第四个边界是系统覆盖有限。4 套系统只是当时提交的子集,新模型可能呈现不同权衡,且论文未测量延迟、实时率与推理成本,不能承诺效率改善。

原文在冲突处理上是诚实的:它既报告总体上的反向关系,也报告阿拉伯语的反例,并把后者标注为部分缓解而非彻底解决。这种措辞值得学习:用报告显示总体趋势,用支持表达机制解释,用可能待验证表达推广到其他低资源语言的猜想。

要复现这套比较,先做什么?

复现的第一步是锁定输入条件。从 ACL-60/60 取英语参考音频,转单声道浮点后存 16 位波形,不做静音裁剪与响度归一化,从平行字段取 6 种目标文本并做 Unicode 一致性归一化,阿拉伯语去变音符号,字母语言转小写去标点,中文保留按字评估的准备。每套模型用独立环境运行,通过标准输入输出交换结构化数据,避免依赖污染,批量推理为主、显存不足回退单样本。

第二步是固定评估工具与口径。内容侧用 Whisper large-v3 做语言定向解码,字母语言算词错误率、中文算字符错误率,说话人侧重采样到 16 千赫兹后用 ECAPA-TDNN 抽嵌入并缓存,按余弦相似度打分。生成音频先峰值归一化再落盘,按模型、语言与说话人组织目录,最后汇总为明细与分语言图形。关键超参数只有 Vox 明确给出引导系数 2.0 与 10 步去噪,其余按各模型默认推理配置,原文未给出的阈值不要自行补默认值。

关于可用性,资源状态是唯一依据。本次未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开。论文首页写有代码地址,但本次未能确认可达,复现前应先核实链接与权重下载方式,再谈系统可运行。若只能拿到部分模型,应优先复现支持语言交集上的比较,并如实标注缺席语言,避免用子集平均代替全语种结论。

何时值得尝试这条路线,还需补哪项验证?

当任务是把英语音色搬到多语文本且只能提供几秒参考时,这套统一管线值得直接借用:相同的输入处理、相同的双路评估、相同的分语言呈现,能最快定位系统是偏向读得准还是偏向像本人。若目标用户包含阿拉伯语,现有证据支持优先试扩散路线的 Vox 类系统,因为它在该语言上同时给出更低错误与更高相似,而大参数自回归系统并未自动占优。若目标是中法等高资源语言,自回归与流匹配系统的低错误率更具吸引力,但要接受中等身份保留的代价。

还需补的验证很具体。一是补人类听感,至少覆盖自然度与口音可接受度,以确认自动指标的排序在人耳下成立。二是补更多低资源与形态复杂语言,检验扩散在阿拉伯语上的例外能否推广。三是补成本测量,包括推理步数、显存占用与延迟,把权衡从质量维度扩展到部署维度。四是补跨源语言验证,当前源固定为英语,换源后结论是否稳定仍待验证。

回到中心矛盾:语言可懂度与说话人身份在多数语言上此消彼长,架构与预训练覆盖决定了曲线位置,语言支持决定了结论边界。记住 0.25 对 0.31 与 0.72 对 0.54 这组阿拉伯语对照,以及 Qwen 的 0.16 低错误伴随 0.50 中等相似的总体画像,就抓住了论文最可复述的证据。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 iwslt-2026 论文汇总