英文题目:The Interspeech 2026 Challenge on Transfer of Pragmatic Intent in Speech-to-Speech Translation

会议身份:conference:interspeech:2026:conference-paper-id:ward26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准设计 #主观评测 #韵律 #语音翻译

评分:6.2/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Nigel G. Ward:机构信息未能从会议 PDF 纯文本可靠映射
  • Marcel de Korte:机构信息未能从会议 PDF 纯文本可靠映射
  • Javier Vazquez:机构信息未能从会议 PDF 纯文本可靠映射
  • Montserrat G. Molina:机构信息未能从会议 PDF 纯文本可靠映射
  • Vanessa Bolado:机构信息未能从会议 PDF 纯文本可靠映射
  • Carol Figueroa:机构信息未能从会议 PDF 纯文本可靠映射
  • Eliya Nachmani:机构信息未能从会议 PDF 纯文本可靠映射
  • John E. Ortega:机构信息未能从会议 PDF 纯文本可靠映射
  • Satoshi Nakamura:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音到语音翻译需在转换词义的同时传递语气与交际意图,输入为源语言会话语音、输出为目标语言语音,难点在于韵律承载的语用功能易在级联中丢失且缺乏直接评测。挑战先让双语者无脚本自然对话并跨语言多次复演选定话语,直至双方认可语气意图一致,形成语用金标准复演参照。接着将原文与候选译文按固定听音顺序提交四名西英双语评委,要求屏蔽语义与音色干扰,仅按语气、感受与意图打1至5分语用相似度。同时用Segura语用相似度自动指标对照人工打分,以检验自动排序与人评的一致性并暴露过敏感等问题。与以往经由韵律声学属性间接推断不同,该设计直接以复演为参照并强制分离语义保真度,使韵律层面的意图保留成为可比目标,具有实际沟通意义。在英语到西班牙语特征映射条件下,MUC的Segura指标为0.8601,高于基线的Segura指标0.8574。该结论仅适用于美式英语与北墨西哥西班牙语短会话话语与小规模评委设置,不能外推至长对话与真实交互场景。其适用边界受限于短话语与小规模评委,尚未验证长对话与真实交互外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么语音翻译译对词还不够用?

输入是真实对话里的一句话语音,比如英语 did you see her?目标是生成另一语言的语音,让对方不仅知道字面问了什么,还能感受到说话人的立场和意图。必须保留的信息有两层,一层是词汇语义,另一层是语用意图,也就是语气、感受和交际目的。举例来说,同样一句话,用屏住呼吸的好奇语气说出来,是在鼓励对方继续讲分手后的复杂心情,如果译文变成平淡朗读,词对了但安慰、好奇和体贴丢了,对话就接不下去。

论文的动机正是当前语音到语音翻译只保语义和自然度,不保语用。作者把语用保真度定义为对原文语气、感受和意图的忠实程度,英文是 pragmatic fidelity。输出是西班牙语或英语语音,要求在对话场景下可用。研究目标有 3 个,一是测量当前技术在这 1 维度上能做到多好,二是发现哪些语用功能最容易丢失,三是检验语用评价方法本身是否可靠。

语用保真度 × 语义保真度: 语义保真度负责词义是否译对,语用保真度负责语气、感受和意图是否译对,前者靠词汇对应即可判断,后者要靠韵律实现,二者搭配的原因是日常对话同时需要信息正确和交际得体,组合意义在于把评价从能不能听懂扩展到能不能顺利把话说下去。

初学者容易误以为自然就是传神,但论文区分得很清楚,自然度是听起来像人,语义是词义正确,语用是交际行为正确。一个例子是讲故事风格、解释风格、犹豫、思考、 amusement、正面评价、否定评价、疑问标记和词汇重音,这些都不改变字面翻译,但决定听者如何理解说话人的下一步期待。挑战的全部设计都围绕这个缺口展开。

已有路线在评什么,为什么还缺语用?

同输入同目标的路线是语音到语音翻译扩展。近年工作把范围从语义扩大到说话人保持、情感和表现力迁移、延迟和等时、空间线索、风格和表现力,论文列举了 TransVIP、StyleS2ST、Seamless、Hibiki 等方向。监督信号从平行文本、语音对齐扩展到单语数据和间接训练,比如 Translatotron 3 和 RosettaSpeech 试图只用单语数据做翻译。同运行阶段的评价路线包括 IWSLT 评测、BLASER 无文本评价、整体级联系统与人类评价协议,以及语音合成领域的 VoiceMOS 和机器翻译元评价。 同监督但不同目标的路线是只做重音迁移。

论文指出,众多语用功能里只有强调得到了较多关注,有序列到序列强调翻译、强调基准和重音保持等工作。其他功能如寒暄、铺垫、示弱、共情和话轮管理很少被系统评价。这说明当前社区有能力处理局部突出,但没有系统处理整句意图。 本文与上述工作的差别是首次把语用意图作为主任务和主指标。它不比较谁的词错率最低,而是比较谁在跨语言后还保留了原来的交际行为。

为此它同时做主观听评和自动度量,并把人类重演既当候选项又当金标准,这是与合成和翻译评价最大的不同。

任务到底要求输入什么、输出什么?

任务有 2 个方向,英语到西班牙语和西班牙语到英语。输入是取自真实对话的句子级语音,平均时长 2.5 秒,最短 0.4 秒,最长 6.0 秒。输出在音频条件下是另一语言的语音波形,在特征映射条件下是另一语言的韵律特征向量。评价问的是译文在语气、感受和意图上与原文有多像,1 分表示完全不像,5 分表示等价。

数据构造方式很特殊,不是找译员翻译文本再朗读,而是让原来聊天的 5 位西英双语者先自由聊宠物、做饭、教学和上课等话题,再共同选出聊得生动有趣的片段,把其中句子用另一种语言重新演出来。重演时由原来说话的两个人反复尝试,直到双方都满意新录音在语气和交际意图上贴近原版。测试集由此得到英语到西班牙语 240 条、西班牙语到英语 199 条。训练只提供 2893 对同协议、同录音室、同人群的小规模匹配数据,预期队伍主要靠外部资源和间接训练。

难点在于质量优先于数量。作者想要覆盖自然对话中常见且多样的语用功能,又要求每对源目标功能尽量一致。没有请求元数据、修正文本和上下文的队伍,主办方就不再额外提供。这种小而精的策略决定了后面统计功效有限,但每条样本的语用标注可信度较高。

两种参赛条件和两套评价如何拼在一起?

全景是两条参赛通道加两套评价。通道一是音频到音频系统,输入输出都是声音,评价同时走人工听评和自动度量。通道二是特征到特征系统,英语用 103 维特征、西班牙语用 101 维特征,英语到西班牙语要学从 103 到 101 的映射,反之亦然,只走自动度量。原来还设想过第三种只给 100 维韵律描述的通道,但无人参赛,最终只有 2 个条件生效。

音频条件 × 特征映射条件: 音频条件要求输入输出都是语音波形,特征映射条件要求输入输出都是刻画语用相关韵律的特征向量,前者考端到端可听翻译,后者只考跨语言韵律对应关系,二者搭配是为了降低参赛门槛并分离合成质量与韵律映射能力,组合意义在于让没有语音合成能力的队伍也能研究意图迁移本身。

下图是论文对条件与评价关系的总结,它把人工和自动放在同一张流程里,能帮你 1 次看清谁评谁、谁和谁比。

看图路径: 1. 先找到左侧输入语音与特征映射两条输入支路,确认音频系统和特征系统入口不同;2. 再看中间 human evaluation 与 Segura metric 两个评价框分别输出 scores;3. 接着追踪 output audio 同时指向人工评价和自动度量的黑色箭头;4. 最后确认 target language features 只进入 Segura metric 而不进入人工听评

原论文 Figure 1:Summary of conditions and evaluations.

论文图 1。原论文 Figure 1:“Summary of conditions and evaluations.”。

从像素可见,图的上分支是人工评价框输出分数,中间是 Segura 度量框输出分数,下方云形是特征映射模块。输出语音同时用箭头指向人工评价和 Segura 度量,而目标语言特征只指向 Segura 度量。这正好对应正文说法,音频系统同时接受两种评价,特征系统只接受自动评价,而且跨条件分数不可比,因为把韵律写对特征比真正合成出带词的语音更容易。提交方式也不同,特征系统走 CodaBench 自动打分,音频走邮件。

人工打分和自动打分各自算什么?

先走一个样本的完整路径。评委先听原句两遍,再听候选译文一两遍,原句与 3 个候选项交替呈现,3 个候选包括两个系统输出和一个人类重演,顺序随机,可要求重放。前 6 组允许小组讨论后改分,之后独立打分,最后还有定性访谈复听前 10 组并总结优缺点。打分只看语用保真度,明确要求忽略音色差异和语义内容差异,打分保留 2 位小数。 人工评价的计算目标是每条译文的语用相似均值。

4 位西英双语评委都是德州大学埃尔帕索分校学生或毕业生,其中 2 人参与过测试数据录制,有时会评到自己的话。每人评 59 组共 177 个评分,报酬是 3 小时 70 美元加午餐。这种安排保证能长时间专注聆听、反思理由并维持注意力。

语音到语音翻译 × 韵律: 语音到语音翻译负责跨语言生成可听的译文语音,韵律负责通过音高、时长、强度和音质变化携带立场和意图,前者提供翻译主通道,后者提供语用信息的载体,二者搭配是因为文本相同但韵律不同会表达完全不同的交际行为,组合后系统既要译词又要译腔调。

自动评价用 Segura 度量比较系统输出与重演。它取平均池化后 HuBERT 特征子集的表征余弦相似度,英语 103 维、西班牙语 101 维,开箱即用。它曾在大规模人类语用相似判断上调参,问法与本次语气感受意图基本一致。作者报告它有两个已知弱点,一是不支持跨条件比较,二是对犹豫和自信的细微差别偶尔过敏感。

Segura 度量 × Marco 度量: Segura 度量负责用平均池化后 HuBERT 特征子集的余弦相似度估计两句语音的语用相似度,Marco 度量负责用 100 个有语用含义的韵律特征加权欧氏距离比较两句语音,前者是数据驱动的表征相似,后者是知识驱动的特征距离,搭配对比的原因是想检验自动评价是否贴近人类对语气感受意图的判断,组合意义在于揭示哪种自动近似更值得做初筛。

另一个自动参照是 Marco 度量,用 100 个韵律特征加权欧氏距离比较两句语音,覆盖音高范围、嘎裂声、气息声、延长、强度等,窗口拼满整句。它在本次挑战中与人类判断相关较低,作为对照出现。

模型用什么数据训练,基线到底做了什么?

本研究没有统一训练一个大模型,而是提供小规模匹配数据并允许各队自带资源。匹配训练集是 2893 对英语西班牙语句子,用与测试集相同协议、同一录音室、同类人群录制,适合调超参数和小幅微调。由于对话式平行语音稀缺,预期队伍依赖外部语音识别、翻译和合成模型以及间接训练方法。论文明确说准备了元数据、修正文本和上下文,但没有队伍索取,因此实际训练条件就是各队自选。

人类重演 × 系统输出: 人类重演是由原对话者反复录制到双方满意的另一语言版本,系统输出是参赛模型自动生成的译文或特征,前者被当作主观评价中的平等候选项和自动评价中的金标准,后者是被评价对象,二者搭配是为了保证每对源目标在语气和交际意图上尽量一致,组合后才能度量机器与人差距。

基线是一个简单多层感知机,只在提供的特征上做跨语言映射,用匹配数据训练,主办方还放出 Jupyter 笔记本方便替换模型、损失和数据。特征映射参赛系统在此基础上改动,闽族大学把多层感知机换成 Transformer 并在损失中加入 Marco 距离的欧氏项,北京语言大学用检索思路,取训练集中最相似的 70 条英语并按相似度加权平均其西班牙语特征,巴黎西岱大学结合 Seamless 与 Hibiki 思路。

音频侧港中大深圳用级联管线,Whisper 做识别,Qwen2.5-72B-Instruct 翻文本,FishAudio 或 OpenAudio-S1-Mini 合成英语,关键创新是把西班牙语源语音和识别文本同时作为合成器的提示。对照的 Seamless 是开源多语言表现力翻译系统。 需要指出缺项,论文未报告各系统的优化器、学习率、冻结哪些参数、梯度是否截断、训练步数和硬件预算,因此不能从模型名字推定实现细节,也不能把无统一训练等同于确定性求解。

实验条件如何保证可比,指标方向是什么?

主观实验按组组织,每组一个原句对应 3 个候选,评委按固定听音顺序打分,候选随机排序。指标是 1 到 5 分,分数越高语用越像。统计用配对 t 检验,显著性阈值 p 小于 0.01。自动指标是 Segura 相似度,越高越像,Marco 是距离,越小越像。聚合对象是测试集上所有条目的平均分,音频西班牙语到英语人工评了 59 组,自动评了全部音频输出,特征映射用 CodaBench 自动计算。

公平条件方面,同一方向内同一评价下比较才有效。音频的人工分可以比相对高低,自动分只能在音频内部或特征内部比,不能跨音频与特征比。人类重演在主观评价中是平等候选项,在自动评价中是金标准。评委被指导只评语用,忽略音色和语义,但定性讨论显示他们对语用理解偏宽,把风格差异也算了进去。 成本与资源按原文交代有限,只知道评委人数、每人工作量和报酬,以及挑战从公布到截止只有七周。

硬件、推理延迟、合成实时率均未报告,因此不能承诺任何延迟或成本改善。最终只有 4 支大学队伍正式提交,尽管有多家大公司表达兴趣,作者归因于任务新颖、社区小和时间紧。

谁最好,与人差多少,自动指标一致吗?

核心问题是最佳系统离人多远,以及开源强基线离最佳研究系统多远。西班牙语到英语音频的人工评价显示人类重演明显高于两个系统,最佳系统仍低 1.2 分左右,差距显著。 下表是人工评分的整理,指标是 5 分制语用保真度均值,方向是越高越好,比较在同一组配对条件下进行。

条件指标人类重演CUHK-SZSeamless
西语到英语音频语用保真度均值 5 分制4.593.462.98
西语到英语音频标准差0.360.630.64

表前比较问题是同一批原句下谁更保住语气感受意图,公平条件是相同 59 组、相同评委、随机顺序盲评,指标方向越高越好。表后解释是 CUHK-SZ 平均高出 Seamless 约 0.5 分且配对检验显著,但 CUHK-SZ 只在 77% 的条目上超过 Seamless,说明两者有互补优势。代价是两者离人类重演仍远,且方差更大,表明表现不稳定。未胜出项 Seamless 虽平均低,但在近 1/4 条目上反超,值得保留对照。有 1 次 CUHK-SZ 甚至超过人类重演,属个别例外。

自动度量是否给出同样排序需要单独看。下表是同一方向音频的 Segura 分数,越高越好。

条件指标CUHK-SZSeamless可比范围
西语到英语音频Segura 相似度0.72700.7175仅音频内部
西语到英语音频显著性不显著差异不显著差异配对比较

表前问题是自动相似度能否复现人工排序,公平条件是同一输出对比同一重演金标准,方向越高越像。表后解释是排序一致,CUHK-SZ 略高,但差异不显著,支持自动分可做初筛但不能替代人工。反例是数值差距很小,若只看自动分会低估人工感知到的 0.5 分差距。

特征映射方向只有自动分,最好的 MUC 只比基线高一点点,检索法反而低于基线,说明简单感知机已是不弱起点。英语到西班牙语似乎比反方向容易,这与作者此前观察一致。

哪些语用功能丢了,哪些风格没过去?

论文用主题分析思路做了跟进探索。作者听了 32 组的原句,归纳出 107 个功能实例、60 种不同功能,平均每句 3.3 个功能。CUHK-SZ 只传过去 30 个,Seamless 只传过去 26 个,比例分别为 28% 和 24%。这支持评委的主观印象,即系统倾向输出中性朗读风格,语用意图大面积丢失。 相对保得较好的有疑问标记和否定评价,但两者在数据中都不多。

较常见的词汇重音、讲故事风格和解释风格约一半时间能过去。经常丢失的有标记顿悟、犹豫、深思、 amusement、引入新指称和会话风格,最常见的正面评价 1 次都没成功传递,还有长尾罕见功能也都没过去。 另一类错误是无中生有,即输出带有原文没有的功能。技术原因有时明显,如识别错、误读输入韵律、输出韵律毛刺把轻微对比做成强重音。最短的感叹如 ohhh 和最长的含引语或句内意图转折的句子最难。

风格差异是意外重点,原句多为低调、轻声、随意,叠加讲故事、幽默、画面感或求共情,而系统输出多为中性。例子音频放在作者网站,资源状态本次为未验证,不写可公开。

评价方法本身可信吗,边界在哪里?

主观协议的信度用两类数字检验。评委两两一致性在 0.48 到 0.80 之间,平均 0.61。Segura 与人类均值的相关为 0.512,Marco 与人类均值相关仅 0.258。方向都是越高越一致。下表把 3 类相关放在一起,条件是西班牙语到英语的 53 个评分,指标是相关系数。

评价对象比较相关或分数方向说明
人工之间两两平均0.613越高越一致差异多为敏感点不同
自动与人工Segura 对人工均值0.512越高越好可做初步质量估计
自动与人工Marco 对人工均值0.258越高越好表现不佳
特征映射英到西最优与基线0.8601 对 0.8574越高越好仅微弱超越
特征映射西到英基线与参赛0.8054 对 0.5613越高越好参赛低于基线

表前问题是在小样本下人工是否稳定、自动是否贴近人工,公平条件是同一批条目、同一金标准,指标方向已注明。

表后解释是人工协议相当稳健,定性讨论未发现实质分歧,多为每位评委敏感点不同,评委也表示能把语用与语义瑕疵、音频伪影分开。代价是部分影响评分的因素在真实跨语言通话中可能不重要,如话语标记、犹豫、非流利、继续意图和某些风格差异,因为实际场景有姿态和注视等冗余线索。未评测边界包括误判率、延迟、成本和多轮对话效果,均未测量。 自动侧结论是 Segura 可做初步估计但不能单独作为评价,Marco 在此任务上不佳。跨条件不可比仍是硬限制。

要复现和复用需要准备什么?

先复现评价,再复现系统。评价复现需要原句音频、人类重演音频、两个系统的输出音频和评委打分表。论文说在某网址发布输入、目标输出、两系统输出和质量评分,但本次收到的证据中该链接被隐去,且没有绑定且完成验证的开源资源,因此只能写本次未能确认可达,不要声称代码模型数据已公开。 系统复现分两路。音频路复现 CUHK-SZ 需要 Whisper、Qwen2.5-72B-Instruct 和 FishAudio 或 OpenAudio-S1-Mini,并把源语音加识别文本作为合成提示,缺失超参数和提示模板细节,需从系统描述手稿补。

特征路复现基线需要 Jupyter 笔记本、多层感知机和 2893 对匹配数据,英语 103 维、西班牙语 101 维,反方向注意维度交换。MUC 的 Transformer 加 Marco 损失、北语的 70 近邻检索加权平均、PAPTAN 的 Seamless 加 Hibiki 结合都需看各自手稿。 先做事项是按方向整理特征维度,跑通基线在 CodaBench 上的自动分,再小批量做盲听。验证补项至少包括报告配对检验的样本量、随机种子、训练硬件和推理耗时,以及在长句、短感叹和含引语 3 类边界上的分开评分,避免总体均值掩盖短板。

何时值得尝试这个方向,下一步做什么?

当你的场景是跨语言聊天、教学、劝说和娱乐,而不只是传达信息时,值得尝试语用迁移。证据显示最佳系统人工 3.46 对人类 4.59,差距 1.2 分,说明词对了但意图常丢。另一证据是开源 Seamless 2.98 对最佳研究系统 3.46,差距 0.5 分,说明部分改进可能较快落地,但仍需验证。 可操作建议是先从疑问、否定评价、词汇重音和讲故事解释风格入手,这些已有部分成功,再攻正面评价、犹豫深思、 amusement 和新指称 grounding,这些目前几乎全丢。同时把风格从中性朗读往低调随意会话风格调,因为这是评委感知落差的重要来源。

未验证推测要谨慎。相关性不等于因果,Segura 相关 0.51 不证明优化它必然提升人工分。缺失证据不是技术错误,只是尚待验证,包括误判率、延迟、成本、长期对话连贯和文化适配。长远看,语言学分析、损失函数和训练数据的改进需要一起做,目标是让使用者能跨语言解释、说服、教学和娱乐,而不只是把词译对。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总