英文题目:CVSS-X: A Multilingual Speech-to-Speech Translation Corpus for 28 Languages

标签:#语音翻译 | #数据集构建 | #多语言 | #数据集

评分:7.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • Lucas Rafael Stefanel Gris:Federal University of Goiás, Goiânia, Brazil
  • Alef Iury Siqueira Ferreira:Federal University of Goiás, Goiânia, Brazil
  • Frederico Santos de Oliveira:Federal University of Mato Grosso, Cuiabá, Brazil
  • Augusto Seben da Rosa:São Paulo State University, São Paulo, Brazil
  • Alexandre Costa Ferro Filho:Federal University of Goiás, Goiânia, Brazil
  • Arlindo Rodrigues Galvão Filho:Federal University of Goiás, Goiânia, Brazil
  • Anderson da Silva Soares:Federal University of Goiás, Goiânia, Brazil

📌 核心摘要

语音到语音翻译(Speech-to-Speech Translation, S2ST)需将英语口语转为多语种目标语音,难点在于平行语音稀缺且多对多对齐成本极高,非英语方向尤其缺乏可训练数据。该工作以英语常识语音(Common Voice)真实录音为源,先用神经机器翻译生成 28 语种平行文本,再用多语种语音合成统一合成为目标语音,其中正则变体使用固定男女声,迁移变体通过跨语种音色克隆保留源说话人。与仅覆盖译入英语的 CVSS 相比,关键机制差异是用已验证平行文本保证句级完美对齐,并用单一可克隆合成器实现跨语系规模化扩展。在开发集每语种 200 条抽样的 Whisper large-v3 回译评测中,正则变体在罗曼斯语族达到 ASR-BLEU 90.3,显著高于印欧伊朗语族的 63.7,显示合成保真度随语系分化。该结论仅适用于合成语音可懂度与自然度层面,未验证真实说话人跨语训练的有效性与人耳感知一致性。原文未披露合成阶段训练、推理与部署成本,仅披露翻译阶段单卡约 11 小时。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为何需要并行语音?

这篇论文要解决的输入很具体:一段英语真人朗读语音。期望的输出也很具体:同一句话用另一种目标语言说出来的语音,而且句子要对齐、内容要对应。初学者容易以为把音频丢给大模型就能端到端学会,实际上直接建模需要大量输入语音和输出语音严格配对的训练数据,否则模型不知道哪段声音对应哪段声音。

传统做法是把长链拆开。白话解释是:自动语音识别负责把语音听写成文字,基于文本的机器翻译负责把源语言文字翻成目标语言文字,文本到语音合成负责把目标文字读成目标语音。后文分别简称为语音识别、机器翻译和语音合成。这种级联的好处是每段都有数据和评测方法,坏处是听写错一个词,翻译和合成只能将错就错。

直接语音到语音翻译想跳过中间文字,直接从源语音预测目标语音。论文提到的 Translatotron 和基于离散语音单元的方法都属于这一路线。但直接方法更依赖并行语音语料,而真实采集需要找会两种语言的说话人逐句对齐朗读,成本极高。这就是合成语料出现的原因:用已有源语音加机器翻译文本加语音合成,批量制造句子级对齐的训练对。

语音到语音翻译 × 级联系统: 语音到语音翻译负责把源语言语音直接变为目标语言语音,分工是解决跨语言的声音到声音映射;级联系统负责把该映射拆成语音识别转写、文本机器翻译、语音合成 3 段,分工是每段只处理一种模态转换,搭配理由是每段都有成熟数据和指标,组合意义是级联误差会逐段传递,而直接建模正是为了减少这种传递。

本解读的输入是论文标题、摘要、正文证据和官方资源可达状态,目标是让研究生能复述构造方法和评价条件。必须保留的信息包括翻译方向、语言数量、两个子集的生成方式、数据划分、合成与翻译工具选择、评价指标与采样规模,以及代码和数据链接的当前可达状态。输出按学习依赖展开,不做超出证据的效果承诺。

同输入同目标的已有语料各解决了什么?

如果只看输入输出,同类工作都是想提供可训练的语音到语音翻译数据。论文把它们按真实录制、自动挖掘和合成生成 3 类区分。真实录制指人实际说两种语言并对齐,例如西班牙语英语 Fisher 语料和 VoxPopuli。自动挖掘指从现成会议录音中自动寻找疑似对齐的句子,例如 SpeechMatrix 和 SeamlessAlign。合成生成指用语音合成批量产生目标语音,例如 CVSS 和本文的 CVSS-X。

CVSS 是第一个大规模公开的合成并行语料,但方向是多对一,只做 21 种语言到英语。SpeechMatrix 规模很大但只覆盖欧洲语言且对齐是近似的。SeamlessAlign 覆盖语言更多,但论文指出其公开的只是元数据,需要用户再从 Common Crawl 重建,不能直接下载完整可用语料。这些差异决定了它们不是同一条件下的可比基线,不能简单按小时数判定谁更好。

CVSS-X 的定位是补上反向:从英语到 28 种目标语言,并且与 CVSS 合在一起后,可以把英语当作枢轴,研究任意语言对之间的翻译。也就是说,论文没有声称在挖掘质量上超过大规模挖掘语料,而是强调可直接下载、句子级对齐严格、方向互补。理解这一点才能正确看待后文用小时数做规模对比的描述:小时数大主要来自合成方式和多语言复制,而不是录制质量更高。

只做多对一会卡住哪类研究?

CVSS 的输入是 21 种源语言语音,输出固定是英语语音。对于想做英语到其他语言的研究者,这个语料没有提供监督信号。对于想做非英语之间互译的研究者,同样缺少可用的训练对。论文要解决的正是这个方向缺失,而不是在同一方向上把英语合成做得更自然。

第二个问题是语言覆盖的形态差异。只做英语目标时,合成器只需要做好一种语言。一旦目标变成 28 种语言,合成器必须处理不同的书写系统、切分习惯和语音结构。例如中文、日语、泰语没有空格切分,常规按空格计算的翻译质量指标会失效。希伯来语等非拉丁文字、泰语的声调相关转写问题,也会让同样的识别加比对流程得到更差的分数。这意味着评价必须分语系看,不能只报一个平均值。

第 3 个问题是音色条件。一种做法是每种语言只用固定标准音,保证清晰。另一种做法是保留源说话人的音色,听起来更像同一个人跨语言说话,但会把源录音的噪声和口音相关特征也带进来。论文同时提供两种,就是为了让后续研究能分别回答内容是否翻对和声音是否像本人这两个不同问题。

一条英语录音如何变成二十八种语言的配对语音?

先沿着一个样本走完全程。输入是一条英语 Common Voice 录音和它的人工转写。第一步用机器翻译把英语转写翻成目标语言文本,例如英语到葡萄牙语。第二步用多语语音合成把目标文本读成目标语音。输出是 1 对语音:左边是原始英语人声,右边是合成的目标语言语音,两者通过中间文本严格对应。整个流程不重新录制目标人声,因此对齐是构造出来的,而不是挖掘出来的。

论文提供两个并行版本。CVSS-X-C 是规范版,每种语言预先准备 1 男 1 女两个固定参考音,根据源说话人的性别元数据选择用哪个声音合成。CVSS-X-T 是音色迁移版,直接用该条英语源录音做零样本音色克隆去合成目标语言,目标是保留说话人特征。两者文本相同,声学条件不同。

CVSS-X-C × CVSS-X-T: CVSS-X-C 负责用每语言固定的两个标准音色合成目标语音,分工是提供清晰稳定的可懂度基准;CVSS-X-T 负责用源英语录音做跨语言音色克隆,分工是保留说话人特征,搭配理由是同一并行文本配两种声学实现,组合意义是让研究者对照标准音与保留音色两种条件下翻译模型的行为。

从规模上看,每种目标语言都复制了同一批约 240000 条英语源语句,因此总对数是语言数乘以单语言样本数。论文报告总量超过 16000 小时,其中规范版约六千多小时,迁移版约九千多小时。迁移版平均时长更长,与克隆时保留源音频的声学特性有关,后文评价也显示其自然度略低。理解这个全景后,下一节再拆翻译和合成 2 个组件的具体选择。

要核对语言覆盖,不能只记二十八这个总数。论文把目标语言按语系归纳为 7 个宏类别,实际跨越 12 个类型学语族,复现时语言代码必须与原表一致,否则分语系聚合会对不上。下面这张原表就是核对代码的依据,比较问题是覆盖是否包含日耳曼、罗曼斯、斯拉夫之外的亚洲和中东语言,公平条件是按论文的宏类别划分,指标方向是类别越全、后续泛化检验越严格。

FamilyNLanguages
Romance6PT, ES, FR, IT, RO, CA
Germanic5DE, NL, SV, DA, NO
Slavic4RU, PL, CS, UK
CJK3ZH, JA, KO
Uralic2FI, HU
Indo-Iranian2HI, FA
Other6EL, HE, TR, TH, ID, VI

上表给出罗曼斯 6 种、日耳曼 5 种、斯拉夫 4 种、中日韩 3 种、乌拉尔两种、印欧伊朗两种、其他 6 种的具体代码。论文在别处说跨 12 个语系,这里归并为 7 个宏类别是为了便于比较分析,两者是聚合粒度不同,并不冲突。选择目标语言子集做实验时,应说明保留了哪些宏类别,避免只挑罗曼斯语系报高分而隐瞒困难语言。未胜出的边界已经 visible:印欧伊朗和其他类别后续保真明显更低,不能用平均数代替。

翻译和合成各自承担什么,为何这样选型?

翻译组件的任务是把英语转写变成目标语言文本。论文比较了 7 个翻译模型,用 100 条英语到葡萄牙语样本做大模型打分,考察准确性、流畅性和术语 3 个维度。TranslateGemma 系列质量更高,但每句需要数百毫秒,全部语言要超过 10 天。NLLB-200 蒸馏版质量略低,每句约十几毫秒,全部 28 种语言在单卡上约 11 小时完成。论文因此选择 NLLB-200,理由是速度和质量的折中,而不是质量最高。

这个选择直接决定了后续限制:低资源语言的翻译错误会进入合成提示文本。合成环节无法纠正语义错误,只能把错误的文本读清楚。因此后文用识别比对测得的高分,只能说明读得准,不能证明翻得对。这一点是理解全部评价数字的前提。

合成组件的任务是把目标文本变成目标语音。论文选择 OmniVoice,理由是它支持跨语言音色克隆,可以用一种语言的参考音合成另一种语言,同时尽量减少把英语口音特征带到目标语言。白话说,规范版只需要它能多语言读得清楚,迁移版还需要它能抓住说话人音色。这个搭配的依据在正文有明确说明:迁移版的参考音只能是英语源录音,因此必须用支持跨语言克隆的合成器。

NLLB-200 × OmniVoice: NLLB-200 负责把英语转写翻译成 28 种目标语言文本,分工是解决语义转换;OmniVoice 负责把目标文本合成为目标语音并支持跨语言音色克隆,分工是解决声学实现,搭配理由是文本是两者之间唯一可校验的对齐点,组合意义是源语音和目标语音通过同一文本实现句子级严格对齐。

规范版的音色实现还有一个细节:用第三方声音设计功能构造中性清晰的合成说话人,性别为空、其他或男性的样本用男声,标注为女性的样本用女声,最终男声占比 80% 以上。论文称这比 CVSS-C 的单一规范音多了 1 倍的声音多样性。迁移版有小比例样本因信号不足被跳过,这意味着迁移版不是每条源语音都有对应目标,不是简单的等量复制。

本研究训练了什么,没有训练什么?

本研究没有训练新的语音翻译模型,也没有训练新的翻译或合成模型。论文属于数据集论文,其计算是构造流程和评价流程,不是梯度优化。因此不存在需要报告的参数冻结、梯度路径或学习率的训练阶段,读者不应把合成调用当成模型训练。

真实的计算分为 3 类。第一类是翻译推理:用已有的 NLLB-200 蒸馏模型对全部源转写做批量翻译,这是决定文本质量和许可协议的关键步骤。第二类是合成推理:用已有的 OmniVoice 对每种语言生成规范版和迁移版语音,其中迁移版以源英语音频为条件做零样本克隆。第 3 类是质量评价计算:用 Whisper 做识别并计算词错率、字错率和识别后翻译质量,用自然度预测模型打分,用说话人编码模型计算相似度。

规范音色 × 跨语言音色克隆: 规范音色指每语言预先设计好的 1 男 1 女固定参考音,分工是提供与源说话人无关的稳定目标;跨语言音色克隆指以英语源录音为参考合成目标语言语音,分工是把源说话人音色带到目标语言,搭配理由是同一源句对应两种目标声学条件,组合意义是分别支撑对翻译内容和对说话人一致性的研究。

需要特别说明的缺项是,论文没有报告人工听音的平均意见分,也没有报告翻译环节相对人工参考的独立质量分解。自动指标只能说明合成语音是否可被识别回提示文本,不能证明翻译本身相对人工参考完全正确。论文在局限中承认需要与人工参考做交叉验证,这一项在当前版本仍是待办,不是已完成验证。

评价想回答什么,样本和指标条件是什么?

评价要回答 3 个不同问题:合成语音的内容是否保真,自然度如何,迁移版是否保留了说话人。内容保真用 Whisper 识别后与合成提示文本比较,报告词错率、字错率和识别后 BLEU。自然度用 UTMOS 预测,量程为一到五。说话人相似度用 ECAPA-TDNN 计算。方向要记住:词错率越低越好,BLEU 和 UTMOS 越高越好,相似度越高表示越像源说话人。

采样条件是每语言从开发集分层随机抽 200 条,每个版本共 5600 条。论文给出了选择依据:在标准差约 0.5 的条件下,200 条可使自然度的置信区间收窄到足以发现有意义差异。为公平比较,作者用同样模型和同样样本量重新评价了原始 CVSS,而不是直接引用旧论文数字。直接比较仍有不对称,因为 CVSS 是多语言到英语,CVSS-X 是英语到多语言,任务难度不同。

ASR-BLEU × UTMOS: ASR-BLEU 负责把合成语音再用语音识别转写后与合成提示文本比对,分工是度量内容保真和可懂度;UTMOS 负责预测听感自然度,分工是度量声音是否自然,搭配理由是前者看内容是否丢失、后者看声音是否顺耳,组合意义是避免把读对但难听与好听但读错两种失败混为一谈。

对无空格语言的处理是论文特有的评价细节。中文、日语、泰语用常规按空格的 BLEU 会得到零,因此改用专用分词工具,并报告字错率和字符级指标。复现时必须保留这一条件,否则同样的合成语音会因为指标实现不同而得到完全不可比的分数。论文还指出泰语在不用专用分词时词错率极高,希伯来语词错率也明显偏高,这些都与文字和识别实现有关,不能直接解读为合成器完全失败。

分语系看,哪些保真高,哪些明显更难?

先提出比较问题:在同一合成管线下,不同语系的保真度和自然度是否一致,规范版和迁移版的差距有多大。公平条件是同一样本量、同样的识别和自然度模型、按语系聚合。指标方向是词错率越低越好,识别后 BLEU 越高越好,自然度越高越好。论文把罗曼斯、日耳曼、斯拉夫、中日韩、乌拉尔、印欧伊朗和其他分别报告,避免平均数掩盖困难语言。

∗CER reported; BLEU w/ specific tokenizers.∗CER reported; BLEU w/ specific tokenizers.∗CER reported; BLEU w/ specific tokenizers.∗CER reported; BLEU w/ specific tokenizers.∗CER reported; BLEU w/ specific tokenizers.∗CER reported; BLEU w/ specific tokenizers.∗CER reported; BLEU w/ specific tokenizers.
WER/CERWER/CERASR-BLEUASR-BLEUUTMOSUTMOS
FamilyCTCTCT
Romance (6)5.88.290.388.03.543.27
Germanic (5)9.512.285.381.13.623.27
Slavic (4)7.07.786.985.93.483.17
CJK (3)∗5.010.275.267.93.563.20
Uralic (2)10.314.384.078.33.543.21
Indo-Iranian (2)22.523.063.760.03.613.20
Other (6)24.824.865.064.93.533.14
Average12.114.182.479.43.553.21

上表按语系报告了规范版和迁移版的词错率或字错率、识别后 BLEU 和自然度。罗曼斯语系和斯拉夫语系保真最高,规范版 BLEU 在高段且词错率低于 8%。印欧伊朗语系和其他语系明显更低,BLEU 只有六十分附近。论文指出这主要由希伯来语、泰语等驱动,但在换用专用分词后,中文、日语、泰语的保真并不差。这说明平均数掩盖了书写系统和指标实现的巨大影响。

自然度方面,各语系规范版分布均匀,没有出现某一语系特别好而牺牲其他语系的情况。迁移版每语系都低约 0.3 左右。未胜出的反例很清楚:乌拉尔语系迁移版词错率更高,印欧伊朗和其他语系两版都在 20% 以上,这些就是后续最需要改进的边界。

与只合成英语的 CVSS 同管线复测差距何来?

这里的比较问题是:同样用识别加自然度管线复测,CVSS-X 与原始 CVSS 的差距是评价实现不同还是任务更难。公平条件是作者用相同模型和样本量重新评价 CVSS,因此数字可以直接对照,但翻译方向不对称仍需记住:CVSS 是多语言到英语,CVSS-X 是英语到多语言。指标方向与上一节一致,自然度和 BLEU 越高越好,错误率越低越好。

MetricX-CX-TCVSS-CCVSS-T
UTMOS (1–5)3.553.214.433.61
ASR-BLEU82.479.494.293.8
WER/CER (%)12.114.13.54.0
Spk. Similarity–0.607––

上表显示,CVSS 规范版自然度更高、识别后 BLEU 更高、词错率更低,而 CVSS-X 规范版三项都明显弱于 CVSS。迁移版也有类似差距。论文报告的解释是任务复杂度不同:CVSS 只需要用在高质量英语数据上训练的英语合成器做好一种语言,而 CVSS-X 需要用同一个多语模型做好 28 种类型差异很大的语言。说话人相似度只报告了 CVSS-X 迁移版的数值,其中日耳曼语系高于斯拉夫语系,论文推测可能与和英语的语音接近程度有关,但用词是可能,属于有限解释而非因果证明。

从可运行策略看,规范版是实际可部署的清晰基线,迁移版是保留音色的实际可运行策略,两者都有完整生成数据,不是事后挑选的最优值。代价也很具体:要保留音色就要接受自然度下降和小比例样本因信号不足被跳过。

哪些结论有证据,哪些还只是待验证?

论文直接报告的是规模、划分、合成时长、采样条件和自动指标数字,这些有明确证据。有限解释包括对差距来源的归因,例如多语任务更难、众包录音瑕疵影响迁移版、语音接近程度影响相似度,这些有机制上的合理性但没有做剔除实验来证明拿掉某个因素后差距必然消失。未验证的推测包括自动自然度预测在非西方音系上的方差、翻译错误在低资源语言中的具体比例,这些需要人工听音和人工参考对照才能确认。

缺失证据不是技术错误,但决定了使用边界。第一,翻译质量依赖 NLLB-200,低资源语言可能有错误。第二,识别后 BLEU 只度量合成语音相对合成提示文本的可懂度,没有相对人工翻译参考的交叉验证。第三,许可证是非商业性质,继承自翻译模型,会限制商业应用。第四,自动自然度预测可能在不同音系上有偏差。复现或引用时应保留这些限定,不应把自动指标当成人评,也不应把总体平均推广到每个语系每条样本。

论文还明确计划未来用更大翻译模型重做翻译以提升保真并争取更宽松许可,引入更新版 Common Voice 和自然对话数据增加说话人多样性,以及训练基线翻译模型验证数据有效性。这些都属于计划,不是本版已交付的内容。引用时要区分已生成交付与未来计划。

要复现构造和评价,先准备什么按何顺序跑?

复现前先确认资源状态。本次收到的官方资源状态显示,代码仓库当前可用,可以按其说明准备环境。数据集链接本次未能确认可达,不能写成已公开可下载,需要自行重试或等待作者发布。第三方声音设计网站当前可用,但它只用于构造规范版参考音,不是论文的核心贡献。许可证方面,数据集声明为非商业许可,非商业限制来自翻译模型,需要在复现计划中预留合规检查。

数据准备的顺序是先对齐源语音。论文用新版英语录音,通过归一化文本匹配找回旧版语句,找回约九成具有人工源音频的语句,再把开发集补足到每语言 10000 条,最终形成训练、开发、测试划分。下表把这些关键规模数字放在一起,便于核对划分是否一致,比较问题是单语言样本数与总对数能否对上,公平条件是按论文的文本匹配口径,指标方向是数量一致才算复现了同一划分。

项目规模
回收的英语语句240,192 of the original 264,037 English utterances (91.0%)
单语言训练划分train (222,349)
单语言开发划分dev (10,000)
单语言测试划分test (7,843)
两版合计时长totaling over 16,000 hours of parallel speech

上表同时核对单语言样本数、总对数和总时长。注意总对数是语言数乘以单语言样本数得到,规范版和迁移版各有一份目标语音,因此总时长是两版相加。复现评价时,每语言从开发集抽 200 条,用大识别模型转写后计算词错率和识别后 BLEU,用自然度模型算自然度,用说话人模型算相似度。中文、日语、泰语必须切换专用分词,否则会出现 BLEU 为零的假失败。硬件预算方面,论文只报告翻译环节单卡约 11 小时,没有报告全部合成和评价的完整耗时,复现时应把这项缺项记为未知成本,不要假设合成同样便宜。

何时值得用 CVSS-X,何时不该直接用?

当研究目标是从英语出发的 1 对多翻译,或以英语为枢轴的任意语言对翻译,且需要可直接下载、句子级严格对齐的训练数据时,CVSS-X 值得尝试。规范版适合先验证内容翻译链路,因为它的声音稳定清晰。迁移版适合再研究说话人一致性,但要接受自然度下降和部分样本缺失。结合 CVSS 使用时,可以构成双向研究,但要记住两边的合成器、目标语言数和难度并不对称。

当目标是商业部署、高质量单语合成、或对低资源语言翻译精度要求极高时,不该直接把该语料当成品使用。翻译错误、众包录音瑕疵、自动指标与人耳的差距都会进入下游模型。更稳妥的顺序是先在罗曼斯和斯拉夫等高保真语系上跑通,再扩展到希伯来语、泰语等困难语言,并补做人工抽检和相对人工参考的翻译验证。

一句话收束:CVSS-X 的价值不在于把语音做得比 CVSS 更自然,而在于用同一批英语源语音批量造出 28 个方向的严格配对目标语音,让反向和枢轴翻译研究有数据可用。代价是质量上限被翻译模型、多语合成器和源录音质量共同决定,引用其数字时必须同时给出语系、版本、指标和聚合条件。

📎 论文与评分元数据

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-15 语音/音乐/音频论文速递