英文题目:UR-BERT: Scaling Text Encoders for Massively Multilingual TTS Through Universal Romanization and Speech Token Prediction

会议身份:conference:interspeech:2026:conference-paper-id:lee26h_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #多语言 #预训练 #文本到语音

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Sangmin Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Eek Gyun Ahn:机构信息未能从会议 PDF 纯文本可靠映射
  • Woongjib Choi:机构信息未能从会议 PDF 纯文本可靠映射
  • Hong-Goo Kang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

大规模多语言TTS的任务是以任意书写系统的文本为输入,输出对应语言自然可懂的语音,实际难点在于正字法高度多样而可靠G2P仅覆盖约100种语言,且相同罗马化串在不同语言中对应不同发音带来声学模糊。UR-BERT的方法链分三步:先用Uroman将495种语言正字法统一转写为约30个拉丁字母的字符序列,送入共享字符级编码器。接着以Omnilingual-ASR-W2V-300M为教师提取语音表示,经强制对齐到罗马化字符并以257码本离散化为每字符语音token作为辅助目标。然后在BERT-base上联合优化掩码语言建模与语音token预测,使文本编码直接推断声学信息,再接入VITS微调合成语音。与依赖音素序列的m-PLBERT和XPhoneBERT相比,该机制以紧凑共享词表换取对无G2P语言的可扩展性,并以声学蒸馏补偿罗马化的语音抽象。在包含英语、德语和普通话的高资源评测中,UR-BERT在英语上达到平均意见分(Mean Opinion Score,MOS)4.35,显著高于XPhoneBERT的4.11,且仅用后者约2.5%的文本量(8M对330M句)完成预训练。低资源与零样本巽他语上同样取得每语言MOS最高。该结论目前限于VITS架构与11种有监督微调语言,极低资源语言的韵律稳定性与跨架构泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/sanghyang00/ur-bert — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

这篇解读的输入是论文原文证据给出的 UR-BERT 方法与实验描述,目标是让刚进入语音合成领域的研究生能复述做法并核对条件。必须保留的信息包括任务定义、罗马化与语音 token 预测的分工、预训练语料规模与训练步数、微调时使用的 VITS 骨干与语言划分、评价指标方向。输出是 1 篇按学习依赖展开的中文技术解读,不做营销式判断。

从任务看,神经网络语音合成通常采用编码器加解码器结构。编码器把文字变成语言表示,解码器再把表示变成声学特征或波形。近年解码器进步较快,文本编码器的文本语音对齐仍是难点。通用做法是引入发音信息,例如把字形转为音素。但可靠的发音词典只覆盖约 100 种语言,剩下的多数语言难以接入。

UR-BERT 要解决的就是大规模多语言合成中的可扩展性与发音保真度矛盾。一方面要支持 495 种语言,不能逐语言维护发音规则。另一方面罗马化把词表压缩到约 30 个字母后,相同拼写在不同语言中可能对应不同发音,会带来声学模糊。论文因此提出两步做法,先用罗马化统一输入,再用语音 token 预测把声学知识注回文本编码器。后续各节先讲相关路线,再沿一个样本走完输入到目标,最后讲实验条件与限制。

已有的文本编码器路线走到了哪里?

最早的一类做法是把通用语言模型的表示作为辅助输入。例如把 BERT 嵌入拼到语音合成的发音表示旁边,希望提升自然度。但这存在粒度不匹配。合成系统通常工作在字符或音素级,而通用 BERT 使用子词单元,对齐与融合都比较别扭。

第二类做法是从零开始为合成预训练 BERT 式编码器。早期工作联合建模字形与音素,以桥接文本空间与发音空间。后来的扩展只在预训练时同时用字形与音素,下游只用音素输入。近期工作把音素级预训练扩展到多语言,代表是多语言 PLBERT 与 XPhoneBERT。前者按证据在 15 种语言的音素序列上预训练,后者扩展到 88 种语言。

这些多语言编码器的共同依赖是发音工具链。证据指出已有工具只支持约 100 种语言,例如 CharsiuG2P 支持 88 种,Phonemizer 支持 127 种。零样本神经网络发音转换在未见语言上不稳定。因此即使把音素建模做大,语言覆盖仍集中在英语、中文与部分欧洲和亚洲语言,对非洲与美洲原住民语言覆盖有限。UR-BERT 的区别是把统一文字接口换成罗马化,并把监督从纯文本改为语音文本对。

为什么发音词典路线难以直接扩到数百种语言?

问题可以拆成两个约束。第一个是资源约束。高质量规则式发音模块需要语言学专家逐语言设计,工具链天然只能覆盖少数语言。论文把这个数字明确为约 100 种量级。这意味着如果编码器输入必须是音素,那么每新增一种语言都要先解决发音词典,扩展成本很高。

第二个是表示约束。国际音标能保留精细发音细节,但符号库存大,常达数千符号。分词时对超音段成分与变音符号的处理也不一致,有的当独立 token,有的与相邻元音辅音合并,导致粒度不稳定。罗马化把非拉丁文字转写为拉丁字符,词表压缩到约 30 个字母量级,分词更稳定,训练也更稳定。先前工作显示罗马化仍保留足够完成语音相关任务的发音信息。

罗马化 × 字形到音素转换: 字形到音素转换负责把正字法变成国际音标一类的精细发音符号,分工是保真但需要逐语言规则;罗马化负责把多种文字都转写为拉丁字母,分工是统一接口与压缩词表。UR-BERT 用罗马化搭配字形到音素转换的替代关系,是因为后者只能覆盖约 100 种语言而前者可借助 Uroman 一类工具理论上扩展到更多语言,组合意义是先解决可扩展性,再用别的语音目标补回罗马化丢失的精细发音区分。

但压缩一定有代价。罗马化 token 库存小,跨语言同形异音更常见。只靠文本掩码建模,编码器看不到声学上下文,学不到精细韵律与发音线索。因此论文把问题定义为在保持可扩展性的同时补回发音保真度,而不是回到逐语言发音词典。

UR-BERT 的全景是什么,一个样本如何走完全程?

UR-BERT 采用标准 BERT-base 结构,12 层 Transformer 编码器,字符级分词器。输入是经 Uroman 一类工具罗马化后的字符序列。预训练目标是常规掩码语言建模加语音 token 预测。微调时把该编码器接入 VITS,替换 VITS 原始文本编码器。

沿一个样本走一遍更直观。假设有一条语音文本对,先把文本转写为罗马化字符序列,例如把某种文字统一为拉丁字母串。语音侧送入多语言语音自监督教师模型,取中间层表示。接着用基于 CTC 的强制对齐把较长的语音帧序列对齐到较短的字符序列,对每个字符覆盖的帧做平均池化,得到字符级声学表示。再用预先聚好的 k-means 码本把每个字符级表示映射为一个离散语音 token。

预训练时编码器一方面做掩码字符恢复,另一方面对每个输入字符预测其语音 token。微调时编码器只吃罗马化文本,不再需要语音输入,直接输出语言表示给 VITS 合成。

论文强调该流程把自动语音识别语料重新用作发音指导。不要求干净的可合成录音,只要有语音文本对即可。这使得大规模多语言预训练在数据层面可行。官方代码当前可用,资源状态为 available,地址为论文脚注给出的仓库链接,复现时应以该链接当前可达版本为准。

语音监督是如何构造的,每一步解决什么不匹配?

语音监督构造分为 3 步。第一步是语音表示抽取。教师网络采用 omnilingual-ASR-W2V-300M 模型,取第 16 层表示。选择中间层的理由是已有发现表明多语言语音自监督模型中间层主要编码音素级信息,而非高层语义。这一步把波形变成帧级连续向量。

第二步是语音文本对齐。语音帧序列远长于字符序列,需要把帧映射到字符。论文使用 MMS-FA 做基于 CTC 的强制对齐,再对每个字符对齐到的帧做平均池化,得到字符级声学表示。对齐示意在原文图 2 中说明,本次没有收到该图像素,因此只按正文归因描述,不推测图中模块位置或颜色。

掩码语言建模 × 语音 token 预测: 掩码语言建模负责从上下文恢复被遮住的罗马化字符,分工是学文本内上下文;语音 token 预测负责从文本表示预测每字符对应的离散声学 token,分工是把声学知识蒸馏进文本编码器。两者搭配的原因是只做文本建模会缺韵律和发音细节,只做语音预测又不稳定,组合意义是让同一编码器同时保持可读的文本结构和可合成的发音倾向。

第 3 步是离散 token 分配。在预训练语料上对字符级声学表示做 k-means 聚类,构造有限码本。每个字符级表示取最近质心,得到每个罗马化字符的离散语音 token。码本大小设为 257,其中 0 为静音 token,1 至 256 为声学 token。论文明确未考虑更大码本,理由是过大容量容易编码说话人或副语言变化而非发音内容,也可能因与紧凑文本词表不匹配而 destabilize 训练。

语音自监督模型 × CTC 强制对齐: 语音自监督模型负责提供连续的声学表示,分工是教师特征源;CTC 强制对齐负责解决语音帧远长于字符序列的长度不匹配,分工是把帧级特征按字符切分并池化为字符级表示。搭配原因是教师特征本身没有字符边界,组合意义是先对齐再离散化,才能为每个罗马化字符生成一个可学习的语音监督目标。

k-means 离散化 × 静音 token: k-means 离散化负责把连续的字符级声学表示聚为有限码本,分工是构造 1-256 号声学 token;静音 token 负责占据 0 号索引,分工是显式表示无声或静音段。搭配原因是连续向量不能直接做分类预测,组合意义是用 257 个类别的分类目标把发音内容压缩为可预测的离散监督,同时避免把说话人或副语言变化也编码进来。

从建模直觉看,音系理论把语音库存看作有限二值特征的经济组合。257 类的规模是在表示能力与发音抽象之间取平衡,既能区分发音,又不至于把每个细节都当成新类别。

预训练与微调各训练什么,哪些参数被冻结?

预训练阶段训练的是 UR-BERT 文本编码器本身。输入是罗马化字符,监督是掩码语言建模目标与语音 token 预测目标。教师语音模型只提供表示与离散目标,不作为待更新对象。论文未报告教师是否参与反向传播之外的更新,按证据应理解为固定的知识蒸馏源,未报告的梯度路径不做推定。

VITS × BERT 式文本编码器: VITS 负责把语言表示变成声学特征或波形,分工是合成骨干与对齐搜索;BERT 式文本编码器负责提供语言表示,分工是替换 VITS 原始文本编码器以增强上下文和发音建模。搭配原因是解码器已较强而编码器的文本语音对齐仍是瓶颈,组合意义是在微调阶段冻结编码器前 25% 步数以稳定单调对齐搜索,再联合优化合成质量。

微调阶段训练的是以 VITS 为骨干的合成系统,其中文本编码器分别替换为原始编码器、多语言 PLBERT、XPhoneBERT 或 UR-BERT 以做对照。优化设置大体沿用预训练配置,但有两个明确安排。第一是文本编码器在前 25% 训练步数内冻结,目的是稳定单调对齐搜索模块。第二是省略 warm-up 调度。低资源模型训练 100K 步,高资源模型训练 300K 步,批大小均为 32。

预训练优化器为 AdamW,采用 3 阶段学习率调度,warm-up、峰值与衰减比例为 0.1、0.5 与 0.4,峰值学习率为 1e-4。预训练共 150K 步,批大小 1024,使用梯度累积。论文未给出掩码比例、语音预测损失权重、冻结之外的层级重置时机等细节,这些属于具体缺项,复现时需以公开代码为准,不从模型名称推定实现。

数据、语言划分与指标如何设置才可比?

预训练语料由三部分自动语音识别数据组成。下表先提出问题:在不依赖发音词典的前提下,能否拼出覆盖数 100 种语言的语音文本预训练集。公平条件是三部分都是语音文本对,且都经过同一罗马化与对齐离散流程。指标方向是语言数越多、时长与句子数越大,覆盖越广,但质量仍需下游合成验证。

语料来源语言规模总规模编码器语言覆盖预训练用途
FLEURS102 种朗读语音语言8M 句495 种语言语音文本对
Common Voice131 种语言13K 小时语音1162 种罗马化支持上限语音文本对
Omnilingual ASR 语料348 种低资源语言13K 小时语音495 种语言语音文本对

上表整理自原文连续句子,重点是三部分语言数与总量级。原文报告预训练语料共约 13K 小时、495 种语言、8M 句。罗马化工具理论上语言无关,表格中 1162 是先前研究实证验证的最大语言数,不是 UR-BERT 本次预训练的语言数,不应混淆。基线方面,多语言 PLBERT 训练语言为 15 种,XPhoneBERT 为 88 种,文本量分别为 150K 句与 330M 句量级,UR-BERT 以 8M 句实现更大语言覆盖,这是后文讨论数据效率的前提。

下游合成实验覆盖 11 种语言,全部重采样到 22050 Hz。高资源组为英语、德语、普通话中文,各 20 小时。低资源组为爪哇语 5 小时、巽他语 5 小时、高棉语 3 小时、南非荷兰语 2 小时、尼泊尔语 2 小时、塞茨瓦纳语 2 小时、科萨语 2 小时、僧伽罗语 1 小时。其中巽他语未包含在预训练语料中,用于零样本泛化检验。评价包括一项主观与四项客观指标。

主观为 1 至 5 分的平均意见分,44 名不同地域背景受试者共评 520 条样本。客观为 UTokyo MOS 预测、相对真值的退化量、基于 Omnilingual-ASR-CTC-1B 转写的字符错误率相对退化量、梅尔倒谱距离与 log-F0 均方根误差。相对退化量越小越好,可减轻跨语言偏差。

训练预算与可运行策略是什么?

比较训练成本时要区分预训练 1 次成本与每个语言微调成本。下表的问题是:在给定步数与批大小下,UR-BERT 的预训练与微调预算是否明确可复现。公平条件是同一优化器家族与同一 VITS 骨干。指标方向不是谁步数多谁就好,而是看小预算能否达到可比质量。

阶段步数批大小学习率调度文本编码器处理
预训练150K 步10243 阶段调度从零训练
高资源微调300K 步32省略 warm-up前 25% 步数冻结
低资源微调100K 步32省略 warm-up前 25% 步数冻结
峰值学习率1e-410243 阶段调度从零训练
对照基线100K 步32沿用协议替换编码器

上表数字均来自原文连续训练描述。预训练峰值学习率为 1e-4,3 阶段比例为 0.1、0.5 与 0.4。微调时高资源与低资源分别用 300K 与 100K 步,批大小均为 32。需要说明的是原文未报告硬件类型、卡时、推理延迟与实时率,因此不能从训练步数推定实际耗时或部署成本。复现时应先跑通低资源单语言微调,再扩展到高资源语言。

高资源语言上提升来自哪里,有无反例?

高资源结果测量的是在数据充足时,更换文本编码器是否仍有增益。对照包括原始 VITS、多语言 PLBERT、XPhoneBERT 与 UR-BERT。论文报告 UR-BERT 在英语、德语、普通话上一致改进主客观指标。XPhoneBERT 因大规模多语言预训练也有竞争力,但在自然度与可懂度上低于 UR-BERT。多语言 PLBERT 接入 VITS 后出现明显退化,表现为流利但发音不准,字符错误率升高。

关键数字需要按原文表格核对。证据的表格部分给出英语、德语、中文的多列 MOS、相对 UTokyo MOS 退化、相对字符错误率退化、梅尔倒谱距离与 log-F0 误差。由于本次结构化原表清单为空,无法以原表选择模式逐格绑定,因此这里不逐格转抄表格裸值,只做可验证的方向性陈述。论文用文字报告的核心效率结论是 UR-BERT 仅用 XPhoneBERT 约 2.5% 的句子量达到更好结果,对应 8M 与 330M 句子量级。这一判断的支持条件是同一 VITS 骨干与相同高资源时长,直接报告为论文结论,有限解释为紧凑罗马化词表带来数据效率,语音感知预训练增强对齐。

未胜出项也要保留。UR-BERT 并非在每个客观子项上都同时最优,例如中文的相对 UTokyo MOS 退化与部分 log-F0 误差存在与 XPhoneBERT 接近或交错的情况。总体趋势成立不等于每组每步都成立,阅读时应回到原表按语言与指标分别核对。

低资源与未见语言上可扩展性是否成立?

低资源结果分为 3 组。第一组是 XPhoneBERT 与 UR-BERT 都支持的语言,包括南非荷兰语与高棉语。第二组是仅 UR-BERT 支持的已见语言,包括爪哇语、尼泊尔语、塞茨瓦纳语、科萨语与僧伽罗语。第 3 组是预训练未见的巽他语,用于零样本检验。这种分组本身就是证据,因为基于音素的基线常因缺少可靠发音系统而无法支持许多低资源语言,而罗马化可自然扩展。

论文报告 UR-BERT 在每个低资源语言上取得最高 MOS,并在多数客观指标上占优,自然度与可懂度增益较明显。巽他语零样本下仍优于基线,支持跨语言泛化。但代价在个别指标上可见,例如爪哇语的相对字符错误率退化与梅尔倒谱距离并未随 MOS 同步改善,说明听感提升与转写错误、频谱距离不完全一致。不同指标差值不能混放比较,也不能把自动指标当成人评。

适用边界是数据量差异很大,从 5 小时到 1 小时不等,且每种语言的可比基线不同。第二组与第 3 组缺少 XPhoneBERT 可运行对照,只能与原始 VITS 比较。因此可部署收益应表述为在罗马化可接入的语言上,UR-BERT 相对原始 VITS 的改进,而不是与所有基线在所有语言上的全面胜负。

拿掉语音 token 预测后会发生什么?

消融测量的是语音 token 预测目标是否必要。比较的是完整 UR-BERT 与去掉该目标的变体,观察 MOS 变化。论文报告去掉后几乎所有语言性能下降,高资源语言下降更明显,低资源与零样本场景仍可见下降。文字结论是该目标对丰富发音表示、稳定文本语音对齐很关键,能补偿罗马化的发音抽象。

表达上应区分直接报告与推测。下降本身是论文直接报告,有限解释是声学对齐得到增强。未验证的推测是拿掉后必然在所有未来语言上失败,原文没有给出这种保证,不应这样写。原文也未报告去掉掩码语言建模、改变码本大小、更换教师层数等对照,因此不能回答这些变体的效果,只能记为待验证。

复现启示是应先保证对齐与离散流程正确,再调损失权重。若强制对齐质量差,语音 token 本身就有噪声,此时消融差异可能缩小甚至反转。这也说明该目标的有效性依赖教师模型与对齐工具链,不是独立成立的模块性质。

还有哪些没有测到,不应过度承诺?

首先是监督来源的依赖。虽然不再依赖逐语言发音词典,但仍依赖多语言语音自监督教师、CTC 强制对齐与 k-means 码本。对齐错误会直接污染字符级语音 token,低资源语言的对齐质量本身可能更低。论文未量化对齐错误率,因此不能承诺在任意新语言上自动获得同样增益。

其次是评价边界。主观评价共 520 条样本、44 名受试者,覆盖多语言但每种语言样本有限。客观指标中的 UTokyo MOS 与字符错误率都依赖预训练模型,存在跨语言偏差,论文用相对退化量缓解但未完全消除。未测量的量包括误判率分解、推理延迟、内存占用与训练碳成本,不应声称这些量得到改善。

最后是数据与工具边界。1162 种是罗马化工具在先前研究中的实证上限,不是本次验证数。本次验证的是 495 种预训练语言与 11 种合成语言。更大码本、其他教师层、其他解码器骨干均未报告。相关性不等于因果,小数据高效可能同时来自紧凑词表、语音目标与数据选择,无法从现有对照分离各自贡献。

要复现应先做什么,需要哪些关键配置?

复现第一步是准备语音文本对并统一采样率。下游合成按证据重采样到 22050 Hz。预训练需要把文本先罗马化,再用教师模型抽取第 16 层表示,用 MMS-FA 对齐并平均池化到字符级,最后用 k-means 生成 257 类离散目标,其中 0 为静音。建议先在一种高资源语言上跑通对齐可视化与 token 分布检查,确认静音 token 不被过度分配,再扩大到多语言。

第二步是按预算复现训练。预训练 150K 步、批大小 1024、AdamW、3 阶段调度、峰值 1e-4。微调采用 VITS,高资源 300K 步、低资源 100K 步、批大小 32,文本编码器前 25% 步数冻结且省略 warm-up。代码当前可用,复现应锁定仓库提交版本,记录 Uroman、教师模型与对齐工具版本,因为三者任一变化都可能改变语音 token。

第 3 步是按问题组织评价。先看 MOS 方向,再看相对 UTokyo MOS 退化与相对字符错误率退化,最后看梅尔倒谱距离与 log-F0 误差。同一数值在不同指标下含义不同,百分点与相对百分比也不同。还需补的验证包括对齐质量统计、码本大小敏感性、不同教师层的对比,以及在未见文字系统上的零样本测试。

何时值得尝试 UR-BERT 路线?

当目标语言缺少可靠发音词典,但能拿到一定量语音文本对时,这条路线值得尝试。罗马化解决了输入可接入问题,语音 token 预测补回发音区分,VITS 骨干保持合成质量。已有证据支持在高资源 3 种语言、低资源多语言与一种零样本语言上的总体增益,且预训练句子量远小于 XPhoneBERT。

当已有高质量发音词典且只做少数高资源语言时,收益可能变小。此时音素输入本身已很强,引入罗马化与语音蒸馏的额外复杂度需要重新评估。当语音文本对极少或对齐质量不可靠时,也应谨慎,因为语音监督噪声会削弱增益。

回到中心判断,UR-BERT 的贡献不是证明罗马化在发音上优于国际音标,而是在可扩展性约束下,用可规模化的语音监督换回足够的发音保真度。理解这一点,就能正确复述方法:统一只是起点,对齐与离散才是质量关键,评价必须按语言与指标分别核对。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总