英文题目:SALT: Selective Allophone-Level Tokenization for Korean Text-to-Speech Synthesis

会议身份:conference:interspeech:2026:conference-paper-id:kim26p_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #语音学与音系 #低资源 #语音 #文本到语音

评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Kwangsung Kim:机构信息未能从会议 PDF 纯文本可靠映射
  • Cellik Adams:机构信息未能从会议 PDF 纯文本可靠映射
  • EunKyoung Jo:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

韩语文本到语音的输入是韩文正字法文本,输出是对应语音,难点在于形态音系正字法造成的形音不一致与音位到同位异音的一对多映射在低资源下难以隐式习得。本文先用文本规整与字位到音位转换把输入变为音位序列,再由选择性同位异音层级分词按声母与韵尾规则附加发音标签,最后将该序列送入预训练流匹配模型微调以生成梅尔频谱并经声码器合成波形。与直接使用字素或音位以及全量同位异音标记相比,该方法的机制差异是只显式切分最高频且声学区分度最大的鼻音韵尾,从而以最小词表扩张换取分布均衡。在12.75小时韩语单说话人数据集上主推配置相对字素基线将字符错误率从4.74%降至3.30%,且获得最高主观自然度。结论仅在单说话人朗读体小数据与特定微调流程下成立,向多说话人、大规模语料及其他语言的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么、目标是什么:从韩文句子到可听语音

这篇解读的输入是韩文文本句子,目标是生成发音正确、听感自然的韩语语音。必须保留的信息包括数据的规模与划分、切分方法如何把文本变成模型词表、模型在哪些参数上更新、用什么指标度量发音错误和自然度,以及在什么条件下比较才算公平。输出是一套可以复述和核对的完整流程,而不是对效果的笼统赞美。

韩语语音合成的难点不在于字母本身难读。韩文字母谚文具有表音性,很多近期研究直接把字形拆成部件输入,让模型自己学习发音。但韩语正字法同时保留形态信息,书写形式与实际发音并不总是一致。一个书写单位在词首、词中、韵尾等不同位置可能读成不同的声音,模型需要见过足够多样的上下文才能隐式学会这些变化。

论文面对的现实约束是韩语高质量有标注语音相对有限。在只有十几小时甚至只有 1 小时单人语音时,模型很难仅靠数据猜出全部形态音位映射。此时如果输入仍然保留歧义,训练容易不稳定,合成会出现读错音。对于刚入门的研究生,关键动作是先把问题定位为输入表示的歧义问题,而不是一开始就改大模型结构。

因此作者选择在文本前端做文章。思路是把一部分已经明确的发音知识直接写进输入,作为语言学先验,而不是等待模型从小数据中归纳。后续所有方法比较都围绕这个思路展开:同样的声学模型和同样的语音数据,只改变文本切分方式,观察发音错误率和听感如何变化。

相关路线对照:日语重音标签与韩语同位异音研究有何不同

同输入同目标的第一条路线是直接用字形或音素输入的端到端语音合成。论文提到,现代架构可以在没有显式字音转换的情况下达到较高质量,韩语研究也常用原始字形部件输入以避免转换模块带来级联错误。这条路线的监督来自配对的文本与语音,运行阶段是训练与推理都使用同一套切分。它的优点是流程简单,缺点是在低资源下难以解决书写与发音不一致的问题。

同目标但不同语言现象的第二条路线是日语语音合成中的显式表层特征。日语是声调重音语言,重音不同可能改变词义,因此系统通常输入重音等表层标注作为语言学归纳偏置。论文明确指出韩语不是声调重音语言,当代口语中词汇歧义很少靠韵律特征解决,韩语的主要问题是形态音位正字法和同位异音带来的声学歧义。所以不能把日语重音标签直接搬到韩语,需要针对韩语设计标记。

同输入现象但不同目标的第三条路线是韩语语音识别和发音评估中的同位异音建模。已有研究通过建模同位异音变化提高了识别准确率。论文把这一成功经验延伸到语音合成,把同位异音标签作为合成模型的输入偏置。这属于同语言现象、同监督来源但运行目标从识别变为生成,对照时不能把识别准确率的提升直接当作合成自然度的提升。

第 4 条相关线索是关于词表规模与分布均衡的研究。机器翻译和切分研究发现,词表扩大会使词频分布偏斜,产生极高频或极低频单元,从而损害可学习性。韩语语音合成若把所有同位异音规则都加入,也会遇到同样问题。论文因此引入基尼系数和伦伊效率来衡量分布均衡,这为后文只做选择性标记提供了评价依据。

真正的矛盾:发音消歧需要更细标记,分布均衡需要更小词表

论文要解决的问题可以表述为:在韩语语音合成中,如何既消除书写与发音之间的歧义,又不破坏词频分布的统计均衡。把标记做细可以提高声学分辨率,例如区分词首清音与词中浊音、区分声母与韵尾。但每细化 1 次,词表就变大 1 次,原来高频的音素被拆成多个低频变体,模型在有限数据下更难充分学到每个变体。

作者用两个现象说明这种张力。一方面,音素仍是抽象单位,一个音素对应多个同位异音,音素输入留下残余歧义。另一方面,无差别引入全部同位异音会显著增加词表规模并产生频率极端不平衡的标记。实验前需要在韩语单人数据集上实际计算不同标记组合的词表大小、基尼系数和伦伊效率,而不是凭直觉决定加多少标记。

字形 × 音素: 字形负责保留韩文正字法原样书写的形态信息,音素负责把书写映射为标准发音规定的抽象发音单位,二者搭配的理由是字形到发音存在 1 对多歧义而音素能消除其中一部分歧义,组合意义在于把实验基线从完全隐式学习推进到显式发音转换,但仍留下同一音素多种实际发音未解决。

对初学者而言,复述时要抓住判断标准。基尼系数越低表示词频越平等,伦伊效率越高表示分布越有效。论文设置参数为 2.5,目的是对高频词主导的分布施加更强的惩罚,因为已有工作发现该取值与下游生成性能相关性更强。这意味着选择切分方法不仅看语言学上是否精细,还要看统计上是否可学。

SALT 全景:先做字音转换,再按位置加标记

选择性同位异音切分简称为 SALT,其全流程可以沿一个样本走一遍。输入是一句韩文原文,先经过文本归一化,把数字、拉丁字母和符号转换为韩文表记,使用的模块是 N2gk+。接着做字音转换,得到音素序列。最后在音素序列上应用 SALT,生成带有同位异音标记的最终词元序列,送入语音合成模型。

与常规做法的区别在于最后一步。常规做法把文本分解为字形或音素单位就停止,SALT 则在音素上附加特殊标记,指明其同位异音实现语境。这不是让模型隐式推断发音规则,而是把语言学先验显式写进输入。论文设计了 3 类标记,对应 5 种主要的同位异音现象,这些现象在语音识别研究中已被证明有效。

SALT 家族包含多种组合。全量组合记为 SALT-VCP,表示同时附加声母、韵尾和腭化相关标记,声学分辨率最高但词表最大。选择性组合例如 SALT-N 只标记鼻音韵尾,SALT-C 标记韵尾,SALT-V 标记声母清音等。论文先在 12.75 小时数据集上比较它们的分布效率,再挑选有代表性的方法进入语音合成训练对照,从而把语言学精细度与统计效率的权衡落到可计算的指标上。

三组标记如何工作:声母清浊、韵尾除阻与腭化

第一组是声母规则,涉及不送气松音的清化与腭化。韩语松辅音在词首实现为清音,在元音之间实现为浊音。为了标明这种声学区别,方法对词首松辅音附加标记。原文说明虽然松辅音底层上是浊音,但因口语语料中浊的元音间变体频率更高,作者把浊的元音间同位异音作为基本词元,只对词首清音加标记。此外,对在/i/或/j/系列元音前发生腭化的辅音附加另一标记。原文表格总结了声母位置的具体映射,包括对应的国际音标变化,初学者复述时应强调位置条件而不是死记符号。

第二组是韵尾规则,涉及不除阻与中和。与声母不同,所有韩语韵尾失去除阻爆破并发生中和,因此需要附加标记说明其语音值与声母对应物不同。这覆盖不除阻塞音、不除阻鼻音和边音。特别重要的是字母ㅇ,它在声母位置没有语音值,在韵尾位置实现为软腭鼻音,若不显式标记,模型需要自己区分同一书写在不同位置的完全不同读音。

音素 × 同位异音: 音素分工是给出抽象的发音类别,同位异音分工是给出同一音素在不同位置和语境下的具体实现,二者搭配的理由是韩语标准发音中这种映射几乎是确定性的,组合意义在于用附加标记把上下文相关的发音差异直接写进输入,避免让语音合成模型在小数据上猜测浊化、腭化与韵尾不除阻等变化。

第三组是组合方式的选择逻辑。如果同时附加全部标记,每个音素最多分裂为 3 个词元,例如基本形、声母清音形、韵尾形,词表扩张到 56 个词元,伦伊效率提升不足。选择性方法把每个音素最多分裂为两个变体,其中 SALT-N 只分离鼻音韵尾ㅁ、ㄴ、ㅇ,SALT-NL 等组合也保持较小词表。论文报告在 12.75 小时数据集上,字形和音素方法因数据集中在特定词元而效率较低,而 SALT-N 和 SALT-NL 在最小化词表增长的同时取得最高的单字伦伊效率。

选择性标记 × 伦伊效率: 选择性标记分工是只对最拥挤、最影响声学的少数发音位置加标记,伦伊效率分工是度量词表分布是否被高频词主导以判断是否稀疏,搭配理由是全量加标记会扩大词表并制造大量低频标记,组合意义在于用效率指标指导只切分鼻音韵尾等高频类别,以最小词表扩张换取分布均衡。

为什么鼻音韵尾值得单独处理,原文给了频率依据。在韩语自然口语中,鼻音韵尾占全部韵尾的很大比例,简单字形或音素切分会产生高度不平衡的分布。SALT-N 通过只把最频繁的词元拆开,在最小化词表扩张的同时最大化效率。这种做法不是随意删减规则,而是对最拥挤的高频区做针对性分解,初学者应把频率统计与标记设计联系起来理解。

模型练了什么、冻了什么:跨语言微调的真实计算过程

语音合成骨干采用基于流匹配的非自回归模型 F5-TTS。训练策略不是从零训练韩语模型,而是在英文和中文数据上预训练的模型基础上做微调。文本嵌入模块和文本编码器做全量微调,使模型能够学习新定义的韩语同位异音词表,其余模块应用低秩适配。原文给出提示适配器秩为 64,扩散变换器部分的低秩适配器秩为 16。优化器使用 AdamW,学习率设为 1e-5。

数据侧的计算过程同样具体。语音下采样到 24 kHz 用于训练。12.75 小时实验在两块 80 GB 显存的 A100 上训练,每块显卡每批处理 19200 帧,总共训练 1501,000 步,单模型耗时 33 到 36 小时。1 小时极低资源实验除使用单块 A100 外,其余训练配置保持相同。波形由声码器 Vocos 从生成的梅尔频谱图合成。

全量微调 × LoRA 适配: 全量微调分工是让文本嵌入和文本编码器学会新的韩语同位异音词表,LoRA 适配分工是以低秩旁路调整其余声学建模模块而保留预训练能力,搭配理由是新标记不在原英文和中文预训练词表中必须重学,而声学部分只需跨语言延续,组合意义在于用较小的可训练增量完成跨语言迁移并公平比较不同切分策略。

公平比较的操作值得复述。原文指出在小规模单人数据集上训练的模型常出现过拟合,不同切分策略收敛速度不同。为了比较各自的峰值性能,作者每 101,000 步在验证集上监测发音错误率,为每个模型挑选最优检查点,再在测试集上测量客观指标。这意味着报告的不是同一固定步数的快照,而是各自验证最优点的测试性能。原文未报告梯度是否在某些层截断之外的更多细节,复述时不应从模型名称推定未说明的实现。

数据划分与评价指标:测什么、与谁比、条件是否一致

实验使用韩语单人高质量语料 KSS。在总共 12.86 小时数据中,随机抽取 100 句并分为 50 句验证集和 50 句测试集,其余 12.75 小时用于训练。此外,为检验极低资源下的学习能力,随机采样 1 小时子集作为缩减训练集。文本预处理、采样率和模型配置在不同切分方法之间保持一致,唯一变量是输入词元序列的构造方式。

评价分为客观与主观两类。客观发音准确性通过 Whisper-Large-v3 转写合成语音,再与真实文本计算字错误率和词错误率。语音质量用 UTMOS 度量客观声学自然度,用 WavLM 提取的说话人嵌入余弦相似度度量音色保持。主观自然度通过 27 名韩语母语听众对每个模型随机抽取的 15 条测试语音做 5 分制平均意见分。参与主观评测的模型经过筛选,包括参考真音、两个基线、SALT-VCP 和 SALT-N。

统计方法也有交代。主观结果先做单因素重复测量方差分析并采用温室校正,再做 Holm-Bonferroni 事后 t 检验。原文提醒韩语自动语音识别中词错误率高于字错误率与空格规则灵活性有关,即使真实语音经大模型转写也会得到 10.44% 的词错误率。因此解读字错误率与词错误率时不能只看绝对值,还要看基线是否在同一转写与同一划分下比较。硬件预算、训练步数和验证选点策略共同构成复现时必须对齐的实验条件。

12.75 小时主结果:SALT-N 降低读错,听感也最好

在 12.75 小时数据集上要回答的问题是:在数据相对充足但仍属低资源的单人条件下,显式消歧是否同时改善客观读错和主观听感。比较条件一致,指标方向明确:字错误率和词错误率越低越好,主观平均意见分越高越好,客观自然度与说话人相似度作为辅助参考。

下表聚焦核心可运行策略的字错误率对照。字形输入、音素输入与 SALT-N 在同一模型和同一数据划分下比较,SALT-N 取得最低值。表后解释其收益与代价:收益是同时解决字形到音素和音素到具体发音两层歧义,代价是仍需维护字音转换与标记规则,不再是纯字形端到端。

数据条件评价指标字形输入音素输入SALT-N
12.75 小时 KSS字错误率4.74%3.74%3.30%

表后需要同时说明未胜出项。音素输入把字形基线的 4.74% 降到 3.74%,说明显式字音转换本身有效。全量标记的 SALT-VCP 尽管声学提示最多,却得到 6.03% 的字错误率,反而落后于字形基线。SALT-N 还取得 11.24% 的词错误率,为所比较方法中最低。客观声学自然度上 SALT-VCP 略高,但主观评价出现反转,这提示客观声学分数与人类对读错的惩罚并不完全一致。

下表转向同一 12.75 小时条件下的主观自然度对照。参与比较的仍是实际可运行的切分策略,分数越高表示听众认为越自然。表后解释要强调统计结论:方差分析显示系统主效应显著,事后检验确认 SALT-N 显著优于字形与音素基线,而 SALT-N 与 SALT-VCP 差异处于边缘显著水平。

数据条件评价指标字形输入音素输入SALT-N
12.75 小时 KSS主观自然度2.62 ± 0.112.53 ± 0.123.10 ± 0.12

表后同样保留反例。SALT-VCP 的主观分为 3.01±0.13,客观自然度反而略高于 SALT-N 的 2.96,但人类听众更偏好读错更少的 SALT-N。参考真音的主观分为 4.25±0.09,说明合成与真音仍有差距。说话人相似度方面各方法差异不大,SALT-N 为 0.80 左右,没有证据表明选择性标记损害音色保持。

只加一部分标记会怎样:1 小时训练曲线的反证

这一节把 1 小时极低资源实验当作消融与反证:数据极少时,模型能否自己学会形态音位映射,以及提示越多是否越好。训练配置除显卡数量外保持相同,验证集字错误率每 101,000 步监测 1 次,最终用各自最优点在测试集比较。指标方向不变,字错误率越低越好。

下图导读覆盖完整的比较对象、条件与时间范围。该图横轴为以 1,000 步计的训练步数,纵轴为验证集字错误率百分比,包含字形、音素、SALT-VCP 与 SALT-N 4 条曲线,时间范围从约 401,000 步延续到 1501,000 步。读图时先确认图例与坐标含义,再比较曲线的相对高低与波动,不要把某一步的上下直接推广为全程趋势。

看图路径: 1. 先看横轴训练步数从 40 到 150 千步、纵轴验证集 CER 百分比的范围;2. 再按图例区分蓝色字形、黄色音素、绿色 SALT-VCP 与橙色 SALT-N 四条曲线;3. 重点观察橙色 SALT-N 是否全程位于最下方并在 100 千步附近降到 9% 以下;4. 对比蓝色字形曲线在中后段的上下波动与始终高于 10% 的表现

原论文 Figure 1:Validation CER during training in the 1-hour ex- tremely low-resource setting.

论文图 1。原论文 Figure 1:“Validation CER during training in the 1-hour ex- tremely low-resource setting. While all other methods remain above 10%, only SALT-N achieves a CER in the 8% range.”。

从像素可见的内容看,橙色 SALT-N 曲线全程基本位于最下方,从早期约 16% 附近快速下降,在 701,000 步附近降到 10% 以下,此后在 8% 到 11% 之间小幅波动,末段降到约 8% 附近。蓝色字形曲线波动最大,中段多次回升到 16% 到 17% 附近,末段仍在 14% 到 15% 附近。黄色音素与绿色全量标记曲线居中,多数时间高于 10%,未能稳定突破 10% 以下。这支持论文的文字总结:只有 SALT-N 进入 8% 区间,其余方法停留在 10% 以上。

测试集数字进一步确认差距比 12.75 小时更大。SALT-N 在 1 小时测试集取得 8.19% 的字错误率和 20.08% 的词错误率,而字形与音素基线分别为 12.21% 和 10.78%,全量标记为 12.21%。这构成关键反证:全量标记提供最多的显式语音提示,但在极低资源下因词表扩张加剧数据稀疏,模型反而见不到每个细粒度标记足够多次。选择性标记只解决鼻音韵尾等最关键的声学歧义,同时保持词表紧凑,因此在数据极少时仍能学到可用的映射。

边界与未验证之处:单人小数据与未测量的成本

论文直接报告的局限是实验仅限于单人小规模数据集 KSS。作者在结论中明确表示,未来将在更大规模多人语料上应用 SALT,并探索其对其他具有复杂但确定性音系规则语言的适用性。这意味着当前结论的支持范围是韩语单人语音合成,不能直接推广到多人、多口音或多语言场景。

未评测的边界同样需要点明。论文比较了字错误率、词错误率、客观自然度、说话人相似度和主观自然度,但没有测量训练推理延迟、实时率、显存占用随词表变化的系统成本,也没有报告误判率分解或不同句子类型的错误分布。因此不能从发音错误下降推定推理更快或部署更便宜,总体趋势也不等于每一组句子都成立。

另一个需要区分的点是相关性与因果。分布效率指标与下游性能的相关性来自已有研究,论文用它指导选择标记组合并观察到 SALT-N 同时具有较高效率与较低错误率,这属于支持性证据,而不是证明效率提升必然导致错误下降。缺少的验证是如果人为打乱标记的语言学含义但保持相同分布,性能是否仍然提升,这项对照原文没有做,复述时应表述为待验证。

复现先做什么:按顺序对齐文本、词表与选点

复现的第一步是对齐文本前端。先用相同归一化模块把数字、拉丁字母和符号转为韩文表记,再做字音转换得到音素序列,最后按声母与韵尾规则附加标记。SALT-N 只需分离鼻音韵尾ㅁ、ㄴ、ㅇ与其声母对应物,词表从 40 到 49 量级只小幅增加到 43 左右。不要一开始就实现全量标记,因为全量组合词表更大且在小数据上更难训练。

第二步是对齐模型与训练。加载英文和中文预训练的 F5-TTS,对文本嵌入和文本编码器做全量微调,其余模块加低秩适配并设置原文给出的秩与学习率。语音重采样到 24 kHz,批大小与训练步数按原文硬件条件换算。关键是复制验证选点逻辑:每 101,000 步测验证集字错误率,取最优点再测测试集,而不是固定步数直接比较,否则不同切分的收敛差异会污染结论。

第三步是对齐评价。转写必须使用同一大模型版本,字错误率与词错误率使用同一文本规范,主观评价需说明听众数量、每模型条数与统计检验方法。资源状态方面,本次收到的证据未绑定完成验证的代码或数据资源,因此不能声称代码、模型或数据已公开。复现时应先补做缺失项验证:记录随机种子与划分、报告多次采样的波动,并补充推理开销与长句稳定性测试。

何时值得尝试 SALT-N:一句话收束与误解澄清

当任务是韩语等书写与发音存在确定性但上下文相关差异的语音合成,且只有十几小时甚至 1 小时单人数据时,值得先尝试 SALT-N 这类选择性标记。它把最拥挤的高频韵尾显式分开,用很小的词表代价换取分布均衡与发音准确性,而不需要改动声学模型结构或增加数据。

常见的误解是标记越细越好。论文的反例恰好说明,全量标记在 12.75 小时落后于字形基线,在 1 小时也未能突破 10%,原因是细粒度标记在小数据下加剧稀疏。另一个误解是客观声学分数高就等于人听起来自然。实验中全量标记的客观自然度略高,但人类听众因惩罚读错而更偏好 SALT-N,因此必须同时看发音错误率与主观评价。

最终收束回到可核对的事实。在 12.75 小时上 SALT-N 把字形输入的字错误率从 4.74% 降到 3.30%,主观自然度达到 3.10 左右;在 1 小时上它是唯一把字错误率降到 10% 以下的方法,取得 8.19%。这些结果支持在极低资源下用语言学先验平衡分辨率与效率的设计思路,但仍待在更大规模多人数据与更多语言上验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总