英文题目:Exploring Pre-training Benefits on Phoneme Addition through Fine-tuning in Speech Synthesis
会议身份:
conference:interspeech:2026:conference-paper-id:murata26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#迁移学习 #跨语言 #低资源 #预训练 #文本到语音
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Masato Murata:机构信息未能从会议 PDF 纯文本可靠映射
- Koichi Miyazaki:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Koriyama:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源文本到语音需将预训练模型扩展到目标语未见音素,输入为目标语音素序列,输出为对应波形,难点在于新增嵌入随机初始化且小数据下声学映射易混淆语言与说话人因素。本文先用大语言模型生成受控英文文本并经espeak-ng转写为国际音标过滤,得到排除目标音素的有限集与包含全音素的完整集,分别用于预训练与微调。再用同一基于VCTK训练的Conformer-FastSpeech2管线合成配对语音以隔离声学条件,并对比朴素微调与从零训练在多档数据量下的目标音素错误率与自然度。与已有跨语言迁移只报整体自然度提升不同,本文将音素增加单独度量,揭示声学先验与新音素学习解耦,微调自然度占优但新音素学习需同等或更多数据。在英语到日语跨语言场景评测下,100、300和500话语条件下微调的目标音素错误率高于从零训练的目标音素错误率,而微调的自然度得分高于从零训练的自然度得分。适用边界为单说话人微调与朴素嵌入扩展,未验证大规模多语预训练、音素映射初始化及主观听感外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么低资源合成需要迁移?
这篇解读的输入是论文正文提供的文字证据与 3 张官方原图像素,目标是让刚进入语音合成的研究生能复述出音素增加实验是如何构造、如何训练、如何评价的。必须保留的信息包括预训练与微调的数据规模、目标音素的定义方式、从零训练基线的可比条件、目标音素错误率与自然度评分的分工,以及作者报告的主要趋势与限制。输出是 1 篇按学习依赖展开的中文技术解读,不做超出证据的推广。
语音合成的任务是把音素序列变成波形。初学者可以把一条样本走一遍:输入是国际音标形式的音素串,例如英语句子转成的音素序列,模型先把每个音素映射为向量,再经过声学模型预测频谱或隐表示,最后经声码器变成波形。低资源语言的问题在于目标语言录音很少,从零训练往往音质不稳。常见做法是先在英语等高资源语言上预训练,再到目标语言上微调。
难点在于目标语言常有源语言音素表里没有的音,例如论文引言提到的西班牙语颤音和科萨语搭嘴音。此时模型必须扩大音素表,把新音素的嵌入向量随机初始化后再学习,论文把这个过程称为音素增加。关键疑问是预训练学会的旧音素能力是否真的帮助学新音,还是只让整体声音更自然。本文正是围绕这个疑问设计对照。
已有路线如何处理未见音素,本文的对照有何不同?
在跨语言低资源合成中,未见音素并不是新问题。论文回顾的已有路线大致有两类。第一类是音素映射,即在微调前把目标语言的新音映射到源语言中最接近的已有音上,再微调。第二类是随机初始化,即直接为新音素新增符号并随机初始化其嵌入,然后微调。论文说明自己沿用后一类朴素做法,并引用前人基线做法作为训练配置依据。
已有研究多报告迁移后整体自然度和可懂度提升,但没有把新音素学得好不好单独拿出来度量。也就是说,整体变好可能是因为旧音素发得更稳、韵律更自然,而不代表新音素本身学得更快。本文的不同在于明确提出目标音素错误率,只在新增音素上算错,从而把新音学习效果与整体音质分开。它还设置了严格可比的从零训练基线,用完全相同的目标数据训练单说话人模型,再与微调比较。教学上可以这样理解:已有工作回答迁移后声音是否更好听,本文追问这种好听中有多少来自新音素本身学得更好。这个例子只是帮助理解分工,不代表已有方法无效。
要回答的两个问题是什么,什么算学会了新音?
论文把大问题拆成两个可检验的小问题。第一,模型能否通过微调学会预训练未见的目标音素。第二,预训练知识对这个学习过程有何好处,好处体现在发音准确性上还是自然度上。所谓学会,在操作层面指合成语音经第三方音素识别模型转写后,目标音素位置的错误率足够低。论文为此定义目标音素错误率,灵感来自有偏词错误率,只统计目标音素,不统计其他已见音素。这样即使模型整体很流畅,只要新音发错,指标仍会暴露问题。
自然度则用预训练的自动评分模型估计,模拟平均意见分,分数越高表示预测的听感越好。两个指标方向相反:目标音素错误率越低越好,自然度评分越高越好。初学者容易把二者混为一谈,认为自然度高就等于新音学会了。论文的设计恰好要打破这种混淆:如果微调的自然度更高但目标错误率不更低,就说明预训练的贡献主要在音质而非新音学习。后续所有实验都同时报告这两个指标,并在不同目标数据量下重复比较。
两路实验如何分工,先仿真后真实的逻辑是什么?
论文安排了两路实验。第一路是音素受控仿真,语言和说话人固定,声学条件一致,只改变目标音素是否存在,用于排除语言失配、说话人变化和录音域差异等混杂因素,并能系统改变训练数据量和目标音素类型。第二路是真实跨语言迁移,从英语到日语,用真实录音验证仿真结论在实际中是否成立。两路都比较微调与从零训练在相同目标数据下的表现。
受控仿真 × 跨语言迁移: 受控仿真指用同一合成管线生成、只控制音素有无的英语语料来模拟音素增加,负责排除语言、说话人和录音域差异;跨语言迁移指用英语真实语料预训练再到日语真实语料微调,负责检验结论在实际中是否成立,二者搭配的原因是先在干净条件下看机制,再在复杂真实条件下看泛化,组合意义是若两路结论一致则证据更可信。
下图是音素增加过程的示意,阅读时先看源数据集与目标数据集的音素表关系,再看新增部分如何追加。
看图路径: 1. 先看上方源数据集方框中的已有音素序列,再看下方目标数据集方框中新追加的红色部分;2. 注意中间大箭头上标注的音素增加字样,确认它表示音素表扩大而非说话人或语言整体替换;3. 对照右侧目标音素括号,确认新增音素是接在原有音素之后追加的;4. 把该图与后文有限语料与完整语料的分工对应起来
论文图 1。原论文 Figure 1:“Overview of the phoneme addition process in trans- fer learning.”。
该图显示源数据集方框只包含已有音素,目标数据集方框在保留已有音素的基础上追加了一段新音素,中间箭头标示音素增加。这个示意对应后文的具体操作:预训练时音素表较小,微调时把音素表扩大,新符号的嵌入随机初始化,其余参数继承。仿真路用英语内部的人工划分实现这种扩大,真实路用英语 40 个符号基础上增加 20 个日语特有音素实现扩大。理解这张图后,再看语料构造和模型训练细节会更顺畅。
模型与微调操作具体改变了什么,什么被冻结什么被重置?
仿真与真实实验都使用基于变换器与卷积增强的快速语音合成模型,即论文所用的 conformer 结构快速语音合成第二版实现,配置沿用公开工具包的对应配方。预训练阶段使用说话人编号条件以支持多说话人,微调阶段去掉说话人条件改为单说话人模型,学习率降为原来的十分之一。论文还说明预备实验发现改变学习率对微调性能影响有限,但未报告具体扫参数值,因此复现时不应把学习率当作已充分优化的量。
音素增加 × 微调: 音素增加指目标语料出现预训练未见音素时必须扩大音素表并学会发这些新音的工作,微调指在预训练模型基础上继续用目标数据训练的做法,二者搭配的理由是希望保留已学会的发音能力同时补上新音,组合后新增的作用是只随机初始化新音素嵌入而其余参数继承,但本文检验这种继承是否真的加速新音学习。
关键的组件改动在输入端。模型的音素表在微调时扩大,未见目标音素的嵌入向量被随机初始化,其余已见音素的嵌入和主干参数从预训练继承。从零训练基线则是同一单说话人结构在相同目标数据上随机初始化全部参数。波形生成统一使用在英语语料上预训练的神经声码器,避免声码器差异干扰比较。论文未明确报告除嵌入外是否有层冻结或梯度截断,因此只能说全参数继续训练的朴素微调,不推测存在分层冻结。
目标音素 × 预训练音素知识: 目标音素指微调阶段才首次出现、需要新学的音,新音素嵌入在实验中被随机初始化;预训练音素知识指模型已能生成预训练阶段见过音素的语言和声学能力,二者搭配的原因是直觉上旧发音知识应帮助学新发音,组合意义在于比较微调与从零训练在相同目标数据下谁更快学会目标音素,从而分离出预训练的真实贡献。
沿一条样本走完流程有助于固定概念:输入的目标音素串中既有旧音素也有新音素,旧音素查到继承的嵌入,新音素查到随机初始化的嵌入,随后一起经过编码器、时长与声学预测得到频谱,再经声码器得到波形。评价时波形再送给第三方音素识别模型得到转写,用于计算目标音素错误率,同时送给自动评分模型得到自然度分数。
语料如何构造,合成数据与真实录音各自承担什么?
仿真路的语料构造是本文特有的细节,需要仔细复述。作者先用大语言模型生成英文句子,再用规则语音合成前端校验音素。为构造预训练用的受限语料,先从发音词典中选出不含目标音素的允许词表,词表规模超过 23000 词,再提示模型只用这些词生成每句 3 到 15 词的自然英文句,每句经国际音标转换确认不含目标音素才保留,不合格丢弃。随后按真实语料的统计抽样约一千句对齐分布,再用预先在英语语料上训练好的合成模型把国际音标句合成为语音,得到语音与音素对。
为构造微调用的完整语料,先让大语言模型按词数分布生成大量句子池,经国际音标转换确认每句至少含一个目标音素,得到约三万有效句,再抽样两千句并用同一合成模型合成语音,保证除音素有无外声学管线一致。预训练用的受限数据集规模约为十万七千句,对应约 55 小时,来自 107 个说话人且排除目标说话人;微调用的完整数据集为来自目标说话人的两千句。真实路则直接用英语多说话人语料预训练,用日语单说话人语料微调,日语文本经日语前端转音素再映射到国际音标符号。
下表提出比较问题:在相同微调数据量下比较是否公平,关键是预训练规模、说话人条件和目标音素定义是否交代清楚,指标方向是错误率越低越好、自然度越高越好。
| 设置 | 预训练语料规模 | 微调语料规模 | 目标音素定义 | 训练数据量级 |
|---|---|---|---|---|
| 受控仿真 | 107000 句约 55 小时 107 人 | 目标说话人 2000 句 | 爆破音或前元音分组 | 100 句到 2000 句多档 |
| 真实跨语言 | 英语约 44 小时 108 人 | 日语约 10 小时单人 | 英语 40 符号加 20 个日语特有音 | 100 句到 2000 句多档 |
该表显示两路实验在预训练规模上差异很大,但微调比较都在各自路内使用相同目标数据抽样,公平性来自路内一致而非跨路一致。代价是仿真路的语音来自同一合成管线,声学多样性不如真实录音;真实路则混入语言、说话人和录音域差异。未胜出项在后文结果中体现:数据量很小时微调的错误率反而更高,这是理解预训练局限的关键反例。
评价条件如何对齐,测试集与识别模型是什么?
评价对齐是复现时最容易出错的环节。仿真路用不参与训练的一千句英语文本做测试,每句至少含一个目标音素,目标音素分组为爆破音和前元音两组。真实路用不参与训练的一百句日语语料文本做测试。两路都用基于自监督语音模型的音素识别器计算目标音素错误率,英语识别器在英语语料上微调,日语识别器在日语语料上微调。自然度统一用自动评分模型估计。训练数据量都在 100、300、500、800、1000 和 2000 句多档重复,均为从各自目标数据集中随机抽样。
目标音素错误率 × 自然度: 目标音素错误率只在新增的目标音素上计算识别错误,负责回答新音是否发对;自然度用预训练的自动评分模型估计整体听感,负责回答语音是否顺滑好听,二者搭配的原因是微调可能同时改变可懂度和听感,组合后才能区分预训练是帮了发音准确性还是只帮了整体音质。
下表把评价协议并排放,便于核对测试集、识别器和指标是否在路内一致。
| 设置 | 测试文本规模 | 音素识别器 | 自然度指标 | 训练数据抽样 |
|---|---|---|---|---|
| 受控仿真 | 1000 句每句至少一个目标音 | 英语上微调的识别模型 | 自动评分越高越好 | 100 句到 2000 句随机抽样 |
| 真实跨语言 | 100 句日语未见文本 | 日语上微调的识别模型 | 自动评分越高越好 | 100 句到 2000 句随机抽样 |
该表说明测试文本与训练集无重叠,识别器与语言匹配,这是公平比较的前提。具体代价是自动评分只是听感代理,不是人工平均意见分,不能把自动分高直接等同于人听一定更好。论文未报告识别器的自身误判率和置信区间,因此目标错误率的绝对数值应理解为相对比较,而非发音正确的绝对概率。复现时应保留相同的识别器语言匹配和测试集不重叠条件,否则跨语言比较会失真。
仿真中微调与从零训练谁更快学会新音?
仿真结果是本文最核心的证据,需要按目标音素类型分别阅读。下图上一排是目标音素错误率,越低越好,下一排是自然度评分,越高越好,左列为爆破音,右列为前元音,横轴都是训练语句数,图例中蓝色实线为微调,红色虚线为从零训练。
看图路径: 1. 先按图例区分蓝色实线微调与红色虚线从零训练,再分清左列爆破音与右列前元音;2. 上一排看目标音素错误率随训练句数从左到右是否下降,下一排看自然度评分是否上升;3. 重点比较训练量最少的 100 句处两条线的上下关系;4. 观察训练量增大到 2000 句时两条线是否靠拢,判断差距是否随数据量消失
论文图 3。原论文 Figure 2:“Target PER (%) (top) and UTMOS score (bottom) comparison between fine-tuning (blue solid) and scratch train- ing (red dashed) for (a) plosive consonants and (b) front vowels…”。
从可见趋势看,在两组目标音素下,从零训练的目标错误率在各数据量下达到相当或更低,尤其在 100 句和 300 句等低资源处差距明显:蓝色微调线起点更高,随数据增加下降更快,但在 800 句之前仍高于红色线,到 1000 句至 2000 句才逐渐接近。换句话说,微调需要相同或更多数据才能达到与从零训练相当的错误率,且该模式不随爆破音或前元音改变。论文还报告频谱观察:在 100 句时从零训练的爆破闭塞模式更清晰,而微调虽已能发准已见音素却在新目标音素上吃力。
数据充足后二者接近。作者据此解释为训练约束不同:从零训练无约束地联合学习全部音素,微调则要在保留旧知识的同时学新音,反而更难。自然度则相反:微调在所有数据量下达到更高或相当的自动评分,说明预训练对整体音质有持续帮助。这一分离是全文的中心判断,应表述为论文报告的结果,而非普遍规律。
换到真实英到日迁移,结论是否依然成立?
真实跨语言实验用于检验仿真结论是否只是合成数据的假象。下图左为日语特有目标音素上的错误率,越低越好,右为自然度评分,越高越好,横轴仍是训练语句数,蓝色实线为微调,红色虚线为从零训练。
看图路径: 1. 先确认横轴是训练语句数,左图纵轴是目标音素错误率,右图纵轴是自然度评分;2. 左图中比较蓝色微调线是否在所有横轴位置都高于红色从零训练线;3. 右图中比较 100 句到 500 句区间蓝色线与红色线的相对高低;4. 观察 800 句之后两条自然度曲线是否趋于接近
论文图 2。原论文 Figure 3:“(a) Target PER (%) on Japanese-specific target phonemes and (b) UTMOS score in a real-speech cross-lingual transfer learning setting (English VCTK →Japanese JSUT), comparing…”。
像素显示左图中红色从零训练线在所有数据量下都低于蓝色微调线,说明即使在真实语言失配和说话人变化下,预训练的已见音素能力仍未转化为新音素学习速度优势。右图则显示在 100 句到 500 句低资源区间蓝色微调线的自然度明显高于红色线,到 800 句之后两线趋于接近。这与仿真路的分离模式一致:错误率上从零训练占优或相当,自然度上微调占优,尤其在数据少时。论文因此报告预训练主要贡献于自然度改善,对音素增加帮助有限。
由于像素不能精确读出每点的具体数值,复述时只讲相对高低与随数据量的收敛趋势,不硬写百分比小数。未评测的边界包括除日语外的其他目标语言、除该声码器外的其他声码器,以及人工听感验证,这些缺项意味着结论不宜直接推广到所有跨语言对。
哪些因素还不能下结论,相关性与因果如何区分?
需要明确区分论文直接报告、有限解释和未验证推测。直接报告的是两路实验中同时出现的分离趋势:微调自然度更高,但目标错误率需要相同或更多数据才能追上从零训练。有限解释是作者对训练约束的讨论,即保留旧知识可能妨碍新音学习,这有频谱观察支持,但未通过冻结层数或损失权重的干预实验验证因果,因此只能表述为可能机制而非定论。未验证推测包括用更大音素覆盖的预训练模型或辅助损失能否改善音素增加,论文只在结尾提出方向,未给出实验。
缺失证据不是技术错误,但复述时要指出具体缺项:未报告识别器误判率、人工平均意见分、统计显著性、训练时长与推理延迟、不同随机种子的方差。相关性不等于因果:自然度与错误率的同时变化不能证明自然度改善导致错误率变化,二者由不同模块和数据因素驱动。此外,仿真语音来自同一合成管线,可能低估真实录音的多样性;真实路只做英语到日语 1 对语言,不能推广到所有语言距离。阅读时还应注意,总体趋势不等于每组每步都成立,例如自然度优势随数据增加而缩小,错误率差距也随数据增加而缩小。
复现时先做什么,需要保留哪些关键条件?
若要复现,建议按学习依赖顺序先做三件事。第一,重建评价管线:准备语言匹配的音素识别器和自动评分模型,固定测试集不与训练重叠,并确认指标方向。仿真路测试为一千句每句至少含一个目标音,真实路测试为一百句日语未见文本。第二,重建数据划分:仿真路需保证预训练集完全不含目标音素而微调集包含,真实路需在英语 40 符号基础上增加 20 个日语特有音并随机初始化新嵌入。第三,重建可比训练:同一目标数据抽样下分别跑朴素微调与单说话人从零训练,微调去掉说话人条件并将学习率降为十分之一,声码器统一。
必须保留的关键超参数与信息条件包括训练数据量多档、目标音素分组、说话人条件切换和声码器一致。论文未说明代码、模型权重或数据是否公开,本次也未发现经验证的可用资源链接,因此不能声称代码或数据已公开,复现应按论文文字自行实现。常见误解是认为预训练数据越大新音必然学得越快,本文证据不支持这种直觉;另一个误解是把自动评分当成人评,复现时应明确标注自动分只是代理指标。若只能做最小验证,优先跑 100 句和 1000 句两档,因为低资源处的分离最明显,高资源处可观察收敛。
何时值得尝试微调,何时应考虑从零训练?
综合两路证据,可以给出务实的分工建议。当目标是快速得到自然流畅的语音,且目标数据很少时,微调值得优先尝试,因为它在低资源下自然度优势最明显。当目标是让新增的特有音素尽快发准,且能负担相同或更多目标数据时,不应默认微调更快,应同时跑从零训练基线并用目标音素错误率单独考核新音。若数据充足到两千句量级,二者在错误率和自然度上都趋于接近,此时选择应更多考虑工程成本而非精度差距。
回到中心矛盾:预训练记得旧音素的能力主要转化为整体音质,而非新音素的学习速度。这一判断在爆破音与前元音两组、仿真与真实两路中保持一致,因此可信度高于单实验结论。但它仍是有边界的结论:只在本文的模型结构、朴素微调操作、自动指标和英到日 1 对语言下得到验证。未来值得补的验证包括人工听感对新音的单独打分、更多语言对、不同音素类型如搭嘴音或声调语言的检验,以及显式帮助新音学习的辅助损失或更大音素覆盖的预训练。初学者记住这个分工,就能在低资源项目中避免把自然度改善误当作新音已学会。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


