英文题目:Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech
标签:#语音合成 | #知识蒸馏 | #低资源 | #多语言
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Kunat Pipatanakul:机构信息未在 arXiv HTML 中可靠披露
- Potsawee Manakul:机构信息未在 arXiv HTML 中可靠披露
- Warit Sirichotedumrong:机构信息未在 arXiv HTML 中可靠披露
- Sittipong Sripaisarnmongkol:机构信息未在 arXiv HTML 中可靠披露
- Pakorn Nathong:机构信息未在 arXiv HTML 中可靠披露
- Phatrasek Jirabovonvisut:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。
🔗 开源与复现资源
代码相关资源:https://github.com/wayu-research/thai-tts-eval — 暂时无法访问
模型相关资源:https://huggingface.co/hexgrad/Kokoro-82M — 暂时无法访问
数据相关资源:https://huggingface.co/datasets/typhoon-ai/thai-dialect-isan-dataset — 暂时无法访问
复现相关资源:https://huggingface.co/hexgrad/Kokoro-82M — 暂时无法访问
第三方资源:https://huggingface.co/k2-fsa/OmniVoice — 暂时无法访问
第三方资源:https://huggingface.co/hexgrad/Kokoro-82M — 暂时无法访问
第三方资源:https://huggingface.co/openai/whisper-large-v3 — 暂时无法访问
第三方资源:https://huggingface.co/typhoon-ai/typhoon-whisper-large-v3 — 暂时无法访问
第三方资源:https://huggingface.co/typhoon-ai/typhoon-whisper-large-v3-ctc — 暂时无法访问
第三方资源:https://huggingface.co/speechbrain/spkrec-ecapa-voxceleb — 暂时无法访问
第三方资源:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash — 暂时无法访问
第三方资源:https://huggingface.co/typhoon-ai/typhoon-isan-asr-whisper — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入只有 15 秒参考时,要改变什么又必须保留什么?
输入是很少的固定音色条件与大量待合成的泰语文本,目标是得到可在设备端运行的固定音色泰英语音合成,不再依赖参考音频。必须保留的是说话人身份的一致性、泰语声调与难词的正确实现,以及自然的短语停顿。改变的是部署形态:从需要大模型与 GPU 推理的零样本克隆,变为 82M 参数的紧凑学生。
泰语让这件事变难。词边界在书写中不一致,声调决定词义,人名与外来词不规则,数字需要口语化,泰英混排的预期往往是泰式英语而非原生英语。教师的随机错误会直接变成学生的训练目标,而简单丢弃失败样本又会丢掉难文本的覆盖。因此流水线设计本身决定了最终质量。
一个教学示例可以帮助定位:假设交互式语音应答只需要一个机构音色朗读账单与通知,团队只有 15 秒录音。直接调用大克隆模型每次都可行但成本高;重新录制单人库又不现实。论文研究的是第三条路:用大模型批量生成该音色的合成语料,再训练固定音色学生,后续推理不再需要参考音频。这里 82M 与不再调用教师只是支持紧凑部署的动机,原文并未报告设备端实时率,不能当作手机 CPU 实测证明。
两条老路各卡在哪里,第三条路继承了什么?
第一条路是大型多语种零样本克隆,依赖自回归或扩散等生成主干与大规模多语语料,用几秒参考复刻音色。它的优点是零样本泛化广,缺点是只需要单一组织音色时推理仍然昂贵。第二条路是 VITS 与 StyleTTS2 一类的紧凑固定音色架构,部署简单但需要有授权的单人语料,低资源语言往往拿不到。
论文把自己的位置放在受大语言模型蒸馏启发的第三条路:用大克隆模型做数据源,把短参考扩展为合成语料,再训练 Kokoro 学生。这与先用合成目标语言语音再用数小时真人适配的做法不同,也与为泰语显式标注声调与停顿的大数据路线不同。它不需要除短参考之外的特定人语料,但质量与覆盖受限于教师能生成什么与过滤能留下什么。
相关泰语工作提醒了评估重点。已有泰语研究显式建模声调与停顿,泰文分词与空白不可靠使词错误率不稳定,转写正确不等于停顿合理。这些都支持论文把句子级可懂度、难词实现、停顿放置、音色相似度与语速分开评估,而不是只报一个平均分。
为什么只看整句错误率会误判泰语合成?
句子级字错误率(character error rate,CER)把整句平均成一个数字,一个关键人名错了可能只增加少量字符错误,但对用户就是整句不可用。泰语空格不可靠,词错误率还依赖分词,而字错误率去空格后稳定但仍然平均掉了局部失败。更隐蔽的是韵律:转写可以全对,但波形中可能在词中间出现数百毫秒静音,或在不合理连接处切开。
论文因此把问题拆成 4 个互补维度:用字错误率看整句可懂度,用挑战集关键词准确率看难表达的局部实现,用韵律停顿准确率看停顿是否落在允许位置,用说话人相似度与语速看身份与节奏是否漂移。每一种度量都可能暴露其他维度看不到的失败。
复述时要记住比较口径。字错误率用 Typhoon Whisper Large V3 转写并做归一化去空格,单句上限 100% 后再平均;关键词用精确子串匹配检查规范形或授权变体;停顿只报告允许而非必需位置下的精确率、含错片段率与词内率,并同时报告每片段停顿数以防少停顿刷低错误率。
三段流水线如何把短参考变成固定音色学生?
全景是文本准备、教师采样与质量过滤、学生训练 3 段。先把泰语文本选材并切分为句子级块,对教师不可靠的数字与英文跨度做口语化改写;再用 OmniVoice 的 Voice Design 模式生成 12 个冻结种子参考,用克隆模式渲染语料文本并对每个候选做质量过滤;最后把留下的文本音频对交给带泰英音素前端的 Kokoro 学生训练。推理时学生只收音素序列,不再需要参考音频。
跟着一个样本走一遍更清楚。训练阶段,一句含数字与英文的泰语句子先被切块与改写,送入冻结音色参考的教师得到波形候选;过滤器转写并比对硬词音素、检测停顿位置与语速时长,合格则进入合成库。停顿放置失败直接移出候选池,其余符合条件的失败最多重渲染 4 次,仍不通过则保留最好的 1 次以维持文本覆盖,并不保证每次保留都合格。部署阶段,用户文本走同样的前端得到音素,直接由学生声学模型与声码器生成固定音色语音,不再经过教师或过滤器。
关键取舍已经埋在这里。过滤越严,训练目标越干净,但难文本越容易被整体丢掉;重采样保留文本覆盖,用多次抽样去找可接受实现。前端把泰语走 TLTK、英语走 Misaki 并共享音素表,低音调需要新增一个词表项与学习嵌入,其余声调与多数音段复用已有符号。
文本从哪里来,又如何变成教师能读对的形式?
语料文本有两个来源:覆盖广的 WangchanThaiInstruct,以及面向难表达的基于大语言模型关键词合成管线。发布模型还加入来自 LibriTTS 的英文文本。所有文本在教师推理前先分为句子级块,这是控制合成长度与过滤粒度的动作。
合成前先做口语化(verbalization)。预实验发现数字有时被读成中文,英文跨度口音与预期的泰式英语不一致,因此用大语言模型改写器把歧义数字与嵌入英文改写为发音导向的泰文或 Tinglish 文本。教师再用冻结种子参考合成该准备文本,候选进入过滤。这个改写只改变输入文字,不改变教师权重。
教师模型 × 学生模型: 教师模型指承担零样本语音克隆的大型 OmniVoice,用于把冻结的 15 秒音色参考渲染成大量候选语音;学生模型指承担固定音色部署的 82M Kokoro 主干,只接受音素序列而不需参考音频。两者搭配的原因是教师有广覆盖但推理贵且错误会遗传,学生便宜但缺单人语料;组合后新增的含义是把教师当作可编程数据源,用过滤与重采样把可用分布提炼成可训练语料,再蒸馏为固定音色能力。
需要区分训练与部署的信息条件。训练时教师能看到参考音频与准备文本,学生只能看到过滤后的文本音频对;部署时学生只能看到前端音素,看不到任何参考音频与过滤信号。因此教师的口音与错误若未被过滤,就会成为学生唯一见过的监督。
过滤器用什么信号决定留下还是重做?
内容正确性用基于 CTC 的泰语自动语音识别(automatic speech recognition,ASR)做硬词音素精确匹配,含声调。硬词由确定性规则定义:词表外或在泰国国家语料中罕见的 TLTK 词典词头。选择 CTC 而不用 Whisper 类自回归 ASR 的理由是后者会利用上下文脑补出预期词,掩盖声学实现错误。任何硬词音素不匹配即拒绝。
韵律与时长有 3 类拒绝:停顿位置违反允许集合、整句语速超出说话人特定范围约正负 10%、硬词时长相对教师总体被异常压缩。停顿失败直接移出候选池,其余失败最多重渲染 4 次并保留最好 1 次,以保留文本覆盖。最终整体拒绝率为 23.0%,是理解规模与覆盖代价的起点。
字错误率 × 挑战集关键词准确率: 字错误率指整句转写后去空格计算的平均字符错误,反映句子级可懂度;挑战集关键词准确率指每句只检查一个目标难表达是否以规范形或授权变体出现在转写中,反映局部难词实现。两者搭配的原因是整句正确可能掩盖一个人名或代码切换词的错读;组合后新增的含义是把平均可懂度与关键局部正确分开度量,避免用一个平均数代替部署风险。
下面的整理表回答过滤压力主要来自哪里。比较条件是同一教师候选池上的 4 类检查,指标方向是拒绝比例越高表示该类问题越多。它不是模型性能表,而是语料构建的诊断表。
| 检查类型 | 拒绝比例 |
|---|---|
| 停顿位置 | 11.3% |
| 发音内容 | 10.4% |
| 任意拒绝 | 23.0% |
停顿与发音合计已占主导,语速与时长只去掉少数候选,但原文未给出这几项叠加后的去重细节,不能把分项直接相加得到总数。更重要的是过滤只能判断教师是否产生可用实现,不能证明被保留样本的难词分布仍完整,这正是后文需要重采样的原因。
学生前端与主干各自负责什么,如何组合?
学生主干是 82M 参数的 Kokoro 与 StyleTTS2 结构,把音素序列转为固定音色集合的语音。Kokoro 本身不直接读原始文本,依赖分语言前端映射到共享国际音标音素词表,英文用 Misaki,中日另有前端。泰语原来不受支持,因此接入 TLTK 做字形到音素转换。
组合细节决定了跨语言行为。多数泰语音段可映射到已有符号,5 个声调中有 4 个复用已有轮廓 token,只有低调需新增词表项与嵌入。拉丁跨度的两种处理构成对照:单语前端把拉丁改写为泰文再统一走 TLTK,双语前端保留拉丁原形并按书写路由,泰走 TLTK、英走 Misaki,数字符号仍泰语口语化。后者保留英语音素表示以支持迁移。
单语前端 × 双语前端: 单语前端指把拉丁字母跨度先改写为发音导向的泰文再全部走 TLTK 泰语音素化;双语前端指泰文走 TLTK、英文原形走 Misaki 并在共享音素词表中拼接,数字符号仍泰语口语化。两者搭配比较的原因是泰式英语的预期口音与原生英语不同,改写与保留各有利弊;组合比较后新增的含义是前端策略可以在不重训声学模型时改变难例的可读性与跨语言迁移。
质量过滤 × 拒绝采样: 质量过滤指用 CTC 泰语 ASR 做音素级硬词校验并检查停顿位置、语速与时长,剔除不合格教师候选;拒绝采样指对被剔除文本中符合条件的失败最多重渲染 4 次并保留最好的 1 次,而不是直接丢弃文本,停顿放置失败则直接移出候选池。两者搭配的原因是只过滤会同时丢掉难文本的覆盖,只重采而不滤会留下错误目标;组合后新增的含义是在挑选更干净目标的同时保留难例覆盖,保留的最好 1 次并不承诺一定合格。
停顿精确率 × 词内停顿率: 停顿精确率指检测到的静音停顿中落在允许位置的比例,是主要的放置质量度量;词内停顿率指包含至少 1 次把一个词从中间切开的片段比例,是最严重的错误子类。两者搭配的原因是精确率看每次停顿,词内率看最不可接受的破坏是否发生;组合后新增的含义是即使转写全对也能发现把ข้อจำกัด这类词吞掉一半的韵律错误,这是纯文本指标看不到的。
参数状态也要 1 次讲清。主模型训练 8 轮,优化器为 AdamW,有效批量为八,主学习率为 1×10−4,PL-BERT 为 1×10−5。PL-BERT、BERT 投影、韵律预测器、文本编码器与解码器从 Kokoro 发布检查点初始化,风格编码器与预测器编码器从 StyleTTS2-LibriTTS 初始化,ASR 对齐器与基频提取器只做训练监督,多周期与多分辨率判别器从零初始化。
训练更新了哪些参数,监督信号从哪里来?
这不是无训练的检索或规则系统,而是有明确训练阶段的蒸馏。需要更新的是学生声学侧:PL-BERT 按 1×10−5 学习率继续更新,BERT 投影、韵律预测器、文本编码器、解码器与风格相关编码器按主学习率更新,以及新增低调嵌入与判别器;冻结或仅作监督的是 ASR 对齐器与 JDC 基频提取器等训练期监督模块。更新信号来自合成文本音频对上的重构、对齐、音高与对抗损失,而不是真人录音。
从零对照的做法在原文有明确定义。所谓从零仍保留 PL-BERT、ASR 对齐器与基频提取器为预训练,其余 BERT 投影、韵律预测器、文本编码器、解码器与两个风格编码器随机初始化,遵循 StyleTTS2 协议。这意味着比较的是主干与风格侧是否复用 Kokoro 与 StyleTTS2 权重,而不是一切从随机开始。
训练预算与数据规模需要同时记住。配方消融从约 17.63 小时扩展到 40.58 小时再到 41.81 小时,最终双语模型为 54.35 小时并把英语上限设为泰语时长的 30%。轮数固定为 8 轮,Isan 适配则是在泰语单语模型上用约 1.5 小时合成 Isan 语音再微调 4 轮,且关闭中部泰语 CTC 发音过滤而保留韵律与时长过滤。
数据集、划分与指标如何保证可复述?
评估文本与训练文本分离。字错误率集为 500 句,仅泰语:250 句来自 WangchanThaiInstruct 测试划分覆盖零售金融医疗法律,250 句来自 Common Voice 17.0 泰语验证集的朗读提示,只用转录文本重新合成。挑战集为 1531 句,每句含一个目标表达,分泰英混排 391、人名 310、罕见词 410、非正式拼写 210 与长句 210,长句目标复用其他类别。
停顿评估只用 210 个长句,因其具有逐句允许位置掩码。允许集合是作者书写的空格与标点,加上文本大模型标记的上下文可停顿位置的并集,平均每句 13.8 个允许位置。检测到的内部静音需排除辅音闭塞与不可归因伪影,再经 TLTK 分词与 CTC 强制对齐映射到文本,分为允许、不合理词边界与词内 3 类。说话人相似度用 ECAPA 嵌入与教师生成训练话语构建的质心算余弦,语速用每浊音秒 token 数相对教师的变化百分比。
基线与硬件条件也要交代。比较对象包括 600M 的 OmniVoice 教师、Gemini 3.1 Flash TTS 专有系统,以及配方内部的单语基线与 Thai-only 模型。英语字错误率用 500 行 LibriTTS 保留句并用 Whisper Large V3 转写。原文未报告传统均值意见分与重复随机种子的方差,因此不要把单次平均数读成显著性结论。
只看平均分会错过什么,难词与停顿揭示了什么?
先看教师与更大系统的对照,回答平均分与局部难度的关系。统一条件是同一挑战集与字错误率集,指标方向是字错误率越低越好、关键词准确率越高越好。Gemini 在两项都优于 OmniVoice,但关键词差距更能暴露难局部表达的失败,而不是整句平均的微小漂移。
| 系统 | 平均字错误率 | 关键词准确率 |
|---|---|---|
| Gemini 3.1 Flash TTS | 3.3% | 79.8% |
| OmniVoice 教师 | 4.6% | 72.8% |
Gemini 相对教师约 7.0 个点的关键词优势,说明句子级平均数确实平均掉了难表达错误。一个反例是不能反过来用关键词代替可懂度:它只检查目标子串,不惩罚其余部分的流畅性。不能推出的结论是教师在所有类别都差 7 个点,类别分解需要后文的预训练与教师支持分析。
停顿结果进一步说明转写正确不等于短语正确。统一条件是 210 个长句,指标方向是停顿精确率越高越好,含错片段率与词内率越低越好,同时看每片段停顿数。Gemini 停顿更多但放得更准,OmniVoice 停顿少却仍有更高的含错率,说明少停顿没有自动带来少犯错。
为什么现在看这张波形图,因为它是转写掩盖停顿错误的直接证据,文字指标无法替代对静音位置的观察。
看图路径: 1. 先读两行标题中的完整时长与括号内显示窗口,区分全长与当前视窗;2. 再核对标题尾部的 verdict:上方 bad 对应 4 处放错停顿,下方 bad 对应 2 处;3. 接着看下方红色块标注的 438 ms 如何横穿ข้อจำกัด,而上方同词连续;4. 最后对照底部图例,区分词内停顿、不允许词边界停顿与可丢弃闭塞静音

论文图 5。原论文 Figure 5::“ASR transcripts can conceal pause errors.”。
图中标题的 47.68 s 与 42.31 s 是两条完整音频的时长,当前视窗分别是括号内 44.96–47.68 s 与 39.83–42.31 s,并非全长波形。横轴为 time (ms),纵轴为 dBFS 并标出 -35 虚线 floor。上方 Gemini 本例标题为 bad 对应 4 处放错停顿,下方 OmniVoice 为 bad 对应 2 处,因此不能把上方读成整体无停顿错。关键比较仍在目标词:下方红色阴影标出 438 ms 词内停顿横穿ข้อจำกัด,上方同词连续无切分,两系统却都正确转写出该词。图例还区分不允许词边界停顿的浅色块与可丢弃的斜线闭塞静音。这改变了当前判断:仅用字错误率会判两者相同,而停顿评估会把下方判为严重放置错误,这正是学生需要通过过滤超越教师的动机。
82M 学生与大系统同台时,强项与代价各在哪里?
最终比较回答紧凑学生能否保留泰语行为并加上英语。统一条件是 1531 项关键词、500 句泰语字错误率、500 行 LibriTTS 英语字错误率与 210 长句停顿音色指标,指标方向与前文一致。发布检查点 Wayu-Paxa-TTS-Edge 在泰语语料基础上加英语至 54.35 小时双语数据,英语上限为泰语时长 30%。
| 系统 | 关键词准确率 | 泰语字错误率 | 英语字错误率 | 停顿精确率 |
|---|---|---|---|---|
| Wayu-Paxa-TTS-Edge | 68.2% | 3.7% | 1.1% | 91.4% |
| OmniVoice 教师 | 72.8% | 4.6% | 0.9% | 89.9% |
学生泰语字错误率 3.7% 优于教师 4.6%,停顿精确率 91.4% 超过教师 89.9%,并取得三系统中最低的含错与词内率,音色相似度 0.882 接近教师 0.899。代价是关键词 68.2% 落后教师 72.8% 与 Gemini 79.8%,说明压缩主要损伤难词汇实现而非音色与停顿结构。加英语的局部代价是相对 Thai-only 模型关键词与停顿精确率小幅下降,但英语字错误率从 4.4% 降到 1.1%,支持其作为部署模型。
Isan 适配回答 15 秒参考能否指定新固定音色。统一条件是约 1.5 小时合成 Isan 文本微调 4 轮,关闭中部泰语发音过滤。比较指标方向是相似度越高越好、字错误率越低越好。下表拆开三行身份:教师行只放教师实测,适配前为 Thai-only 学生,适配后为 Isan 微调后学生。
| 条件 | 说话人相似度 | Isan 字错误率 | 中央泰语字错误率 | 中央泰语关键词准确率 |
|---|---|---|---|---|
| 教师 | 0.854 | 6.6% | 缺失 | 缺失 |
| 适配前学生 | 缺失 | 缺失 | 3.4% | 69.2% |
| 适配后学生 | 0.842 | 5.5% | 5.1% | 65.8% |
适配后相似度 0.842 接近教师 0.854,Isan 字错误率 5.5% 优于教师 6.6%,但中央泰语字错误率从 3.4% 升到 5.1%,关键词从 69.2% 降到 65.8%。这支持短参考可以迁移音色与方言形式,但字错误率只测可懂度,不能证明 Isan 自然度与方言保真,完整 Isan 评估集仍是下一步。
配方中哪一步真正同时改善内容与停顿?
配方消融按累积方式组织,每行在上一行基础上增加一个组件,采样预算匹配并按同一过滤标准保留有效样本。比较问题是质量与覆盖如何平衡,统一条件是约 17.63 小时起步的同一教师分布,指标方向是关键词与停顿精确率越高越好,字错误率、含错率与词内率越低越好。
| 配置 | 关键词准确率 | 平均字错误率 | 停顿精确率 | 语速偏差 |
|---|---|---|---|---|
| 未过滤单语基线 | 67.5% | 4.0% | 81.3% | 12.4% |
| 增加停顿过滤 | 69.6% | 3.5% | 88.4% | 8.2% |
相对未过滤基线,仅停顿过滤就把关键词从 67.5% 提高到 69.6%,平均字错误率从 4.0% 降到 3.5%,停顿精确率从 81.3% 升到 88.4%,语速偏差从 12.4% 降到 8.2%。这支持去除错位停顿不仅改善短语,还提供更干净的内容目标。失败项在后两步:固定语料换双语前端时字错误率回升到 4.1%,质量过滤扩到 40.58 小时后关键词跌到 67.2% 且停顿精确率跌到 85.4%,说明只丢弃会稀释难例。
不能由这张小表推出完整配方的最优性。原文报告重采样后在 41.81 小时取得关键词 69.2%、字错误率 3.4%、停顿精确率 92.8% 的平衡,预训练对照则显示复用 Kokoro 与 StyleTTS2 权重全面优于从零,代码切换准确率从 22.8% 到 65.5% 是最大变化,人名增益仅约 6.1 个点,说明难类别对初始化的敏感度不同。
前端的推理期干预提供了未胜出项的另一面。用固定第 8 轮权重只改大语言模型口语化与 TLTK 音素处理,分别影响 12.3% 与 7.3% 输入,关键词从 68.9% 到 69.2% 再到 70.0%,合计 1.1 个点。这说明可观的失败来自声学模型上游,但口语化改动多而收益小,音素表示改动少而收益大,不应把长尾都归因于声学容量。
教师的天花板在哪里,哪些错误注定难蒸馏?
教师分析用 oracle best-of-K 衡量可恢复上限。K 从 1 到 118 时精确准确率从 72.8% 升到 87.9%,高出单样本基线 15.1 个点,说明多次采样能找回大量 1 次抽不到的正确实现。这标识采样与选择是更强训练目标的路径,但 oracle 是事后最优,不可直接当作可部署收益。
覆盖分析把上限与教师语料联系起来。OmniVoice 报告约 10.5k 小时泰语语音,其中 98.2% 来自 GigaSpeech 2,关键词频率与采样难度相关系数为 -0.437。在 K 为 118 时,未见关键词覆盖仅 66%,而出现 100 到 10k 次的关键词覆盖达 98%。未解决项集中在教师训练语料中欠代表的表达,因此下一步挑战是数据覆盖而非单纯增加采样次数。
方法与评估的残差也要点名。停顿评分依赖泰语分词、CTC 对齐与口语化跨度处理,字符对齐器对数字与拉丁跨度无词表,分词器在复合词上仍有分歧;指标最可靠的是同仪器下的系统间比较。讨论部分也承认停顿与关键词信号依赖启发式与规则分词,未来可结合神经与规则方法。专有 Gemini 的参数下界为文献代理,跨规模比较时不应读成同条件胜负。
要复现这条路,先做什么后做什么?
先复现评估再复现训练。第一步用 500 句字错误率集与 1531 项挑战集固定转写与匹配规则,确认基线字错误率与关键词的计算口径,包括去空格、单句 100% 截断与精确子串匹配。第二步在 210 长句上复现允许位置并集与停顿三率,固定 -35 dBFS floor、75 毫秒最小停顿时长与 60 毫秒边界容差,再核对每片段停顿数,避免用少停顿刷低含错率。
再按文本口语化、教师采样过滤、学生训练的顺序推进。文本侧保留句子级切块与数字英文改写;教师侧用 12 个冻结参考并记录 4 类拒绝,停顿失败直接剔除、其余失败最多重渲染 4 次并保留最好 1 次;学生侧复用 Kokoro 与 StyleTTS2 初始化并保持 8 轮与批量八的设置,PL-BERT 用 1×10−5 学习率更新,低调新增嵌入不要遗漏。双语扩展时把英语上限设为泰语时长 30%,Isan 适配时关闭发音过滤但保留韵律时长过滤。
常见误解需要提前纠正。第一,过滤后规模变大不等于变强,40.58 小时无重采样反而使关键词与停顿精确率下降,必须检查难例覆盖。第二,前端改动可在固定权重下提分,但 1.1 个点的收益不能证明声学模型已够用。第三,best-of-118 的 87.9% 是 oracle 上限,不是实际可运行策略,部署收益只能用单次或可运行选择器衡量。开源状态按证据区分:原文称开放模型与评估框架,但复现前应核对仓库中的权重、基准元数据与许可,而不是把代码存在等同于权重可下载。
什么条件下值得尝试这条合成蒸馏路?
当应用只需要单一机构或品牌音色、有 15 秒合规参考但无单人库,且能接受难词实现略低于大教师时,这条路值得尝试。它的可运行优势是推理端固定音色、无需参考音频,停顿结构甚至可通过过滤超过教师。它的适用条件是泰语口语化与前端可维护,因为一部分长尾失败在声学模型之外。
不值得盲目尝试的情况也要明确。如果业务核心是大量罕见人名、股票代码与混排品牌的高精度朗读,仅靠单次教师采样与严格丢弃可能不够,需要重采样预算与更好的选择器,并补足教师欠覆盖表达的文本来源。如果需要 Isan 等方言保真,现有字错误率与相似度不足以验收,应先建方言评估集再做 4 轮适配。
收束时回到可核对的事实。82M 学生用 54.35 小时双语合成数据达到泰语 3.7%、英语 1.1% 字错误率与 91.4% 停顿精确率,关键词 68.2% 仍落后教师与 Gemini;教师多次采样的 15.1 个点上探与频率相关性说明覆盖是下一瓶颈。这些数字的比较条件与单位已在上表注明,复现时沿评估、过滤、训练的顺序逐段核对即可。
📎 论文与评分元数据
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses