英文题目:Phonikud: Overcoming Phonetic Underspecification for Hebrew Text-To-Speech

会议身份:conference:interspeech:2026:conference-paper-id:kolani26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #数据集 #Adapter #文本到语音

评分:8.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 1.0/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Yakov Kolani:机构信息未能从会议 PDF 纯文本可靠映射
  • Maxim Melichov:机构信息未能从会议 PDF 纯文本可靠映射
  • Cobi Calev:机构信息未能从会议 PDF 纯文本可靠映射
  • Morris Alper:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

现代希伯来语文本到语音(Text-to-Speech,TTS)输入为无元音符号文本,输出为语音,难点在于正字法欠指定导致重音位置、Shva读法和外来音难以确定。Phonikud先用冻结的DictaBERT注音基座加可训练两层感知机适配头生成增强注音,再经有限状态转换器与词典匹配转为完整国际音标(International Phonetic Alphabet,IPA),最后以该IPA训练轻量TTS并用微调的音频到IPA识别器做自动评测。与直接映射文本到音频或仅用标准注音训练相比,该链条把缺失韵律与音段特征显式化,使小模型获得充分发音输入,从而显著降低重音与元音错误。在ILSpeech基准评测下,Phonikud的WER为17.4%,低于DictaBERT的WER 39.5%。下游90M参数StyleTTS2加Phonikud在SASPEECH 100句上词错误率为35.2%,优于全部开源基线并接近专有系统。结论限于录音室希伯来语、双说话人语料与合成数据训练场景,对口语变体和日期地址等文本归一化尚未验证。训练在单张RTX4090上完成,TTS微调约10小时,开源模型在无GPU的macOS M1上测得实时因子小于1。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,哪些信息不能丢?

这篇论文研究的输入是日常无元音希伯来语文本,目标是合成出发音准确的希伯来语语音。必须保留的信息不只是辅音字母本身,还包括元音质量、词重音、舍瓦是否成音、前缀切分以及个别不规则词的特殊读法。

论文开场强调现代希伯来语约有 9,000,000 人使用,但缺乏开源且足够好的语音合成系统。重要应用包括屏幕阅读器与智能家居技术。对刚入门的读者,白话解释是希伯来语日常书写省略元音符号,读者靠上下文脑补。

做语音合成时机器没有这种脑补能力,必须把每个词的完整发音算出来。论文把这种现象称为语音欠指定,也就是书写形式没有写全发音所需的特征。输出端论文要求的是充分指定的国际音标,英文为 International Phonetic Alphabet,缩写为 IPA,后文简称 IPA。

重音标记按语音合成惯例直接写在被重读元音之前,例如 /sˈefer/。学习路径上,先要理解 3 类欠指定,再看 2 步走的转换管线如何补齐它们。然后看语料与评测如何让重音这类以往测不到的错误变得可测,最后看小模型如何用更好的音素输入接近大系统。

论文声明代码、数据与模型在项目页当前可用,第三方工具 eSpeak NG 的仓库链接本次可达。资源状态是正文开源声明的唯一依据,本次 5 个资源链接均报告可用。

已有路线为什么还是读错重音与元音?

已有路线大致分 2 类。第 1 类是把无元音文本直接映射到音频,代表是端到端建模与基于离散语义单元增强稳定性的方法。第 2 类是先预测元音符号再在带元音文本上训练合成模型,代表是 2 阶段的 SASPEECH 基线、MMS 多语系统与 Robo-Shaul 等开源希伯来语系统。

论文指出这 2 类都没有完全解决欠指定问题,即使加了标准注音仍会留下显著的发音错误。评测路线同样有缺口。标准做法是用自动语音识别,英文为 automatic speech recognition,缩写为 ASR,后文简称 ASR,把合成音频转写成文本再与输入比较。

但标准希伯来语 ASR 输出的是无元音文本,因此对元音质量与重音位置的错误是盲的。也就是说合成器把重音读错了,评测分数可能完全看不出来。与多语字素到音素工具的对照也说明问题。

论文把字素到音素转换,英文为 grapheme-to-phoneme conversion,缩写为 G2P,后文简称 G2P,作为独立任务来测。eSpeak NG 与 CharsiuG2P 名义上支持希伯来语,但在论文的基准上几乎不可用。前者是常用词词典支持不足,后者出现大量幻觉。

这支持论文把希伯来语 G2P 当作需要专门处理的新基准,而不是直接复用多语工具。

希伯来语的 3 类欠指定具体长什么样?

第 1 类是词重音。希伯来语词重音只能部分从词形与词性预测,正字法即使加了元音符号也不标重音。论文给的最小对比例是 /txˈina/ 的 tahini 与 /txinˈa/ 的 grinding,同形但重音不同。

另 1 例是带元音符号的词既可读作 /bˈira/ 的啤酒,也可读作 /birˈa/ 的首都。合成器若默认把重音放在固定位置,就会产生母语人一听即知的错误。第 2 类是舍瓦的多功能性。

舍瓦这个元音符号有时静默,有时读作 /e/,取决于复杂的形态音系规则且不规则多。论文举例 /belˈondon/ 的在伦敦中前 2 个辅音之间的舍瓦要发音,而 /blondˈini/ 的 blonde 中对应位置静默。只靠字母顺序无法决定,必须结合形态切分与词典知识。

第 3 类是不规则词,尤其是包含 /w/ 音的外来词,其写法与 /v/ 相同。论文举例 /pˈinɡwin/ 的企鹅与假设的 */pˈinɡvin/ 在书写上无法区分。作为教学例子可以这样理解:同样一串字母,可能是 4 种读法。

标准注音只能缩小范围,不能唯一确定。这正是论文要把增强符号与规则转换分开处理的原因。

2 步管线如何从无元音文本走到完整音标?

论文提出的方法全景是 2 步 G2P 管线。第 1 步是增强注音模块,给每个字母加上标准元音符号与额外的语音符号。第 2 步是基于规则的 IPA 转换模块,把这种增强的带符号文本确定性地变成标准 IPA。

之后可用于训练高效的希伯来语语音合成模型。沿一个样本走完全程就是输入无元音字母串,先得到带标准符号加增强符号的中间形式。再经有限状态机与词典匹配得到带重音的 IPA。

下图是理解全系统的关键,阅读时先看主路径再看上下展开的细节框。图中上排从左到右是输入、蓝色虚线增强注音框、绿色虚线规则转换框与右侧 IPA 输出。左下与右下分别展开神经预测细节与规则算法细节。

看图路径: 1. 先从左上角输入框沿箭头向右追踪增强注音与规则转换 2 个大框到右侧国际音标输出;2. 再看左下蓝色虚线框内每个字母如何同时经过冻结的基础编码器与基础加增强 2 个预测头;3. 接着看右下绿色虚线框内带增强符号的注音形式如何经规则算法变为音标字符串;4. 最后对照右下黑色虚线框确认基础头标雪花冻结而增强头标火焰可训练

原论文 Figure 1:The Phonikud grapheme-to-phoneme pipeline.

论文图 1。原论文 Figure 1:“The Phonikud grapheme-to-phoneme pipeline.”。

图中示例输入为 5 个希伯来字母的无元音词,输出为斜杠括起的 /hapat’uax/ 形式。左下展开显示每个输入字母先进入冻结的基础注音编码器,再分叉到基础与增强 2 个预测头。底部标注区分基础符号、重音与前缀 3 类输出。

右下展开显示带增强符号的注音形式先进入基于规则的算法框,再得到不带斜杠的音标字符串。右下黑色虚线框明确标注基础头冻结、增强头可训练,这与正文冻结 DictaBERT 只训练新头的安排一致。

增强注音模块冻结什么,新增什么?

增强注音模块不是从零学习转写,而是复用已有的高精度注音模型。基础模型采用 DictaBERT 的希伯来语注音微调版本,约 300 M 参数的编码器加线性词符分类头。论文冻结该模型及其原有逐字预测头,新增一个可训练的 2 层多层感知机头。

该适配头隐藏维度为 256,使用 ReLU 激活,只预测 3 个增强符号。这种安排的理由是新增参数可忽略、推理高效,并保持标准符号预测性能固定。3 个新增符号分别是上标角标、下标线与竖线。

上标角标表示非末重读音节,下标线表示舍瓦读作 /e/,竖线表示附着前缀的结束位置。前 2 个直接给出缺失的语音特征,第 3 个帮助不规则词的词典匹配。论文说明这些字形选用传统圣经吟诵符号,因为日常书写不用它们。

注音 × 字素到音素转换: 注音负责给无元音希伯来字母补上标准元音符号,解决读什么元音的问题;字素到音素转换负责把带符号的书写形式变成无歧义的国际音标,解决合成器直接可读的发音规范问题。两者搭配的原因是直接从无元音文本学发音歧义太大,先用成熟注音模型缩小歧义,再用确定性规则完成多对一字母映射与顺序调整,组合意义是让训练与合成都基于充分指定的音素输入。

实现上每个字母位置会同时得到基础符号与增强符号 2 路预测,基础路冻结、增强路学习。训练时只有适配头更新,基础编码器不更新。因此标准注音能力被锁定,新增能力以蒸馏方式加入。

3 个增强符号如何对应 3 类歧义?

这节把符号与欠指定问题一一对应。重音符号解决即使带元音仍不标重音的问题。舍瓦符号解决舍瓦静默还是成音的问题。前缀边界竖线解决附着成分切分问题,间接帮助不规则词查词典。

组合机制是 3 者都写在同一中间文本上,交给下一步规则模块统一消费。而不是让合成模型自己猜。

增强注音符号 × 词重音: 增强注音符号是新增的 3 个辅助标记,分工是补上标准注音不写的发音信息;词重音是其中最关键的缺失特征,分工是指示哪个音节被强调。搭配理由是希伯来语即使加了元音符号仍不标重音,如啤酒与首都同形但重音不同,必须用上标角标这类非常用符号显式标出非末重音,组合后规则模块才能生成带重音标记的国际音标。

舍瓦 × 前缀边界: 舍瓦是希伯来语中多功能的元音符号,分工是判定此处静默还是读作 /e/;前缀边界是标示附着于词前的介词冠词等成分结束位置的竖线,分工是帮助切分附着成分以便查词典。搭配原因是舍瓦发音依赖形态音系规则且不规则多,而前缀切分错误会连带影响舍瓦与重音判断,组合意义是同时给出舍瓦实现用的下标线标记和词典匹配用的切分信息。

需要提醒初学者竖线本身不是发音,它的作用是切词。例如先标出前缀在哪里结束,剩余词干才能正确匹配不规则词典。若把竖线误当成停顿或声学标记,就会误解管线分工。

进而才能决定舍瓦与重音的规则走向。这种显式中间表示是后续规则确定性可复现的前提。

规则转换模块处理哪些书写复杂性?

得到增强注音形式后,音素表示已可无歧义确定。论文用确定性规则算法转成标准 IPA,主要以有限状态机与词典匹配实现。原文明确列出 4 类处理,分别是多对一映射、非单调序列、双功能字母与不规则词。

多对一的例子是 2 个不同字形都对应 /t/。非单调序列的例子是特定字母串应读作 /rˈeax/ 而非按字母线性顺序的错误读法。双功能字母的例子是同一字母可作辅音也可作元音。

这一步不含神经网络训练,作用是把语言学规则沉淀为可复现的转换。消融实验显示去掉 IPA 转换、直接在带元音文本上训练,性能变化很小。这说明 IPA 转换保留了合成所需的关键语音内容。

同时带来可解释性与跨语言标准化的实用好处。对复现者而言,这意味着若只关心合成质量,带增强符号的注音文本已足够。若要跨系统比较或输出标准音标,则需要保留规则模块。

没有重音真值时如何造出大规模训练信号?

根本挑战是现有资源缺乏重音等特征的真值标注。论文采用人在回路的办法,先用现有资源加人工修正造出伪真值,再蒸馏进模型。具体做法是采用约 5,000,000 行的 IsraParlTweet 希伯来语文本语料。

利用 Dicta 的形态音系分析接口与已知语言学规则自动预测重音位置、前缀边界与舍瓦实现。由于自动预测常不准,论文按切分后的词型频率排序,人工修正包含最高频 1000 词的集合。训练配置按原文交代为在这些伪标签上训练直到早停触发。

约 6 个轮次,批量大小为 256,学习率为 5e-3,验证集比例为 5 %。只有新增的 2 层适配头被训练,基础模型冻结。论文未报告该适配头训练的梯度裁剪、权重衰减与学习率调度等细节。

这属于具体缺项,复现时应先按默认值跑通再调优,不应从模型名称推定优化器实现。

冻结基础模型 × 可训练适配头: 冻结基础模型指约 300 M 参数的 DictaBERT 注音编码器及其原有逐字分类头,分工是保持标准元音符号预测精度不变;可训练适配头指新增的 2 层多层感知机,分工是只学习 3 个增强符号。搭配理由是缺乏重音等真值标注且不想破坏已有高精度注音能力,组合意义是以极小参数增量实现高效推理并把新知识蒸馏进适配头。

所有训练运行在单块 RTX 4090 上进行,显存为 24 GB。下游合成训练约 10 小时,使用默认超参数,这为复现预算提供了参考。

语料、划分与指标如何让重音变得可测?

论文贡献的 ILSpeech 语料是约 2 小时的高质量希伯来语语音,来自 2 位说话人。内容覆盖科学、技术、历史与日常对话。音频以 44 kHz 在录音室录制,经 Adobe Enhance 增强后归一化到 22.05 kHz。

再经语音活动检测加人工修正切成 4 秒到 14 秒的片段,配有希伯来语文本与专家标注的 IPA。说话人已获知用途与许可并给出明确书面同意,语料以非商业加伦理使用要求发布。该语料承担 2 个角色。

文本加 IPA 用于 G2P 基准,音频加 IPA 用于监督音频到 IPA 的 ASR 模型。G2P 基准因部分对比模型的计算需求,只在随机 100 个样本子集上评测。论文用配对 Wilcoxon 符号秩检验加 Bonferroni 校正报告显著性。

指标包括词错率、忽略重音的词错率、字错率与完全匹配率,方向都是前 3 者越低越好、完全匹配越高越好。聚合在样本级进行。音频到 IPA 的 ASR 是在 openai/whisper-small 希伯来语识别模型上微调得到。

训练对来自 ILSpeech 的音频加 IPA。在 150 个带人工核验 IPA 的合成话语留出子集上,该模型词错率为 24.71 %,字错率为 5.47 %。论文认为该精度足以支撑自动评测,并用后文的用户研究作佐证。

下游合成评测在 SASPEECH 的 100 个至少 6 词且无特殊字符的随机样本上进行。开源模型在无 GPU 加速的 MacBook M1 上测实时率,专有系统走云端接口。

字素到音素转换中重音建模带来多大差距?

比较问题是在相同的 100 个 ILSpeech 样本上,不同 G2P 策略谁的音标更接近专家标注。公平条件是都以专家 IPA 为目标,用词错率、忽略重音词错率、字错率与完全匹配率衡量。基线包括加默认重音的 DictaBERT 与 Nakdimon、多语工具与大语言模型。

大模型推理时温度为 1.0,用固定提示指定重音位置与标点保留等 IPA 规范。原表所有数值为百分比,表头已说明单位,单元格保留裸数值写法。

系统词错率忽略重音词错率字错率完全匹配率示例输出
Phonikud17.412.23.817.0bˈoker tˈov
DictaBERT 加默认重音39.525.68.32.0bokˈer tˈov
Nakdimon 加默认重音40.527.28.72.0bokˈer tˈov
eSpeak NG100.095.144.00.0vvkr tov
CharsiuG2P100.0100.070.60.0boːʔab têːb
Claude Opus 4.625.319.05.110.0bˈoker tˈov
Gemini 3.1 Pro13.911.82.816.0bˈoker tˈov

表后解释是 Phonikud 显著优于所有实时基线,论文报告与 Phonikud 的所有比较 p 值小于 1e-10。其优势主要来自重音预测,现有注音器因用默认重音而在示例中把正确重音读错。多语工具几乎不可用,未胜出项中 2 个多语系统的词错率均为 100.0,属于明确的负结果。

大模型一侧 Gemini 3.1 Pro 略优于 Phonikud,但论文强调其昂贵且太慢不适合实时。只能作为性能上界而非可部署收益。剩余误差既有重音等特征预测错误,也有基础注音模型的局限。

音频到国际音标识别 × 语音合成自动评测: 音频到国际音标识别的分工是把合成语音听写成带元音质量与重音的音标序列;语音合成自动评测的分工是用该序列与输入文本对应的标准音标比较算出词错率与字错率。搭配理由是标准希伯来语识别只输出无元音文本,对元音与重音错误视而不见,组合后才能自动捕捉以往被忽略的发音细节并用于比较不同合成系统。

需要区分忽略重音的词错率与完整词错率不是同一指标,数值接近不代表重音不重要。恰恰是两者之差反映了重音错误的占比。

下游语音合成中小模型何时能接近大系统?

比较问题是用 Phonikud 转写的 IPA 训练轻量合成模型,能否在发音准确性与延迟之间取得更好权衡。公平条件是用同一音频到 IPA 识别模型算错率,并在相同 SASPEECH 样本上比较。论文微调轻量 Piper 的 High 版本 32 M 参数与 StyleTTS2 90 M 参数。

训练数据为经 Gemini 2.5 Pro 生成的 20 小时合成希伯来语音频,输入文本先经 Phonikud 转成 IPA。从英文预训练检查点初始化,错率单位为百分比,实时率越低越快。

模型词错率字错率实时率参数量类型
Piper 加 Phonikud44.310.50.1332M开源本地
StyleTTS2 加 Phonikud35.28.90.5090M开源本地
Robo-Shaul50.414.91.5828M开源基线
SASPEECH68.121.00.1628M开源基线
MMS63.619.60.2136M开源基线
HebTTS68.723.325.4420M开源基线
Gemini29.46.60.80未报告专有云端
OpenAI35.08.71.60未报告专有云端

表后解释是基于 Phonikud 的 StyleTTS2 在开源组最优,论文报告与它的所有比较 p 值小于 1e-8。Piper 虽然错率略高但实时率最低,适合边缘计算。代价是两者仍未在词错率上稳定超过专有 Gemini。

且评测句对部分基线是分布内而对本方法是分布外,因此跨组比较需谨慎。未胜出项中 HebTTS 参数达 420 M 但错率与延迟均差,说明参数规模不等于希伯来语发音准确性。用户研究进一步显示 9 名母语者在 20 句日常句上更偏好 StyleTTS2 加 Phonikud。

自然度比较平均意见分加 1.3,内容保真度加 0.7,分别在 p 小于 1e-4 与 p 小于 0.01 下显著。对重音敏感的 250 句专项人工评测显示,完整方法词错率为 3.2 % 且整句全对率为 77.0 %。去掉重音后词错率升至 8.4 % 且全对率跌至 46.4 %,领先基线 Robo-Shaul 的 6.6 % 与 56.8 %。

所有比较 p 小于 1e-7。这支持重音建模对母语人可感知的显著性。

拿掉增强符号、注音或转写会发生什么?

消融固定 Piper Medium 20 M 参数与更少数据及迭代次数的轻量设置,只改变输入表示。比较问题是增强注音、IPA 转换与基础元音符号各自对下游合成错率的贡献是多少。指标仍为词错率与字错率,越低越好,原表所有数值为百分比。

配置词错率字错率相对完整方法的变化论文判断
完整方法49.913.3基准最优
去掉增强注音55.015.5均上升损害整体性能
去掉 IPA 转换直接用带元音文本56.115.4变化小保留关键语音内容
去掉元音符号直接用无元音文本69.423.2大幅上升元音预测错误严重

表后解释是去掉增强注音会损害性能,与人工重音评测一致。去掉元音符号直接用无元音文本导致最差结果,说明元音是不可或缺的基础。反例是去掉 IPA 转换影响很小,论文明确这不是技术失败。

而是 IPA 转换保留了本质语音内容并提供可解释性与跨语言标准化。所有完整系统与其他设置的比较 p 小于 0.004。复现时不应把无训练等同于确定性求解,规则模块确定性强不代表整体输出确定。

基础注音与适配头的预测仍有不确定性。

哪些误差与边界是原文明确承认的?

论文在局限节明确方法继承基础注音模型的缺陷,包括偶发元音不准与遵循正式书面希伯来语惯例而偏离口语。例如特定词的关闭在正式语与口语中读法不同,这些局限与现有希伯来语合成方法共有。不是 Phonikud 独有。

未评测边界包括细粒度韵律控制、语码切换、日期地址等文本规范化,论文只列为未来方向而未给出证据。不能当作已验证能力。数据侧 ILSpeech 仅约 2 小时且来自 2 位说话人,虽足以建立 G2P 基准与音频到 IPA 模型。但不能推广为大覆盖度的声学训练集。

评测侧音频到 IPA 模型的自身词错率为 24.71 %,自动指标存在噪声。需与人工重音评测与用户研究联合解读,不能把自动指标当成人评。相关性不等于因果的一个例子是小模型接近大系统是在更好音素输入条件下观察到的趋势。

不等于每组句子或每种说话风格都成立。论文未测量误判率之外的延迟分解与成本细节时,不应承诺这些量同步改善。训练资源、推理开销与实际延迟应分别讨论。

要复现应先跑通哪 3 件事?

第 1 件事是跑通 G2P 管线。按原文顺序先加载冻结的 DictaBERT 注音模型,再训练 2 层适配头预测 3 个增强符号。训练数据用 IsraParlTweet 约 5,000,000 行经 Dicta 接口加规则自动标注后人工修正高频 1000 词的结果。

超参数从约 6 轮、批量 256、学习率 5e-3、验证比例 5 % 起步。硬件参考为单块 RTX 4090。第 2 件事是复现规则转换。实现多对一映射、非单调顺序、双功能字母与不规则词典。

输入输出对应用论文示例校验,例如增强形式应能得到带重音的 IPA,而不是线性错序。第 3 件事是复现评测。先用 ILSpeech 的文本加 IPA 跑 G2P 基准,再用其音频加 IPA 微调 whisper-small 得到音频到 IPA 模型。

确认在留出集上达到相近的 24.71 % 词错率与 5.47 % 字错率后,再用它评测合成输出。代码、数据与模型在项目页当前可用,属于代码开源与资源可下载的范畴。但系统可运行还需自行配置希伯来语字体、音频采样率与词典依赖。

若要验证下游合成,先用 20 小时合成音频与默认超参数微调 Piper 或 StyleTTS2。再在 SASPEECH 子集与 250 句重音专项集上分别测自动错率与人工重音准确率。还需补的验证是更大说话人覆盖与真实录音训练下的表现。

以及在边缘设备上的实测延迟。

何时值得尝试先补符号再转音标的思路?

当输入是欠指定的书写系统而目标需要完整发音时,这套思路值得尝试。论文明确点名最直接的是带注音的语言如阿拉伯语、乌尔都语等。更一般的是正字法不透明的语言。

判断条件是已有高精度基础注音器可用,缺失特征可用少量新增符号显式标出。且规则转换能覆盖多对一映射与词典例外。对研究生而言,可复述的方法链是冻结基础注音保精度。

用小适配头补重音、舍瓦与前缀边界,经确定性规则得完整 IPA。再用专家小语料同时建立可测重音的基准与可听出重音错误的识别器,最后把更好的音素输入喂给小合成模型。论文报告显示这条链让 100 M 参数以下的本地模型在发音准确性上接近大专有系统。

但代价是仍依赖基础注音质量与人工修正的高频词表。最终收束是欠指定不是靠更大声学模型硬猜就能解决的,显式补齐书写中缺失的语音特征。再让评测能看见这些特征,才是可核对的改进。

后续若补上韵律控制、语码切换与文本规范化,并扩大说话人与语体覆盖。才能更完整地回答实用化问题。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总