英文题目:Dictionary-Constrained Grapheme-to-Phoneme for Unsegmented Languages from LLM-Annotated Data

标签:#文本到语音 | #Transformer | #数据增强 | #语音学与音系 | #低资源

评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Rui Hu:机构信息未在 arXiv HTML 中可靠披露
  • Zhenpeng Zhan:机构信息未在 arXiv HTML 中可靠披露
  • Xiaolong Lin:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

日语字形到音素转换需把未切分文本映射为全句读音,难点是切分与多音字歧义耦合,且单汉字可对应变长音节并在复合时发生音变。该方法先用词典构造词格,再用字符级编码器提取上下文表示,随后对格节点表层形与读音分别编码并经注意力融合打分,最后在有向无环图上做条件随机场解码。与传统形态分析器依赖局部代价和硬切分不同,该框架只监督读音序列并将切分边缘化,同时用间隔损失区分同跨度竞争读音。从结构上看,词典保证输出合法,神经模型负责长程语境消歧。在Joyo-Kanji-Yomi修订基准13536句上,目标词读音准确率达99.62%,目标词音素错误率0.32%,整句音素错误率0.14%,明显高于形态分析器与序列基线。该结论目前仅在常用汉字读音场景验证,对专有名词、阿拉伯数字与外来语仍需外推检验,原文未披露推理时延与部署开销。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么日语更难?

这篇论文研究的是字音转换,也就是把写出来的句子变成它的发音形式。输入是一整句日语原文,输出是整句的读音,论文中用片假名表示读音节点,用假名序列计算错误率。对于语音合成,这个模块决定汉字读什么;对于语音识别,它帮助把文本与发音对齐。作者强调该模块要快、要稳定、要看上下文。

日语的难点在于 3 个特点叠加。第一是没有空格,切分本身就是问题。第二是汉字与假名混写,一个汉字在不同词里可能对应不同数量的音节。第三是多音与复合音变,论文举例恋可读 koi 或 ren,人可读 hito、nin 或 jin,但复合词恋人读作 koibito,不能简单把单字读音拼起来。中文虽然也有多音字,但基本是一字一音节,可以做成字级别标注。

英语有空格,查词典加异形同形词消歧即可。日语必须同时处理切分与读音选择。

初学者容易误以为直接用大模型逐字翻译发音就行。论文的判断是,无约束的序列模型偶尔会造出词典里不存在的读音,例子是把稲光读成不存在的 irigabi,而正确应为 inabikari。传统形态分析器则先定切分再查读音,切分错了读音跟着错,且只看局部上下文。因此作者选择保留词典约束,同时引入整句语境打分。

已有路线各解决了什么,还缺什么?

同输入、同目标的已有工作可分为 3 类。第一类是基于形态分析器加词典的方法,代表是 MeCab 加 UniDic、OpenJTalk、Juman++ 和 Sudachi。它们先建词格子,再按词与转移代价找最低代价路径。优点是快速稳定,缺点是形态上最合理的切分不一定对应正确读音,且上下文建模浅。

第二类是神经序列模型,直接把字形串翻译成音素串,包括自回归的 ByT5 和非自回归的基于联结时序分类的模型,以及微调的小指令模型。它们能看更长上下文,但没有词典约束,论文报告会出现幻觉式读音。第 3 类是用预训练掩码语言模型加词典做多音消歧,但仍依赖形态分析器做切分与特征,训练数据多为有限人工标注或分析器伪标注。

形态分析器 × 神经节点打分器: 形态分析器负责用词典代价与局部特征先定切分再查读音,优点是快而稳定;神经节点打分器负责用字符级预训练编码与跨注意力看整句语境再给节点打分;搭配理由是前者提供合法候选约束防止幻觉,后者提供长距离语境解决多音,组合意义是用结构先验约束生成空间、用神经语境做选择。

近期有人评测大模型本身的字音能力,但用大模型标注大规模数据再训练专用字音模型的工作还很少。本文的定位就是补上这一环:用前沿大模型生成两百多万句带整句读音的训练数据,再训练一个受词典约束的语境打分模型。

任务如何形式化,什么叫切分松弛?

论文把日语字音转换形式化为在词格子有向无环图上的路径选择问题。先用词典对输入句子做全匹配,得到所有可能的词节点,每个节点带有表面形、读音、词性与活用等信息,节点按字符位置连接成格子。任何一条从句首到句末的完整路径都对应一种切分加读音假设。

关键动作是放松切分要求。传统方法要求路径在形态上最合理,本文只要求路径产生的整句读音与目标读音一致。也就是说,只要读音对,切分走哪条边都可以。论文用外国人参政権举例,形态分析偏好的绿色边路径是一种合法切分,但蓝色边经过的其他节点组合只要读音正确也被视为有效。这种松弛带来两个好处:推理时不必执着于语言学上的标准切分;训练时只需整句读音监督,不必提供逐词对齐,从而让大模型标注变得可行,因为让大模型写整句和整句读音比让它做精细切分标注更可靠。

整体流程如何从一句话走到一个读音?

沿一个样本走完流程有助于建立全局感。假设输入是外国人参政権 6 个字符。第一步,字符级文本编码器对 6 个字符做双向编码,得到每个位置的语境表示。第二步,格子构造器用大词典对该句做匹配,产生外国、人参、政権等长词节点,也产生外、国、人等单字节点,形成多层重叠的格子。第三步,对每个节点,模型取出它覆盖的字符表示切片,同时把它的片假名读音做嵌入与投影,两部分拼接到一起。

第四步,拼接表示经过编码块与以整句表示为键值的解码块融合,池化后得到一个标量节点分数。第五步,所有节点分数相加得到路径分数,推理时用维特比搜索找最高分路径,取出其读音串即为输出。

下面这张格子示例图值得停留阅读,它把上述第二步具体化,展示了同一串字符如何被不同粒度的词同时覆盖。图中顶部是 6 个汉字,中间矩形是词节点,横线是连接边,不同颜色的路径代表不同切分假设。

看图路径: 1. 先从顶部六个汉字找到输入句子外国人参政权的字符顺序;2. 再对比上层长词块与中层单字块的覆盖跨度差异;3. 然后沿黑线、蓝线与绿线分别走一条从左到右的完整路径;4. 最后观察同一字符位置如何被不同切分同时覆盖

原论文 Figure 1:An example of a word lattice (adapted from \\[17\\]).

论文图 1。原论文 Figure 1::“An example of a word lattice (adapted from [17]).”。

这张图说明的核心机制是候选冗余。外国对应 gaikoku,人参对应 ninjin 并标注胡萝卜义,政権对应 seiken;中层是外 gai、国 koku、人 jin、参 san、政 sei、権 ken 等单字读音;下层还有国人 kunito 与参政 sansei 等跨切分节点。黑色、蓝色与绿色边表示不同路径走向。

对于字音任务,只要某条路径的读音串正确,即使它的切分在形态学上不是最优,也被训练目标接受。这正是后文条件随机场把切分边缘化的结构前提。

节点分数如何融合字面语境与候选读音?

节点打分器是全文唯一的神经打分部件。它的输入有两路:一路是整句字符的语境表示,来自初始化自日语 DeBERTa 的字符级编码器;另一路是格子中每个节点的表面形跨度与片假名读音。实现动作是按表面形的起止下标从语境表示中切出对应片段,再把读音序列做嵌入与线性投影到同一维度,然后沿序列维拼接。

拼接后的表示先过两个 Transformer 编码块做双向自注意力,再作为查询进入两个 Transformer 解码块,以整句语境表示为键和值做交叉注意力。解码块的自注意力不使用因果掩码,意味着节点内部与整句信息可以双向流动。最后对融合表示做平均池化加线性投影,得到该节点的标量分数。直观理解是,模型在问这个读音放在这个位置、放在这整句话里是否合适。

词格 × 条件随机场: 词格负责提出所有词典允许的切分与读音组合,解决无监督空间枚举问题;条件随机场负责在整句读音监督下对整条路径打分并边缘化切分,解决只关心读音、不关心切分如何得到读音的训练目标问题;二者搭配使模型只能输出词典可达读音,同时用语境打分区分多音,新增作用是把切分误差不再直接传给读音预测。

下面这张结构图对应上述计算顺序,左侧是字符编码与跨度抽取,右侧是读音嵌入与融合,顶部是池化输出,初学者可按箭头复述一遍数据流。

看图路径: 1. 先沿底部输入字符与格子构造器找到两条并行输入支路;2. 再看左侧语境编码与右侧词面加读音嵌入如何汇合;3. 然后确认解码器块的上下文键值来自整句编码;4. 最后沿顶部箭头确认输出为单个节点分数

原论文 Figure 2:Architecture of the neural node scorer.

论文图 2。原论文 Figure 2::“Architecture of the neural node scorer.”。

这张图的可执行读法是:底部外国内人参政権 6 个字符先进入字符级文本编码器,得到六列语境向量;同时格子构造器给出节点参政及其读音サンセイ,标注跨度为 3 比 5;左侧用跨度抽取取出第 4 到第 5 个字符的向量,右侧把读音嵌入后与抽取向量拼接;拼接块先过编码器块再作为查询进入解码器块,解码器块的上下文键值直接来自左侧整句编码;最上层池化投影输出节点分数。注意解码器没有因果掩码,与自回归生成不同,这里是整句可见的打分。

训练目标如何只监督读音而不监督切分?

训练时把节点分数看作格子有向无环图上的条件随机场。记输入句子为 X,目标整句读音为 Y,全部路径集合为 P,能产生 Y 的有效路径子集为 G。路径分数是其包含节点分数之和。损失是目标读音的负对数边缘似然,即全部路径的对数配分函数减去有效路径的对数配分函数,两项都用格子上的分层前向算法精确计算。因为切分在两项中都被边缘化,目标只关心产生哪个读音,不关心用哪种切分产生。与传统条件随机场不同,这里省略显式转移特征,作者的安排理由是双向编码器与交叉注意力已能捕捉上下文依赖。

第一个公式定义上述全局损失,符号含义是分子分母分别对有效路径与全部路径求指数和的对数差。

\[\mathcal{L}_{\mathrm{crf}}=\log\sum_{\pi\in\mathcal{P}}\exp(s(\pi))-\log\sum_{\pi\in\mathcal{G}}\exp(s(\pi)),\]

第二个公式是针对同跨度竞争的边际损失。对于覆盖相同字符跨度的正确节点与竞争节点,要求正确分数至少高出间隔 m,否则按差值惩罚。若句子中没有此类竞争对,该项记为零。

\[\mathcal{L}_{\mathrm{margin}}=\frac{1}{|\mathcal{C}|}\sum_{(v_{g},v_{c})\in\mathcal{C}}\max\left(0,\,m-\left(s(v_{g})-s(v_{c})\right)\right),\]

第 3 个公式是总目标,为全局损失加权重系数乘边际损失,权重记为 lambda。论文报告间隔 m 设为 2.0,权重设为 0.5。

\[\mathcal{L}=\mathcal{L}_{\mathrm{crf}}+\lambda\mathcal{L}_{\mathrm{margin}},\]

单音词条 × 多音词条: 单音词条指表面形只对应一个读音的词典条目,负责低成本扩大语料覆盖;多音词条指同一表面形对应多个读音的条目,决定消歧上限;搭配理由是先用单音数据学会稳定映射,再用分组校验后的多音数据学会语境区分,组合意义是把标注预算集中到真正需要语境的样本上。

节点分数 × 边际损失: 节点分数是对格子中每个词节点的语境适配度打分,负责给出路径总分的基础;边际损失是对同一字符跨度下正确节点与竞争节点要求拉开间隔,负责强化局部多音区分;搭配原因是全局条件随机场只关心整句读音似然,边际损失补上同跨度竞争的直接监督,组合后既保全局一致又保局部可分。

推理时没有标注,做法是在格子上做维特比搜索找最高分路径并输出其读音。这种训练推理不对称是故意的:训练用边缘似然容忍切分多样性,推理用最优路径给出唯一可执行的读音选择。

两本词典与两类标注数据如何构造?

数据构造是本文工作量最大的部分,需要区分两本词典的不同职责。用于建格子的词典要覆盖优先,作者保留 UniDic 全部条目,并用对齐工具挖掘单字读音,补上只出现在复合词中、未作为独立条目列出的单字读音,例如及读 kyuu。用于大模型标注的词典要准确紧凑,作者按基本形归并活用与音变分散的条目,过滤掉不含汉字的条目与专有名词,再区分为单音与多音条目,以便分别标注。

下表把词典准备的关键规模放在一起比较,阅读时先看用途决定取舍,再看数量级是否支持后文两百多万句的生成量。表中数字与单位保留原文写法,规模列为约数。

用途来源与处理规模构成或增补取舍理由
建格子用词典UniDic 全量保留约 870k 条常用词专有名词符号全含覆盖优先容忍少量噪声
建格子增补对齐挖掘单字读音约 16.6k 条补独立单字条目解决复合词内读音缺独立条目
标注用词典归并基本形并过滤约 151k 条去无汉字去专有名词准确紧凑信息密度高
标注用词典细分区分单音多音约 145k 单音约 6k 多音多音为消歧关键预算向多音倾斜

上表说明的主要收益是结构分工明确:大而全的格子词典保证推理时候选可达,小而准的标注词典保证生成时提示信息密集。具体代价是专有名词被排除在标注之外,论文在局限中承认特定领域专有名词需要额外增强;增补的单字条目也可能引入噪声,但作者认为对覆盖的增益大于噪声代价。未胜出的替代方案是只用一本词典兼顾两职,论文没有采用,理由是覆盖与准确对词典的要求互相冲突。

标注流程分单音与多音两条线。单音每条目生成 15 句并附读音,提供表面形、读音、词性与活用信息,大模型先判断条目是否合法,只对合法条目生成。单音部分先得到约 2.05M 句。多音部分先做校验:评估每个候选读音合法性,把语义几乎相同的读音聚类、写简短释义并指定主导读音,得到约 10.2k 组;再按组生成,每组 30 句,提示中注入校验释义与同形竞争读音,要求构造出母语者能唯一推断目标读音的语境,得到约 306k 句。随后做格子可达性过滤与非主导读音映射,最终得到约 2.04M 单音句与约 303k 多音句。

评测基准、指标与训练条件是什么?

评测用的是常用汉字读音基准的修订版,基于 2136 个常用汉字与 4378 个官方读音,共 13536 个测试句,每句标注目标词位置与读音以及整句读音。修订版修复了原基准的标注错误,并处理目标词多可接受读音的情况。指标有三项:准确率为目标词读音完全命中任一可接受读音的句子占比;目标词音素错误率为目标词假名序列的字符错误率;整句音素错误率为整句读音的字符错误率,后两者封顶 100%。

所有指标去标点按句计算再平均,报告的是宽松准确率与目标词错误率。作者特别说明标注用的大模型早于基准发布,避免测试集泄漏进训练。

目标词准确率 × 句子音素错误率: 目标词准确率只看基准标注的目标词读音是否命中任一可接受读音,负责衡量多音消歧核心能力;句子音素错误率看整句假名序列的字符错误率,负责衡量全句输出的完整代价;搭配原因是前者聚焦难点、后者防止只优目标词而坏整句,组合后能同时看到消歧收益与长尾错误来源。

模型细节按原文交代如下:字符编码器用预训练日语 DeBERTa 并全参数微调,后接映射到 512 维的线性层;读音嵌入 256 维再投影到 512 维;拼接后过两个编码器块与两个解码器块,注意力头 8 个,隐层 512 维,前馈 2048 维,丢弃率 0.1。训练选 5k 句做验证,其余训练,训 10 轮,4 卡 H100,预热占总步数 5%,预训练部分峰值学习率 5 乘 10 的负 5 次方,其余部分 3 乘 10 的负 4 次方,AdamW,批大小 640,余弦调度,权重衰减 0.01,选验证准确率最好的检查点。基线包括形态分析器类的 MeCab 加 UniDic、OpenJTalk、Juman++、Sudachi,以及神经类的 ByT5 小模型、基于同一 DeBERTa 的联结时序分类模型、微调的 Qwen3 零点 6B,还有作为参考的前沿大模型。神经基线中的前两者先在 17,000,000 句日语维基伪标注上预训练 15 轮,再在同一大模型标注数据上微调 10 轮。

下表把生成规模与过滤比例放在同一行,便于核对数据量从毛量到净量的变化,表中百分号与约数保留原文表述。

数据分支每单位生成量毛量规模过滤或映射比例净量规模
单音分支每条目 15 句约 2.05M 句约 0.76% 不可达过滤约 2.04M 句
多音分支每组 30 句约 306k 句约 0.88% 不可达过滤约 303k 句
多音校验每表面形分组校验约 10.2k 组约 0.06% 需映射无无效读音残留

上表之后需要明确公平条件:后文所有神经基线微调都用同一批大模型标注数据,因此主结果的差距主要来自结构与解码方式,而非数据量差异。但预训练条件并不完全一致,联结时序分类与 ByT5 多了 1 阶段维基伪标注预训练,这对它们是有利条件,若它们仍落后,则更支持格子约束的增益。未评测的边界是阿拉伯数字、拉丁外来语、单位与数学表达式,论文明确说这些更适合上游文本归一化模块。

主结果在什么条件下比过了谁?

主结果的问题是:在只允许输出词典可达读音的条件下,语境打分模型能否同时超过传统分析器与无约束神经模型,并接近标注它的大模型。比较条件是同一常用汉字读音基准,指标方向为准确率越高越好、两项错误率越低越好。论文报告本方法达到 99.62% 目标词读音准确率、0.32% 目标词音素错误率与 0.14% 整句音素错误率。原文同时给出前沿大模型与传统方法的对照,以及甲骨文上限:选与真值最接近的格子路径可达 100.00% 准确率与 0.00% 目标词错误率,说明格子覆盖对汉字不是瓶颈,剩余整句 0.01% 错误主要来自阿拉伯数字。

具体对照需要回到原文表格。传统方法中 Sudachi 在目标词上相对最好,但论文举例米の収穫時期中 Sudachi 把米误读为 bei 而非更合适的 kome,说明局部特征难以处理语境多音。神经基线中 ByT5、联结时序分类与微调小指令模型的目标词准确率在 98% 区间,落后本方法约 0.8 到 1.5 个百分点,且会出现词典外幻觉读音。参考大模型方面,本方法与 Gemini 3.1 Flash 相当,接近其数据生成器 Gemini 3.1 Pro,但仍低于 GPT-5.6-Sol 报告的 99.85%。因此论文的表述是显著超过以往方法、与部分前沿大模型相当,而不是全面超过所有大模型。

从可部署角度看,大模型参考基线每次评估跑 3 次取平均且需要高推理努力设置,而本方法是格子维特比解码的专用小模型,输出空间受约束。原文未报告延迟与成本数字,所以不能从准确率推定推理更快或更便宜,这是待验证项。另一个限制是该基准聚焦常用汉字读音,专有名词与数字归一化不在主指标内,实际系统仍需外挂模块。

去掉边际损失或换主干会发生什么?

消融要回答两个可操作问题:同跨度边际损失是否只影响目标词而不影响整句,以及主干容量多大才够用。公平条件是同一基准、同一训练数据与同一格子,只改损失或只换 DeBERTa 规模。指标方向与主结果一致。下表直接选用原文消融表,首行为表头,其后为数据行,数字为裸值、单位在表题中交代为百分比。

MethodAccuracyTarget PERSentence PER
w/o margin loss99.530.430.15
DeBERTa-tiny99.340.540.19
DeBERTa-base99.620.320.14
DeBERTa-large99.610.330.13

表后解释需要区分两类效应。去掉边际损失后,准确率从 99.62% 降到 99.53%,目标词错误率从 0.32% 升到 0.43%,而整句错误率仅从 0.14% 变为 0.15%。这支持边际损失主要改善同跨度多音区分,而对整句影响很小的判断。主干方面,从基础版降到微型版时三项指标全面变差,准确率降到 99.34%,说明容量不足会损及语境表示;从基础版升到大版时整句错误率从 0.14% 微降到 0.13%,但准确率与目标词错误率略变差。

作者的有限解释是当前数据规模下基础版已提供足够语境表示,属推测性解释,应用可能一词表达。未胜出项是 DeBERTa-large,它没有在核心目标词指标上带来收益,却增加计算成本,因此论文选择基础版作为性能与效率的平衡点。负结果本身也有教学价值:并非越大越好,数据规模与任务粒度共同决定容量收益。

哪些情况本文方法不适用?

论文明确列出两项局限。第一,词典过滤时排除了专有名词,因为专有名词语境无关性强、同一表面形常有多个同样合理的读音,标注歧义大、成本高。这意味着人名、地名与领域术语的读音需要针对性数据增强,不能指望当前模型直接泛化。第二,格子管线聚焦汉字读音,对阿拉伯数字、拉丁外来语、单位与数学表达式不擅长,这些更适合上游文本归一化模块处理。甲骨文分析也佐证这一点:即使选最优格子路径,整句仍残留 0.01% 错误,主要来自阿拉伯数字。

初学者常见的误解是把格子覆盖上限当成可部署收益。100.00% 准确率的甲骨文是事后选最接近真值的路径,不是可运行策略,不能与 99.62% 的维特比解码直接比较。同理,前沿大模型的分数是在高推理努力与多次运行平均下得到的参考值,不是同等成本下的对照。复述时应保留这些条件,避免把参考上限说成实际增益。

要复现需要准备哪些数据、代码与权重?

复现先做三件事:词典、标注提示与评估基准。词典方面,原文基于 UniDic 约 870k 条目,格子用全量加约 16.6k 单字增补,标注用归并过滤后的约 151k 条目。标注用的大模型是 Gemini 3.1 Pro 并设高思考级别,单音每条目 15 句、多音每组 30 句,提示需包含表面形、读音、词性、活用属性,多音还需注入校验释义与竞争读音。评估用修订版常用汉字读音基准,共 13536 句,代码库提供宽松准确率与两项错误率计算,去标点按句平均。

模型方面,字符编码器初始化自日语 DeBERTa 基础版并全参数微调,其余模块从零训练,关键超参数为间隔 2.0、权重 0.5、批大小 640、10 轮、余弦调度。基线中的形态分析器可直接运行,神经基线需要先在维基伪标注上预训练再微调。资源状态是正文开源声明的唯一依据:本次收到的资源中,修订版基准数据集当前可用,维基工具数据集当前可用,日语 DeBERTa 权重当前可用,Gemini 系列第三方模型页面当前可用,GPT-5.6 系列页面本次链接当前不可用。不可用不代表论文未做实验,只代表按本次核验无法通过该链接复核其当前可达性。

还需补的验证包括:格子构造的具体匹配规则与符号处理、过滤后数据的可达性检查脚本、维特比实现的效率,以及在专有名词与数字归一化上的端到端评测。原文未报告训练时长、推理延迟与显存占用,因此复现报告应单独测量这些量,不从准确率推定效率。

何时值得尝试这个方案?

当任务同时满足 3 个条件时值得尝试:语言无显式切分、读音高度依赖上下文、且有词典可以枚举合法候选。此时用词典格子约束输出空间、用整句编码做选择,比纯序列生成更稳;用整句读音监督加切分边缘化,比要求逐词对齐的标注更便宜。本文的证据支持在常用汉字读音上达到 99.62% 准确率并接近标注它的大模型,同时消融支持边际损失对目标词的增益。

不值得盲目照搬的情况包括:目标含大量专有名词、数字与外来语而无归一化模块;词典覆盖不足导致正确读音不可达;或推理预算只允许极小模型,此时微型主干的退化已有实测。下一步验证应是补上专有名词增强集、数字归一化前处理,以及延迟与成本测量,再谈系统级收益。

📎 论文与评分元数据

排名:前25% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-18 语音/音乐/音频论文速递