英文题目:IPA-Guided Dual Transcription for Data-Centric Speech Corpus Refinement

会议身份:conference:interspeech:2026:conference-paper-id:choi26f_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据清洗 #SFT #语音 #语音识别

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jeong-Ju Choi:机构信息未能从会议 PDF 纯文本可靠映射
  • Young-Ik Kim:机构信息未能从会议 PDF 纯文本可靠映射
  • Jin NamGoong:机构信息未能从会议 PDF 纯文本可靠映射
  • Jaeyeon Jang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

高质量语音语料需要口语实现与书面规范的一致对齐,但两者是多对多映射,同一书面形式可有多种口语实现,同一发音也可对应多种写法,日期数字等仅凭文本上下文本质欠定。本文提出数据为中心的两阶段流水线,先由音素中间条件 Phoneme Intermediate Conditional / PIC 语音转文本模型从音频单次前向同步输出国际音标 International Phonetic Alphabet / IPA 与正字法文本,再由微调大语言模型 Large Language Model / LLM 以两者为联合条件生成固定格式的书面口语二元组,前者提供发音锚点,后者负责上下文推理与格式统一。与纯文本归一化相比,该机制把实际发音作为额外约束,在书面歧义处实现可验证消歧,并支撑噪声或领域语料的迭代提纯。在 Google TN 抽取的 1000 条合成语音诊断评测上,所提方法句子准确率 88.7%,数字错误率 4.7%,优于 Duplex 基线的 81.9%与 10.2%。在 100 小时 YouTube 韩语牙科语料清洗版 KDSC V2 上微调后,牙科集误差从基线 16.9%降至 5.1%,数字集从噪声版微调的崩溃中恢复。该结论适用边界受限于英语合成语音诊断评测与韩语牙科单一领域,尚未验证对自然口语多说话人与多领域泛化的有效性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,学完要能复述什么?

这篇解读的输入是论文正文证据与一张系统结构原图像素,目标是让刚进入语音领域的研究生能复述方法与实验条件。必须保留的信息包括任务定义、2 阶段结构、训练数据的来源与规模、评测协议的构造方式、主结果数字与适用边界。输出是 1 篇按学习依赖展开的技术讲解,不做超出证据的效果承诺。

语音语料建设的核心矛盾是嘴上说的和纸上写的不一一对应。论文举的例子是书面 01/05 可以读成 January fifth,也可以读成零一斜杠零五,还可以读成 the fifth of January,反过来发音同样可能对应 please、pls. 或 plz. 等多种写法。如果语料里有时存书面、有时存口语,或者把两者混在一起,识别模型学到的映射就会抖动,合成模型也会拿到不一致的目标。

为此论文把每条语料的要求明确为同时给出两种表示。先用白话说清楚,口语文本是实际发音的记录,论文用国际音标来承载它,书面文本是给人读和给系统做输入输出的标准正字法形式。语料精炼的目标就是得到可靠且一致的口语与书面配对,让后续识别与合成都能用上干净对齐。

口语文本 × 书面文本: 口语文本负责记录实际怎么读出来,例如用国际音标记录发音细节,书面文本负责记录按阅读习惯怎么写,例如 01/05 这样的标准写法,二者搭配的原因是同一书面常有多种读法、同一读法也可有多种写法,只有同时保留两者才能在建库时判断对齐是否一致,组合意义是把语料质量问题从单个转写错误变成可检查的口语与书面配对问题。

学完这篇解读,你应当能复述一个样本如何从音频变成两条文本,再变成 1 对规范化双文本,以及英语与韩语两组实验分别在什么条件下测了什么。凡是教学用的举例都会标为例子,不把例子当作论文报告的数值。

已有路线在同输入同目标下各自缺了哪一块?

在相同输入与相同目标下做对照,才能看清本文的位置。端到端识别路线用从语音经音素层到词层的层级编码器,中间用子词或音素目标做条件约束,报告显示这能改善识别性能,但它主要解决声学到文本的建模,不直接产出可用于建库的口语与书面配对。

文本规范化路线包括基于规则的加权有限状态机、加权有限状态机加语言模型打分,以及用大语言模型做规范化。大语言模型路线比纯文本规则有所改进,但它只看文字,不知道这句话当时是怎么读出来的。遇到日期、数字分组、缩写这类一文多读的情况,仅靠上下文仍然欠定。

与本文最接近的是同时输出口语与书面双文本的语音转文本工作,它通过联合训练与双文本微调证明优于级联系统。但论文明确指出区别在于那条路线没有把识别器输出的发音流喂给下游模型做消解。本文的关键差异是把识别器产生的国际音标作为大语言模型的主要条件信号,使生成既利用上下文推理,又被实际发音锚定。

因此相关工作不是谁分数更高的问题,而是信息条件不同。只给文字的规范化器缺发音证据,只给音频的识别器缺成对的规范化输出格式,本文用 2 阶段把两者补齐,并强调该管线可重复用于语料精炼。

要解决的歧义如何形式化为可测任务?

论文把中心问题定义为以数据为中心的语音语料精炼,也就是为每段音频得到可靠的口语与书面配对。形式化地说,给定原始正字法序列与对齐的国际音标序列,大语言模型的目标是生成规范化输出序列,论文用条件概率的最大化来描述,即在给定原始文本与国际音标以及参数的条件下选择概率最高的输出。

输出格式被固定为书面斜杠口语的双文本表示,例如右侧示例把 I just bought an RTX 4090 与 R T X forty ninety 配对。论文主要评测书面到口语方向,同时说明同一框架可用不同提示做口语到书面方向,例如把 one four three zero 映射到规范书面 1430,日期 12/08 则可能对应 December eighth 或 twelve oh eight。

可测性来自 2 个任务。英语任务测文本规范化能否从有歧义的书面恢复正确的口语,韩语任务测用精炼后语料微调领域识别模型能否降低领域测试集误差。2 个任务都要求说明数据来源、基线条件与指标方向,否则无法判断收益来自方法还是来自数据与评测方式的变化。

两阶段管线如何从音频走到双文本?

整个系统分两段。第一段是音素中间条件音频编码器,它从单段音频 1 次前向同时输出国际音标流与正字法文本流。第二段是大语言模型,它同时读入这两路输出,再按任务指令生成包含书面与口语的双文本。发音流不是辅助输出,而是消解歧义的主要条件信号。

沿一个样本走一遍更容易理解。以图中 I just bought an RTX 4090 为例,音频先进入编码器层叠,中间层输出对应的国际音标,顶层输出原始正字法文本,两者进入大语言模型后,模型按使用国际音标生成口语形式、规范化英文书面、其余词保持不变的提示,输出书面斜杠口语的配对。教学例子到此为止,具体数值与效果以实验节为准。

下面这张原图是理解分工的关键,先看主路径再看分支汇合,图中文字较多时重点看箭头指向与模块归属。

看图路径: 1. 先从底部音频输入向上追踪经过第 1 层、第 K 层到第 N 层的编码器主路径;2. 再对比子词 CTC 与音素 CTC 两个分支分别输出原始文本与国际音标的位置;3. 接着看两路输出如何作为原始文本与发音证据同时进入大语言模型;4. 最后确认用户提示中的三条约束与右侧书面斜杠口语双文本输出格式

原论文 Figure 1:Proposed dual transcription system integrating a phoneme intermediate conditional audio encoder…

论文图 1。原论文 Figure 1:“Proposed dual transcription system integrating a phoneme intermediate conditional audio encoder and a large language model.”。

从像素可见,左侧是编码器单层细节与层叠结构,中间是两个连接时序分类解码输出,右侧是大语言模型与双文本输出。左侧单层框显示多头注意力、加残差与归一化、前馈等组件构成一层,层叠从第 1 层经第 K 层到第 N 层,音频从底部进入。中间框明确分为子词分支输出原始英文文本与音素分支输出国际音标,两路箭头分别标注原始文本与国际音标进入右侧大语言模型。

大语言模型框内可见骨干与低秩适配器,以及训练时更新的标注,下方框给出监督微调与奖励引导精炼 2 个阶段,底部用户提示框列出 3 条约束,右侧最终输出为书面斜杠口语格式。该图支持的判断是发音证据与文本证据在进入大语言模型前是分离的两条流,消解发生在语言模型内部,而不是在识别器内部完成。

音素中间条件 × 双文本转写: 音素中间条件分工是在编码器中间层先预测国际音标并把该信息回注给后续层,让声学表示带上发音约束,双文本转写分工是让大语言模型每次同时输出书面形式与口语形式,二者搭配的原因是仅有正字法时日期数字缩写无法唯一确定读法,而有了识别器给出的发音流就能锚定生成,组合意义是形成从音频到发音再到规范化配对的可重复管线。

编码器中间层如何同时学会发音与文字?

编码器基于 Conformer 结构,标准 Transformer 编码器层由自注意力与前馈组成。论文给出第 i 层的计算是先对上一层输出做自注意力加残差,再做前馈加残差,最终层表示通过连接时序分类损失对到目标序列。初学者可以这样记,残差保证信息不丢失,连接时序分类解决语音帧与文本符号长度不对齐的问题。

音素中间条件是关键改动。在第 k 层增加一个中间连接时序分类头预测国际音标音素序列,把该层的音素后验经线性投影后加回第 k 层表示,再送入后续层继续处理。最终第 N 层预测子词正字法序列。训练目标是两者损失等权相加,一项对应音素目标,一项对应子词目标。子词目标来自书面文本经句子切分工具得到,音素目标来自口语文本经发音工具得到。

这样 1 次前向得到两条对齐的流,发音流来自中间层,文字流来自顶层。下游大语言模型正是使用这两条流做消解。论文还指出训练时国际音标序列来自发音工具,推理时来自该编码器,这意味着声学证据不需要额外提供原始音频给语言模型,而是经由识别器转写后的发音序列传递。

文本规范化 × 逆规范化: 文本规范化分工是把书面转成口语,例如把 12/08 转成 December eighth,逆规范化分工是把口语转成规范书面,例如把 one four three zero 转成 1430,二者搭配的原因是语音识别训练需要口语对发音、语料整理需要书面做统一入口,组合意义是用同一套书面斜杠口语格式同时服务识别与合成两侧的对齐需求。

该组件的常见误解是把中间音素头当成可有可无的正则项。按原文安排,它的输出在推理时会被实际使用,是第二阶段的条件输入,因此它的质量直接影响消解效果,而不是只在训练时起作用。

大语言模型如何把两路输入变成固定格式?

第二阶段采用大语言模型做双文本生成。输入是原始正字法序列与对齐的国际音标序列,输出是同时包含书面与口语的双文本表示。提示明确要求用国际音标生成口语形式、规范化英文书面、其余词保持不变。输出用确定性解析校验,无法解析的在建库时保守丢弃或回退,这保证了语料管线的可重复性。

骨干是 Gemma-3 27B,用高效微调框架做 4 比特量化下的低秩适配。论文采用 2 阶段微调,先做有监督微调,用成对的原始文本加国际音标例子对齐格式,再用组相对策略优化,用格式与内容一致性奖励提高鲁棒性。论文指出仅提示的方法在日期数字等歧义处不稳定、输出不稳定,2 阶段微调正是为了解决数值丰富与上下文敏感表达的确定性问题。

论文还讨论了互补关系。纯文本后处理例如生成式纠错或领域词表偏置,主要靠周围词与提示推断意图,在一文多读或同音多写时仍然欠定。本文用语音信号预测的国际音标提供发音接地,作为生成的额外约束,实际使用时也可与领域词表偏置结合。

有监督微调 × 组相对策略优化: 有监督微调分工是先用成对的原始文本与国际音标例子教会模型输出固定双文本格式,组相对策略优化分工是用格式与内容一致性奖励进一步提高在数字日期等敏感表达上的鲁棒性,二者搭配的原因是仅提示常在歧义处不稳定、仅监督微调仍可能格式漂移,组合意义是先对齐格式再用奖励约束确定性行为。

需要强调的是大语言模型微调只用文本与国际音标配对,不用合成音频。声学信息已经由第一阶段转成发音符号,语言模型看到的是符号化的发音证据,这也是该方法能用纯文本数据训练第二阶段的原因。

两段模型分别用什么数据与更新方式训练?

语音转文本模型的训练在 LibriSpeech 训练集上进行,子词词表与国际音标单元数分别报告为 8k 与 125。编码器由 2048 隐单元与 512 输出维度构成,共 12 层 Conformer 层,其中第 9 层预测国际音标序列,第 12 层预测子词序列,两项均用连接时序分类损失,权重相等。韩语实验的基线与音素中间条件模型在 KSponSpeech 训练数据上按相同条件训练,论文未报告学习率与优化步数等细节,这是复现时需要补看代码或附录的缺项。

大语言模型的监督微调使用从 Google 文本规范化训练集随机抽取的 10k 样本,输入为文本与发音工具给出的国际音标配对,不使用合成音频。论文未给出低秩秩数、量化位宽之外的训练轮数与奖励函数的完整公式,只说明奖励关注格式与内容一致性。因此梯度路径与参数冻结范围只能按证据说到低秩适配器在训练时更新、骨干量化高效微调为止,不从模型名称推定全部参数更新。

韩语语料精炼流程是先有 100 小时来自 YouTube 的牙科领域原始语料,该语料由半自动转写得到,存在正字法不一致与领域术语错位。例子显示原始记录把 Canal Filing 误写为 Canal Filing 的拼写变体且缩写处理混乱,经双文本管线后得到 Canal Filling 与캐널필링、CF 与씨에프的书面斜杠口语配对。精炼后的 KDSC V2 用于微调,书面直接做文本,口语转成音素序列参与训练。

连接时序分类损失 × 监督微调: 连接时序分类损失分工是在无需逐帧对齐的情况下把编码器表示对到音素序列或子词序列,监督微调分工是把大语言模型对到成对的原始文本加国际音标输入与双文本输出格式,二者搭配的原因是前者解决语音侧两条流的对齐学习,后者解决文本侧歧义消解的格式学习,组合意义是分别保证发音证据可靠与规范化输出稳定。

训练与构造的边界要分清。编码器训练与大语言模型微调是参数更新阶段,语料精炼与合成评测语音生成是数据构造与诊断评测阶段,论文对后者有单独的协议说明,不能把构造数据的计算量与模型训练混为一谈。

英语评测的语音从哪来,指标各测什么?

英语实验比较书面到口语的文本规范化。基线包括传统规则加权有限状态机、加权有限状态机加语言模型打分、NVIDIA 的 Duplex 神经模型,基线实验使用 NeMo 开源框架。被测方法是音素中间条件编码器加微调大语言模型的双文本方案。

由于公开的文本规范化数据集缺少自然语音与口语书面真值配对,论文采用受控诊断协议。从 Google 文本规范化测试集随机抽 1000 条,用数据集提供的参考口语形式作为多说话人语音合成系统的输入,合成评测语音,随机从 110 个说话人中每句选一个以避免单说话人伪影,再用本文语音转文本模型从合成波形提取国际音标上下文。该协议测的是给定实际口语实现时发音接地能否帮助恢复正确规范化,不是真实声学多变性下的识别性能,论文明确将在未来用自然口语数据验证。

指标共 4 个。句子级准确率测整句完全正确的比例,越高越好。词错误率测词级错误,越低越好。F1 在词元级衡量生成与参考之间精确率与召回率的调和,越高越好。数字错误率专门衡量数字类表达式的错误率,越低越好,论文把包含日期、基数、十进制、金额、序数、时间、数字、电话、分数共 9 类语义标签的词表项归为数值表达式。硬件与实现方面,结构图标注训练更新在 RTX 4090 级别设备上进行,韩语识别实验使用 WeNet 2.0,音素中间条件模型实现基于 ESPnet2 示例代码。

资源可用性方面,本次收到的证据中未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码模型或数据已公开,只能按论文文字交代所用开源框架与数据集名称。

韩语领域实验的基线与测试集如何划分?

韩语实验聚焦牙科领域,公共预训练数据未覆盖该领域时的性能退化是动机。比较 4 种语音识别方法。基线是 12 层 Conformer 编码器,在公开韩语 KSponSpeech 上训练。音素中间条件模型在相同条件下用相同数据加中间条件训练。第三种是在原始 KDSC 上微调的音素中间条件模型,第 4 种是在精炼后 KDSC V2 上微调的同结构模型。

测试集分三块。KSpon 是公开评测集,用字错误率评估通用领域。KDent 是来自 YouTube 的牙科领域集,KDigit 是包含韩语数字语音的集,后两者用词错误率评估。这种划分使通用能力、领域术语能力与数字表达能力被分开测量,避免用单一指标掩盖领域退化。

数据质量是解释结果的关键。原始 KDSC 含大量转写错误,论文认为直接在它上面微调会引入错误监督,而 KDSC V2 经双文本管线得到更一致的书面与口语配对。训练时书面直接做文本,口语转成音素序列,这与英语阶段音素目标来自发音工具的安排一致,只是此处口语来自管线输出而非人工标注。论文还提出迭代精炼设想,即用适配后模型重处理领域音频得到 KDSC V3 再训练,但未报告多轮系统实验,因此只能记为待验证方向。

英语规范化在可比条件下赢在哪里?

比较问题是,在相同 1000 条合成语音诊断集上,以句子准确率、词错误率、词元 F1 与数字错误率为指标,本文方法是否一致优于可运行的规则与神经基线。公平条件是所有方法面对同一批书面输入,而本文方法额外拥有从合成语音提取的国际音标作为发音证据,这正是要验证的信息增益,不是隐藏的不公平,但解读时必须说明该增益依赖语音输入的存在。

条件指标WFSTWFST 加语言模型Duplex本文方法
Google 文本规范化诊断集句子准确率越高越好80.879.681.988.7
Google 文本规范化诊断集词错误率越低越好5.476.124.822.73
Google 文本规范化诊断集词元 F1 越高越好0.9630.9590.9710.981
Google 文本规范化诊断集数字错误率越低越好18.719.610.24.7

表后解释需要同时给出收益与代价。论文报告显示本文方法在四项指标上均优于最强基线 Duplex,数字类相对错误下降按论文计算为 53.9%,支持发音信息消解了一文多读歧义的判断。代价是该收益在受控合成语音上测得,合成输入是参考口语而非歧义书面,且说话人随机采样仍不代表真实口音噪声与信道变化,因此不能推广为自然语音下的同等提升。未胜出项也值得注意,加语言模型的加权有限状态机在句子准确率与词错误率上反而不如纯规则版本,说明语言模型打分并未在该诊断条件下带来稳定增益,这也提醒比较时不能默认更复杂的基线一定更强。

韩语精炼语料是否经得起反例检验?

比较问题是,同一音素中间条件结构下,用原始领域语料微调与用精炼后语料微调,在通用集、牙科集与数字集上的表现是否分化。公平条件是两者起点同为音素中间条件模型,区别仅在微调语料是 KDSC 还是 KDSC V2,指标方向均为越低越好。

条件指标基线音素中间条件加原始 KDSC 微调加 KDSC V2 微调
KSpon 通用集字错误率越低越好8.878.757.717.65
KDent 牙科集词错误率越低越好16.916.730.35.1
KDigit 数字集词错误率越低越好14.910.189.212.2

表后解释要突出反例的价值。论文报告显示仅加音素中间条件已有温和一致改进,与引用的中间条件文献趋势一致。关键反证是直接用原始 KDSC 微调的模型在通用集上看似变好,但在牙科集恶化到 30.3,在数字集恶化到 89.2,说明噪声语料的错误监督在领域与数字上危害极大。用 KDSC V2 微调后牙科集降到 5.1,数字集降到 12.2,论文给出相对基线在牙科与数字上分别下降 69.8% 与 18.1%,支持高质量发音信息对领域适配重要的判断。但数字集上音素中间条件未微调模型的 10.1 仍优于 KDSC V2 微调后的 12.2,这是一个未胜出细节,说明领域微调在提升牙科术语的同时并未在所有数字表达上保持最优,迭代精炼与多轮验证仍有必要。

哪些边界会让结论不再成立?

第一个边界是英语评测的语音来源。论文在结论与方法中 2 次承认使用语音合成而非公开自然语音语料,原因是缺少配对自然语音与口语书面真值的数据集。这意味着发音证据的质量是在干净合成条件下测得的,真实口音、噪声、重音与识别错误会同时污染国际音标流,消解收益可能缩小。论文明确该协议是受控诊断,不建模真实识别多变性。

第二个边界是语言与领域覆盖。主体实验是英语,韩语只展示了牙科与数字两个领域,多语言与多领域的扩展被列为未来工作。计算效率优化也被列为未来工作,论文未报告延迟、推理开销与输出帧率,因此不能承诺该 2 阶段管线在部署时更快或更便宜。

第三个边界是迭代精炼尚未验证。从适配后模型重处理音频得到 KDSC V3 再训练的循环只是自然延伸,论文明确把系统性多轮分析留给未来工作。把总体趋势推广为每轮必提升是不成立的,需要补做多轮语料质量与领域鲁棒性的联合测量。

要复现应当先准备什么,再核对什么?

复现先做数据与协议还原。英语侧需要 Google 文本规范化训练与测试划分、10k 监督微调抽样方式、1000 条诊断抽样种子、多说话人语音合成配置与 110 个说话人采样方式,以及 9 类数值标签的数字错误率统计口径。韩语侧需要 KSponSpeech 训练与评测划分、100 小时 YouTube 牙科音频的采集与半自动转写流程、KDent 与 KDigit 的构建方式,以及字错误率与词错误率的聚合对象。

再核对模型配置。编码器侧核对 12 层中第 9 层为音素头、子词与音素单元数、隐单元与输出维度、等权损失实现,以及发音工具与句子切分工具版本。大语言模型侧核对骨干版本、低秩适配与 4 比特量化设置、有监督微调与组相对策略优化的样本格式、提示 3 条约束与双文本解析规则。论文报告的超参数只到上述粒度,优化器与奖励细节缺失时应先按开源框架默认跑通,再做对照。

运行阶段注意信息条件。训练大语言模型时只用文本与发音工具给出的国际音标,不用音频。评测英语时必须先合成语音再用语音转文本模型提取国际音标,不能直接把参考口语当作发音输入,否则会高估。韩语微调时书面直接做文本、口语转音素,评测时通用与领域指标不可混用。

关于可运行性,证据中没有完成网络可达验证的资源绑定,因此只能说论文提及 NeMo、WeNet 2.0、ESPnet2 示例、发音工具与合成工具等名称,不能声称本研究的代码权重或数据当前可用或已公开。

何时值得尝试这种发音锚定的建库方法?

当语料同时满足 3 个条件时值得尝试。第一,书面存在系统性一文多读,例如日期金额电话与缩写密集。第二,有办法获得可信的发音实现,无论是领域音频经识别器转写的国际音标,还是受控合成的参考口语。第三,下游同时需要口语对发音与书面做统一入口,例如识别与合成共用语料。只有文本而无语音时,该方法的信息增益无从发挥,此时纯文本规范化或词表偏置可能是更省的选择。

复现的最小闭环是先在小规模诊断集上验证发音证据是否改变歧义样本的输出,再用精炼前后语料分别微调同一领域模型并分开报告通用、领域与数字指标,最后检查无法解析输出的丢弃率与回退策略是否引入选择偏置。若只看平均指标而不看数字类与领域反例,容易误判语料质量。

还需补的验证包括自然语音下的发音鲁棒性、多轮迭代是否单调改进、以及训练与推理成本的完整预算。论文的直接报告支持发音接地带来消解收益,有限解释支持该收益可用于领域语料建设,但能否推广到多语言自然语音仍是待验证推测。理解这 3 层区别,才能把该框架用在正确的位置。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总