英文题目:Towards Efficient Simultaneous Inverse Text Normalization with Pretrained Text-to-Text Language Model and Read-Tag-Write Policy

会议身份:conference:interspeech:2026:conference-paper-id:hoang26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#端到端学习 #高效推理 #预训练 #流式处理 #语音识别

评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Kiet Anh Hoang:机构信息未能从会议 PDF 纯文本可靠映射
  • Khanh Le:机构信息未能从会议 PDF 纯文本可靠映射
  • Bao Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
  • Linh Pham:机构信息未能从会议 PDF 纯文本可靠映射
  • Dung Vo:机构信息未能从会议 PDF 纯文本可靠映射
  • Thai Tran:机构信息未能从会议 PDF 纯文本可靠映射
  • Mai Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
  • Tri Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
  • Vu Le:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

流式逆文本归一化需将流式语音识别输出的口语形式实时转为带标点大小写及半符号与语音学变换的书面形式,难点在于缺失未来上下文时难以消歧且大量照抄词不容扰动。第一步由基于预训练EnViT5的块式因果编码器以动态右上下文掩码逐块读入并缓存历史隐状态,其输出直接送入联合B-I-O标注器判定变换边界。第二步读标注写策略消费标注序列,对O词直接透传输出,仅当遇到B或O确认B-I跨度完结时才将该跨度连同左文打包触发解码,连续多跨度合并一次解码以摊薄开销。第三步解码器以受限交叉注意仅关注跨度结束位置之前的前缀并经前缀截断增强学会局部终止,其生成结果经复制粘贴与键值缓存复用历史,与同时机器翻译全局重排不同,该设计利用ITN局部保序避免冗余重生成。在越南语自建 5M 测试集上流式模型书面错误率(Word Error Rate, WER)为 4.18%,相对混合流式基线 8.27% 提升约 1.98 倍并接近非流式基线 3.63%。适用边界限于越南语新闻域、块 3至5加前视 1至2、贪婪解码,罕见外来实体仍易幻觉,长跨度需等完结才输出,275M 参数端侧部署未验证。原文未披露训练时长与部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,哪些信息必须保留?

这篇论文的输入是流式语音识别已经吐出的口语词流,形态是小写无标点且数字被展开为单词。目标输出是可直接阅读的书面形式,需要恢复逗号句号问号感叹号,恢复大小写,并把数字日期时间分数货币与电子地址等折叠回规范写法。

必须保留的信息是原始词序与未改写词的原样,因为多数口语词与书面词逐词相同。教学例子是把数量加货币的口语短语转为符号加数字,论文用此类例子说明上下文消歧,但不把该例数值当作越南语性能承诺。

逆文本规范化 × 流式推理: 逆文本规范化分工是把口语词流转写为书面形式,恢复标点大小写并折叠数字时间等表达;流式推理分工是按块即时输出而不等整句。搭配理由是直播与会议转写必须边听边写,组合意义是把全局改写拆成局部跨度判定,只对需改写跨度调用生成。

离线方法可以等整句到齐再做全局注意力,流式则必须在块到达时就决定输出。工业级联后处理稳定但难联合处理结构与语义歧义,混合式能保住不变词却依赖人工语法。端到端可直接从数据学习映射,但标准编码器解码器依赖全局交叉注意而无法增量处理。

同输入同目标的已有路线有何取舍?

第一条路线是离线端到端,把整句口语映射为书面句,多语言表现强且可压缩。它的代价是会产生流畅但改变原意的幻觉,且整句等待带来延迟。

第二条路线是流式混合式,用组块标注器检测类别再调类别相关有限状态机转换。它保住不变词的效果好,已有用预训练模型处理可变块的工作,但仍需人工规则与大量标注。

第三条路线是同时翻译中的读写法,如固定延迟等待与单调注意力。它们解决全局重排序与延迟冲突,而逆规范化基本保序且变换局部。论文报告照搬固定等待会造成冗余计算,因此选择用轻量边界信号协调编解码。

为什么预训练序列模型不能直接流式?

论文采用的越南语基础是双语 EnViT5,编码器解码器各 12 层,隐维度 768,注意力头 12 个,前馈中间维度 2048,总参数约 275M。它在 80 GB 过滤网页语料上做跨度破坏预训练,词表是 50048 的句子片段模型。

直接使用的第一个障碍是编码器双向全局注意,新词到达会改变旧表示而无法复用。第二个障碍是解码器习惯在整句源表示上生成,局部截断时不知何时停止。第三个障碍是对每个词都生成会重写大量照抄词,既慢又易幻觉。

论文把问题形式化为读入块、标注边界与按需写出 3 阶段决策。关键约束是交叉注意只能看到完备跨度为止的编码状态,不能用前瞻影响当前变换。另一个约束是高并发长句下编码器必须增量,解码器只在必要时触发。

一个样本如何走完读标写全程?

先沿一个越南语样本走完全程,底部输入是小写无标点的词序列。流式编码器按块读入,借助缓存历史与有限前瞻算出隐状态并拼接到全局序列。联合标注器对新块每位置输出开始内部外部之一。

若标签为外部,系统直接把原词送到输出,实现逐词透传。若出现开始加内部构成的跨度,系统继续读,直到下一标签为开始或外部或句界才判定完备。此时解码器被触发 1 次,交叉注意限定到跨度末尾,并以已生成书面前缀为条件生成局部片段直到局部结束符。

以下导读先看整体 3 层布局,再看跨度完备触发与两条输出路径分工,最后看解码器条件与注意力限制,这是理解精度延迟权衡的总图。

看图路径: 1. 先沿底部口语词流找到流式编码器与注意力掩码小图;2. 再看中间标注器输出的红色开始与内部标签如何框出跨度;3. 对比顶部绿色透传与粉色选择性解码两条路径的汇合

原论文 Figure 1:Overview of the proposed streaming end-to-end ITN framework using the Read–Tag–Write policy.

论文图 1。原论文 Figure 1:“Overview of the proposed streaming end-to-end ITN framework using the Read–Tag–Write policy.”。

图 1 底部是流式编码器与输入词流,中部是标注器,顶部是输出层,右侧是自回归解码器。图中灰色表示历史,黄色表示当前块,绿色表示外部标签的直接透传,粉色表示开始内部跨度的选择性解码。注意力掩码小图呈分块对角结构,说明历史全可见而未来受限。解码器一侧标出交叉注意只到跨度末尾隐状态,并以已生成前缀为条件,虚线表示完备才触发。

编码器标注器解码器各自算什么?

流式编码器训练时块大小在 1 到 5 之间变化,前瞻在 0 到 2 之间变化,始终保留全部左侧历史。这种掩码模拟实时受限未来,使推理在不同延迟下鲁棒。输入经受掩码约束的变换器层得到隐状态,标注器是隐状态上到 3 类的线性投影。训练时通过变化块与前瞻组合反复暴露截断边界,使同一模型能适应零前瞻的因果执行与少量前瞻的低延迟执行,历史表示则通过缓存复用避免重复编码。

动态右上下文掩码 × 因果编码器: 因果编码器分工是只看历史与当前块,保证不偷看未来;动态右上下文掩码分工是在训练时随机改变块与前瞻,模拟不同延迟。搭配理由是固定窗口无法适应可变块,组合后编码器既严格从左到右又对前瞻鲁棒。

解码器保持标准自回归结构,输入此前书面词,输出经词表投影得到分布。训练是标注交叉熵加生成负对数似然的多任务目标,推理分透传与选择性解码两路。生成到结束符停止,并设每跨度最多 64 词硬截断以防死循环。标注损失负责及时发现跨度边界,生成损失负责在限定编码跨度内完成局部改写,两者在同一编码表示上联合优化,使边界判定与文本生成相互校准。

联合标注器 × 读标写策略: 联合标注器分工是对每词预测开始内部外部 3 类边界;读标写策略分工是按标签决定透传或触发解码。搭配理由是多数词照抄不必生成,组合意义是把开销集中到完备跨度,减少幻觉与延迟。

为加速推理,编码器做增量键值缓存,解码触发时先 1 次批量前向填充已有前缀缓存再自回归生成。拷贝粘贴把外部词跳过解码器但仍纳入历史,避免重算全部历史。完全流式版本进一步对解码器自注意与交叉注意启用缓存,只更新新词。执行顺序是先读入新块并扩展编码缓存,再标注并判定跨度是否完备,若完备则触发 1 次解码调用完成局部片段,若为外部词则直接透传并更新历史前缀,从而把高频照抄路径与低频改写路径彻底分开。

拷贝粘贴策略 × 键值缓存: 拷贝粘贴策略分工是把外部词直接复制输出并保留为历史;键值缓存分工是复用已算注意力状态只算新块。搭配理由是丢历史会伤上下文而全量重算太慢,组合意义是在保留完整历史同时把编码延迟降到约 10 毫秒。

训练如何制造流式才能见到的截断?

标准训练把结束符预测条件放在全局源边界上,流式却要求在句中局部跨度末就停。推理时若在源块后补结束符,会破坏增量缓存并加剧分布偏移。

论文提出前缀训练增强,在训练时以 0.8 概率随机截断样本。截断时源侧取前 k 词且不加结束符,目标侧取对齐前缀并显式加结束符。非截断时保留完整源与目标并加结束符,该操作在线进行且代价低。

前缀截断增强 × 局部结束符: 局部结束符分工是让解码器在小跨度末停止;前缀截断增强分工是训练时以概率截断整句为前缀对且目标前缀后加结束符。搭配理由是标准训练只在句末见过结束符,组合意义是教会模型仅凭局部状态判断完备而不破坏增量缓存。

数据基于约 6,000,000,000 词新闻语料流水线,生成 500 万训练句对与各 5 万验证测试,附短语级比对与词级边界。半符号用正则检出再规则生成口语候选并随机选一种,语音词用字音转换加人工校验建成约 125,000 词典。训练用 4 卡 80 GB 图形处理器,最多 20 轮,全局批量 512,峰值学习率 0.0001,一轮预热加余弦调度。

在什么数据基线指标下比较?

评估分干净口语真值与含噪转写两种输入,含噪是将 5 万测试经合成再经组块识别得到。该识别相对口语参考的词错误率为 14.21%,含误识与语音歧义,尤其外语与未登录词多。干净输入检验规范化本身的精度上限,含噪输入检验对识别错误与语音歧义的鲁棒性,两者共用同一套生成流水线与边界标注以保证比较公平。

基线分 3 组,非流式端到端包括从零训练与预训练微调与加辅助标注损失,以及只看孤立跨度的自适应模型。混合流式为复现的动态上下文模型分零前瞻与有前瞻两档,流式端到端包括因果编码器与多路径等待策略与本文多档。所有流式模型在推理时按块平均,多组块与前瞻配置取平均后报告,避免单点延迟设置带来的偶然优势。

推理用贪心解码,块在 3 到 5 采样,前瞻在 1 到 2 采样,报告多配置平均。指标都是越低越好,规范化词错误率衡量需改写部分,非规范化词错误率衡量对不变词扰动,总词错误率衡量全句。统计用 10,000 次自助法给 95% 置信区间,延迟在批量 100 与句长 100 到 200 词下测每块时间。资源状态方面,论文未提供经验证可达的链接,本解读不声称代码模型数据已公开。

主结果:精度接近离线并超过混合与等待策略吗?

比较问题是流式端到端能否在保住不变词的同时追平离线精度。公平条件是同数据流水线训练,流式按块平均而离线看整句,指标方向越低越好。下表整理两档总词错误率与相对倍数,数值保留原文写法。

评价设置离线强基线 WER流式 S2 的 WER相对倍数含义说明
含标点大小写3.63%4.18%1.67[1.60,1.75]×相对等待策略的优势倍数
不含标点大小写0.52%0.64%5.81[4.96,6.73]×相对等待策略的优势倍数
流式对比等待策略3.63%4.18%1.67[1.60,1.75]×等待策略因源滞后目标而失效

表后解释主要收益是预训练加辅助标注建立强离线基线,流式 S2 显著优于等待策略。论文报告等待策略即使等待多词仍可能源滞后目标,因单目标词可对应多源词。代价是相对离线最强基线仍有约一成多相对上升,反映缺未来上下文时全局依赖难解。未胜出项是只看孤立跨度的自适应基线在含标点档高达 40.08%,说明保留历史对大小写标点至关重要。混合基线 H2 在两档的高 I-WER 进一步说明人工规则难以覆盖复杂规范化,而端到端从数据直接学习变换更具扩展性。

以下导读先看堆叠含义,再看四档优化递减,最后看块增大时的绝对增量,这是延迟是否满足实时的直接证据。

看图路径: 1. 先按图例区分深蓝编码器延迟与粉红总延迟的堆叠;2. 再横向比较同块大小下四档配置高度的下降;3. 纵向对比块 3 块 4 块 5 三组总高度随块增大的幅度

原论文 Figure 2:Per-chunk latency breakdown (Encoder vs.

论文图 2。原论文 Figure 2:“Per-chunk latency breakdown (Encoder vs. Total) for four streaming configurations across chunk sizes of 3, 4, and 5.”。

图 2 显示 3 组块大小下每组四根柱从基线到拷贝粘贴再到编码器缓存再到解码器缓存逐级降低。深蓝编码器部分从 54 ms 降到 10 ms,总高度在块为 5 时从 206 ms 降到 60 ms。拷贝粘贴砍掉照抄词的解码调用,编码器缓存砍掉历史重算,解码器缓存省去初始批量前向。论文报告 95 分位下解码器缓存 165.5 ms 仍低于编码器缓存 249.0 ms,块为 5 通常对应 500 ms 音频,支持实时与高并发。

含噪识别与延迟优化下谁更稳更快?

比较问题是输入变为含识别错误转写时流式是否仍保持优势,以及缓存优化是否损害精度。公平条件是同一批含噪文本输入,离线与流式同指标比较,延迟在同批量与句长下比较。下表整理延迟与含噪相对变化。

配置编码延迟起点编码延迟终点总加速与长尾含义说明
块 5 优化54 ms10 ms3.43×编码缓存加拷贝粘贴的总加速
长尾与含噪165.5 ms10 ms1.38[0.48,2.73]%解码器缓存长尾与相对 S2 改进
含噪流式54 ms10 ms3.43×完全流式在噪声下仍可用

表后解释主要收益是编码器缓存把编码延迟从数十毫秒降到约 10 毫秒,总延迟实现数倍加速。完全流式相对编码器缓存版本在干净两档绝对上升仅 0% 点几,而块为 5 时总延迟相对下降约 30%。含噪下完全流式略优于非完全流式,支持解码器缓存未损害噪声鲁棒性。未胜出项是从零训练的流式接近混合,说明预训练先验在噪声下尤为重要。限制是该测试仍是合成语音加单一识别器,未覆盖真实口音与信道。

前瞻与截断概率各带来什么代价?

第一个问题是前瞻是否有用,条件是同模型分零前瞻与有前瞻。有前瞻的流式相对零前瞻在两档分别相对下降约 19% 与 22%,混合有前瞻相对零前瞻也有下降。代价是前瞻引入少量等待,需在延迟与精度间权衡。

第二个问题是截断概率如何选,实验固定块为 3 前瞻为 1。以下导读先看两条曲线起点差异,再看中段平稳段,最后看末端同时上跳,这是选择 0.8 的依据。

看图路径: 1. 先确认横轴截断概率与纵轴词错误率及两条图例;2. 再观察流式曲线随概率增大而下降的趋势;3. 对比离线曲线中段平稳而末端两条曲线同时上跳

原论文 Figure 3:Impact of truncation probability ptrunc on the Word Er- ror Rate for both offline and streaming…

论文图 3。原论文 Figure 3:“Impact of truncation probability ptrunc on the Word Er- ror Rate for both offline and streaming inference of our model.”。

图 3 横轴是截断概率,纵轴是词错误率,蓝色圆圈为离线,红色方块为流式。蓝色离线在中间区间平稳波动,红色流式从左侧高位随概率增大总体下降,在 0.6 到 0.9 之间与离线差距最小。概率为 1.0 时两条曲线同时陡升,说明完全去掉整句监督损害长程建模。论文报告无增强时流式超过 100% 因无法预测局部结束符,而 0.8 取得流式最低且离线仍具竞争力。

跨架构与跨语言是否同样缩小流式差距?

论文用越南语 132M 音节模型与英语 223M 模型验证通用性,英语在标准谷歌文本规范化子集上训练评估。越南语分干净与含噪两档,流式按块 3 到 5 前瞻 0 到 2 平均。

报告显示离线与流式差距在不同骨干上一致收窄,越南语大骨干绝对值更好而小模型在噪声下差距略大。英语也有类似趋势,支持方法只依赖标准文本到文本基础而不依赖语言特定启发。

代价是更大骨干绝对值更好,更小模型边缘部署更轻但噪声下需权衡。未评测边界是长表单与代码混合文本,论文未报告,复现时不应直接推广。总体趋势不等于每组都成立,需按块与前瞻分别报告曲线。

哪些错误仍在,哪些结论不能推广?

论文明确报告语音规范化仍难,半符号类有效但未登录词与外语实体仍挑战大。常见是标注器找对跨度而解码器拼出语音相近但事实错误的形,未来想把语音词典偏置融入解码。

第二是当前策略等跨度完备才发射,长序列体感延迟大,未来想探索足够上下文就部分输出。第三是 275M 参数对端侧偏大,未来需蒸馏与量化。

不能推广的是总体平均实时不等于每块都实时,需看 95 分位。干净文本提升不等于真实口音下同等成立,自动词错误率下降不等于下游翻译理解同等获益。缺失开源链接意味着不能承诺可运行,复现需自建流水线。

复现先做什么,需要哪些超参与信息条件?

复现先重建数据与对齐,用正则检出标点大小写与半符号类别。规则生成口语候选并随机选一种,语音词用字音转换加人工校验建成词典。保留短语级对齐与词级 3 类边界,标点归入前词。

然后按文本到文本结构搭建流式编码器与联合标注器,训练用动态块 1 到 5 与前瞻 0 到 2。截断概率 0.8,多任务损失相加,全局批量 512,峰值学习率 0.0001,一轮预热加余弦,最多 20 轮。

推理实现 3 阶段循环,按块读并追加隐状态,按块标注并判断完备。外部直接复制,完备跨度 1 次解码并限制交叉注意到跨度末尾,每跨度最多 64 词。贪心解码,块 3 到 5 前瞻 1 到 2 平均报告,延迟用批量 100 与句长 100 到 200 词测均值与 95 分位。常见误解是把 3 类标签当成类别规则,实际它只管边界不管转换,把拷贝粘贴当成丢历史而实际历史仍作前缀保留。

何时值得尝试,一句话收束

当后处理需要流式输出且输入大部照抄只有局部需改写,不愿维护人工有限状态机时值得尝试。用 3 类边界把生成限制到完备跨度,用截断增强教会中途停止,用双端缓存保住实时。

证据是越南语流式接近离线,含噪下相对混合下降超 20%,块为 5 时总延迟从 200 以上到 60 左右。代价是相对离线仍有差距,长跨度需等完备,外语罕见实体仍可能拼错。

收束一句话是把流式逆规范化做成按边界按需生成,而非对每个词生成,是精度与延迟兼得的关键。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总