英文题目:The Hidden Cost of Digits: Number Normalization and WER in ASR Systems

标签:#语音识别 | #评测协议 | #多语言 | #语音

评分:6.0/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Stanisław Kacprzak:机构信息未在 arXiv HTML 中可靠披露
  • Mieszko Fraś:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

自动语音识别评测输入为系统假设转写与参考转写,输出为词错误率,难点在于现代系统输出阿拉伯数字而参考多为完整拼写,波兰语等高度屈折语言中数字形态随语境变化,直接比较会引入格式偏差。方法链分为三步,首先用语言相关数字归一器将完整拼写映射为数字形式并先于去标点执行,其次施加基础归一器统一小写标点与空白,最后在归一前后分别计算参考间差异与系统词错误率增益以分离格式影响。相对仅做小写去标点的Whisper基础归一,关键机制差异是在删除逗号冒号前先做数字逆归一化并适配波兰语逗号小数与序数屈折,从而减少时间冒号与数字序列切分歧义,恢复跨系统公平比较。在VoxPopuli英语基准评测下,Whisper-IP的WER为8.38%,低于Whisper的WER 8.46%。该结论适用于含数字的朗读与议会类语音,尚不能外推至分数缩写时间口语变体密集场景。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么写法不同就会算错分?

这篇论文的输入是语音,目标是给出与人耳听到的内容一致的文字转写,评价指标是词错误率。初学者容易以为只要模型听得准,分数自然就准,但论文指出当代大模型已经学会了带格式的转写,会直接输出阿拉伯数字、标点和缩写,而另一些模型只输出逐字拼写的原始口语形式。参考文本同样存在两种风格,同一个数据集里既有数字写法也有逐字写法。如果评价时只做小写和去标点,不统一数字写法,那么 nineteen eighty-four 与 1984 会被计为多次替换或删除插入,得到虚高的错误率。

更麻烦的是多语言评测长期复用英语的归一化代码,对英语之外的语言只做基础清洗。英语有现成的数字归一器,可以把货币、时间、缩写数字映射到阿拉伯数字,而德语、法语、西班牙语、波兰语没有同等可靠的公开工具。波兰语还是高度屈折语言,序数和数量词会随语境变格,同一个数字有多种拼写形式,规则编写难度更大。于是不同系统之间的比较不再是声学和语言建模能力的比较,而是输出风格与参考风格是否恰好对齐的比较。论文要解决的正是这个可复述的评价问题:在不改变模型的前提下,用明确的归一化顺序和工具,把写法差异与真实识别错误分开。

本文的写作只依据论文原文证据,不引入外部基准结论。资源状态方面,本次没有发现来源绑定且完成验证的资源,因此不得声称代码模型或数据已公开,只能按原文描述讲作者做了什么、用了什么数据、得到什么数字。

同任务同评价阶段的前人做了什么,本文补哪一块?

在相同输入输出和相同运行阶段上,前人已经注意到归一化会改变结论。Whisper 共享代码提供了英语的数字归一和基础归一,但对非英语只做基础归一,这一点在论文中被明确复述。针对印度语系文字的研究指出归一化可能人为抬高性能,针对多语言社会的数字发音研究指出数字可能用不同语言读出,针对文本归一化的深度学习研究则强调必须结合知识规则以避免灾难性错误。NVIDIA NeMo 工具包为少数非英语语言提供了基于规则的归一工具,但包括 NVIDIA 模型评测和开放语音识别榜单在内的多语言比较仍然基于 Whisper 归一。

本文的定位是补上数字这一项的定量分析,并且补上波兰语工具。作者没有重新训练声学模型,也没有提出新的解码器,而是把已有系统的输出和已有参考文本放在统一的归一管线下重算分数。另 1 篇被引工作关注如何正确格式化转写中的数字表达,本文则关注如果不格式化会给比较带来多大偏差。理解这个分工很重要:前人讨论归一化的必要性,本文给出不同语言、不同参考风格、不同输出风格下的百分点代价,并验证自建的波兰语 words-to-digit 归一器是否能把参考之间的写法差异归零。

什么情况下看似完美的预测会被算成高错误率?

论文用一组看似完美的预测说明基础归一的不完备。白话讲,就是说话内容一样,只是标点和数字写法不同,归一后仍然对不齐。例子是教学例子,不是新实验数据:会议时间写成 10 am 与 10 a.m.,归一后一边是 10 am,另一边被拆成 10 a m;12.215 写成文字与写成 12:25,冒号处理会让两边切词不同;毫米缩写会被当成填充词。

连续数字序列会因为先删逗号而粘连成 10211 或 3002 这样的长串。这些例子说明归一顺序和歧义处理会直接制造错误。

问题的核心可以沿一个样本走一遍:输入是一段包含数字的语音,表示是参考文本与假设文本,组件是先数字归一再基础归一的管线,目标是让同一发音的不同合法书写得到相同的词序列,输出是可比较的词错误率。如果跳过数字归一,或者先删标点再猜数字,就会把切词错误计入声学错误。波兰语把问题放大,因为 1984 这样的数字在德语中可能是一个长复合词,在英语中是 3 个词,在波兰语中是 4 个词,在西班牙语和法语中是 5 个或 6 个词。

词数不同意味着同样的数字错误在不同语言中权重不同,也意味着归一前后分母 N 会变化。论文后面所有实验都是围绕这个机制展开:固定语音和系统,只改变参考风格与是否做数字归一,观察分数变化。

评价管线全景:先转数字,再做基础清洗,最后算分

论文的方法全景是一条评价管线,不是训练新模型。第一步是数字归一,用 N(·) 表示;第二步是基础归一,去除大小写、标点符号、括号内容并压缩空格;第三步是计算词错误率。关键的安排理由是先做数字归一再做基础归一,这样可以减少标点提前删除带来的歧义。

英语用 Whisper 自带的数字归一器,波兰语用作者自建的归一器,德语、法语、西班牙语用 NeMo 的逆归一器。作者明确说明为了只聚焦数字影响,不使用会做更多英语特有转换的完整英语归一器,因此分数可能与其他榜单不同。

波兰语归一器的构造思路是跟随英语的做法,把逐字转写映射为阿拉伯数字,而不是反向展开。作者增加了对波兰语逗号小数、序数屈折、带小数部分数字、日期和时间的支持,并在删标点之前做数字映射。作者也明确承认局限:不能覆盖所有序数屈折和真分数,但认为常见情形已处理,并且修复了英语归一器在连续数字和缩写上的部分问题。代码带有常见用法的单元测试,并在议会语料上验证效果。复述时要注意这是一个基于规则的评价工具,不是声学模型的改进,验证方式是看它能否把同一内容的两种参考写法归一到一致。

组件与计算:归一器做什么,词错误率怎么算?

先讲白话。基础归一器做的是通用清洗:删掉方括号和圆括号中的内容,把标点符号替换为空格,转小写,压缩连续空格,对无空格分词语言在字间加空格。数字归一器做的是写法统一:把文字数字变成阿拉伯数字。波兰语版本还要处理变格和本地小数逗号。评价时所有转写和系统输出都先过数字归一,再过基础归一,避免冒号、点号、逗号先被删掉后无法恢复数字边界。

文本归一化 × 数字归一化: 文本归一化负责把大小写、标点、括号和多余空格统一成可比形式,数字归一化负责把 nineteen eighty-four 这类逐字表达和 1984 这类阿拉伯数字表达统一到同一侧,二者搭配的理由是只有先统一数字写法,再做小写去标点,词错误率的替换删除插入计数才不会把同一发音的不同写法误判为识别错误,组合意义是让输出数字型系统和输出逐字型系统能在同一分母下比较。

逐字文本 × 数字文本: 逐字文本指参考或假设中把数字完全拼写出来,数字文本指用阿拉伯数字书写数字,二者分工是揭示训练来源不同导致的输出风格差异,搭配理由是同一段语音在 VoxPopuli 的 raw_text 与 normalized_text 中可能分别呈现为两种风格,组合意义是论文用两类参考同时评测,才能分离出多少词错误率来自识别错误、多少来自写法不一致。

词错误率 × 归一化后词数: 词错误率负责统计替换插入删除相对参考词数的比例,归一化后词数负责提供分母 N,二者搭配的理由是把 tysiąc dziewięćset osiemdziesiąt cztery 4 个词压缩成 1984 一个词会直接缩小分母,从而放大其余错误的权重,组合意义是提醒读者数字归一化不是无代价的对齐操作,它同时改变分子和分母,解读改善量时必须看分母变化方向。

基础归一器 × 波兰语数字归一器: 基础归一器负责跨语言通用的小写、去标点、去括号和空白压缩,波兰语数字归一器负责处理波兰语特有的逗号小数、序数变格、日期时间和十进制分数,二者分工是通用清洗与语言相关数字映射分离,搭配理由是先做数字映射再做去标点可以避免冒号和逗号提前被删掉造成的歧义,组合意义是把英语已有的数字归一能力补到屈折变化更复杂的波兰语上。

词错误率的符号与输入如下:分子是替换数、插入数、删除数之和,分母是参考转写中的总词数,输出是百分比。论文明确提醒,把逐字数字压缩成单个数字会减小分母,从而放大其余错误的权重;反向展开则会稀释权重。这个提醒是理解后文所有改善量的前提。

\[WER[\%]=\frac{S+I+D}{N}\times 100\%\,,\]

公式中 S 是替换,I 是插入,D 是删除,N 是参考总词数。计算目标是衡量转写与参考在词序列上的差异,实现上是先完成上述两步归一,再做对齐计数。原文没有给出新的近似或梯度路径,因为这不是可训练模块,不存在停止梯度和优化步骤,复述时不应脑补训练细节。

本研究训练了什么,没有训练什么,真实计算是什么?

本研究没有训练任何声学模型,也没有微调语言模型,不存在优化器、学习率、冻结层数或梯度更新。4 个被测系统都是现成调用:Whisper large-v3、OWSM v4 medium、Canary 1B 和 Canary 1B-v2。论文报告的输出风格差异来自各系统原有训练数据的转写规范:Whisper 与 OWSM 主要输出数字文本,Canary 1B-v2 多数输出逐字文本,Canary 1B 只输出逐字文本。作者没有改变这些模型的参数,只是显式指定识别语言,并用束宽为 5 的束搜索解码。

直接解码输出 × 提示引导的逐字输出: 直接解码输出指 Whisper 按默认训练偏好输出数字形式,提示引导的逐字输出指用初始提示词诱导同一模型输出逐字数字形式,二者分工是构造同一模型在两种书写规范下的对照,搭配理由是只有固定声学模型而改变输出风格,才能检验评价流程是否公平,组合意义是论文用 Whisper 与 Whisper-IP 的配对证明不做数字归一化时更差的模型反而可能看起来更好。

真实计算过程是推理加评价。推理侧对 Whisper 增加了一个对照分支 Whisper-IP,用初始提示词诱导输出逐字数字,英语提示词明确包含日期、时间、百分比和数量的逐字例子,其他语言用翻译版本,作者说明初步实验发现提示词方式优于抑制数字 token 的方式。规则侧的计算是波兰语数字归一器的字符串映射与正则处理。评价侧的计算是不同归一组合下的词错误率重算。没有训练意味着不能把分数改善说成模型能力提升,也不能从参数冻结推定输出确定,提示词本身会轻微扰动解码,论文也报告了这种扰动带来的代价。

数据、划分、系统与对照条件如何保持一致?

数据方面,英语、法语、西班牙语、德语和波兰语使用 VoxPopuli,另加波兰议会语料。VoxPopuli 有两种转写:raw_text 以阿拉伯数字为主,normalized_text 只有逐字数字,论文为清晰起见分别称为数字文本和逐字文本。议会语料原始为逐字文本,作者手工制作了数字文本,并在检查输出时发现两条录音与音频不对应而剔除。采样上只用测试划分,各语言约 2000 条,论文给出具体条数,复现时应按相同划分取数。

下面表格的比较问题是各语言测试规模是否可比,公平条件是都取测试划分,指标方向是条数越多抽样越稳,数字越大不代表效果越好,只是规模说明。

数据集语言测试条数参考类型数字写法
VoxPopuli 测试划分英语1842 条逐字与数字数字为主与逐字
VoxPopuli 测试划分波兰语1831 条逐字与数字数字为主与逐字
VoxPopuli 测试划分德语1968 条逐字与数字数字为主与逐字
VoxPopuli 测试划分法语1742 条逐字与数字数字为主与逐字
VoxPopuli 测试划分西班牙语1528 条逐字与数字数字为主与逐字

上表说明多语言比较的基数相近,都在 1500 到 2000 条之间,议会语料则小得多但数字密集,适合做深入核查。具体代价是议会语料手工数字文本可能引入人工判断,论文用小规模换取可逐条验证,两条坏数据被剔除也说明小规模语料需要更严格的质检。未评测边界是除波兰语和英语外,其他语言的数字归一依赖 NeMo 逆归一器,其覆盖度不如英语工具,跨语言改善量不能直接等同于工具质量排序。

系统与协议方面,4 个系统加一个提示词分支共 5 个待测输出,每个输出分别在逐字参考、数字参考、归一后逐字参考、归一后数字参考下计分,并且区分只归一参考、只归一假设、两侧都归一的组合。指标是词错误率,越低越好。聚合方式是数据集级别总体计分,没有报告置信区间,解读时应把零点几个百分点的差异看作需要结合归一条件判断的信号,而不是绝对能力排序。

主结果:两侧都归一是否最低,不归一会错判谁更好?

主结果的测试问题是数字归一能否降低写法差异带来的虚高错误,以及是否改变系统排序。论文报告显示,对每个系统、每种参考和每个数据集,两侧都做数字归一时词错误率最低。更关键的反证是 Whisper-IP 本身在归一场景下比标准 Whisper 差约 0.5 个百分点,说明提示词轻微损伤识别,但在不做数字归一的逐字参考下,Whisper-IP 反而更好,这正是评价不公平的直接证据。

下面表格的比较问题是同一模型不同输出风格在逐字参考下的排序是否可靠,公平条件是同一语音、同一参考、同一基础清洗,只差是否用提示词改变数字风格,指标方向是词错误率越低越好。

系统分支参考风格未归一词错误率归一后趋势论文判断
Whisper 标准解码英语逐字参考8.46%两侧归一更低输出数字风格吃亏
Whisper-IP 提示引导英语逐字参考8.38%两侧归一更低未归一时虚假占优
Whisper 标准解码波兰语逐字参考7.85%两侧归一更低输出数字风格吃亏
Whisper-IP 提示引导波兰语逐字参考7.52%两侧归一更低未归一时虚假占优
评价流程所有组合以两侧归一为准单侧归一不稳定必须统一两侧

上表的主要收益是揭示排序反转:不归一时输出风格与参考恰好一致的分支占优,归一后优势消失。具体代价是提示词分支本身更差,归一后差距约 0.5 个百分点,说明用提示词构造逐字输出不是免费的,不能把未归一的胜利理解为模型更好。未胜出项是标准 Whisper,它在公平归一后才是更强分支,这个反例恰好支持论文主张。

多语言的总体改善见下图导读。左面板是逐字参考,右面板是数字参考,纵轴是两侧都归一相对未归一的词错误率改善量,单位是百分点,越高表示归一消除的虚高错误越多。需要先确认面板与图例,再比较同一系统内不同语言柱高。

看图路径: 1. 先看左右两个面板标题,确认左侧是逐字参考、右侧是数字参考;2. 再看横轴四个系统分组与每组内五种语言柱条的相对高度;3. 对比 Whisper-IP 在左右面板的柱高反转,确认输出风格与参考风格错位时的收益最大;4. 观察 Canary-v2 在德语数字参考下的最高柱,确认个别组合仍有接近 0.9 个百分点的改善

原论文 Figure 1:Absolute WER reduction (percentage points) in WER when ASR outputs and reference transcripts are…

论文图 1。原论文 Figure 1::“Absolute WER reduction (percentage points) in WER when ASR outputs and reference transcripts are both number normalized for various VoxPopuli languages”。

从像素可见,左侧逐字参考下 Whisper 与 OWSM 的各语言柱普遍较高,波兰语和法语改善明显;右侧数字参考下 Whisper-IP 与 Canary-v2 的柱更高,其中德语在 Canary-v2 下的柱接近全图最高,西班牙语在 Whisper-IP 下也有高柱,而 OWSM 在右侧普遍很矮。这支持论文的判断:收益最大的总是输出风格与参考风格错位的组合,但在德语与 Canary-v2 这类组合中两种参考下都有可见收益,因此无法事先估计某个语言某个系统的影响,只能统一做双侧归一。论文还报告某些语言相对改善可超过 10%,但总体趋势不等于每组都成立,解读时不能把单柱最高值推广为全语言结论。

只归一一边会怎样,参考之间的差异能归零吗?

这一节按消融思路组织:测的是参考文本自身的写法差异,与系统无关。做法是把数字文本与逐字文本直接互算词错误率,再看只归一参考一侧与两侧都归一的残差。条件一致性在于同一数据集、同一基础清洗,只改变哪一侧过数字归一器。指标方向仍然是越低越好,残差越小说明归一器越能消除写法差异。

下面表格的比较问题是参考写法差异有多大、归一能消除多少,公平条件是不引入识别错误、只比较两种参考,指标方向是词错误率越低表示写法越一致。

数据集初始参考间差异两侧归一后残差单侧归一 pessimistic 值论文支持的判断
波兰语 VoxPopuli初始 1.28%归一后 0.30%单侧更高数字文本仍需归一
跨数据集趋势数字越密差异越大两侧归一最低只归一一侧不稳定必须双侧归一
残差来源切词与漏词归一无法消除需人工核查非数字噪声仍存在

上表的主要收益是两侧都归一显著降低参考间差异,英语从约 1% 量级降到 0.31%,波兰 VoxPopuli 从 1.28% 降到 0.30%,议会语料从大于 2% 降到零。具体代价是只归一其中一侧反而可能更高,英语单侧归一达到 1.33%,说明不对称归一比都不归一更差。未胜出项是残差不为零的情形,英语剩余差异多为 well being 与 wellbeing 这类切词差异和原始数字文本中的漏词,证明数字归一不能解决所有转写噪声。未评测边界是波兰语归一后 0.60% 的数字文本自归一差异,说明即便原始文本已用数字书写,仍需进一步归一才能公平比较。

议会语料归零是一个强信号,但不能理解为工具完美。论文明确说该工具不能处理所有序数屈折和真分数,归零得益于议会语料数字类型集中且可手工核查,换到更开放的口语数字仍需补验证。

哪些结论有直接证据,哪些还只是可能?

论文直接报告的是在给定管线下重算的分数差异,支持的是数字归一能改变排序、双侧归一最低、议会语料上自建工具能把参考差异归零。有限解释是提示词损伤约 0.5 个百分点的原因,以及罗马数字等个案对 Whisper-IP 在议会数据上更稳的解释,这些属于结合输出观察的解释,不是受控因果验证,应表述为可能与个案有关。未验证推测是把相对改善推广到所有部署场景,论文没有测量延迟、计算开销、误判率或下游任务收益,因此不能承诺归一改善识别能力,只能说改善评价公平性。

下面表格的比较问题是不同数据集上悲观代价的上限是多少,公平条件是假设输出与参考风格完全错位且只做单侧或不做归一,指标方向是百分点越大表示评价偏差越大。

数据集悲观代价估计论文措辞适用条件限制
英语 VoxPopuli高于 1%超过 1%风格错位时非每句都成立
波兰语 VoxPopuli达到 1.5%达到 1.5%数字更密集依赖 NeMo 与自建工具
波兰议会语料接近 3%几乎 3%日期金额法案号多小样本手工参考
多语言榜单背景零点几百分点即影响排序差异常在零点几顶尖模型差距小不能替代显著性检验
工具覆盖序数与分数不全作者承认不全常见情形可用罕见屈折待验证

上表说明论文的上限估计不是平均收益,而是风格错位加数字密集时的悲观值。具体代价是样本和工具依赖:议会数据只有百余条且经手工处理,VoxPopuli 其他语言依赖 NeMo 逆归一器,工具误差会混入改善量。未胜出项是罕见屈折和真分数,作者明确未覆盖,复现时不应声称全量波兰语数字已解决。相关性不等于因果,数字密集与分数差异大同时出现,但不能据此断定所有高错误都来自数字,仍需逐条对齐核查。

要复现这篇论文,先做什么才能得到可比分数?

复现的第一步是固定数据划分与参考类型。取 VoxPopuli 各语言测试划分,保留 raw_text 与 normalized_text 两套参考,不要自行合并或重切分;议会语料保留原始逐字文本,如需数字文本应按原文思路手工制作并记录两条剔除录音的原因。所有文本在计分前走同一管线:先过对应语言的数字归一,再过基础归一。英语用原文指定的数字归一器,波兰语用作者描述的规则版本并加上单元测试,德法西用 NeMo 逆归一器,并记录版本号,因为工具版本不同会改变切词。

第二步是固定解码条件。显式指定识别语言,使用束宽为 5 的束搜索,对 Whisper-IP 使用论文给出的英语提示词及其翻译版本,不要改写提示词中的数字例子,因为提示词内容会影响输出风格。分别在逐字参考、数字参考、归一后逐字参考、归一后数字参考下计分,并额外记录只归一假设、只归一参考、两侧都归一的 3 组对照,这样才能复现单侧归一更差的结论。计分时保留分母词数,因为归一会改变分母,复现报告应同时给出归一前后分母变化,避免把分母缩小带来的权重放大误读为模型变差。

第三步是核查工具本身。先不测系统,只算数字文本与逐字文本之间的词错误率,检查两侧归一后是否降到论文报告的 0.31%、0.30% 与零附近;若差距大,先查标点顺序是否颠倒、是否误用了完整英语归一器、波兰语逗号小数是否被当成千分位。还需补的验证是显著性与切词残差分析,以及在新领域上测试序数变格和分数,因为原文已说明这两类覆盖不全。资源方面,本次未验证到可用链接,因此复现陈述应写按论文描述实现与调用,不声称代码已公开或可一键下载。

何时值得加数字归一,如何避免被分数误导?

当评测涉及输出风格不同的系统,或参考本身混用数字与逐字写法时,值得加入双侧数字归一。尤其在多语言榜单上,顶尖系统差距常在零点几个百分点,而论文显示写法错位可带来 1 到接近 3 个百分点的偏差,足以反转排序。做法上应把数字归一放在基础清洗之前,为每种语言选择明确工具,并同时报告归一前后分数与分母变化,而不是只报告最低的一版。

需要记住的特有误解有三点。第一,低分不等于听得准,可能是输出风格恰好与参考一致,论文中 Whisper-IP 在未归一逐字参考下反超标准 Whisper 就是实例。第二,归一改善不等于模型改善,它消除的是写法惩罚,声学错误仍需看归一后的对齐细节。第三,英语工具好不等于多语言可直接复用,波兰语需要处理变格和逗号小数,德法西需要验证逆归一覆盖,罕见序数和真分数仍是已知缺口。

收束时回到可操作结论:比较数字型输出与逐字型输出的系统,必须两侧都做数字归一;只归一一侧可能比都不归一更差;报告时区分直接报告的分数、支持的公平性判断与待验证的推广,不要把悲观上限当成平均收益,也不要把议会小样本上的归零推广为所有波兰语语音都已解决。

📎 论文与评分元数据

排名:前50% | 文档类型:应用研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-21 语音/音乐/音频论文速递