英文题目:Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition

标签:#语音识别 | #多任务学习 | #提示学习 | #大语言模型

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Fengrun Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Li Fu:机构信息未在 arXiv HTML 中可靠披露
  • Wangjin Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Lu Fan:机构信息未在 arXiv HTML 中可靠披露
  • Youzheng Wu:机构信息未在 arXiv HTML 中可靠披露
  • Xiaodong He:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

针对中文语音识别中口语忠实转写与书面可读转写难以兼顾的问题,论文用成对监督加提示词选形式训练一个共享模型,并以数字关键词加权的序列优化和分开考核必须改与禁止改的协议证明其在必须规范化上达到 4.64% I-CER 与 94.85% 关键词 F1、在禁止改上达到 95.18% 保留率,而无数字控制集上未引入虚假数字。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入什么、要改变什么、必须保留什么

这篇论文处理的是中文语音识别的两种输出需求。输入是同一段语音,输出却有两种合同。一种是口语形式转写,要求忠实记录说话人怎么说的,数字保持汉字说法,不做美化。另一种是书面形式转写,要求把应当规范的数字表达改成阿拉伯数字加规范单位,便于阅读、字幕和会议纪要使用。

想改变的是数字相关片段的呈现方式,例如把表示时长、日期、数量的汉字数字改成数字写法。必须保留的是两样东西。第一是原句语义和非数字上下文,一个字也不能因为改数字而走样。第二是那些按规范就不该改的说法,例如成语、专名、农历表达和词汇化短语,看到数字也不能转。输出由提示词选择,同一个模型在口语提示下做忠实识别,在书面提示下做语义敏感的逆文本规范化。

初学者容易把逆文本规范化理解成简单的汉字数字替换。论文反复强调它不是局部替换,而是依赖语义角色的呈现决策。同一个“ten to one”在表示比分时应当写成“10:1”,在表示“很可能”时应当保留原说法。中文里同样存在时长与固定说法、公历与农历的对立,这就要求模型结合上下文判断改或不改,而不是见数就转。

已有路线在哪里断开,论文站在哪个缺口

第一条路线是独立的逆文本规范化。基于规则和加权有限状态转换器的方法在覆盖的类别上高效,但开放域和上下文相关的数字表达难以维护。神经序列模型、复制改写标注器、流式转换器和解码器大模型减少了规则工程,但仍然在识别之后运行,只能看到识别文本。识别错误已经发生,归一化决策无法与声学识别联合优化。

第二条路线是带格式的端到端识别。以 Whisper 为代表的系统从互联网原始转写中学到标点、大小写和数字格式能力,一些开源大模型语音识别系统也提供要求格式化转写的提示接口。问题是隐式格式和提示诱导只提供弱控制,没有两种输出形式的显式监督,数字需要语义判断时行为不稳定。

第三条路线是大模型生成监督与裁判范式。已有工作用大模型合成训练信号或做可扩展质量控制,但语音识别的书面目标不是开放指令跟随,而是受约束的口语到书面转换,只允许局部数字片段变化。评估侧同样缺一块,传统识别指标看整体质量,独立规范化指标多看必须改是否改对,很少单独度量对成语、约数和专名等禁用片段的过度改写。论文的位置正在于此:保留口语识别能力,用成对监督显式区分两种形式,再用分开考核必须改与禁止改的协议补上评估。

三个具体障碍如何变成可训练可度量的问题

第一个障碍是级联缺乏联合优化。实用系统通常先识别再用文本模块改写,规范化器看不到声学,识别错误会传入规范化阶段,数字决策也不能与识别一起优化。论文把这个问题变成一个模型两种提示的联合训练问题,让共享识别能力同时支撑两种输出。

第二个障碍是上下文敏感的语义决策。规则系统难以规模化处理例外,神经后处理也只看到文本。论文把它变成书面模式内的分类呈现问题:提示选定书面形式后,由语义解释决定每个数字半符号表达应当规范化还是保留。这要求训练目标同时包含改对和不乱改的信号。

第 3 个障碍是评估只看改对不看改错。激进转换所有像数字的片段可以在普通数量上提高可读性,却会破坏应当保留的表达。论文把它变成两个互补测试集的决策感知协议,一个测必须改,一个测禁止改,再加一个无数字控制集检查书面提示是否在不需要时凭空造数字。

一个模型两种提示:数据流先走一遍

拿一条真实样本走完全流程有助于建立全局感。训练阶段同一条语音对应两个目标:口语目标保持原样,书面目标只在恰当数字处变化。模型收到语音加口语提示时学习输出前者,收到同一语音加书面提示时学习输出后者。部署阶段用户只换提示词,不换模型,就能在这两种合同之间切换。

这张范式对比图值得现在看,因为它把级联与联合的信息路径画得非常干净。上面是两段式,下面是一体两用式,中间的差别不在于模型更大,而在于规范化决策能否接触声学与上下文。

看图路径: 1. 先看上面(a) 分支:语音经识别得到口语形式,再经独立后处理得到书面形式,确认两阶段之间只有文本传递;2. 再看下面(b) 分支:同一段语音与口语提示或书面提示共同进入同一权重共享模型,按提示分叉输出两种形式;3. 对比两条路径的信息瓶颈:级联路径的归一化看不到声学,联合路径的归一化与识别共享同一模型

原论文 Figure 1:Comparison of ASR-ITN paradigms.

论文图 1。原论文 Figure 1::“Comparison of ASR-ITN paradigms. (a) Cascaded ASR decouples spoken-form recognition from written-form normalization by applying a separate ITN module after recognition.”。

上方面板(a) 从左到右是波形、识别、口语形式、后处理、书面形式,箭头单向传递,规范化模块的输入只是文本。下方面板(b) 从左侧同一波形分出两条提示支路,分别是口语提示与书面提示,汇入中间权重共享的大模型语音识别模块,再分出两种输出。像素中中间模块明确标注共享权重,说明两种形式不是 2 个模型,而是同一参数在不同条件下的两种行为。看完这张图再读方法,就能理解为什么论文强调不是从零重学声学识别,而是扩展已有的口语能力。

口语形式与书面形式如何分工又不互相污染

口语形式 × 书面形式: 口语形式负责忠实记录听到了什么,数字保持汉字说法,不把改变显示格式当成纠正声学识别;书面形式负责在可读显示时把应当规范的数字表达改成阿拉伯数字与规范单位,例如转换时长而保留固定短语中的汉字数词。两者搭配是因为混在同一条件下训练会导致输出形式不可控,因此用提示词把形式选择显式化,共享识别能力支撑两种部署模式,再由语义判断决定书面形式内哪些片段可改、哪些必须保留。这里描述的是训练目标,不保证任意语音都被逐字正确识别。

训练时每个保留样本贡献两个实例,形式完全由提示指定。论文用显式条件避免把口语与书面看成同一条件下的噪声变体,这是关键安排。如果不给提示而混在一起训练,模型会学到时而改时而不改的平均行为,部署时不可控。有了提示,声学部分的梯度可以共享,形式部分的决策由提示分支承担。

没有书面标注时,书面目标从哪里来

起点是已有语音识别语料中的语音与口语转写。目标是为每条语音生成高置信的书面对应句,且只允许局部数字相关片段变化。整个流程先把国家标准的操作化写成生成提示与判断提示,再用文本改写器提候选,用成对打分器打分过滤,最后加确定性规则清洗。

这张监督构造图把生成与裁判的分工画成自上而下的流水线,阅读顺序应当从顶部指南开始往下走,而不是只看左右箭头。虚线表示提示派生,实线表示文本流动,示例数字的变化幅度很小,正好对应受约束转换的要求。

看图路径: 1. 从顶部指南出发,看生成提示与判断提示如何同时由指南合成器派生;2. 沿左侧口语输入进入书面生成器,再向下经候选进入成对校验与过滤,最后落入三元组语料库;3. 核对示例“六月十五号”到“6 月 15 号”的局部变化,确认非数字上下文未被改写

原论文 Figure 2:LLM-driven generate-and-judge workflow for dual-form supervision.

论文图 2。原论文 Figure 2::“LLM-driven generate-and-judge workflow for dual-form supervision.”。

像素顶部是通用指南,向下进入指南合成器,再分出左侧生成提示与右侧判断提示。左侧口语形式进入书面生成器,示例把“六月十五号”改成“6 月 15 号”。候选向下进入成对质量校验与过滤模块,同时接受右侧判断提示的约束,最后落入过滤后三元组语料库,示例保留语音、口语与书面三者。图中 3 个蓝色模块右下角带有网络图标,表示大模型参与的位置,而最终产物是可用于训练的三元组集合。

生成器提候选、校验器打分、规则做清洗

生成器是纯文本改写器,只改逆文本规范化相关片段。形式上可以记为给定口语与生成提示输出书面候选,论文给出明确的候选生成式。

\[\tilde{y}_{i}^{w}=G(y_{i}^{s};p_{g}).\]

校验器是纯文本成对打分器,检查语义保持、恰当规范化与非规范化文本不变,给出质量分,超过阈值才保留。论文同样给出打分式,校验器采用 1–10 质量分,阈值设为 9,属于相当严格的筛选。保留集合记为三元组总体,每条包含语音、口语目标和书面目标。

生成器 × 校验器: 生成器是文本改写器,输入固定的口语转写,只改与逆文本规范化相关的局部数字片段并提出书面候选;校验器是成对打分器,检查候选是否保持原语义、是否只改了恰当片段、有没有动无关上下文。生成器负责提出可能性,校验器负责拦截语义漂移和大范围改写,两者搭配是因为开放式大模型生成容易过度发挥,必须把提出与把关分开,组合后得到的是可审计的高置信三元组,可直接展开为两种提示条件下的训练样本。

确定性清洗处理标点、空格、全半角和英文大小写归一,剔除含非法符号或明显非规范化改写的候选。被拒候选不作书面监督,因为它们可能包含不可验证的大范围变化,自动修复会引入额外假设。最终双形式训练集包含 14,230,000 条语句和 9574.7 小时,其中书面目标含阿拉伯数字的为 393,600 条、对应 417.2 小时,约占书面小时数的 4.4%。无数字语句的书面目标在基本文本归一后与口语相同,这保证模型见到大量不需要改的例子。

模型结构与参数谁动谁不动

模型沿用大模型语音识别结构:语音编码器加适配器加大模型解码器。声学表示被投影到大模型嵌入空间,再与文本提示嵌入拼接,由同一模型按提示生成两种转写。初始化使用 FireRedASR2,包含编码器、下采样率为 2 的线性适配器和 Qwen2-7B-Instruct 解码器。训练时语音编码器与适配器可训练,大模型解码器主体冻结,在该解码器各模块上加秩为 64、缩放为 16、丢弃率为 0 的低秩适配器。优化器为 AdamW,学习率为 2 乘 10 的负 5 次方,预热 4000 步,动态长度分批按 18000 词元组批,混合精度与梯度裁剪为 5,在 8 张显存 140 GB 的 H200 上训练 1 轮。

这张训练反馈图把序列优化的闭环画成左右两大块,左侧是模型与输入,右侧是奖励与候选表,顶部虚线回路表示策略梯度。阅读时先分清冻结与活跃,再看候选如何变成奖励。

看图路径: 1. 从左侧语音加提示与目标进入中间编码器适配器与大模型,区分冻结与活跃部分;2. 看右侧 N-best 表四条假设的字符错误率、抽取关键词、计数与两类奖励如何逐行变化;3. 沿顶部虚线策略梯度反馈环回到模型,确认序列奖励闭环的更新方向

原论文 Figure 3:DF-ASR training with dual-form CE and ITN-MWER.

论文图 3。原论文 Figure 3::“DF-ASR training with dual-form CE and ITN-MWER.”。

像素左侧输入框包含语音、提示文字与目标示例“今天是 6 月 15 号农历五月十三”。中间模型框内编码器与适配器标注活跃,分词器为独立模块,大模型标注冻结而旁边的低秩适配器标注活跃。右侧是提示条件化的最小词错率模块,左侧列出字符级转写奖励与关键词级规范化奖励,中间 N-best 表给出 4 条假设、字符错误率、抽取关键词、计数与两类奖励,最优假设奖励为 1.00,最差假设因漏改与错改而显著降低。顶部虚线明确标出策略梯度反馈环,说明奖励信号沿该路径更新活跃参数。图注说明为可读性只画 4 个候选,实际训练使用 16 个候选。

CER 奖励 × 关键词奖励: CER 奖励衡量整句字符级保真,计算为 1 减字符错误率,防止模型乱改无关文字;关键词奖励从假设与参考中抽取阿拉伯数字及其附带单位符号,用匹配、缺失和多余计算 F1,专门惩罚小数点、百分号和单位这类语义损失大的错误。两者搭配是因为只用字符级目标会低估数字错误,只用关键词目标会忽视上下文,组合后的 ITN 奖励同时保留通用转写保真和归一化敏感反馈,并在口语与书面两种提示下都计算,避免序列优化把双形式压成单一风格。

双形式交叉熵目标对两种提示条件分别求和,形式如下。

\[\mathcal{L}_{\mathrm{CE}}=-\sum_{i=1}^{M_{T}}\sum_{b\in\{s,w\}}\sum_{t=1}^{|y_{i}^{b}|}\log P_{\theta}(y_{i,t}^{b}\mid y_{i,其中符号分别对应语音、提示、参考前缀与当前词,目标拉近模型分布与成对目标的一致性,梯度经过可训练的编码器、适配器与低秩适配器,冻结的大模型主体不更新。

双形式交叉熵 × ITN-MWER: 双形式交叉熵是逐词似然目标,对同一条语音在口语提示和书面提示下分别计算下一词预测损失,建立提示到形式的映射;ITN-MWER 是序列级目标,对 N-best 候选按组合奖励相对基线的优势加权,强化整句数字与单位的正确性。双形式交叉熵负责把两种写法分开且稳定,ITN-MWER 负责纠正逐词训练不敏感的数字语义损失,两者搭配时保留交叉熵作稳定项,组合后实现在不破坏口语忠实行为的前提下继续打磨书面归一化。

数字关键词奖励定义为基于匹配、缺失和多余的 F1 形式,若双方都不含数字关键词则取 1,避免无数字句产生噪声。

\[R_{\mathrm{key}}(\hat{y},y)=\frac{2\mathrm{TP}}{2\mathrm{TP}+\mathrm{FN}+\mathrm{FP}}.\]

最终序列奖励是字符奖励与关键词奖励的加权平均,权重在完整系统中各取 0.5。

\[R_{\mathrm{ITN}}(\hat{y},y)=\frac{\alpha R_{\mathrm{CER}}(\hat{y},y)+\beta R_{\mathrm{key}}(\hat{y},y)}{\alpha+\beta}.\]

序列损失以 N-best 平均奖励为基线降低方差,并保留交叉熵作稳定项,权重为 0.2。两种提示下都计算奖励,口语侧的字符项防止不必要改写,书面侧的关键词项提供规范化反馈而字符项约束无关上下文不被改动。

数据、对照系统与指标方向如何约定

训练数据来自 WenetSpeech 的 14,610,000 条、9992.6 小时中文语音,经生成判断流程后保留 14,230,000 条。评估基准从 SpeechIO 按国家标准 GB/T 15835-2011 手工标注复核,分为必须改的 772 条、禁止改的 309 条含 332 个禁用片段,以及 1000 条无数字控制集。生成与判断提示模板由 Gemini 3.0 Flash 操作化该标准,生成器与校验器均用 Qwen3.5-35B-A3B 实现,校验打分 1 到 10 分,阈值为 9。

对照系统包括级联、级联加大模型后处理、开源直接识别与闭源模型。级联指口语识别后接 WeTextProcessing,级联大模型指 FireRedASR2 口语识别后接同系列大模型后处理。开源侧评估 FunASR-Nano 与 Whisper-large-v3,其中前者内部规范化策略未公开,只按相同协议比较行为。闭源侧评估豆包大模型语音识别与 Fun-ASR 1.5,均通过公开接口在 2026 年 6 月 10 日测得。

Require-ITN × Forbid-ITN: Require-ITN 负责考核必须改的片段是否改对,包含 772 条应当规范化的语句,用 ITN 相关区错误率和关键词 F1 衡量;Forbid-ITN 负责考核禁止改的片段是否保住,包含 309 条语句中 332 个手工标记的禁用片段,覆盖成语、固定表达、专名、历史用语、约数和词汇化数字短语,用保留率衡量。两者搭配是因为只看必须改会鼓励见数就转,只看保留会鼓励一律不转,组合后才能暴露漏改与过度归一化这两种互补失效。

指标方向需要先记牢。必须改侧报告字符错误率、逆字符错误率、非逆字符错误率和数字关键词 F1,前三者越低越好,最后者越高越好。其中逆错误率聚焦规范化相关区,非逆错误率检测无关改写。禁止改侧报告字符错误率与禁用片段保留率,前者越低越好,后者越高越好。保留率定义如下。

\[FSPR{}=1-\frac{N_{\mathrm{itn}}^{f}+N_{\mathrm{oth}}^{f}}{N_{\mathrm{span}}^{f}}.\]

其中分子是被错误转成含数字书面形式的片段数加上其他删除替换或不完整保留数,分母是禁用片段总数。评估时英文字母统一为大写,避免仅大小写差异带来惩罚。

必须改的片段是否改对,无关文字是否被连带改坏

这张主结果表要回答的核心比较问题是,在相同的必须改与禁止改协议下,一体化双形式模型相对级联、开源直接系统和闭源参考,是否在改对数字的同时不破坏无关上下文。统一条件是手工标注的中文子集与书面提示,指标方向为逆错误率越低越好、关键词 F1 越高越好、保留率越高越好。原表单位仅写在表头,数据格为裸值,此处保留该写法。

系统必须改 I-CER(%)越低越好必须改 NI-CER(%)越低越好必须改 CER(%)越低越好关键词 F1(%)越高越好禁止改 CER(%)越低越好禁止改保留率(%)越高越好
级联 WFST8.192.003.0989.7112.3725.60
级联大模型6.722.443.1992.314.6786.45
FunASR-Nano58.765.7615.1154.635.3295.18
Whisper-large-v36.565.075.3392.819.4277.11
豆包大模型语音识别2.472.082.1595.813.5693.98
Fun-ASR 1.54.352.092.4994.484.8486.45
DF-ASR4.641.862.3594.853.6795.18

相对 WFST 级联,双形式模型把逆错误率从 8.19% 降到 4.64%,整体错误率从 3.09% 降到 2.35%,关键词 F1 从 89.71% 提升到 94.85%,且非逆错误率保持在全部系统中最低的 1.86%。这说明收益不是靠乱改无关文字换来的。Whisper 关键词 F1 有竞争力,但非逆错误率高达 5.07%,表明其书面输出动了太多规范化区之外的文字,这正是非逆指标的价值。

未胜出的位置也要交代。豆包在必须改整体错误率和关键词 F1 上最好,分别为 2.15% 与 95.81%,双形式模型落后但保持可比,且提供可检查的训练与评估流程。这张表不能推出开源方法已全面超越闭源产品,因为闭源系统可能受益于私有数据与长期规范维护,论文也明确这是外部参考而非同配方对照。

另一个反例是 FunASR-Nano,它在禁止改保留率上与双形式模型并列最高,但必须改关键词 F1 仅 54.63%。这种保守策略保住了禁用片段,却错过大量应当规范化的数字,恰好说明必须同时看两张子表,否则会被单一高分误导。

禁止改的片段是否保住,无数字时会不会凭空造数

禁止改侧的比较问题是模型能否识别语义受限表达并拒绝转换。WFST 级联保留率仅 25.60%,说明规则转换见数就转,破坏成语与固定说法。级联大模型把保留率提高到 86.45%,但仍低于双形式模型的 95.18%。双形式模型在禁止改字符错误率为 3.67%,略高于豆包的 3.56%,但保留率高出约 1.2 个百分点,这组交叉说明整体字符准确与禁用片段保留是两个不同能力,必须分开考核。

无数字控制集回答的是回归问题:书面提示会不会在不需要时触发数字生成。下表条件是 1000 条不含数字的语句,统一用书面提示解码,指标为整体错误率越低越好与虚假数字插入率越低越好。

系统CER 越低越好虚假数字插入越低越好
FireRedASR2 骨干2.92%0.00%
DF-ASR3.07%0.00%

双形式模型相对骨干仅上升 0.15 个百分点,且双方虚假插入均为 0.00%,支持双形式微调没有明显损害普通识别行为,也不支持书面提示会无条件造数的担忧。这张表不能推出模型在所有无数字场景都零风险,因为它只覆盖采样到的 1000 条,且评估的是插入率而非全部风格漂移,但至少给出一个可复核的非回归检查。

监督质量与奖励分量各自贡献了什么

消融要回答两个分离问题:监督构造的收益中有多少来自大模型生成、有多少来自校验过滤;序列优化的收益中有多少来自字符保真、有多少来自关键词反馈。监督来源比较使用各自目标训练 SFT;目标函数比较才在已验证双形式监督微调之后继续优化,奖励权重分别取纯字符、纯关键词与各半组合。

变体奖励权重I-CER 越低越好关键词 F1 越高越好禁止改保留率越高越好
规则目标微调无8.2889.1726.20
未验证大模型目标微调无6.6393.5095.48
已验证双形式目标微调无5.1094.2695.18
加普通 MWER1,04.8794.8095.18
加纯关键词 MWER0,14.9694.6794.88
加 ITN-MWER0.5,0.54.6494.8595.18

监督侧规则目标继承上下文无关的转换决策,保留率仅 26.20%。未验证大模型目标保留率最高达 95.48%,但逆错误率仍有 6.63%,表现为过度保守:保住了禁用片段,却漏掉必须改。已验证目标把逆错误率降到 5.10%,关键词 F1 升到 94.26%,保留率略降到 95.18%,得到更好的改与保平衡。

目标侧纯字符优化改善通用保真,纯关键词优化过度聚焦数字词,组合奖励取得最好的逆错误率与关键词 F1,且保留率不下降。这支持序列优化需要同时保留两类反馈的判断。需要注意消融只报告这三项指标,没有给出非逆错误率在各变体下的完整变化,因此不能用这张表断言无关改写已完全受控,主结果中的非逆最低值仍需回到主表核对。

案例表进一步展示语义决策不是局部替换。时长与描述经济停滞的固定短语虽然都含汉字数词,书面模式只转换前者;公历日期采用数字写法,农历表达按约定保留。这些对照保留的是作者的改与不改决策,表中不重新排印口语逐字转录。复杂数量例子的确切小数 0.9999995 未出现在训练中,书面输出仍能正确呈现小数、幂次与百分比。这是论文给出的单个组合泛化案例,不代表所有未见数字都已验证。

案例语义口语/保留条件书面条件下的实际决策
时长与固定说法口语采用汉字数词;固定表达保留时长采用数字写法;固定短语中的汉字数词保持不变
未见小数与复杂数量口语保留汉字数词,且幂次词出现“密了”的同音误识别小数、幂次与百分比均正确输出;确切小数见表前说明
公历与农历两类日期在口语模式中均为口语写法公历转为数字写法,农历表达保留

这张表整理的是原论文案例的决策摘要,不是逐字转录全文,也不能当作总体定量证据,它只说明模型具备上下文相关的改保能力与对未见数值的组合能力,且口语输出第二例仍有“密了”这类识别错误,提醒读者声学错误依然存在,只是书面决策没有被它完全带偏。

边界在哪里,哪些结论不能延伸

论文明确限定为离线中文语音识别的逆文本规范化。英文或多语言扩展需要各自的规范约定与评估集,不能把中文的改保规则直接平移。即使经过校验的监督仍可能残留数字错误,因为大模型判断与确定性清洗只能拦截明显无效样本,无法保证每个数值完全正确。

实验边界同样具体。闭源比较依赖 2026 年 6 月 10 日的公开接口快照,接口版本变化后数字可能不再可比。训练预算为 8 卡 H200 上 1 轮,推理延迟、流式改造与部署成本没有报告,不能从参数冻结或低秩适配直接推定全程开销。评估侧禁用片段共 332 个,覆盖成语、专名和约数等类别,但未覆盖全部开放域例外,保留率的高分只在该标注分布内成立。

方法上也有未验证点。阈值取 9 分、奖励各半与稳定权重 0.2 是作者选定的可运行配置,消融只比较了奖励分量的 3 种组合,没有搜索阈值与权重的完整曲面。把这些超参数说成最优会超出证据,只能说它们在当前数据与协议下给出报告的最优平衡。

要复现先做什么,常见误解如何避开

复现的第一步不是直接训练,而是重建数据契约。按国家标准把指南操作化为生成提示与判断提示,用同一大模型分别生成候选与 1 到 10 分打分,仅保留 9 分以上,再做标点、空格、全半角和大小写归一并剔除非法符号。每个保留样本展开为口语与书面两个训练实例,提示显式指定形式,无数字语句的书面目标与口语保持一致。

第二步是按冻结关系搭建模型。复用 FireRedASR2 编码器与 Qwen2-7B-Instruct 解码器,冻结解码器主体,训练编码器、适配器与大模型解码器中的低秩适配器。先用双形式交叉熵建立提示到形式的映射,再用 16 候选的序列优化继续打磨,完整权重取字符与关键词各半,稳定权重取 0.2。评估时英文字母统一大写,分别计算必须改的逆错误率与关键词 F1、禁止改的保留率,以及无数字集的虚假插入率。

3 个误解值得提前纠正。其一,书面提示不是美化开关,它只在语义允许时改数字,成语与农历等禁用片段应当原样保留。其二,大模型裁判不是正确性证明,它只是训练目标构造中的可扩展质量控制,随后还有确定性清洗,残留错误仍需承认;人工标注复核用于评估集,原文未声称全部训练三元组经过人工验收。其三,保留率与整体错误率不能互相替代,低整体错误仍可能伴随过度归一化,这正是协议把两者分开的原因。

什么条件下值得尝试,一句话收束

当部署同时需要忠实存档与可读显示,且数字错误代价高于普通错字时,这套双形式思路值得尝试。它用一份声学能力支撑两种输出,用提示解决形式选择,用语义判断解决改或不改,再用分开考核防止为可读性牺牲固定表达。复现时优先保证成对数据的局部性与校验严格度,再考虑序列奖励的权重搭配。

回到中心矛盾:见数就转会伤害成语与专名,一律不转会损害可读数量。论文的回答是把形式选择交给提示,把数字决策交给上下文,并在必须改、禁止改和无数字 3 组条件下分别验收。报告显示一体化模型在必须改上显著优于规则级联,在禁止改上与最保守的开源行为并列最高且保持更高的必须改 F1,同时在无数字集上不引入虚假数字。未被证明的是跨语言通用性、流式实时性与长期维护成本,这些需要新的规范、数据与延迟测量才能判断。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-04 语音/音乐/音频论文速递