英文题目:Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR

会议身份:conference:interspeech:2026:conference-paper-id:kordt26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#持续学习 #可解释性 #语音 #语音识别

评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Henri-Leon Kordt:机构信息未能从会议 PDF 纯文本可靠映射
  • Theresa Pekarek Rosin:机构信息未能从会议 PDF 纯文本可靠映射
  • Jae Hee Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Stefan Wermter:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为含填充词、重复修正、中断和停顿的自发与病理语音,输出为保留不流利标记的逐字转写,难点在于主流识别系统倾向清洗输出并在小数据适配时遗忘通用能力。该工作先在预训练骨干中引入填充词、重复、中断和停顿四类标记并在马来西亚英语语料上微调以建立标记发射机制,其输出的带标记检查点作为后续持续学习的统一起点。接着以选定检查点为起点在Pitt和Delaware语料上按固定顺序适配以模拟域漂移,并对比弹性权重巩固、经验回放、梯度投影与权重平均在记忆稳定性和学习可塑性上的差异。最后用解码器交叉注意力头重要性排序与置零掩膜消融检验标记是否形成专用回路,成功学习标记的方法共享同一小组交叉注意力头且掩膜可选择性抑制标记发射而基本不损伤通用字错率。在Pitt和Delaware顺序适配后的三数据集联合评测下,经验回放的A-F1为0.49±0.01,高于直接微调的A-F1 0.39±0.02。该结论仅在单骨干、单语英语TalkBank序列和固定任务顺序下验证,对其他架构、语言与增量顺序的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么主流识别系统听不见犹豫?

输入是带犹豫、重复、修正、咳嗽笑声和停顿的连续语音,目标是既给出可懂的文字,又不丢掉这些不流利事件。刚入门容易以为识别就是把声音变成干净文本,但论文指出的现实是,大规模弱监督模型为了可读性被优化成省略不流利,结果是信息丢失和幻觉,也就是音频里没有的内容被模型补出来。必须保留的信息是:不流利不是噪声,它有临床意义,也影响时间戳对齐和下游任务。输出因此不是清洗版文本,而是带显式标记的逐字转写。

学习依赖是先理解任务定义,再看标记如何进入词表,再看持续学习如何防止学新忘旧。本文用 whisper-small.en 做骨干,只研究英语 TalkBank 三库,不涉及新声学前端。执行顺序是先在最接近骨干的语料上建立标记机制,再按难度递增顺序做持续适配并用注意力探测解释机制。本文没有公开代码、模型或数据的可用声明,本次也未能确认可达,复现只能按文字条件重做。

同任务的已有路线分歧在哪里?

同输入同目标的路线是逐字转写和犹豫标注。论文引用了声学精确的犹豫标注对端到端逐字系统必要、CrisperWhisper 做精确时间戳、WhisperD 同时做痴呆语音识别和填充词检测,这些都说明把填充词和停顿写出来有助于保留信息和对齐。另一条同目标路线是按说话人个性化,例如针对紊乱语音采集大规模数据,但对小数据和隐私受限场景不通用。同监督的路线是引入显式标记,已有工作把类似标记用于痴呆检测和自发语音改进。

同运行阶段的路线是持续学习做领域自适应,已有工作用于非标准语音和低资源语言,但论文报告尚未用于不流利或受损语音。类别差异不能当同条件胜负:个性化解决单人适配,逐字标记解决事件保留,持续学习解决顺序多域不遗忘,本文是把后两者组合起来,先解决标记能否稳定发出,再解决多分布下能否记住。

小数据引入标记为什么容易顾此失彼?

问题可以沿一个样本走完。输入一段马来西亚英语学生的发言,含多个 um 和单词重复。表示是 CHAT 转写格式的人工标注,里面已用统一语法标出不流利。组件是预训练解码器,它原来没有这 4 类标记,输出习惯是跳过 um 直接给流畅句。目标是让模型在不破坏通用识别的前提下学会输出 FILLER、REP、DISRUPT、PAUSE 4 类符号。

若直接在小库上微调,模型会用改动通用参数的代价去记标记,表现为通用测试集词错率上升,这就是灾难性遗忘。朴素联合训练要每次都带上全部预训练数据,对随时间变化的语音和受限的不流利数据不可行。因此问题不是标记本身难写,而是标记学习与通用性能共享同一套参数更新预算,执行中必须同时看内容错误率和标记保留率才能判断是否真学会。

两阶段持续适配的全景是什么?

方法全景分两步。第一步是不流利标记引入,在最接近骨干领域的 SME 上微调,同时比较微调、弹性权重巩固、经验回放、平均梯度约束和权重平均 5 种策略,看谁能在学会标记的同时保住 LibriSpeech 干净语音性能。第二步是顺序持续适配,从第一步选出的能稳定发标记的检查点出发,按 Pitt 再 Delaware 的顺序继续训练,模拟真实中模型遇到更难分布和更稀疏标记的过程。

全程用预处理词错率看内容对错,用标记 F1 看事件保留,用平均误差、增量平均、后向迁移、遗忘度、前向迁移和内在性度量看记忆稳定性和学习可塑性。可解释性分支并行探测解码器交叉注意力头,判断标记是否形成少数头特化。教学例子是:先让模型学会听见 um,再考它在痴呆老人和轻度认知障碍语音中还能不能留住 um 并继续认清内容,公平比较要求同一骨干、同一顺序和同一评测划分。

四类标记和四个持续学习组件各管什么?

4 类标记是把 TalkBank 人工标注聚合后的词表扩展。填充词管 um、uh 这类填充,重复修正管词级和音素级重复改口,中断管咳嗽笑声等突发事件,停顿管静音犹豫。持续学习 4 组件分工不同。弹性权重巩固用对角 Fisher 信息矩阵估计旧任务重要参数并惩罚其更新。经验回放保留旧数据一小部分组成回放缓冲并混入新任务批次。

平均梯度约束计算回放梯度与当前梯度的点积,惩罚方向相反的更新。权重平均保留旧权重,训练新副本后取两者平均作为更新后模型。评估侧用预处理词错率和标记 F1 分别看两类能力,前者在算前去掉标点、特殊字符和不流利标记,后者用词袋方式算标记命中。

逐字转写 × 不流利标记: 逐字转写负责把犹豫、重复、中断和停顿都写出来而不做清洗,不流利标记负责给这 4 类事件提供可学习的词表符号,二者搭配的理由是只有把事件变成显式目标,模型才能在解码时保留临床和对齐信息,组合意义是把删除式识别改为可评估的标记预测任务。

沿样本走完就是:音频进入 Whisper 编码器,解码器在生成文字的同时在犹豫处生成 FILLER 等符号,最终输出带标记序列,评测时去掉标记算词错率,保留标记算 F1。组合原因是标记负责把事件显式留住,持续学习负责让新旧分布共存,两者缺一都会回到要么丢事件要么忘旧域。原文未给出标记嵌入初始化和词表扩展细节,这是复现缺项,不能从模型名推定实现。

数据、划分和更新条件如何固定?

训练对象是 whisper-small.en 单语小模型。数据是 SME 的 11.79 小时马来西亚大学生二语英语、Pitt 的 21.30 小时老年痴呆与阿尔茨海默语音、Delaware 的 9.72 小时轻度认知障碍语音,其中 Pitt 在持续学习中只用 12.11 小时以减小尺寸效应。Pitt 和 Delaware 的健康对照各取一半分入训练和验证。划分是每库按说话人不相交的八二开。回放缓冲从每库训练集随机采 10%,贪心优先稀有标记使分布贴近全集,并另取一小部分 LibriSpeech 代表无扰动语音。

每个数据集训 10 轮,学习率 2e-5,批量 16,每批旧数据占 25%,弹性权重巩固重要性参数为 1000,结果平均 3 个随机种子。顺序是 SME 引入标记,再 Pitt 引入大量停顿和更多中断,再 Delaware 考验标记稀疏下的保持,执行时所有方法都从同一已会发标记的检查点出发以保证起点公平。

灾难性遗忘 × 持续学习: 灾难性遗忘指在小规模不流利数据上微调时通用语音性能快速丢失,持续学习负责用正则、回放或权重平均约束更新方向,二者搭配的理由是新分布必须学但旧能力不能丢,组合意义是把一次性微调改为分阶段可保留的领域递进适配。

经验回放 × 权重平均: 经验回放分工是保留旧任务一小部分样本并混入当前批次以稳定梯度,权重平均分工是保留旧权重并与新权重插值以稳定参数,二者搭配的理由是分别从数据侧和参数侧限制漂移,组合意义是本文对比了保留标记与保留词错率的不同取舍。

该节明确报告了冻结与更新的只有权重平均保留旧权重、回放混入旧样本等机制性描述,未报告层冻结、梯度停止位置和解码器与编码器分别更新比例,缺项如实保留,复现时不应自行补设定。

用什么数据分布和指标组织两组实验?

实验按两个问题组织。标记引入实验测能否在 SME 上学会 FILLER 和 REP 并保住 LibriSpeech 测试集性能,对比骨干、直接微调和 4 种持续学习方法,指标方向是预处理词错率越低越好、微平均 F1 越高越好。顺序适配实验测从已会发标记的检查点出发,经 Pitt 和 Delaware 后通用识别与标记保留如何变化,对比联合训练上限、直接微调和 4 种持续学习,指标是平均词错率、增量平均词错率、后向迁移、遗忘度、前向迁移和内在性,以及分类型标记 F1。需要先看清三库的不流利构成,否则无法理解为何 Pitt 难、Delaware 考验保持,比较时百分比按各数据集自身分布计算,不能跨行直接比绝对计数。

下面这段导读帮你带着比较问题看图:三行分别是 SME、Pitt、Delaware,四列是 4 类标记,格内同时有百分比和计数,颜色越深占比越高,重点是各行主导类型是否相同以及 Pitt 是否带来新分布。

看图路径: 1. 先看行标签确认三个数据集,再看列标签确认四类标记;2. 比较每行内颜色最深格,确认各数据集的主导不流利类型;3. 对照格内百分比与计数,确认 Pitt 的 PAUSE 和 DISRUPT 明显多于另两行;4. 记住 SME 以 FILLER 和 REP 为主,为后文只引入两类标记做铺垫

原论文 Figure 1:The distribution of disfluencies across the selected datasets.

论文图 1。原论文 Figure 1:“The distribution of disfluencies across the selected datasets. Percentages are calculated with respect to each dataset’s distribution.”。

该热力图显示 SME 集中在填充词 4642 例占 53.6% 和重复修正 3526 例占 40.7%,中断和停顿很少。Pitt 分布最均衡且停顿达 2037 例占 24.6%、中断 989 例占 11.9%,是难度来源。Delaware 填充词高达 66.6% 共 2209 例但总量最少、停顿仅 79 例占 2.4%,因此考验在稀疏信号下不遗忘。百分比按各数据集自身分布计算,不能跨行直接比绝对计数。这就解释了实验顺序的设计理由,即先学常见两类再迎难分布最后考稀疏保持。

标记学会了吗,通用识别付出了什么?

先看标记引入的主结果,比较问题是同训练轮数和同评测下谁保通用、谁学会标记,公平条件是同一骨干、同一 SME 训练、LibriSpeech 干净集衡量保持,指标方向是两类词错率越低越好、标记 F1 越高越好。

下表整理了原文报告的骨干、直接微调与 4 种持续学习在 SME 词错率、LibriSpeech 词错率和 SME 标记微平均 F1 上的表现,单位与精度保留原文写法,表头单位覆盖整列、数据格保留裸值写法。

方法SME(pWER% ↓)LibriSpeech(pWER% ↓)SME 标记微平均 F1 ↑是否稳定发出标记
骨干15.973.470.00否
直接微调12.21±0.185.06±0.020.73±0.01是
平均梯度约束12.17±0.174.39±0.070.75±0.01是
经验回放12.47±0.034.55±0.130.73±0.01是
弹性权重巩固10.34±0.474.43±0.070.21±0.07弱
权重平均9.64±0.083.41±0.010.00±0.00否

表后解释是收益与代价并存,需要把内容正确性和事件保留分开看。权重平均在 SME 上最低词错率且 LibriSpeech 保持最好,但标记 F1 为 0,完全没有发出标记。弹性权重巩固 SME 词错率好于直接微调,但标记 F1 仅 0.21,属弱发出。直接微调、回放和梯度约束标记 F1 在 0.73 到 0.75 之间,但 SME 词错率停在 12% 左右,LibriSpeech 也升到 4 以上。未胜出项是权重平均,它证明总体词错率最优不等于任务成功。论文据此报告标记训练与词错率存在权衡,支持需要改动通用适配低成本参数才能学会标记的解释,执行顺序上必须先选出能稳定发标记的检查点再进入顺序适配。

预处理词错率 × 标记 F1: 预处理词错率分工是去掉标点、特殊字符和不流利标记后衡量通用可懂度,标记 F1 分工是用词袋方式衡量 4 类标记是否发对,搭配理由是前者看有没有说错内容,后者看有没有听见犹豫,组合意义是二者必须同时报告才能暴露本文的核心权衡。

顺序适配中所有持续学习方法的平均词错率都低于直接微调基线,除梯度约束外标记 F1 也更高,但最优者分裂:权重平均平均词错率 18.90% 最好,回放标记宏平均 F1 为 0.49 最好。干净语音保持排序与不流利保持一致,权重平均 4.68%,弹性权重巩固 6.45%,回放 7.14%,梯度约束 8.36% 几乎与直接微调 8.37% 持平。分类型看填充词最稳健而重复修正方法敏感性最强,停顿最难但回放仍有优势,这与三库分布差异和稀疏保持的考验相互印证。

少数注意力头是不是标记的专用电路?

消融问题是标记能力是否有可定位的内部机制,以及该机制是否随持续学习方法而变。操作是按 Michel 等人的头遮蔽思路,为每个注意力头引入可学习标量门,计算标记目标对门灵敏度并在标记实例集上平均得到头重要性,再算进入前十排名的频率相对普通词基线的提升值,最后对提升值最高的 5 个头做置零遮蔽,看标记发射量与预处理词错率的变化。公平条件是对所有能发标记的方法平均,并在训练集上计算提升值。

下面导读帮你看跨注意力热力图:左右两幅分别是填充词和重复修正,横轴头、纵轴层,红色为正提升、蓝色为负,重点看红色是否集中在少数格以及左右是否重合。

看图路径: 1. 先确认横轴是头编号 H、纵轴是层编号 L,左右两幅分别为 FILLER 和 REP;2. 观察中层偏红的少数格,确认特化集中而非全层均匀变红;3. 对比左右两幅红色位置的重合度,判断共享机制的证据强度;4. 注意底部深蓝区域,确认深层头对标记相对不重要

原论文 Figure 2:Top-10 lift scores for FILLER (left) and REP (right) across decoder cross-attention heads…

论文图 2。原论文 Figure 2:“Top-10 lift scores for FILLER (left) and REP (right) across decoder cross-attention heads computed on the train split averaged across all token emitting methods.”。

解释是只要成功学会标记,少数解码器交叉注意力头被一致分配给标记发射,左图填充词和右图重复修正的红色集中位置高度重合,且跨方法平均后仍可见,支持共享机制而非方法各自发明新策略。深层多为蓝色说明深层头对标记相对不重要。原文用遮蔽验证因果:遮掉填充词前 5 头则填充词发射相对减少 57.0±5.2%,重复修正仅降 7.1±3.8%,词错率仅升 0.42±0.64%。遮掉重复修正前 5 头则重复修正降 15.7±4.2%。遮掉两者并集则分别降 62.2±5.2% 和 21.2±9.8%,词错率升 0.44±0.68%。

随机 5 头对照几乎无影响。限制是像素不能精确读出每个红格的层头编号,原文亦未给出完整编号表。

交叉注意力头 × 头重要性提升值: 交叉注意力头负责在解码每一步从编码语音中取信息,头重要性提升值负责度量某头进入不流利词前十重要排名的频率超出普通词基线的程度,二者搭配的理由是要区分总体有用与标记专用,组合意义是把平均误差之外的内部策略差异变成可遮蔽验证的因果证据。

该结果支持标记有专用电路且与普通词生成可分离,但原文只做了发射量与词错率对照,未测量误判率和延迟,不能承诺遮蔽无其他副作用。

哪些边界没有测,不能推广?

论文直接报告的局限是只用单个骨干和单一现实任务顺序。未验证的推测是换更大或多语模型、换 Delaware 先 Pitt 后的顺序、换自发会议语音时结论是否成立,这些待验证。数据侧 Pitt 只取 12.11 小时,尺寸效应只是减小而非消除。指标侧词袋 F1 不看顺序,预处理词错率去掉标记后评测,二者都不是人工可懂度评价。方法侧弹性权重巩固和权重平均在引入阶段几乎不发标记,说明强保持策略可能抑制新符号学习,但这只是该配置下的观察,不能推广为所有正则方法必然如此。

资源侧原文未报告训练时长、显存、推理开销和输出帧率,总体趋势不等于每步都成立。相关性不是因果:共享注意力模式与成功标记学习共现,不能证明只要固定这几个头就能学会标记。

要复现先固定什么,再补哪项验证?

复现先固定信息条件。骨干用 whisper-small.en,词表扩展出填充、重复修正、中断、停顿四符号,聚合规则按原文例子实现。数据用 TalkBank 的 SME、Pitt、Delaware 统一 CHAT 格式,Pitt 持续阶段取 12.11 小时,对照组对半分入训练验证,全部分割保证说话人不相交。训练用每库 10 轮、学习率 2e-5、批量 16、每批旧数据占 25%、回放缓冲为训练集 10% 并贪心优先稀有标记、弹性权重巩固重要性 1000、3 个种子平均。评测同时算预处理词错率和标记 F1,再算平均词错率、增量平均、后向迁移、遗忘度、前向迁移和内在性。

顺序适配必须从 SME 标记检查点出发,原文选的是平均梯度约束第二种子,不能换成权重平均检查点,否则起点就没有标记。还需补的验证是给出标记嵌入初始化、分词器改动和解码约束,报告硬件预算和解码延迟,并在验证集上报告分类型精确率召回率以排除词袋 F1 的顺序盲区。资源状态是没有发现来源绑定且完成验证的资源,不得声称代码模型数据已公开。

何时值得尝试这种做法?

当任务要求保留犹豫且只能顺序拿到小规模标注语音时值得尝试。分类型结果可指导选择:下表是顺序训练后三库合并上的分类型标记 F1,方向越高越好,可见填充词最稳、重复修正方法敏感、停顿最难而回放优势明显。

方法填充词 F1重复修正 F1中断 F1停顿 F1总体特点
联合训练0.71±0.010.54±0.020.42±0.020.25±0.02参考上限
直接微调0.69±0.020.42±0.020.34±0.000.09±0.06遗忘明显
平均梯度约束0.68±0.010.35±0.030.34±0.030.05±0.02标记最弱
经验回放0.75±0.010.61±0.000.38±0.010.23±0.02标记最好
弹性权重巩固0.72±0.010.49±0.020.37±0.020.16±0.01中间
权重平均0.73±0.000.63±0.010.37±0.010.09±0.01词错率稳但停顿弱

表后判断是目标决定方法。若首要目标是标记泛化保留,选经验回放,它在标记后向迁移 0.01 和遗忘度 0.02 上几乎不忘。若首要目标是不流利与干净语音的词错率稳定,选权重平均,它平均词错率最低、遗忘最小但可塑性低、停顿仅 0.09。常见误解是把词错率低当成全胜,本文显示权重平均在引入阶段标记为零,说明必须双指标验收。未来工作是组合两类优势并设计兼顾域适应与标记保留的方法,复现时不要把事后最优当可部署收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总