英文题目:Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models

会议身份:conference:interspeech:2026:conference-paper-id:huang26c_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#自回归模型 #形式化分析 #测试时自适应 #语音识别

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Wei-Ping Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Chee-En Yu:机构信息未能从会议 PDF 纯文本可靠映射
  • Guan-Ting Lin:机构信息未能从会议 PDF 纯文本可靠映射
  • Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

测试时自适应(Test-Time Adaptation,TTA)需在无监督条件下对单条语音输入 q 即时优化模型,再输出转写序列 y,自回归依赖使序列空间组合爆炸而难以直接最小化预测熵。论文先证明词元级熵估计器的无偏性,再对序列级与词元级估计器分别求期望梯度,得到可采样的完整梯度表达式并转化为可优化损失。适配时对每条语音采样 G 条候选转写,估计序列或词元熵后用策略梯度项加熵路径梯度项更新层归一化参数,多步迭代后贪婪解码输出最终结果。与仅优化词元熵的教师强制启发式相比,该完整目标同时校正轨迹概率与分布锐度,避免遗漏采样分布随参数的变化。在受损Librispeech十种噪声评测条件下,EM-tok-b的WER为19.15%,低于未适配源模型的WER 22.53%。该结论适用边界受限于情景式单样本适配与Whisper语音识别验证,波束搜索变体为有偏估计且在小域偏移与部分语言上增益有限,跨模型架构与流式部署等外推尚未验证。多采样多步迭代带来明显推理开销,原文在单卡RTX 3090硬件上报告每1秒语音适配需数秒量级延迟。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,测试时还要学什么?

本文的输入是一条测试语音,记为 q,目标是在没有真实转写的情况下让自动语音识别模型对这条语音更确定、更准确。学习对象是 Whisper 这类自回归基础模型的参数,在推理前用无监督目标对单条样本做若干步更新,推理结束后再把参数重置,这就是文中采用的片段式测试时自适应。必须保留的信息是这种适应的信息条件:只能看到测试语音本身,不能访问源训练数据,不能获得人工标注,只能用模型自身的输出分布构造信号。输出是适应后模型用贪心解码给出的最终转写,用词错率评价,词错率越低越好。

测试时自适应 × 熵最小化: 测试时自适应负责在只有单条测试语音可用时继续更新模型以应对分布偏移,熵最小化负责在没有标注时提供无监督目标即让预测分布更确定,二者搭配的理由是测试阶段无法获得真实转写,只能用自身不确定性作为可优化的代理信号,组合意义是把适应问题转化为对每个测试样本最小化输出熵的在线优化问题。

对于刚进入语音领域的读者,白话理解是模型在训练后进入了噪声、口音或新语言环境,听得不再准,测试时自适应允许它在正式作答前先听几遍当前这句话并微调自己。熵最小化就是让它少犹豫:如果对同一句话能产生很多互相矛盾的转写,说明分布很散,熵高;如果所有概率集中在少数转写和少数词上,说明很确定,熵低。

论文要解决的矛盾是,这种思想在分类任务中很直接,但在自回归生成中预测是整条依赖相关的词序列,如何求导、如何估计熵,过去存在两种互不相通的做法。本文默认从原文独立写作,不继承其他解读,资源状态方面本次没有发现来源绑定且完成验证的资源,因此不声称代码模型或数据已公开。

已有路线为何分成两派?

相关工作按同输入同目标对照可分为 3 类。第一类是视觉与非自回归语音中的熵最小化,例如对批归一化参数做熵最小化,或对 wav2vec2 加 CTC 这类帧独立模型按帧求熵和,这类分布是独立分类变量的集合,梯度直接可算,不涉及序列依赖。第二类是自回归上的教师强制启发式,先用贪心解码产生伪标签,再把测试输入与伪标签拼接作为完整输入序列,最小化伪标签各位置上的输出分布熵,自然语言处理中的单样本熵最小化、语音中的 SGEM 与 CEA 以及面向语音语言模型的 SLM-TTA 都属于此派。第 3 类是强化学习视角,把熵当作代价用策略梯度优化,近期大模型推理工作中的语义熵与系统比较工作属于此派。

教师强制 × 强化学习: 教师强制范式负责用贪心解码得到伪标签再把伪标签拼接到输入后最小化各位置的词元熵,强化学习范式负责把熵当作标量奖励或代价用策略梯度优化,搭配理由是论文证明前者只对应完整目标中的熵损失项,后者只对应完整目标中的策略梯度项,组合意义是澄清二者不是竞争方法而是同一正确目标的两个不完整投影。

论文指出两派各自只实现了正确梯度的一部分。教师强制只优化了词元熵本身,没有考虑参数变化会改变采样到这些轨迹的概率;强化学习只优化了轨迹概率,没有直接让词表分布变尖。序列级变体之所以恰好正确,是因为其第二项数学上恒为零,只剩策略梯度一项。本文的统一视角就是把两派放回同一个求导结果中检验,从而为自回归模型的熵最小化提供可核对的基准。

自回归让熵最小化难在哪里?

困难来自预测对象不是单个类别而是长度可变、以结束符结尾的序列集合。记所有有限长且以结束符结尾的序列集合为输出空间,模型对输入 q 的输出分布记为条件分布,任一条序列的概率是各步条件概率的连乘。熵定义为对该分布求期望的负对数概率。直接按分类方式写熵并求导会遇到双重依赖:期望的采样分布依赖参数,被期望的估计值本身也依赖参数。对乘积求导必须用乘积法则展开,否则会漏项。

过去的启发式恰好是各漏一项:一种固定采样轨迹只对估计值求导,另一种固定估计值只对采样概率求导。教学例子是设想模型对一句带噪语音产生 16 条不同转写,若只让每条轨迹内部的词分布变尖,模型仍可能把高概率赋给高熵的坏轨迹;若只调整轨迹概率而不让词分布变尖,模型仍可能在每个位置上犹豫不决。只有同时做两件事,才对应熵期望的完整变化率。

完整目标的全景是什么?

论文先建立两种熵估计,再分别求导。序列级估计是对采样到的整条序列计算负对数概率,即各步对数概率求和取负,它按定义就是无偏的。词元级估计是对采样序列的每个前缀位置计算词表分布熵再求和,论文用单调收敛定理与全期望公式证明在熵有限时它同样无偏,这是后续词元级求导的合法性基础。

求导时对词元级估计的期望应用乘积法则与对数导数技巧,得到两项:词元熵估计作为停止梯度的系数乘以序列对数概率的梯度,以及词元熵估计本身的梯度。对序列级估计的期望同样展开,但可证明第二项对全空间积分为零,因此只剩策略梯度一项。两种形式在梯度期望上都正确,但优化行为与实现细节不同。

以下示意图把正确目标拆成上下两路,上路是词元熵损失,下路是词元策略梯度损失,底部标明二者相加才是完整目标,阅读时可对照后文的组件分工理解。

看图路径: 1. 先看上半部分输入语音与示例序列如何进入自回归模型并在每个位置输出词表分布;2. 再看下半部分多条采样序列如何各自计算熵估计并与序列概率相乘形成策略梯度项;3. 最后确认底部蓝色条带把两项相加标为正确目标

原论文 Figure 1:The correct EM objective for the autoregressive model decomposes into a token-level policy…

论文图 1。原论文 Figure 1:“The correct EM objective for the autoregressive model decomposes into a token-level policy gradient loss and a token- level entropy loss. See Section 3 for the details.”。

图中上半部分展示输入与示例词序列进入自回归模型后每个位置产生一个词表分布,所有位置的分布熵求和得到词元熵估计,直接作为熵损失。下半部分展示从模型中采样多条候选序列,每条序列的词元熵估计被标为代价,与该序列的概率相乘形成策略梯度损失。两路相加构成词元级完整目标。这一分解的教学价值在于把过去两派的做法 1 次定位:只做上路就是教师强制,只做下路就是强化学习的词元变体。

两项估计与两项损失如何分工?

沿一条样本走完流程有助于固定指代。输入是一段带噪或带口音的语音,模型先产生多条候选转写,每条转写附带每一步的词表分布。表示层是这些分布与整条序列的概率。组件层是两个损失:策略梯度项根据每条候选的熵高低上调或下调其概率,熵项直接压缩每条候选内部各位置的分布。目标层是最小化熵期望,输出是更新后的模型再做贪心解码。先走通这条链,再看公式细节才不会把符号与优化步骤混淆。

序列级熵估计 × 词元级熵估计: 序列级熵估计负责把整条转写序列的负对数概率作为熵的无偏估计,词元级熵估计负责把每个解码位置上的词表分布熵按时间步求和,搭配理由是论文证明在熵有限时后者同样是无偏估计且能提供更细粒度的词表信息,组合意义是两种估计分别引出序列级与词元级两条最小化路径,但梯度结构不同不能混用。

具体计算上,序列级估计只看解码出的词是否被赋予高概率,信息较粗;词元级估计要看每个位置上整个词表的分布形状,论文假设这对语音识别更关键,因为识别错误多发生在词级别的混淆上,词表分布能提供更细的纠错信号。实验部分也报告词元级完整目标在 3 个语料上普遍优于序列级,这与该假设一致,但应理解为报告的支持而非跨任务的必然结论。

为何缺一项就不算正确的熵最小化?

论文用表格对照把 4 种历史做法映射到统一框架:教师强制与微调变体只含词元熵梯度,强化学习词元变体只含词元策略梯度,强化学习序列变体含序列策略梯度且因第二项为零而正确,本文完整目标同时含词元策略梯度与词元熵梯度。关键区分是原始目标、近似与停止梯度:损失中把熵估计用停止梯度包裹后再乘以对数概率,对应分布变化项;不包裹而直接求导的部分对应估计值变化项。原文未给出的梯度路径不猜,本文解读也不自行补写展示公式。

策略梯度损失 × 熵损失: 策略梯度损失负责刻画采样分布本身随参数变化的影响,把熵估计值当作代价去调整整条轨迹的出现概率,熵损失负责在固定采样轨迹的条件下直接让每步词表分布更尖锐,搭配理由是对期望求导时乘积法则必然产生分布变化项与估计值变化项两项,组合意义是只有两项相加才是数学完整的熵最小化梯度,缺任何一项都是有偏的启发式。

实现时论文加入两处原文明确的技巧。第一是方差控制:对每个输入采样多条响应,用留一基线构造优势,并采用词元级归一化,即把优势除以总词元数后再加权,这是借鉴已有强化学习实践的做法。第二是用束搜索的前若干条候选代替随机采样,概念上类似优先扫描高概率响应以加速收敛,但会引入偏差,严格说不再符合无偏假设,论文明确承认这一点并在实验中检验其经验效果。

没有训练阶段时到底计算了什么?

本研究没有传统意义上的训练阶段,没有在源数据上重新训练 Whisper,也没有学习新的声学模型。真实计算过程是测试时对单条语音的在线优化:对每条测试语音,先用当前模型生成多条候选转写,估计熵并按上述目标计算梯度,用 AdamW 优化器更新模型的层归一化参数,编码器与解码器的层归一化都包含在内,其他参数冻结。更新后重新采样候选用于下一步,共进行若干适应步,最后用适应后模型做 1 次贪心解码报告词错率,然后把参数重置以处理下一条语音。这种单样本片段式流程意味着不存在跨样本的记忆,重置时机是每条样本推理结束后。

随机采样 × 束搜索: 随机采样负责从模型输出分布中抽取候选转写以保证梯度无偏,束搜索负责保留概率最高的前若干条候选以集中优化高质量轨迹,搭配理由是随机采样在噪声下可能产生过长或低质序列而束搜索更稳定简洁,组合意义是以引入一定偏差为代价换取更快的收敛与更低的实际运行时间,论文将其作为实用技巧而非理论必需部分。

超参数按原文在 CommonVoice 的保留子集上选择,再固定应用到所有目标语料,默认用 Whisper 基础模型,适应步数为 10,采样数为 16,学习率为千分之一。原文未报告置信度阈值等附加组件,解读中把教师强制基线限定为仅用熵的简化版本,不与带有其他损失或阈值的完整系统直接等同。未报告的内容不从模型名称推定,例如不猜测束宽之外的解码细节。

在哪些数据与条件下比较?

实验按问题组织为 3 组。第一组是加性噪声适应,用在 Librispeech 测试集上叠加噪声构造的破坏版数据,含空调、机场广播、人声嘈杂、复印机、咀嚼、邻居、关门、打字、吸尘器与高斯噪声共 10 种条件,信噪比为 10 分贝。第二组是口音偏移,用非母语英语语料,覆盖阿拉伯、普通话、印地、韩语、西班牙与越南 6 种母语背景。第 3 组是跨语言泛化,用多语语料中的荷兰、法、德、意、波兰、葡萄牙与西班牙 7 种语言。

比较对象在同一运行阶段保持一致:未适应的源模型、贪心伪标签的教师强制基线、序列级完整目标、词元级完整目标及其束搜索扩展。指标均为词错率,方向是越低越好,聚合对象是各域上的平均词错率。硬件条件为单张 3090 显卡,超参数跨语料固定,这是公平性的重要前提。论文还报告了不同模型尺寸、不同适应步数、不同采样数与运行时间的分析,为复现提供预算参照。

噪声下的完整目标带来多大改进?

要回答的核心比较问题是,在相同单样本适应协议下,数学完整的目标是否优于仅做一半的贪心基线,指标方向是词错率越低越好。下表聚焦 10 种噪声条件的平均表现,保留原文报告的平均值写法,单位为百分比。

评测场景指标SourceGreedy-EMEM-tok-b
破坏版语音 10 种噪声平均词错率22.53 %21.91 %19.15 %
破坏版语音 10 种噪声平均词错率21.34 %20.77 %19.15 %

表后解释需要同时看到收益与代价。报告显示源模型平均为 22.53%,贪心基线降至 21.91%,序列级与词元级完整目标进一步降至 21.34% 与 20.77%,束搜索扩展达到 19.15% 且在 10 种噪声上均为最低。支持的判断是完整目标在噪声下一致优于贪心启发式,且词元级优于序列级。代价是完整目标每步需采样 16 条候选并做 10 步更新,计算量明显高于只需一条贪心转写的基线。限制是平均趋势不等于每种噪声都同等受益,解读不把平均改进推广为对每条语音都成立。

看图路径: 1. 先确认横轴为适应步数 0 到 20,纵轴为词错率,起点为同一未适应模型;2. 再比较贪心基线下降缓慢而其余三条曲线随步数持续下降;3. 最后确认束搜索变体在第 1 步与第 3 步已明显领先

原论文 Figure 4:WER(%) of different TTA methods over different adaptation steps on LS-GS-10.

论文图 5。原论文 Figure 4:“WER(%) of different TTA methods over different adaptation steps on LS-GS-10.”。

上图展示在高斯噪声域上词错率随适应步数从 0 到 20 的变化,所有方法起点相同,贪心基线下降最缓,序列级次之,词元级与束搜索变体下降更快,且束搜索变体在第 1 步与第 3 步已取得明显领先。这支持增加步数持续降低词错率的总体趋势,但原文也显示收益随步数递减,复现时需权衡步数与延迟。

口音与多语下的表现是否一致?

第二个比较问题是,噪声上的结论能否搬到口音与多语场景,公平条件仍是同一采样数与步数下的词错率比较。下表汇总口音平均与多语平均的关键数字,保留原文百分比写法。

评测场景指标EM-seqEM-tokEM-tok-b
非母语口音 6 种平均词错率17.68 %17.05 %16.21 %
非母语口音 6 种平均词错率19.35 %18.77 %16.21 %
多语 7 种语言平均词错率24.17 %24.07 %22.63%
多语 7 种语言平均词错率24.58 %24.08 %22.63%

表后解释要指出未胜出项与反例。报告显示口音场景源模型平均为 19.35%,贪心基线为 18.77%,但在西班牙口音子集上贪心基线反而差于源模型,而序列级与词元级完整目标分别降至 17.68% 与 17.05%,束搜索变体达到 16.21%。多语场景域偏移较小,贪心基线从 24.58% 到 24.08%,序列级与词元级为 24.17% 与 24.07%,改进微弱,只有束搜索变体达到 22.63%。这说明完整目标的优势在偏移大时更明显,在偏移小时三者差异缩小。论文还报告词元级在多语的德语与葡萄牙语上例外地未优于基线,这是重要的未胜出边界,提示不应把方法理解为在所有语言上必胜。

看图路径: 1. 先确认红色虚线为未适应源模型词错率作为上限参照;2. 再按标记形状区分采样数 4 与 16 与 64,观察横轴平均运行时向右增大;3. 最后比较同等采样数下束搜索变体在纵轴更低且横轴更靠左

原论文 Figure 5:Comparison of WER and average runtime for a 1-second utterance for different methods on LS-GS-10.

论文图 4。原论文 Figure 5:“Comparison of WER and average runtime for a 1-second utterance for different methods on LS-GS-10.”。

上图比较在高斯噪声域上不同方法的词错率与 1 秒语音平均运行时的权衡,红色虚线为源模型上限,圆点方块三角分别对应采样数 4 与 16 与 64。可见贪心基线最省时但词错率最高,完整目标随采样数增大而词错率下降但耗时上升,束搜索变体在相同采样数下耗时更少且词错率更低,论文称在 16 采样时运行时间减少约三成五。解读为报告的转述,实际延迟需在自己的硬件上重测,不承诺相同的加速比。

两项损失各自贡献了什么?

消融按采样数组织,比较完整词元目标与其 2 个组件:仅策略梯度与仅熵损失,测试域选为高斯噪声、西班牙口音与波兰语,采样数取 1 与 4 与 16 与 64。以下导读对应三列曲线图,横轴为采样数,纵轴为词错率,虚线为源模型。

看图路径: 1. 先确认三列分别为高斯噪声西班牙口音与波兰语,横轴为采样数 1 到 64;2. 再比较蓝色完整目标与橙色仅策略梯度在样本数增大时的下降趋势;3. 最后观察绿色仅熵损失曲线几乎水平,确认其对样本数不敏感

原论文 Figure 2:WER(%) across varying sample sizes for Gaussian Noise (left), Spanish Accent (middle), and Polish…

论文图 2。原论文 Figure 2:“WER(%) across varying sample sizes for Gaussian Noise (left), Spanish Accent (middle), and Polish (right) domains.”。

图中可见当采样数为 1 时,仅策略梯度与完整目标都差于仅熵损失且方差大,此时留一基线不可用,策略梯度不稳定。当采样数增至 4 以上,完整目标与仅策略梯度持续下降并明显优于几乎水平的仅熵损失曲线,完整目标总体最优。这支持论文的判断:有足够采样时策略梯度提供主要增益,熵项起辅助作用;单样本时应谨慎使用策略梯度。

另一组束搜索消融显示束搜索变体在小采样数下优势更大,采样数到 64 时随机采样的完整目标逐渐追上,说明偏差技巧的收益随估计准确而缩小。波兰语上仅策略梯度加束搜索偶发最优,论文假设与该域束搜索解码质量本身较高有关,这属于待验证的解释而非因果证明。

哪些边界尚未验证?

首先是方法边界:束搜索扩展有偏,论文明确说明它不符合无偏假设,经验有效不等于理论正确,未来需研究解码策略与适应目标的交互。其次是数据边界:多语平均改进小,个别语言上词元级未胜出,说明跨语言泛化不能简单外推,低资源语言与更强口音的覆盖仍缺。再次是协议边界:实验是片段式单样本适应并在每条样本后重置,不涉及连续分布漂移下的遗忘与累积误差,相关方法中的持续适应问题不在本文范围内。

然后是测量边界:论文未系统测量误判率、校准误差与真实部署延迟,运行时间分析仅针对 1 秒语音在特定显卡上的平均值,不能当作实际延迟承诺。最后是资源边界:本次未发现可验证的公开代码模型或数据绑定,因此复现需自行实现损失与采样逻辑,不能假定官方实现可直接下载运行。缺失证据不是技术错误,但引用时需用报告与支持区分直接结果与有限解释。

复现先做什么,需要哪些条件?

复现的第一步是固定信息条件:用 Whisper 基础模型,只更新编码器与解码器的层归一化参数,其他冻结,优化器用 AdamW 学习率千分之一,每条语音采样 16 条候选,做 10 步更新后贪心解码,最后重置参数。第二步是实现两个熵估计:序列级用整条序列负对数概率,词元级用各位置词表熵求和,并为词元级实现停止梯度的策略梯度项与直接求导的熵项,加入留一基线与按总词元数的归一化。

第三步是建立可运行基线:未适应源模型与单条贪心转写的教师强制基线,再接入序列级与词元级完整目标,最后才试束搜索扩展并记录其引入的偏差。验证时先在保留集上调参再冻结参数测所有目标域,避免按测试集回搜最优。还需补的验证包括更大采样数的稳定性、不同模型尺寸的一致性以及自己硬件上的耗时与词错率曲线,论文已在小中大模型上报告一致改进,但具体数值需重跑确认。

何时值得尝试这种完整熵最小化?

当测试语音存在明显声学退化或口音偏移,且允许对每条语音做多步多采样的在线计算时,值得尝试本文的词元级完整目标,因为它在 20 余个域上报告了优于贪心启发式的平均词错率,且在贪心失效的西班牙口音等反例上仍带来改进。当偏移很小或延迟预算极紧时,贪心基线或纯束搜索解码可能已足够,完整目标的额外增益可能无法覆盖采样开销。

实践建议是从词元级完整目标加随机采样起步,保证梯度无偏,再在需要效率时引入束搜索变体并明确记录偏差。对初学者的可复述要点是:熵期望求导必然有两项,一项调轨迹概率,一项压词表分布,过去的方法各做一半,本文把两半加回一起,这就是全部理论增量的白话版本。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总