英文题目:Beyond Transcription: Mechanistic Interpretability in ASR

会议身份:conference:aaai:2026:conference-paper-id:41073

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #可解释性 #语音 #语音识别

评分:6.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Neta Glazer:机构信息未能从会议 PDF 纯文本可靠映射
  • Yael Segal-Feldman:机构信息未能从会议 PDF 纯文本可靠映射
  • Hilit Segev:机构信息未能从会议 PDF 纯文本可靠映射
  • Aviv Shamsian:机构信息未能从会议 PDF 纯文本可靠映射
  • Asaf Buchnick:机构信息未能从会议 PDF 纯文本可靠映射
  • Gill Hetz:机构信息未能从会议 PDF 纯文本可靠映射
  • Ethan Fetaya:机构信息未能从会议 PDF 纯文本可靠映射
  • Joseph Keshet:机构信息未能从会议 PDF 纯文本可靠映射
  • Aviv Navon:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

自动语音识别需将连续声学语音转写为离散文本符号,难点在于噪声、口音与语境预期常压倒声学证据并诱发幻觉与重复循环。该文以编码器解码器语音模型为对象,先用线性探测检验编码器与解码器残差流中的属性可解码性,再用对数透镜追踪逐层词元选择演化,最后用白噪声参考的成分补丁与置零消融验证因果作用。探测发现的候选表征进入透镜分析以定位承诺层,再将可疑编码器与解码器部件送入干预验证,从而把表征存在性与组件必要性分离。与以往仅统计词错率的做法不同,该机制链直接定位语义偏置与重复控制的责任位置,揭示编码器亦编码语义预期而非纯声学处理。在LibriSpeech测试集下,Whisper解码器22层残差流探测的准确率为0.934,高于5层的0.622。该结论受限于合成偏置语音与小规模自划分标签,尚未验证跨噪声、跨语言与流式部署的外推性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出是什么,为什么要看内部?

输入是一段音频,输出是由编码器加解码器逐词生成的转写词元序列。研究生首先要保留的信息是模型配置与实验条件:Whisper-large-v3 是 32 层音频编码器加 32 层文本解码器、总量约 1.5B 参数,在大规模配对音频文本上联合训练;Qwen2-Audio-7B-Instruct 总量约 8.2B 参数,采用冻结的 Whisper-large-v3 编码器加 Qwen2.5-7B 解码器,编码器输出以前缀形式拼接到解码器输入以支持多模态指令跟随与转写。

本文的目标不是再刷词错误率,而是把大语言模型中已成熟的可解释性方法搬到语音识别,回答声学证据与语境预期在何处竞争、幻觉与重复由哪些组件驱动、预测如何随层形成。输出是 1 篇可核对的方法解读:每个结论都回到原文给出的层号、数据集划分与干预方式,不把比喻当证明,不补写原文未报告的训练细节。阅读顺序按学习依赖展开:先明确任务与相关路线,再看方法全景与组件计算,然后讲数据构造与推理流程,最后看结果、反证与复现要点。

相关路线:大语言模型可解释性与语音内部表征研究在做什么?

大语言模型一侧的可解释性工具分为 3 类。第一类是 logit lens 及其改进 Tuned Lens,逐层投影残差流以跟踪词元预测如何演化,给出分层的行为视图。第二类是线性探测,用简单分类器检验句法或事实知识是否以线性方向编码在隐藏表示中。第 3 类是激活修补与因果追踪,通过交换或删除特定隐藏状态观察输出变化以判断因果作用,后来还有用梯度定位影响神经元的归因修补。这些方法已被用于诊断幻觉与推理错误,并与模型安全相关。

语音一侧已有工作表明 Whisper 编码器捕获噪声特征、说话人身份与情感内容,解码器也编码说话人特征并对语言切换敏感。另有博客规模的分析发现编码器神经元与人类可解释的音素模式对齐,解码器更像弱语言模型;还有工作研究解码器先稳定首选词元再依次稳定次选词元,以及用探测分析多语言校准曲线、编目非语音段上的高频幻觉。

但原文指出这些工作没有以定位组件为目标的系统性机理解释,特别是没有回答哪一层、哪个注意力头控制重复,也没有分离编码器与解码器在语境偏置中的各自贡献。本文正是在同输入同目标同运行阶段下,把上述 3 类方法同时适配到编码器加解码器语音识别,并用白噪声破坏性参考与置零消融作对照。

研究问题:声学真相被语境改写时,错误发生在哪里?

以一个样本走完全程有助于建立直觉,此为教学例子而非原文数值。假设输入说的是 white lice,但上下文让 white rice 更合理,模型最终输出了 rice。问题是这个替换发生在编码器对声音的表征阶段,还是解码器按语言习惯生成阶段,或者两者都有。原文用合成语音构造了 700 个此类声学模糊但语境强偏置的句子,Whisper 在其中 153 例出现语境错误,Qwen2-Audio 在 251 例出错,且每例输出与真相只差一个目标词,便于精确分析声学与语境的权衡。

第二个问题是幻觉能否提前从内部状态读出,而不是等转写结束再算词错误率。第 3 个问题是重复幻觉是全模型弥散失效,还是可定位到个别交叉注意力层与头。第 4 个问题是词元选择何时承诺,以及候选词在声音与语义上何时向终选靠拢。这些问题都要求同一条链路可操作:输入音频到帧表示,到编码器分层表示,到解码器残差流与词表投影,到目标词输出。

方法全景:四种手段各自回答什么?

全文方法可分为四块,各有明确分工。logit lens 负责回答预测何时形成,做法是在每个解码步取出每层残差流并用解嵌矩阵投影为 logits,取每层 top-k 观察发展,并用饱和层量化承诺点。线性探测负责回答某属性是否线性可解码,做法是在冻结激活上训练简单分类器,编码器侧对时间取平均得到定长向量,解码器侧多取末位词元状态,训练后还可在推理时以很小开销复用为监测器。

成分修补与消融负责回答因果作用,做法是用白噪声参考破坏自然计算或直接置零某组件,再看声学准确率是否恢复或重复是否消失,干预范围覆盖编码器与解码器的交叉注意、自注意、前馈乃至注意力头级别。编码器透镜是本文新引入的适配,做法是取出每一编码器层的完整表示,施加模型最终编码器层归一化后直接送入解码器,原文强调若不加该归一化解码器难以产生连贯语法输出,从而为每层构造出可读的文本侧写。

四者组合的逻辑是先用探测与透镜发现相关性,再用干预验证因果,最后用 logit lens 刻画时间过程。

组件与计算:符号、读出与干预如何实现?

记音频输入为 x,输出词元序列为 y,编码器层数为 Le,解码器层数为 Ld,隐藏维度为 d。编码器在 le 层给出帧表示,帧数为特征提取后的 F,位置 tau 处的向量记为该层表示;解码器在 ld 层词位置 t 的隐藏状态经层归一化后得到残差流,再经词表解嵌矩阵投影为该层该位置的 logits。教学上可以这样理解:残差流是待投票的内部草稿,解嵌矩阵是把草稿翻译成词表分数的词典。线性探测的计算目标是在冻结表示上拟合标签,原文用交叉熵或回归损失训练线性分类器,高准确率被解读为属性线性可解码的证据,但这只是相关性而非因果,原文用后续干预补足因果链。

线性探测 × 残差流: 线性探测的分工是用冻结激活训练简单分类器检验某属性是否线性可解码,残差流的分工是承载解码器每层归一化后待投影为词表 logits 的中间表示,二者搭配的理由是探测需要一个随层可比且贴近输出的读出点,组合意义在于把幻觉质量信号定位到具体解码层并可复用为轻量实时监测器。

\[P(h) = Wh + b,\]

成分修补的计算目标是按比例混合原始激活与参考激活,参考取白噪声音频以破坏声学保真或语境偏置,系数为正实数;消融则是把目标组件置零。干预对象包括交叉注意、自注意与前馈块,必要时下探到头级别。

成分修补 × 消融: 成分修补的分工是用参考输入的激活按比例替换目标输入的某组件激活以观察输出是否恢复声学真相,消融的分工是把该组件激活置零以检验其必要性,二者搭配的理由是修补看充分性而消融看必要性,组合意义在于把语境偏置与重复幻觉归因到编码器或解码器交叉注意力的具体位置。

\[˜aC = (1 −α) aorig α ∈R+.\]

logit lens 的饱和层定义为最早使该层 top-1 与最终输出一致并保持稳定的层,概率曲线与饱和层的分离使承诺早晚可比较。

logit lens × 饱和层: logit lens 的分工是把每一解码层的残差流都用解嵌矩阵投影到词表以观察候选如何收敛,饱和层的分工是给出最早与最终输出一致且保持稳定的层号,二者搭配的理由是仅看概率曲线无法判断承诺点,组合意义在于把何时选定词元转化为可跨语言比较的层数指标。

编码器透镜的关键实现细节是必须施加最终编码器层归一化,这一步继承自扩散透镜对文本编码器的处理经验,目的是让中间表示落在解码器可接受的分布内。

编码器透镜 × 解码器: 编码器透镜的分工是取中间编码器表示经最终层归一化后直接送入解码器生成文本以显化该层已具备的信息,解码器的分工是按既定语言模型与声学条件生成连贯转写,二者搭配的理由是绕过高层编码可分离表征成熟度与生成 fluency,组合意义在于揭示中层流利但不接地、深层陷入重复、末层才收敛的分阶段演化。

本研究训练了什么,没有训练什么?

本研究没有训练 Whisper 与 Qwen2-Audio 的主干权重,这是一个需要首先说明的事实。Whisper-large-v3 与 Qwen2-Audio 的权重按原文描述直接调用:前者是已在大规模弱监督下训练好的多语言语音转文本与翻译模型,后者是冻结 Whisper 编码器加指令微调后大语言模型解码器的组合,本文只是调用其前向、抽取激活并做干预。

本研究实际训练的是大量轻量线性探测器:说话人性别、干净与噪声环境、口音、幻觉质量、语音与非语音、语义类别,均在冻结激活上用交叉熵或回归损失优化线性层参数,梯度只更新探测器权重而不回传主干。原文未报告探测器的优化器、学习率、轮数等超参数细节,这是复现时需要补齐的缺项,不能从模型名称推定实现。编码器透镜与 logit lens 不引入可训练参数,只是前向抽取加投影;成分修补与消融也不更新参数,只在推理时替换或置零激活。

因此所谓训练成本主要来自多次前向抽取与探测器拟合,而非大模型预训练,原文也未给出硬件与耗时预算,讨论延迟或成本改善时必须标注未测量。

实验条件:数据、划分、模型与指标方向如何对齐?

转写丰富性探测使用 LibriSpeech 与口音数据:性别探测在 2000 个标注样本上训练、在 test-clean 的 500 样本上评估并逐编码器层报告;干净与噪声探测用 dev-clean 与 dev-other 训练、在 test-clean 与 test-other 上测试;口音在 4 个口音组共 2400 样本上训练、在 337 测试样本上评估,类别为新西兰、威尔士谷地、南非与印度。幻觉监测把 LibriSpeech test-clean 与 Common Voice 16.1 分别转写后,各取零词错误率 150 例与最高词错误率 200 例组成 400 样本,按 7 比 3 划分训练测试,并在文本长度分布一致的条件下比较,避免长度偏差冒充质量信号。

语音与非语音用 400 语音加 400 非语音共 800 平衡样本,非语音覆盖噪声音乐与白噪声,且聚焦会被转写为连贯词的困难情形。声学语境机制用文本转语音合成 700 个单目标词差异的偏置句,Qwen2-Audio 错 251 例、Whisper 错 153 例,干预时以白噪声为破坏性参考。重复机制用 Common Voice 日英部分中易重复的 102 条多语言语音,对 32 层中交叉注意、自注意与前馈逐层修补与消融,并下探到头级别。编码器透镜用英语、西班牙语、中文共 400 条随机样本保证类型与语音多样性。词元选择用 6 种语言各 100 条 Common Voice 测试集。

指标方向需记牢:分类准确率越高越好,音素错误率越低表示声学越相似,语义余弦越高表示语义越接近,概率越高表示对终选越确信。

结果一:编码器藏了多少非转写信息?

比较问题是冻结编码器表示是否线性包含性别、环境与口音,公平条件是同一共享编码器逐层训练同类线性探测并在固定测试划分上评估,指标方向是准确率越高表示线性可解码性越强。下表整理原文报告的 3 个最佳层结果,均为实际可运行的探测策略,不含事后最优以外的虚构基线。表前说明已满足比较问题与公平条件,表中数字与单位保留原文写法。

条件指标探测位置本方法准确率比较对象
说话人性别分类准确率编码器第 25 层94.6%文本输出判性别 87.8%
干净与噪声环境分类准确率编码器第 27 层90.0%dev-clean 对 dev-other 划分
四口音分类平均分类准确率编码器第 22 层97.0%印度 95.7% 等分项

表后解释需要同时讲收益与代价。收益是单次转写隐含生成了更丰富的表示:性别在深层最清晰,环境在 27 层有效分离,口音在 22 层达平均 97.0% 且威尔士谷地高达 99.2%,而直接问 Qwen2-Audio 文本输出判性别仅 87.8%,说明模型知道的多于说出的,这与大语言模型中已报道的现象一致。

代价与限制是探测准确率高不等于主干为此优化,也不等于可在部署中免费获得,原文未测量误判率与延迟,且口音仅覆盖 4 个英语口音组,未评测边界外的泛化。未胜出项是浅层表示分离较弱,语义理解到末层才达平均 85.6%,不能把末层结果推广到全程。

下面看语义随层的演化,图前导读如下:该图横轴为编码器层 18 到 31,纵轴为语义二分类准确率,5 条曲线代表不同语义对,观察重点是早期是否已有信号、中段是否波动、末段是否收敛,这直接对应编码器是否分层建立语义。

看图路径: 1. 先看横轴 Layer 从 18 到 31 与纵轴分类准确率的整体上升趋势;2. 再对比五条语义对曲线在 23 层附近的下探与分化;3. 最后看蓝色 Countries 对 Tools 到 31 层接近顶部的收敛位置

原论文 Figure 1:Semantic classification progression across encoder layers for selected category pairs.

论文图 1。原论文 Figure 1:“Semantic classification progression across encoder layers for selected category pairs.”。

该图显示语义理解早在中层 18 到 21 已出现,多对类别在最终层前已取得实质性能,但 23 层附近多条曲线出现下探,之后再爬升,到 28 层后多对超过 80% 并在 31 层分化,蓝色国家对工具升至顶部,红色学术对动物等稳定在 80% 以上。原文还报告末层平均 85.6% 且多对达 96.7%,例如国家对天气或服装,说明编码器在声学处理之外发展了分层语义表示。像素不能精确读出的具体小数不应硬写,趋势判断以原文文字为准。

结果二:幻觉信号能否从残差流实时读出?

比较问题是解码器残差流是否线性编码转写质量与语音有无,公平条件是在同一模型自身转写的零词错误与高词错误样本上训练测试,且长度分布一致,指标方向是准确率越高表示质量信号越强。下表整理幻觉预测与重复控制的关键数字,均为原文直接报告的可运行探测与干预策略。

条件指标探测或干预位置本方法比较对象
LibriSpeech 幻觉判别分类准确率解码器第 22 层残差流93.4%Common Voice 同层 88.1%
Qwen2-Audio 幻觉判别分类准确率解码器第 22 层残差流70.2%Common Voice 同层 83.6%
重复修补解决比例第 23 层交叉注意76%第 18 层追加 13%
单头抑制重复抑制比例第 18 层头 1378.1%全模型 640 头中之一

表后解释要区分直接报告与有限解释。直接报告是 Whisper 在 LibriSpeech 上 22 层达 93.4%,在 Common Voice 上同层达 88.1%,语音与非语音在 10 到 28 层达 100% 而 31 层为 99.17%,表明即使对非语音也自信转写,内部仍保留线性可分的语音有无信号,可作为推理时标记潜在幻觉的元数据。

有限解释是 Qwen2-Audio 在 LibriSpeech 仅 70.2% 而在 Common Voice 达 83.6%,同样峰值出现在 22 层,支持跨架构存在一致的质量编码位置,但不能据此承诺所有领域都成立。未胜出项是 Qwen2-Audio 在 LibriSpeech 的探测明显弱于 Whisper,说明大语言模型解码器并不自动带来更易线性读出的质量信号,还需补验证。重复方面,第 23 层修补解决 76% 且第 18 层追加 13%,合计覆盖 89%,而自注意与前馈无可测效果,单头 13 单独抑制 78.1%,显示高度局域化,但这是在 102 条易重复样本上的结果,不等于任意噪声下都成立。

干预与分层:语境偏置来自编码器还是解码器?

比较问题是声学真相被语境改写时,编码器与解码器各自的因果贡献有多大,公平条件是在 153 例 Whisper 错误与 251 例 Qwen2-Audio 错误上,对所有编码器与解码器子组件用同一白噪声参考做成分修补,指标方向是恢复声学准确的比例越高表示该侧偏置越强。原文报告用破坏性音频干预编码器反而提升声学准确率,编码器与解码器都贡献恢复,其中编码器效果尤其强,Whisper 经编码器恢复 85.0%、经解码器恢复 82.4%、总体恢复 88.9%,Qwen2-Audio 对应 68.1%、58.6% 与 70.1%,且 Qwen2-Audio 错误率 35.8% 高于 Whisper 的 21.8%,显示更强的语境预测倾向。

这一反直觉结果支持语义影响起源于编码器,挑战了编码器只管声音、解码器只管语言的简单分工,但相关性不等于全部因果,仍需头级别与层级别的消融互证。 词元选择的分层分析进一步刻画承诺过程,图前导读如下:该图分三面板,左为终选词元概率随解码器层变化并标出平均稳定层,中为前五候选与终选的音素错误率,右为语义余弦相似度,粉色为 Whisper、蓝色为 Qwen2-Audio,观察重点是抬升点、稳定层先后与声义两条曲线的相对位置。

看图路径: 1. 先看左图两条词元概率曲线在 20 层后抬升与两条虚线稳定层位置;2. 再看中图音素错误率随层下降且粉色 Whisper 始终更低;3. 最后看右图语义余弦相似度在 25 层后快速拉开的过程

原论文 Figure 2:Token Selection Mechanism: (a) Probability of the final selected token across decoder layers, with…

论文图 2。原论文 Figure 2:“Token Selection Mechanism: (a) Probability of the final selected token across decoder layers, with indication to the average saturation layer; (b) Phoneme error rate (PER) by layer.”。

像素可见左图概率到 20 层前都很低,之后陡升且最后 3 层高度确信,Qwen2-Audio 平均概率更高但 Whisper 饱和层更早;中图 Whisper 音素错误率始终低于 Qwen2-Audio 且在 25 层附近同步下降,说明收敛后候选在声音上更接近终选;右图 Whisper 在多数层语义相似度更高,尽管人们可能预期大语言模型解码器语义更强。原文还补充 Qwen2-Audio 在 21 层已把下一词排入候选并保留对下下词的部分预测,Whisper 到 29 层才 sharp 提升,这些层号不应推广为所有语言都相同,附录按语言细分应另查。

边界与未验证推测:哪些结论不能直接部署?

首先是数据边界。语境偏置集是合成的 700 句且每例只差一个目标词,真实口音、远场与重叠语音下的竞争可能更复杂;重复集仅 102 条日英易重复语音,代码切换、碎片与强噪声下的例子在附录举例但未计入主数字;编码器透镜仅 400 条英西中样本,其中 Whisper 在 0 到 22 层多输出空串或孤立标点、20 到 27 层偶发流利但不接地的补全、27 到 30 层约 60% 出现重复环、31 到 32 层才收敛为流利转写,Qwen2-Audio 早层则高频出现 Kids are talking by the door 等记忆化序列,这些模式提示训练数据不均衡但属于待验证推测,不能直接认定为记忆泄露。

其次是方法边界。探测高准确率只说明线性可解码,不说明模型实际使用该信号;白噪声参考能破坏计算但也引入分布外效应,恢复声学准确不能等同于修复全部语境偏置;单头干预高效但未报告对正常语音词错误率的影响,压缩或微调前需补测核心性能。资源与成本方面,原文未报告训练资源、推理开销、帧率与延迟,总体趋势不等于每组每步成立,实时监测器的轻量之说仅指探测器本身参数少,未测量端到端延迟时不应承诺延迟改善。

最后是可达性,文内引用的 2 篇 LessWrong 博客在本次核对中返回 429 而暂时不可达,只能按原文引用归因,不能据此补充细节。

复现先做什么,需要哪些信息条件?

复现应按依赖顺序先跑通前向抽取,再做探测,最后做干预。第一步固定模型与解码方式:调用 whisper-large-v3 与 Qwen2-Audio-7B-Instruct 的转写流程,记录采样、语言提示与后处理,因为词错误率划分与 top-k 候选都依赖解码配置。第二步复现探测:对性别、环境、口音、幻觉、语音有无与语义类别,按原文划分在冻结激活上训练线性层,编码器侧先对时间平均,解码器侧取末位残差流,逐层报告以定位 25、27、22 等峰值层,注意保留千分位与小数精度,不自行四舍五入。

第三步复现 logit lens 与饱和层:每层残差流经解嵌矩阵投影,统计终选概率、音素错误率与语义余弦随层的变化,并与原文六语言各 100 条的设置对齐。第四步复现干预:用白噪声参考对编码器与解码器子组件做成分修补,对重复集逐层消融交叉注意、自注意与前馈并下探到第 18 层头 13,记录恢复比例与对正常集的影响。缺项清单包括探测优化器与轮数、合成语音的说话人与信噪比、重复集的筛选阈值、硬件预算,这些需在复现报告中明确标注为补测,而非沿用默认值一笔带过。

何时值得尝试,常见误解是什么?

当你的系统出现流利但不符合声音的转写,或在静音与噪声段自信输出句子,或在重复输入与语码切换时陷入长串重复,本文方法值得尝试。可用线性探测先判断质量信号在哪一层最强,再用编码器透镜看中层是否已出现流利不接地,最后用成分修补定位到交叉注意的具体层与头,而不是一开始就全量微调。论文特有的误解需要澄清:编码器并非纯声学,它在中层已建立语义并能施加语境偏置。

解码器虽像弱语言模型,但 Whisper 候选在声音与语义上反而比大语言模型解码器更贴近终选;单头高效不等于单头负责全部重复,原文是第 23 层加第 18 层头 13 合计覆盖 89%,其余仍需监测。另一个误解是把 100% 语音有无判别当成转写已正确,它只是标记潜在幻觉的元数据,不能替代词错误率评估。

是否采用应看验证补齐情况:若能在你的领域复现 22 层附近的质量峰与交叉注意的局域效应,并确认干预不损伤正常语音,再考虑把探测器做成在线 monitors 或对定位组件做定向微调,否则先停留在离线分析。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总