英文题目:From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales

会议身份:conference:interspeech:2026:conference-paper-id:viakhirev26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#形式化分析 #对抗鲁棒性 #可解释性 #语音 #语音识别

评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:理论研究

👥 作者与机构

  • Ivan Viakhirev:机构信息未能从会议 PDF 纯文本可靠映射
  • Kirill Borodin:机构信息未能从会议 PDF 纯文本可靠映射
  • Grach Mkrtchian:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

自动语音识别以声学证据为输入并输出转写文本,在静音、噪声与扰动下大模型仍高置信输出无据内容,传统词错率难以预警这种解耦。作者先将解码器堆叠建模为含外部声学上下文的条件动力系统并推导上下文雅可比矩阵,再把逐层传播子分解为主导秩1方向与残差并引入谱间隙、层间对齐与有效增益刻画信号保持或坍缩,随后用激活奇异谱的有效秩、谱衰减指数与基尔霍夫指数作为可观测代理,最后在对抗LibriSpeech上对比Tiny至Large-v3-Turbo的跨注意力与自注意力演化。与只看词错率或置信度的方法不同,该机制区分色散导致的解体区与对齐增强导致的吸引子区,解释了小模型丢信号与大模型锁先验的不同失效意义。在对抗LibriSpeech评测条件下,Small解码器跨注意力的有效秩变化指标为-13.40%,低于Tiny的有效秩变化指标-11.98%。Large模型则出现自注意力压缩与谱硬化并锁定内部先验。结论仅限于 Whisper 编解码器家族与三类强扰动下的幻觉样本,未验证其他架构、自然分布偏移与在线检测有效性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

本文解读的对象是会议论文 From Dispersion to Attraction,作者以 Whisper 系列为观测对象,研究自动语音识别在大模型规模下出现的幻觉。输入是语音波形或声学特征,目标是输出与语音内容一致的转写文本。当输入变为静音、噪声、混叠或拉伸语音时,模型仍可能输出流利但与声学证据无关的句子、循环重复或记忆片段,这就是论文讨论的幻觉。

对于刚进入语音与音频方向的研究生,关键误解是把词错误率低等同于幻觉少。论文指出,在解耦发生时模型局部依然自信,词错误率和词元对数概率往往不能提前预警。白话说,模型不是不知道自己在说什么,而是它的内部表示已经听不见输入,却还在按内部语言先验继续说话。因此本解读的目标是讲清作者如何用信号传播的谱视角区分两种失耦,并复述其实验条件与可核对数字。

本解读的输出是一套可复述的方法链条:先说明任务与已有路线的分工,再展开谱传播不稳定性框架的全景,然后按交叉注意力、自注意力与前馈网络讲清观测量的计算,接着交代对抗数据集构造与模型选择,最后组织主结果、反证与复现要点。所有事实只来自本次收到的论文原文证据与 3 张官方原图像素,不引入外部评价。凡是论文未报告的实现细节,本解读会明确指出缺项,不做推定。资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开。

已有路线在解决幻觉的哪个环节?

论文把已有工作分成两类。第一类是检测与事后验证,包括语义熵、预测区间、用辅助大语言模型做外部校验。这类方法的输入是已生成的文本或多次采样的分布,目标是判断哪句话不可信。它的优点是与模型内部解耦,可以直接部署在解码之后,但缺点是只处理症状,不解释表示在何处、以何种几何方式脱离声学证据。

第二类是 Transformer 结构理论,包括秩崩解、信息过挤压、训练中的凝聚现象。这类工作指出深层网络有向低秩收缩的归纳偏置,但多在初始化或通用语言任务下讨论,没有专门回答语音中编码器到解码器的声学耦合何时断裂。论文的定位是补上中间环节:把层间传播写成显式的动力系统,用主导奇异方向、层间对齐与有效增益解释幻觉是色散还是吸引子捕获。

按同输入、同目标、同运行阶段对照,本文与不确定性估计不是竞争关系。前者在输出端给出可疑度,后者在表示端给出失耦机制。理解这一点很重要:即使谱指标显示进入吸引子,区分正确转写与幻觉仍然需要任务标签或外部验证,谱硬化本身不等同于错误检测器。

为什么大模型的幻觉不是小模型幻觉的放大版?

论文提出的核心问题是规模带来的失效模式切换。小模型在噪声下更像是信号被冲散,深层收到的早期声学注入指数衰减,最终输出与输入无关,更接近随机或碎片化错误。大模型则相反,它有能力抵抗整体散架,却可能把受扰输入主动引导到内部熟悉的低维流形上,输出流利、自信但与证据正交。

举一个教学用的例子而非论文数据:同样一段混入多人说话的片段,小模型可能输出断裂的词片,大模型可能输出一段通顺却完全不在音频中的句子。例子只是帮助区分色散与吸引子的直觉,不代表论文测量过该具体样本。论文要用谱量把这种直觉变成可检验的预测:中间规模应出现交叉注意力秩的大幅下降,大规模应出现自注意力秩的压缩与谱斜率变陡。

这个问题的难点在于,两种失效在词错误率上都表现为高错误,单看错误率无法区分机制。必须打开解码器的每一层,分别看负责耦合、负责上下文、负责记忆的组件如何变化,才能判断是接口断了还是内部先验锁死了。

谱传播不稳定性框架如何把一句话的生成变成可追踪的信号?

作者把深度网络看作离散动力系统。设第 l 层隐状态为 hl,外部声学上下文为 c,层函数同时依赖上一层状态与声学上下文。沿着一个样本走完流程就是:声学特征进入编码器形成上下文 c,解码器从初始嵌入出发逐层更新 hl,每层通过交叉注意力注入声学证据,通过自注意力整合已生成的前文,通过前馈网络重塑流形,最终输出下一个词元。论文关心的是最终表示对声学上下文的雅可比矩阵,它度量输入动一点输出动多少。

如果雅可比范数随深度饱和且早期注入衰减,说明深层听不见早期语音,对应色散机制。如果雅可比坍缩为秩 1 结构,说明所有声学注入被投影到单一方向,对应吸引子机制。为此作者引入谱灵敏度定理,用 3 个量控制传播:谱间隙表示主导奇异值与残差的相对噪声水平,有效增益表示沿主导路径的幅度稳定性,层间对齐表示相邻层主导方向的几何一致性。

有效秩 × 谱衰减系数: 有效秩 Neff 度量表示占据的等效维度,谱衰减系数 α 度量奇异值在对数坐标下的拖尾衰减速度,二者搭配是因为低秩可以来自整体收缩也可以来自主导方向压制拖尾,组合意义在于用高 α 加低 Neff 共同判定谱硬化与秩 1 吸引子,而不是单看维度下降。

在实现上,作者不直接计算大规模雅可比的完整谱,而是用激活矩阵的奇异值谱做代理。有效秩下降对应秩 1 坍缩,谱衰减系数升高对应主导值压制拖尾即谱硬化,基尔霍夫指数上升对应隐图电阻增大与过挤压。3 个代理量分别从维度、形状与连通性刻画同一件事,下一节按组件说明它们在何处测量。

交叉注意力、自注意力与前馈各在测量什么?

论文对每个解码器层提取 3 类表示。交叉注意力连接编码器与解码器,它的激活谱反映声学耦合强度。白话说,它是耳朵与嘴之间的通道,通道秩下降意味着耳朵的声音传不到嘴边。自注意力只看解码器内部历史,它的谱反映上下文先验是否形成压缩结构。前馈网络负责逐位置的非线性记忆与流形重塑,它的谱反映隐流形在扰动下是否收缩。

计算过程是统一的:对每层激活矩阵做奇异值分解得到奇异值集合,再计算有效秩、谱衰减系数与基尔霍夫指数。有效秩用归一化奇异值的香农熵指数定义,分布越集中秩越低。谱衰减系数通过对数坐标下奇异值随序号的线性回归斜率估计,斜率越陡说明头部主导越强。基尔霍夫指数由协方差特征值倒数和定义,特征值越小电阻越大,信息越难长程传递。

交叉注意力 × 声学耦合: 交叉注意力负责把编码器声学特征注入解码器,声学耦合是这种注入是否有效的程度,二者搭配是因为交叉注意力的注入矩阵 Gl 决定了雅可比对声学上下文的敏感性,当其有效秩崩解时耦合失效,组合意义在于把接口秩变化直接对应到 Regime I 的色散失耦。

论文用两种谱宽度做稳健性检查。主导模式取前 10 个奇异值,关注头部是否被主导方向控制;谱尾部取前 50 个,关注拖尾是否被侵蚀。两种宽度下的结论方向一致时,才认为相变证据更可信。这种设计避免了只看头部会夸大压缩、只看尾部会被噪声主导的问题。

有效增益与对齐如何决定色散还是吸引子?

定理的第一部分对应色散区。当每层有效增益小于 1 时,早期注入的传播子范数按指数衰减,深层雅可比不再增长,总灵敏度收敛到与深度无关的常数。直观理解是每一层都把声音调小一点,经过几十层后早期语音几乎消失,模型只能靠局部先验补全。

定理的第二部分对应吸引子区,需要稳定性、累积增益、对齐、注入相干与谱纯度同时成立。稳定性要求有效增益不小于 1,对齐要求相邻层主导方向几乎共线,注入相干要求各层声学注入在主导方向上的投影同号叠加而非相互抵消,谱纯度要求残差噪声相对主导方向可忽略。满足时雅可比近似为单一外积加小残差,所有注入被放大到同一方向,正交方向的声学细节被压制。

自注意力 × 吸引子: 自注意力负责在解码器内部整合已生成上下文形成先验,吸引子是多层传播后所有声学注入被压缩到单一方向 uL 的低秩状态,二者搭配是因为自注意力的层间对齐与增益决定是否形成压缩,组合意义在于把自注意力秩压缩对应到 Regime II 的自回归锁定。

论文特别论证对齐不可能是随机产生的。在隐藏维度 1280 下,两个随机单位向量的期望绝对内积约 0.022,远小于吸引子要求的接近 1。因此观测到的谱硬化与秩压缩如果成立,只能解释为训练动力学逐步把各层主导子空间拉齐,形成结构相干的低秩流形。这是从观测反推机制的关键一步,但作者也承认并未直接测量层间余弦,只是以后果作为特征性签名。

本研究训练了什么,没有训练什么?

本研究没有训练任何新的语音识别模型,也没有微调 Whisper 权重。论文的训练部分应理解为无训练的观测型研究:直接调用已有的 Tiny、Small 与 Large-v3-Turbo 权重,在干净与对抗条件下做前向推理,抽取中间激活并计算谱代理量。因此不存在优化器、学习率、梯度更新、参数冻结与解冻的安排,也不存在用幻觉标签做监督的环节。

真实的计算过程是推理加谱分析。第一步按固定协议生成对抗音频并做前向解码,第二步保存每层交叉注意力、自注意力与前馈的激活矩阵,第三步对每个矩阵做奇异值分解并拟合谱指标,第四步比较干净与幻觉条件下的相对变化。由于没有训练,论文不能从参数更新角度证明对齐是如何形成的,只能报告规模越大越呈现吸引子签名的相关性。

需要补的缺项是推理与计算预算。原文未报告解码超参数如束宽与温度,未报告奇异值分解的具体实现与截断策略,也未报告硬件型号与耗时。因此复现时只能保证流程可重放,不能保证逐数值完全一致。把无训练等同于确定性求解是错误的,前向解码中的采样与数值误差仍可能带来波动。

对抗条件如何构造,比较是否公平?

论文要回答的问题是声学解耦时的内部谱变化,测量对象是层级谱指标而非词错误率本身,对比条件是同一模型在干净与对抗音频下的配对变化,指标方向是有效秩变化百分比、基尔霍夫指数对数变化与谱斜率变化。公平性来自配对设计:同一句话的干净版与扰动版分别过同一模型,差值排除了说话人与文本差异,只保留扰动效应。

对抗数据集称为 Hell,基于 LibriSpeech 的干净与难例划分施加 3 类声学压力,分别针对对齐、流形饱和与谱间隙。筛选时只保留词错误率大于 0.5 的样本,聚焦已验证的幻觉而非轻微错误。模型覆盖 3 个规模以捕捉随规模的相变,分析聚焦解码器各层,分别看耦合、上下文与记忆组件。下表把模型规模与数据构造的关键条件整理成可核对的形式,表中参数数字均有原文连续句覆盖,模型角色列为理解性归纳而非原文新数字。

模型或数据条件规模参数维度或筛选论文中的机制角色本解读的复现提示
Tiny39M小规模色散参照高秩低衰减端先跑通谱流水线
Small244M中规模解耦重点交叉注意力崩解重点看接口秩
Large-v3-Turbo809MD 等于 1280吸引子锁定重点看自注意力压缩
Hell 配对集5559 pairs同句干净与扰动配对对抗应力输入需重建 3 类扰动
幻觉筛选WER 大于 0.5只留验证幻觉排除轻微错误保持筛选阈值 1 致

上表把规模、样本量与筛选阈值放在同一视图,收益是复现时能一次性对齐模型选择与数据口径,代价是表中未包含扰动的具体参数如拉伸倍数与信噪比,使用时还需回到正文的 3 类应力描述。未胜出的细节是 Tiny 在多数讨论中只是背景参照,论文的机制对比主要在 Small 与 Large 之间展开,因此 Tiny 的负结果不应被解读为无幻觉。

随深度展开时哪条曲线先背叛声学证据?

本节的比较问题是沿归一化深度观察秩崩解百分比,哪类组件在哪个规模上最先失守。公平条件是同模型干净与对抗的配对差值,纵轴负值表示秩下降,曲线向下表示耦合丢失而非性能提升。论文报告 Small 的交叉注意力秩下降约 13.40%,Large 的自注意力出现约 2.34% 的独特压缩,前馈则在所有规模收缩。

看图路径: 1. 先看三块面板标题区分交叉注意力、自注意力和前馈网络,再看横轴归一化深度与纵轴秩崩解百分比方向;2. 比较绿色 Small 在左图深层的大幅下探与红色 Large 在中图的贴零压缩;3. 核对右图三条线均为负值,确认前馈收缩是全规模共有现象;4. 注意散点是样本级波动,实线是趋势,判断结论依据实线走向而非单点

原论文 Figure 1:Layer-wise Spectral Dynamics. The evolution of rank collapse (∆Neff) across network depth.

论文图 1。原论文 Figure 1:“Layer-wise Spectral Dynamics. The evolution of rank collapse (∆Neff) across network depth.”。

从像素可见,左图交叉注意力中绿色 Small 实线从浅层接近零一路下探到深层约负 20% 以上,波动散点在深层更加弥散,红色 Large 则呈平缓下行,蓝色 Tiny 相对平稳。负斜率在这里读作输入信号随深度丢失。中图自注意力纵轴范围小得多,3 条线基本贴零,Large 几乎水平,Small 先小幅下探再回升,说明自注意力整体秩变化不大,Large 的压缩是小而独特的。右图前馈 3 条线全为负值,Tiny 最低,Small 居中,Large 最高,表明前馈收缩是全规模共有,只是程度不同。

对比维度观测指标Small 实测Large 实测尾部能量对照
耦合接口交叉注意力有效秩变化13.4% collapse下降较轻尾部比值上升
上下文先验自注意力有效秩变化扩张找上下文−2.34%斜率变陡
记忆流形前馈收缩方向大幅收缩较轻收缩全规模为负
谱形状衰减系数变化接口变陡自注意力变陡头部约 1.003
能量分布尾部比值高于 1高于 1尾部约 1.04 到 1.05

表后解释需要同时讲收益与代价。收益是双重分离:Small 用接口崩解释色散,Large 用自注意力压缩解释锁定,二者不在同一组件上竞争,因此不是简单的谁更差。代价是自注意力 2.34% 的压缩幅度很小,若只看绝对值容易被噪声淹没,必须结合谱斜率变陡与相图位置一起判断。未胜出项是 Small 自注意力反而扩张,论文解释为寻找上下文的补偿,但在主结论中不是重点,复现时不应把该扩张当作吸引子证据。

相图能否把三个规模干净地分开?

本节的比较问题是最后一层解码器表示在有效秩与谱衰减平面上是否形成单调分离。公平条件是同为末层、同为幻觉条件下的散点,横轴向右为秩升高,纵轴向上为衰减变陡。论文预期 Tiny 位于高秩低衰减区,Large 位于低秩高衰减区,Small 居中。

看图路径: 1. 先确认横轴为有效秩 Neff、纵轴为谱衰减 α,理解右下为高秩低衰减、左上为低秩高衰减;2. 分别找到蓝色 Tiny 圆点群、绿色 Small 叉号群与红色 Large 方块群的位置;3. 观察从 Tiny 到 Small 再到 Large 沿对角线的单调分离,确认相变不是连续重叠;4. 读出 Large 群 α 约 9 附近而 Tiny 群 α 约 1 到 2 附近的数量级差异

原论文 Figure 2:Spectral Phase Diagram. Scales separate monotoni- cally from Tiny (high rank, low α) to Large…

论文图 2。原论文 Figure 2:“Spectral Phase Diagram. Scales separate monotoni- cally from Tiny (high rank, low α) to Large (low rank, high α).”。

从像素可见,蓝色 Tiny 圆点聚集在右下,横轴约 44 到 47,有效秩最高,纵轴约 1.5 附近,衰减最低,并标注为色散区。绿色 Small 叉号聚集在中部,横轴约 29 到 34,纵轴约 6.5 到 7 附近。红色 Large 方块聚集在左上,横轴约 20 到 22,纵轴约 9.1 附近,并标注为吸引子区。三群之间有明显空隙,没有重叠,支持从色散到吸引子的单调拓扑分离。纵轴数量级差异很大,Large 的衰减约为 Tiny 的数倍,这是谱硬化的直观证据。

有效增益 × 层间对齐: 有效增益 ρ 决定主导方向信号逐层放大还是衰减,层间对齐 κ 度量相邻层主导奇异向量的几何一致性,二者搭配是因为只有对齐接近 1 时增益才能沿同一方向累积,组合意义在于解释为何大模型能从色散进入吸引子而随机初始化几乎不可能自发进入该状态。

该结果支持而非证明定理。支持的是规模越大越同时出现低秩与高衰减,与吸引子要求的谱纯度与对齐后果一致。限制是相图只展示末层,没有展示对齐本身,中间层的过渡路径仍需回到深度曲线补充。把末步结果推广到全程会夸大结论,正确读法是末层状态验证了相变的终点,而机制路径需要多层证据联合。

如果只看特征值尾部,大模型的自信从哪里来?

本节按特有细节展开失败条件:Large 在抵抗整体散架的同时,尾部能量反而抬升。比较问题是幻觉与干净条件的特征值比值随序号如何变化,基准是恒等于 1 的虚线,高于 1 表示幻觉能量更高。论文报告首部模式约 1.003,尾部约 1.04 到 1.05,且全程大于 1 并向尾部爬升。

看图路径: 1. 先确认横轴为特征值序号 k、纵轴为幻觉与干净的特征值比值,虚线 1.0 为恒等基准;2. 检查曲线全程位于 1.0 之上,确认扰动后能量整体抬升而非部分下降;3. 比较首部比值约 1.003 与尾部约 1.04 到 1.05 的爬升幅度;4. 注意尾部波动增大但趋势向上,对应细微声学特征被放大的尾部模式

原论文 Figure 3:Eigenvalue-ratio profile (Whisper Large, layer 3): λhell/λclean vs.

论文图 3。原论文 Figure 3:“Eigenvalue-ratio profile (Whisper Large, layer 3): λhell/λclean vs. index k — everywhere > 1 and rising toward the tail (leading mode ≈1.003, tail ≈1.04–1.05).”。

从像素可见,红色曲线从序号 1 附近约 1.003 起步,快速爬升后沿锯齿状持续上行,到序号 45 附近达到峰值约 1.06 附近,之后略有回落但仍远高于 1。浅红色填充标注为谱侵蚀区,灰色虚线为恒等基准。全程无低于 1 的点,说明扰动没有压低任何已排序的能量成分,而是系统性抬升,尤其是本应微弱的尾部成分被不成比例地放大。

基尔霍夫指数 × 过挤压: 基尔霍夫指数 Kf 由激活协方差特征值倒数和定义表示隐图的有效电阻,过挤压指信息在传播中被瓶颈压缩而丢失,二者搭配是因为 Kf 指数上升对应图电阻增大与长程声学依赖难以到达深层,组合意义在于把 Regime I 的雅可比饱和与早期注入衰减转成可测量的电阻式代理量。

这个看似矛盾的现象正是吸引子解释的关键:尾部能量上升的同时谱斜率变陡,意味着模型用放大的内部尾部模式替代了精细声学特征。换句话说,能量多了但信息少了,多出的部分是内部先验而非证据。因此对数概率依然可以很高,因为模型在自身流形内是自信的。未评测的边界是该图只展示 Large 第 3 层,不能说明深层是否同样存在尾部抬升,也不能给出检测阈值,复现时应补多层与多模型的同图对照。

哪些关键量没有被直接测量?

第一个限制是对齐假设。论文用谱硬化与秩压缩作为结构对齐的特征性签名,但在讨论中明确承认没有直接测量层间主导子空间的余弦。从逻辑上说,低秩高衰减与高对齐是一致的,但不是唯一的解释,优化动力学、归一化或注意力饱和也可能塑造类似谱形。因此吸引子结论应表述为支持而非证实,待验证的是跨层奇异向量的实际内积分布。

第二个限制是适用范围。作者明确把结论限制在 Whisper 家族,未来才计划扩展到 Canary 与 OWSM 等编码器解码器模型。不同分词、不同编码器深度与不同训练数据的模型可能有不同的增益与对齐轨迹,不能把 Tiny 到 Large 的单调分离直接推广为所有语音基础模型的定律。

第 3 个限制是检测与成本缺项。论文未报告误判率、延迟、推理开销与输出帧率,也未给出基于谱指标的实时检测精度。即使谱特征能区分机制,也不等于能以可部署的代价提前拦截幻觉。相关性不是因果,缺失的证据不应被当作技术错误,但复现者不应承诺这些未测量量得到改善。

要复现这条证据链,先做什么?

复现的第一步是重建 Hell 配对集。基于 LibriSpeech 的测试干净与测试难例划分,对每条语音施加 3 类扰动:时间拉伸、对多人混音与高斯噪声,然后用同一 Whisper 模型解码并计算词错误率,只保留大于 0.5 的样本。关键是保持干净与扰动的配对关系,后续所有谱差值都在配对内计算,避免用总体均值掩盖个体效应。

第二步是抽取表示并计算谱量。对 Tiny、Small 与 Large-v3-Turbo 分别保存解码器每层的交叉注意力、自注意力与前馈激活,对每个矩阵做奇异值分解,计算有效秩、谱衰减系数与基尔霍夫指数,并在主导模式与尾部两种宽度下重复。复现时应固定解码超参数与随机种子,记录分解库版本,因为小幅的自注意力压缩对数值细节敏感。

第三步是绘制 3 张诊断图:分组件的深度秩崩解曲线、末层的相图散点、Large 浅层的特征值比值曲线。只有当 Small 接口大幅下降、Large 自注意力小幅压缩且相图单调分离同时出现时,才能说复现了论文的主张。若只能复现其中之一,应报告为部分复现并检查扰动强度与筛选阈值是否与原文一致。

何时值得用这套谱视角,结论的边界在哪里?

当研究者遇到流利但无依据的转写,且词错误率与置信度无法预警时,这套视角值得尝试。它把排查从看文本转向看表示:先看交叉注意力是否随深度丢失秩,若是则优先检查声学前端、对齐与噪声鲁棒性;若接口完好但自注意力压缩且谱变陡,则优先怀疑解码器先验过强,考虑解码约束、外部验证或谱正则化。

论文特有的误解需要澄清。第一,高谱衰减不等于高质量,衰减陡恰恰可能是吸引子锁定的信号,不能单独作为模型更好的证据。第二,能量整体抬升不等于证据增强,尾部放大的可能是内部模式,需结合斜率一起读。第三,大模型抵抗散架不等于更少幻觉,它的幻觉更结构化、更自信,反而更难被对数概率发现。

最终的收束是机制判断而非部署承诺。论文报告的是中间规模的结构解体与大规模的压缩寻求吸引子,证据是配对谱差值与相图分离,代价是未直接测量对齐、未验证跨家族泛化、未给出检测成本。后续验证应补上层间对齐的直接测量、其他编码器解码器模型的对照,以及基于谱特征的实时检测与正则化实验,再谈改善误判率与延迟。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总