英文题目:Layer-wise Probing of Whisper’s Encoder Representations for Bengali Phone-like Units
会议身份:
conference:interspeech:2026:conference-paper-id:thahmid26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#评测协议 #可解释性 #语音学与音系 #语音 #音频分类
评分:5.9/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Munim Thahmid:机构信息未能从会议 PDF 纯文本可靠映射
- Sadia Sharmin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究冻结的Whisper编码器在孟加拉语上何处形成音位类单元的线性可分表示,输入为连续语音与转写,输出为逐层音类判别性能曲线,难点在于低资源语言缺乏可靠音素对齐且短片段易受说话人与词汇泄漏干扰。方法链分为四步:先用多语言语音模型对罗马化转写做强制对齐并按规则合并相邻字形得到区间标签,再按最大时间重叠将区间映射到50 Hz编码帧并取中心段平均为层表示,接着逐层训练线性探针在说话人无关划分上评估,最后用最小对ABX判别与二元对立探针做无分类器交叉验证。相对自监督编码器的中期峰后速降,监督语音识别训练被认为能把音系细节保留到更深编码层,这构成机制差异与复用冻结特征的实际意义。在共享2000话语子集说话人无关评测设置下,Whisper-medium在15/24层的Macro-F1为0.858 ± 0.003,高于Whisper-small在8/12层的Macro-F1 0.837±0.017。结论仅适用于粗粒度罗马化代理标签与自然语境判别,精细音系与上下文受控泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么要逐层看?
这篇论文的输入是孟加拉语朗读语音,目标是回答一个定位问题:在已经训练好的多语语音编码器内部,孟加拉语电话样单元在第几层最容易被线性分类器分开。初学者可以把编码器想象成一叠变换,每一层都把声音重新表达 1 次,探测就是在每一层门口放一个很弱的分类器,只看哪一层门口的表示已经把不同音类摆得足够开。
论文必须保留的信息包括数据来自 OpenSLR 53 孟加拉语子集、标签来自多语对齐器 MMS 在通用罗马化文本上的强制对齐、评价是说话人互斥、模型是冻结的 Whisper small 与 medium 与 large-v3 加 wav2vec2-XLSR 对照。输出不是新的识别系统,而是一条随深度变化的可分性曲线加分音类与对照实验。学习本文需要先接受两个前提:第一,标签是字形簇拼出来的代理目标,不是语言学手册里的标准音位;第二,探测分数高只说明线性可分,不等于模型在该层理解了音系。
按学习依赖展开,先讲任务与相关路线,再讲方法全景与组件计算,然后讲构造与评价条件,最后讲结果、反证与复现。本文讨论的 Whisper 是监督式多语编码器解码器结构,但论文只用其编码器部分且全程冻结,wav2vec2-XLSR 是自监督多语编码器,用来对照训练目标不同是否改变晚层行为。
同输入同目标的已有路线把峰值放在哪里?
相关工作可以按输入、目标、监督与运行阶段对照。第一条路线是英语自监督表示的逐层分析,Pasad 等人报告音素信息集中在 wav2vec2 与 HuBERT 的中层并向顶层下降,这与本文的 XLSR 孟加拉语结果方向一致,区别是本文把同一套探测流程搬到孟加拉语并增加了 Whisper 监督模型的对照。
第二条路线是跨层一致性与多语表示研究,关注不同层是否学到相似内容,本文不直接测一致性,而是用分类与 ABX 两种度量三角验证峰值位置。第三条路线是 Whisper 的应用与可解释性,包括孟加拉语识别性能、发音障碍检测、情感识别的低秩适应等,本文的不同在于不微调不做下游任务,只做冻结编码器的层间比较。
第四条路线是强制对齐方法本身,基于隐马尔可夫的蒙特利尔对齐器在边界精度上常优于基于连接时序分类的峰值输出,本文把对齐当作实用代理并用置信度过滤、小规模核查思路与英语对齐锚点来检验噪声是否改变结论。初学者容易把类别差异当成同条件胜负,例如把英语音素探测分数直接与孟加拉语电话样分数比大小,论文的正确做法是只比形状与相对深度,绝对值受标签噪声与类别数影响不可比。
要回答的具体问题与容易误解的标签是什么?
中心问题有两个:孟加拉语电话样单元在哪一层最线性可分,这个形状如何随模型规模变化。附带问题是这种形状是 Whisper 特有还是大语音编码器的共性,因此引入自监督基线。为此论文把连续语音先切成段,每段得到一个标签、一个时间区间与一个置信度,再把段映射到 Whisper 每秒 50 帧的网格上。
容易误解的是标签,例如例子中的 th 与 bh 与 ch 与 tt 与 ddh 等写法,它们是通用罗马化字符按规则合并后的字符串,不是国际音标,也不是经过音系学家审定的音位。论文明确说这些是可复现的字形簇对齐目标,语言学解释只限制在送气与卷舌这类在罗马化下仍稳定的粗对比上。另一个误解是把探测准确率高当成识别效果好,实际上探测只在冻结表示上训练浅分类器,解码器、语言模型与搜索都不参与,因此不能直接推断词错误率。
教学例子:假设一句孟加拉语音频被转写并罗马化后得到一串字符,对齐器给出每个字符的起止时间,合并规则把相邻的 t 加 t 加 h 拼成 tth 并取时间并集,这就是一个电话样单元样本,后续所有层共享同一组帧索引以保证比较公平。例子只是帮助理解合并与映射,不代表真实音频的数值结果。
从一条语音到一条层间曲线走完哪些步骤?
沿一个样本走完全流程有助于建立依赖关系。第一步取一条 OpenSLR 53 孟加拉语音频与其转写,转写先规范化并用通用罗马化工具变成无重音拉丁串。第二步用 MMS 强制对齐器得到每个罗马化字符的时间跨度与字符分数,按确定性映射贪心合并相邻跨度,合并包括双字母合并、3 个字符的三合合并与长元音塌缩,标签取合并后字符串,区间取并集,置信度取平均。
第三步用冻结的 HuggingFace Whisper 检查点抽取嵌入层加每层变换器输出,关闭丢弃,得到每秒 50 帧的隐藏状态。第四步按最大时间重叠把每段映射到帧,若主导电话占据帧时长不足 70% 则该帧判为模糊并丢弃,每段只保留中间三分之 1 帧并平均成一个向量,若段短于 3 帧则退化为中心帧。
第五步对每一层独立做训练前按训练集计算的逐层标准化,再训练多项逻辑回归并在互斥说话人上测准确率与宏平均 F1,3 随机种子取均值与标准差。第六步把每层的宏平均 F1 连成曲线,峰值层除以总层数得到相对深度,再用 ABX、置信度过滤、时长分层与英语锚点验证形状是否稳定。整个流程中语音编码器从不更新,梯度只存在于浅探测器内部,对齐噪声通过过滤与敏感性分析处理而不是假装不存在。
对齐、映射与探测器各自算什么?
对齐组件的输入是音频加罗马化文本,输出是字符级区间与分数,计算目标是让文本与音频在时间上对上。论文对孟加拉语用 MMS,对英语基线用蒙特利尔对齐器直接取其音素标签,这种不对称是故意的:英语端作为跨语言锚点需要更干净的边界,而孟加拉语端恰是待检验的噪声条件。
映射组件的输入是字符区间与 50 赫兹帧网格,输出是每段每层一个向量,关键操作是帧主导比例阈值与中央三分之一池化。论文报告对齐段很短,中位时长 20 毫秒,约 70% 六的段对应不超过 2 帧,这就是选择中央池化而不是全段平均的理由,消融显示换成中位数池化峰形基本不变。
探测器组件的输入是标准化后的段向量,输出是 30 类或二分类的预测,线性探测用 L2 正则逻辑回归,系数 C 取 0.1,优化器用 L-BFGS,最大迭代两千,非线性对照用单隐层 256 单元的感知机。标准化按层在训练集上计算,避免跨层尺度差异主导比较。
冻结编码器 × 线性探测: 冻结编码器负责把语音变成逐层表示且本身不更新,线性探测负责在每一层上用最简单的线性分类器检验电话样单元是否已经线性可分,二者搭配的理由是把表示能力与分类器能力分开,组合意义在于层间分数差异只能归因于表示本身的变化而不是微调带来的适应。
冻结编码器与线性探测的组合把表示比较变成了公平的逐层考试,初学者应先记住这一分工再看曲线高低。
强制对齐 × 电话样单元: 强制对齐负责给出每个 uroman 字符在时间上的起止区间与置信度,电话样单元负责按合并规则把相邻字符区间拼成可分类的标签目标,二者搭配的理由是 Whisper 帧是连续的而监督必须是离散段,组合意义是得到可复现的字符簇目标但同时承认它不是标准音位表。
强制对齐与电话样单元的组合决定了监督目标的粒度,理解它是代理目标才能正确限制语言学结论的范围。
本研究训练了什么,没有训练什么?
本研究没有训练任何语音编码器,Whisper 与 XLSR 权重全部冻结,也没有训练对齐器与分词器,唯一需要优化的是每层一个浅探测器。真实计算过程是监督分类:在说话人互斥的训练段上拟合逻辑回归权重,用训练集均值方差做标准化,检查求解器收敛后在测试说话人上计算准确率与宏平均 F1。
非线性对照同样只训练单隐层网络 30 轮,批量二百五十六,Adam 学习率千分之一,其余表示不变。需要指出的缺项是论文未报告编码器预训练的梯度路径与数据细节,本文只引用其已发布检查点,不从模型名称推定预训练实现。另一个缺项是未报告探测训练的硬件耗时,但因探测数据量为数千段且分类器很浅,成本主要在表示抽取而非分类器拟合,小子集实验明确是为了控制抽取成本。
由于编码器冻结,不能把参数冻结等同于系统输出确定,解码与采样策略仍可引入随机性,只是本文不涉及解码。
说话人互斥划分 × 文本近似互斥: 说话人互斥划分负责让训练与测试说话人不重叠以防记住音色,文本近似互斥负责检查转写文本在两端几乎不重叠以防记住词句,二者搭配的理由是语音探测容易同时泄露说话人与词汇,组合意义是让层间曲线更可能反映音类本身的可分性而不是记忆。
说话人互斥与文本近似互斥共同保证了探测分数不是靠记住说话人或句子刷出来的,这是理解评价严格性的关键。
数据、划分、指标与基线如何保证可比?
主实验用 2000 条孟加拉语音频的子集并在所有 Whisper 规模间共享,过滤平衡后得到 7669 个电话段,来自 493 个说话人,覆盖 30 个电话样标签,最频标签 a 被截断到 2000 样本,最小保留类有 52 个样本。置信度 0.7 过滤后剩 6015 段,485 个说话人,27 个标签。
划分是说话人互斥,测试比例 0.2,无过滤时约 6100 训练加 1500 测试,对应约 395 加 99 个说话人,过滤后约 4800 加 1200。词汇重叠每种子约 4 到 6 条相同转写,占比约 0.2%,因此说话人互斥近似等价于文本互斥。英语锚点用 LibriSpeech 测试集干净子集的 200 条加蒙特利尔对齐标签,因样本少而用话语互斥而非说话人互斥。
指标方向是准确率与宏平均 F1 越高越好,宏平均对小类更敏感,适合类别不平衡的电话任务,聚合是对 3 随机种子取均值加标准差。基线包括标签打乱近机会水平、文本互斥划分、英语 MFA 锚点、自监督 XLSR 同流程对照,以及求解器、标准化、类别权重与池化的探测配方消融。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码模型或数据已公开,原文仅写代码与产物将公开发布,应理解为计划而非当前可用。
峰值在第几层,规模如何改变晚层?
要回答的主比较问题是:在说话人互斥与共享 2000 条条件下,3 种 Whisper 规模的峰值层与晚层保持度是否随规模改善,指标方向是宏平均 F1 越高越好。公平条件是共享音频子集、相同帧映射与相同线性探测配方,聚合都是 3 个种子均值加标准差。
| 模型 | 峰值层 | 相对深度 | 准确率 | 宏平均 F1 |
|---|---|---|---|---|
| small 12 层 | 8/12 | 0.67 | 0.890 ± 0.006 | 0.837 ± 0.017 |
| medium 24 层 | 15/24 | 0.63 | 0.897 ± 0.001 | 0.858 ± 0.003 |
| large-v3 32 层 | 26/32 | 0.81 | 0.906 ± 0.005 | 0.860 ± 0.003 |
上表比较了峰值位置与绝对分数,公平条件已在表前说明,指标方向都是越高越好。表后解释是:small 与 medium 呈倒 U 形,峰值相对深度都在约 0.65 附近,large-v3 峰值绝对层更深但在约 0.66 深度已接近峰值并形成宽晚层平台,末层仅降约 2 个百分点而 medium 降约 4 个百分点,支持规模减轻语音细节与解码器表示之间权衡的判断。代价与反例是绝对提升不大,medium 到 large-v3 峰值仅从 0.858 到 0.860,且英语锚点分数更高不能直接比大小。
分音类看,送气塞音与塞擦音早层已超 0.9,鼻音与擦音的中层爬升贡献了总峰,逆卷鼻音 nn 峰值仅 0.71 且晚层回落,顶层混淆集中在 n 与 nn、s 与 sh、dd 与 tt。
相对深度 × 绝对层号: 绝对层号负责定位某一模型内部的第几层,相对深度负责把层号除以总层数以便跨规模比较,二者搭配的理由是 small 只有 12 层而 large-v3 有 32 层直接比层号不公平,组合意义是可以判断峰值是否稳定在约三分之二深度以及晚层平台是否随规模变宽。
相对深度与绝对层号的换算关系是跨规模比较的前提,记住除以总层数才能看出 2/3 附近的对齐。
下面这张图把 3 条 Whisper 曲线的相对深度形状放在同一坐标下,是理解规模效应的关键,横轴是层号除以最大层,纵轴是宏平均 F1,3 个种子阴影带表示波动。
看图路径: 1. 先看横轴相对深度与纵轴宏平均 F1 的含义,再看三条曲线的共同爬升段;2. 比较 small 蓝色与 medium 橙色峰值是否都落在相对深度三分之二附近;3. 观察 large-v3 绿色曲线在右侧晚层是否比另两条曲线更平坦持久
论文图 2。原论文 Figure 1:“Macro-F1 vs. relative depth for three Whisper sizes (Bengali; speaker-disjoint; 2 000 utterances).”。
图中 3 条曲线都从 0.3 附近随深度快速爬升,small 蓝色与 medium 橙色在相对深度约 0.6 到 0.7 达到顶点后轻微下滑,large-v3 绿色爬升稍慢但在右侧高位更平,阴影带为 3 个种子标准差,说明峰形不是单次随机的偶然。需要强调总体趋势不等于每层单调,large-v3 中段仍有小幅波动,复现时应看峰值区间与晚层平台而不是苛求某一层的精确相等。
换度量、换阈值、换对齐后峰形还成立吗?
本节按问题组织反证:分类器依赖、帧映射阈值、对齐置信度与编码器训练目标任一改变是否推翻中到后层最优。先看自监督对照,公平条件是同一 2000 条、同一映射与同 L-BFGS 加标准化流程,指标仍是宏平均 F1 越高越好。
| 条件 | 模型 | 峰值表现 | 末层表现 | 峰值到末层损失 |
|---|---|---|---|---|
| 无过滤峰值 | medium 24 层 | 15 层 0.858 ± 0.003 | 末层降约 4 个百分点 | 中度下滑 |
| 无过滤峰值 | large-v3 32 层 | 26 层 0.860 ± 0.003 | 末层 0.842 | 降约 2 个百分点 |
| 无过滤峰值 | XLSR 24 层 | 15 层 0.801 ± 0.010 | 末层 0.689 ± 0.033 | 降 14 个百分点 |
| 稳健变体 | XLSR 加权顶层 | 稳健顶层 0.716 | 仍远低于峰值 | 定性陡降不变 |
| 置信度过滤 | Whisper 全规模 | 峰层排序保持 | 分数整体抬高 | 噪声非主因 |
表前问题是训练目标是否改变晚层行为,公平条件已对齐,指标方向一致。表后解释是:XLSR 峰值也在中层但晚层陡降,未胜出项恰是 XLSR 末层,负结果是即使加平衡权重的稳健顶层探测也只能小幅抬高末层而不能改变陡降,这支持监督识别训练把语音细节保留到更深层的解释,但仍是有限解释而非因果证明。ABX 作为无优化器度量同样显示峰随规模后移,small 送气与卷舌都在第 9 层,medium 在 14 到 15 层,large 在 20 到 22 层,与分类峰三角互证。
帧阈值敏感性在 100 条 13 类子集上扫 0.5、0.7、0.9,峰仍在中到后层,11 层在 0.5、10 层在 0.7 与 0.9,说明映射阈值只改变绝对值。孟加拉语小规模对齐核查用 191 条,中位 70 毫秒,可用帧保留率远高于 MMS,但类别减至 22 类后峰仍在第 9 层,分数降至 0.632,提示边界更准不改变形状但类别与数据量改变绝对值。
分类器探测 × ABX 可分性: 分类器探测负责用训练得到的线性边界度量多分类可分性,ABX 可分性负责用余弦距离直接比较三元组而不训练分类器,二者搭配的理由是前者依赖优化与类别平衡而后者不依赖,组合意义是当两种度量都指向中到后层最优时结论更少受探测器选择影响。
分类器探测与 ABX 可分性的搭配让结论不再依赖单一优化器,两种度量同向才能更放心地谈深度趋势。
下面这张图直接对比 Whisper 与 XLSR 的相对深度曲线,是判断训练目标效应的最直观证据,横轴是相对深度,纵轴是宏平均 F1,红色是自监督基线。
看图路径: 1. 先区分图例中三条 Whisper 曲线与红色 XLSR 曲线的整体走向差异;2. 观察 XLSR 在相对深度接近 1 处急剧下坠与紫色星号稳健点的位置;3. 对比 large-v3 绿色曲线在右侧是否保持高位平台而不跟随下坠
论文图 1。原论文 Figure 2:“Macro-F1 vs. relative depth for Whisper models and wav2vec2-XLSR (Bengali; speaker-disjoint; 2 000 utterances).”。
图中橙蓝绿 3 条 Whisper 曲线在右侧保持高位,红色 XLSR 在相对深度约 0.9 后急坠并在末端出现深谷,紫色星号的稳健顶层点略高于红色末端但仍远低于峰值,阴影带显示该下坠超出随机波动。解读时先确认图例完整对象与时间范围是同一 2000 条说话人互斥,不能把纵轴的宏平均 F1 当成准确率,也不能把末步低点推广为全程不好。
接下来看帧阈值是否只是过滤了短段的噪声,下图横轴改为绝对层号,比较 3 种多数阈值下的峰形是否同步移动。
看图路径: 1. 先确认横轴是编码器层号零到十二,纵轴仍是宏平均 F1 指标;2. 比较零点五零点七零点九三条阈值曲线在八到十层峰值是否重合;3. 观察浅层与深层阴影带宽度,判断阈值改变是否只影响绝对值
论文图 3。原论文 Figure 3:“Frame-majority threshold sensitivity (Whisper-small; 100 utterances; 13-label allowlist).”。
图中 3 条阈值曲线都呈先升后平再微降,峰值区在 8 到 10 层重叠,浅层分数低且阴影宽,说明小样本下浅层估计不稳,阈值提高并未把峰推向浅层或深层,支持映射选择不是峰形的人为来源。像素不能精确读出的具体小数不应硬写,应以正文报告的峰层为准。
哪些结论不能下,哪些边界尚未评测?
论文直接报告的是可分性曲线的形状与峰值区间,有限解释的是监督训练保留深层语音细节,尚未验证的是因果与下游收益。缺失证据不是技术错误,但必须明确边界。第一,标签是粗代理,通用罗马化合并了若干对立,细粒度音系结论需谨慎,论文只对送气与卷舌等粗对比做语言学解读。
第二,段极短,中位 20 毫秒,多数段不超过 2 帧,虽然时长分层显示短段与长段都在第 8 层达到 0.87 左右,但上下文受控的 ABX 仍是未来工作。第三,只对比了一个自监督编码器与 191 条的小规模对齐核查,更广的自监督基线与更大规模的人工核查尚未做。
第四,未测量误判率之外的延迟、算力与解码成本,不能承诺抽深层表示一定改善识别,训练资源、推理开销、输出帧率与实际延迟应分别讨论。原文预设的 2/3 深度到末层对比显示 medium 从 16 到 24 层平均降 0.039 而 large 从 21 到 32 层平均降 0.007,前者置信区间不含零后者包含零,这支持规模效应但不等于每组每步都成立。相关性不是因果,晚层平台可能与容量、数据与目标多因素有关。
要复现这条曲线先做什么,需要哪些参数?
复现应按依赖顺序先准备数据与对齐,再抽表示,最后逐层探测。第一步取 OpenSLR 53 孟加拉语 2000 条共享子集,保留说话人标识,转写规范化后用通用罗马化得到拉丁串,用 MMS 强制对齐得到字符区间与分数,按双字母、三合与元音塌缩规则贪心合并,标签取合并串,区间取并集,置信度取平均,每类截断 2000 并丢弃少于 50 样本的类。
第二步加载冻结的 Whisper small 与 medium 与 large-v3 检查点,打开输出隐藏状态,关闭丢弃,按 50 赫兹把段映射到帧,主导占比低于 0.7 的帧丢弃,每段取中央 1/3 平均,短段取中心帧,保证跨层帧索引一致。第三步按说话人互斥划分测试比例 0.2,3 随机种子,逐层在训练集上算标准化参数,多项逻辑回归取 C 0.1、L2、L-BFGS、最大迭代 2000、容差 0.0001,报告准确率与宏平均 F1。
先跑 small 验证第 8 层峰值与中到后层形状,再跑 medium 与 large 验证相对深度与平台,接着做 0.7 置信度过滤、帧阈值 0.5 到 0.9 扫描与标签打乱近机会水平检查。若只有 100 条量级,应缩小到 13 类允许表并预期绝对值下降但峰形保持。还需补的验证是更大规模的对齐质量审计与上下文控制的 ABX,以及跨更多自监督编码器的对照。关于可用性,本次没有验证通过的公开资源,不得写代码模型或数据已公开,复现应以论文文字参数为准。
何时值得抽深层表示,何时不必?
综合所有证据,当任务需要线性可分的音类表示且使用 Whisper 这类监督编码器时,值得尝试抽中到后层而非浅层或末层,small 可从第八层附近开始,medium 从第十五层附近开始,large-v3 可在 21 到 28 层区间内选平台而不必执着于单点峰值。当任务涉及送气爆发与塞擦噪声这类声学显著线索时浅中层已够,而涉及齿与卷舌鼻音、擦音部位等细微对立时更需要中层以上的上下文整合。
分音类热图支持这一分工:th 与 bh 与 ch 与元音 a 在 4 到 5 层已超 0.9,n 与 nn 与 ss 在 7 到 9 层陡升,kh 与 h 到 10 到 11 层才最优。下图按行列展示了这种分化,是决定抽取层时的重要依据。
看图路径: 1. 先按行看送气音 th 与 bh 以及塞擦音 ch 在哪一列就变为深红色;2. 再看鼻音 n 与 nn 以及擦音 ss 的深红色向中间层推移的过程;3. 注意 nn 整行整体偏浅及其在十到十二列的回落,对应持续混淆
论文图 4。原论文 Figure 4:“Per-class F1 across Whisper-small layers. Aspirated stops and the affricate ch saturate early; nasals and sibilants drive mid-layer gains.”。
上图按行展示了 15 个电话样类别在 0 到 12 层的逐层 F1 变化,深红表示高分而浅黄表示低分,横轴从嵌入层 0 到 12 层,纵轴为电话样类别。可以看到送气与塞擦行早早变红而鼻音与擦音行在中间才变红,nn 行整体偏浅印证了持续混淆,复现时应重点核对早饱和与晚爬升两类行的位置。若使用自监督 XLSR 则应避免直接取末层,因其末层比峰值低 14 个百分点,即使换稳健探测也难挽回。未评测边界是长句解码与实时延迟,抽深层意味着更多计算,是否值得需另测推理开销。最终判断是:规模增大没有大幅抬高峰值绝对值,但拓宽了可用的深层区间,这是本文对实践最有用的信息。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



