英文题目:Stuttering Classification and Segmentation with Attention-Based Multiple Instance Learning
会议身份:
conference:interspeech:2026:conference-paper-id:susac26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#注意力机制 #弱监督学习 #言语障碍 #语音 #音频事件检测
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Petar Sušac:机构信息未能从会议 PDF 纯文本可靠映射
- Sebastian P. Bayerl:机构信息未能从会议 PDF 纯文本可靠映射
- Hrvoje Džapo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为 3 秒口吃语音片段,输出为片段级多标签分类与 20 ms 级帧级口吃分割,难点是主流数据集只有片段级弱标签而临床严重度评估需要事件持续时长。该方法用语音基础编码器抽取多层帧表示并经 HConv 接口融合,再经双向长短期记忆网络做时序平滑与投影,随后分叉为实例分支与嵌入分支。实例分支对每帧输出多标签概率并用最大池化得到片段预测,嵌入分支用多实例学习注意力加权帧嵌入得到包表示再分类,帧级推理时若片段判正则对归一化前注意力分数加 Sigmoid 阈值化。与已有最大池化多实例方法相比,关键差异是将注意力池化嵌入机制首次引入多标签口吃分类,使片段判别与关键帧定位解耦并保留可解释权重,同时通过微调编码器摆脱对合成口吃帧级预训练的依赖。在 CASA 共识测试集整段录音评测下,Whisper 注意力池化模型帧级平均 F1 达到 0.70,高出同期分割基线约 0.23 至 0.25;在 SEP-28k-E 上仅在 Block、Sound repetition、Word repetition 和 Interjection 上达最优,Prolongation 与流畅标签仍落后基线。该结论仅适用于英语播客与 FluencyBank 访谈类语音,对长时阻塞、多说话人及跨语言泛化尚未验证。原文未披露训练推理成本与代码权重。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决什么矛盾?
本文的输入是 3 秒长的语音片段,目标有两个层次。第一是片段级多标签分类,判断一个片段中是否存在阻塞、延长、音重复、词重复、插话等口吃类型,一个片段可以同时含多种类型。第二是帧级切分,以 20 毫秒为 1 帧,给出每 1 帧是否口吃,从而得到口吃事件的起止时间和持续时长。必须保留的信息是训练时只有片段标签,没有帧时间戳,评估时帧任务需要在连续录音上逐帧打分。输出是每类在片段和帧两个粒度的概率或二值判定。
矛盾在于临床评估需要时长。论文明确指出标准化严重度评估工具如 SSI-4 和言语效率分要求已知口吃持续时间,而现有大规模数据集为降低标注成本多采用片段标注,由非专家快速标注有无,不记录时间戳。若只做片段分类,就会丢掉评估最需要的时长信息。若要求全部数据重标帧时间戳,成本又不可行。因此本文要回答,能否只用片段标签训练出可做帧切分的模型。
给刚入门的读者一个定位动作。拿到一个 3 秒片段,先问它被标了什么标签,例如至少 2 名标注者投了阻塞则阻塞为正。再问模型要输出什么,片段层面是一个长度为类别数的向量,帧层面是一个帧数乘类别数的矩阵。学习依赖是后文所有方法都围绕包与实例关系展开,理解包标签已知而实例标签未知,是读懂最大池化和注意力池化的前提。
同任务、同监督下已有路线做到哪里?
在同输入同目标的片段多标签分类路线上,近年主流是使用基础语音编码器加时间池化再接分类头。论文列出的做法包括对编码器输出做平均池化或点积注意力,然后分类。编码器覆盖 wav2vec 2.0、Whisper 和 WavLM。另一支路线用手工谱特征加长短期记忆网络或随机森林。本文把前者作为直接对照,因为同为片段监督、同为多标签、同运行阶段可比。
在帧级路线上,已有 3 类不同监督和运行条件。YOLO-Stutter 是多模态语音文本模型,在人工合成口吃数据上训练,把任务做成类目标检测问题。StutterCut 是图聚类方法,借助基于 Whisper 的片段分类器把 1 帧聚为流畅与不流畅两簇。Harvill 等人与 Shih 等人的方法是二进制帧分类,先在合成口吃上预训练,再在片段数据集上用多实例学习微调。它们与本文的差异在于是否需要帧级或合成预训练,以及是否为多标签。
本文的继承与区别很清晰。它把 Shih 等人的实例加最大池化多实例方法推广到多标签,并首次把基于注意力的嵌入式多实例方法用于口吃分类。与需要帧级预训练的方法不同,本文声称无需在帧标注数据上预训练,只用片段数据即可做零样本帧分类。这个声明是后文实验必须检验的,读者应注意它的适用条件是单标签帧评估,而多标签帧切分留作未来工作。
为什么片段标签能监督帧模型?多实例假设是什么?
把一个片段看作包,把其中按 20 毫秒划分的帧看作实例。标准多实例假设是包标签已知而实例标签未知,若包中任一实例为正,则包为正,若全部实例为负,则包为负。举例说明,这是一个教学例子而非论文数据。假设一个 150 帧的片段中第 20 到 50 帧是音重复,其余流畅,则包的音重复标签为正,但模型训练时看不到 20 到 50 这个区间,只能看到包为正。
推广到多标签时,每个类别独立满足上述假设。一个片段可同时因不同帧区间而在多个类别上为正。论文把无口吃词标签取反,使正表示含有口吃,从而符合有口吃帧则包为正的假设。标签为正的判定规则是 3 名标注者中至少 2 人投票给该标签。
这个形式化决定了两种学习路径。基于实例的路径为每帧输出概率,再用最大、平均或对数和指数等池化函数聚合成包概率,帧分数直接解释包决策。基于嵌入的路径先把多帧映射为包嵌入再判包标签,片段性能常更好但缺少解释。注意力池化被引入来弥合两者,它学习自适应池化权重,其权重被证明能指示对正包有贡献的关键实例。本文正是利用这一性质做切分。
两个多实例网络如何从同一主干分叉?
2 个模型共享前半段,只在后半段分叉。输入 3 秒音频先经过预训练基础编码器,论文试验 wav2vec2-large、wavlm-large 和 whisper-medium,三者参数量相近且嵌入维度均为 1024。编码器多层输出经 HConv 接口汇聚,卷积特征提取器产生时间维表示,3 种编码器帧长均为 20 毫秒,3 秒对应 150 帧。然后经过 4 层每层 512 单元的双向长短期记忆网络做平滑,再经过 2 层分别为 256 和 128 神经元加泄漏修正线性单元的投影器。至此仍保留时间维 T,这是能做帧预测的关键结构选择。
从投影器之后分叉为实例模型与嵌入模型。实例模型经逐帧多标签分类头加 Sigmoid 得到每帧每类概率,训练时取每类在时间维的最大值作为片段概率,推理做帧切分时去掉最大池化并对逐帧概率阈值化。嵌入模型经多实例注意力层得到包表示再分类,帧切分时若片段判负则全部帧判负,若判正则用归一化前的注意力权重经 Sigmoid 加阈值做帧分类。 下图是理解分叉最直接的材料,建议按主路径与分支对照阅读。
看图路径: 1. 先从底部 3 秒音频波形向上追踪 Foundation Encoder 到 HConv 到 LSTM 到 Projector 的主路径;2. 对比左侧实例分支经 Classifier 加 Sigmoid 再经 Max pooling 得到片段预测的走向;3. 对比右侧嵌入分支经 MIL attention 同时分叉到片段预测和注意力权重两路的走向;4. 核对每条箭头旁标注的张量形状变化,确认时间维 T 在何处被保留、何处被压缩
论文图 1。原论文 Figure 1:“Architecture of the proposed MINN models.”。
左图实例分支的虚线框标出训练时才用的最大池化,帧预测在池化之前引出。右图嵌入分支的多实例注意力同时产生两路输出,一路经分类器到片段预测,另一路经 Sigmoid 到注意力权重。两图底部均为 3 秒音频波形,顶部张量形状标注显示 T 在投影器之前始终保留。注意右图分类器的输入维度已从时间维压缩为包维度,而注意力权重仍保留 T,这正是嵌入模型能回溯到帧的原因。
编码器、平滑层与分类头各自做什么?
基础语音编码器负责提供可微调的声学表示。论文先冻结编码器训练后端,待开发集损失 3 轮不下降后再解冻并以更小学习率微调。HConv 接口负责汇聚编码器多层输出,避免只用最后一层。双向长短期记忆网络负责保证帧间时序一致,减少逐帧独立预测的抖动,论文明确指出它改善帧级性能。投影器负责把表示降到适合分类的维度。
分类与池化细节决定监督如何回传。实例头对每帧做二元交叉熵意义下的多标签预测,包损失经最大值反传到最可疑帧。嵌入头的注意力算子由 2 层 128 与 T 神经元加双曲正切与 Softmax 实现,产生长度为 T 的权重,加权求和得包表示。推理用归一化前权重做帧分类,理由是 Softmax 使权重和为 1,若口吃段很长,归一化后单帧权重会被拉低,掩盖长时口吃的证据。
多实例学习 × 片段级弱监督: 多实例学习负责把未知帧标签问题形式化为包与实例关系:片段是包,帧是实例,只要 1 帧含口吃则包为正;片段级弱监督负责只提供包标签作为唯一监督来源。两者搭配的理由是口吃数据集大多只有片段标注,无法直接训练帧分类器;组合后网络可以在只见包标签时仍学出帧级响应,使片段数据能同时训练片段分类和帧切分。
基于实例的多实例学习 × 基于嵌入的多实例学习: 基于实例的方法负责对每 1 帧直接输出类别概率,再用最大池化得到片段结果,可解释性强但片段判别力较弱;基于嵌入的方法负责先把多帧聚合成包表示再做片段分类,片段性能更好但缺少帧解释。两者搭配的理由是需要同时保证片段精度和帧可定位性;组合意义在于论文用注意力池化桥接二者,让嵌入路径也产生可用于切分的帧权重。
沿一个样本走完流程有助于复述。输入 150 帧 3 秒音频,经编码器与平滑得 150 个帧嵌入,经投影器仍为 150 个向量。实例路径输出 150 乘类别数的概率矩阵,取时间最大得类别向量。嵌入路径输出 150 个注意力权重,加权得一个包向量再分类。若片段判正,则回看 150 个权重中超过阈值的连续区间作为切分结果。
注意力与最大池化在训练和推理中有何不同?
训练时两者都只见包标签。实例模型用最大池化把帧到包的映射固定为取最大,梯度主要流向当前最大帧。嵌入模型用可学习的注意力权重做加权平均,梯度可分布到多帧,权重本身也被监督更新。论文沿用 Ilse 等人的注意力算子结构,这是嵌入模型能学出有意义帧权重的结构基础。
推理时阈值均为 0.5,但对象不同。片段任务对分类器输出阈值化。帧任务中实例模型对逐帧 Sigmoid 输出阈值化,嵌入模型对未归一化注意力权重经 Sigmoid 后阈值化,且先看片段判定,若片段为负则直接全帧为负。这种 2 阶段门控减少了在完全流畅录音上的误报,是理解其帧评估的关键。
图 2 的单样本曲线直观展示了两种帧信号的一致性,后文结果节将结合像素解读。
注意力池化 × 最大池化: 最大池化负责取所有帧概率中每类最大值作为片段概率,决策只依赖最可疑的 1 帧;注意力池化负责学习每帧的自适应权重再加权求和得到包表示,决策考虑多帧贡献。搭配理由是最大池化简单但易受单帧噪声影响,注意力能平滑并突出关键区段;组合意义是论文在同一主干下对比两种汇聚,验证注意力在片段和帧两端是否同时带来增益。
基础语音编码器 × 双向长短期记忆网络: 基础语音编码器负责把 3 秒音频变成每 20 毫秒 1 帧的声学表示,论文对比 wav2vec 2.0、WavLM 和 Whisper;双向长短期记忆网络负责在时间维上平滑这些表示,保证相邻帧预测一致。搭配原因是编码器输出帧间独立性强,直接分类会出现抖动;组合后平滑层为后端的投影器和多实例头提供时序一致的帧嵌入,有助于切分出连续的口吃段。
口吃严重度评估 × 帧级切分: 口吃严重度评估负责回答临床关心的口吃持续时长和占比,如 SSI-4 和言语效率分需要时长;帧级切分负责给出每 20 毫秒帧是否口吃及其起止时间。搭配理由是仅有片段有无判断无法计算时长;组合意义是把片段数据集转化为可输出时长的切分器,是论文把多实例学习引入口吃任务的临床动机。
需要提醒的是注意力权重不是概率。它在训练中经 Softmax 归一化用于构建包表示,在帧推理中用的是归一化前的值再过 Sigmoid。两者数值范围与含义不同,不能混为一谈。论文对注意力曲线做了重缩放以便与实例分数同图显示,读图时应只比较起止位置而非绝对高度。
损失、类别不平衡和标注分歧如何处理?
优化目标是二元交叉熵,多标签时在标签间取平均。为处理类别不平衡,对每类正样本加权,权重为该类负样本数除以正样本数。直观上越稀有的口吃类型正样本权重越大,使模型不至于只预测多数类。论文给出权重公式,但本次无公式像素可绑定,故只做文字复述,不另写展示公式。
另一权重处理标注分歧。每个样本有 3 名标注者,若无口吃词标签得票为 0 或 3 表示一致,样本权重为 1,若为 1 或 2 表示分歧,权重为 0.25。再在批内归一化使 batch 平均权重为 1。做法的含义是不丢弃分歧样本但降低其影响,同时保持每批总梯度尺度稳定。
训练分 2 个阶段。先冻结基础编码器,用初始学习率 5×10 的负 5 次方、批量 16 训练至开发集损失 3 轮不下降。再解冻编码器,以 1×10 的负 5 次方微调至开发集损失再次停滞。最终取开发集损失最低的检查点测测试集。优化器为 Adam。编码器解冻与否是后文跨数据集提升的重要解释,复现时必须保留 2 个阶段,不能一开始就全量微调。
数据、划分、基线与指标如何对应?
训练与片段评估用 SEP-28k 的标准化划分 SEP-28k-E,共 28000 个 3 秒片段,标签包括阻塞、延长、音重复、词重复、插话和无口吃词。每样本 3 名标注者,至少 2 票为正。无口吃词标签取反后表示含有口吃。跨数据集片段评估用 FluencyBank 的 4144 个片段,标签体系与 SEP-28k 相同,为与单标签基线可比,只用取反后的无口吃词标签训练单标签分类器。帧评估用 FluencyBank 的 CASA 标注,含核心与次要行为,核心标签包括音节重复、不完全音节重复、多音节重复、延长和阻塞,在 8 段可变长录音共 732 个口吃事件的金标准一致测试集上评估,只聚合成单标签性能。
基线选择按同条件对照。片段多标签对照 Miyahara 等人的 VGG-19 加自注意力权重方法和 Haas 等人的多语种 wav2vec 2.0 个模型,且均未剔除样本。跨数据集单标签对照 Shih 等人的冻结 WavLM 加最大池化多实例模型。帧对照 YOLO-Stutter 与 StutterCut,前者需用 WhisperX 转写并用作者推理代码,后者为作者自实现。录音被切为无重叠 3 秒片段再按 20 毫秒成帧,帧标签由时间戳生成。
指标方向是 F1、精确率、召回率越高越好。帧指标先按每段录音算再平均,而非把所有帧混在一起算,这对长短不一的录音更公平。阈值统一为 0.5。硬件与资助方面,论文说明计算由萨格勒布大学计算中心高级计算服务提供,研究受欧盟下一代欧盟项目支持,但未报告具体显卡型号与训练时长,这是复现成本上的缺项。
片段与帧的主结果支持什么判断?
先看片段多标签任务。比较问题是同为片段监督下多实例结构能否达到已有最优,公平条件是同用 SEP-28k-E 测试集且不剔除样本,指标是每类 F1 越高越好。下表保留原文每类 F1 写法,数值相同不代表同一类别可互换,需按列对照。
| 模型 | 阻塞 | 延长 | 音重复 | 词重复 | 插话 | 无口吃词取反 |
|---|---|---|---|---|---|---|
| Miyahara 等 | 0.30 | 0.53 | 0.46 | 0.67 | 0.78 | 0.82 |
| Haas 等 | 0.33 | 0.51 | 0.53 | 0.71 | 0.77 | - |
| WavLM 加最大池化 | 0.34 | 0.31 | 0.51 | 0.72 | 0.83 | 0.78 |
| WavLM 加注意力池化 | 0.35 | 0.47 | 0.42 | 0.74 | 0.82 | 0.78 |
| Whisper 加最大池化 | 0.35 | 0.50 | 0.53 | 0.80 | 0.74 | 0.78 |
| Whisper 加注意力池化 | 0.35 | 0.49 | 0.53 | 0.78 | 0.82 | 0.78 |
表后解释需要同时看到收益与代价。论文报告 WavLM 与 Whisper 变体在阻塞、音重复、词重复和插话上达到最优,支持基础编码器架构是主要增益来源,因为 wav2vec 2.0 变体全面落后。但在延长和通用流畅标签上略低于基线,这是未胜出项,说明多实例结构并非每类都赢。注意力与最大池化在片段端差距较小,片段最优更多来自编码器选择而非池化。
再看帧单标签任务。比较问题是只用片段训练的模型能否在连续录音上切分,基线假设每段输入必含口吃而本文在整段录音上评估,条件并不完全一致,本文方法更接近端到端。指标仍是越高越好。下图先给出单样本的机制证据。
上方面板横轴为帧序号 0 到约 150,纵轴为频率 0 到 8000 赫兹,语谱图上方标有转写文字,可见前 60 帧为重复区,后段能量连续。按照先确认对象再判断的动作,先确认蓝色实线为实例分数、红色虚线为注意力权重,两者在 10 到 60 帧同时高 plateau,60 帧后同时回落,说明两种路径定位一致。注意纵轴为分数值而非频率,曲线向下在此处表示流畅而非性能变差。像素不能精确读出每帧小数,故只判断区间对应而不硬写阈值 crossing 的具体帧号。
看图路径: 1. 先看上方面板语谱图的横轴帧序号与纵轴频率,确认重复 pro 片段对应的能量分布;2. 再看转写文字 The appro pro pro proach is that you 在语谱图上方的位置与重复区间的对应;3. 对比下面板蓝色实线实例分数与红色虚线注意力权重的上升沿与下降沿是否都落在约 10 到 60 帧;4. 观察 60 帧之后两条曲线是否都回落到接近零,判断模型对流畅段的抑制是否干净
论文图 2。原论文 Figure 2:“Spectrogram and single-label frame-level model out- puts for a clip from the SEP-28k-E test set. Both models used the Whisper encoder”。
该例显示两种帧信号都能把重复区间与流畅尾段分开,且注意力权重上升沿略早于实例分数,提示注意力对边界更敏感。但这只是单样本,能否推广到长阻塞等多类情况需看定量表与局限节,不能把 1 例推广为全程有效。
编码器与池化的增益各来自哪里?跨数据集是否成立?
跨数据集单标签片段结果用于检验微调的作用。对照是冻结 WavLM 权重的 Shih 等人模型,本文解冻微调后 WavLM 与 Whisper 均提升,Whisper 加注意力达 0.90 的 F1。这支持论文的解释,即增益来自微调阶段减少了对人工合成预训练的依赖,而非仅来自池化。但需注意基线 F1 为 0.85 是直接引用原文数字,非本文复跑,引用条件需保留。
帧定量对比是本文最强的证据。问题是不同编码器与池化在金标准 8 段录音上的平均 F1、精确率、召回率,条件是把录音切为无重叠 3 秒片段再逐帧评估。下表保留原文三指标写法。
| 模型 | 评估条件 | F1 | 精确率 | 召回率 |
|---|---|---|---|---|
| YOLO-Stutter | CASA 金标准整段录音 | 0.47 | 0.47 | 0.49 |
| StutterCut | CASA 金标准整段录音 | 0.45 | 0.39 | 0.58 |
| WavLM 加最大池化 | CASA 金标准整段录音 | 0.46 | 0.53 | 0.41 |
| WavLM 加注意力池化 | CASA 金标准整段录音 | 0.56 | 0.53 | 0.59 |
| Whisper 加最大池化 | CASA 金标准整段录音 | 0.66 | 0.76 | 0.59 |
| Whisper 加注意力池化 | CASA 金标准整段录音 | 0.70 | 0.71 | 0.69 |
表后解释要区分可部署收益与条件差异。Whisper 加注意力以 0.70 的 F1 超过 2 帧基线,相对提升幅度大,且嵌入模型在两种编码器下均高于同编码器的实例模型,召回率提升对临床漏检更重要,支持注意力嵌入路径对帧任务有效。但基线假设输入必含口吃而本文评估含全流畅段,基线会有额外误报,比较并非严格同运行条件。未胜出项是 WavLM 加最大池化的 0.46 与基线相当,说明仅用多实例而不选对编码器与池化并不能保证帧增益。多标签帧切分未评估,这是明确的边界。
哪些现象不支持推广?还有什么没测?
论文经人工检查报告模型有时难以处理长时阻塞。解释是模型只能基于 3 秒上下文做预测,若阻塞跨多个窗口,单窗口内缺乏必要的声学证据。待验证的是更长上下文是否能改善,这只是推测而非已验证对照,复述时要用可能一词,不能写成必然改善。
未测量项需要明确。论文未报告训练时长、参数更新量、推理延迟、每秒输出帧率与误报在临床流程中的成本,也未做统计显著性检验。总体趋势不等于每段录音都成立,帧指标是 8 段平均,单段波动未知。相关性不等于因果,编码器差异带来的增益可能混杂预训练数据与结构,不能直接断言某结构必然更适合口吃。
另一限制是标签映射。CASA 核心标签与 SEP-28k 标签体系不同,帧评估只做了单标签聚合,多标签帧性能未知。若读者想直接用于多类严重度评估,还需补多标签帧验证。资源状态方面,本次未发现来源绑定且完成验证的开源代码与模型,不得声称代码或权重已公开。
要复现应先固定什么,再跑什么?
先固定数据与标签规则。用 SEP-28k-E 标准划分训练,至少 2 票为正,无口吃词取反。FluencyBank 片段用于跨数据集单标签,CASA 金标准 8 段录音用于帧评估,录音切为无重叠 3 秒片段,帧长 20 毫秒,帧标签由时间戳生成。划分与切分方式改变会直接改变帧平均结果,必须与原文一致。
再固定模型与训练顺序。编码器选 wav2vec2-large、wavlm-large 或 whisper-medium 之一,经 HConv、4 层 512 单元双向长短期记忆网络、256 与 128 投影器,再接实例或注意力分支。先冻结编码器以 5×10 的负 5 次方、批量 16、Adam 训练至开发集损失 3 轮不降,再解冻以 1×10 的负 5 次方微调至再次停滞,取开发集最优检查点。损失为标签平均的二元交叉熵,加类别正样本权重与基于标注一致性的样本权重并在批内归一化。
推理阈值统一 0.5。片段直接阈值化,帧任务实例路径阈值化逐帧概率,嵌入路径先看片段判定再对归一化前注意力权重过 Sigmoid 后阈值化。YOLO-Stutter 复现需 WhisperX 转写加作者推理代码,StutterCut 需自实现,引用基线分数时注明直接引用。建议先复现 Whisper 加注意力这一最强配置,再补 WavLM 与最大池化对照,以分离编码器与池化的贡献。
何时值得尝试这种方法?
当手头只有片段有无标签却需要输出时长时,值得尝试多实例结构。它允许用现有片段数据训练帧切分,省去重标时间戳的成本,且同一模型同时给出片段与帧结果,便于临床核查。若已有帧标注或合成预训练流程,本文方法可作为弱监督基线,而非替代。
选择分支时,若更看重片段精度且需要帧解释,优先试嵌入加注意力路径,论文显示它在帧召回上优于最大池化。若资源有限或需快速验证,先跑实例加最大池化作为可运行下限。编码器优先试 Whisper-medium 与 WavLM-large,wav2vec 2.0 在本文配置下较弱。
还需补的验证是长阻塞的长上下文试验、多标签帧评估、跨语种与跨采集设备的稳定性,以及延迟与误报成本。只有补齐这些,才能从切分分数走向可用的严重度评估工具。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

