英文题目:Speech Quality Embeddings for Improved Detection and Classification of Degradations in Speech Signals
会议身份:
conference:odyssey:2026:conference-paper-id:kuhlmann26_odyssey
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据增强 #对比学习 #语音 #音频事件检测 #语音质量评估
评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Michael Kuhlmann:机构信息未能从会议 PDF 纯文本可靠映射
- Tobias Cord-Landwehr:机构信息未能从会议 PDF 纯文本可靠映射
- Reinhold Haeb-Umbach:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动主观语音质量评估以整句语音为输入、输出 utterance 级平均意见分,难以定位现代高质量语音中时域受限的局部短时退化,且缺乏帧级标注导致弱监督学习困难。方法先利用干净与退化平行语料,以预训练局部评估模型生成帧级伪分,再经部分混合在波形域拼接局部退化片段并按同一掩码加权伪分,形成帧级强伪目标以训练帧级MOS分支。为解耦评分与表征学习,模型在共享编码器后增加退化类型嵌入分支,对每帧退化组合类别施加帧级有监督对比损失,使同类退化帧在单位超球面隐空间聚拢。检测时以干净验证集嵌入均值作为注册向量,与输入帧嵌入做余弦相似度判决,从而替代MOS阈值路径并保留更大判决裕量。与弱标签基线相比,该嵌入路径对退化起始更敏感,并能同时支持退化类型验证与检索。在LibriAugmented测试集下,模型CON1的EER错误率为4.88%,高于NISQA域内条件下模型CON1的EER错误率3.87%。多退化并发与域外未见退化时类别可分性与聚类纯度明显下降,结论适用边界受限于合成局部退化与已知退化组合,跨真实退化与大规模并发场景尚未验证。原文未披露训练、推理或部署成本
🔗 开源与复现资源
- 代码相关资源:https://github.com/fgnt/local_sqa — 链接可访问(HTTP 200)
- 代码相关资源:https://github.com/fgnt/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/iver56/audiomentations/ — 链接可访问(HTTP 200)
- 第三方资源:https://openreview.net/forum?id=7fQohcFrxG → https://openreview.net/challenge?redirect=%2Fforum%3Fid%3D7fQohcFrxG — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么整句打分不够用了?
输入是这篇会议论文的正文与官方原图像素,目标是让刚进入语音音频方向的研究生能核对并复述方法。必须保留的信息包括任务定义、部分混合构造、双解码器结构、两类检测方式、训练与评估划分、阈值无关指标及其方向、关键数字与适用条件。输出是 1 篇按学习依赖展开的中文技术解读。 论文实际研究的任务是非侵入式语音质量评估的延伸。白话说,非侵入式就是打分时看不到干净参考,只能听退化语音本身猜人会打几分。
英文叫自动主观语音质量评估,缩写是 SSQA,监督常用平均意见分,英文是平均意见分,缩写是 MOS。传统做法给整条语音一个总分,这在老系统整体质量都较差时够用。 现代合成或增强语音整体很好,损伤可能只占几百毫秒。例如一句话中间突然出现失真或噪声,总分仍然偏高,用户却能听出局部问题。于是需要局部主观语音质量评估,英文是局部主观语音质量评估,缩写是 LSSQA,把估计下沉到帧级。
帧在这里指编码器输出的时间步,论文编码器帧率是 50 赫兹。 进一步,定位还不够,还想知道损伤类型,以便做系统分析和按类型检索。论文要同时回答哪里坏了和坏的是哪一类。
主观语音质量评估 × 局部主观语音质量评估: 主观语音质量评估负责给整条语音一个反映人听感的总分,常用平均意见分做监督,局部主观语音质量评估则要求把判断下沉到每 1 帧。两者搭配的原因是现代语音整体分可能很高但局部藏着损伤,只看总分会漏检,组合意义是用同一编码器同时保留整句可比性和逐帧可定位性,后文的阈值检测与距离检测分别在这两种粒度上计算。
难点在于训练规模的数据只有整句分,没有帧级真值。论文把这种情形类比为弱标签声音事件检测:只知道整段有没有,但要学会每帧有没有。另一条相关路线是帧级音语言模型,用强伪目标加对比损失把帧嵌入与描述对齐。论文借用其思想,但不对齐文本,而是对齐已知的损伤类型。 已有观察是深度语音质量模型整句嵌入会按损伤聚类,但那是损伤主导整句时的现象,局部损伤下是否成立不清楚。
另一工作用三元组学感知嵌入,但正样本按相似度构造,更反映强度而非类型。论文的切入点因此是先造出带局部损伤的训练数据,再让嵌入按类型聚类。
同输入同目标的工作此前是怎么做的?
按同输入、同目标、同监督来对照更公平。输入都是待评语音,目标都是质量或损伤判断,监督都是整句分或信号型客观分。早期工作加帧级正则让帧分看起来合理,但骨干较弱。近期工作把帧级正则用到自监督骨干上,通过池化在后策略和一致性损失减少远距离上下文对当前帧的影响。检测时对预测的帧级 MOS 调阈值,这就是基于 MOS 的退化检测。
与本文最接近的一路发现深度语音质量模型隐空间按损伤聚类,并用近邻分类识别已知损伤,还用客观分标签的增强数据改进结果。但其结论基于整句平均嵌入且损伤主导整句,未验证局部损伤。另一路用非匹配参考的思路做距离比较,与本文基于嵌入的检测相似,但其训练目标是强度而非类型区分。 声音事件检测中的弱标签训练、交集检测评估也被本文直接借用。
交集检测要求预测段与真值段互相重叠足够大才算对,比逐帧计数更能反映能否形成连通区域。本文的差异在于同时做三件事:用平行干净退化语料做部分混合造帧监督,用已知损伤类做帧级监督对比,用干净注册嵌入做阈值无关的嵌入检测。理解这三件的分工,就能理解后文分数路线与嵌入路线为何出现大差距。
要解决的具体问题与输出是什么?
举一个教学例子帮助理解,不代表论文数据。假设一条 8 秒语音,前 6 秒干净,后 2 秒混入短噪声。整句 MOS 可能仍有 4 分以上,但用户关心的是后 2 秒在哪里以及是什么损伤。论文把这个问题拆成 3 个可测任务。第一是局部退化检测,给每帧二分类,输出是每帧是否退化。
第二是类型验证与检索,给定两段嵌入判断是否同类,或给定每类原型把测试嵌入指派到最近原型,输出是等错率与准确率。第三是联合检测与聚类,先用检测得到退化帧,再对这些帧做已知类数的凝聚聚类,输出是调整兰德指数与干净类准确率。 论文明确指出,训练时只有整句 MOS 和混合时使用的损伤类标注,没有人工逐帧质量分。测试时域内用仿真子集做部分混合,域外用自制增强版本做部分混合。
评估强调阈值无关,帧等错率和最小检测代价越低越好,交集检测曲线下面积越高越好。最小检测代价中假设先验退化概率为 0.01,交集检测容忍参数取 0.7。这些条件决定了后文数字只能在相同混合长度、相同注册集和相同参数下比较。
方法全景:一个样本走完全流程
先沿一个样本走完输入到输出。输入是一条待评波形,它先进入编码器,得到帧级表示序列,共多帧。该序列同时送入两个解码头。上路是 MOS 头,先经卷积得到瓶颈嵌入,再经投影得到每帧分数序列,再做帧平均得到整句估计。下路是对比头,同样经卷积得到瓶颈嵌入,再经线性投影并归一化到单位超球面,得到可对比的嵌入。
训练时上路用整句分加帧伪标签监督,下路用帧级损伤类做监督对比。推理时有两条检测路线。分数路线看帧分是否低于阈值。嵌入路线先在验证集干净语音上算平均注册嵌入,再算每帧嵌入与注册嵌入的相似度或距离,超过阈值判为退化。类型分析则看退化帧嵌入是否按类聚拢。
下面先看整体框图导读,再看细节。 导读本图要解决的是双头从哪里分叉、各输出通向何处。看图时先找最左侧输入与最右侧两个输出,再确认中间虚线框住的才是分数头,上下两路共享的起点是编码器输出。
看图路径: 1. 沿左侧输入到编码器再到上下两路箭头确认分叉位置;2. 对比上路经瓶颈与投影到帧分再到平均池化的打分链;3. 对比下路经瓶颈与投影到归一化嵌入的聚类链
论文图 1。原论文 Figure 1:“Block schema of the full proposed model.”。
图中可见输入波形经编码器得到帧表示后分成上下两路。上路虚线框内是分数解码器,依次经过瓶颈嵌入与投影得到帧分,再经平均池化得到整句估计。下路是对比解码器,经瓶颈嵌入与投影得到投影嵌入。两路共享编码器输出但投影与目标分离,这种分离正是论文要把数值估计与表示学习解耦的安排。编码器用预训练大模型并随解码器微调,解码器是 3 层卷积加投影,对比分支投影到 128 维。
部分混合如何造出帧监督?对比分支如何按类型拉近?
部分混合是训练数据的构造动作。论文要求有平行语料,干净参考集与退化集在内容上可配对。先用已有的局部质量模型对两边分别跑出帧分,得到参考帧分与退化帧分。训练时以一定概率抽取二值掩码,掩码在样本级与帧级对应同一时间点。构造的新波形等于掩码乘退化波形加反掩码乘干净波形。
构造的新伪标签等于掩码乘退化帧分加反掩码乘参考帧分。 关键假设是取自退化集的整句损伤在全句持续且强度相近,这样掩码切出的局部段才确实带有可感知的退化。为保证这一点,论文在加对比损失的训练中只从语音区采样,只选参考整句分较高且退化整句分较低的配对,且只选参考帧分减退化帧分大于阈值的区域。掩码段数与时长在训练与测试中有意错开,训练每条采较短的多段,测试用更长的段,以检验对更长损伤的泛化。
部分混合 × 帧级伪标签: 部分混合负责用二值掩码把干净参考与退化语音在时域上拼成一条新训练语音,帧级伪标签负责给拼后每帧一个可训练的质量目标。两者搭配的原因是大规模数据只有整句分而无帧级真值,必须先造出已知哪里干净哪里退化的数据,组合意义是掩码同时决定音频拼接位置与伪标签加权位置,使帧监督与输入的局部损伤严格对齐。
对比分支是表示学习的动作。每帧在混合后都有类标,类别空间是训练损伤类加一个干净类。训练切分有大量组合类,背后是十余种单损伤的不同组合,组合不同即算不同类。监督对比损失对小批量内每帧计算 1 次,把同类帧当正样本、其余帧当负样本,做多热目标下的交叉熵。温度系数取 0.1。
为避免相邻帧因强相关形成自对比,论文排除时间距离小于阈值的帧对,该阈值等于感受野的一半。总损失是帧监督损失加温度缩放的对比损失。干净帧有两种处理:作为独立正类参与,或不参与分子只留在分母。前者记为保留干净类的策略,后者记为排除干净类的策略。论文发现两者在检测与聚类上各有代价,这是后文消融的重点。
质量分数解码器 × 对比嵌入解码器: 质量分数解码器负责从编码器输出估计每帧平均意见分并经平均池化得到整句分,对比嵌入解码器负责从同一编码器输出另一路瓶颈嵌入并经投影做类型区分。两者搭配的原因是要把数值高低的估计与类型相似性的表示解耦,避免对比损失直接扭曲分数头,组合意义是一个样本同时走完打分路径与聚类路径,前者用于阈值检测,后者用于距离检测与检索。
训练配置与可复现的构造细节是什么?
训练数据用 NISQA 与 BVCC,混合主要在 NISQA 上做。NISQA 训练与验证仿真子集提供元数据以构造类标,多重同时损伤的组合被当作独立类。模型配置上编码器输出上 1000 维,随解码器一起微调。MOS 解码器是 3 层卷积,隐层数 100 维,核尺寸分别为 11、7、5,激活用泄漏整流加批归一化,再线性投影到标量,总感受野数百毫秒。对比解码器结构相同但投影到 128 维并归一化。
训练 100 轮,批量 64,初始学习率从较小值线性衰减到更小值。论文给出 5 种模型代号。基线不用混合,只用原局部损失。两个监督模型只加帧伪标签监督,混合概率分别为 0.5 与 1.0。两个对比模型在混合概率 1.0 基础上再加对比总损失,区别是前者把干净帧作为正类,后者排除。
数据准备已开源,本次收到的资源 1 显示可用且状态 200,对应本地质量评估代码库,可写当前可用。 资源 2 是同一组织主页,资源 3 是第三方数据增强库,资源 4 是帧级音语言模型论文页,均显示可用。论文未报告训练硬件与耗时,这一项缺失,后文不把总体趋势说成每步都省时。梯度路径上论文未逐层说明冻结细节,只明确编码器参与微调,解码器参与训练,推断时注册嵌入来自验证集干净语音的帧平均再平均。
在什么数据与指标下比较才公平?
评估用两套合成的部分混合数据,各有验证与测试切分。域内是 NISQA 验证与测试仿真集做部分混合,测试由两个子集组合合并,含 9 种单损伤共 36 个组合类,损伤段比训练更长。域外是自制增强版本,用室外噪声并把增益渐变换成整句恒定增益,每条语音恰好损伤 2 次,1 次单损伤从 9 种选,1 次双损伤从 6 种组合选,共 15 类。 域外注册集用干净开发集语音,域内注册集用验证集干净参考。比较的公平条件是同一测试混合、同一注册集、同一阈值无关指标。
局部检测报告帧等错率、最小检测代价和交集检测曲线下面积。等错率与代价越低越好,交集面积越高越好。类型分析先用真值做预言检测以隔离聚类能力,报告验证等错率与原型检索准确率。 联合任务再换成实际检测输出做凝聚聚类,假设类数已知,报告调整兰德指数、去掉干净类的指数以及干净类准确率。论文还把连续检出帧取平均以减少相邻帧相关带来的重复计数。
理解这些划分才能解释为什么同一模型在域内与域外、预言检测与实际检测下排名会变化。
检测主结果:分数路线与嵌入路线差在哪里?
比较问题是加帧伪标签与加对比损失后,分数检测与嵌入检测谁真正可用,公平条件是同一域内测试混合与同一干净注册,指标方向是等错率与代价越低越好、交集面积越高越好。先看单样本示意导读,目的是建立对两条曲线的直觉,再看数字表。导读时注意上面板纵轴是 MOS,虚线是分数阈值,绿区是真值,下面板纵轴是距离,虚线是距离阈值,红短线是检出。
看图路径: 1. 对照上下两面板同一时间轴上的绿色真值区;2. 观察上面板蓝色分数曲线在损伤段的跌落与回弹;3. 观察下面板蓝色距离曲线在干净段贴零在损伤段抬升的裕量
论文图 2。原论文 Figure 2:“CON1 MOS-based (upper) and embedding- based (lower) detection results for a single utterance from NISQA TEST SIM-partial-mixup.”。
图中上面板蓝色分数曲线在干净段维持高位,进入绿区后剧烈下探但中间出现回弹,导致第二个长绿区内多次穿越阈值,形成碎片化检出。下面板蓝色距离曲线在干净段贴近零,进入绿区后迅速抬升并保持高位平台,与阈值的裕量更大,对起止更敏感。论文据此报告嵌入检测应优先选用。下表整理域内分数与嵌入检测随混合与对比的变化。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 域内部分混合分数检测 | 交集面积 | Baseline I-AUC: 0.01 | SUP2 I-AUC: 0.52 | SUP1 I-AUC: 0.25 |
| 域内嵌入检测等错率 | 等错率 | SUP2: 11.1% | CON1: 3.87% | 嵌入交集 SUP2: 0.58 与 CON1: 0.91 |
| 域内嵌入检测代价 | 最小代价 | CON2 minDCF: 0.84 | CON1 minDCF: 0.60 | 干净类保留优于排除 |
表后解释是加帧伪标签显著改善分数检测,更高混合比例更好,但分数路线上限仍低。加对比损失带来等错率大幅下降与交集面积大幅上升,瓶颈嵌入表现最稳。把干净帧作为独立正类明显优于排除,代价是类型纯度在后文会反转。
论文还报告域外趋势相同,分数路线略好而等错率略差,但未测量延迟与计算开销,不能承诺部署成本也改善。
基于平均意见分的检测 × 基于嵌入的检测: 基于平均意见分的检测负责比较每帧预测分与分数阈值,低于阈值判为退化,基于嵌入的检测负责比较每帧嵌入与干净注册嵌入的余弦相似度,距离大判为退化。两者搭配比较的原因是分数阈值对局部损伤不敏感而嵌入距离对分布偏移更敏感,组合意义是论文用同一模型同时报告两条路线,用阈值无关指标说明何时应放弃分数路线改用嵌入路线。
为确认嵌入是否真正按类型聚拢,论文进一步做验证与检索。下表直接引用原表矩阵,覆盖基线与两种对比策略在 36 类全量下的表现,数据配置表不能替代这种结果表。
| Model | ID EER | [%] | Accuracy | [%] |
|---|---|---|---|---|
| Baseline [3] | 42.11 | 43.86 | 2.12 | 0.62 |
| SUP2 | 36.29 | 44.64 | 7.14 | 2.12 |
| CON1 | 15.17 | 14.15 | 30.30 | 27.41 |
| CON2 | 13.56 | 14.25 | 26.79 | 25.76 |
该原表显示仅加帧伪标签几乎不改善区分,而加对比总损失后等错率大幅下降、准确率大幅上升。未胜出项是监督模型在检索准确率上长期处于个位数,说明分数监督不带来类型结构。代价是全量 36 类下准确率仍只有 30% 左右,反例是多损伤组合共享子损伤导致类间混淆,这一点在下一节用并发数趋势进一步展开。
类型区分与干净帧取舍:何时纯度会崩?
比较问题是嵌入是否按损伤类型聚拢,以及干净帧取舍如何影响纯度,公平条件是用预言检测隔离聚类能力,再用实际检测检验联合性能。先看随并发数变化的趋势导读,目的是理解类别组合爆炸如何制造混淆。导读时注意左轴是对数等错率,右轴是线性准确率,实线是等错率,虚线是准确率,两种颜色分别对应两种干净帧处理策略。
看图路径: 1. 先看横轴并发数增加时实线等错率的上行趋势;2. 再看虚线准确率随类别数增加的下行趋势;3. 对比蓝色与橙色曲线在最左侧单损伤点处的起点差异
论文图 3。原论文 Figure 3:“EER and accuracy when constraining the number of concurrent degradations in NISQA TEST SIM-partial-mixup.”。
图中可见横轴从单损伤到多损伤,等错率实线整体上行,准确率虚线整体下行。单损伤点处排除干净类的曲线等错率最低而准确率最高,说明排除干净类在少类时利于类型纯度。随着并发数到两重与三重,共享相同子损伤的不同组合类增多,曲线交叉,优势缩小。下表是域内 36 类全量下的验证与检索,含必要基线与可运行策略。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 域内类型验证 | 等错率 | Baseline EER: 42.1% | CON2: 13.5% | SUP2 EER: 36.3% |
| 域内类型检索 | 准确率 | SUP2: 7.14% | CON1: 30.3% | 仅帧监督不带来结构 |
表后解释是仅加帧伪标签几乎不改善区分,而加对比总损失后显著改善,支持对比损失是类型可分性的来源。代价是全量下准确率仍有限,反例是组合类共享子损伤。下表看单损伤与域外未见损伤的对照。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 单损伤 9 类验证 | 等错率 | CON1 EER: 7.71% | CON2 EER: 0.93% | 少类下排除更纯 |
| 域外未见损伤验证 | 等错率 | around 19% | 未见损伤更难分离 | 准确率与域内相近但等错率高 |
表后解释是约束到单损伤时可准确区分,但放开到多类后纯度下降。域外未见损伤的验证等错率在 19% 左右,支持未见损伤更难互相分离。联合聚类进一步显示排除干净类的模型在预言分割下更好,但换成实际检测后干净嵌入不稳定,而保留干净类的模型干净类准确率保持高位。
结论是若下游需要稳定检出干净段,训练必须包含干净类。
监督对比损失 × 干净帧处理: 监督对比损失负责把同损伤类型帧在投影空间拉近、不同类型推远,干净帧处理负责决定干净帧是作为独立正类参与拉近还是只出现在分母中。两者搭配的原因是混合数据中干净帧远多于退化帧,其参与方式直接改变正负样本比例,组合意义是形成保留干净类与排除干净类两种可运行策略,前者利于检测稳定,后者利于少类下类型纯度。
哪些结论还不能推广?
论文直接报告的是在合成部分混合上的阈值无关检测与聚类提升,有限解释是嵌入按类型聚类的程度,待验证的是真实部署中的鲁棒性。缺失证据不是技术错误,但必须点明边界。第一,多重并发损伤下纯度下降,共享子损伤的组合类互相混淆,论文把每种组合当独立类,这种标注在真实数据中会爆炸,需要更细的相似性分析来设计训练与测试。
第二,域外未见损伤的验证等错率在 19% 左右,检索虽可用但分离不彻底,对未见损伤的嵌入行为不一致,论文留作未来工作。第三,联合任务假设已知类数做凝聚聚类,真实应用类数未知,且论文为控制簇数省略了超过两重同时激活的区域,这会高估可操作性。 第四,最小检测代价先验取 0.01,交集参数取 0.7,换参数后排名可能变化,论文未做敏感性分析。
第五,未测量误判率之外的延迟、算力与帧率,编码器是大型自监督模型,总体趋势不等于每步都快,不能从检测提升推定系统更便宜。相关性不等于因果,嵌入距离大与损伤存在相关,但不能说距离就是质量的因果解释。
复现先做什么?需要哪些信息条件?
复现的第一步是拿到可运行的数据构造而非先调模型。按论文做法,先准备 NISQA 训练与验证仿真子集的元数据,把多重损伤组合映射为独立类,记录训练与验证的映射表以便对齐。接着用已有局部质量模型跑出平行干净与退化帧分,用语音活动检测只保留语音区,再按参考整句分较高、退化整句分较低、帧分差大于阈值过滤混合区。 混合时训练采多段短时损伤,测试用更长的段。
模型侧用大自监督模型做编码器并微调,MOS 与对比解码器用相同 3 层卷积,核为 11、7、5,隐层数 100 维,对比投影上 100 维,温度 0.1,邻帧排除阈值为感受野一半,训练上 100 轮、批量数十、学习率从较小值线性衰减。评估时域内注册用验证集干净参考,域外自制增强集并用开发集干净语音注册,每条测两处损伤。 代码方面本次收到资源 1 可用且状态 200,可写当前可用,对应本地质量评估仓库。第三方增强库与帧级音语言模型页也显示可用,但权重下载与完整可运行需以仓库实际说明为准。
还需补的验证是真实录音而非合成混合上的表现,以及不同先验与交集参数下的稳定性。
何时值得尝试这种路线?
当你的语音整体分很高但怀疑藏着局部损伤,且手头有平行干净退化数据与损伤类标注时,这条路线值得尝试。做法是先用部分混合造出已知位置的局部损伤并生成帧伪标签,把检测从整句阈值推进到帧级。再加帧级监督对比让同类损伤嵌入靠近,用干净注册嵌入做距离检测。 若下游只需稳定检出哪里坏了,选把干净帧当独立正类的训练。若下游更看重少类下分清是哪一类,可对比排除干净类的策略,但要接受实际检测下干净簇不稳的代价。
对初学者,复述时抓住一条主线:掩码同时决定音频拼接与伪标签加权,双头共享编码器但目标分离,检测从比分数改为比距离。 常见误解是把交集面积当成逐帧准确率,前者要求段级重叠,后者只计帧对错。把等错率下降直接当成部署误报下降,前者是阈值无关的平衡点,实际阈值仍需在验证集上调。把组合类准确率低当成模型失败,实际是标注把共享子损伤的组合硬拆成多类,混淆有结构性原因。
下一步值得补的是按损伤相似性设计训练采样、在未知类数下做聚类,并报告编码器带来的推理开销与实际延迟。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
另有 38 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses





