英文题目:Contrastive Time-Proximity Pre-Training for Speech-Based Heart Failure Monitoring
会议身份:
conference:interspeech:2026:conference-paper-id:fiedler26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#语音生物标志物 #对比学习 #跨语言 #语音 #病理语音评估
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Tobias Fiedler:机构信息未能从会议 PDF 纯文本可靠映射
- Mariam Fouad:机构信息未能从会议 PDF 纯文本可靠映射
- Marcus Hott:机构信息未能从会议 PDF 纯文本可靠映射
- Leonhard Riehle:机构信息未能从会议 PDF 纯文本可靠映射
- Felix Hohendanner:机构信息未能从会议 PDF 纯文本可靠映射
- Bruce Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Cummins:机构信息未能从会议 PDF 纯文本可靠映射
- Bert Arnrich:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
心衰急性失代偿检测需从自然朗读语音中排出入院水肿态与出院缓解态的相对顺序,难点在于内容可变与录音条件及语言差异淹没细微病理信号。排序需跨患者消除绝对水平差异并聚焦个体内纵向趋势变化。方法链分三步衔接:梅尔频谱切分为短段并由共享双向长短期记忆网络编码帧级表示,注意力先在段内聚合帧再在段间聚合为整段向量,时间邻近对比目标拉近同患者短期录音并推远长期录音以注入纵向敏感性。相比沿用说话人验证不变性或手工声学特征,该机制显式利用心衰渐进性假设而非内容无关身份区分。与经典声学特征相比,对比时间邻近表示在 Mayo 跨中心跨语言测试上以 XGBoost 排序器取得 0.61 准确率而基线跌至 0.34,显示更稳的迁移趋势。结论仅适用于入院出院极端状态排序,未验证连续失代偿程度跟踪与大规模远程监测外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
心衰监测为什么需要看自然语音?
这篇解读的输入是 2026 年悉尼 Interspeech 收录的 1 篇心衰语音监测论文,目标是让刚进入语音或音频健康方向的研究生能复述方法与实验条件。需要保留的信息包括数据从哪里来、近端与远端如何定义、特征提取器如何从波形走到录音嵌入、评估如何按患者内排序组织,以及哪些结论只是探索性。输出按学习依赖展开,先讲任务与路线,再讲结构与训练,最后讲证据与限制。
心衰的特点是病程中会反复出现急性失代偿,也就是常说的由湿重到干的剧烈变化,需要住院处理。临床希望提前发现这种加重,但常用无创手段如体重监测灵敏度不足,约半数患者住院前并无明显增重,而有创血流动力学监测虽更有效却昂贵且需植入。于是寻找无创、低成本、可频繁采集的生物标志物成为动机。语音被提出的原因是液体潴留不仅影响外周与肺部,也可能影响声道与声带水合,进而改变发声阈值压与嗓音质量。
此前多数工作用的是持续元音,要求患者主动配合、固定录音条件与发声技巧,这在真实随访中难以持续。自然语音的吸引力在于可以在日常朗读中顺手采集,但内容、时长与录音条件变化大,手工特征很难直接对应心衰状态。论文因此选择表征学习路线:不先规定哪个声学量等于病情,而是让模型从纵向数据中自己学出对病情变化敏感的表示。这一定位决定了后文所有设计都要回答同一个问题,即没有可靠临床标签时,用什么可规模化获得的弱信号来驱动学习。
同样用声音看心衰,先前路线卡在哪里?
按同输入、同目标、同监督来对照,先前心衰语音工作多以持续元音为输入、以分类或回归心衰状态为目标、以人工设计的声学特征加小样本建模为监督方式。它们的优点是特征可解释且采集可控,缺点是依赖患者依从性,跨设备与跨语言时容易把录音条件学成捷径。另一些住院期间的语音研究开始用自然语音与声学分析,但仍停留在手工特征层面。
自监督学习在医学影像、多模态临床数据、步态与嗓音筛查中已有成功例子,说明在标签稀缺时先学通用表示再做下游任务是可行路线。与之最接近的是心脏信号上的跨空间、时间与患者的对比学习,但那类工作常让表示对个体不变,而心衰监测恰恰需要对个体内纵向变化敏感。论文的差异化正在于此:不追求抹掉时间,而是把时间间隔本身变成正负例的来源。理解这一点,才能明白为什么后文不用说话人验证的判别目标,也不能把说话人嵌入直接当病情分数用。
要解决的具体判断是什么?
论文把评估任务定义为极端状态排序。举例说明:假设某患者在住院期间留下两段入院录音与一段出院录音,模型需要对每 1 对入院与出院组合判断哪一段更湿,也就是失代偿更重。准确率按所有入院与出院配对计算,而不是按录音单点分类。这样做是为了解决患者间基线不可比的问题,不同患者水肿的绝对程度不同,直接比分数会混入个体差异,而只在患者内部比趋势更贴合监测液体变化的临床目标。
预训练任务则是另一回事:它不预测入院或出院,只判断两段录音在嵌入空间应该靠近还是远离。输入是同一患者的两段自然朗读,输出是两个 256 维向量的余弦相似度,目标是短间隔靠近、长间隔远离。下游排序时,这些嵌入被冻结或微调后交给排序器。两个阶段的标签完全不同,预训练用时间差,下游用入院与出院状态,复述时不能把时间接近程度说成病情标签。
从一段朗读到一个病情向量经历了什么?
先沿着一个样本走完全程。拿一条患者用手机录下的读诗音频来说,系统先重采样并转成梅尔谱,然后把谱按时间切成每段 160 帧的小块,每块约 800 毫秒。若录音长则段数多,若短则段数少,因此后续必须有能处理变长的汇聚机制。每段独立送入同一个 3 层双向长短期记忆网络,得到每帧的隐表示,再经一层线性投影加柔性最大值归一化学出帧权重,加权平均成段嵌入。最后所有段嵌入再经一段注意力聚合成一条录音的 256 维向量,整个特征提取器约 450 万可训练参数。
下图是该流程的结构总览,重点看主路径如何从波形经分段与共享网络走向单一向量。
看图路径: 1. 从顶部音频波形沿重采样箭头看到梅尔谱,再看切成多个 160 帧段的切分线;2. 对比左右两列共享参数的三层双向长短期记忆网络与帧注意力框;3. 找到底部段注意力把所有段嵌入汇成 1 乘 256 录音嵌入的汇聚箭头;4. 确认该图只画前向表示流程,不包含近远端对比损失
论文图 1。原论文 Figure 1:“Feature extraction architecture. Audio is converted to a mel-spectrogram and partitioned into N segments of M=160 frames.”。
从像素看,顶部是音频波形经重采样与转换指向梅尔谱的箭头,中部左右两列分别画出第一段与第 N 段的 160 帧结构,其下是浅蓝色 3 层双向长短期记忆网络框与浅紫色帧注意力框,框之间标注共享参数,底部粉色段注意力把所有段嵌入汇成录音嵌入。这张图只表达表示计算,不包含对比损失,损失的逻辑在训练节的另一张概念图中。3 种输入分辨率配置在此主干上变化,配置 A 为 16 千赫兹加 40 个梅尔滤波器组并沿用说话人验证检查点初始化,配置 B 为 44 千赫兹加 40 维,配置 C 为 44 千赫兹加 120 维,后两者随机初始化。
双层注意力各自在压缩什么?
帧注意力与段注意力不是重复设计。帧层面的操作对象是毫秒级声学帧,它要在一小段朗读内区分浊音、清音、停顿与呼吸噪声;段层面的操作对象是已压缩的段向量,它要在整条录音里挑选对病情更相关的时刻。白话说,前者做局部降噪与摘要,后者做全局挑选。若只有帧注意力,长录音仍难以定长表示;若只有段注意力而无帧压缩,段内噪声会直接污染段向量。
急性失代偿性心衰 × 时间邻近对比预训练: 急性失代偿性心衰指心衰患者因液体潴留加重而需要住院的极端状态变化,时间邻近对比预训练则是不用临床标签、只用同一患者两段录音时间间隔来构造监督信号的方法,二者搭配的理由是心衰被描述为渐进性过程,短间隔更可能健康状态相近、长间隔更可能不同,于是把生理上的渐变假设转写成拉近与拉远嵌入距离的训练目标,组合后新增的作用是让模型对纵向变化敏感,而不是只记住说话人身份。
该组合的实际效果在后文注意力分析中得到呼应:被放大的往往不是元音稳态段,而是语音间隙对应的呼吸段。这与人类标注者最常提到的呼吸线索一致,也与液体负荷影响呼吸功能的生理预期相符。但这只是相关性证据,不能反推注意力峰等于呼吸病理,更不能说模型已经理解呼吸机制。
说话人验证主干为什么不能直接用?
论文沿用的 d 向量模型原本为说话人验证设计,优化目标是让同一说话人靠近、不同说话人远离,同时对内容不变。这种表示天然会压制同一说话人内部随时间的变化,而心衰监测恰恰需要放大同一说话人内部的变化。原文用无对比预训练的现成检查点做了对照,其下游跨中心排序准确率仅在 0.38 到 0.42 之间,与随机无异,说明说话人先验本身不带来病情判别力。
帧注意力 × 段注意力: 帧注意力负责在 160 帧组成的一段内给每 1 帧学权重再加权平均,得到段嵌入,段注意力负责在整条录音的多个段嵌入之上再学权重并聚合成 256 维录音嵌入,二者搭配是因为自然语音长度不一且信息不均匀,需要先局部压缩再全局挑选,组合后模型可以跳过内容差异大的部分,把呼吸停顿这类短区域放大。
因此方法全景是主干提供语音建模起点,对比时间邻近目标负责把主干从身份判别扭转为变化敏感。训练时对长短期记忆层用较小学习率,对其余参数用较大学习率,正是为保留语音基础能力的同时调整注意力与汇聚行为。复述时要强调参数更新是全网参与但速率不同,而不是冻结主干只训排序头。
没有病情标签时如何造出正负例?
预训练数据是来自远程监测项目的弱标签数据,缺乏经验证的临床终点,因此不能用入院与出院做监督。论文利用心衰渐进性的假设:同一患者相隔很近的录音更可能健康状态相似,相隔很远的更可能不同。具体阈值是时间差至多 3 天为近端对,至少 100 天为远端对,阈值选择依据临床对进展速度的指导并兼顾正负例平衡,得到约 156 千近端对与约 134 千远端对。为降低急性加重违背渐变假设的风险,与已知心衰事件或显著体重变化同时的录音被从近端对中剔除。作者明确表示未做阈值敏感性分析,这是一个待补项。
下图把该假设画成一条随时间缓慢下降但有波动的健康曲线,近处点应靠近、远处点应远离。
看图路径: 1. 先看横轴从第 1 天到第 365 天的患者时间线与纵轴心衰健康状态曲线;2. 找到左侧三个靠拢的蓝色录音点与标注拉近嵌入距离的虚线箭头;3. 找到右侧相隔很远的两个蓝色录音点与标注拉远嵌入距离的长虚线;4. 确认图例说明蓝点只是录音时刻,不代表病情数值
论文图 2。原论文 Figure 2:“Contrastive time-proximity concept. For a given pa- tient, recording pairs ≤3 days apart are considered proximal (minimize embedding distance), while pairs ≥100 days apart are…”。
从像素看,横轴是第 1 天到第 365 天的患者时间线,纵轴是心衰健康状态,灰色曲线缓慢下行且有起伏,左侧 3 个蓝色圆点靠得很近并连出拉近嵌入距离的短虚线,右侧两个蓝色圆点相隔数月并连出拉远嵌入距离的长虚线。训练目标是余弦嵌入损失,近端最小化 1 减余弦相似度,远端在余弦相似度超过边际时惩罚,边际取库默认值 0 且未调优。批量为 32 对,最多训练 100 轮并以验证损失做 7 轮耐心早停,单配置在单卡上约需 5 天。
近端对 × 远端对: 近端对指同一患者时间差至多 3 天的录音对,远端对指同一患者时间差至少 100 天的录音对,前者分工是提供应被拉近的相似健康假设,后者分工是提供应被推开的不同健康假设,搭配理由是只用时间结构就能在无验证性临床终点的数据上造出大量弱标签,组合意义是把连续时间轴离散成对比学习的正负例,但急性加重会违背该假设,因此原文对已知心衰事件或显著体重变化附近的近端对做了过滤。
需要提醒初学者:时间接近只是相似健康的代理变量,不是金标准。若患者在 3 天内恰好经历快速加重,该正例就是噪声;若 100 天后病情稳定,负例也可能是噪声。过滤只能减少已知事件的干扰,不能保证假设处处成立。
数据、划分与基线如何保证可比?
实验分两批数据。预训练用 392 名德语患者的日常朗读,包括固定诗歌与趣味短文;评估用 VAMP-HF 试验中柏林 32 名德语患者与罗切斯特 36 名英语患者共 68 人的入院与出院录音。两批数据均声明不公开,前者因通用数据保护条例下的专有远程监测数据,后者含受保护健康信息,且作者认为尚无合适的公开数据集可替代。本次未能确认任何代码或数据链接可达,因此不能声称已公开。
比较问题是:在患者内排序指标下,学到的表示是否比手工特征与人类更能跨中心迁移?公平条件包括同一排序任务、同一配对计分方式、同一随机种子重复 50 次报告中位数与四分位距,以及 2 级评估。第一级在柏林做留一患者交叉验证,测对未见患者的泛化;第二级把第一级所有折模型的预测平均后直接测英语中心,测跨语言与跨中心泛化。排序头有两种可运行策略:把嵌入冻结后用梯度提升树排序器,以及微调特征提取器并联合训练神经排序头。指标方向是准确率越高越好,随机基线为 0.50。
排序准确率 × 留一患者交叉验证: 排序准确率指对同一患者全部入院录音与出院录音配对中正确排出谁更重的比例,留一患者交叉验证指在柏林中心每次留出一个患者做测试、其余患者训练,搭配原因是绝对分值受患者间基线差异影响,直接分类容易混淆个体差异与病情变化,组合后评估的是模型捕捉个体内趋势的能力,并与跨中心测试衔接。
下表先核对数据规模与任务差异,避免把预训练对数与评估患者数混为一谈。表前已说明比较问题与公平条件,表中单位保留原文写法,裸数不擅自添加百分号。
| 用途 | 患者数 | 录音与对数规模 | 语言与中心 | 任务与标注性质 |
|---|---|---|---|---|
| 临床评估 | 68 名患者,其中 32 German-speaking 与 36 English-speaking | 入院与出院多录音配对计分 | Charité Berlin 与 Mayo Clinic Rochester | admission 与 discharge 极端状态排序 |
表后解释:预训练的优势是规模大且纵向密集,足以支撑对比学习,但代价是标签弱且含假设噪声;评估的优势是端点清晰且跨语言跨中心,但代价是仅 68 人且每种方法可评估人数还因缺失略有差异,导致统计功效不足。人类基线仅在第一级获得,10 套标注来自 9 名标注者,含机器学习专家、声学专家、心衰护士与 1 名医生,其中医生最高约 0.66,护士仅 0.53 与 0.56,说明任务对人也不易,且不能把自动指标与人评混为同一列比较。
跨中心时谁还站得住?
先看预训练是否学会了时间结构。配置 A 的近远端平均相似度差为 0.986,高分辨率的 B 与 C 超过 1.2,说明训练后短间隔嵌入更相似、长间隔更不相似,目标在技术上是成立的。但预训练好不等于临床好,高分辨率配置下游反而更差,这构成后文重要的反证。
下图展示训练前后相似度分布的变化,重点是远端分布是否被真正推开。
看图路径: 1. 先看左右两块面板标题区分近端对与远端对,纵轴都是嵌入相似度;2. 对比每块面板内训练前与训练后两根小提琴分布的位置与宽度;3. 重点观察右侧远端对训练后分布明显下移且变宽,而左侧近端对仍集中在顶部;4. 不要把左侧训练后出现的细长尾直接读成整体变差,要结合均值差判断
论文图 3。原论文 Figure 3:“Distribution of embedding similarity of proximal pairs (left) and distal pairs (right) both before and after training of CTP-C.”。
从像素看,左面板近端对训练前后都集中在纵轴 1.00 附近,训练后顶部更尖但拖出一条细长尾;右面板远端对训练前集中在 1.00 附近,训练后明显下移并展宽,主峰落在负值区约负 0.6 附近,同时顶部仍残留小峰。解读时纵轴是嵌入相似度而非准确率,向下对远端是变好,对近端则不是。不能把左面板的细尾读成整体失败,也不能把右面板残留的高相似峰忽略,那正是假设噪声或内容相似的体现。
经典声学特征 × 对比时间邻近特征: 经典声学特征指语速、基频、强度、嗓音质量、频谱与共振峰等 29 个手工特征,对比时间邻近特征指经上述近远端目标预训练后的 256 维录音嵌入,前者分工是给出可解释且在单中心易拟合的基线,后者分工是学习对内容和录音条件更鲁棒的表征,搭配比较的理由是检验手工特征是否把中心特异的语言和设备线索当成了病情信号,组合意义在于揭示同中心最高不等于可迁移。
下表是核心结果,必须同时保留可运行的排序策略与随机基线,不能只放最优数。表前问题是同中心最高能否迁移,公平条件是同一配对准确率与 50 次种子中位数,指标方向为越高越好。
| 方法 | Level 1 准确率 | Level 2 准确率 | 排序器 | 对照与样本 |
|---|---|---|---|---|
| Random | 0.50 | 0.50 | – | 随机基线 |
| Human | 0.55 | – | – | 仅 Level 1 人评 |
| Classical | 0.62 | 0.34 | XGBoost | Level 2 n=29 patients,95% Wilson CI 0.20–0.53 |
| CTP-A | 0.58–0.61 | 0.59–0.61 | Neural 与 XGBoost | Level 2 n=31,0.61; 0.44–0.76 |
| CTP-B/C 与 d-vector | 0.47–0.59 | 0.35–0.53 | Neural 与 XGBoost | d-vector 无 CTP 仅 0.38–0.42 |
表后解释:主要收益是 CTP-A 在 2 级分别约 0.58 到 0.61 与 0.59 到 0.61,保持稳定,而经典特征从第一级 0.62 掉到第二级 0.34,未能迁移。具体代价有三。其一,经典特征在第二级低于 0.50 并非可反转的反向信号,原文指出约 9.2% 配对在树排序器下打平,其余符合小样本波动,应读成失效而非符号反转。其二,可评估人数少且随方法变化,经典与 CTP-A 的患者级二项区间重叠,因此差异不显著,所有比较只能算探索性。其三,未胜出项明确:预训练指标最好的 B 与 C 在第二级分别掉到 0.35 到 0.42 与 0.52 到 0.53,说明分辨率提升带来的相似度间隔没有转化为临床迁移。
分辨率与注意力告诉我们什么反例?
把分辨率当作一组已验证对照来看:A 用 16 千赫兹与 40 维并从说话人检查点出发,下游最好;B 与 C 用 44 千赫兹且随机初始化,预训练间隔更大但下游更差。这不支持更高输入分辨率必然更好的直觉。可能的原因包括初始化不同、数据量相对高维输入不足,或高频细节放大了设备与语言差异,但原文未做消融来分离这些因素,因此只能报告现象,不能断言病因。排序器的选择同样不是决定性因素,CTP-A 在树排序器与神经排序器下都稳定,而经典特征与 B、C 换排序器也未挽回跨中心失效。
注意力分析属于定性佐证而非因果证明。下图是跨种子 98% 排对的个例,导读后看峰与呼吸间隙的对齐。
看图路径: 1. 先区分上下两大部分分别对应入院与出院,顶部紫色阶梯线是合并时间注意力;2. 沿红色框找到注意力峰与下方梅尔谱中能量间隙的对齐关系;3. 对比入院约 27 点 3 秒与出院约 23 点 2 秒两条时间轴,确认不是同一长度直接叠加;4. 注意中间红色标注明确写出注意力峰在呼吸周围,这是作者的人工听辨结论
论文图 4。原论文 Figure 4:“Temporal attention of CTP-A model for patient 0036 (98% accuracy across seeds).”。
从像素看,上半为入院约 27.3 秒,下半为出院约 23.2 秒,每半都由顶部紫色合并时间注意力阶梯线与下方梅尔谱组成,红色框标出注意力峰,中间红字明确写出峰在呼吸周围。谱上峰处多对应低能量间隙,听辨确认为呼吸段,且人类标注中引用呼吸的 25 次判断有 19 次正确。这支持模型关注了与液体负荷相关的呼吸模式,但样本是挑选出的高正确率患者,不能推广到全体,也不能排除模型同时利用了其他未可视化线索。
哪些边界尚未被验证?
首先是统计边界。评估仅 68 人,且按方法可评估数在 29 与 31 之间浮动,患者级区间严重重叠,任何跨方法胜负都应表述为提示而非证实。原文明确要求探索性解读,并用注意力定性分析做旁证,这种谨慎应被保留。其次是标签边界。评估只用入院湿与出院干两个极端,没有连续失代偿度量,无法回答提前几天预警或轻微加重能否检出。人类排序也仅在第一级获得,跨中心的人机比较缺失。
第三是假设与泛化边界。近远端阈值未经敏感性分析,3 天与 100 天的划分可能不是最优;过滤只针对已知事件与显著体重变化,未知快速变化仍会污染正例。跨中心差异同时混入语言、设备、人口与护理流程,经典特征失效不能唯一归因于语言。此外,训练与下游成本不对称,预训练每配置约 5 天单卡,下游每种子约 1 分钟,复现时预算应留给预训练而非排序器调参。
最后是可用性边界。数据与代码均不公开,外部只能复现思路而无法直接复跑权重,任何关于部署延迟、误报率或成本改善的承诺都超出证据。
要复现应先固定哪些细节?
复现的第一步是重建数据管线,而非调模型。需要按患者组织纵向录音,记录每条录音的患者编号与天数,构造同患者内时间差至多 3 天与至少 100 天的配对,并复刻对已知事件附近近端对的剔除逻辑。若没有体重与事件记录,应明确记为缺项,而不是用模型名称推定过滤已生效。第二步固定特征计算:重采样率、梅尔维数、160 帧分段与变长汇聚必须与所选配置一致,A、B、C 三档不能混用,A 的说话人检查点初始化与 B、C 的随机初始化差异也要保留,否则无法比较分辨率效应。
第三步固定优化细节:余弦嵌入损失边际取 0,批量 32 对,长短期记忆层学习率 10 的负 5 次方、其余参数 2 乘 10 的负 4 次方,最多 100 轮并以验证损失 7 轮耐心早停。下游必须实现患者内全配对排序准确率,留一患者交叉验证只在第一中心做,第二中心用第一级所有折平均预测直接测试,重复 50 个随机种子报告中位数与四分位距。缺失录音导致的可评估人数变化要如实报告分母,不能为凑齐样本而编造划分。若资源有限,可先在小规模上验证远端分布是否下移,再投入完整预训练。
何时值得尝试这种时间代理监督?
当研究同时满足 3 个条件时值得尝试:拥有同一患者密集纵向语音但缺乏可靠临床标签,目标是捕捉个体内渐变而非区分个体身份,且能接受小样本临床验证只做探索性结论。此时用时间间隔构造对比目标,比直接复用说话人嵌入更合理,也比纯手工特征更能抵抗内容与设备变化。论文的证据支持这一判断:CTP-A 跨中心保持在 0.59 到 0.61,而经典特征掉到 0.34,现成说话人模型停留在随机附近。
不值得盲目推广的情形同样明确:若疾病并非渐进、短期内波动剧烈,或无法过滤已知急性事件,近端相似假设会引入系统噪声;若追求更高分辨率与更大预训练间隔,需先证明其能转化为下游迁移,否则可能只是把设备指纹学得更精细。还需补的验证包括阈值敏感性、连续失代偿度量、更大远程队列与跨设备测试。回到中心矛盾,时间接近是廉价但有噪的监督,它能让模型学会关注呼吸相关的纵向变化,却不能替代临床终点,复述时应把稳定跨中心表现说成待验证的泛化提示,而不是已确立的监测能力。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



