英文题目:Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

会议身份:conference:interspeech:2026:conference-paper-id:jiang26c_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#医疗音频 #评测协议 #鲁棒性 #语音识别

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Xiao-Hang Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Hanjie Guo:机构信息未能从会议 PDF 纯文本可靠映射
  • Ying-Si Liang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yang Ai:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
  • Lei Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhi-Yang He:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

环境临床记录需将医患对话音频转写为结构化病历并输出分诊决策,难点在于自动语音识别前端的微小误听会被大语言模型放大为高风险临床错误,而词错率对此完全失察。该方法先将同一段客观结构化临床考试对话与平稳环境噪声及非平稳语义干扰按信噪比混合,构造配对清洁与加噪音频以控制病例混杂。再用冻结的自动语音识别与大语言模型流水线生成转写与限定模式的结构化JSON,使语义漂移可归因于声学扰动。最后以医师审核的原子事实金标准,从分诊一致性与安全错误两路度量临床不变性与幻觉风险。与只看转写保真度的传统评估不同,该框架建立原因侧触发特征到结果侧安全终点的分类学,直接度量临床不变性而非词面重合。在272段OSCE对话的配对评测条件下,加噪条件的非安全错误率为27.21%,从清洁基线条件的非安全错误率13.60%升至加噪条件的非安全错误率27.21%。结论限于模拟OSCE英语对话与单条WHISPER-LARGE-V3到QWEN3流水线,未验证真实病房混响、远场拾音与多模型泛化。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

这篇解读的输入是同一批医患对话录音在干净与加噪两种条件下走完同一套临床笔录流水线的全过程记录,目标是让刚进入语音与医疗文本交叉方向的研究生能复述研究者如何把噪声这个变量单独拎出来,并理解为什么转写错得不多不等于临床安全。

必须保留的信息包括数据来源与规模、噪声家族与信噪比、转写与整理模型的具体配置与冻结方式、原因侧与结果侧的全部指标定义与方向、主结果中干净基线与各噪声条件的配对数字,以及缓解方法在重噪声下的实际可运行效果与代价。输出是一套可核对的方法复述:从一段样本如何被混入噪声,到转写如何被打分,再到结构化结论如何与医生审核的金标准对比,最后说明何时值得尝试证据约束,何时还需要补验证。

本文不继承其他解读的评价,只依据论文原文证据与本次收到的官方原图像素写作。关于资源可得性,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能按原文报告的模型名称与数据集名称复述实验条件。

论文研究的任务是环境临床笔录,也就是在诊室里不打扰地录下医生与患者的对话,先由语音识别转成文字,再由大语言模型整理成结构化病历、分诊等级与安全标记。初学者容易把这个任务理解成听写加总结,但临床场景多了一层要求:整理结果必须在关键事实上与真实病情一致,一个否定词、一个剂量数字、一个时间单位的差错都可能改变处置。传统做法用词错误率衡量转写好坏,它把所有词同等看待,删掉一个语气词和翻转一个否定词扣分相似。

论文要回答的问题是:如果完全相同的对话只是听到的背景声不同,临床结论还能存活吗,以及是哪种声学畸变驱动了下游的安全降级。

已有路线在测什么,为什么还缺配对归因?

与本工作同输入的路线是临床语音转写鲁棒性评估,同目标的路线是医疗对话摘要与病历生成,同监督的路线是用医生审核或参考病历做语义评价,同运行阶段的路线是在真实诊室噪声下测试级联系统。以往转写侧多报告词错误率,整理侧多报告文本重叠度,这两类指标都对临床语义不敏感。已有文献指出词错误率无法感知临床语义,单个词扰动可能是灾难性的,而填充词丢失则是良性的;也有工作指出级联结构存在误差传播,前端小错会被后端放大成诊断或分诊错误,且机器错误格式良好、速度快、规模大,容易绕过常规核查。

这些路线留下的缺口是缺少受控的配对归因。非结构化的野外录音往往没有确定的金标准,病例组合与生成随机性也会混入结果,让人分不清安全下降到底来自病例更难、采样运气差,还是真的来自噪声。论文的对照思路是同一病例自身对照:病例历史与病情混合被固定,下游模型的系统指令、输出模式约束与解码配置也被固定,只有输入音频的噪声条件在变。这样观察到的结构化输出语义漂移才能归因到噪声诱发的转写扰动。教学上可以把这理解为行为测试的例子:不是只看平均分涨跌,而是构造同一病例的反事实输入,看结论是否保持不变。

问题如何形式化,什么算安全失败?

论文把流水线形式化为音频先经语音识别得到转写文本,再由参数固定的大语言模型在系统指令、输出模式约束与解码配置下映射为结构化临床对象。结构化对象至少包含有序分诊标签和一组原子临床断言与安全标记。每个底层对话会产生一个干净基线音频和多个扰动对应音频,配对比较的是同一对话在不同噪声下的输出差异。

安全失败不是指措辞不像参考文本,而是指可行动语义出错。论文区分两类后果:误报类是噪声引入了金标准没有的关键误报,例如把否认的皮疹记成存在,把没有的用药记成服用,这会推高过度分诊风险;漏报类是金标准有的红旗、过敏、时间窗等关键信息在噪声下丢失或被淡化,这会推高分诊不足风险。另有一类是严重程度放大型错误,例如把能上三四层楼才喘变成走三四步就喘,把持续 2 小时的剧痛记成持续 2 天,前者夸大功能受限,后者改变急缓判断。

论文还用 5 级临床一致性评分兜底:五分要求安全关键断言与金标准临床等价,四分允许不影响风险判断的小偏差,三分是可能需要澄清的模糊,二分是可能增加风险的重大偏差,一分是可直接导致危险处置的危急失败,不安全率定义为评分小于等于二分的对话占比。

配对声学压力测试如何走完一个样本?

先沿一个样本走完全程。取一段客观结构化临床考试格式的医患对话录音,这是医学院用标准化病人模拟特定疾病的考核形式,好处是不涉及真实患者隐私,且剧本里预埋了密集的安全线索,便于确定什么是必须命中的金标准。原始干净录音先被下混为单声道、幅度归一并重采样到同一采样率。然后为该对话从目标噪声库中确定性地截取一段与对话等长的连续噪声,按信噪比做均方根能量缩放混合,缩放只在非静音语音段上计算,避免长停顿稀释能量。这样同一对话就有了干净基线与多个加噪版本。

加噪音频与干净音频分别送入同一个语音识别前端得到配对转写,再送入配置完全相同的整理模型得到配对结构化输出。整理模型的系统指令施加证据接地约束,要求安全关键断言引用逐字原文片段以抑制幻觉,决策输出限制在固定分类内,例如 3 级分诊量表,以便定量比较。最后把每条输出与医生审核的原子事实金标准对比,分别计算信号保真、决策不变性与临床安全 3 组指标。 下图是论文给出的流水线总览,值得对照上面的样本路径阅读。

看图路径: 1. 先从左侧说话人与医生图标沿箭头找到自动语音识别模块;2. 再对比干净转写与噪声转写两条分支如何进入同一个大模型整理模块;3. 观察右侧绿色与红色结论框之间标注的安全降级箭头;4. 最后看底部三类评估与右下角两阶段证据混合智能体的回路

原论文 Figure 1:Overview of the paired acoustic stress test for clinical scribe pipelines.

论文图 1。原论文 Figure 1:“Overview of the paired acoustic stress test for clinical scribe pipelines.”。

上图上半部分展示了问题来源:左侧说话人与医生图标进入语音识别模块后分叉为理想条件下的干净转写与真实条件下的噪声转写,两条分支各经过一个大模型整理模块,得到绿色框的低紧急常规随访结论与红色框的高紧急立即会诊结论,中间红色双向箭头标注安全降级,例子是胸痛从否定变为肯定。

图的下半部分对应评估的三块内容:上游失真用否定错误与插入率衡量,决策不变性用分诊一致性衡量,临床安全用危急误报与分诊不足衡量,右下角是 2 阶段证据接地混合智能体作为缓解回路。这种画法把全文逻辑压缩为一句话:固定病例与模型,只动声学输入,看临床结论是否存活。

组件如何分工,噪声分类与指标如何计算?

流水线有 3 个可指代的组件。音频混合器负责构造配对条件,转写前端负责把波形变为文本,整理与审计后端负责把文本变为可比较的结构化对象。噪声分类是理解失真签名的钥匙。平稳环境干扰用办公、食堂、交通等连续背景声代表,主要造成频谱掩蔽;非平稳语义干扰用多人语音子集代表,背景人声会与主对话竞争,甚至让整理结果抽取出背景说话人提到的药名或症状,形成加性幻觉。评估信噪比覆盖十五、分贝、10 分贝与 5 分贝三档,用同一组写法表示从安静诊所到嘈杂急诊的环境谱。

自动语音识别 × 大语言模型: 自动语音识别(Automatic Speech Recognition,ASR)负责把诊室录音转成文字,是误差的入口;大语言模型(Large Language Model,LLM)负责把转写整理成结构化病历与分诊结论,是误差放大的场所。二者搭配的理由是分工串接可以自动化文书,但组合新增的作用是声学侧一个否定词或数字单位的扰动会被语言侧整理成格式完好却临床相反的结论,形成静默失效。

词错误率 × 临床不变性: 词错误率(Word Error Rate,WER)负责统计转写与人工参考相比的替换删除插入总数占比,对所有词一视同仁;临床不变性负责判断同一病例在不同噪声下分诊与关键事实结论是否保持一致。二者搭配的原因是前者只能看信号保真,后者才能看诊疗含义是否存活,组合的意义在于揭示论文中心矛盾:WER 几乎不动时临床结论仍可能翻转。

平稳环境干扰 × 非平稳语义干扰: 平稳环境干扰(Stationary Ambient Interference)指空调、设备等连续无语音背景声,分工是造成频谱掩蔽;非平稳语义干扰(Non-Stationary Semantic Interference)指候诊区多人说话等重叠人声,分工是与主对话竞争并注入可被误采的医学实体。二者搭配是为了覆盖诊所从安静到嘈杂急诊的真实声学,组合意义是暴露两种不同失真签名:前者插入少但否定与语义极性易错,后者插入多且幻觉多。

原因侧触发特征 × 结果侧安全终点: 原因侧触发特征负责描述转写层发生了哪类高杠杆错误,如否定丢失、数字单位冲突、非语音污染;结果侧安全终点负责描述下游临床对象出现了什么安全后果,如分诊漂移、遗漏红旗、危急误报。二者搭配的理由是把声学原因与临床后果显式链接,组合新增的作用是让评估从数错词转向定位哪种语义畸变最能预测不安全输出。

原因侧指标先看信号保真。词错误率是替换删除插入总数除以参考词数再乘一百,微平均到词级别;插入率是插入数除以参考词数再乘一百,用作加性伪影的轻量代理,捕捉重复、填充式插入或噪声诱发的额外词;否定错误率是出现临床相关实体否定状态不匹配的对话占比乘一百,例如无发热记成发热。结果侧指标再看鲁棒与安全。

配对分诊一致性是噪声条件与干净基线分诊标签相同的对话占比;分诊不足率是相对金标准新出现的低估紧急程度的占比,只计噪声下新增且基线没有的病例;安全危急错误率是相对金标准与干净基线新出现的危急误报标记的对话占比,针对误报,漏报风险由分诊不足率与整体不安全率互补反映;误差传播率是新增的金标准对照断言错误数除以新增的语音识别词错误数再乘一百,分母为零时记零,它衡量每多错一个词平均带来多少新的断言错误。

分级一致性评分由确定性量表法官给出,只罚临床有意义的偏差,语义等价的改写不扣分,报告平均分与不安全率。

本研究训练了什么,没有训练什么,真实计算是什么?

本研究没有训练或微调转写模型与整理模型,这是一个必须先说清的缺项。语音识别前端直接调用公开模型的推理,整理与审计后端直接调用指令模型的应用程序接口服务,金标准的原子事实分解借助另一大模型的应用程序接口做初拆,再经临床医生修正与补漏。不存在梯度更新、优化器步骤、训练集划分与早停,也不能把参数冻结等同于系统输出确定,因为解码与接口侧仍可能有随机性,论文用确定性贪心解码与固定温度来压制这种随机性。

真实计算过程是推理、检索式混合与规则过滤的组合。转写侧强制温度为零的贪心解码与固定 30 秒窗口,把声学伪影作为变异的主要驱动。整理侧用固定系统指令、固定输出模式与确定性解码,把转写映射为结构化对象。金标准构建是模型辅助加人工核验:先由模型把干净人工转写拆成原子事实,再由医生审核纠正幻觉并补齐遗漏,形成每场对话的语义单元集合。

缓解智能体也是无微调的计算:同一主干模型扮演两个角色,起草器用原始转写做证据、用清洗视图做推理并附逐字证据引用,核查器对照原始转写只做删除,证据缺失时宁可置空,再加确定性符号过滤器丢弃非原文子串的引用,高风险字段无存活证据则置空,温度为零。这种设计 deliberately 用完整性换可追溯性,目标是削减重噪声下的永不该发生类错误。

起草器 × 核查器: 起草器(Extractor)负责用原始转写生成结构化草稿并为安全字段附上逐字证据引用;核查器(Verifier)负责对照原始转写审计草稿,分工是只做删除而不做新增,证据缺失时宁可置空。二者搭配的原因是不做模型微调也能约束幻觉,组合意义是用可追溯性换完整性,优先消除危急误报类永不该发生的错误。

数据、噪声、模型与金标准如何对齐?

临床语料采用开放模拟问诊数据集,包含二百七十二场英文对话,约 52 小时,覆盖呼吸、心血管、胃肠、肌肉骨骼与皮肤 5 个专科,录音不含受保护健康信息。这种客观结构化临床考试格式的价值在于剧本预埋了红旗与过敏等安全线索,且有确定性参考,可严格量化安全关键断言的遗漏,而不只是看措辞相似度。噪声源用两套标准库代表声学分类:多样环境噪声库的办公、食堂、交通子集代表平稳环境干扰,音乐语音噪声库的语音子集代表非平稳语义干扰。

每个对话的噪声段是确定性采样并按时长匹配,再按信噪比混合,保证每个干净基线都有严格配对的扰动对应,控制患者病史与病例组合。

流水线配置按原文交代复述。转写前端采用大语音模型第三代大参数版本,确定性贪心解码,温度为零,窗口固定 30 秒。临床结构化采用二百三十五 B 参数混合专家指令模型经官方接口调用,系统指令要求安全断言引用逐字原文,决策输出限制为固定分类,例如三点分诊量表。金标准对全部二百七十二场对话建立:先用大模型把干净人工转写拆成原子事实,再经医生审核修正幻觉并补细节。

分级一致性法官采用另一大模型按量表打分,关注断言级错误而非风格相似。下游结构化字段在每场对话每种条件下都被要求存在,因此下游指标在全集上计算,不做实例过滤。聚合上词错误率与插入率是词级别微平均,否定错误率、分诊一致性、分诊不足率、危急误报率与不安全率是对话级别占比,误差传播率是新增错误数之比,平均分是 5 级分的算术平均。

主结果显示了什么,哪种噪声最具欺骗性?

比较问题是:在下游配置完全冻结时,不同噪声家族是否以不同方式破坏临床安全,以及词错误率能否提前预警。公平条件是同一对话配对、同一转写与整理配置、同一金标准与同一聚合口径。指标方向是词错误率、插入率、否定错误率、误差传播率、危急误报率、分诊不足率与不安全率越低越好,分诊一致性与平均分越高越好。

条件词错误率(%)插入率(%)否定错误率(%)分诊一致性(%)危急误报率(%)平均分(1-5)不安全率(%)
干净识别基线16.542.9919.12100.000.004.6213.60
语义干扰 15 dB21.164.7434.9391.9175.373.9266.91
语义干扰 5 dB54.6814.5551.1081.9992.283.4191.54
环境干扰 15 dB17.252.4820.2293.0144.124.4527.21
环境干扰 5 dB20.632.3139.7191.5466.184.2340.44

上表把原文主结果压缩为可运行策略的直接对比,干净识别基线是同一流水线在干净音频下的表现,其余行是配对加噪后的表现,数值保留原文表头单位为百分比与裸格写法。需要强调的是干净基线本身已有 13.6% 的不安全率,说明即使没有额外噪声,级联流水线也不是零风险。语义干扰呈现插入重型失真,信噪比越低词错误率与插入率攀升越剧烈,重噪声下不安全率超过 90%。

环境干扰最具欺骗性:15 分贝时词错误率仅比基线高 0.71 个百分点,插入率甚至略降,但不安全率从 13.6 升至 27.21,近乎翻倍;5 分贝时词错误率仅升至 20.63,否定错误率却升至 39.71,不安全率达 40.44。分诊一致性在环境干扰下仍维持在 90% 以上,说明系统相对自身基线看似稳定,但相对金标准的危急误报与漏报已大量累积,这正是自我一致不等于正确的静默失效。

未胜出的边界是环境干扰下分诊不足率随信噪比并非严格单调,轻噪声与重噪声的相对排序会出现小幅波动,论文解释为具体哪些关键语句被声学扰动所致,而非信噪比的纯线性函数。

缓解智能体换来了什么,又付出了什么?

比较问题是:在重噪声 5 分贝下,不做模型微调的证据接地审计能否降低高风险幻觉,以及它是否同时降低了整体断言错误。公平条件是同一噪声音频、同一主干模型、同一金标准,比较对象是无缓解的直接整理与有缓解的 2 阶段审计。指标方向与主结果一致,重点看不安全率、危急误报率、分诊不足率与平均分,兼看误差传播率是否同步下降以判断它是全面变准还是选择性 abstention。

条件词错误率(%)误差传播率分诊一致性(%)危急误报率(%)分诊不足率(%)平均分不安全率(%)
语义干扰 5 dB 无缓解54.6810.5381.9992.287.723.4191.54
语义干扰 5 dB 有缓解54.6810.6286.0383.822.573.7170.96
环境干扰 5 dB 无缓解20.6377.9391.5466.183.314.2340.44
环境干扰 5 dB 有缓解20.6378.8292.2851.841.104.3633.46

上表显示缓解策略是实际可运行的:转写侧数字不变,因为审计只改整理侧;两种噪声下不安全率、危急误报率与分诊不足率均下降,平均分与分诊一致性回升。语义干扰下不安全率从 91.54 降至 70.96,环境干扰下从 40.44 降至 33.46。但代价也很清晰:误差传播率基本不变甚至微升,说明审计并没有让每个新增词错误带来的平均断言错误减少,而是选择性剪掉了无支撑的安全关键永不该发生内容,良性表述差异被相对保留。

论文明确这是用完整性换可追溯性的权衡,高风险字段无证据时置空可以减少误报,但也可能让本可推断的细节缺席。未胜出项是即使有缓解,重语义噪声下的不安全率仍高达 70%,说明证据约束不能解决背景人声主动注入医学实体这一根本难题,还需声学侧的说话人分离或更强的来源标注。

哪些结论有边界,哪些验证还没有做?

论文直接报告的是在二百七十二场模拟问诊、两类噪声库、三档信噪比与固定双模型配置下的配对结果,支持的判断是词错误率是临床安全的弱代理,不同噪声诱发不同失真签名,以及符号证据约束能降低高风险幻觉。这些判断的适用条件是英文模拟对话、确定性剧本与医生审核金标准,是否推广到真实诊室的多方言、远场混响、设备告警声与真实患者隐私约束下的长对话,仍待验证。

可能但待验证的推测是小转写扰动不成比例地产生断言错误这一高杠杆机制。轻环境噪声下误差传播率出现尖峰,重噪声下该比值反而下降,论文解释为分母涌入大量低影响词错误稀释了比值,而分子取决于关键语句是否被击中。这种解释是合理的,但原文没有逐词因果消融来证明每个否定词或数字词的边际贡献,因此只能表述为支持而非证明。

明确缺失的证据包括延迟、算力成本与误判率的人因评估。缓解智能体需要 2 次大模型调用加符号过滤,论文未报告推理开销、输出帧率与实际延迟,也未测量医生在置空字段下的补救时间与漏诊风险。训练资源一节已说明无训练,但推理预算同样未披露,不能承诺该方法改善了效率。总体趋势不等于每组都成立,环境干扰下个别信噪比的非单调波动提醒读者不要把平均改善推广为每场对话必改善。

若要复现,应先固定什么,再跑什么?

复现的第一步是固定配对与冻结,而不是先调模型。按原文顺序,先把干净录音统一为单声道、幅度归一与同一采样率,再为每场对话确定性截取等长连续噪声段,用仅在非静音段计算的均方根能量缩放到十五、分贝、10 分贝与 5 分贝三档,生成严格配对的加噪集。转写侧固定贪心解码、温度为零与 30 秒窗口,整理侧固定系统指令、固定三点分诊等输出模式与确定性解码,并在整个对比中保持主干模型版本与接口不变。任何改动指令措辞或解码温度都会破坏配对归因。

第二步是重建金标准与指标。先用大模型把干净人工转写拆成原子事实,再请临床人员逐条审核,纠正幻觉并补齐红旗、过敏、数字单位与时间窗等细节,形成每场对话的语义单元集合。转写侧计算微平均词错误率、插入率与对话级否定错误率,整理侧计算与干净基线的分诊一致性、相对金标准新增的分诊不足率、相对基线与金标准新增的危急误报率、新增断言错误与新增词错误之比的误差传播率,以及 5 级法官的平均分与不安全率。注意百分点与相对百分比不同:0.71 个百分点是词错误率的绝对差,不安全率翻倍是相对变化,不能混为同一指标的差值。

第三步是复现缓解。同一主干模型跑起草器与核查器双角色,起草器附逐字证据引用,核查器只删不增,再加符号过滤器丢弃非原文子串引用,高风险字段无存活证据置空,温度为零。复现时应同时记录被置空的比例与医生补救成本,否则只看不安全率下降会高估可用性。关于可运行性,原文只给出模型名称与接口调用方式,本次未验证代码与权重链接可达,因此应按不可用处理,先用自有合规数据与模型做小规模配对验证,再谈部署。

何时值得尝试这套方法,还需补哪项验证?

当你的临床语音笔录已经是转写加整理两段式,且担心干净环境测得的低词错误率掩盖了真实诊室的风险时,值得尝试这套配对压力测试。它不要求重训模型,只要求把同一病例在不同噪声下重跑一遍并冻结下游,就能定位是插入型幻觉、否定翻转还是数字时间畸变在驱动不安全输出。对于平稳环境噪声占主导的问诊室,即使词错误率只动零点几个百分点,也应重点抽查否定与数字单位字段,而不是只看平均分。

当重噪声下危急误报居高不下且可接受部分字段置空时,可以尝试证据接地混合智能体。它的收益是实际可运行的:两种噪声 5 分贝下不安全率与危急误报率均下降,分诊不足也有所缓解;它的代价是整体断言错误率并未同步下降,且需要额外的大模型审计调用与规则过滤,重语义噪声下仍有 70% 不安全率。换言之,它适合作为安全护栏,而不是作为准确率提升器。

还需补的验证至少有三项。一是真实诊室的前瞻验证,包括远场、重叠说话、设备告警与多口音下的表现,以及医生在置空与误报下的实际处置时间。二是成本与延迟测量,明确 2 次调用与过滤的端到端耗时,以及在门诊并发下的可行性。三是逐词因果分析,对否定词、剂量数字与时间表达做受控扰动,验证高杠杆假设并指导声学前端与整理约束的联合设计。记住论文特有的误解:分诊与自身基线一致不等于与金标准一致,词错误率稳定不等于临床含义稳定,只有配对到同一病例并对照医生审核的金标准,才能看到静默失效。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总