英文题目:Moot-Court: Training-Free Dialectical Reasoning for Depression Detection
会议身份:
conference:interspeech:2026:conference-paper-id:sun26i_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#语音生物标志物 #检索增强 #大语言模型 #病理语音评估
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Yuqing Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Haoxun Li:机构信息未能从会议 PDF 纯文本可靠映射
- Leyuan Qu:机构信息未能从会议 PDF 纯文本可靠映射
- Taihao Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动抑郁检测需以临床访谈文本与语音声学线索为输入,输出是否抑郁的筛查判断,难点在于临床数据稀缺易致过拟合且黑盒推理缺乏可解释的症状归因路径。本文先将交互延迟、语速、基频与能量等声学标志文本化为多模态蓝图,再由控方构建致病图编码内外部症状触发与强化关系、辩方构建情境图编码保护性语境,前者输出为后面对抗举证提供结构化证据。随后多法官以不同采样温度并行裁决并经多数投票形成裁决,反思器对分歧与系统性失败路径做对比反思并沉淀为动态法典正负经验,约束后续推理轨迹。相对直接微调或单路提示的方法,该机制差异在于用冻结大语言模型模拟对抗举证与判例演化,把参数更新替换为可追溯的规则检索与更新,因而兼顾免训练部署与临床可验证性。在DAIC-WOZ测试集下,DeepSeek V3.2完整框架的F1为.8856,高于DepressInstruct基线的F1 .8235。该结论目前仅在单一英文访谈语料与官方划分下验证,未检验跨语言跨场景与双相障碍等复杂共病的外推能力。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要解决的临床缺口是什么?
这篇论文的输入是半结构化临床访谈的多模态记录,一边是被试与虚拟访谈员 Ellie 的逐句转录文本,一边是同一段录音的声学信号。目标不是替代医生下诊断,而是做可解释的自动抑郁筛查,输出是二分类结论,即抑郁或健康,并附带可核查的推理路径。必须保留的关键信息是数据集采用 DAIC-WOZ 官方划分,训练 107 例、验证 35 例、测试 47 例,评价指标是精确率、召回率与 F1,F1 越高表示在查全与查准之间平衡得越好。
论文反复强调的临床背景是问卷截断值与结构化诊断经常对不上,低资源初级保健场景漏诊率高,传统从零训练的融合模型虽然能拟合基准,但缺乏医生可信任的解释,还容易学到与访谈员提示词相关的捷径。因此作者把问题框定为低资源、不能大改参数、又要可追溯的筛查任务。初学者容易误以为声音越大模型越准,论文的立场恰相反:声音必须先变成与文本对齐的符号,再进入临床语义网络,否则多模态融合会引入新的过拟合。
本解读默认只讲论文实际做的访谈级抑郁二分类,不扩展到严重程度回归或多疾病鉴别。后面提到的例子会明确标为例子,不代表论文报告过该数值。例如我们会说假如某句话出现叹息标记加长停顿,系统会如何处理,这只是帮助理解流程的教学例子。
已有路线走了多远,为什么还缺训练无关方案?
按同输入、同目标、同运行阶段对照,已有路线可分成 3 类。第一类是端到端监督学习,例如上下文感知卷积、双向循环网络与跨模态注意力网络,它们直接在 DAIC-WOZ 上从零或从浅层特征训练,优点是拟合能力强,缺点是需要较多标注且解释是事后附加的。第二类是自监督或参数高效微调,例如语音自监督表示加全量微调,以及在 GPT-2 上做低秩适配,优点是复用了预训练语音或文本知识,缺点是仍要改权重,在只有 100 例级临床数据时容易过拟合,且换一个基座就要重调。
第 3 类是把语音接入大模型,例如声学界标提示与语音时序检索增强,优点是可读性好,缺点是多模态对齐仍依赖可训练的映射层或指令调优。
Moot-Court 与它们的区别不在输入模态,而在监督与运行阶段。它的基座大模型全程冻结,不做指令调优、低秩适配或提示调优中的任何梯度更新,学习只发生在外部经验库的增删改上。这意味着它与微调路线不是同条件比较:微调路线用训练集改权重,它用训练过程积累可读规则再在测试时检索。理解这一点才能正确看待后文 F1 超越微调模型的说法,它比较的是最终筛查效果,不是同等参数更新量下的优化效率。
论文还点名了两个常被混淆的概念。免训练不是说系统没有从数据中获益,而是不用反向传播;可解释不是输出一段流畅的病情描述就算数,而是每一步结论都能回指到事实节点的引文与声学标签。这两个区分是后文所有设计的评价标准。
任务形式化:从一次访谈到一次可复述判决
把 1 次访谈记成多轮话语集合,每轮有文本与对应音频。论文先把音频转成每轮的符号化声学生物标记集合,再把 3 层蓝图、两张对抗图、多法官投票串成一条流水线。最终判决是多数投票结果,反思只在特定分布下触发。学习依赖很清晰:没有蓝图就无法对齐语音与文本,没有节点分类就无法定义边,没有对抗图就无法暴露矛盾,没有经验检索就无法约束法官的先验。
一个样本走完全程的样子是这样的。输入是一段 3 分钟左右的访谈切块与转录,例如被试回答关于亲子关系的问题时出现口吃重复与叹息标记。系统先给该话语贴上停顿与能量等标记,再统计全场的语速斜率、能量分布与打断率,并用音频大模型生成性别年龄与整体韵律描述。然后大模型按精神病理网络理论抽出外部触发、内部主诉与客观证据 3 类节点,再分别连成致病图与辩护图,最后由 5 个法官读图投票。若全对则跳过反思,若全错或分歧则由反思者提炼新规则回写经验库。
这里的输出不是概率校准后的风险分,而是离散标签加证据链。论文没有报告阈值选择、类别不平衡处理或跨数据集迁移,因此不能把测试集上的高召回直接理解为临床部署中的低漏诊率。
总览:蓝图、对抗图、裁决与进化如何串起来?
Moot-Court 可以按 4 个动作记忆:先把语音变成文字能读的画像,再把画像变成带临床类型的事实节点,然后让两个律师沿相反方向连边,最后让法官投票并让反思者把教训写进法典。左路是多模态蓝图,负责解决不更新参数时的融合难题;中路是辩证推理,负责解决黑盒不可追溯的难题;右路是动态经验进化,负责解决静态提示无法积累的难题。
下图是全文唯一有像素依据的总览图,阅读时不要把它当装饰,要按箭头核对 3 个汇合点。
看图路径: 1. 先从左下角被试与 Ellie 访谈出发,沿橙色虚线看声学 biomarker 如何变成话语级标记与统计画像;2. 再看中间事实节点池如何分叉给上方的检察官致病图与下方的辩护律师情境图;3. 最后看中间法官如何同时接收两张图与右侧经验库先验,并按三种场景决定是否触发反思者回写
论文图 1。原论文 Figure 1:“Overview of the proposed Moot-Court framework.”。
从像素可见,左框顶部是话语级声学标记示例,被试的重复与叹息后跟着符号标记,中间是会话级统计画像,列出交互延迟、语速、能量趋势与音质,下面是被试级描述性画像,给出性别年龄估计与情感效价中性等文字,底部是原始波形与 Librosa 提取的延迟、语速、基频、能量均值、抖动闪烁。中间底部是事实节点池,明确写出节点集合是 3 类节点的并集。
中间上方蓝色圆是致病图,标注了触发、泛化、强化、掩盖、矛盾、指示等边,中间下方红色圆是情境图,标注了情境化、生理学解释、抑制等边。右侧上方是修改、合并、新增 3 种进化操作指向法典,右侧中间是正向规则与负向陷阱的经验条目,右下方是 3 种反思场景,场景一全对直接跳过反思,场景二全错与场景三分歧才进入反思者回写。法官位于中间,同时接收两张图与经验先验,向下多数投票输出抑郁或健康。
这 1 像素结构直接对应后文三节组件划分,凡是猜测图中颜色深浅代表重要性的说法都没有依据。
蓝图怎么做:三层文本化如何对齐声音与文字?
多模态蓝图要解决的是未对齐问题,即音频是连续帧,文本是离散轮次,直接拼接会让冻结大模型无所适从。论文的做法是分层文本化。话语级把每轮的声学符号直接追加到该轮转录后,形成统一节点,便于语义对齐。会话级用统计算子对全场声学标记做回归斜率、均值方差极值与打断率,刻画时间趋势、分布形态与交互主动性。被试级用音频语言模型按 3 分钟分块生成人口学估计与整体韵律描述,再用大模型提炼成临床叙事。
实现细节按原文交代:原始音频先用 ZipEnhancer 去噪,因为 DAIC-WOZ 存在背景噪声;声学标记用 Librosa 提取交互延迟、每秒词数、基频与均方根能量,用 Parselmouth 提取抖动与闪烁;描述性画像用 Qwen-Audio 做分段属性抽取,用 Qwen-max 做临床叙事。冻结的是判读用的 DeepSeek 或 Qwen3 判读基座,不是特征工具链本身。初学者要分清这两层冻结含义:判读大模型不更新权重,但信号处理与切块描述仍是实际计算步骤。
声学特征文本化 × 多模态蓝图: 声学特征文本化负责把每句话的停顿、语速、基频、能量、抖动闪烁等连续信号转成可读符号,多模态蓝图负责把这些符号按话语级、会话级、被试级 3 层组织成诊断上下文,二者搭配的理由是不更新参数也能让纯文本大模型读懂语音,组合后新增的作用是形成统一的蓝图 B 供后续图推理直接引用。
教学例子:假如某轮文本写着孩子们的爱是无条件的,但声学标记显示长停顿加叹息,话语级节点会保留这种图文矛盾,而不是在融合时平均掉。正是这种保留,后续的矛盾边才能检测到微笑抑郁类悖论。
对抗图怎么做:检察官与辩护律师各连什么边?
事实节点抽取后,系统得到离散节点集,每个节点是包含编号、层级类型、临床标签、原文引文与声学标签的五元组。类型只有 3 类:外部场记录失业、人际冲突等环境触发,内部状态区分核心症状主诉与短暂情绪,证据标记把声学统计与画像映射为客观证据。这种分类直接来自精神病理网络理论,不是模型自由发明的。
检察官执行病理边扫描,核心是找自维持回路。它先用指示边把客观标记锚到内部症状,再用强化边找症状间的反馈环,用触发边找外部应激如何激活症状,用泛化边标记过度概括的认知扭曲,用掩盖边标记适应性行为对病理的遮蔽,最关键的是用矛盾边检测声学极性与文本自述冲突的临床悖论。辩护律师做排除性分析,优先用排除边执行躁狂否决以严格排除双相史,再用情境化边把症状映射回外部应激以区分反应性悲伤与内源性病理,用生理学解释边找躯体疾病等生物学托词,用抑制边纳入积极应对等韧性因素,用区分边归因到共病焦虑网络。
致病图 × 辩护图: 致病图由检察官角色负责,用指示、强化、触发、泛化、矛盾、掩盖等边把症状连成自我维持的网络,辩护图由辩护律师角色负责,用情境化、生理学解释、抑制、排除等边把症状拉回生活应激或躯体原因,二者搭配的理由是只找病会过度诊断、只辩护会漏诊,组合后新增的作用是把矛盾判读变成两张可比较的图交给法官裁决。
症状网络理论 × 辩证推理: 症状网络理论负责提供节点的分类学,即外部场、内部状态、证据标记 3 类事实节点,辩证推理负责提供边的临床语义和对抗流程,搭配理由是理论只给静态本体、推理需要可执行的扫描协议,组合后新增的作用是让每条连边都有病理含义并可追溯到原文引文和声学标签。
两张图的临床分工不同:致病图回答症状是否已进入迟滞自维持状态,辩护图回答症状是否有更节俭的外部或生理学解释。只有当两张图都摆在法官面前,过度诊断与漏诊的张力才被显式化,而不是藏在 1 次前向推理的隐状态里。
裁决与反思怎么做:五法官与三种场景如何分工?
裁决阶段为每个病例初始化 5 个独立法官,采样温度从 0.5 到 0.8 形成逻辑梯度。推理前按奖励分数从经验库检索高质量经验,每个法官再做 2 次筛选,对简单样本有权否决全部先验以保持独立性。最终标签由多数投票决定。温度差异的目的是让推理路径多样化,而不是制造随机性卖点,论文没有声称温度设置本身带来可证明的增益。
反思逻辑按正确路径分布分成 3 种博弈场景。场景一是全体正确,视为样本足够简单,跳过反思以保持经验库纯净。场景二是全体错误,触发校准协议,审计跨失败路径的共享偏置并生成防御性负向陷阱,还要经过经验验证环。场景三是既有正确也有错误,做对比反思,定位胜者与败者在证据加权上的分歧点,蒸馏出正向经验与负向陷阱。3 种场景的划分依据是 5 条路径的正确性分布,不是置信度阈值。
多智能体法官 × 反思者: 多智能体法官负责用 5 个不同采样温度并行裁决并多数投票给出抑郁或健康结论,反思者负责在全错或意见分歧时对比胜负路径提炼经验,搭配理由是单次判读易受采样偶然性影响而需要事后校准,组合后新增的作用是把 1 次判决变成可复盘、可沉淀的案例。
需要提醒的是,跳过反思不是系统偷懒,而是原文明确的保纯机制。若对简单样本也反复提炼,经验库会被冗余规则稀释,后文奖励公式中的成功率也会失真。
没有梯度时,系统到底更新了什么、怎么算分?
本研究没有神经网络训练阶段,所有判读基座在单次试验内保持同一版本且冻结,不存在反向传播、优化器步数或权重重置。真正被更新的是外部经验库,它由正向规则集与负向陷阱集组成,每个节点记录协议内容、权威度、使用频次与成功次数。计算过程是检索、推理、投票、反思、回写的外循环,不是梯度内循环。把免训练理解为确定性求解是误解:冻结参数只保证权重不变,采样温度与检索内容仍会让输出变化。
奖励分用于检索排序与进化淘汰,原文给出的目标是衡量经验的历史诊断成功率并保护新知识。符号含义是权威度乘以缩放因子再乘以成功率,加上新样本奖励,其中成功率是成功次数除以使用频次,缩放因子取 0.4,新手奖励在频次小于 5 时给 0.5 以保证新知识被充分采样。进化操作有 3 类:当候选经验给出更精确触发边界时做修改并将权威度增加 0.2,上限 3.0;当语义相似度超限时做合并并继承统计权重再给 0.3 权威奖励;当出现全新临床经验时做新增并分配正负规则编号,初始化权威度为 1。每次任务后还做语义去重与按分淘汰以保持高保真。
经验库 × 奖励反馈: 经验库负责存放正向规则集与负向陷阱集的结构化节点,反馈奖励负责用成功率与权威度计算每条经验的留存分数,搭配理由是冻结模型不能靠梯度记住教训只能靠外部记忆约束推理轨迹,组合后新增的作用是通过修改、合并、新增 3 种进化操作实现无参数更新的知识积累。
原文未报告的缺项要明确指出:没有给出语义相似度阈值的具体数值与编码器,没有给出经验验证环的通过标准,没有报告经验库大小上限与检索截断长度,也没有报告反思器与法官是否共享同一提示模板。这些缺项不影响复述主流程,但会影响逐字复现。
实验条件:数据、工具链与评价口径是什么?
数据按官方划分使用 DAIC-WOZ,训练 107、验证 35、测试 47,访谈由虚拟智能体主持以评估心理困扰。音频预处理用 ZipEnhancer 去噪,声学标记用 Librosa 与 Parselmouth 按上文提取,描述性画像按 3 分钟切块以适应音频语言模型输入长度。判读基座包括 DeepSeek V3.2 及其推理版与 Qwen3 系列,单次试验内所有智能体用同一模型版本以保证逻辑一致。法官数为 5,温度 0.5 到 0.8。评价指标是精确率、召回率与 F1,方向都是越高越好,其中召回高意味着漏诊少,精确率高意味着误报少。
资源状态是正文开源声明的唯一依据,本次没有发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。论文致谢列出多项基金支持,并声明用了语言模型做文字润色、用图像模型生成总览图中的人物元素,但科学内容由作者负责。这些信息与性能无关,但复现时要知道人物插图不是实验数据。
一个特有的细节是输入长度约束处理:描述性画像不是对全场 1 次生成,而是分块抽取再提炼,这意味着长访谈的叙事一致性依赖提炼模型,而不是音频模型的长上下文。另一个特有细节是法官有权否决检索到的先验,这意味着经验库不是强制提示,而是可拒绝的语义先验,简单样本的独立性因此得以保留。
主结果:与可运行基线比,增益与代价各是什么?
比较的问题是冻结大模型加外部经验,能否在测试集上达到或超过需要改权重的路线。公平条件是同一 DAIC-WOZ 测试划分与同一精确率、召回率、F1 口径,指标方向都是越高越好。下表整理论文报告的主结果,策略列区分全量训练、微调与免训练,不能把不同策略的数字当成同等训练预算下的胜负。
| 条件 | 指标 | 全量训练基线 | 指令调优基线 | 本方法 | 比较对象 |
|---|---|---|---|---|---|
| DAIC-WOZ 测试集 | F1 | 0.8700 | 0.8235 | 0.8856 | 本方法对比最强全量训练与指令调优 |
| DAIC-WOZ 测试集 | 召回 | 0.9100 | 0.8400 | 0.9394 | 本方法漏诊更少但需看误报代价 |
| DAIC-WOZ 测试集 | 精确率 | 0.8300 | 0.8077 | 0.8378 | 本方法精确率仅略高于基线 |
| DAIC-WOZ 测试集 | F1 | 0.8500 | 0.8330 | 0.8856 | 本方法对比循环网络与地标提示路线 |
表后解释要同时讲收益与代价。主要收益是本方法报告的 F1 为 0.8856,召回达 0.9394,高于表中全量训练、指令调优与低秩适配路线,支持免训练加辩证约束可以捕获复杂病理表征的判断。但代价与限制同样具体:精确率 0.8378 只比最强全量训练高约 0.7 个百分点,高召回是否以特定误报为代价需要看混淆矩阵,而论文未给出;未胜出项方面,原文正文另写 F1 为 0.8750,与表内 0.8856 互相冲突,此处明确标注冲突而不自行取舍;边界方面,所有主结果只在 DAIC-WOZ 单语料上报告,没有跨语料或跨人群验证,不能推广为临床通用筛查能力。百分点差与相对百分比不同,后文不把召回提升说成百分比增幅。
消融与反证:哪个模块在补什么短板?
消融要回答 3 个递进问题:直接多模态推理差在哪里,线性推理与对抗图各修什么,经验库是否解决了对抗带来的保守化。条件一致性是同一 DeepSeek V3.2 基座与同一测试口径。下表先看推理链的增量贡献。
| 条件 | 指标 | 直接推理 | 线性推理与反思 | 对抗无经验库 | 完整框架 |
|---|---|---|---|---|---|
| 同基座消融 | F1 | 0.6296 | 0.7143 | 0.7020 | 0.8856 |
| 同基座消融 | 召回 | 0.5152 | 0.7143 | 0.6061 | 0.9394 |
| 同基座消融 | 精确率 | 0.8095 | 0.7143 | 0.8333 | 0.8378 |
| 同基座消融 | 结论 | 漏诊严重 | 过滤幻觉但平衡 | 变保守误报少漏诊多 | 召回恢复且保持精确 |
表后解释的关键反例是对抗无经验库的权衡:精确率升到 0.8333,但召回掉到 0.6061,说明控辩过滤把反应性悲伤等假阳性压住了,却也把真阳性放走了。完整框架用经验先验把召回拉回 0.9394 且精确率维持 0.8378,F1 到 0.8856,这支持经验库补的是对抗过度保守的短板,而不是简单叠加增益。未胜出项是线性推理版本的 F1 仅 0.7143,说明没有对抗图时反思只能做初步幻觉过滤。
第二组反证看模态必要性与基座泛化,条件分别是同框架下纯文本对比图文,以及同框架换基座。纯文本 F1 为 0.7890,图文融合 F1 为 0.8856,支持声学提供了文本没有的互补信息;换到 Qwen3-30B 等较小基座时 F1 为 0.8234 但召回仍不低于 0.9394,说明增益主要来自辩证引擎与经验库的即插即用,而不是某个特定大模型的私有能力。但论文未报告音频质量差或方言口音下的衰减,因此不能把多模态增益理解为在所有采集条件下成立。
| 条件 | 指标 | 纯文本 | 图文融合 | 小基座表现 | 比较对象 |
|---|---|---|---|---|---|
| 模态与基座 | F1 | 0.7890 | 0.8856 | 0.8234 | 融合优于纯文本,小基座仍可用 |
| 模态与基座 | 召回 | 0.8485 | 0.9394 | 0.9545 | 小基座召回保持高位 |
| 模态与基座 | 精确率 | 0.7368 | 0.8378 | 0.7241 | 小基座精确率代价明显 |
| 模态与基座 | 结论 | 文本基线尚可 | 声学补足漏诊 | 换基座以精确率为代价保召回 | 需按部署目标选型 |
表后差异解释需回到同一口径:图文融合在保持精确率 0.8378 的同时把召回维持在 0.9394,而小基座以精确率降至 0.7241 为代价保持召回 0.9545,因此部署选型应在漏诊容忍与误报成本之间权衡,且不能外推至论文未覆盖的低质音频条件。
哪些结论还站不住,需要补什么验证?
论文直接报告的是单数据集上的标签准确性,有限解释是辩证图与经验库带来了可追溯性,未验证推测是这种可追溯等于临床可用性。必须用可能与待验证来表达后者:经验库中的正向规则与负向陷阱可能帮助医生复核,但论文没有做医生一致性评价或误判率的人因实验,因此不能承诺减少临床误诊。
缺失的证据不是技术错误,但要逐项点名。统计方面没有给出置信区间、显著性检验或多次采样的方差,5 法官投票本身有采样随机性,单次 0.8856 不能读成稳定上界。成本方面没有报告推理延迟、调用开销、音频切块与检索的耗时,总体 F1 趋势不等于每组每步都更快更省。数据方面测试集仅 47 例,DAIC-WOZ 的访谈员提示捷径问题在相关工作中已被指出,论文虽用对抗图缓解,但没有做提示词消融来证明捷径已被去除。
另一个特有误解是把高召回当成适合筛查的充分条件。筛查更怕漏诊没错,但 0.9394 召回对应的假阳性会进入转诊链条,论文没有评估转诊负担或阈值可调性,因此何时值得尝试要加条件:只有当部署方能承受复核成本,并把系统定位为支持而非替代诊断时,才值得按后文步骤复现。
复现先做什么,需要保留哪些信息条件?
复现的第一步不是跑大模型,而是重建数据与特征口径。按官方划分取 107、35、47,用 ZipEnhancer 去噪后,用 Librosa 提取延迟、每秒词数、基频与能量,用 Parselmouth 提取抖动闪烁,保留每轮符号的原始单位与精度,不要自行四舍五入。描述性画像必须按 3 分钟切块用音频模型抽取再提炼,不要改成全场 1 次生成,否则输入长度与叙事粒度都会偏离原文。
第二步是冻结判读基座并固定版本,单次试验内检察官、辩护律师、法官与反思者用同一模型,法官数取 5,温度取 0.5 到 0.8 的梯度,经验检索后允许法官否决先验。第三步是实现 3 类节点抽取与两张图的边定义,节点必须保留编号、类型、标签、引文与声学标签,边必须按原文的指示、强化、触发、泛化、矛盾、掩盖与情境化、解释、区分、抑制、排除来连,不要自创新的边类型。第四步是实现奖励排序与修改、合并、新增回写,以及场景一跳过、场景二全错校准、场景三分歧对比的触发条件。
关键超参数与信息条件要原样保留:缩放因子 0.4、新手奖励 0.5 且频次小于 5、修改增量 0.2 上限 3.0、合并奖励 0.3。代码、权重与数据是否可运行本次未能确认可达,不要写已公开。若复现结果低于 0.8856,优先检查经验库是否为空检索、温度梯度是否被固定为单值、矛盾边是否因声学单位错误而失效,而不是先调大模型版本。
收束:这套方法在什么情况下值得用?
回到中心矛盾:临床数据少、不能大调模型,又要可解释的多模态判断。Moot-Court 的选择是用文本化绕开参数融合,用对抗图把矛盾显式化,用外部经验库代替梯度记忆。这个选择的代价是系统变重,需要维护检索、投票与进化 3 套逻辑,且单数据集证据尚不足以证明跨场景稳定。
何时值得尝试的条件很具体:已有访谈转录与录音,且能做去噪与分块;部署环境不允许微调或换基座成本高;复核人力能消化高召回带来的假阳性,并要求每例结论可回指到引文与声学证据。此时可按上一节顺序先复现蓝图与对抗图,再接入经验进化。若只能做纯文本筛查,论文的 0.7890 纯文本基线说明仍有可用性,但不应期待达到图文融合的 0.8856。
还需补的验证是跨语料测试、医生复核一致性、多次采样的稳定性区间,以及延迟与调用成本的实测。只有补齐这些,才能把训练无关从节省算力的说法推进为可部署的筛查范式。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
