英文题目:Task-Conditioned Audio-Text-Image Fusion for Cognitive Score Estimation from Speech-Based Assessments
会议身份:
conference:interspeech:2026:conference-paper-id:krzywdziak26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#语音生物标志物 #混合专家模型 #多模态学习 #语音 #病理语音评估
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Justyna Krzywdziak:机构信息未能从会议 PDF 纯文本可靠映射
- Władysław Średniawa:机构信息未能从会议 PDF 纯文本可靠映射
- Agnieszka Pruszek:机构信息未能从会议 PDF 纯文本可靠映射
- Wojciech Szecówka:机构信息未能从会议 PDF 纯文本可靠映射
- Michał K. Grzeszczyk:机构信息未能从会议 PDF 纯文本可靠映射
- Teresa Brzozka:机构信息未能从会议 PDF 纯文本可靠映射
- Bartłomiej Eljasiak:机构信息未能从会议 PDF 纯文本可靠映射
- Zofia Marciniak:机构信息未能从会议 PDF 纯文本可靠映射
- Łukasz Łazarski:机构信息未能从会议 PDF 纯文本可靠映射
- Mateusz Matuszewski:机构信息未能从会议 PDF 纯文本可靠映射
- Daria Hemmerling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理基于语音的认知评估中从录音预测蒙特利尔认知评估 (Montreal Cognitive Assessment, MoCA) 与简易精神状态检查 (Mini-Mental State Examination, MMSE) 分数的回归问题,难点在于临床分数采集频率低于录音频率导致样本级监督粗糙,且轻度认知障碍 (Mild Cognitive Impairment, MCI) 与健康对照的言语差异细微而五种诱发任务异质。方法链分三步推进:先用音频、文本与视觉预训练编码器抽取模态表示并经独立投影头映射到共享融合空间,再以任务嵌入 (task embedding) 条件化的交叉注意力实现词元级交互并在图片描述 (Picture Description, PD) 任务中加入视觉分支,最后用轻量多输出回归头联合掩码加权均方误差主损失与标签条件图文对齐损失优化并以混合专家 (Mixture-of-Experts, MoE) 做任务特化。与仅把图片作特征源的做法不同,该设计把转录与图像一致性显式建模为健康对照鼓励高相似、MCI 在超过裕度时惩罚高相似的几何约束。在自采波兰语临床数据集患者级五折评估的聚合任务条件下,E6的RMSE为2.49,低于E0的RMSE 3.74,且E6的MMSE RMSE为2.14,低于E0的MMSE RMSE 2.97。结论目前仅限于该采集协议与五类任务内,跨语言、跨中心与独立队列验证尚未完成。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一步?
本文的输入是受试者在手机上完成语音认知任务时留下的录音、由语音识别得到的转录文本,以及只在图片描述任务中出现的提示图片。输出不是分类标签,而是两个连续的临床筛查分数:蒙特利尔认知评估即 MoCA 与简易精神状态检查即 MMSE。研究者明确说明由于类别不平衡严重,工作聚焦于回归性能,而不是做轻度认知障碍与健康对照的二分类。
目标读者需要先建立的事实是数据规模与采集方式。论文报告数据集在波兰 3 个医疗中心通过临床试验收集,共 88 名受试者,其中 69 名为经标准化神经心理确认的轻度早期认知障碍,19 名为健康对照。轻度认知障碍组还包含与阿尔茨海默病、多发性硬化或帕金森病相关的亚型。所有人都完成了 MoCA 与 MMSE 筛查,平均年龄 61.34 岁,MoCA 均值 23.82,MMSE 均值 26.85。采集设备统一为三星 Galaxy A55 手机,轻度认知障碍组采集约 6 个月,健康对照组约一个月,多数录音在家中完成。
本文要解决的是中间建模步骤:在已有音频、文本、可选图像的条件下,如何设计从多模态表示到两个分数的回归管线,并验证任务条件、视觉接地与专家专门化是否逐段带来改进。最终输出是按病人聚合后的均方根误差即 RMSE 与平均绝对误差即 MAE。理解这一点后,后续所有模型变体都可以看成对同一回归目标的不同表示与融合选择。
同任务同目标的前人走到了哪里?
在语音加文本这条路线上,前人常用自动语音识别后接 BERT 或 RoBERTa 等变换器编码器。在帕金森病相关研究中,语言特征经常优于声学特征,论文转述的解释是任务高度依赖语义内容与核心词汇产出。在 TAUKADIAL 多语言多图片背景下,已有工作主要做 MMSE 回归,报告性能从基线均方根误差 2.89 到最优系统 1.87 不等。这说明文本语义在这类任务中信息量大,但跨语言、跨特征、跨评估协议的波动也大。
在加入视觉的路线上,关键区别在于把提示图当作主动模态还是仅当特征来源。论文回顾了 CLIP 与 BLIP 等视觉语言系统,以及在 ADReSSo 上把图片区域与口语或转录内容关联的图方法与协同注意力方法,还提到按句子计算 CLIP 图文相似度并筛选痴呆信息子区域的工作,其最好准确率为 83.44%,高于纯文本基线的 79.91% 与全图相关过滤的 80.63%。这些对照与本文是同输入、同目标意义上的参照:都是看图说话加转录加分数或诊断。
本文与上述工作的差异在于不只做分类或单图过滤,而是把多张图片的潜在空间看成可诱发不同叙事复杂度的条件,并用任务条件融合统一处理 5 个语音任务。论文的 3 个贡献因此是递进的:提出音频图像文本融合管线加图片描述任务的标签条件图文对齐损失;用从声学基线到多模态融合再到混合专家的阶段序列展示 MoCA 与 MMSE 预测的逐步改进;给出 5 个任务的任务级分析并指出图片描述最具信息量。
为什么图片描述任务值得单独建模?
论文在摘要与引言中给出的行为依据是轻度认知障碍者在图片描述中往往描述更窄的画面部分,容易遗漏细节与空间关系。这意味着转录文本与图像之间的一致性本身就携带疾病信号:健康人更可能覆盖主要物体与关系,患者则可能偏离、遗漏或泛化。于是建模问题不只是把语音转成分数,而是显式度量所说内容与所见图像是否对齐。
举一个教学用的例子而非论文数据:同样一张厨房图,健康受试者可能依次提到水槽、凳子、窗外等位置关系,而患者可能只重复水杯一句话。这个例子帮助理解为何作者要引入图文相似度,但具体相似度数值与阈值必须以论文的余弦相似度与边界参数为准,不能把例子当成证据。
形式化后,每个样本由特定任务的录音、病人编号、任务标签与两个连续目标组成。只有图片描述任务有配对视觉刺激,其余任务只有音频与转录。这种非对称输入决定了后续架构必须处理缺失模态:视觉令牌在接口上保留但在非视觉任务中被完全屏蔽,以保证输入结构一致而不影响预测。
从一段录音到两个分数要走过哪些模块?
沿着一个图片描述样本走一遍有助于建立全景。手机录得的波形先重采样到 16 千赫并做幅度归一化,转录文本用 BERT 分词器分词,图片用 CLIP 处理器预处理。音频波形送入 wav2vec2 类编码器,文本送入 BERT 类编码器,图像送入 CLIP 类视觉编码器,得到维度与分布各不相同的表示。随后每个模态经过各自的可学习线性投影加层归一化,进入维度为 dmodel 的共享融合空间。
下面的导读帮助按主路径阅读最佳模型示意图,先看 3 路如何汇合,再看任务信息在何处注入,最后看回归头如何输出双分数。
看图路径: 1. 先从左到右跟踪音频经 wav2vec2、文本经 BERT、图像经 CLIP 的三条支路;2. 再看每条支路后 LinearNorm 投影块上的冻结与可训练标记如何区分;3. 接着看中间共享空间内拼接模态身份向量 a、t、v 的位置;4. 最后看右侧融合记忆加任务查询、交叉注意力、混合专家到双输出的顺序
论文图 1。原论文 Figure 1:“Schematic diagram of the best-performing experiment.”。
从像素可见的结构看,左侧 3 条支路分别标注冻结的编码器与可训练的线性归一化投影,中间紫色共享空间内每路再拼接一个模态身份向量,分别记为音频、文本、视觉。右侧融合记忆接收全部令牌,融合查询令牌定义为分类标记加任务嵌入,共同经过交叉注意力与混合专家层后分出 MoCA 与 MMSE 两个回归头。非图片描述任务的视觉分支在图中用占位符表示,对应正文中完全屏蔽的说明。这种设计把任务条件放在查询端而不是仅拼在输入端,使得同一套主干可以按任务动态读取不同模态。
编码器、投影头与融合查询各自分工是什么?
编码器层直接沿用预训练基础模型,不在本文从零训练。音频、文本、视觉各用一个基础编码器,目的是继承大规模数据学到的声学、语义与视觉表示。投影头的作用是桥接维度差异与分布差异,对令牌级表示做可学习线性投影后加层归一化。论文明确梯度更新首先集中在投影、融合与预测层,编码器初始冻结,后期只解冻少量顶层并用更低学习率微调。
预训练编码器 × 模态专用投影头: 预训练编码器负责把原始音频、文本、图像变成各自语义较强的向量,模态专用投影头负责把维度与分布不同的三者映射到同一维度 dmodel 的共享融合空间,二者搭配的原因是直接拼接原始编码器输出会因尺度不一致而难以做注意力融合,组合后新增的作用是得到可比、可拼接、可做交叉注意力的令牌序列 A、T、V。
融合部分有两种策略。晚期融合只在池化后的模态向量上操作,把音频与文本投影向量与任务嵌入拼接后送入小型多层感知机回归器,可作为简单的多模态基线。中层融合则保留令牌级交互,定义融合查询令牌为分类标记加任务嵌入,注意力记忆为音频、文本、视觉投影令牌的拼接,得到的融合表示再送回归头。视觉只在图片描述中有效,其余任务视觉令牌被屏蔽。最终阶段在融合表示上再加混合专家层以允许任务专门化。
任务嵌入 × 融合查询令牌: 任务嵌入负责告诉模型当前样本来自口头回答、复述故事、记忆词、图片描述还是朗读中的哪一种,融合查询令牌负责作为交叉注意力的查询起点去读取多模态记忆,二者搭配的原因是同一句话在不同任务中的认知含义不同,组合方式是查询令牌定义为 z0 等于 CLS 加任务嵌入,新增的作用是让同一种融合结构按任务动态调整读取音频、文本和视觉令牌的权重。
晚期融合 × 中层交叉注意力融合: 晚期融合负责把池化后的音频与文本向量投影拼接后直接送入小型多层感知机回归器,做法简单但丢失令牌级对应关系,中层交叉注意力融合负责让融合查询令牌在令牌级记忆 M 等于 A、T、V 拼接上做注意力交互,二者搭配做对照的原因是检验令牌级结构是否带来额外收益,组合意义在于论文用 E3 对比 E4 显示中层融合更好,说明保留跨模态细粒度结构有助于分数预测。
混合专家层 × 共享主干: 共享主干负责提供所有任务共用的音频文本视觉编码与融合表示,混合专家层负责在融合表示之上按任务或样本特点做专门化映射,二者搭配的原因是 5 个任务既有共性又有差异,完全共享会欠拟合任务特性,完全分开则在小样本下更易过拟合,组合后新增的作用是在保留共享表示的同时允许专家分支 specializing,从而在 E6 取得总体最优。
把 3 组关系连起来看,投影解决可比性,任务查询解决按任务读取,专家层解决任务差异化。缺少其中任何一环,都会回到要么无法对齐维度、要么所有任务共用同一读取权重、要么任务特性被平均掉的状态。
回归目标与标签条件对齐损失如何共同训练?
预测头是轻量多输出回归头,作用在融合嵌入上。主目标是带屏蔽的加权均方误差和,只对可用的目标计算,并按可用目标数归一化以保持损失尺度稳定。公式中权重、可用指示与预测误差的含义都围绕样本级监督:有些样本可能只有一个分数可用,缺失目标不应贡献梯度。目标归一化参数只在训练划分上计算,再应用于验证与测试集,避免信息泄露。
辅助目标只用于有图片与诊断标签的图片描述样本。记池化投影后的转录嵌入与图像嵌入的余弦相似度为相似度分数,对健康对照鼓励相似度接近 1,对轻度认知障碍则在相似度超过边界 m 时惩罚。总损失是主损失加系数乘以有图指示的对齐损失。论文说明辅助项的梯度更新投影头以及启用时的参数高效适配器,从而联合塑造共享嵌入几何。
下面的导读帮助理解健康人图文矩阵应有的样子:对角线对应转录与所见图片配对,非对角为错配,颜色越亮表示相似度越高。
看图路径: 1. 先确认横轴为 18 张图片、纵轴为 18 段转录文本的方阵布局;2. 再沿对角线观察高相似亮色方块是否集中连续;3. 最后对比非对角区域的背景相似度是否整体偏低
论文图 3。原论文 Figure 3:“Correlation matrix between displayed images and transcripts for an HC participant (MoCA=28, MMSE=30).”。
该健康受试者矩阵显示对角线亮色方块集中连续,MoCA 为 28,MMSE 为 30,非对角背景整体偏暗。论文同时报告轻度认知障碍受试者矩阵对角集中性较弱、分布更弥散,MoCA 为 20,MMSE 为 24。两图共同支持作者的建模假设:转录与图像一致性在两类人群中有可见差异,因此用标签条件损失去约束相似度是有行为依据的,但这仍是相关性证据而非因果证明。
图文对齐损失 × 回归主损失: 回归主损失负责让融合表示直接拟合可用的 MoCA 与 MMSE 连续目标,图文对齐损失负责约束图片描述样本中转录文本嵌入与图像嵌入的余弦相似度,二者搭配的原因是仅靠分数回归难以显式利用健康人与轻度认知障碍者在描述覆盖面上的差异,组合意义是以弱辅助正则方式塑造投影头的嵌入几何,对健康对照鼓励高相似,对患者只在相似度超过边界 m 时惩罚。
训练优化器使用 AdamW,带 5 步热身与余弦衰减,模型选择依据验证集上跨目标的平均均方根误差与平均绝对误差并做早停。需要指出的缺项是论文未报告对齐损失权重、相似度边界、专家数量与解冻层数的具体数值,复现时只能按描述做超参数搜索,不能从模型名称推定实现。
数据、任务、阶段与评估条件是什么?
数据侧的比较问题是不同任务是否在同一病人划分与同一指标下比较,公平条件是病人级五折交叉验证与目标归一化只用训练集统计量。指标方向是均方根误差与平均绝对误差越低越好,聚合方式是当测试病人有多个样本时先按病人与目标平均预测再计算误差,并同时报告总体与分任务结果。统计上用方差分析检验任务间差异。
下表整理受试者构成与分数分布,阅读时注意轻度认知障碍占多数带来的回归偏向风险。
| 条件 | 指标 | 样本量 | 均值 | 离散度 |
|---|---|---|---|---|
| 全队列 | 年龄 | 88 人 | 61.34 岁 | 标准差 11.53 岁 |
| 全队列 | 性别 | 88 人 | 女 43 男 45 | 计数 |
| 全队列 | MoCA 分数 | 88 人 | 23.82 分 | 标准差 4.14 分 |
| 全队列 | MMSE 分数 | 88 人 | 26.85 分 | 标准差 3.64 分 |
| 分组 | 轻度认知障碍 | 69 人 | 含多种病因亚型 | 计数 |
| 分组 | 健康对照 | 19 人 | 神经系统健康 | 计数 |
表后需要强调的是年龄跨度大且健康对照仅 19 人,模型很容易学到多数群体的分数区间。论文因此聚焦回归而非分类,并在病人级别划分以防同一人录音同时出现在训练与测试中。硬件预算与推理延迟在原文中未报告,这是后续部署评估的缺项。
下表整理 5 个任务的刺激数量与视觉条件,阅读时注意只有图片描述提供配对图像。
| 任务代号 | 任务内容 | 刺激数量 | 音频 | 配对图像 |
|---|---|---|---|---|
| AV 口头回答 | 回答屏幕问题 | 18 段文本 | 有 | 无 |
| MA 复述故事 | 听故事后复述 | 13 段故事 | 有 | 无 |
| MW 记忆词 | 记忆 3 词后复述 | 9 组三元词 | 有 | 无 |
| PD 图片描述 | 描述屏幕图片 | 18 张图像 | 有 | 有 |
| RA 朗读 | 朗读屏幕文本 | 13 段文本 | 有 | 无 |
表后解释是所有任务都提供音频并附带 Whisper Large 第三版生成的转录,文本质量因此依赖识别准确率。任务刺激在研究期间统一展示,保证同一任务内刺激可比,但不同任务的认知负荷本就不同,所以跨任务误差差异不能直接解读为模型好坏,还包含任务本身难度差异。
从声学基线到混合专家误差下降了多少?
主结果要回答的比较问题是阶段式增强是否在可运行策略下逐步降低总体误差,公平条件是同一病人级交叉验证与同一聚合口径,指标方向是均方根误差越低越好。论文按 E0 到 E6 组织:声学特征加多层感知机基线、冻结 wav2vec2 音频单模态、冻结 BERT 文本单模态、音频文本晚期融合、任务条件中层融合、仅图片描述加视觉令牌、再加标签条件对齐、最后加混合专家。
下面的导读帮助阅读总体误差曲线,先看阶段顺序,再看双曲线的相对位置,最后看误差棒变化。
看图路径: 1. 先确认横轴为 E0 到 E6 的阶段顺序、纵轴为均方根误差;2. 再比较蓝色 MoCA 曲线与紫红 MMSE 曲线的相对高低;3. 最后观察每个阶段误差棒随阶段推进是否收窄
论文图 4。原论文 Figure 4:“Aggregate RMSE across experiments for MoCA and MMSE prediction. Error bars denote standard deviation across folds.”。
从像素可见,两条曲线都随阶段单调下降,蓝色 MoCA 始终高于紫红 MMSE,误差棒在 E0 处最宽,随后收窄。论文报告 E6 总体最低,MoCA 为 2.49,MMSE 为 2.14,从 E0 到 E6 分别从 3.74 降到 2.49 与从 2.97 降到 2.14。中间模型也呈现渐进下降。文本单模态优于音频单模态,支持语义与词汇信息与分数变异更直接相关的判断,但这是在所研究任务与波兰语数据上的有限解释。
下表把总体与图片描述任务的关键数字放在同一口径下,阅读时注意总体与分任务不可混比。
| 评估范围 | 指标 | E0 起点 | E6 终点 | 图片描述 E6 |
|---|---|---|---|---|
| 总体聚合 | MoCA 均方根误差 | 3.74 分 | 2.49 分 | 2.11 分 |
| 总体聚合 | MMSE 均方根误差 | 2.97 分 | 2.14 分 | 1.84 分 |
| 图片描述 | MoCA 均方根误差 | 未单独报告 | 未单独报告 | 2.11 分 |
| 图片描述 | MMSE 均方根误差 | 未单独报告 | 未单独报告 | 1.85 分 |
| 图片描述 | 跨折标准差 | 未单独报告 | 未单独报告 | MoCA0.03 分 MMSE0.08 分 |
表后解释是最大收益出现在图片描述任务,E6 在该任务达到 MoCA 约 2.11 与 MMSE 约 1.84 到 1.85,摘要中标准差为正负 0.03 与正负 0.08。需要注意正文一处写 1.84 而摘要写 1.85,属于同一量级的不同修约呈现,复现时应以自己按病人聚合的代码为准并报告保留精度。总体趋势不等于每折都成立,误差棒仍显示折间波动。
哪一段改进来自融合策略,哪一段来自视觉接地?
消融要回答的是每个组件的增量是否可归因,比较条件是同一任务划分下 E3 对比 E4、E5a 对比 E5b、E5 对比 E6。指标方向仍是越低越好。论文报告 E3 到 E4 显示任务条件中层融合优于晚期融合,说明令牌级交互保留了有用的跨模态结构。E5a 加入视觉令牌,E5b 再加标签条件对齐后进一步改善,E6 加混合专家后达到总体最优。
下面的导读帮助阅读分任务曲线,重点看图片描述与其他任务的分离时机。
看图路径: 1. 先在上下面板分别确认 MoCA 与 MMSE 两套纵轴范围不同;2. 再跟踪红色图片描述曲线在 E5a 到 E5b 段的下降斜率;3. 最后对比黑色朗读曲线是否在多数阶段处于最高位置
论文图 5。原论文 Figure 5:“Task-wise RMSE across experiments for MoCA (top) and MMSE (bottom).”。
从像素可见,上下面板各有 5 条任务曲线,横轴为 E1 到 E6。红色图片描述曲线在 E5a 后明显下探并与其他曲线拉开差距,黑色朗读曲线在多数阶段处于最高,蓝色口头回答曲线接近图片描述但始终略高。粉色星号表示每阶段内全任务方差分析显著,绿色星号表示图片描述跨阶段显著,后期多为三颗星即 p 小于 0.001。论文还量化图片描述相对 E1 的 MoCA 下降达 1.34,大于复述故事的 0.95,支持视觉接地的任务特异性。
未胜出项同样重要:朗读任务误差最高,E6 仍为 MoCA2.79 与 MMSE2.35;口头回答次优,E6 为 2.43 与 2.12。这说明需要朗读固定文本的任务提供的自发语义较少,模型难以从中估计认知分数。非视觉任务在各阶段也有稳定改进,但改进幅度小于图片描述,这是视觉只在图片描述中可用的自然结果,也划定了方法的适用边界。
哪些结论现在还不能下?
论文明确报告的局限包括队列较小且仅为波兰语受试者,可能限制泛化;临床分数测量频率低于录音频率,使得样本级监督相对粗糙;性能依赖语音识别质量;视觉接地只适用于图片描述;虽用病人级交叉验证减少泄露,但仍缺独立队列的外部验证。作者建议未来在类似 DementiaBank 协议的独立队列上验证,并加强纵向与病人级聚合以及预测不确定性量化。
从学习依赖看,还有三点不能过度推广。第一,相关性不是因果,图文相似度差异支持建模但不能证明描述覆盖面导致分数变化。第二,总体误差下降不等于每组每步都成立,折间标准差与任务差异表明某些病人或任务上仍可能波动。第三,未测量误判率、延迟与成本,不能承诺这些量得到改善,训练资源与推理开销在原文中也未给出。
另一个需要保留的细节是资源可达性。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。复现者应按论文文字重建管线,而不是假设存在可下载权重。
要复现这条管线先做什么?
第一步重建数据口径:按病人划分五折,目标归一化参数只用训练折计算,测试时同一病人多样本先平均预测再算误差,同时报告总体与分任务的均方根误差与平均绝对误差。音频重采样到 16 千赫并幅度归一化,文本用 BERT 分词器,图片描述图像用 CLIP 处理器,转录统一用 Whisper Large 第三版生成以保持与原文一致。
第二步按阶段搭建模型:先跑声学特征加多层感知机、冻结音频编码器、冻结文本编码器 3 个单模态基线,再做晚期融合与任务条件中层融合对照,然后只在图片描述中加入视觉令牌并屏蔽其余任务的视觉输入,接着加入标签条件图文对齐损失,最后在融合表示上加混合专家。编码器先冻结,只训练投影、融合与预测,后期解冻少量顶层并降低学习率,优化器用 AdamW 加 5 步热身与余弦衰减,早停依据验证集跨目标平均误差。
第三步补齐缺失验证:搜索对齐损失权重、相似度边界、专家数等未报告超参数;检查语音识别错误对文本分支的影响;在条件允许时引入独立队列做外部验证,并记录训练时长、推理延迟与按病人的误差分布,避免只报告平均误差。
何时值得尝试这套方法?
当任务包含看图说话且能拿到配对图片与诊断标签时,这套任务条件融合加标签约束对齐值得尝试,因为图片描述在本文中给出最低误差且视觉接地带来任务特异性增益。当只有朗读或固定问答而缺乏自发语义时,预期收益会小,论文中朗读误差最高就是直接提醒。
复现的最小可运行集合应包括文本单模态、晚期融合、中层融合 3 个对照,否则无法判断增量来源。若只能跑一个消融,优先保留是否加入视觉与是否加入对齐损失的对比,因为这是本文区别于纯语音文本基线的核心。
还需补的验证是跨语言、跨设备与纵向稳定性,以及不确定性估计以识别低置信预测。总体上,本文支持在异构认知评估中使用任务感知多模态融合与选择性视觉接地,但结论目前限于单中心波兰语小样本与内部交叉验证,外部推广仍待验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



