论文解读

把共有的病和各自的信号分开:DIVINE 的多模态解耦评估

针对口面部神经疾病的音视频联合诊断与严重度估计问题,DIVINE 用分层变分瓶颈分离共享与私有表征并做稀疏门控融合,在 Toronto NeuroFace 上以 DeepSeek-VL2 加 TRILLsson 达到双模态高精度,但缺模态与跨库泛化仍受限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9146 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

去掉语言可预测成分后跨语言帕金森检测为何能找回灵敏度

针对目标语言只有健康人语音时分类器把目标语言当成健康信号的问题,论文用健康人拟合的岭回归残差去除语言可预测成分,在 5 个骨干、3 个任务、3 个目标语言上把平均 F1 从 0.52 提升到 0.87,但语言信息并未完全消除且评估仍限于印欧语系。

 · 更新于 2026-09-24 · 约 20 分钟 · 9640 字 阅读 →
论文解读

不对概率取平均,对名次取平均:用排序聚合绕开跨模态置信度量纲

针对声学与语义分类器后验概率量纲不可比的问题,该工作用训练集留一法分布下的百分位名次代替原始概率做平均,并在高置信度分歧时才允许手工语言特征随机森林覆写,在 ADReSS2020 取得 95.83% 准确率、在 ADReSSo2021 取得 90.14% 准确率,代价是需要保留训练侧分布与多组逻辑回归分支并做前向选择。

 · 更新于 2026-09-24 · 约 20 分钟 · 9825 字 阅读 →
论文解读

临床抑郁评估:行为信号能判病,大模型推理为何还差一截

论文用 169 人临床确诊的多任务多模态数据比较任务与模态的判别力,并测试大模型精神科推理,报告音频与视频最有效、图片描述最能诱发标记、知识引导可提升约 10 个百分点 Macro-F1,但文本大模型仍落后于监督判别模型。

 · 更新于 2026-09-24 · 约 17 分钟 · 8236 字 阅读 →
论文解读

不发原声原脸如何做青少年抑郁焦虑压力筛查:AdoDAS 的隐私接口与双赛道设计

AdoDAS 在不分发未成年人原始音视频的前提下提供 6000 人四会话的匿名化表征与文本,要求在隐藏测试集上完成 D/A/S 二分类筛查与 21 项 DASS-21 序数预测,音视频基线均值 F1 为 0.4604、均值 QWK 为 0.2675,最优提交分别达到 0.5921 和 0.2776,但提升主要来自时序多模态与跨会话建模而非原始编码器规模。

 · 更新于 2026-09-24 · 约 21 分钟 · 10035 字 阅读 →
论文解读

线性拼接已够好时,注意力还能补什么:BioSync 的宽深融合与合成验证

BioSync 用多头自注意力建模模态间交互并并联线性拼接分支,在两个合成队列上以认知队列 AUC 0.928 和代谢队列准确率 0.764 为最强证据,代价是干净数据优势微弱且临床推断仍待真实队列验证。

 · 更新于 2026-09-24 · 约 17 分钟 · 8124 字 阅读 →