acl-2026 论文深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对神经退行性疾病语音监测中临床量表噪声大与小数据难复用的问题,论文提出只要求预测分数服从样本间排序的比较器损失,在仅用自报三级标签训练的条件下得到与 ALSFRS-R 等未见标注相关的严重度分数,其代价是分数绝对值无标定且对录音条件偏移敏感。
该工作用自发语音同时检验阿尔茨海默病淀粉样蛋白阳性预测与原发性进行性失语三分类,对比拼接加注意力池化的 DMHAM 与词级对齐加门控交叉注意力的 CogniAlign,最强证据是西班牙语 SPIN 队列上 CogniAlign 加手工声学特征达到淀粉样预测准确率 83.86%,代价是 PPA 小样本三分类不稳定且手工特征在不同任务上时而冗余时而互补。
针对看图说话中词汇语义与发音 timing 互补但贡献不均的问题,LAPE 以大语言模型文本表示为锚,把停顿与拖长写进转写并做事件保持组块与门控融合,在 ADReSS 与 ADReSSo 的五折与留一被试评估中均取得最高准确率,代价是依赖词时间戳与多路语音特征的完整流水线。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对呼吸音频编码与临床文本编码语义不兼容的问题,RespiraMFM 采用先对比训练投影器再冻结做指令微调的两阶段结构,在九个呼吸疾病任务上报告了监督平均 AUROC 0.823 与零样本平均 AUROC 0.738,代价是依赖症状元数据质量且小病种评测样本较少。
针对整段临床对话只有一个会话级标签且病理性表现稀疏不均匀的问题,该工作用会话级聚合、片段级伪标签与帧级一致性三层联合的纯音频半监督框架学习,在中英文抑郁与阿尔茨海默数据上以极少标注逼近全监督,并以消融与伪标签演化分析揭示收益与代价。
SLAP 针对语音中人口学、嗓音质量与健康属性难以零样本推断的问题,选择用大语言模型把异构元数据转写为自然语言描述再与语音做对比学习,最强证据是 38 个二分类任务上零样本平均 F1 达到 62.9%,代价是预训练数据仍不均衡且小测试集任务波动大。
该研究用 62 名巴西受试者的持续/a/元音检验特纳综合征是否存在可测声学偏离,发现 F1-F3 中心趋势和 shimmer 系统性偏低并用树集成模型得到 AUC 在 0.70-0.75 到 0.821 左右的初步判别,但仅 19 例患者且只用单一元音任务,尚不能作为临床筛查依据。
针对仅用咳嗽声会丢掉年龄症状等背景风险、简单拼接又学不到两者配合的问题,DeepGB-TB 用表格概率嵌入加一维卷积做两路表示、双向交叉注意力做相互提炼、漏诊加权损失压低假阴性,在 1105 例七国数据上报告 AUROC 0.903 与 F1 0.851,代价是依赖回顾性病例对照数据与特定预处理和调参条件。
针对目标语言只有健康人语音时分类器把目标语言当成健康信号的问题,论文用健康人拟合的岭回归残差去除语言可预测成分,在 5 个骨干、3 个任务、3 个目标语言上把平均 F1 从 0.52 提升到 0.87,但语言信息并未完全消除且评估仍限于印欧语系。
针对声学与语义分类器后验概率量纲不可比的问题,该工作用训练集留一法分布下的百分位名次代替原始概率做平均,并在高置信度分歧时才允许手工语言特征随机森林覆写,在 ADReSS2020 取得 95.83% 准确率、在 ADReSSo2021 取得 90.14% 准确率,代价是需要保留训练侧分布与多组逻辑回归分支并做前向选择。
BioSync 用多头自注意力建模模态间交互并并联线性拼接分支,在两个合成队列上以认知队列 AUC 0.928 和代谢队列准确率 0.764 为最强证据,代价是干净数据优势微弱且临床推断仍待真实队列验证。
医疗音频 | 7.5/10
语音生物标志物 | 6/10
语音生物标志物 | 7.2/10
语音生物标志物 | 5.4/10
语音生物标志物 | 1.0/10
语音生物标志物 | 8.0/10
语音生物标志物 | 7.0/10