不追求更像人脸,而是生成对判别更有用的视觉特征:跨模态引导的抑郁识别训练框架
针对临床访谈数据少导致视觉编码器学不好,该工作用音频文本为条件合成视觉特征并与识别器联合优化,在 DAIC-WOZ 上 F1 达到 0.86、在 E-DAIC 上 CCC 达到 0.69,代价是依赖词级对齐与端到端联合训练的复杂度。
针对临床访谈数据少导致视觉编码器学不好,该工作用音频文本为条件合成视觉特征并与识别器联合优化,在 DAIC-WOZ 上 F1 达到 0.86、在 E-DAIC 上 CCC 达到 0.69,代价是依赖词级对齐与端到端联合训练的复杂度。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该研究针对波兰儿童浊卷舌擦音发音部位分类,用支持向量机比较梅尔倒谱、谱描述子、摩擦噪声与新提出谱比值特征及多种特征选择方法,最强证据是梅尔倒谱加谱描述子加谱比值配合套索选择达到灵敏度 0.72 与特异度 0.81,代价是小样本与类别不平衡下的稳定性仍需更多验证。
该文把轻量语音转文本后的饼干失窃描述转成词共现图,用两层图卷积区分阿尔茨海默症与健康人,在 ADReSS-o 上主体词图达到 88.73%、精炼版 90.14%,代价是词表依赖该图片描述任务且只用文本模态。
该文在 AVEC2014 上用固定的两层感知机隔离融合设计的影响,以线性加权平均管模态可靠性、有序加权平均管特征显著性做向量保留式联合加权,在分类取得 85.7% 准确率与 0.88 的 AUC、回归取得 8.1 的均方根误差与 0.44 的一致性相关系数的同时,在 0 分贝强噪声下仍保持相对可控的退化,代价是可靠性打分依赖的信号质量指示与排序后权重构造细节 …
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文用固定文字、只改声音的合成对照测音频语言模型能否把可听症状用于分诊,最强证据是高风险声音配安心文字时多数模型仍跟文字走,而代价是大量平局与无效输出且声学敏感度随疾病和模型剧烈波动。
针对神经退行性疾病语音监测中临床量表噪声大与小数据难复用的问题,论文提出只要求预测分数服从样本间排序的比较器损失,在仅用自报三级标签训练的条件下得到与 ALSFRS-R 等未见标注相关的严重度分数,其代价是分数绝对值无标定且对录音条件偏移敏感。
该工作用自发语音同时检验阿尔茨海默病淀粉样蛋白阳性预测与原发性进行性失语三分类,对比拼接加注意力池化的 DMHAM 与词级对齐加门控交叉注意力的 CogniAlign,最强证据是西班牙语 SPIN 队列上 CogniAlign 加手工声学特征达到淀粉样预测准确率 83.86%,代价是 PPA 小样本三分类不稳定且手工特征在不同任务上时而冗余时而互补。
针对 HeyJay!数据集的三级构音障碍严重程度分类问题,论文用冻结的 wav2vec 2.0 Large XLSR-53 做特征提取加约 67000 参数的可训练解码器,在说话人独立五折交叉验证下取得话语级准确率 64.6%、说话人级准确率 80.2%,代价是中度与重度边界仍存在与专家分歧同构的混淆。
针对看图说话中词汇语义与发音 timing 互补但贡献不均的问题,LAPE 以大语言模型文本表示为锚,把停顿与拖长写进转写并做事件保持组块与门控融合,在 ADReSS 与 ADReSSo 的五折与留一被试评估中均取得最高准确率,代价是依赖词时间戳与多路语音特征的完整流水线。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对呼吸音频编码与临床文本编码语义不兼容的问题,RespiraMFM 采用先对比训练投影器再冻结做指令微调的两阶段结构,在九个呼吸疾病任务上报告了监督平均 AUROC 0.823 与零样本平均 AUROC 0.738,代价是依赖症状元数据质量且小病种评测样本较少。
针对整段临床对话只有一个会话级标签且病理性表现稀疏不均匀的问题,该工作用会话级聚合、片段级伪标签与帧级一致性三层联合的纯音频半监督框架学习,在中英文抑郁与阿尔茨海默数据上以极少标注逼近全监督,并以消融与伪标签演化分析揭示收益与代价。
SLAP 针对语音中人口学、嗓音质量与健康属性难以零样本推断的问题,选择用大语言模型把异构元数据转写为自然语言描述再与语音做对比学习,最强证据是 38 个二分类任务上零样本平均 F1 达到 62.9%,代价是预训练数据仍不均衡且小测试集任务波动大。
该研究用 62 名巴西受试者的持续/a/元音检验特纳综合征是否存在可测声学偏离,发现 F1-F3 中心趋势和 shimmer 系统性偏低并用树集成模型得到 AUC 在 0.70-0.75 到 0.821 左右的初步判别,但仅 19 例患者且只用单一元音任务,尚不能作为临床筛查依据。
针对仅用咳嗽声会丢掉年龄症状等背景风险、简单拼接又学不到两者配合的问题,DeepGB-TB 用表格概率嵌入加一维卷积做两路表示、双向交叉注意力做相互提炼、漏诊加权损失压低假阴性,在 1105 例七国数据上报告 AUROC 0.903 与 F1 0.851,代价是依赖回顾性病例对照数据与特定预处理和调参条件。
针对卒中后构音障碍的交替与顺序轮替发音任务,CLINIC 用临床可解释声学特征联合频谱与自监督语音表示做三级严重度分类并用 Shapley 值归因,GENIE 再用检索到的相似病例生成韩文四维度解释,报告显示平衡准确率 0.952 且重度召回 1.000,专家保真度 4.94,但重度样本少且仅覆盖任务化语音。