急救电话里的情绪不等于病情:27 项语音辅助分诊研究的任务、证据与落地差距
该综述按 PRISMA 筛出 2014-2025 年 27 项急救电话语音研究,发现 78% 做呼叫优先级排序且近半依赖情绪识别,但仅 7 项评估临床或运行影响、14 项依赖模拟语料,说明算法性能不等于分诊可用性。
该综述按 PRISMA 筛出 2014-2025 年 27 项急救电话语音研究,发现 78% 做呼叫优先级排序且近半依赖情绪识别,但仅 7 项评估临床或运行影响、14 项依赖模拟语料,说明算法性能不等于分诊可用性。
针对对话情感识别中随机缺失模态导致语义不一致与模态冲突,论文用掩码超图注意力为扩散恢复提供条件并用特征源与判别双通道估计不确定性做证据融合,在缺失率 0.0 至 0.7 下保持最高准确率,代价是两阶段训练与 300 步扩散采样开销。
针对语言、视觉、声音互相冲突时融合不可靠的问题,CICA 先让每个单模态编码器输出置信度和不确定度,再用它们调制融合注意力,在 MOSI 上报告 MAE 0.630 和 Corr 0.855、在 MOSEI 上报告 MAE 0.489 和 Corr 0.856,代价是需要两阶段训练并保留互信息正则以防止文本主导时压垮其他模态。
针对类别标签难表混合情绪、维度分数难直观解释的问题,该研究把日语表演性情绪语音标注为色相、饱和度、明度并用回归直接预测,留一说话人交叉验证下多任务学习在色相角误差约 29.7 度、饱和度与明度一致性相关系数约 0.560 与 0.803、六分类准确率 90.8% 上同时优于单任务,但结论限于表演性日语与小规模众包标注条件。
针对同一视频中语言、视觉、音频情感极性不一致时相似性对齐会扭曲共享语义的问题,论文提出冲突感知自适应交叉重构 CACR,用共享空间冲突分数加权交叉重构实现隐式对齐并以视听线索精炼文本,在 MOSI 上报告 ACC7 为 48.69、ACC2 为 87.04,代价是需要多组重构解码器与多项正则损失协同训练。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对视觉听觉情绪线索稀疏且时间不同步导致隐式融合稀释与纠缠的问题,EmoThinker 用结构化 token 选择提纯面部与声音证据并用 CoET 数据集做分步推理,在 DFEW 等基准上报告了最高分,但背景丢弃与长尾类别仍带来代价与不稳定。
针对文本主导、音频视觉被压制且噪声鲁棒性差的问题,EBMC 用解耦加补偿先增强弱模态、再用能量协调与样本级信任蒸馏拉平贡献,在 MOSI/MOSEI/IEMOCAP 上取得可复述的提升,代价是两阶段多损失联合调参与额外蒸馏计算。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文在五个语音情绪数据集上零样本评测 Qwen2-Audio 并用多组多类公平指标审计,发现其总体预测分布较均衡但总体准确率平等性差距大,且解码温度超过 0.7 会同时损害准确率与公平性。
论文提出第一人称自我情绪追踪任务,用 110 小时智能眼镜数据的开放词表时间线与五任务基准支撑 OSIRIS 模型,该模型以对话历史加情绪记忆加分步推理取得领先,但仍受日常社交场景与文化覆盖限制。
针对可学习查询缺乏显式情感语义的问题,论文用固定数量的多模态情感原型作软提示并冻结大模型主干,在四个数据集和三种大模型上取得可复述的精度提升,而可训练参数仅占极小比例。
该文以固定 Wav2Vec2-XLSR 基线检验语系分组对跨语言语音情感识别的影响,最强证据是同语系内留一语言泛化优于跨语系泛化,而代价是跨语系直接迁移大幅掉点且受数据量与标注不一致制约。
针对只有全局共有与单模态私有两类表示会漏掉仅在两个模态之间成立的情感协同的问题,论文把表示分成公共、两两共享、私有三路并用子空间感知交叉注意力融合,在对齐与非对齐条件下报告了更低的平均绝对误差与更高的细粒度准确率,代价是更多分支与正则项需要逐项验证。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。
针对声音匿名化中情感保留被硬标签平均召回低估不确定性的问题,该研究把语音情感识别输出换成概率与对数值并比较原始与匿名化嵌入距离,用 23 人 MUSHRA 主观评分为准,发现概率向量欧氏距离与人耳判断高度相关且不再依赖真值标注,但属性预测表示仍弱于类别表示。
针对全模态情感推理中模型过度依赖视觉而忽视声音与文本的模态坍缩问题,该工作用带引导词的结构化推理数据做冷启动,再用基于引导词熵的奖励做强化学习校准模态使用,在四个情感基准上取得多项最优并保留通用能力,代价是对极端长尾类别与强模态冲突仍敏感。
针对对话中模态缺失切断细粒度跨模态因果链的问题,CaM-HG 采用先由历史条件混合专家补全再由非对称因果动态超图挖掘的路线,在 IEMOCAP 等 3 套基准上报告了高缺失率下更慢的衰减,但连续极端缺失与结构因果解耦仍是边界。