浅融合不够,深融合又乱:跨空间协同如何同时管表示与梯度
针对对话多模态情感识别中高阶跨模态交互不足与多目标梯度冲突问题,论文用模态特异低秩多项式融合做表示、用三目标帕累托梯度协调做优化,在 IEMOCAP 上报告 75.42% 准确率、在 MELD 上报告 68.47% 准确率,代价是每轮训练比单分支基线多约 0.66s 的小规模二次规划开销。
针对对话多模态情感识别中高阶跨模态交互不足与多目标梯度冲突问题,论文用模态特异低秩多项式融合做表示、用三目标帕累托梯度协调做优化,在 IEMOCAP 上报告 75.42% 准确率、在 MELD 上报告 68.47% 准确率,代价是每轮训练比单分支基线多约 0.66s 的小规模二次规划开销。
针对仅用咳嗽声会丢掉年龄症状等背景风险、简单拼接又学不到两者配合的问题,DeepGB-TB 用表格概率嵌入加一维卷积做两路表示、双向交叉注意力做相互提炼、漏诊加权损失压低假阴性,在 1105 例七国数据上报告 AUROC 0.903 与 F1 0.851,代价是依赖回顾性病例对照数据与特定预处理和调参条件。
论文针对多模态 token 与文本从第 0 层共同走完全部语言模型层造成的算力负担,提出仅让文本走完全程而把多模态 token 直接送入中间层的 DeepInsert,并在视觉、音频、分子模态中显示第 4 层插入可持平基线,而更深插入可用可接受回落换取推理加速。
针对卒中后构音障碍的交替与顺序轮替发音任务,CLINIC 用临床可解释声学特征联合频谱与自监督语音表示做三级严重度分类并用 Shapley 值归因,GENIE 再用检索到的相似病例生成韩文四维度解释,报告显示平衡准确率 0.952 且重度召回 1.000,专家保真度 4.94,但重度样本少且仅覆盖任务化语音。
针对口面部神经疾病的音视频联合诊断与严重度估计问题,DIVINE 用分层变分瓶颈分离共享与私有表征并做稀疏门控融合,在 Toronto NeuroFace 上以 DeepSeek-VL2 加 TRILLsson 达到双模态高精度,但缺模态与跨库泛化仍受限。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
该研究用音画同步选出说话人、用文本教师蒸馏音频与视觉图网络、再用分层注意力与组合损失做融合,在 MELD 达到 67.75% 加权 F1、在 IEMOCAP 达到 72.44% 加权 F1,代价是引入更多超参数与调参负担。
该文把语音驱动的人脸运动看作情绪条件下的运动隐空间分布,用正交运动字典加情绪子空间保留发音与情感耦合,再用逐层跨注意力融合音频与情绪去调制流匹配速度场,在 MEAD 上取得 82.05% 情绪准确率与 22.58 dB PSNR 并以十步采样实现实时推理,代价是仅覆盖英语与七类基本情绪且对大角度头部转动验证不足。
针对音频频谱 token 远多于文本导致多模态 MoE 路由崩塌的问题,CoPRIME 用对比学习加 ELBO 路由与熵正则做音频文本对齐,在 MOSEI 和 IEMOCAP 零样本与少样本情绪任务上超过稠密与 LIMoE 式基线,代价是引入对比加 ELBO 加四个辅助损失共六项损失与两个权重的调参负担。
针对全局视觉条件丢失局部发声细节的问题,SS2A 用检测与跨模态翻译感知多模态声源,经单声源对比流形解歧义再用注意力混合生成,论文报告其在图像到音频的相关性与多源配比上占优,代价是依赖检测质量与预训练生成器且需单源数据训练。
针对文本、参考图像与音频难以协同且三元完备数据稀缺的问题,HuMo 用非完备互补数据加两阶段渐进训练实现统一控制,在主体保持与音画同步子任务上报告了超越专用基线的分数,代价是仍需两阶段 40k 步训练与分段推理引导配置。
针对大音频语言模型时间定位不准、长音频难以端到端理解的问题,TimeAudio 用时间标记加绝对时间编码加分段令牌合并,并在 FTAR 时间任务数据上微调,在密集描述、定位与时间线摘要上报告了定位精度的提升,但密集描述的文本多样性仍有代价与边界。
针对视觉对话回复正确但不吸引人的问题,该研究用情感感知语音合成补齐音频上下文并以交错文本音频序列建模,配合三项预热任务与多模态参与度评估,在两个数据集上报告了语法与参与度两方面的提升,但合成音频的计算代价与真实人声泛化仍待验证。
针对音频与文本同质、视觉与二者异质的问题,MDF 只对音频做文本剥离得到声音分量,再用正交约束强化异质并用标签导出的贡献监督权重生成器,在 CMU-MOSI 上取得 MAE 0.692 等最好或次好结果,但视觉增益与权重估计仍受单模态预测误差限制。
针对自由文本到 MIDI 语义对齐不足与调号速度拍号结构失配问题,MIDILM 采用前缀条件加共享掩码自注意力与文本 MLP 加 MIDI 混合专家双路前馈,在 MidiCaps 上相对最强基线在 CLAP 到 TB 上提升 6.07% 到 144.77%,代价是调性建模仍弱且复杂转调下降,未公开代码链接当前不可用。
针对同音替换、字形拆解、缩写与中英混写等伪装使纯文本失效的问题,MMBERT 把文本、合成语音与字形图像经对齐器送入共享自注意力加混合专家结构,并用三阶段渐进训练稳定优化,在 ToxiCloakCN 上报告 F1 为 95.2,代价是依赖合成多模态输入与较重的分阶段调参。
该研究把多方桌游对话切成保持或让渡的 2 分类问题,用文本加音频加语义手势的混合专家模型求解,最强证据是 3 模态融合在语义监督下取得更高的宏平均 F1,代价是标注一致性中等且领域局限于游戏对话。
论文把音乐诱发绘画评估定义为直接预测感知一致性分数,用音乐调制视觉的 MPJudge 结合回归与偏好优化学习,在自建专家标注集上报告 SRCC 0.86 与 MAE 0.04,代价是更大的绘画编码器与对专家标注的依赖。
M2M 只用英文文本训练 2 个线性层完成多语言到多模态的映射,在 XTD 上英文达到 94.9% 的 Recall@10 而 11 个语言平均为 89.5%,代价是生成保真度和超大检索库上的差距仍然存在。
针对单模态指令在相似物体环境中易歧义的问题,论文提出 MINav 任务与 NaVLA2 个模型,用空间语义双分支音频编码与边想边做解码实现多模态接地,最强证据是在 MINav 上达到 27.2% 成功率与 19.6% 路径加权成功率,代价是仍需三阶段训练与连续仿真渲染。