论文解读

二分容器装不下成对线索:用三子空间为模态对单独留位置

针对只有全局共有与单模态私有两类表示会漏掉仅在两个模态之间成立的情感协同的问题,论文把表示分成公共、两两共享、私有三路并用子空间感知交叉注意力融合,在对齐与非对齐条件下报告了更低的平均绝对误差与更高的细粒度准确率,代价是更多分支与正则项需要逐项验证。

 · 更新于 2026-09-25 · 约 20 分钟 · 9615 字 阅读 →
论文解读

人声与人脸为何总对不上:用不对称时间窗口重建音画同步

针对以人为中心联合生成中唇同步偏差与语义情绪脱节,UniAVGen 采用对称双分支加不对称跨模态交互、面部感知调制与模态感知引导实现单模型多任务生成,论文报告在更少联合样本下取得音色与情绪一致性优势,同时存在主体一致性未胜出与大模型打分客观性不足等边界。

 · 更新于 2026-09-25 · 约 20 分钟 · 9864 字 阅读 →
论文解读

同步声画为何难评:VABench 用三任务十五维卡住语义与对齐

针对带同步音频的视频生成缺乏联合评测的问题,VABench 用文本到声画、图像到声画与立体声三类任务和专家加多模态大模型的十五维评估组织测试,报告显示端到端音视频模型在对齐与细粒度问答上占优而语义同步真实感难以兼得,且立体声空间分离均不可靠。

 · 更新于 2026-09-25 · 约 19 分钟 · 9429 字 阅读 →
论文解读

不只看脸像不像:用生成器内部的声音嘴型对齐信号抓伪造

针对跨生成器泛化难的问题,论文用音频条件扩散模型的 DDIM 反演重建差异与音频视觉交叉注意力做双路检测,在 MMDF 未见生成器与外部基准上取得领先,但单次反演约一分钟的计算开销是主要代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9407 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 433 分钟 · 216709 字 阅读 →
论文解读

用引导词把视觉听觉拉回同一条推理链:OmniCoT 与动态模态熵

针对全模态情感推理中模型过度依赖视觉而忽视声音与文本的模态坍缩问题,该工作用带引导词的结构化推理数据做冷启动,再用基于引导词熵的奖励做强化学习校准模态使用,在四个情感基准上取得多项最优并保留通用能力,代价是对极端长尾类别与强模态冲突仍敏感。

 · 更新于 2026-09-25 · 约 19 分钟 · 9477 字 阅读 →
论文解读

补上时间细节:让多模态大模型重新看清唇动的前后变化

针对多模态大模型做音视频语音识别时视觉时间建模粗糙且深层解码逐渐丢失时序的问题,论文用编码端时间感知注意力和解码端分层时间 token 堆叠来补时间信息,在 LRS2 与 LRS3 上把纯视觉识别词错率做到更低,代价是只在英语离线句子级条件下验证且增加了投影与注意力模块的开销。

 · 更新于 2026-09-25 · 约 17 分钟 · 8351 字 阅读 →
论文解读

静态特质约束动态偏见:CMTD 用认知建模做多模态对话情绪识别

CMTD 针对纯文本与浅层推理在对话情绪识别中误判复杂思维模式的问题,用多智能体分别提取大五人格特质、四步认知扭曲、表情与语音描述再融合预测,在 MELD 与 IEMOCAP 零样本条件下报告优于同条件基线的准确率,同时以多轮大模型调用带来明显更高的时间与费用开销。

 · 更新于 2026-09-25 · 约 16 分钟 · 7691 字 阅读 →
论文解读

可变形状态空间如何盯住稀疏而模糊的伪造边界

针对音视频时间伪造定位中边界模糊、伪造稀疏和长距离衰减问题,DeformTrace 用可变形自扫描、中继令牌与可变形交叉扫描改造状态空间模型,在 LAV-DF 与 AV-Deepfake1M 上取得精度与效率优势,但依赖冻结特征与固定超参数组合。

 · 更新于 2026-09-25 · 约 17 分钟 · 8507 字 阅读 →
论文解读

自然互动与多粒度标注:EmotionTalk 如何让中文情感可训练又可解释

EmotionTalk 用 19 名演员主题即兴的 23.6 小时双人对话同时给出 7 类离散标签、连续强度与四维说话风格描述,并以单模态、多模态融合与生成式描述三类基准验证了跨模态不一致带来的难度与融合的必要性。

 · 更新于 2026-09-25 · 约 19 分钟 · 9210 字 阅读 →
论文解读

长视频里听懂人:LongInsightBench 为何同时考定位、排序与因果

论文针对以人为中心的长视频多模态理解,构建约 1001 个视频与 4781 个问答的 LongInsightBench,用六类事件内与事件间任务测出 Gemini3-Pro 总体 80.04% 领先而跨事件因果仍偏低,并以模态替换对照揭示融合 deficit,代价是依赖专有模型与约 250 GPU 小时加 700 美元 API 成本。

 · 更新于 2026-09-25 · 约 18 分钟 · 8769 字 阅读 →
论文解读

文化知识碎在模态和语言之间:MMAC 如何对齐三模态输入再测一致性与根据

针对多语言多模态模型的文化感知碎片化问题,MMAC 用 8 国 10 语言 27,000 题的三模态语义对齐题库和五维评测揭示跨语言跨模态不一致与解释不忠实,并以口音线索增益与整合失败等代价界定其适用边界。

 · 更新于 2026-09-25 · 约 21 分钟 · 10388 字 阅读 →
论文解读

多人对话视频看似逼真却接不上话:MTAVG-Bench 如何逐层诊断结构性失败

论文针对多人对话音视频生成中身份漂移与轮转混乱难以被感知质量指标发现的问题,构建覆盖四层九维度的失败诊断问答基准,用 12 个全模态模型的诊断得分与三类生成器的人评成功率显示交互层是主要瓶颈,但诊断高度依赖音频输入与提示对齐条件。

 · 更新于 2026-09-25 · 约 16 分钟 · 7726 字 阅读 →
论文解读

情绪幻觉为何分面而治:从六维评估到记忆引导的生成校正

论文针对开放式情绪推理中多面幻觉难评估、粗粒度缓解顾此失彼的问题,提出六面 EHR 评估与免训练 HMER 框架,在 19 个模型上显示幻觉普遍存在,而 HMER 在多数据集上降低总体幻觉率并保持情绪预测准确率,代价是迭代评估带来额外 token 与延迟。

 · 更新于 2026-09-25 · 约 19 分钟 · 9490 字 阅读 →
论文解读

每秒给出群体氛围单值并标记分歧:连续群体情绪的滑动窗口多模态建模

该研究把三人对话的群体情绪定义为每秒的唤醒与效价连续估计,用混合状态平行标记成员分歧,以冻结编码器加时序 Transformer 的因果滑动窗口建模,最强证据是音视频融合在一致性与误差上超过单模态,而高混合区间更大的误差揭示了单值表示的边界。

 · 更新于 2026-09-25 · 约 22 分钟 · 10579 字 阅读 →
论文解读

音乐问答为何不能只靠通用多模态:密集音画下的时空与音乐先验设计

论文以音乐演出问答为对象,论证连续重叠音画与多尺度时间推理需要专门的输入处理与空间-时间结构,其证据是带时空设计的方法在三套基准上系统性领先,而代价是更复杂的分段选择与跨模态对齐及对音乐先验建模不足。

 · 更新于 2026-09-25 · 约 18 分钟 · 8569 字 阅读 →
论文解读

三跳都必须用上:OMHBench 如何堵住全模态评测的捷径与偏路

针对全模态理解可绕过模态与跨模态多跳推理路径失衡的问题,OMHBench 用表格三元组加三跳规则与六路模态置换构造 6144 题并报告专有模型仍对语音在后路径大幅掉点而高级提示无一致增益。

 · 更新于 2026-09-25 · 约 18 分钟 · 8816 字 阅读 →
论文解读

同时听看读才能判对:Omni-RewardBench 逼奖励模型做三模态排序

论文把同时含文本、音频、图像或视频的问答做成 1375 组优选对,用桥接加人工核验构造基准,报告榜单分数与下游 Best-of-N 表现为同分布 0.94、异分布 0.72 相关,但原生全模态模型仍弱于桥接后的双模态大模型。

 · 更新于 2026-09-25 · 约 16 分钟 · 7565 字 阅读 →
论文解读

只看说话前一秒会误判:用整段对话和视频教会模型的附和时机

针对附和预测中缺视频、模态时间不对齐和只盯触发点的问题,论文用多层跨模态对齐加两阶段课程学习,在韩语 KC-Dialog 上宏 F1 达到 58.53,代价是视频推理耗时从 18.868 毫秒增至 20.083 毫秒。

 · 更新于 2026-09-25 · 约 20 分钟 · 9604 字 阅读 →