aaai-2026 论文深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文用 15 种非洲语言、约 7.5k 对图文加母语录音的平行问答测文化理解,最强闭源模型文本选择题仅 78% 而开放问答仅 38%,开源模型在母语语音开放问答上近零分且语音识别与语种识别先失灵。
论文针对以人为中心的长视频多模态理解,构建约 1001 个视频与 4781 个问答的 LongInsightBench,用六类事件内与事件间任务测出 Gemini3-Pro 总体 80.04% 领先而跨事件因果仍偏低,并以模态替换对照揭示融合 deficit,代价是依赖专有模型与约 250 GPU 小时加 700 美元 API 成本。
论文以音乐演出问答为对象,论证连续重叠音画与多尺度时间推理需要专门的输入处理与空间-时间结构,其证据是带时空设计的方法在三套基准上系统性领先,而代价是更复杂的分段选择与跨模态对齐及对音乐先验建模不足。
针对全模态理解可绕过模态与跨模态多跳推理路径失衡的问题,OMHBench 用表格三元组加三跳规则与六路模态置换构造 6144 题并报告专有模型仍对语音在后路径大幅掉点而高级提示无一致增益。
论文把同时含文本、音频、图像或视频的问答做成 1375 组优选对,用桥接加人工核验构造基准,报告榜单分数与下游 Best-of-N 表现为同分布 0.94、异分布 0.72 相关,但原生全模态模型仍弱于桥接后的双模态大模型。
论文用极简听觉测试 DeafTest 和 4555 题的音画推理基准 AV-Odyssey 证明低级听觉感知与高级音画推理高度相关,最强证据是两者准确率的 Pearson 相关达 0.945,而代价是当前模型在计数、响度与音高上仍接近随机猜测。
针对推理时音频或视觉缺失的音视问答,论文提出先检索真实特征再做上下文净化的 R2ScP 路线,报告在 Music-AVQA 平均 71.54% 与 AVQA 平均 76.35% 的准确率,代价是对检索库质量敏感且只处理推理阶段缺失。
论文用文本化多模态线索统一笑声检测、类型分类与原因解释,并以笑声自指令扩充与混合笑声专家提升泛化,主证据是文本大模型在三任务上优于音视频大模型,代价是依赖外部抽取器与伪标签校对。
论文研究只加音频扰动能否无目标破坏音频视频语言模型的问答,方法是固定视频与文本并用六种损失学习一段可复用的共享扰动,最强证据是组合损失在 AVQA 上达到 96.03% 攻击成功率,代价是跨模型与跨声学域迁移很弱且物理混响下部分目标明显衰减。
该研究用声音性别与头像外观正交变化的协作游戏二选一任务审计 10 个多模态大模型,发现闭源模型近乎强制声音外观一致、开源模型偏向高风险场景选男性且两种偏置可独立出现,而降低写实度只在部分强配对模型中减弱声音效应。
针对多模态大模型在以人为中心场景中感知尚可但理解与回应不足的问题,论文用 3882 道真人记录选择题建四层基准并以多阶段全模态强化学习做推理模型,最强证据是人类 87.5% 领先最优模型 29.7 个百分点,而代价是长上下文推理仍是瓶颈且音频任务覆盖不全。
针对主播与观众实时互动的直播视频理解问题,论文用多智能体加种子问题的人机协同流程构建含音频语音评论的 3168 视频 3175 题基准,并以两阶段指令微调加视频到评论检索训练 LiVi-LLM-7B,在 LiViBench 上报告 64.4% 的总准确率,代价是仍落后最优闭源模型的直播专有任务与对海量评论的依赖取舍。
MAVERIX 用 700 段视频与 2556 道必须联合音视频才能回答的问题,测出以 Gemini 2.5 Flash-Lite 约 54.7% 选择题准确率为代表的模型与 92.8% 人类表现之间的大幅差距,代价是更长的人工标注与多轮去捷径校验流程。
针对全模态大模型忽略视听证据与视频音频互相对不齐的问题,OmniDPO 用文本偏好对与加噪模态偏好对做条件偏好优化,在 Qwen2.5-Omni 与 MiniCPM-o-2.6 上降低幻觉并提升推理,但仍受基座视觉能力限制。
针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。
针对视觉存在但音频缺失的不对称输入,论文用 AV-ConfuseBench 暴露视觉主导误判,并用 RL-CoMM 的两阶段强化协作把 Qwen2.5-Omni-3B 的问答与幻觉指标提升 10 到 30 个百分点,代价是只在有限样本上做在线策略优化并依赖外部音频推理与嵌入裁判。
针对多用户 OFDM 下多模态 Token 经 Modified Rapp 功放非线性失真导致任务精度与能效下降的问题,MAPS 用两阶段训练在嵌入空间联合优化跨模态对齐与均衡 PAPR 抑制,在 IBO=3 dB 时相对同条件基线获得约 64.5% AVQA 精度提升与约 64.4% 任务导向能效提升,代价是引入方差均衡与锚定重构等额外约束以稳定训练。
为解决全模态大模型在图文声三路互斥时把模态偏置与证据形式偏置混为一谈的问题,Tri-PvP 以 8000 样本的四条件匹配反事实与五模型对照揭示视觉主导且视听在感知与命题上不对称,并以早期线性可分与对比解码仅部分缓解且引入文本残余为代价验证偏置的表征根源。