论文解读
联合分支不可全信:用冲突量与可干预性重配解码权重
针对全模态大模型中音频视觉联合预测不可靠融合的问题,论文提出免训练的冲突感知解码 CAD,用潜在冲突量与任务空间可干预性决定是否把联合分支权重转给单模态分支,在 Qwen2.5-Omni-7B 上把 CMM 整体准确率提到 85.0% 与 AVHBench 提到 84.1%,代价是每步要跑四个分支并依赖人工阈值。
针对全模态大模型中音频视觉联合预测不可靠融合的问题,论文提出免训练的冲突感知解码 CAD,用潜在冲突量与任务空间可干预性决定是否把联合分支权重转给单模态分支,在 Qwen2.5-Omni-7B 上把 CMM 整体准确率提到 85.0% 与 AVHBench 提到 84.1%,代价是每步要跑四个分支并依赖人工阈值。
音视频问答 | 8.1/10
音视频问答 | 5.9/10
音视频问答 | 7.2/10
音视频问答 | 6.6/10
音视频问答 | 6.7/10
音视频问答 | 5.5/10
音视频问答 | 4.7/10
音视频问答 | 6.2/10
音视频问答 | 7.0/10
音视频问答 | 8.3/10
音视频理解 | 6.0/10
音视频问答 | 5.9/10
音视频问答 | 6.9/10
音视频问答 | 8/10
音视频问答 | 7.1/10
音视频问答 | 7.5/10
音视频问答 | 7.3/10
音视频问答 | 7.8/10
音视频问答 | 7.3/10