看得懂却算不对:多模态大模型乘法在算术负载下的计算崩塌
论文用配对文本图像音频乘法题证明感知近乎完美但计算随算术负载 C 急剧失效,并用强制续写损失探针与 LoRA 正交性揭示模型偏好分配式分解而强加单一启发式反而破坏原有路由。
论文用配对文本图像音频乘法题证明感知近乎完美但计算随算术负载 C 急剧失效,并用强制续写损失探针与 LoRA 正交性揭示模型偏好分配式分解而强加单一启发式反而破坏原有路由。
该研究针对完整乐谱的多级理解问题,选择 ABC 文本与 PDF 图像双模态生成问答评测,最强证据是文本问答约 49.44% 而视觉问答仅约 24.22%,代价是跨级全对的严格成功率迅速归零且微调仍难维持高层一致性。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对全模态理解可绕过模态与跨模态多跳推理路径失衡的问题,OMHBench 用表格三元组加三跳规则与六路模态置换构造 6144 题并报告专有模型仍对语音在后路径大幅掉点而高级提示无一致增益。
论文把同时含文本、音频、图像或视频的问答做成 1375 组优选对,用桥接加人工核验构造基准,报告榜单分数与下游 Best-of-N 表现为同分布 0.94、异分布 0.72 相关,但原生全模态模型仍弱于桥接后的双模态大模型。
论文把无指令下的主动帮助定义为视觉加音频加角色文本到动作序列的映射,用 19963 条 122 场景数据和四指标评测显示只有同时理解两模态才能给出正确帮助,而缺任一模态或替换任一模态都会使总体得分大幅下降。
PRiSM 把音素实现识别拆成转写准确与转写探针加表示探针两类下游使用来考,证据显示多语言覆盖与编码器加 CTC 更稳定而专用模型仍领先大音频语言模型,但以声学保真与任务依赖为代价。
论文用极简听觉测试 DeafTest 和 4555 题的音画推理基准 AV-Odyssey 证明低级听觉感知与高级音画推理高度相关,最强证据是两者准确率的 Pearson 相关达 0.945,而代价是当前模型在计数、响度与音高上仍接近随机猜测。
论文针对音频大模型会无意收录并回答旁观者语音的问题,提出只听主说话人的选择性听觉任务与 SH-Bench 评测和 SE 统一指标,并用旁观者隐私微调 BPFT 在保持主说话人理解的同时学会拒答,最强证据是微调后选择模式下旁观者准确率与 SE 大幅超过 Gemini 2.5 Pro,代价是主说话人准确率轻微波动且仅覆盖单主说话人场景。
论文研究如何用极小子集替代上万条音频评测并对齐真人语音助手体验,用 50 条达到 0.93 以上基准相关、用 100 条回归达到 0.978 人类偏好相关,代价是仅 7 个模型的人评与英语对话场景限制。
针对中文多轮语音任务对话缺乏真实口语评测的问题,RealTalk-CN 用 5400 段真人录音与不流利标注和跨模态切换任务,测出槽填充比意图分类更怕口语化,而流水线与端到端各有胜负且老年与方言口音存在可测差距。
论文用四种真实声景按 1 到 4 个干扰源叠加构造十万级评测,报告高阶推理在户外强干扰下功能性崩溃而性别感知相对稳定,且常用去噪反而加重词错误率等代价。
针对语音到语音模型只测语义、不测说话方式的问题,S2S-Arena 用四级交互协议与 1243 条语音查询做 1001 次语音内成对比较,最强证据是工业模型全面领先而学术模型在高难度表达层落后 300 分以上,代价是合成语音分布与短轮交互的局限。
论文以多轮对话中同一说话人是否保持声学一致为问题,用检测、定位、判别三任务与 1818 个人审实例检验 12 个大音频语言模型与 6 种嵌入基线,最强证据是判别可达 81.5% 而检测仅 64.7% 且加文本上下文后不一致检出崩塌,代价是绝对判断阈值不稳与文本压过声学。
IWSLT 2026 围绕离线、低资源、压缩、字幕、同传、语音生成与质量估计组织十个赛道,用统一数据条件、自动指标加听音频人工打分检验级联与端到端路线,最强证据是压缩后 4 比特模型与全精度接近、额外上下文平均提升 2.75 个 COMET 点,而语音质量估计在片段级仍远低于人工一致性。
论文针对句子重音改变语义这一被忽视的能力,提出 StressTest 基准与 Stress-17k 合成训练管线,微调得到的 StresSLM 在真实录音上显著超过现有语音模型,同时基本保留原有识别能力。
论文把音频地理定位做成音频语言模型基准,用四步声学过滤加正负类别加权的定位性分数筛出 1444 段录音,最强闭源模型仍只在部分样本上精确定位且高度依赖语言线索。
v-HUB 把视频幽默拆成字幕匹配、幽默解释和开放问答三类可核对任务,用文本、纯视频、视频加音频三组输入对照测出模型重度依赖文字线索,而环境声和画面内文字只带来小而稳定的增益且历史默片更难。
针对英文为主和合成语音评测失真的问题,VCB Bench 用全真人中文语音构建指令跟随、知识理解与鲁棒性三维评测,在 9 个语音对话模型上显示常识问答最难而物理干扰比口误更致命。
论文用同一段母语录音配不同种族照片的匹配假象法,测 9 个语音视觉模型,发现高能力闭源模型在英语中把亚裔降为近母语、在韩语中给外群体加能力分,而小模型多为无差别的视觉干扰降分。