论文解读

看得懂却算不对:多模态大模型乘法在算术负载下的计算崩塌

论文用配对文本图像音频乘法题证明感知近乎完美但计算随算术负载 C 急剧失效,并用强制续写损失探针与 LoRA 正交性揭示模型偏好分配式分解而强加单一启发式反而破坏原有路由。

 · 更新于 2026-09-24 · 约 17 分钟 · 8277 字 阅读 →
论文解读

看完整总谱而不是猜标题:MSU-Bench 用四级定位问答逼出文本与视觉的差距

该研究针对完整乐谱的多级理解问题,选择 ABC 文本与 PDF 图像双模态生成问答评测,最强证据是文本问答约 49.44% 而视觉问答仅约 24.22%,代价是跨级全对的严格成功率迅速归零且微调仍难维持高层一致性。

 · 更新于 2026-09-24 · 约 20 分钟 · 9649 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

三跳都必须用上:OMHBench 如何堵住全模态评测的捷径与偏路

针对全模态理解可绕过模态与跨模态多跳推理路径失衡的问题,OMHBench 用表格三元组加三跳规则与六路模态置换构造 6144 题并报告专有模型仍对语音在后路径大幅掉点而高级提示无一致增益。

 · 更新于 2026-09-24 · 约 18 分钟 · 8816 字 阅读 →
论文解读

同时听看读才能判对:Omni-RewardBench 逼奖励模型做三模态排序

论文把同时含文本、音频、图像或视频的问答做成 1375 组优选对,用桥接加人工核验构造基准,报告榜单分数与下游 Best-of-N 表现为同分布 0.94、异分布 0.72 相关,但原生全模态模型仍弱于桥接后的双模态大模型。

 · 更新于 2026-09-24 · 约 16 分钟 · 7565 字 阅读 →
论文解读

看见消防车、听见警笛才行动:PEAP 要求视觉与音频联合决定动作序列

论文把无指令下的主动帮助定义为视觉加音频加角色文本到动作序列的映射,用 19963 条 122 场景数据和四指标评测显示只有同时理解两模态才能给出正确帮助,而缺任一模态或替换任一模态都会使总体得分大幅下降。

 · 更新于 2026-09-24 · 约 18 分钟 · 8989 字 阅读 →
论文解读

只看转写错误会漏掉什么:PRiSM 同时考听写与下游使用

PRiSM 把音素实现识别拆成转写准确与转写探针加表示探针两类下游使用来考,证据显示多语言覆盖与编码器加 CTC 更稳定而专用模型仍领先大音频语言模型,但以声学保真与任务依赖为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9552 字 阅读 →
论文解读

听不见的推理:从基础听觉短板看多模态模型的音画推理上限

论文用极简听觉测试 DeafTest 和 4555 题的音画推理基准 AV-Odyssey 证明低级听觉感知与高级音画推理高度相关,最强证据是两者准确率的 Pearson 相关达 0.945,而代价是当前模型在计数、响度与音高上仍接近随机猜测。

 · 更新于 2026-09-24 · 约 17 分钟 · 8293 字 阅读 →
论文解读

只听主人、不听路人:用选择性听觉堵住音频大模型的旁观者泄露

论文针对音频大模型会无意收录并回答旁观者语音的问题,提出只听主说话人的选择性听觉任务与 SH-Bench 评测和 SE 统一指标,并用旁观者隐私微调 BPFT 在保持主说话人理解的同时学会拒答,最强证据是微调后选择模式下旁观者准确率与 SE 大幅超过 Gemini 2.5 Pro,代价是主说话人准确率轻微波动且仅覆盖单主说话人场景。

 · 更新于 2026-09-24 · 约 19 分钟 · 9239 字 阅读 →
论文解读

小子集为何能排准大音频模型:从基准压缩到人类偏好回归

论文研究如何用极小子集替代上万条音频评测并对齐真人语音助手体验,用 50 条达到 0.93 以上基准相关、用 100 条回归达到 0.978 人类偏好相关,代价是仅 7 个模型的人评与英语对话场景限制。

 · 更新于 2026-09-24 · 约 17 分钟 · 8208 字 阅读 →
论文解读

口语不流利、说话人各异还要随时切语音文字:RealTalk-CN 如何测任务对话

针对中文多轮语音任务对话缺乏真实口语评测的问题,RealTalk-CN 用 5400 段真人录音与不流利标注和跨模态切换任务,测出槽填充比意图分类更怕口语化,而流水线与端到端各有胜负且老年与方言口音存在可测差距。

 · 更新于 2026-09-24 · 约 18 分钟 · 8785 字 阅读 →
论文解读

真实现场压垮推理:RSA-Bench 用声学生态测出音频大模型的感知-认知断层

论文用四种真实声景按 1 到 4 个干扰源叠加构造十万级评测,报告高阶推理在户外强干扰下功能性崩溃而性别感知相对稳定,且常用去噪反而加重词错误率等代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9023 字 阅读 →
论文解读

不只听懂,还要说得对:S2S-Arena 考语音模型的副语言指令跟随

针对语音到语音模型只测语义、不测说话方式的问题,S2S-Arena 用四级交互协议与 1243 条语音查询做 1001 次语音内成对比较,最强证据是工业模型全面领先而学术模型在高难度表达层落后 300 分以上,代价是合成语音分布与短轮交互的局限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9501 字 阅读 →
论文解读

能比出声音差别,却判不准是否换人:SpeakerSleuth 揭示的阈值与模态失衡

论文以多轮对话中同一说话人是否保持声学一致为问题,用检测、定位、判别三任务与 1818 个人审实例检验 12 个大音频语言模型与 6 种嵌入基线,最强证据是判别可达 81.5% 而检测仅 64.7% 且加文本上下文后不一致检出崩塌,代价是绝对判断阈值不稳与文本压过声学。

 · 更新于 2026-09-24 · 约 17 分钟 · 8418 字 阅读 →
论文解读

从离线到同传再到打分:IWSLT 2026 如何把语音翻译的任务、系统与评价钉在一起

IWSLT 2026 围绕离线、低资源、压缩、字幕、同传、语音生成与质量估计组织十个赛道,用统一数据条件、自动指标加听音频人工打分检验级联与端到端路线,最强证据是压缩后 4 比特模型与全精度接近、额外上下文平均提升 2.75 个 COMET 点,而语音质量估计在片段级仍远低于人工一致性。

 · 更新于 2026-09-24 · 约 21 分钟 · 10109 字 阅读 →
论文解读

重音一变意思就变:语音模型为何听不出言外之意

论文针对句子重音改变语义这一被忽视的能力,提出 StressTest 基准与 Stress-17k 合成训练管线,微调得到的 StresSLM 在真实录音上显著超过现有语音模型,同时基本保留原有识别能力。

 · 更新于 2026-09-24 · 约 18 分钟 · 8705 字 阅读 →
论文解读

听声辨位:用可定位性把众包录音筛成组合推理考题

论文把音频地理定位做成音频语言模型基准,用四步声学过滤加正负类别加权的定位性分数筛出 1444 段录音,最强闭源模型仍只在部分样本上精确定位且高度依赖语言线索。

 · 更新于 2026-09-24 · 约 21 分钟 · 10407 字 阅读 →
论文解读

只看画面能懂笑点吗:v-HUB 逼模型从视觉和环境声里找幽默

v-HUB 把视频幽默拆成字幕匹配、幽默解释和开放问答三类可核对任务,用文本、纯视频、视频加音频三组输入对照测出模型重度依赖文字线索,而环境声和画面内文字只带来小而稳定的增益且历史默片更难。

 · 更新于 2026-09-24 · 约 20 分钟 · 9544 字 阅读 →
论文解读

真人中文语音做考题:VCB Bench 为何要同时考听话、懂知识和抗干扰

针对英文为主和合成语音评测失真的问题,VCB Bench 用全真人中文语音构建指令跟随、知识理解与鲁棒性三维评测,在 9 个语音对话模型上显示常识问答最难而物理干扰比口误更致命。

 · 更新于 2026-09-24 · 约 16 分钟 · 7773 字 阅读 →
论文解读

看着脸听声音:多模态大模型为何在英语里幻听口音、在韩语里加分

论文用同一段母语录音配不同种族照片的匹配假象法,测 9 个语音视觉模型,发现高能力闭源模型在英语中把亚裔降为近母语、在韩语中给外群体加能力分,而小模型多为无差别的视觉干扰降分。

 · 更新于 2026-09-24 · 约 17 分钟 · 8234 字 阅读 →