论文解读

只拼模态不够:用静态属性与动态事件补上物理监督

针对通用多模态只学语义对齐而缺物理量监督的问题,OmniFysics-Nano-V2 用静态属性 grounding 与动态视听事件对齐的双分支数据加两阶段 GRPO,在 21 项中 17 项领先同类全模态模型,代价是依赖商用大模型标注与多阶段训练流程。

 · 更新于 2026-09-25 · 约 22 分钟 · 10584 字 阅读 →
论文解读

听声辨位再行动:OmniEcho 用四通道空间音频补上具身感知的方向感

针对具身智能体难以利用空间音频做问答与导航的问题,论文构建 197 场景问答与 30 场景导航的实录基准并用可控渲染补大规模仿真训练,提出保留语义通路另加 FOA 空间编码器的 OmniEcho,其问答总体 28.5 分与声音导航 16.2% 成功率接近部分文本导航基线,但精细定位与自主停止仍是主要代价。

 · 更新于 2026-09-25 · 约 20 分钟 · 9568 字 阅读 →
论文解读

能说出事件不等于能定住时间:AVTrace 如何拆解音画时间推理

AVTrace 把音画时间能力拆成七类可复算的定位与排序任务,用固定测试集显示现有全模态模型语义描述尚可但时间定位与同步判断偏弱,而针对 Gemma4-E4B 的时间后训练能在部分指标上提升但伴随外部任务的涨跌。

 · 更新于 2026-09-25 · 约 20 分钟 · 9866 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-20

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 3 分钟 · 1104 字 阅读 →
论文解读

先看到的不等于已证实:用未来可验声明管住流式音视记忆

针对流式中视觉先成熟、音频后到达导致的过早跨模态承诺问题,OST 用未来声明加到期验证加谱系回撤加回答门控组织记忆,在冻结 Qwen3-Omni-30B-A3B 上提升流式与音视基准并在诊断集上降低视觉诱发的听觉幻觉,但重写对比与多阶段训练带来额外推理与训练代价。

 · 更新于 2026-09-25 · 约 24 分钟 · 11690 字 阅读 →
论文解读

数得准还要指得出:长视频线索级音视计数的基准与能力迁移训练

论文针对长视频多模态计数难评难训的问题,构建带细粒度线索标注的 CG-AV-Counting 并用课程式 GRPO 训练 AV-Reasoner,最强证据是在 DVD-Counting 上达到 44.00 准确率且多项音视定位任务达到新高,代价是显式输出思维链在域外幻觉子集上反而降低准确率。

 · 更新于 2026-09-25 · 约 20 分钟 · 9734 字 阅读 →
论文解读

看听推理不断线:AVATAR 用离线复用与首尾加权修补 GRPO

针对长视频音频问答中 GRPO 样本浪费、组内奖励相同导致优势为零、全序列平均授信的问题,AVATAR 用分层回放加离线修正与首尾抛物线加权做强化学习,在 Qwen2.5-Omni 上取得 MMVU 加 5.4 等增益,代价是四阶段课程与多奖励判断器带来的训练复杂度。

 · 更新于 2026-09-25 · 约 22 分钟 · 10852 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 212 分钟 · 106059 字 阅读 →
论文解读

先听清再看懂:EgoAVU 用多模态上下文图把第一视角的声音钉回可见来源

针对第一视角视频中模型重视觉轻音频、声源对应差的问题,EgoAVU 用模块化解耦叙述增强与多模态上下文图生成联合叙述,再派生问答,报告显示微调后在 EgoAVU-Bench 上最高相对提升 113.3%,代价是依赖开源单模态模型输出噪声与大规模微调资源。

 · 更新于 2026-09-25 · 约 21 分钟 · 10185 字 阅读 →
论文解读

只会看的第一人称模型:EgoSound 逼模型把声音听进推理里

EgoSound 针对第一人称视频中的声音理解构造 900 视频 7315 对开放问答与七类任务,用九个多模态大模型的评测显示最强模型仅 56.7% 准确率而人类达 83.9%,代价是自动构造依赖大模型与 GPT-5 判分带来的偏差与可复现性负担。

 · 更新于 2026-09-25 · 约 20 分钟 · 9722 字 阅读 →
论文解读

不暴力看全片:用跨模态预测逼模型补全听觉与视觉

针对视频问答中被动看帧、忽视音频的问题,该工作用跨模态未来与过去摘要预测做监督微调,再用对比式强化学习约束双模态联合推理,在 16 帧与 64 帧条件下以 7B 与 8B 规模在四个音视频基准上达到与大闭源模型可比的水平,代价是两阶段推理延迟高于单阶段模型。

 · 更新于 2026-09-25 · 约 19 分钟 · 9332 字 阅读 →
论文解读

从听见对准到记住行动:HAVE-Bench 用三层结构测音频视觉模型

论文针对音频视觉评测偏重单轮感知的问题,提出感知—推理—交互三层基准并区分指令与上下文两种音频角色,用 2451 个样本和多轮任务图揭示语音指令推理弱于文本指令且交互成功率普遍偏低,代价是构造依赖人工标注而交互判定依赖大模型裁判。

 · 更新于 2026-09-25 · 约 20 分钟 · 9811 字 阅读 →
论文解读

只听见声音不够:当语义对不上时用双耳空间线索做视听推理

论文把视听空间推理定义为超越语义匹配的定位与关系判断,用 SoundSpaces 2.0 渲染的全景图加双耳音频构造 100 万问答对并训练连接视觉与空间音频编码器的大语言模型,在语义错位与多同类目标场景上报告了双耳相对单耳的定向优势,但分类精度仍远低于 Oracle 且依赖仿真场景。

 · 更新于 2026-09-25 · 约 19 分钟 · 9064 字 阅读 →
论文解读

长视频不止于切分检索:用视听实体黏合与分层索引保持叙事连贯

针对小时级视频上下文过长与朴素切分检索导致碎片化的问题,论文提出离线构建全局-场景-片段-实体四层索引并用说话人身份做跨模态实体黏合,再由智能体按需多粒度检索,在 LVBench 上以 30 秒粗切分与至多 10 步推理达到 84.1% 整体准确率,但高密度采样与多工具调用仍带来离线与在线开销。

 · 更新于 2026-09-25 · 约 22 分钟 · 10570 字 阅读 →
论文解读

从标注到干扰项:HumanVBench 用人为可核查的流水线逼问视频模型的看人能力

论文针对视频多模态大模型看人不细的问题,用两条自动标注与组装干扰项的流水线合成 16 个细粒度选择题,并在 30 个模型与人类基线上显示情绪与声画对齐仍远落后于人,且开放流水线把人工从出题转为验题。

 · 更新于 2026-09-25 · 约 20 分钟 · 9660 字 阅读 →
论文解读

跨模态检索错位与单跳知识太浅:用多跳图加两步剪枝补齐音视频问答证据

针对音视频问答中共享嵌入检索错位与单跳图证据太浅的问题,论文用三步多智能体构造多跳多模态知识图并以模态内检索加 GRASP 接地剪枝供给答案有用子图,在 AudioCaps-QA、VCGPT 和 VALOR 上一致提升但强依赖阈值与外部接地模型。

 · 更新于 2026-09-25 · 约 20 分钟 · 9674 字 阅读 →
论文解读

先问该听谁再解码:用自评估权重压住跨模态幻觉的 MAD

针对音视频大模型中一个模态错误污染另一模态描述的跨模态幻觉,MAD 用免训练的两步流程先让模型自评问题需要音频、视频还是两者,再用权重调节四路对比解码,在 CMM 和 AVHBench 上提升 VideoLLaMA2-AV 与 Qwen2.5-Omni 的准确率,代价是每步需计算多组 logits 且依赖模型自身判断的可靠性。

 · 更新于 2026-09-25 · 约 18 分钟 · 8746 字 阅读 →
论文解读

用不相关扰动不变、相关损坏敏感拆开音视频:MoD-DPO 如何压制跨模态幻觉

针对全模态大模型把一模态线索误用到另一模态提问以及过度依赖文本先验的问题,论文提出在偏好优化中加入不相关模态不变与相关模态敏感两项解耦约束并叠加纯文本惩罚,用自动构造的约 1.8 万偏好样本训练,在幻觉基准上报告最高约 27% 的匹配任务提升,而代价是每步增加无需梯度的损坏输入前向与四分之一轮数的训练预算控制。

 · 更新于 2026-09-25 · 约 18 分钟 · 8945 字 阅读 →
论文解读

文本挤占参数更新时,单块 LoRA 如何隐式分出模态分工

针对多模态微调中文本主导参数更新的问题,论文用单矩阵隐式分区加解耦与对齐两个梯度约束来恢复平衡,在音频视觉文本等任务上提升精度且保持与标准 LoRA 相同的可合并参数量与推理结构。

 · 更新于 2026-09-25 · 约 18 分钟 · 8995 字 阅读 →
论文解读

语音一说就信?SVHalluc 检验语音与画面是否真的对上

论文针对语音内容与视频画面的语义和时间对齐问题,构造 2405 个问答的 SVHalluc 基准并测试多款音视频大模型,最强证据是 Gemini-2.5-Pro 在全局语义对齐上达到 93.10% 而多数开源模型徘徊在 50% 附近,代价是开源模型跨模态绑定能力仍接近随机且需额外的人工核验构造流程。

 · 更新于 2026-09-25 · 约 19 分钟 · 9059 字 阅读 →