论文解读

看见消防车、听见警笛才行动:PEAP 要求视觉与音频联合决定动作序列

论文把无指令下的主动帮助定义为视觉加音频加角色文本到动作序列的映射,用 19963 条 122 场景数据和四指标评测显示只有同时理解两模态才能给出正确帮助,而缺任一模态或替换任一模态都会使总体得分大幅下降。

 · 更新于 2026-09-25 · 约 18 分钟 · 8989 字 阅读 →
论文解读

听不见的推理:从基础听觉短板看多模态模型的音画推理上限

论文用极简听觉测试 DeafTest 和 4555 题的音画推理基准 AV-Odyssey 证明低级听觉感知与高级音画推理高度相关,最强证据是两者准确率的 Pearson 相关达 0.945,而代价是当前模型在计数、响度与音高上仍接近随机猜测。

 · 更新于 2026-09-25 · 约 17 分钟 · 8293 字 阅读 →
论文解读

流式音视频不同步、该不该开口难判断:ROMA 用对齐单元与说话头统一反应与主动

针对连续音视频流中被动问答与主动触发难以统一的问题,ROMA 用一秒多模态单元加分块时间位置编码与独立说话头做对齐与时机判断,在主动提醒与实时解说上报告最优并保持被动问答竞争力,代价是每秒决策粒度和有限上下文。

 · 更新于 2026-09-25 · 约 17 分钟 · 8355 字 阅读 →
论文解读

从“是不是自闭”到“在说什么”:ROSCO-Omni 用标签引导把照护者理解蒸馏进开源全模态模型

针对非口语与极少口语自闭症个体的多标签沟通理解问题,论文用教师模型按照护者标注生成动作与功能描述并微调开源学生模型,在动作与功能分类上接近闭源教师模型,但绝对准确率仍不高且依赖小规模特定综合征队列。

 · 更新于 2026-09-25 · 约 23 分钟 · 11277 字 阅读 →
论文解读

笑声不止于好笑:把视频转成文字再让专家模型分工推理

论文用文本化多模态线索统一笑声检测、类型分类与原因解释,并以笑声自指令扩充与混合笑声专家提升泛化,主证据是文本大模型在三任务上优于音视频大模型,代价是依赖外部抽取器与伪标签校对。

 · 更新于 2026-09-25 · 约 19 分钟 · 9370 字 阅读 →
论文解读

只动声音就能拖垮三模态推理:SoundBreak 的六路音频攻击

论文研究只加音频扰动能否无目标破坏音频视频语言模型的问答,方法是固定视频与文本并用六种损失学习一段可复用的共享扰动,最强证据是组合损失在 AVQA 上达到 96.03% 攻击成功率,代价是跨模型与跨声学域迁移很弱且物理混响下部分目标明显衰减。

 · 更新于 2026-09-25 · 约 18 分钟 · 8927 字 阅读 →
论文解读

双假设迟融合:在语言空间里让听觉与视觉各自举证再裁决

针对噪声下单流纠错被音频质量卡住的问题,论文用独立 ASR 与 VSR 双路 N-best 假设加可靠性提示词做语言空间组合,在 LRS2 上把基线相对误差降低约一半,代价是依赖上下游识别头质量并增加大模型串行纠错开销。

 · 更新于 2026-09-25 · 约 19 分钟 · 9036 字 阅读 →
论文解读

只看画面能懂笑点吗:v-HUB 逼模型从视觉和环境声里找幽默

v-HUB 把视频幽默拆成字幕匹配、幽默解释和开放问答三类可核对任务,用文本、纯视频、视频加音频三组输入对照测出模型重度依赖文字线索,而环境声和画面内文字只带来小而稳定的增益且历史默片更难。

 · 更新于 2026-09-25 · 约 20 分钟 · 9544 字 阅读 →
论文解读

先看再听:用两段式推理链约束幻灯片辅助转写

针对全模态模型易复述可见幻灯片文字而忽略语音的问题,论文提出先在思考块中识别幻灯片文字再在回答块中引用锚定转写,并用四项奖励做组相对策略优化,在实体密集基准上改善实体识别,同时带来思考块的额外推理开销。

 · 更新于 2026-09-25 · 约 18 分钟 · 8645 字 阅读 →
论文解读

看着脸听声音:多模态大模型为何在英语里幻听口音、在韩语里加分

论文用同一段母语录音配不同种族照片的匹配假象法,测 9 个语音视觉模型,发现高能力闭源模型在英语中把亚裔降为近母语、在韩语中给外群体加能力分,而小模型多为无差别的视觉干扰降分。

 · 更新于 2026-09-25 · 约 17 分钟 · 8234 字 阅读 →
论文解读

把主唱和和声分开:VocalRep 用角色一致性重做人声表示

针对双轨分离把主唱与和声混为一轨导致的下游含混问题,VocalRep 用全局身份条件加排序约束做三轨分离,在保持可比分离分的同时以更干净的主唱提升歌声转换可懂度与音高稳定性和唇同步精度,代价是求和比较时累积误差与多人主唱假设受限。

 · 更新于 2026-09-25 · 约 18 分钟 · 8832 字 阅读 →
论文解读

声音对不上长相时,多模态队友先信谁:配对偏置与场景刻板印象的分流

该研究用声音性别与头像外观正交变化的协作游戏二选一任务审计 10 个多模态大模型,发现闭源模型近乎强制声音外观一致、开源模型偏向高风险场景选男性且两种偏置可独立出现,而降低写实度只在部分强配对模型中减弱声音效应。

 · 更新于 2026-09-25 · 约 17 分钟 · 8353 字 阅读 →
论文解读

文本带路、解释搭桥、时间对齐:TEXT 如何让音频视频不再带偏情感判断

针对短视频中文本主导而音视频易误判的问题,TEXT 用多模态大模型生成解释做语义锚点,再做解释对齐与轻量时间对齐并以文本路由稀疏专家融合,在四个数据集上取得最低平均绝对误差,但细粒度分类仍有两项未胜出且依赖外部大模型。

 · 更新于 2026-09-25 · 约 20 分钟 · 9732 字 阅读 →
论文解读

高层偏向视频、跨模态不宜直并:AccKV 按层聚焦再校准压缩音视频 KV

针对音视频大模型推理时 KV 缓存过大问题,AccKV 按层自适应聚焦关键模态并先模态内合并再跨模态校准,在 MVBench 与 AVSD 上用 10% 缓存与 120 词元预算维持接近全缓存精度,但未测量延迟与吞吐提升。

 · 更新于 2026-09-25 · 约 16 分钟 · 7861 字 阅读 →
论文解读

先对齐多帧运动、再用声音补嘴部细节:GAVN 的时域与身份互补修复

针对带声音的人脸视频在压缩、模糊和低分辨率下的退化,GAVN 用低分辨率空间的帧间时域特征做粗修复、用高分辨率空间的音频加关键点身份特征补细节,在 VoxCeleb2 和 Obama 两种说话人场景下取得最优的图像质量与唇音同步分数,但代价是两阶段训练与多模块推理成本。

 · 更新于 2026-09-25 · 约 16 分钟 · 7903 字 阅读 →
论文解读

推理与分割打架时:AURORA 用四步推理加蒸馏保住像素精度

针对引用音频视觉分割中语言理解浅与推理分割互损问题,AURORA 用结构化思维链加分割特征蒸馏起步,再经纠错反思与分组奖励强化学习提升,在引用音频视觉分割的已见与未见划分上取得最高分,其代价是三阶段流水线与多模型标注依赖。

 · 更新于 2026-09-25 · 约 22 分钟 · 10802 字 阅读 →
论文解读

已有配音怎么改:AV-Edit 用音画联合表示做加、删、换

针对已有视频音轨需随画面增删替换音效的问题,AV-Edit 先用细粒度对比掩码预训练学到音画对齐表示,再用相关门控加多模态扩散重生成,在 VGG-Edit 三类编辑与 VGGSound 生成上报告最优距离与质量,代价是原文承认不能无失真保留原音。

 · 更新于 2026-09-25 · 约 20 分钟 · 9758 字 阅读 →
论文解读

先认出是什么,再听出在哪里:跨实例视觉提示的选择性测向

针对混合声中只定位目标声源的问题,该研究用跨实例图像做语义提示,先做语义对齐再做多频带空间对齐,在 VGGSound-SSL 上报告平均绝对误差 16.59 度、准确率 71.29%,代价是依赖合成空间音频与人工核验的提示池。

 · 更新于 2026-09-25 · 约 20 分钟 · 9621 字 阅读 →
论文解读

广播满分不等于学会唇读:六条件复测下的视觉泛化断层

该文用统一预处理把六种说话条件接入三种主流架构复测,显示纯视觉在域外全面崩溃、音视融合仅在 Lombard 夸张口型下稳定增益,而发音人清晰度与 90 度侧脸的影响远大于小角度偏移与加数据量。

 · 更新于 2026-09-25 · 约 17 分钟 · 8033 字 阅读 →
论文解读

广告审核为何需要跨模态因果链:BLM-Guard 的两阶段策略

针对短视频广告中夸大表述与跨模态错位带来的细粒度政策违规,BLM-Guard 采用规则锚定的交错模态推理冷启动加自适应评论奖励的分组优化实现可解释审核,在自建基准与消融矩阵中报告严格准确率与一致性提升,但资源本次未能确认可达且一致性依赖大模型打分。

 · 更新于 2026-09-25 · 约 20 分钟 · 9863 字 阅读 →