AcoustiTrace: When Plausible Sound Violates Physics

📄 AcoustiTrace: When Plausible Sound Violates Physics 标签:#音视频生成 #多模态模型 #音视频理解 #基准测试 #扩散模型 6.9/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频生成 | #多模态模型 | #音视频理解 #基准测试 | arxiv 👥 作者与机构 第一作者:Shiyang Li (中科院的机构1和2) 通讯作者:Changqing Zou (中科院的机构1和6) 作者列表:Shiyang Li (机构1,2), Yuewen Cao (机构2), Yihao Liu (机构2), Yuandong Pu (机构3), Baochang Zhang (机构4), Xiaofei Li (机构5), Changqing Zou (机构1,6) 机构说明:论文未明确给出机构全称,仅以数字标记了6个不同机构。 💡 毒舌点评 AcoustiTrace以其声学物理过程的三阶段八维度拆解,为现有音视频生成评估中“听着真但物理假”的棘手问题,提供了一套迄今最具结构感的诊断工具箱。它细致、体面、有洞见。然而,当这个基准的全部数据、验证过的评估器以及精心设计的提示套件都被作者们揣在兜里,拒绝开源时,它就从社区的公共基础设施退化成了一场自娱自乐的内部演习。再精巧的“手术刀”,若只允许少数人使用,其价值也大打折扣。 ...

2026-08-04 · 更新于 2026-08-14 · 3 min · 434 words

Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

📄 Allocation Before Ranking: Decoupled Token Compression for OmniLLMs 标签:#音视频理解 #模型剪枝 #音频理解 #Transformer #模型评估 8.1/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #模型剪枝 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者及通讯作者:Zhenghui Guo(University of Houston, Department of Computer Science) 作者列表:Zhenghui Guo(University of Houston, Department of Computer Science)、Yilin Yang(University of Houston, Department of Computer Science)、Yuanbin Man(The University of Texas at Arlington, Department of Computer Science and Engineering)、Miao Yin(The University of Texas at Arlington, Department of Computer Science and Engineering)、Weidong Shi(University of Houston, Department of Computer Science)、Rabimba Karanjai(University of Houston, Department of Computer Science)、Omprakash Gnawali(University of Houston, Department of Computer Science)、Chengming Zhang(University of Houston, Department of Computer Science) 通讯作者:论文未单独注明通讯作者,根据惯例及机构信息,第一作者 Zhenghui Guo 通常也是通讯作者。 💡 毒舌点评 这篇文章的洞察力令人印象深刻:敏锐地指出共享注意力中“一次打分,两次决策”的结构性缺陷,将全模态 token 压缩从一个单一的排序问题重新提炼为“先分配容量,后模态内排序”的优化问题,理论分解干净利落。实验也相当扎实,跨 backbone 验证和与 OmniZip 的 Pareto 对比都做得不错。但短板同样明显:方法严重依赖固定的超参(如 α、读层),缺乏针对不同输入分布的在线自适应策略;实验基线虽具代表性,但并未囊括所有近期的训练式压缩方法。这些问题削弱了其实用性闭环论证,离“即插即用”的终极目标还有一步之遥。 ...

2026-08-04 · 更新于 2026-08-14 · 4 min · 681 words

FATE: Frame-Level Audio-Visual Temporal Embedding

📄 FATE: Frame-Level Audio-Visual Temporal Embedding 标签:#音视频理解 #对比学习 #音频理解 #Transformer #模型评估 8.3/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #对比学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Kaisi Guan(未说明) 通讯作者:Ruihua Song(未说明) 作者列表:Kaisi Guan(未说明)、Bingzi Zhang(未说明)、Xihua Wang(未说明)、Ying Ba(未说明)、Xin Cheng(未说明)、Yijing Chen(未说明)、Ruihua Song(未说明) 💡 毒舌点评 这篇论文用一句话就能概括其精髓:拒绝全局池化,把时间轴还给对齐。这个简单但有效的策略直击了当前音视频模型“有语义无时间”或“有时间无语义”的软肋,实验设计和对比验证都非常扎实。唯一的遗憾是,这篇好文章的作者信息像是特工档案——除了名字啥都未说明,代码都开源了,加个机构很费墨吗? 📌 核心摘要 这篇论文旨在解决现有音视频模型无法同时捕捉“语义内容(what)”和“时间同步(when)”的问题。提出的FATE模型摒弃了传统的全局池化操作,保留音视频的帧级特征序列,并通过最近邻插值将它们对齐到统一的物理时间轴上,构建出一个帧级的嵌入空间。其训练策略结合了跨视频的语义对比学习和视频内的时间软对比学习,让模型能在一个统一的嵌入空间中同时编码语义和时间信息。在三个下游任务中,FATE表现优异:在时间跨模态检索上将最强基线提升了超过13个百分点(R@3),在零样本的事件定位任务上达到了48.3%的平均准确率,超越了全监督方法,并且在与人类判断的相关性上优于所有自动评估指标。 ...

2026-08-04 · 更新于 2026-08-14 · 3 min · 478 words

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

📄 FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models 标签:#音视频理解 #多模态模型 #音频理解 #Transformer #模型评估 7.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 ✅ 7.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频理解 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Jeffrey M. Girard (Fluid Concepts Research) 通讯作者:Jeffrey M. Girard (Fluid Concepts Research, jeff@fluidconcepts.ai) 作者列表:Jeffrey M. Girard (Fluid Concepts Research), Jason Z. Zheng (Fluid Concepts Research), Jacqueline R. Vertino (Fluid Concepts Research), Antony D’Avirro (Fluid Concepts Research), Benjamin Peloquin (Fluid Concepts Research) 💡 毒舌点评 这项工作用一个“反语义泄露”的构建思路将社会感知评测推到了更可控的层面,信号检测理论的引入也巧妙揭露了模型“高分偏心”的表象。但96个dyad的小规模基准让多数模型无法显著脱离随机水平,置信区间宽如门板,削弱了排名比较的笃定性;而声称的“人类-模型统计不可区分”在如此小的样本下更像是一个统计学上的“无罪推定”而非真正的性能对齐。 ...

2026-08-03 · 更新于 2026-08-14 · 3 min · 517 words

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

📄 ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine 标签:#音视频理解 #多模态模型 #数据集 #基准测试 #音频理解 8.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5 🔥 8.3/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频理解 | #多模态模型 | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:Yukang Cao (S-Lab, Nanyang Technological University)、Haozhe Xie (S-Lab, Nanyang Technological University)、Beichen Wen (ACE Robotics) 通讯作者:Dacheng Tao (ACE Robotics)、Xiaogang Wang (ACE Robotics)、Liang Pan (ACE Robotics)、Ziwei Liu (S-Lab, Nanyang Technological University) 作者列表:Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu 💡 毒舌点评 本工作搭建了首个在真实家居中同步捕获视觉、全身运动、物体6D轨迹、触觉与音频的大规模数据集,传感器同步与标定硬核,双尺度设计巧妙,彻底告别了具身数据碎片化。然而音频部分彻底沦为花瓶,基准评测仅涉及视觉、触觉和运动,多通道音频信号未被任何下游任务利用,对语音/音频领域而言几乎只是硬件陈列。触觉手套和全身标记的侵入性也可能让“自然行为”打了折扣,数据集的价值能否泛化到无穿戴场景存疑。 ...

2026-07-31 · 更新于 2026-08-14 · 5 min · 853 words

CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions

📄 CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions 标签:#音视频理解 #多模态模型 #数据集 #医疗音频 #基准测试 7.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.7/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频理解 | #多模态模型 | #数据集 #医疗音频 | arxiv 👥 作者与机构 第一作者:David Gimeno-Gómez(PRHLT, Universitat Politècnica de València, Spain; 与 Catarina Botelho 共同第一作者) 通讯作者:未说明 作者列表:David Gimeno-Gómez(PRHLT, Universitat Politècnica de València, Spain)、Catarina Botelho(Sword Health, Portugal; INESC-ID, Portugal)、Carlos-D. Martínez-Hinarejos(PRHLT, Universitat Politècnica de València, Spain)、Isabel Trancoso(INESC-ID, Portugal; Instituto Superior Técnico, Universidade de Lisboa, Portugal)、Alberto Abad(INESC-ID, Portugal; Instituto Superior Técnico, Universidade de Lisboa, Portugal) 💡 毒舌点评 这是一个野心勃勃、工程扎实的多模态医疗数据集,覆盖12种疾病和多维行为特征,其规模和结构化的元数据弥足珍贵。然而,数据集本质上仍是二手数据再加工,缺乏原生的临床验证和标准化录制协议;控制组的构成也使得疾病 vs 健康的对比难以做到纯粹,基于文本叙事推断的情绪和症状元数据更需谨慎使用,否则可能沦为大规模噪声源。 ...

2026-07-29 · 更新于 2026-08-14 · 6 min · 1119 words

DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment

📄 DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment 标签:#音视频理解 #多任务学习 #音频理解 #Transformer #模型评估 4.9/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 4.9/10 | 后50% | 文档类型:方法研究 | 评分置信度:低 | #音视频理解 | #多任务学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Shiyu Teng(立命馆大学信息科学与工程学院) 通讯作者:Yen-Wei Chen(立命馆大学信息科学与工程学院) 其他作者:Haichen Yu(立命馆大学信息科学与工程学院)、Jiaqing Liu(立命馆大学信息科学与工程学院)、Hao Sun(立命馆大学信息科学与工程学院)、Yu Song(立命馆大学信息科学与工程学院)、Shurong Chai(立命馆大学信息科学与工程学院)、Ruibo Hou(立命馆大学信息科学与工程学院)、Lanfen Lin(浙江大学计算机科学与技术学院) 💡 毒舌点评 这项工作在技术设计上展现了一定的巧思,其将DASS-21量表的心理测量结构显式引入多模态融合与交叉任务学习,以及将冻结LLM定位为"证据提取器"而非"预测器"的策略,都体现了不错的洞察力。然而,光有好的想法远远不够。实验部分严重拖了后腿:仅仅在一个私有数据集、一个验证集上跑分,且对比基线陈旧得可怜,竟无一个近年的主流多模态时序融合模型(如MISA、MulT)。这使得所有关于性能提升的声明都悬在半空,无法判断其相对于现代SOTA的真实水平。没有代码、模型或数据开源,加上多个关键超参数缺失,这项工作看起来更像是一个面向特定竞赛的工程方案,其作为普适性方法论的贡献说服力不足。 ...

2026-07-29 · 更新于 2026-08-14 · 2 min · 375 words

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

📄 OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs 标签:#音视频问答 #模型压缩 #音视频理解 #高效推理 #多模态模型 7.0/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频问答 | #模型压缩 | #音视频理解 #高效推理 | arxiv 👥 作者与机构 第一作者:Haoyang Huang (浙江大学, 阿里巴巴通义应用) 通讯作者:Jun Zhang (阿里巴巴通义应用), Xinyi Hu (阿里巴巴通义应用), Meng Zhang (浙江大学) 作者列表:Haoyang Huang (浙江大学, 阿里巴巴通义应用), Wenjie Huang (浙江大学, 阿里巴巴通义应用), Tianqi Xu (卡内基梅隆大学, 阿里巴巴通义应用), Hongyaoxing Gu (中国科学院大学, 阿里巴巴通义应用), Kang Tan (浙江大学), Yikai Fu (浙江大学), Yuhao Shen (浙江大学, 阿里巴巴通义应用), Tianyu Liu (中国科学技术大学), Baolin Zhang (阿里巴巴通义应用), Jun Zhang (阿里巴巴通义应用), Xinyi Hu (阿里巴巴通义应用), Jun Dai (阿里巴巴通义应用), Shuang Ge (阿里巴巴通义应用), Lei Chen (阿里巴巴通义应用), Yue Li (阿里巴巴通义应用), Mingchen Wang (阿里巴巴通义应用), Meng Zhang (浙江大学) 💡 毒舌点评 作者用一个精心设计的诊断实验漂亮地揭露了OmniLLM压缩社区集体忽视的前置问题——预算分配先于token选择,动机部分堪称范本。然而,当读者期待一个纯粹训练无关(training-free)的优雅方案时,作者默默掏出了GPT-5.5-xhigh来完成技能池构建、查询分类和诊断标注,这相当于用F1赛车跑完了"自行车拉力赛"的第一段。整套方案完全闭源,技能池JSON不公布,所有声称的Pareto前沿推进都无法被独立验证——对于一篇声称建立新基线的论文来说,这是硬伤。此外,OmniDelta相比OmniZip的1个百分点平均提升,在缺乏置信区间的情况下,到底是真信号还是统计噪声,只有作者自己清楚。 ...

2026-07-29 · 更新于 2026-08-14 · 4 min · 794 words

Towards High-Level Semantic Intelligence

📄 Towards High-Level Semantic Intelligence 标签:#音视频理解 #多模态模型 #大语言模型 #数据集 #基准测试 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:综述 | 评分置信度:中 | #音视频理解 | #多模态模型 | #大语言模型 #数据集 | arxiv 👥 作者与机构 第一作者:Xiujie Song(X-LANCE Lab, 上海交通大学计算机科学与工程学院) 通讯作者:Mengyue Wu(X-LANCE Lab, 上海交通大学计算机科学与工程学院) 作者列表:Xiujie Song, Gefei Yang, Yining You(以上均为X-LANCE Lab, 上海交通大学),Jiahui Gan(南京大学),Qi Jia(上海人工智能实验室),Shota Watanabe, Tianxi Wan(以上均为X-LANCE Lab, 上海交通大学),Mengyue Wu, Kai Yu(以上均为X-LANCE Lab, 上海交通大学) 💡 毒舌点评 这篇综述野心不小,以“语义复杂度”为名,试图将幽默、隐喻、讽刺、共情、说服和叙事等六大领域的高级语义智能(HLSI)一网打尽,并自创了一套从语义线索到语义效应的形式化框架。文章结构清晰,对超过100个数据集和数千篇文献进行了结构化梳理,并维护了实时更新的开源仓库,为研究者提供了一张宏大的“研究地图”。然而,这篇综述的广度野心牺牲了分析的深度:它对六个庞大的子领域大多止步于文献的“流水账”式列举和分类,缺乏深入的方法论对比和关键洞察;其对音频/语音模态的覆盖尤其单薄,在语音情感、副语言、声学幽默等关键领域着墨甚少,令“多模态”综述的声名有所折扣。此外,其形式化框架虽新颖,却停于概念定义,未经验证。 ...

2026-07-28 · 更新于 2026-08-14 · 3 min · 468 words

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

📄 OmniReasoner: Thinking with Long Audio-Video via Native Tool Use 标签:#音视频理解 #强化学习 #音频理解 #Transformer #模型评估 6.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #强化学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Yu Chen (University of Chinese Academy of Sciences, Institute of Automation, CAS)(工作于实习期间完成于Shopee) 通讯作者:Haibo Zhang (Shopee)、Chaofan Chen (Beijing University of Technology) 作者列表:Yu Chen(University of Chinese Academy of Sciences, Institute of Automation, CAS)、Caorui Li(Southeast University)、Ziyu Xiong(Southeast University)、Yidong Wang(Shopee)、Mingqi Gao(Tsinghua University)、Shuman Liu(Shopee)、Biao Liu(Southeast University)、Chunfeng Yang(Southeast University)、Anxiang Zeng(Shopee)、Haibo Zhang(Shopee)、Chaofan Chen(Beijing University of Technology) 💡 毒舌点评 亮点:本文将主动工具使用范式创新性地引入长音视频推理,设计了一个两阶段(全局预览 + 局部聚焦)的端到端可训练框架。核心设计——TimeAnchor机制——通过简单的文本时间标记巧妙解决了跨采样粒度(稀疏全局预览 vs. 稠密局部片段)下工具参数的时间对齐难题,设计简洁有效。配套的“时间增强数据引擎”实现了工具使用轨迹的自动合成,减少了对昂贵人工标注的依赖。实验在多个音视频和视频基准上展现了稳定提升。 短板:论文对“音频”模态的处理深度严重不足。音频在框架中仅作为视频的附属信息被压缩编码(2秒区块内的token),未能作为独立的推理主体进行深入分析(如声音事件定位、语音内容理解)。这导致其核心贡献实质上是“长视频+辅助音频”的推理,而非真正的“音视频”联合推理。此外,工具类型单一(仅时间放大),依赖特定基座模型(Qwen-Omni的交织方案),评估基准存在偏好,这些都限制了其通用性和影响力。 ...

2026-07-23 · 更新于 2026-08-14 · 3 min · 543 words