Ariadne's Thread of LipSync: Unraveling Forgeries via Inconsistency between Lip Motions and Head Poses

📄 Ariadne’s Thread of LipSync: Unraveling Forgeries via Inconsistency between Lip Motions and Head Poses 7.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.8/10 | 前25% | #音视频理解 | #对比学习 | arxiv 👥 作者与机构 第一作者:Tianyi She(中国科学技术大学,University of Science and Technology of China) 通讯作者:Kejiang Chen(中国科学技术大学,University of Science and Technology of China) 作者列表:Tianyi She(中国科学技术大学)、Jiawei Liu(上海交通大学)、Weifeng Liu(北京大学)、Hanqing Zhao(南洋理工大学)、Weiming Zhang(中国科学技术大学)、Kejiang Chen(中国科学技术大学) 💡 毒舌点评 论文提出利用唇动-头姿生理耦合不一致来检测 LipSync 伪造,思路有新意且动机分析充分,统一检测+归因的两阶段设计也比较完整。但所有辉煌结论都建立在自建的 LipSync-A 数据集上——该数据集目前无任何下载链接,代码和模型也未公开,将外部独立验证的门彻底关死,极大地削弱了可信度。此外,归因仅做到生成器架构族级别,离真正的细粒度模型溯源尚有距离。两阶段分开训练且 Stage II 依赖 Stage I 编码器冻结,这种设计是否最优也值得商榷。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 698 words

Attend to Anything: Foundation Model for Unified Human Attention Modeling

📄 Attend to Anything: Foundation Model for Unified Human Attention Modeling 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.2/10 | 前25% | #音视频理解 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Wenzhuo Zhao(四川大学计算机学院) 通讯作者:Keren Fu(四川大学计算机学院,国家合成视觉重点实验室) 作者列表:Wenzhuo Zhao(四川大学计算机学院)、Ronghao Xian(四川大学计算机学院)、Keren Fu(四川大学计算机学院,国家合成视觉重点实验室)、Qijun Zhao(四川大学计算机学院,国家合成视觉重点实验室) 💡 毒舌点评 本文以双曲空间层级蕴含与Fokker-Planck动力学统一图像、视频、音视频注意力建模,思路新颖且物理可解释性较强,在16个基准上刷出均6%的提升,并承诺开源代码和数据集,为该领域首个统一基础模型做出了有意义的尝试。然而,音频-视觉融合模块本质上是一个“视觉特工”,仅在语义相关时对视觉特征进行调制,对纯音频领域的借鉴价值极其有限;尽管有聪明的条件交换实验,但文本条件的设计仍依赖人工构建的数据集级提示,模型对真实开放世界中未见文本组合的泛化能力仍缺少系统压测,整体离“Attend to Anything” 的宏大叙事还有距离。 📌 核心摘要 论文旨在解决人类注意力建模(saliency prediction)因场景、模态、任务割裂而缺乏通用基础模型的问题。核心方法是将注意力差异定义为一种从通用倾向到具体任务的层级蕴含关系,并在双曲空间(Lorentz模型)中通过文本提示实现层级嵌入约束;视频动态则用Fokker-Planck方程统一为静态注意力的扩散演化,以物理驱动取代传统滑窗时空建模。相比现有参数隔离或多头微调方案,AAM在几何空间中显式编码层次语义,并通过算子分裂实现逐帧高效推断。实验在16个数据集上覆盖图像、视频、音视频,平均相对提升约6%,视频推理速度提升约4倍。主要实验结果如下: Dataset Method CC↑ KLD↓ AUC↑ SIM↑ NSS↑ MIT1003(图像) AAM 0.831 0.446 0.923 0.674 — CAT2000(图像) AAM 0.906 0.235 0.890 0.769 — SALICON(图像) AAM 0.925 0.163 0.876 0.819 — DIEM(音视频) AAM 0.710 — 0.919 — 2.88 Coutrot2(音视频) AAM 0.887 — 0.971 — 7.46 DHF1K(视频) AAM 0.563 — 0.919 0.421 3.272 Hollywood2(视频) AAM 0.742 — 0.944 0.599 4.055 实际意义在于为注意力预测提供了第一个能跨模态、跨场景、跨任务统一迁移的基础模型,且推理高效。主要局限性是音频输入在模型中仅为轻量调制,未深度挖掘复杂声学场景,且文本条件依赖数据集级描述,对通用情况的泛化能力有待验证。训练数据存在显著的静态图像占比过高(88%)及由此可能引入的数据集偏差。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 414 words

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

📄 AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing #多模态模型 #音频生成 #音频理解 #语音合成 #说话人日志 5.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.6/1 | 影响 0.9/1.5 | 开源 0.1/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 📝 5.8/10 | 前50% | #音频生成 | #扩散模型 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:William Chen(Adobe Research, Carnegie Mellon University) 通讯作者:William Chen williamchen@cmu.edu, Prem Seetharaman pseeth@adobe.com 作者列表:William Chen(Adobe Research, Carnegie Mellon University)、Prem Seetharaman(Adobe Research)、Rithesh Kumar(Adobe Research, OpenAI)、Oriol Nieto(Adobe Research)、Shinji Watanabe(Carnegie Mellon University)、Justin Salamon(Adobe Research)、Zeyu Jin(Adobe Research) 💡 毒舌点评 这是一篇工程味很重的工作,为统一处理复杂多源音频场景提供了一个端到端的解决方案,pipeline设计完整。但核心创新很有限,本质是将视觉领域的Transfusion和Diffusion Forcing技术结合后迁移到音频,并强依赖于一个用专有模型合成的数据集。评测高度内循环,在域外真实音频上的泛化性存疑,且模型不公开,更像是Adobe内部技术实力的展示而非推动社区开放研究的产物。 ...

2026-07-04 · 更新于 2026-07-27 · 3 min · 550 words

AudioMosaic: Contrastive Masked Audio Representation Learning

📄 AudioMosaic: Contrastive Masked Audio Representation Learning #音频分类 7.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.7/10 | 前25% | #音频分类 | #对比学习 | arxiv 👥 作者与机构 第一作者:Hanxun Huang(School of Computing and Information Systems, The University of Melbourne, Australia) 通讯作者:Hanxun Huang(The University of Melbourne)、Christopher Leckie(The University of Melbourne) 作者列表:Hanxun Huang(The University of Melbourne)、Qizhou Wang(The University of Melbourne)、Xingjun Ma(Institute of Trustworthy Embodied AI, Fudan University)、Cihang Xie(Baskin School of Engineering, University of California, Santa Cruz)、Christopher Leckie(The University of Melbourne)、Sarah Monazam Erfani(The University of Melbourne) 💡 毒舌点评 这篇工作把 SpecAugment 的灵魂塞进了对比学习的壳子里,用结构化时频掩码造正样本,配上有效秩分析来解释为何此法能缓解维度崩塌,逻辑自洽、实验详实、效果亮眼。但本质上仍是"结构化掩码+SimCLR"的工程重组,理论新颖度有限,与 Audio‑LLM 的对接仅停留在替换编码器的层面,缺乏深入的协同优化,收益虽稳但未惊艳。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 794 words

AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning

📄 AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning #音频理解 #音频大模型 #强化学习 #低资源 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.2/10 | 前50% | #音频理解 | #强化学习 | #音频大模型 #低资源 | arxiv 👥 作者与机构 第一作者:Siqian Tong(中国科学院声学研究所,中国科学院大学) 通讯作者:Siqian Tong(中国科学院声学研究所,中国科学院大学)、Xuan Li(中国科学院声学研究所,中国科学院大学) 作者列表:Siqian Tong(中国科学院声学研究所)、Xuan Li(中国科学院声学研究所)、Yiwei Wang(加州大学默塞德分校)、Baolong Bi(中国科学院计算技术研究所)、Yujun Cai(昆士兰大学)、Shenghua Liu(中国科学院计算技术研究所)、Yuchen He(中国科学院计算技术研究所)、Chengpeng Hao(中国科学院声学研究所) 💡 毒舌点评 这篇论文在音频工具增强推理上的探索方向值得肯定,差分奖励机制的设计也算巧妙。但话说回来,仅在2000样本上训练的RL策略、6个固定工具的微缩库,再加上对ReAct等成熟工具调度框架的刻意回避,让“范式转移”的宣称显得过于膨胀。整体工作更像是在已知的RL+Tool框架上,于音频领域完成了一次精巧但有限的适配验证,深度和广度都还欠火候。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 342 words

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

📄 AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation 7.6/10 | 创新 1.1/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | #音视频生成 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Ziwei Zhou(复旦大学)、Zeyuan Lai(中国科学技术大学)(共同一作) 通讯作者:Yifan Yang(Microsoft Research Asia) 其他作者:Rui Wang(复旦大学)、Yuqing Yang(Microsoft Research Asia)、Qi Dai(Microsoft Research Asia)、Lili Qiu(Microsoft Research Asia)、Chong Luo(Microsoft Research Asia) 💡 毒舌点评 这篇工作用一个设计良好的任务驱动基准和混合评估框架,把当前 T2AV 模型在音乐音高、文本渲染、物理推理等方面的“车祸现场”系统地曝光了出来,对领域极具诊断价值。然而,评测在音高维度因模型全面崩盘而存在地板效应,区分度与人类一致性均较低;对闭源 MLLM 的过度依赖和对评估模块自身的敏感性分析缺失,让这一精细指标的长期可靠性存疑。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 644 words

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

📄 AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs #音视频理解 #多模态模型 #基准测试 7.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | #音视频理解 | #多模态模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Yaoting Wang(复旦大学大数据学院) 通讯作者:Henghui Ding(复旦大学大数据学院) 作者列表:Yaoting Wang(复旦大学大数据学院)、Ziyi Zhang(华中科技大学)、Wenming Tu(上海交通大学)、Shaoxuan Xu(中国人民大学)、Wenjie Du(南洋理工大学)、Cheng Liang(上海交通大学)、Weijun Wang(清华大学智能产业研究院(AIR))、Yuanchao Li(爱丁堡大学)、Guangyao Li(清华大学)、Hao Fei(牛津大学)、Yuanchun Li(清华大学智能产业研究院(AIR))、Henghui Ding(复旦大学大数据学院)、Yunxin Liu(清华大学智能产业研究院(AIR)) 💡 毒舌点评 这篇论文野心勃勃地构建了一个认知启发的音视频智能评测基准,四层分类法试图用精巧的数学公式来量化“类人”智能。然而,这套公式的惩罚系数(α=0.5)选择得相当随意,其理论或实证根据约等于零,更像是为了给一个朴素的直觉套上学术外衣。论文声称追求“类人”智能,却将与人类表现的巨大差距简单归因于模型能力不足,而对基准任务本身可能存在的、未对齐人类能力评估的深层问题避而不谈,这无疑是一种自我实现的预言。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 354 words

AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

📄 AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes #音视频理解 #多模态模型 9.3/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 9.3/10 | 前10% | #音视频理解 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Yaoting Wang(复旦大学大数据学院、计算机科学技术学院/人工智能学院) 通讯作者:Henghui Ding hhding@fudan.edu.cn(复旦大学大数据学院、计算机科学技术学院/人工智能学院) 作者列表:Yaoting Wang(复旦大学大数据学院、计算机科学技术学院/人工智能学院)、Yun Zhou(同上)、Zipei Zhang(同上)、Henghui Ding(同上) 💡 毒舌点评 AVTrack用一个精心策划的、仅含测试集的基准,漂亮地撕下了现有AVIS方法在真实复杂场景下的“遮羞布”。八个挑战维度覆盖全面,让那些在简单场景中“称王称霸”的模型原形毕露——HOTA不足21,堪称惨烈。然而,论文提出的“救世主”基线AVTracker,本质上是一个靠堆砌VLM和SAM“老本”的模块化流水线。其推理开销大到离谱(每帧18,900 GFLOPs),速度仅为0.21 FPS,且整个基准不提供训练集,让“如何在这套场景上通过训练真正变强”成为一个悬而未决的开放问题。这更像是一个昂贵的“鉴定师”,而非一个实用的“解题者”。 📌 核心摘要 本论文针对现有人中心音频视觉实例分割(AVIS)基准场景简单、缺乏动态挑战的问题,提出了AVTrack数据集,包含871个视频、3120个精细标注的实例轨迹,覆盖视觉遮挡、相机运动变化、多轮说话等八类复杂条件。该数据集定位为纯测试集,旨在提供一个长期稳定的评估平台。 方法上,论文设计了一个基于模块化流水线的基线AVTracker,利用Whisper转写与说话人嵌入进行语块聚合,再配合视觉大模型(VLM)Qwen3-VL和SAM3在局部窗口内建立音视对应,最后通过全局推理模块关联同一说话人的轨迹片段。与以往端到端AVIS方法相比,AVTracker的独特之处在于其训练无关、可插拔的模块化架构,直接用文本语义桥接音频和视觉。在AVTrack上的实验表明,主流VIS方法HOTA<12,最强AVIS方法HOTA<21,而AVTracker达到了29.08 HOTA,领先约8个点。此外,论文还与商业模型Gemini 2.5 Pro进行了零样本对比,其HOTA仅为14.4,进一步证明了AVTrack的挑战性。该基准为评估复杂场景下的人中心音视理解提供了有价值的测试平台;其主要局限是计算代价极高,且纯测试集设计使模型无法利用场景内训练数据进行适配。 主要实验结果如下(表2摘要,数值为百分比): 方法类型 方法名称 HOTA DetA AssA IDF1 MOTA VIS VITA 9.70 10.54 9.35 12.32 1.91 VIS LBVQ 10.29 11.77 9.36 12.87 1.98 VIS CAVIS 11.46 12.10 10.07 12.95 1.96 AVIS AVISM 20.84 23.22 19.53 26.57 3.95 AVIS ACVIS 20.60 22.59 19.66 26.23 4.23 AVIS AVTrackFormer 21.47 22.51 20.26 26.41 4.11 AVIS AVTracker 29.08 31.18 28.47 34.55 16.20 🔗 开源详情 代码:论文仅提供了项目网站,未提及公开代码仓库。 模型权重:论文未提及提供模型权重。 数据集:论文声明提供数据集下载,但报告中未提及可直接访问的下载链接。根据摘要,项目网站为 https://FudanCVL.github.io/AVTrack/。 Demo:论文中未提及。 复现材料:论文附录F提供了基线AVTracker的实现细节和超参数配置,附录G提供了VLM推理所用的提示,但未提供可直接运行的代码和检查点。 论文中引用的开源项目: SAM (Kirillov et al., 2023) Grounded-SAM (Ren et al., 2024) Mask2Former (Cheng et al., 2022) VITA (Heo et al., 2022) Qwen3-VL (Bai et al., 2025) Whisper (Radford et al., 2023) SpeechBrain / ECAPA-TDNN (Desplanques et al., 2020) MossFormer2 (Zhao et al., 2024) SAM 3 (Carion et al., 2025) 🏗️ 方法概述和架构 AVTracker是一个三阶段、完全基于预训练模型的模块化流水线,不进行任何任务特定训练。其核心思想是利用文本作为音频和视觉之间的语义桥梁,通过"局部音视匹配+全局身份关联"的策略完成追踪。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 328 words

BAT: Better Audio Transformer Guided by Convex Gated Probing

📄 BAT: Better Audio Transformer Guided by Convex Gated Probing #音频分类 #音频事件检测 #语音识别 #自监督学习 #Transformer 8.6/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.6/10 | 前25% | #音频分类 | #自监督学习 | #音频事件检测 #语音识别 | arxiv 👥 作者与机构 第一作者:Houtan Ghaffari(Ghent University)、Lukas Rauch(University of Kassel,现就职于 Earth Species Project)(并列一作) 通讯作者:Houtan Ghaffari(Ghent University)、Lukas Rauch(University of Kassel) 作者列表:Houtan Ghaffari(Ghent University)、Lukas Rauch(University of Kassel,现就职于 Earth Species Project)、Christoph Scholz(University of Kassel,Fraunhofer IEE)、Paul Devos(Ghent University) 发表于 ICML 2026,首尔,韩国 💡 毒舌点评 论文以鲜明的"探测优先于微调"的评估哲学切入,提出的 CGP 和 BAT 形成了一套从评估到模型设计的闭环,实验维度相当完整且可复现性意识强。不过,其 AS-2M 的最终微调性能未能超越已报告 SOTA(Reported SSLAM 50.2 vs BAT 48.85),且性能提升的来源存在一定"调参红利"嫌疑,部分结论的泛化性仍待更严格的跨框架验证。 ...

2026-07-04 · 更新于 2026-07-27 · 8 min · 1519 words

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

📄 BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps #音乐生成 #自回归模型 #实时处理 #多任务学习 7.6/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | #音乐生成 | #自回归模型 | #实时处理 #多任务学习 | arxiv 👥 作者与机构 第一作者:Lekai Qian(华南理工大学) 通讯作者:Lekai Qian(华南理工大学)、Ziyu Wang(Mohamed bin Zayed University of Artificial Intelligence / 纽约大学) 作者列表:Lekai Qian(华南理工大学)、Haoyu Gu(华南理工大学)、Jingwei Zhao(新加坡国立大学)、Ziyu Wang(Mohamed bin Zayed University of Artificial Intelligence / 纽约大学) 💡 毒舌点评 亮点在于将钢琴卷的稀疏性与节拍网格的规律性注入 token 化设计,用节拍内基‑3 编码和相对音高实现了紧凑、时移/移调具有部分不变性的表示,并天然适配实时因果生成,思路干净利落。短板上,严格依赖量化 MIDI,对演奏 MIDI 几乎直接失效;节拍内模式词汇随分辨率 τ 呈指数长尾分布,细粒度韵律建模受限;实时伴奏对比的基线仅 SongDriver,有自卖自夸之嫌。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 700 words