NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

📄 NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating #音频事件检测 #长音频处理 #高效推理 5.5/10 | 创新 1/2 | 严谨 0.7/1.5 | 实验 0.8/1.5 | 清晰 0.4/1 | 影响 0.5/1.5 | 开源 0.8/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 📝 5.5/10 | 前50% | #音频事件检测 | #音频大模型 | #长音频处理 #高效推理 | arxiv 👥 作者与机构 第一作者:Zhongju Yuan(WAVES Research Group, Ghent University, Gent, Belgium) 通讯作者:Zhongju Yuan(zhongju.yuan@ugent.be) 作者列表:Zhongju Yuan(Ghent University)、Geraint A. Wiggins(Vrije Universiteit Brussel; Queen Mary University of London)、Dick B.M. Botteldooren(Ghent University) 💡 毒舌点评 这篇论文将“选择性注意”包装成一个神经启发的波动力学问题,想法有趣,但数学与工程落地之间存在不小的鸿沟。OWM的Bragg共振最优性证明看似漂亮,但从离散格点方程跳跃到连续介质近似的过程略显随意,部分定理(如Theorem 2.3)在连续假设下漂亮但实际系统离散、有界,理论对实际设计的指导意义有限。此外,实验仅在两个数据集上进行,主要性能提升(17.1% AP)令人印象深刻,但对比基线AudioQwen全量推理表现过弱(53.50% AP),且论文未与任何基于深度特征的时序模型基线(如简单的GRU/LSTM漂移检测器)对比,让人难以判断OWM复杂的波动力学机制是否真有必要。自适应阈值依赖多个手动设定的参数(W=20, α=0.2),其跨场景泛化能力存疑。论文自我定位为“训练自由”方法,但严重依赖两个大规模预训练模型(PANN和AudioQwen),这种“自由”是建立在他人训练成果之上的。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 377 words

Native Active Perception as Reasoning for Omni-Modal Understanding

📄 Native Active Perception as Reasoning for Omni-Modal Understanding #多模态模型 6.8/10 | 创新 1.6/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.6/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | #音视频理解 | #强化学习 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Zhenghao Xing(香港中文大学)、Ruiyang Xu(上海交通大学)、Yuxuan Wang(阿里巴巴通义千问团队) 通讯作者:Jin Xu(jxu3425@gmail.com)、Pheng-Ann Heng(pheng@cse.cuhk.edu.hk) 完整作者列表:Zhenghao Xing1, Ruiyang Xu2, Yuxuan Wang3, Jinzheng He3, Ziyang Ma2,4, Qize Yang3, Yunfei Chu3, Jin Xu3, Junyang Lin3, Chi-Wing Fu1, Pheng-Ann Heng1 ( 共同一作;1 香港中文大学计算机科学与工程系;2 上海交通大学;3 阿里巴巴通义千问团队,Qwen Team;4 南洋理工大学) 💡 毒舌点评 这篇工作在“让MLLM学会像人一样主动看视频”的agentic范式上做出了优雅且扎实的尝试——将长视频理解重塑为POMDP中的迭代感知过程,并用TAURA解决了GRPO在多轮推理中的信用分配难题,让7B模型在LVBench上正面击败了10倍大的静态模型,这个结果本身具备足够的冲击力。然而,对于语音/音频领域的审稿人而言,这份工作的吸引力会打折扣:论文的核心卖点是交互范式和视频理解效率,音频在这里更像是个“锦上添花”的模态输入,而非被深入研究的感知对象。尽管“全模态”的旗号已经打出,但论文并未在诸如长播客理解、复杂声学场景对话、ASR等纯音频任务上验证方法的迁移性,其“Omni”的宣称尚缺乏来自音频社区的严苛审视。如果投到纯音频会议,这艘船可能因为“货物不对板”而吃水过深。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 367 words

Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation

📄 Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation #音视频语音分离 #语音增强 #多模态模型 6.2/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.6/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.2/10 | 前50% | #音视频语音分离 | #多模态模型 | #语音增强 | arxiv 👥 作者与机构 第一作者:Xinmeng Xu(岭南大学人工智能系,Department of Artificial Intelligence, Lingnan University) 通讯作者:Haoran Xie(岭南大学人工智能系,Department of Artificial Intelligence, Lingnan University) 作者列表:Xinmeng Xu(岭南大学人工智能系)、Haoran Xie(岭南大学人工智能系)、Xiaohui Tao(南昆士兰大学数学物理与计算学院,School of Mathematics, Physics and Computing, University of Southern Queensland)、Lin Li(武汉理工大学计算机科学与人工智能学院,School of Computer Science and Artificial Intelligence, Wuhan University of Technology)、S. Joe Qin(岭南大学人工智能系) 💡 毒舌点评 这篇论文从认知神经科学中搬来“听觉选择”和“跨模态补偿”的双阶段机制,并在AVSS架构中将其显式化为ASM和CCM模块,想法干净且有洞察力。在LRS2/3和VoxCeleb2上以6.3M的参数稳定超越包括AV-CrossNet在内的现有SOTA,且多说话人重叠和视觉降质下的表现更加突出。然而,致命伤是完全闭源:无代码、无模型、无Demo链接,这在2024年后的ML顶会中极度罕见且难以接受。此外,Section 3.1的信息论不等式与模块设计之间存在一条明晃晃的鸿沟:Eq. 2中的β项从未在损失函数中出现过,其“理论指导设计”的说法本质上是一种后验包装。总体而言,这是一篇工程扎实但理论过度声称、且因闭源而严重削弱影响力的工作。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 662 words

NeuroCLUS: A Foundation Model with Functional Clustering for Intracranial Neural Decoding

📄 NeuroCLUS: A Foundation Model with Functional Clustering for Intracranial Neural Decoding #语音识别 #自监督学习 #预训练 #图神经网络 #医疗音频 6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6/10 | 前50% | #语音识别 | #自监督学习 | #预训练 #图神经网络 | arxiv 👥 作者与机构 第一作者:Hui Zheng(Independent Researcher) 通讯作者:Hui Zheng(icml2026.neuroclus@gmail.com) 作者列表:Hui Zheng(Independent Researcher)、Hai-Teng Wang(Independent Researcher) 💡 毒舌点评 这项工作敏锐地捕捉到了现有iEEG基础模型在tokenization粒度上的核心矛盾——要么太细(单通道)要么太粗(全脑聚合),提出的两阶段功能聚类策略直击要害,在Du-IN语音生成任务上甚至大幅超越了专门的SOTA模型(65.92% vs 62.70%),这点值得称赞。然而,完全忽略解码任务中至关重要的时序动态聚类(即功能模块可能随时间漂移这一基本神经科学事实),仅用静态的功能依赖图指导token聚合,导致模型对复杂认知过程的适应性存疑;同时“独立研究者”的身份与高达10k小时的预训练数据和8张A100的算力需求存在一定张力,缺少代码和模型权重也使得“SOTA”声称暂时难以验证。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 788 words

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

📄 Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion 5.8/10 | 创新 0.9/2 | 严谨 0.9/1.5 | 实验 0.6/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 📝 5.8/10 | 前50% | arxiv 👥 作者与机构 第一作者:Lijiang Li(南京大学计算机软件新技术国家重点实验室、南京大学智能科学与技术学院) 通讯作者:Chaoyou Fu(南京大学计算机软件新技术国家重点实验室、南京大学智能科学与技术学院) 作者列表:Lijiang Li(南京大学)、Zuwei Long(腾讯优图实验室)、Yunhang Shen(腾讯优图实验室)、Heting Gao(腾讯优图实验室)、Haoyu Cao(腾讯优图实验室)、Xing Sun(腾讯优图实验室)、Caifeng Shan(南京大学)、Ran He(中国科学院自动化研究所)、Chaoyou Fu(南京大学) 💡 毒舌点评 本文提出将mask-based discrete diffusion应用于any-to-any多模态系统,这一方向选择确实体现了对非自回归范式潜力的洞察。三阶段渐进式训练、SDVI数据集构建以及position penalty等推理trick形成了一套相对完整的技术方案。但问题也很突出:实验对比基线严重过时(LLaVA、InstructBLIP均为2023年工作),text-to-image的CLIP分数(CLIP-T 0.236)远低于实用水平,ASR的WER 6.69%更是不可接受。作者声称的"comparable or even better"需要更充分的证据,与2024-2025年主流系统的对比完全缺失。SDVI数据集依赖语音合成,其质量对结论的影响未被讨论。某些关键设计(如自适应长度系数)过于经验化,缺乏敏感性分析。 📌 核心摘要 本文提出Omni-Diffusion,首个完全基于mask-based discrete diffusion的any-to-any多模态语言模型,统一处理文本、图像、语音的理解与生成。其核心方法是将多模态数据统一离散token化——使用MAGViT-v2作为图像tokenizer(下采样因子f=16,codebook size 8192)、SenseVoiceSmall作为语音编码器、GLM-4-Voice decoder作为语音解码器(token rate 12.5Hz,codebook size 16384)。在预训练的Dream-7B扩散语言模型上,通过扩展vocabulary来统一建模多模态离散token的联合分布,并在mask-token prediction框架下训练。与现有autoregressive多模态系统(如AnyGPT、NExT-GPT等)不同,Omni-Diffusion用扩散模型的并行解码替代自回归生成,天然支持图像inpainting等任务。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 720 words

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

📄 Omni-Perception Policy Optimization for Multimodal Emotion Reasoning 7.4/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.4/10 | 前50% | #音视频理解 | #强化学习 | arxiv 👥 作者与机构 第一作者: Zhiyuan Han (University of Science and Technology of China, SenseTime Research, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center) 通讯作者: Xun Yang (University of Science and Technology of China), Beier Zhu (University of Science and Technology of China) 作者列表: Zhiyuan Han (USTC, SenseTime, Hefei Institute), Beier Zhu (USTC), Wenwen Tong (SenseTime), Pengyang Shao (National University of Singapore), Peipei Song (USTC), Xinyi Wang (USTC), Jiangnan Chen (SenseTime), Lewei Lu (SenseTime), Xun Yang (USTC) 💡 毒舌点评 论文精准地抓住了现有情感多模态大模型“思考链中缺乏可靠感知”的痛点,将感知可靠性分解为利用率和忠实度两个可量化原则,并设计了细粒度线索覆盖奖励与模态特定token的KL惩罚,构思巧妙。附录中的信息论分析试图为协同效应提供理论支撑,虽然略显牵强,但不失为一次有趣的尝试。然而,全文最致命的硬伤在于零开源的姿态:声称构建了诊断基准MEP-Bench并刷新了多项SOTA,却未提供任何代码、模型权重或数据集,这使得“可复现”和“促进社区发展”的承诺显得苍白无力。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 469 words

OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models

📄 OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models #音视频理解 #模型压缩 #多模态模型 #高效推理 6.3/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0.1/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 6.3/10 | 前50% | #音视频理解 | #模型压缩 | #多模态模型 #高效推理 | arxiv 👥 作者与机构 第一作者:Zining Wang(北京航空航天大学计算机科学与工程学院,复杂与关键软件环境国家重点实验室) 通讯作者:Xianglong Liu(北京航空航天大学计算机科学与工程学院,复杂与关键软件环境国家重点实验室) 其他作者:Zhihang Yuan(北京大学)、Yingjie Zhai(华为技术有限公司)、Wenshuo Li(华为技术有限公司)、Han Shu(华为技术有限公司)、Ruihao Gong(复杂与关键软件环境国家重点实验室)、Jinyang Guo(北京航空航天大学计算机科学与工程学院/人工智能学院,复杂与关键软件环境国家重点实验室) 💡 毒舌点评 这篇论文的动机分析(层间异质性和跨模态锚点驱动)是一次漂亮的现象学观察,作者花了大力气证明“为什么”需要层自适应和跨模态对齐。但坦白说,方法论上更像一个“证件照”:SVD、DPC-KNN、余弦相似度这套组合拳看起来体面,深究下去却没有真正的新算法原理。核心卖点“training-free”既是铠甲也是软肋——轻量化部署确实友好,但也意味着它永远只能做“事后诸葛亮”,无法改变模型自身对冗余信息的处理逻辑。实验覆盖面广是优点,但依然缺少对深层why的拷问:为什么基于静态编码器输出的余弦相似度,能成为深层复杂语义交互的良好代理?这篇工作给了一个“够用”的解释,但离“令人信服”还有距离。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 466 words

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

📄 OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation 6.9/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ✅ 6.9/10 | 前50% | #音视频生成 | #流匹配 | arxiv 👥 作者与机构 第一作者:Donghao Zhou(香港中文大学)、Guisheng Liu(字节跳动)(共同第一作者) 通讯作者:Shilei Wen(字节跳动)、Pheng-Ann Heng(香港中文大学) 作者列表: Donghao Zhou(香港中文大学) Guisheng Liu(字节跳动) Hao Yang(字节跳动) Jiatong Li(字节跳动,项目负责人) Jingyu Lin(蒙纳士大学) Xiaohu Huang(香港大学) Yichen Liu(字节跳动) Xin Gao(字节跳动) Cunjian Chen(蒙纳士大学) Shilei Wen(字节跳动) Chi-Wing Fu(香港中文大学) Pheng-Ann Heng(香港中文大学) 💡 毒舌点评 论文在工程整合上展现出成熟的工业级执行力,统一通道注入与解耦再联合训练策略切实解决了多模态视频生成的数据异构难题,并贡献了专用于HOIVG的HOIVG-Bench基准。然而,方法内核本质上是对现有技术(通道拼接、线性插值融合、窗口注意力)的高超缝合,缺少方法论层面的本质突破;与级联基线的对比设计合理,但实验部分仍缺乏关键的消融(如融合比例的具体影响、姿态引入阶段的严格对照),且评测只覆盖5秒片段,长视频质量、推理效率与规模化边界均未触及。音频条件的评测仍属视频领域的附属品,门控向量的分析虽有启发性,但距离纯粹的语音/音频社区直接影响有限。若无法公开模型与数据,其复现价值和社区推动力将大打折扣。 ...

2026-07-04 · 更新于 2026-07-28 · 5 min · 1042 words

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

📄 OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models #音视频问答 #模型压缩 7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | #音视频问答 | #模型压缩 | arxiv 👥 作者与机构 第一作者(共一):Yue Ding(中国科学院自动化研究所模式识别国家重点实验室;快手科技Kling团队)与 Yiyan Ji(南京大学) 通讯作者:Qiang Liu(中国科学院自动化研究所模式识别国家重点实验室) 作者列表:Yue Ding(中科院自动化所;快手科技)、Yiyan Ji(南京大学)、Jungang Li(香港科技大学(广州))、Xuyang Liu(四川大学)、Xinlong Chen(中科院自动化所)、Junfei Wu(中科院自动化所)、Bozhou Li(北京大学)、Bohan Zeng(北京大学)、Yang Shi(北京大学)、Yushuo Guan(快手科技)、Yuanxing Zhang(快手科技)、Jiaheng Liu(南京大学)、Qiang Liu(中科院自动化所)、Pengfei Wan(快手科技)、Liang Wang(中科院自动化所) 💡 毒舌点评 这篇论文的“视觉先行、再引导音频”两阶段压缩,直觉干净,实验也漂亮——35% tokens就能战平甚至略超 full-token baseline,效率提升显著。但自信别太早:核心实验全在 Qwen2.5-Omni 上跑,换到 Qwen3-Omni 马上掉点(DailyOmni 70.5 vs. 70.8 full),说明方法的普适性没那么神。STVP 那套“按位置算余弦距离就当时间显著性”的操作,本质上仍在像素级做差分,真正的物体运动、遮挡这些时序动态它根本没建模,却好意思标榜“temporal redundancy”处理。Chunk 级剪枝更是直接摆烂,跨 chunk 长程依赖直接放弃,这可是 long-form 理解的基本盘。想法好、工程值钱,但别急着说自己是范式开创者。 ...

2026-07-04 · 更新于 2026-07-28 · 7 min · 1345 words

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

📄 OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention #音视频问答 #强化学习 #后训练 #对比学习 #自监督学习 7.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | #音视频问答 | #强化学习 | #后训练 #对比学习 | arxiv 👥 作者与机构 第一作者:Zhangquan Chen(清华大学,THU;实习于腾讯HY) 通讯作者:Ruqi Huang(清华大学深圳国际研究生院,sz.tsinghua.edu.cn)、Jiale Tao(腾讯HY,jialetao.std@gmail.com) 作者列表:Zhangquan Chen(清华大学)、Jiale Tao(腾讯HY)、Ruihuang Li(腾讯HY)、Yihao Hu(湖南大学,HNU)、Ruitao Chen(腾讯HY)、Zhantao Yang(腾讯HY)、Xinlei Yu(新加坡国立大学,NUS)、Haodong Jing(西安交通大学,XJTU)、Manyuan Zhang(香港中文大学,CUHK)、Shuai Shao(腾讯HY)、Biao Wang(腾讯HY)、Qinglin Lu(腾讯HY)、Ruqi Huang(清华大学深圳国际研究生院) 💡 毒舌点评 这篇论文精准地抓住了“多模态模型一加音频就变傻”的痛点,提出的两阶段RL框架,特别是用自监督时间-字幕对齐来驱动查询密集型局部定位,设计思路相当巧妙,拿掉了过程级标注这个昂贵的门槛。然而,死穴和亮点一样突出:整个奖励函数几乎把身家性命都押在了外部judge模型的质量上,论文对judge偏差传播和reward hacking的风险几乎没有展开讨论,这让人对训练信号的可靠性打上一个大大的问号;更致命的是,所有代码、模型权重和训练数据均未开源,号称“第一个RL框架”却把复现门槛拉满,使得那些漂亮的SOTA数字目前只能被视为“纸上SOTA”,在第三方验证之前说服力大打折扣。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 439 words