Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation

📄 Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation #音视频语音分离 #语音增强 #多模态模型 6.2/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.6/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.2/10 | 前50% | #音视频语音分离 | #多模态模型 | #语音增强 | arxiv 👥 作者与机构 第一作者:Xinmeng Xu(岭南大学人工智能系,Department of Artificial Intelligence, Lingnan University) 通讯作者:Haoran Xie(岭南大学人工智能系,Department of Artificial Intelligence, Lingnan University) 作者列表:Xinmeng Xu(岭南大学人工智能系)、Haoran Xie(岭南大学人工智能系)、Xiaohui Tao(南昆士兰大学数学物理与计算学院,School of Mathematics, Physics and Computing, University of Southern Queensland)、Lin Li(武汉理工大学计算机科学与人工智能学院,School of Computer Science and Artificial Intelligence, Wuhan University of Technology)、S. Joe Qin(岭南大学人工智能系) 💡 毒舌点评 这篇论文从认知神经科学中搬来“听觉选择”和“跨模态补偿”的双阶段机制,并在AVSS架构中将其显式化为ASM和CCM模块,想法干净且有洞察力。在LRS2/3和VoxCeleb2上以6.3M的参数稳定超越包括AV-CrossNet在内的现有SOTA,且多说话人重叠和视觉降质下的表现更加突出。然而,致命伤是完全闭源:无代码、无模型、无Demo链接,这在2024年后的ML顶会中极度罕见且难以接受。此外,Section 3.1的信息论不等式与模块设计之间存在一条明晃晃的鸿沟:Eq. 2中的β项从未在损失函数中出现过,其“理论指导设计”的说法本质上是一种后验包装。总体而言,这是一篇工程扎实但理论过度声称、且因闭源而严重削弱影响力的工作。 ...

2026-07-04 · 更新于 2026-07-24 · 4 min · 662 words