Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation
📄 Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation 标签:#音频理解 #Transformer #模型评估 6.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #Transformer | #模型评估 | arxiv 👥 作者与机构 第一作者:Leiye Liu(大连理工大学) 通讯作者:Miao Zhang(大连理工大学) 作者列表:Leiye Liu(大连理工大学)、Miao Zhang(大连理工大学)、Jiahong Jiang(大连理工大学)、Jingjing Li(Carnegie Mellon University)、Jialong Zhong(大连理工大学)、Kai Peng(大连理工大学)、Tingwei Liu(大连理工大学)、Wei Ji(Yale University)、Yongri Piao(大连理工大学)、Huchuan Lu(大连理工大学) 💡 毒舌点评 这篇论文在AVIS这个新兴任务上做出了两项有实质意义的设计——显式声源解缠与音频动态调制的Mamba——性能提升幅度可观(+7.8% mAP),消融实验也基本自洽。但问题同样明显:方法大量依赖外部冻结的预训练模型(MixIT、VGGish),核心贡献被稀释,且这些组件在目标域分离失败时可能直接导致流程崩溃;此外AVIS任务本身规模小(926个视频)、生态薄弱,跨任务影响力存疑,零样本泛化提升也较微弱,审稿人会质疑这项工作的可迁移性和实际部署价值。 ...