CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning
📄 CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning 标签:#空间音频 #对比学习 #音频检索 #多通道 #长音频处理 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #对比学习 | #音频检索 #多通道 | arxiv 👥 作者与机构 第一作者:Peiwei Ren(Xi’an Jiaotong Liverpool University, China) 通讯作者:Peiwei Ren;Jinbo Hu;Fang Kang;Shan Liang;Yin Cao 作者列表:Peiwei Ren、Jinbo Hu、Fang Kang、Shan Liang、Yin Cao(机构:Xi’an Jiaotong Liverpool University, China;MiLM Plus, Xiaomi Inc., China;Center for Machine Vision and Signal Analysis, University of Oulu, Finland;Institute of Acoustics, Chinese Academy of Sciences) ...