SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval
📄 一条声音,二十四种说法:SonicCaps 把听觉歧义变成检索的养分 英文题目:SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval 一句话:针对音频描述过于粗糙且一对一配对难以反映听觉一对多歧义的问题,论文用音频加文本联合驱动的多粒度复述构建约 70 万音频约 1500 万描述的 SonicCaps 并在训练中按分布采样,使 AudioCaps 文本到音频 R@5 达到 79.5%,代价是依赖单一多模态大模型分辨率且质量与多样性度量仍显粗糙。 标签:#音频检索 | #对比学习 | #音频字幕生成 | #数据集 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Zineb Lahrichi:Sony CTC, France LTCI, Telecom Paris, Institut polytechnique de Paris, France Marc Ferras:Sony CTC, France LTCI, Telecom Paris, Institut polytechnique de Paris, France Gaël Richard:Sony CTC, France LTCI, Telecom Paris, Institut polytechnique de Paris, France Geoffroy Peeters:Sony CTC, France LTCI, Telecom Paris, Institut polytechnique de Paris, France 💬 毒舌点评 把多样性做成了训练时可采样的监督分布而非装饰性统计,用大规模多粒度复述直接推高对比学习的泛化,这个切入点扎实。短板是质量与多样性的度量仍粗糙,主观实验仅25人375次评价且困惑度只刻画采样分布不刻画语义差异,让核心因果论证略显单薄。 ...