S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling
📄 S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling 标签:#音频检索 #对比学习 #多模态模型 6.0/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频检索 | #对比学习 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Xueqi Wang(College of Computer Science, Inner Mongolia University, Hohhot, China;University of Electronic Science and Technology of China, Shenzhen Campus, Shenzhen, China) 通讯作者:Junfeng Zhao(未说明) 作者列表:Xueqi Wang(College of Computer Science, Inner Mongolia University, Hohhot, China;University of Electronic Science and Technology of China, Shenzhen Campus, Shenzhen, China)、Zhigang Wang(未说明)、Runqing Zhang(未说明)、Zhenqi Jia(未说明)、Junfeng Zhao(未说明) 💡 毒舌点评 S2Dialog 在 DailyTalk 上用专有双分支和跨模态对比学习把 Recall@10 从 25.6% 拉到 50.68%,幅度足够吸引眼球,说明 dialogue-level 建模和 Bottom-K 负样本确实起了关键作用。但方法内核仍是“冻结 backbone + GRU + 对比学习”的经典组合,且只在单个双说话人数据集上验证,关键训练配置和标签一致性都没有交代,结论的泛化性与可复现性仍欠火候。 ...