论文解读MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue跨模态 | 6.5/10
论文解读VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation对话情感识别 | 7.4/10
论文解读Caption and Audio-Guided Video Representation Learning with Gated Attention for Partially Relevant Video Retrieval视频检索 | 7.0/10