论文解读

当 AI 自己给艺术分类:28 个簇与 6 个人类标签的错位

音视频理解 | 4.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9446 字 阅读 →
论文解读

不训练模型,只靠对齐:用图像把英文单词钉到印地语语音里

音频检索 | 7.3/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9174 字 阅读 →
论文解读

Omni 不等于会选:当模型被要求用对的模态回答

音视频理解 | 7.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8261 字 阅读 →
论文解读

不只用文字指挥检索:当嵌入器学会看区域、听时段

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9187 字 阅读 →
论文解读

别再把同步分数当裁判:先问它量的是偏移、内容,还是感知代理

音视频理解 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5899 字 阅读 →
论文解读

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

音视频理解 | 9.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6559 字 阅读 →
论文解读

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

音视频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6968 字 阅读 →
论文解读

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

音视频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4901 字 阅读 →
论文解读

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

音视频理解 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4759 字 阅读 →
论文解读

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

音视频理解 | 10.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4537 字 阅读 →
论文解读

Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations

音视频理解 | 8.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4656 字 阅读 →
论文解读

DAVSS: Distilled Audio-Visual State Space Models

音视频理解 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5722 字 阅读 →
论文解读

Multimodal Rapport Estimation in Real-World HRI

多模态模型 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4533 字 阅读 →
论文解读

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

音视频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5996 字 阅读 →
论文解读

On computational approaches to Pop music culture

音乐理解 | 6.1/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2903 字 阅读 →
论文解读

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

音视频理解 | 7.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8197 字 阅读 →
论文解读

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

音视频理解 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6485 字 阅读 →
论文解读

Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety

音视频理解 | 4.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6424 字 阅读 →
论文解读

AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6962 字 阅读 →
论文解读

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

音频字幕生成 | 8.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11629 字 阅读 →