论文解读

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

音视频理解 | 5.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7410 字 阅读 →
论文解读

Constrained Hebbian Learning Supports Efficient Representational Allocation under Structural Constraints

音视频理解 | 6.7/10

 · 更新于 2026-09-24 · 约 29 分钟 · 14475 字 阅读 →
论文解读

SceneBind: Binding What and Where Across Vision, Audio and Language

音视频理解 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6403 字 阅读 →
论文解读

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

音视频理解 | 9.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10324 字 阅读 →
论文解读

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

音视频理解 | 6.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8333 字 阅读 →
论文解读

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5818 字 阅读 →
论文解读

Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

音视频理解 | 7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6394 字 阅读 →
论文解读

\(C^3\)ASD: Multi-Level Consistency-Driven Representation Learning

音视频理解 | 7.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7018 字 阅读 →
论文解读

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

音视频理解 | 7.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5942 字 阅读 →
论文解读

AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

音视频理解 | 9.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6378 字 阅读 →
论文解读

CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

音视频理解 | 8.3/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8159 字 阅读 →
论文解读

EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6514 字 阅读 →
论文解读

Efficient Distributed MLLM Training with Cornstarch

音视频理解 | 7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5041 字 阅读 →
论文解读

Group Cognition Learning: Making Everything Better Through Controlled Two-Stage Agents Collaboration

音视频理解 | 7.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6246 字 阅读 →
论文解读

OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8099 字 阅读 →
论文解读

PRIM:Cooperative Dynamic Token Compression for Efficient Large Multimodal Models

音视频理解 | 3.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5669 字 阅读 →
论文解读

Probing Cross-modal Information Hubs in Audio-Visual LLMs

音视频理解 | 7.2/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2684 字 阅读 →
论文解读

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

音视频理解 | 9.4/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7829 字 阅读 →
论文解读

Zero-Shot Rankability: Revealing Latent Ordinal Structure in Multimodal Large Language Models via Language

音视频理解 | 6.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6730 字 阅读 →
论文解读

A global predicted-fMRI drive signal from TRIBE does not predict YouTube replay heatmaps

音视频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7749 字 阅读 →