论文解读

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

音视频理解 | 6.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6883 字 阅读 →
论文解读

SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation

音视频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12060 字 阅读 →
论文解读

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

音视频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7118 字 阅读 →
论文解读

C^2MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning

音视频理解 | 4.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8343 字 阅读 →
论文解读

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

音视频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8473 字 阅读 →
论文解读

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4713 字 阅读 →
论文解读

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

音视频理解 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7260 字 阅读 →
论文解读

AcoustiTrace: When Plausible Sound Violates Physics

音视频生成 | 6.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6749 字 阅读 →
论文解读

Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

音视频理解 | 8.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6640 字 阅读 →
论文解读

FATE: Frame-Level Audio-Visual Temporal Embedding

音视频理解 | 8.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6937 字 阅读 →
论文解读

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

音视频理解 | 7.9/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7441 字 阅读 →
论文解读

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

音视频理解 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5406 字 阅读 →
论文解读

CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions

音视频理解 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8510 字 阅读 →
论文解读

DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment

音视频理解 | 4.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8175 字 阅读 →
论文解读

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

音视频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9455 字 阅读 →
论文解读

Towards High-Level Semantic Intelligence

音视频理解 | 7.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6680 字 阅读 →
论文解读

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

音视频理解 | 6.9/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10082 字 阅读 →
论文解读

Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network

音视频理解 | 5.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5753 字 阅读 →
论文解读

EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation

语音情感识别 | 5.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7242 字 阅读 →
论文解读

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

音视频理解 | 6.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7850 字 阅读 →