论文解读

说出来就变了味:当语音不再是文本的透明通道

音视频问答 | 8.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7692 字 阅读 →
论文解读

Multi-Modal Generative Fuzzy System: Fuzzy Inference Guided Large Model Interactive Question Answering Framework

音视频问答 | 5.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5449 字 阅读 →
论文解读

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

音视频问答 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6710 字 阅读 →
论文解读

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

音视频问答 | 6.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6671 字 阅读 →
论文解读

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

音视频问答 | 6.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5213 字 阅读 →
论文解读

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

音视频问答 | 5.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7600 字 阅读 →
论文解读

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

音视频问答 | 4.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5952 字 阅读 →
论文解读

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication

音视频问答 | 6.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5761 字 阅读 →
论文解读

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

音视频问答 | 7.0/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9455 字 阅读 →
论文解读

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

音视频问答 | 8.3/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8316 字 阅读 →
论文解读

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

音视频理解 | 6.0/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7850 字 阅读 →
论文解读

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

音视频问答 | 5.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6882 字 阅读 →
论文解读

E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs

音视频问答 | 6.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8438 字 阅读 →
论文解读

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

音视频问答 | 8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5975 字 阅读 →
论文解读

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

音视频问答 | 7.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7537 字 阅读 →
论文解读

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

音视频问答 | 7.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7777 字 阅读 →
论文解读

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

音视频问答 | 7.3/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7522 字 阅读 →
论文解读

V-LynX: Token Interface Alignment for Video+X LLMs

音视频问答 | 7.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5123 字 阅读 →
论文解读

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

音视频问答 | 7.3/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9623 字 阅读 →
论文解读

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

音视频问答 | 6.0/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9627 字 阅读 →