论文解读

Rethinking Entity Disambiguation in Complex Modalities

实体消歧 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4884 字 阅读 →
论文解读

Semantic-Guided Pseudo-Feature Attention Network for Audio-Visual Zero-Shot Learning

音频分类 零样本学习 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4921 字 阅读 →
论文解读

SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5286 字 阅读 →
论文解读

SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision

空间音频 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6276 字 阅读 →
论文解读

Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection

视频高光检测 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6335 字 阅读 →
论文解读

Sparse-View Visual-Acoustic Latent Learning for Novel-View Audio Synthesis

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5274 字 阅读 →
论文解读

Spiking Temporal-Enhanced Network for Zero-Shot Audio-Visual Learning

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4341 字 阅读 →
论文解读

Streamingbench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3905 字 阅读 →
论文解读

Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4812 字 阅读 →
论文解读

Temporal-Spatial Decouple Before Act: Disentangled Representation Learning for Multimodal Sentiment Analysis

情感分析 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6191 字 阅读 →
论文解读

The Synergistic Role of Audio and Large Video-Language Model in Source-Free Video Domain Adaptation

领域适应 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4434 字 阅读 →
论文解读

Training-Free Multimodal Guidance for Video to Audio Generation

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4470 字 阅读 →
论文解读

Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation

音视频 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4803 字 阅读 →
论文解读

V2A-DPO: Omni-Preference Optimization for Video-To-Audio Generation

视频到音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4613 字 阅读 →
论文解读

VividTalker: A Modular Framework for Expressive 3D Talking Avatars with Controllable Gaze and Blink

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5244 字 阅读 →
论文解读

β-AVSDNET: A Novel End-To-End Neural Network Architecture For Audio-Visual Speaker Diarization

说话人分离 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5853 字 阅读 →
论文解读

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5626 字 阅读 →
论文解读

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6055 字 阅读 →
论文解读

Audio Video Verbal Analysis (AVVA) for Capturing Classroom Dialogues

音频问答 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4018 字 阅读 →
论文解读

Misinformation Span Detection in Videos via Audio Transcripts

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4016 字 阅读 →