论文解读

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

音视频 | 7.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8619 字 阅读 →
论文解读

SAM Audio: Segment Anything in Audio

音频分离 | 9.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6829 字 阅读 →
论文解读

M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

语音识别 | 9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6425 字 阅读 →
论文解读

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

音视频 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6541 字 阅读 →
论文解读

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

音频生成 | 8.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7201 字 阅读 →
论文解读

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

音频生成 | 6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7631 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8197 字 阅读 →
论文解读

When Vision Speaks for Sound

音视频 | 7.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9514 字 阅读 →
论文解读

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

音视频 | 7.3/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9061 字 阅读 →
论文解读

WavFlow: Audio Generation in Waveform Space

音频生成 | 6.7/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11712 字 阅读 →
论文解读

Sound Sparks Motion: Audio and Text Tuning for Video Editing

视频编辑 | 5.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5597 字 阅读 →
论文解读

Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8769 字 阅读 →
论文解读

MMTB: Evaluating Terminal Agents on Multimedia-File Tasks

基准测试 | 60/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9917 字 阅读 →
论文解读

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8379 字 阅读 →
论文解读

FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries

音频检索 | 6.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9517 字 阅读 →
论文解读

Do Joint Audio-Video Generation Models Understand Physics?

Do Joint Audio-Video Generation Models Understand Physics?

 · 更新于 2026-09-25 · 约 18 分钟 · 8531 字 阅读 →
论文解读

Audio-Visual Intelligence in Large Foundation Models

跨模态 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4580 字 阅读 →
论文解读

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

视频编辑 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6198 字 阅读 →
论文解读

AsymK-Talker: Real-Time and Long-Horizon Talking Head Generation via Asymmetric Kernel Distillation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6222 字 阅读 →
论文解读

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3895 字 阅读 →