论文解读

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

视频描述生成 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4718 字 阅读 →
论文解读

Leveraging Large Multimodal Models for Audio-Video Deepfake Detection: A Pilot Study

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4328 字 阅读 →
论文解读

Slot Filling as a Reasoning Task for Speechllms

槽填充 | 6.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4747 字 阅读 →