论文解读

Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning

音视频 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6444 字 阅读 →
论文解读

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5294 字 阅读 →
论文解读

AlignSep: Temporally-Aligned Video-Queried Sound Separation with Flow Matching

音频分离 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4519 字 阅读 →
论文解读

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4402 字 阅读 →
论文解读

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5777 字 阅读 →
论文解读

Human Behavior Atlas: Benchmarking Unified Psychological And Social Behavior Understanding

多模态模型 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5063 字 阅读 →
会议任务专题

ICLR 2026 - 音视频

共 4 篇 ICLR 2026 音视频 方向论文

 · 更新于 2026-09-25 · 约 11 分钟 · 5130 字 阅读 →
论文解读

Instilling an Active Mind in Avatars via Cognitive Simulation

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4426 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5220 字 阅读 →
论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4810 字 阅读 →
论文解读

Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5713 字 阅读 →
论文解读

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4257 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6225 字 阅读 →
论文解读

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

音视频 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5201 字 阅读 →
论文解读

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

视频摘要 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5060 字 阅读 →
论文解读

AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5530 字 阅读 →
论文解读

AlignSep: Temporally-Aligned Video-Queried Sound Separation with Flow Matching

语音分离 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5425 字 阅读 →
论文解读

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

音视频 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6017 字 阅读 →
论文解读

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

语音分离 | 9.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5833 字 阅读 →
论文解读

Instilling an Active Mind in Avatars via Cognitive Simulation

数字人生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4161 字 阅读 →