论文解读

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation

音视频生成 | 7.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6701 字 阅读 →
论文解读

Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

音视频生成 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5281 字 阅读 →
论文解读

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

音视频生成 | 7.8/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7019 字 阅读 →
论文解读

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

音视频生成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6768 字 阅读 →
论文解读

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

音视频生成 | 5.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5522 字 阅读 →
论文解读

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

音视频生成 | 7.4/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4241 字 阅读 →
论文解读

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

音视频生成 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5645 字 阅读 →
论文解读

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9417 字 阅读 →
论文解读

AcoustiTrace: When Plausible Sound Violates Physics

音视频生成 | 6.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6749 字 阅读 →
论文解读

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

音视频生成 | 7.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5209 字 阅读 →
论文解读

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8468 字 阅读 →
论文解读

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

音视频生成 | 6.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7788 字 阅读 →
论文解读

Parallel Decoding Distillation for Fast Image and Video Generation

音视频生成 | 6.2/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9236 字 阅读 →
论文解读

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

音视频生成 | 6.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6160 字 阅读 →
论文解读

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

音视频生成 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7731 字 阅读 →
论文解读

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

音视频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7604 字 阅读 →
论文解读

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

音视频生成 | 6.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6689 字 阅读 →
论文解读

Bring Music The Horizon: Music-Driven 360^\circ Video Generation

音视频生成 | 5.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4986 字 阅读 →
论文解读

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6464 字 阅读 →
论文解读

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

语音合成 | 5.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4932 字 阅读 →