论文解读

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

音视频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6464 字 阅读 →
论文解读

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

语音合成 | 5.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4932 字 阅读 →
论文解读

Vidu S1: A Real-Time Interactive Video Generation Model

音视频生成 | 6.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7039 字 阅读 →
论文解读

Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption

音视频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6413 字 阅读 →
论文解读

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

音视频生成 | 8/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9827 字 阅读 →
论文解读

REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation

音视频生成 | 7.3/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12601 字 阅读 →
论文解读

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

音视频生成 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7734 字 阅读 →
论文解读

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

音视频生成 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6404 字 阅读 →
论文解读

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

音视频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7540 字 阅读 →
论文解读

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

音视频生成 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8106 字 阅读 →
论文解读

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

音视频生成 | 6.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6714 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 8.1/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9524 字 阅读 →
论文解读

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

音视频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8863 字 阅读 →
论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6841 字 阅读 →
论文解读

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5908 字 阅读 →