论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5924 字 阅读 →
论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6841 字 阅读 →
论文解读

Latent Fourier Transform

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4291 字 阅读 →
论文解读

LayerSync: Self-aligning Intermediate Layers

生成模型 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4835 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音克隆 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4919 字 阅读 →
论文解读

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5436 字 阅读 →
论文解读

Scaling Speech Tokenizers with Diffusion Autoencoders

语音分词 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4954 字 阅读 →
论文解读

SmartDJ: Declarative Audio Editing with Audio Language Model

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4459 字 阅读 →
论文解读

SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5614 字 阅读 →
论文解读

SpeechOp: Inference-Time Task Composition for Generative Speech Processing

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5070 字 阅读 →
论文解读

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5245 字 阅读 →
论文解读

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5626 字 阅读 →
论文解读

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4891 字 阅读 →
论文解读

Token-Based Audio Inpainting via Discrete Diffusion

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4973 字 阅读 →
论文解读

VibeVoice: Expressive Podcast Generation with Next-Token Diffusion

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5927 字 阅读 →
论文解读

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

条件生成 | 8.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3079 字 阅读 →
论文解读

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5965 字 阅读 →
论文解读

DiffAnon: Diffusion-based Prosody Control for Voice Anonymization

语音匿名化 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4816 字 阅读 →
论文解读

Diffusion Reconstruction towards Generalizable Audio Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4407 字 阅读 →
论文解读

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5319 字 阅读 →