论文解读

Scaling Speech Tokenizers with Diffusion Autoencoders

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3677 字 阅读 →
论文解读

SmartDJ: Declarative Audio Editing with Audio Language Model

音频编辑 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6024 字 阅读 →
论文解读

SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5424 字 阅读 →
论文解读

SpeechOp: Inference-Time Task Composition for Generative Speech Processing

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4967 字 阅读 →
论文解读

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

视频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4282 字 阅读 →
论文解读

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

音视频 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5201 字 阅读 →
论文解读

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4490 字 阅读 →
论文解读

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 24 分钟 · 12017 字 阅读 →
论文解读

Token-Based Audio Inpainting via Discrete Diffusion

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6091 字 阅读 →
论文解读

Unified Multi-Modal Interactive and Reactive 3D Motion Generation via Rectified Flow

动作生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4802 字 阅读 →
论文解读

VibeVoice: Expressive Podcast Generation with Next-Token Diffusion

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4511 字 阅读 →
论文解读

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

生成模型 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3762 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4936 字 阅读 →
论文解读

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

面部动画生成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Bridging Piano Transcription and Rendering via Disentangled Score Content and Style

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5197 字 阅读 →
论文解读

DiffSDA: Unsupervised Diffusion Sequential Disentanglement Across Modalities

无监督学习 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4931 字 阅读 →
论文解读

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5535 字 阅读 →
论文解读

Hierarchical Semantic-Acoustic Modeling via Semi-Discrete Residual Representations for Expressive End-to-End Speech Synthesis

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6858 字 阅读 →
论文解读

Instilling an Active Mind in Avatars via Cognitive Simulation

数字人生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4161 字 阅读 →
论文解读

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

视频生成 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4843 字 阅读 →