论文解读

WaveNeXt 2: ConvNeXt-Based Fast Neural Vocoders With Residual Denoising and Sub-Modeling for GAN and Diffusion Models

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5927 字 阅读 →
论文解读

Diffusion Domain Expansion: Learning to Coordinate Pre-trained Diffusion Models

扩散模型 | 7.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5697 字 阅读 →
论文解读

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

视频生成 | 4.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7098 字 阅读 →
论文解读

Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches

音乐生成 | 8.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7719 字 阅读 →
论文解读

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech

语音合成 | 9.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9678 字 阅读 →
论文解读

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频修复 | 8.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8138 字 阅读 →
论文解读

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

音视频 | 7.3/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9061 字 阅读 →
论文解读

S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9578 字 阅读 →
论文解读

SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7239 字 阅读 →
论文解读

Stable Audio 3

音频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11116 字 阅读 →
论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 语音合成 | 6.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7824 字 阅读 →
论文解读

Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis

音频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8349 字 阅读 →
论文解读

FSD50K-Solo: Automated Curation of Single-Source Sound Events

数据清洗 | 5.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6839 字 阅读 →
论文解读

Seconds-Aligned PCA-DAC Latent Diffusion for Symbolic-to-Audio Drum Rendering

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10175 字 阅读 →
论文解读

A Cold Diffusion Approach for Percussive Dereverberation

音频修复 | 6.2/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9177 字 阅读 →
论文解读

DiffVQE: Hybrid Diffusion Voice Quality Enhancement Under Acoustic Echo and Noise

语音增强 | 6.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8037 字 阅读 →
论文解读

Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8830 字 阅读 →
论文解读

Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems

音色迁移 | 5.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8892 字 阅读 →
论文解读

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

音视频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9059 字 阅读 →
论文解读

PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6606 字 阅读 →