论文解读

Generating Moving 3d Soundscapes with Latent Diffusion Models

空间音频 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4816 字 阅读 →
论文解读

Generative Audio Extension and Morphing

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5736 字 阅读 →
论文解读

GLA-GRAD++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4319 字 阅读 →
论文解读

GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Constrative and Generative Pretraining

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3524 字 阅读 →
论文解读

Improving Automatic Speech Recognition by Mitigating Distortions Introduced by Speech Enhancement Under Drone Noise

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4511 字 阅读 →
论文解读

InstructAudio: Unified Speech and Music Generation with Natural Language Instruction

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9232 字 阅读 →
论文解读

Instrument Generation Through Distributional Flow Matching and Test-Time Search

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5027 字 阅读 →
论文解读

KSDIFF: Keyframe-Augmented Speech-Aware Dual-Path Diffusion for Facial Animation

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4327 字 阅读 →
论文解读

LAFUFU: Latent Acoustic Features For Ultra-Fast Utterance Restoration

语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5039 字 阅读 →
论文解读

Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4229 字 阅读 →
论文解读

Leveraging Diffusion U-Net Features for Predominant Instrument Recognition

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3908 字 阅读 →
论文解读

Low-Resource Guidance for Controllable Latent Audio Diffusion

音乐生成 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5392 字 阅读 →
论文解读

MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation Without Vector Quantization

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4829 字 阅读 →
论文解读

MELA-TTS: Joint Transformer-Diffusion Model with Representation Alignment for Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5124 字 阅读 →
论文解读

Membership Inference Attack against Music Diffusion Models via Generative Manifold Perturbation

音频安全 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4376 字 阅读 →
论文解读

MirrorTalk: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3679 字 阅读 →
论文解读

Mitigating Data Replication in Text-to-Audio Generative Diffusion Models Through Anti-Memorization Guidance

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Mix2Morph: Learning Sound Morphing from Noisy Mixes

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4754 字 阅读 →
论文解读

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5908 字 阅读 →
论文解读

Noise-to-Notes: Diffusion-Based Generation and Refinement for Automatic Drum Transcription

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5198 字 阅读 →