论文解读

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

音频生成 | 8.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5965 字 阅读 →
论文解读

DiffAnon: Diffusion-based Prosody Control for Voice Anonymization

语音匿名化 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4816 字 阅读 →
论文解读

Diffusion Reconstruction towards Generalizable Audio Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4407 字 阅读 →
论文解读

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

音视频 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5319 字 阅读 →
论文解读

A State-Dependent Markov Diffusion Process for Generative Speech Enhancement

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5040 字 阅读 →
论文解读

Are Modern Speech Enhancement Systems Vulnerable to Adversarial Attacks?

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4629 字 阅读 →
论文解读

Asynchrony-Aware Decoupled Multimodal Control for Cued Speech Video Generation

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4846 字 阅读 →
论文解读

Audience-Aware Co-speech Gesture Generation in Public Speaking via Anticipation Tokens

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5224 字 阅读 →
论文解读

Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4086 字 阅读 →
论文解读

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5499 字 阅读 →
论文解读

Automatic Music Mixing Using a Generative Model of Effect Embeddings

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5057 字 阅读 →
论文解读

Bayesian Signal Separation Via Plug-and-Play Diffusion-Within-Gibbs Sampling

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4956 字 阅读 →
论文解读

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

音频深度伪造检测 | 8.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4573 字 阅读 →
论文解读

Bone-Conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4225 字 阅读 →
论文解读

Break-the-Beat! Controllable MIDI-to-Drum audio synthesis

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4419 字 阅读 →
论文解读

Bridging the Measurement–Simulation Gap in Room Acoustics with Real2sim Diffusion

声源定位 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4409 字 阅读 →
论文解读

Cardiobridge-DM: Bridging Cross-Cohort Heart Sound Synthesis via Rhythm-Aware Semi-Supervised Diffusion

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4823 字 阅读 →
论文解读

Conditional Diffusion Models for Mental Health-Preserving Voice Conversion

语音转换 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4927 字 阅读 →
论文解读

Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5822 字 阅读 →
论文解读

D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation from Lead Sheet

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4875 字 阅读 →