论文解读

A State-Dependent Markov Diffusion Process for Generative Speech Enhancement

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5040 字 阅读 →
论文解读

Are Modern Speech Enhancement Systems Vulnerable to Adversarial Attacks?

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4629 字 阅读 →
论文解读

Asynchrony-Aware Decoupled Multimodal Control for Cued Speech Video Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4846 字 阅读 →
论文解读

Audience-Aware Co-speech Gesture Generation in Public Speaking via Anticipation Tokens

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5224 字 阅读 →
论文解读

Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4086 字 阅读 →
论文解读

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5499 字 阅读 →
论文解读

Automatic Music Mixing Using a Generative Model of Effect Embeddings

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5057 字 阅读 →
论文解读

Bayesian Signal Separation Via Plug-and-Play Diffusion-Within-Gibbs Sampling

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4956 字 阅读 →
论文解读

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

音频深度伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4573 字 阅读 →
论文解读

Bone-Conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4225 字 阅读 →
论文解读

Break-the-Beat! Controllable MIDI-to-Drum audio synthesis

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4419 字 阅读 →
论文解读

Bridging the Measurement–Simulation Gap in Room Acoustics with Real2sim Diffusion

声源定位 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4409 字 阅读 →
论文解读

Cardiobridge-DM: Bridging Cross-Cohort Heart Sound Synthesis via Rhythm-Aware Semi-Supervised Diffusion

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4823 字 阅读 →
论文解读

Conditional Diffusion Models for Mental Health-Preserving Voice Conversion

语音转换 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4927 字 阅读 →
论文解读

Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5822 字 阅读 →
论文解读

D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation from Lead Sheet

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4875 字 阅读 →
论文解读

DGSDNet: Dual-Graph Spectral Diffusion Network for Incomplete Multimodal Emotion Recognition in Conversations

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5031 字 阅读 →
论文解读

Diff-vs: Efficient Audio-Aware Diffusion U-Net for Vocals Separation

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Diffemotalk: Audio-Driven Facial Animation with Fine-Grained Emotion Control via Diffusion Models

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5341 字 阅读 →
论文解读

Diffusion Timbre Transfer via Mutual Information Guided Inpainting

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4273 字 阅读 →