论文解读

DGSDNet: Dual-Graph Spectral Diffusion Network for Incomplete Multimodal Emotion Recognition in Conversations

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5031 字 阅读 →
论文解读

Diff-vs: Efficient Audio-Aware Diffusion U-Net for Vocals Separation

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Diffemotalk: Audio-Driven Facial Animation with Fine-Grained Emotion Control via Diffusion Models

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5341 字 阅读 →
论文解读

Diffusion Timbre Transfer via Mutual Information Guided Inpainting

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4273 字 阅读 →
论文解读

Direct Preference Optimization For Speech Autoregressive Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4779 字 阅读 →
论文解读

DisContSE: Single-Step Diffusion Speech Enhancement based on Joint Discrete and Continuous Embeddings

语音增强 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4612 字 阅读 →
论文解读

Disentangling Physiology from Fidelity: Latent-Guided Diffusion Models for Cross-Modal Cardiac Synthesis

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5351 字 阅读 →
论文解读

DISSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5058 字 阅读 →
论文解读

DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers

语音增强 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6128 字 阅读 →
论文解读

DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment

歌唱语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4870 字 阅读 →
论文解读

DMP-TTS: Disentangled Multi-Modal Prompting for Controllable Text-to-Speech with Chained Guidance

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6161 字 阅读 →
论文解读

Do We Need EMA for Diffusion-Based Speech Enhancement? Toward A Magnitude-Preserving Network Architecture

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5481 字 阅读 →
论文解读

DOMA: Leveraging Diffusion Language Models with Adaptive Prior for Intent Classification and Slot Filling

语音对话系统 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4529 字 阅读 →
论文解读

Emotion-Aligned Generation in Diffusion Text to Speech Models Via Preference-Guided Optimization

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4704 字 阅读 →
论文解读

FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec

语音转换 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4319 字 阅读 →
论文解读

Feedback-Driven Retrieval-Augmented Audio Generation with Large Audio Language Models

音频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5723 字 阅读 →
论文解读

FODGE : High-Fidelity Dance Generation via Full-Body Optimization

音频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4639 字 阅读 →
论文解读

Gdiffuse: Diffusion-Based Speech Enhancement with Noise Model Guidance

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4722 字 阅读 →
论文解读

Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4542 字 阅读 →