论文解读

Direct Preference Optimization For Speech Autoregressive Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4779 字 阅读 →
论文解读

DisContSE: Single-Step Diffusion Speech Enhancement based on Joint Discrete and Continuous Embeddings

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4612 字 阅读 →
论文解读

Disentangling Physiology from Fidelity: Latent-Guided Diffusion Models for Cross-Modal Cardiac Synthesis

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5351 字 阅读 →
论文解读

DISSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5058 字 阅读 →
论文解读

DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6128 字 阅读 →
论文解读

DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment

歌唱语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4870 字 阅读 →
论文解读

DMP-TTS: Disentangled Multi-Modal Prompting for Controllable Text-to-Speech with Chained Guidance

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6161 字 阅读 →
论文解读

Do We Need EMA for Diffusion-Based Speech Enhancement? Toward A Magnitude-Preserving Network Architecture

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5481 字 阅读 →
论文解读

DOMA: Leveraging Diffusion Language Models with Adaptive Prior for Intent Classification and Slot Filling

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4529 字 阅读 →
论文解读

Emotion-Aligned Generation in Diffusion Text to Speech Models Via Preference-Guided Optimization

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4704 字 阅读 →
论文解读

FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec

语音转换 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4319 字 阅读 →
论文解读

Feedback-Driven Retrieval-Augmented Audio Generation with Large Audio Language Models

音频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5723 字 阅读 →
论文解读

FODGE : High-Fidelity Dance Generation via Full-Body Optimization

音频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4639 字 阅读 →
论文解读

Gdiffuse: Diffusion-Based Speech Enhancement with Noise Model Guidance

语音增强 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4722 字 阅读 →
论文解读

Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers

语音增强 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4542 字 阅读 →
论文解读

Generating Moving 3d Soundscapes with Latent Diffusion Models

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4816 字 阅读 →
论文解读

Generative Audio Extension and Morphing

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5736 字 阅读 →
论文解读

GLA-GRAD++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4319 字 阅读 →
论文解读

GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Constrative and Generative Pretraining

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3524 字 阅读 →