论文解读

DepthTalk: Few-Shot Talking Head Generation with Depth-Aware 3D Gaussian Field Motion

说话人生成 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3888 字 阅读 →
论文解读

Detecting and Attributing Synthetic Spanish Speech: The HISPASpoof Dataset

语音伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4286 字 阅读 →
论文解读

DGSDNet: Dual-Graph Spectral Diffusion Network for Incomplete Multimodal Emotion Recognition in Conversations

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5031 字 阅读 →
论文解读

Diff-vs: Efficient Audio-Aware Diffusion U-Net for Vocals Separation

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Diffemotalk: Audio-Driven Facial Animation with Fine-Grained Emotion Control via Diffusion Models

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5341 字 阅读 →
论文解读

Differentiable Grouped Feedback Delay Networks for Learning Direction and Position-Dependent Late Reverberation

空间音频 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5327 字 阅读 →
论文解读

Differentiable Pulsetable Synthesis for Wind Instrument Modeling

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3998 字 阅读 →
论文解读

Diffusion Timbre Transfer via Mutual Information Guided Inpainting

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4273 字 阅读 →
论文解读

Direct Preference Optimization For Speech Autoregressive Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4779 字 阅读 →
论文解读

Direct Simultaneous Translation Activation for Large Audio-Language Models

语音翻译 | 6.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4476 字 阅读 →
论文解读

Direct Transfer of Prosody in Speech-to-speech Translation using Disentangled Speech Tokens

语音翻译 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4896 字 阅读 →
论文解读

Directly Trained Spiking Neural Networks with Adaptive Phase Coding

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4192 字 阅读 →
论文解读

DisContSE: Single-Step Diffusion Speech Enhancement based on Joint Discrete and Continuous Embeddings

语音增强 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4612 字 阅读 →
论文解读

Discrete-Continuous Fusion With Adaptive Hierarchical Features For Audio Deepfake Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4332 字 阅读 →
论文解读

Disentangled Authenticity Representation for Partially Deepfake Audio Localization

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3989 字 阅读 →
论文解读

Disentangling Physiology from Fidelity: Latent-Guided Diffusion Models for Cross-Modal Cardiac Synthesis

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5351 字 阅读 →
论文解读

Dissecting Performance Degradation in Audio Source Separation under Sampling Frequency Mismatch

音乐源分离 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4275 字 阅读 →
论文解读

DISSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5058 字 阅读 →
论文解读

Distilling Attention Knowledge for Speaker Verification

说话人验证 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3961 字 阅读 →