论文解读

D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation from Lead Sheet

音乐生成 | 7.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4875 字 阅读 →
论文解读

DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5316 字 阅读 →
论文解读

DAMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMS

视频问答 | 7.0/10

 · 更新于 2026-09-11 · 约 12 分钟 · 5719 字 阅读 →
论文解读

DAT-CFTNet: Speech Enhancement for Cochlear Implant Recipients using Attention-based Dual-Path Recurrent Neural Network

语音增强 | 7.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4653 字 阅读 →
论文解读

DBFT-SD: Weakly Supervised Multimodal Detection of Sensitive Audio-Visual Content

音频事件检测 | 8.0/10

 · 更新于 2026-09-11 · 约 8 分钟 · 4008 字 阅读 →
论文解读

DDSC: Dynamic Dual-Signal Curriculum for Data-Efficient Acoustic Scene Classification Under Domain Shift

音频场景分类 | 7.0/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3676 字 阅读 →
论文解读

DDSR-Net: Robust Multimodal Sentiment Analysis via Dynamic Modality Reliability Assessment

语音情感识别 | 6.5/10

 · 更新于 2026-09-11 · 约 17 分钟 · 8029 字 阅读 →
论文解读

DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEG

语音增强 | 7.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4453 字 阅读 →
论文解读

Decoder-Only Conformer with Modality-Aware Sparse Mixtures of Experts for ASR

语音识别 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5265 字 阅读 →
论文解读

Decorrelation-Enhanced Multiband Subband Adaptive Filtering for RIR Tracking in Sound Field Control

空间音频 | 7.0/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3685 字 阅读 →
论文解读

Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS

语音合成 | 7.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4986 字 阅读 →
论文解读

Deep Learning-Based Joint Optimization of Adaptive Feedback Cancellation and Residual Feedback Suppression for Hearing Aids

语音增强 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4888 字 阅读 →
论文解读

Deep Spatial Clue Informed Ambisonic Encoding for Irregular Microphone Arrays

空间音频 | 7.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4357 字 阅读 →
论文解读

Deepaq: A Perceptual Audio Quality Metric Based on Foundational Models and Weakly Supervised Learning

音频质量评估 | 7.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4761 字 阅读 →
论文解读

Denoising Of Stochastic Ray Tracing Room Impulse Responses

空间音频 | 7.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4886 字 阅读 →
论文解读

DepthTalk: Few-Shot Talking Head Generation with Depth-Aware 3D Gaussian Field Motion

说话人生成 | 7.0/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3888 字 阅读 →
论文解读

Detecting and Attributing Synthetic Spanish Speech: The HISPASpoof Dataset

语音伪造检测 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4286 字 阅读 →
论文解读

DGSDNet: Dual-Graph Spectral Diffusion Network for Incomplete Multimodal Emotion Recognition in Conversations

语音情感识别 | 8.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5031 字 阅读 →
论文解读

Diff-vs: Efficient Audio-Aware Diffusion U-Net for Vocals Separation

语音分离 | 7.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Diffemotalk: Audio-Driven Facial Animation with Fine-Grained Emotion Control via Diffusion Models

语音情感识别 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5341 字 阅读 →