论文解读

Distributed Multichannel Active Noise Control with Asynchronous Communication

信号处理 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4052 字 阅读 →
论文解读

DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers

语音增强 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6128 字 阅读 →
论文解读

DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment

歌唱语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4870 字 阅读 →
论文解读

Diverse and Few-Step Audio Captioning via Flow Matching

音频字幕生成 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3494 字 阅读 →
论文解读

DMP-TTS: Disentangled Multi-Modal Prompting for Controllable Text-to-Speech with Chained Guidance

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6161 字 阅读 →
论文解读

Do Bias Benchmarks Generalise? Evidence from Voice-Based Evaluation of Gender Bias in Speechllms

模型评估 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4695 字 阅读 →
论文解读

Do Foundational Audio Encoders Understand Music Structure?

音乐信息检索 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3755 字 阅读 →
论文解读

Do Speech LLMs Learn Crossmodal Embedding Spaces?

音频检索 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4063 字 阅读 →
论文解读

Do We Need EMA for Diffusion-Based Speech Enhancement? Toward A Magnitude-Preserving Network Architecture

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5481 字 阅读 →
论文解读

Do we really need self-attention for streaming automatic speech recognition?

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4519 字 阅读 →
论文解读

Do You Hear What I Mean? Quantifying the Instruction-Perception GAP in Instruction-Guided Expressive Text-to-Speech Systems

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4453 字 阅读 →
论文解读

Does the Pre-Training of an Embedding Influence its Encoding of Age?

语音生物标志物 | 7.0/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3128 字 阅读 →
论文解读

DOMA: Leveraging Diffusion Language Models with Adaptive Prior for Intent Classification and Slot Filling

语音对话系统 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4529 字 阅读 →
论文解读

Domain Partitioning Meets Parameter-Efficient Fine-Tuning: A Novel Method for Improved Language-Queried Audio Source Separation

音频分离 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5493 字 阅读 →
论文解读

Domain-Aware Scheduling for ASR Fine-Tuning

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4493 字 阅读 →
论文解读

Domain-Invariant Representation Learning of Bird Sounds

生物声学 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5091 字 阅读 →
论文解读

DPO-Regularized Regression for Age Prediction

说话人识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4470 字 阅读 →
论文解读

DPT-Net: Dual-Path Transformer Network with Hierarchical Fusion for EEG-based Envelope Reconstruction

语音生物标志物 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5126 字 阅读 →
论文解读

DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models

音频问答 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4732 字 阅读 →
论文解读

DSRMS-TransUnet: A Decentralized Non-Shifted Transunet for Shallow Water Acoustic Source Range Estimation

声源定位 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4613 字 阅读 →