论文解读

Do Bias Benchmarks Generalise? Evidence from Voice-Based Evaluation of Gender Bias in Speechllms

模型评估 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4695 字 阅读 →
论文解读

Do Foundational Audio Encoders Understand Music Structure?

音乐信息检索 | 7.0/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3755 字 阅读 →
论文解读

Do Speech LLMs Learn Crossmodal Embedding Spaces?

音频检索 | 6.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4063 字 阅读 →
论文解读

Do We Need EMA for Diffusion-Based Speech Enhancement? Toward A Magnitude-Preserving Network Architecture

语音增强 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5481 字 阅读 →
论文解读

Do we really need self-attention for streaming automatic speech recognition?

语音识别 | 7.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4519 字 阅读 →
论文解读

Do You Hear What I Mean? Quantifying the Instruction-Perception GAP in Instruction-Guided Expressive Text-to-Speech Systems

语音合成 | 8.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4453 字 阅读 →
论文解读

Does the Pre-Training of an Embedding Influence its Encoding of Age?

语音生物标志物 | 7.0/10

 · 更新于 2026-09-11 · 约 7 分钟 · 3128 字 阅读 →
论文解读

DOMA: Leveraging Diffusion Language Models with Adaptive Prior for Intent Classification and Slot Filling

语音对话系统 | 8.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4529 字 阅读 →
论文解读

Domain Partitioning Meets Parameter-Efficient Fine-Tuning: A Novel Method for Improved Language-Queried Audio Source Separation

音频分离 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5493 字 阅读 →
论文解读

Domain-Aware Scheduling for ASR Fine-Tuning

语音识别 | 6.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4493 字 阅读 →
论文解读

Domain-Invariant Representation Learning of Bird Sounds

生物声学 | 6.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5091 字 阅读 →
论文解读

DPO-Regularized Regression for Age Prediction

说话人识别 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4470 字 阅读 →
论文解读

DPT-Net: Dual-Path Transformer Network with Hierarchical Fusion for EEG-based Envelope Reconstruction

语音生物标志物 | 7.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5126 字 阅读 →
论文解读

DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models

音频问答 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4732 字 阅读 →
论文解读

DSRMS-TransUnet: A Decentralized Non-Shifted Transunet for Shallow Water Acoustic Source Range Estimation

声源定位 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4613 字 阅读 →
论文解读

DSSR: Decoupling Salient and Subtle Representations Under Missing Modalities for Multimodal Emotion Recognition

情感识别 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5035 字 阅读 →
论文解读

Dual Contrastive Learning for Semi-Supervised Domain Adaptation in Bi-Modal Depression Recognition

语音生物标志物 | 7.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4365 字 阅读 →
论文解读

Dual Data Scaling for Robust Two-Stage User-Defined Keyword Spotting

语音活动检测 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5107 字 阅读 →
论文解读

Dual-Perspective Multimodal Sentiment Analysis with MoE Fusion: Representation Learning via Semantic Resonance and Divergence

多模态情感分析 | 7.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4367 字 阅读 →
论文解读

Dual-Strategy-Enhanced Conbimamba for Neural Speaker Diarization

说话人分离 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4642 字 阅读 →