论文解读

Augmenting Dysarthric Speech Severity Assessment with MOS Supervision

语音质量评估 | 7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5497 字 阅读 →
论文解读

DASH: Dual-View Self-Distillation with Multi-Layer Hidden Representations for Robust Speech Recognition

语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5965 字 阅读 →
论文解读

Low-resource Language Discrimination Towards Chinese Dialects with Transfer learning and Data Augmentation

语音识别 | 5.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5615 字 阅读 →
论文解读

An Analysis of the Effectiveness of Synthetic Speech Data for ASR Fine-tuning in Selected Indic Languages

语音识别 | 5.7/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12144 字 阅读 →
论文解读

Descriptor: Certus Caliber Classification Gunshot Dataset (C3GD)

音频分类 | 5.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4488 字 阅读 →
论文解读

DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention

语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5315 字 阅读 →
论文解读

Improving low-resource ASR using bilingual fine-tuning with language identification: a cross-linguistic evaluation

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4484 字 阅读 →
论文解读

Learning task-specific subspaces via interventional post-training of speech foundation models

自监督学习 | 6.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10293 字 阅读 →
论文解读

Turning music identification into a neural forward pass

音频分类 | 7.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6103 字 阅读 →
论文解读

An Empirical Study on Learning Latent Representations for Emotional Speech Synthesis

语音合成 | 8.2/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4584 字 阅读 →
论文解读

ArtBoost: Synthetic Articulatory Data Augmentation for Acoustic-to-Articulatory Inversion

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5884 字 阅读 →
论文解读

Confidence Score Guided Incremental and Speaker Adaptive Pseudo-Labeling for Semi-Supervised Elderly Speech Recognition

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6027 字 阅读 →
论文解读

CraBERT: Efficient Phoneme Encoder Pre-Training via Cascade Fusion of Subword Representations for Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5796 字 阅读 →
论文解读

Fast When, Careful Who: Dual-Process Multiparty Turn-Taking with Diffusion Augmentation

语音活动检测 | 5.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6103 字 阅读 →
论文解读

From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation

自监督学习 | 8.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5339 字 阅读 →
论文解读

Joycent: Diffusion-based Accent TTS without Accented Phone Prediction

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5195 字 阅读 →
论文解读

Learning Input-Channel Permutation Equivariance for Multi-Channel Source Separation: Reducing Bleeding in Small Music Ensembles

音乐源分离 | 7.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5210 字 阅读 →
论文解读

LLM-Based Synthetic Ground Truth Generation for Audio-Based Emotion Classification via In-Context Learning

数据增强 | 5.3/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5545 字 阅读 →
论文解读

Robust Spoofed Speech Detection via Temporal Pyramid Modeling

音频深度伪造检测 | 6.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6597 字 阅读 →
论文解读

Scaling Human and G2P Supervision for Robust Phonetic Transcription

语音识别 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4873 字 阅读 →