每日研究速递

语音/音乐/音频论文速递 2026-07-01

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 50963 字 阅读 →
论文解读

GigaSpeechBench: A Real-World Multilingual Speech-to-Text Benchmark

语音识别 | 8.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5725 字 阅读 →
论文解读

wav2VOT: Automatic estimation of voice onset time, closure duration, and burst realisation with wav2vec2

自监督学习 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5028 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-30

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 51078 字 阅读 →
论文解读

Advancing Speaker-Based Vocal Effort Classification with WavLM and Data Augmentation in Naturalistic Non-Calibrated Speech Recordings

语音增强 | 6.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4639 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-29

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 46 分钟 · 22697 字 阅读 →
论文解读

Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

语音合成 | 6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4968 字 阅读 →
论文解读

Low Resource Multimodal Translation of Nepali Spoken Words into Emotion-Conditioned Sign Language Avatars

语音识别 | 5.3/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11134 字 阅读 →
论文解读

Neural Speaker Diarization via Multilingual Training: Evaluation on Low-Resource Nepali-Hindi Speech

语音分离 | 5.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7055 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 55 分钟 · 27448 字 阅读 →
论文解读

CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations

语音合成 | 5.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5965 字 阅读 →
论文解读

End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users

端到端 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6231 字 阅读 →
论文解读

Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

语音识别 | 6.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4514 字 阅读 →
论文解读

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4856 字 阅读 →
论文解读

Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12144 字 阅读 →
论文解读

Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection

语音伪造检测 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5991 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-25

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38268 字 阅读 →
论文解读

A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5029 字 阅读 →
论文解读

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6034 字 阅读 →
论文解读

Autoencoder based optimized SSL representations: Complexity Minimization and improved Dysarthric ASR

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4861 字 阅读 →