论文解读

BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset

音频深度伪造检测 | 9/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4225 字 阅读 →
论文解读

Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR

语音识别 | 9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6751 字 阅读 →
论文解读

Layer-wise Probing of wav2vec 2.0 and Whisper for Consonant Cluster Reduction in African American English

语音识别 | 9.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4433 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-24

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 98 分钟 · 48791 字 阅读 →
论文解读

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5481 字 阅读 →
论文解读

An Analysis of Untrained Deep Reservoir Networks for Audio Surveillance

音频事件检测 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5526 字 阅读 →
论文解读

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5325 字 阅读 →
论文解读

AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation

数据增强 | 6.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5361 字 阅读 →
论文解读

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4555 字 阅读 →
论文解读

DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6257 字 阅读 →
论文解读

Imitation Learning for Elder-Facing Speech Synthesis

语音合成 | 5.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5760 字 阅读 →
论文解读

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3142 字 阅读 →
论文解读

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

语音合成 | 7.4/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5272 字 阅读 →
论文解读

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

语音识别 | 8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4961 字 阅读 →
论文解读

Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5011 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-23

共分析 83 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 224 分钟 · 112108 字 阅读 →
论文解读

Beyond Speaker Independence: Evaluating Cross-Lingual Acoustic-to-Articulatory Inversion Across Finnish and Russian

自监督学习 | 4.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6597 字 阅读 →
论文解读

Cross-Dataset, Age, and Gender Generalization: A Comprehensive Analysis of Fine-Tuning Strategies for Low-Resource Children's ASR

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5701 字 阅读 →
论文解读

FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5749 字 阅读 →
论文解读

Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11077 字 阅读 →