论文解读

Layer-wise Probing of wav2vec 2.0 and Whisper for Consonant Cluster Reduction in African American English

语音识别 | 9.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4433 字 阅读 →
论文解读

Progressive Alignment Objectives for Aligner-Encoder based ASR

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2719 字 阅读 →
论文解读

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

语音识别 | 7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5481 字 阅读 →
论文解读

An Evaluation Framework for Text-to-Speech Voice Reconstruction

语音合成 | 8.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5642 字 阅读 →
论文解读

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

音频问答 | 7.9/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4940 字 阅读 →
论文解读

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

语音识别 | 8.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5325 字 阅读 →
论文解读

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5368 字 阅读 →
论文解读

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents

语音识别 | 7.7/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4555 字 阅读 →
论文解读

DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

语音合成 | 7.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6257 字 阅读 →
论文解读

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 23 分钟 · 11361 字 阅读 →
论文解读

From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7637 字 阅读 →
论文解读

HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems

语音识别 | 8.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5820 字 阅读 →
论文解读

Interleaved Speech Language Models Latently Work In Text

语音识别 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5690 字 阅读 →
论文解读

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

语音合成 | 6.6/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4805 字 阅读 →
论文解读

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

语音识别 | 5.8/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3142 字 阅读 →
论文解读

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10439 字 阅读 →
论文解读

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

语音识别 | 8/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4961 字 阅读 →
论文解读

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5153 字 阅读 →
论文解读

The Anatomy of the CTC Oracle Gap: Acoustic Exhaustion and Linguistic Recovery

语音识别 | 7.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7447 字 阅读 →
论文解读

Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement

语音增强 | 7.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5965 字 阅读 →