论文解读

From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7637 字 阅读 →
论文解读

HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems

语音识别 | 8.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5820 字 阅读 →
论文解读

Interleaved Speech Language Models Latently Work In Text

语音识别 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5690 字 阅读 →
论文解读

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

语音合成 | 6.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4805 字 阅读 →
论文解读

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3142 字 阅读 →
论文解读

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10439 字 阅读 →
论文解读

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

语音识别 | 8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4961 字 阅读 →
论文解读

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5153 字 阅读 →
论文解读

The Anatomy of the CTC Oracle Gap: Acoustic Exhaustion and Linguistic Recovery

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7447 字 阅读 →
论文解读

Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement

语音增强 | 7.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5965 字 阅读 →
论文解读

Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis

语音识别 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6199 字 阅读 →
论文解读

Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5011 字 阅读 →
论文解读

Word Lengthening as a Function of Utterance Position: A Multi-Corpus Study

语音合成 | 8.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4828 字 阅读 →
论文解读

A Comparative Study of Pretrained Transformer Models for Quranic ASR: Speech Representations, Label Formats, and Dataset Composition

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5716 字 阅读 →
论文解读

A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine

语音合成 | 7.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5736 字 阅读 →
论文解读

Analyzing Language and Geographical Variation in Speech Representations Across 60 Indic Languages

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5299 字 阅读 →
论文解读

Cross-Dataset, Age, and Gender Generalization: A Comprehensive Analysis of Fine-Tuning Strategies for Low-Resource Children's ASR

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5701 字 阅读 →
论文解读

Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech

语音识别 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5725 字 阅读 →
论文解读

Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11077 字 阅读 →
论文解读

Low-Burden Data Augmentation for Dysarthric ASR via Zero-Shot Voice Cloning

语音识别 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5408 字 阅读 →