论文解读

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8162 字 阅读 →
论文解读

Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8776 字 阅读 →
论文解读

WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7464 字 阅读 →
论文解读

Chunkwise Aligners for Streaming Speech Recognition

语音识别 | 6.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9896 字 阅读 →
论文解读

Mechanistic Interpretability of ASR models using Sparse Autoencoders

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8102 字 阅读 →
论文解读

Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement

语音增强 | 6.6/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10496 字 阅读 →
论文解读

Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization

语音识别 说话人日志 | 5.5/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10162 字 阅读 →
论文解读

Dolphin-CN-Dialect: Where Chinese Dialects Matter

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8629 字 阅读 →
论文解读

Responsible Benchmarking of Fairness for Automatic Speech Recognition

语音识别 | 5.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7970 字 阅读 →
论文解读

Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9094 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6296 字 阅读 →
论文解读

VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models

音乐转录 | 7.0/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10272 字 阅读 →
论文解读

A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4807 字 阅读 →
论文解读

A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2387 字 阅读 →
论文解读

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5431 字 阅读 →
论文解读

Contrastive Regularization for Accent-Robust ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3952 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6496 字 阅读 →
论文解读

Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning

音视频 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6444 字 阅读 →
论文解读

Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4665 字 阅读 →
论文解读

When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2617 字 阅读 →