论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6296 字 阅读 →
论文解读

VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models

音乐转录 | 7.0/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10272 字 阅读 →
论文解读

A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4807 字 阅读 →
论文解读

A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

语音识别 | 6.0/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2387 字 阅读 →
论文解读

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5431 字 阅读 →
论文解读

Contrastive Regularization for Accent-Robust ASR

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3952 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6496 字 阅读 →
论文解读

Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning

音视频 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6444 字 阅读 →
论文解读

Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4665 字 阅读 →
论文解读

When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2617 字 阅读 →
论文解读

A Brain-Inspired Gating Mechanism Unlocks Robust Computation in Spiking Neural Networks

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4303 字 阅读 →
论文解读

A cross-species neural foundation model for end-to-end speech decoding

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5724 字 阅读 →
论文解读

Confident and Adaptive Generative Speech Recognition via Risk Control

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4401 字 阅读 →
论文解读

CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition

语音识别 | 9.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4230 字 阅读 →
论文解读

DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations

语音对话系统 | 9.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4530 字 阅读 →
会议任务专题

ICLR 2026 - 语音识别

共 9 篇 ICLR 2026 语音识别 方向论文

 · 更新于 2026-09-06 · 约 29 分钟 · 14186 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音识别 语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5615 字 阅读 →
论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4323 字 阅读 →
论文解读

Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5713 字 阅读 →
论文解读

Scaling Speech Tokenizers with Diffusion Autoencoders

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3677 字 阅读 →