论文解读

Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR

语音识别 | 8.8/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9313 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9056 字 阅读 →
论文解读

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

语音识别 | 8.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6706 字 阅读 →
论文解读

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9228 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 5.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6538 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7440 字 阅读 →
论文解读

On the Role of Conversational Timing in Synthetic Training Data for ASR

语音识别 | 6.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6828 字 阅读 →
论文解读

On the Role of Conversational Timing in Synthetic Training Data for ASR

语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7527 字 阅读 →
论文解读

Vidu S1: A Real-Time Interactive Video Generation Model

音视频交互 | 5.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6461 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8468 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8582 字 阅读 →
论文解读

Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9935 字 阅读 →
论文解读

Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8554 字 阅读 →
论文解读

Transformer-based segmentation of prosodic boundaries in Brazilian Portuguese

语音识别 | 4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7485 字 阅读 →
论文解读

UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition

语音识别 | 7.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6172 字 阅读 →
论文解读

From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition

语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7890 字 阅读 →
论文解读

Gemma 4 Technical Report

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8126 字 阅读 →
论文解读

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

语音翻译 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5932 字 阅读 →
论文解读

Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8091 字 阅读 →
论文解读

CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6524 字 阅读 →