论文解读

Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

语音识别 | 7.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6300 字 阅读 →
论文解读

A Pocket Offline Model for Simultaneous Speech Translation as CUNI Submission to IWSLT 2026

语音翻译 | 6.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6364 字 阅读 →
论文解读

BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language

语音识别 | 7.8/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4606 字 阅读 →
论文解读

Benchmarking Speech-to-Speech Translation Models

语音合成 | 8.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5395 字 阅读 →
论文解读

Efficient ASR Training with Conversations that Never Happened

语音识别 | 8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6552 字 阅读 →
论文解读

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

语音识别 | 8.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6820 字 阅读 →
论文解读

SiamCTC: Learning Speech Representations through Monotonic Temporal Alignment

语音识别 | 7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6619 字 阅读 →
论文解读

SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription

语音识别 | 8.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6767 字 阅读 →
论文解读

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

语音识别 | 8.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5528 字 阅读 →
论文解读

The DeepSpeak-Agentic Dataset

语音合成 | 8.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6420 字 阅读 →
论文解读

Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

语音识别 | 5.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4920 字 阅读 →
论文解读

Echo: A Joint-Embedding Predictive Architecture for Speaker Diarization and Speech Recognition in a Shared Latent Space

语音识别 | 7/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7107 字 阅读 →
论文解读

MOSS-Audio Technical Report

语音识别 | 9.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5940 字 阅读 →
论文解读

MURMUR: An Efficient Inference System for Long-Form ASR

语音识别 | 8.3/10

 · 更新于 2026-09-06 · 约 4 分钟 · 1773 字 阅读 →
论文解读

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

语音识别 | 8.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5668 字 阅读 →
论文解读

SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

语音识别 | 5.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6052 字 阅读 →
论文解读

Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6692 字 阅读 →
论文解读

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning

语音合成 | 9.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5542 字 阅读 →
论文解读

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

语音识别 | 8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5632 字 阅读 →
论文解读

A Unified and Reproducible Experimentation Framework for Speech Understanding

语音识别 | 5.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6336 字 阅读 →