论文解读

M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

语音识别 | 9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6425 字 阅读 →
论文解读

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

语音识别 | 8.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6696 字 阅读 →
论文解读

Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition

语音识别 | 6.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4724 字 阅读 →
论文解读

Ouvia: A User-centered Framework for Measuring Usability of Speech Translation in Real-World Communication Scenarios

语音翻译 | 8.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5825 字 阅读 →
论文解读

Revisiting Lexicon Evaluation in Unsupervised Word Discovery

语音识别 | 1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5346 字 阅读 →
论文解读

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6366 字 阅读 →
论文解读

Towards Truly Multilingual ASR: Generalizing Code-Switching ASR to Unseen Language Pairs

语音识别 | 5.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5559 字 阅读 →
论文解读

CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

语音编码 | 8.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7045 字 阅读 →
论文解读

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

语音识别 | 10/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6280 字 阅读 →
论文解读

Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 3 分钟 · 1214 字 阅读 →
论文解读

Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6300 字 阅读 →
论文解读

A Pocket Offline Model for Simultaneous Speech Translation as CUNI Submission to IWSLT 2026

语音翻译 | 6.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6364 字 阅读 →
论文解读

BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4606 字 阅读 →
论文解读

Benchmarking Speech-to-Speech Translation Models

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5395 字 阅读 →
论文解读

Efficient ASR Training with Conversations that Never Happened

语音识别 | 8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6552 字 阅读 →
论文解读

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6820 字 阅读 →
论文解读

SiamCTC: Learning Speech Representations through Monotonic Temporal Alignment

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6619 字 阅读 →
论文解读

SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription

语音识别 | 8.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6767 字 阅读 →
论文解读

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

语音识别 | 8.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5528 字 阅读 →
论文解读

The DeepSpeak-Agentic Dataset

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6420 字 阅读 →