论文解读

OMNI-AVSR: Towards Unified Multimodal Speech Recognition With Large Language Models

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4649 字 阅读 →
论文解读

Online Register For Dual-Mode Self-Supervised Speech Models: Mitigating the Lack of Future Context

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5121 字 阅读 →
论文解读

PAC: Pronunciation-Aware Contextualized Large Language Model-Based Automatic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4114 字 阅读 →
论文解读

Peeking Into the Future for Contextual Biasing

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5086 字 阅读 →
论文解读

PhoenixDSR: Phoneme-Guided and LLM-Enhanced Dysarthric Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5876 字 阅读 →
论文解读

Polynomial Mixing for Efficient Self-Supervised Speech Encoders

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Position-Invariant Fine-Tuning Of Speech Enhancement Models With Self-Supervised Speech Representations

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Production-Scale Dynamic Vocabulary ASR Biasing with Word-Level FST and Robust Training

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3562 字 阅读 →
论文解读

Proficiency-Aware Adaptation and Data Augmentation for Robust L2 ASR

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3992 字 阅读 →
论文解读

Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4265 字 阅读 →
论文解读

RAS: a Reliability Oriented Metric for Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4136 字 阅读 →
论文解读

Reducing Prompt Sensitivity in LLM-Based Speech Recognition Through Learnable Projection

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4818 字 阅读 →
论文解读

Reference Microphone Selection for Guided Source Separation Based on The Normalized L-P Norm

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3975 字 阅读 →
论文解读

Relative Time Intervals Representation For Word-Level Timestamping With Masked Training

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4823 字 阅读 →
论文解读

RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3657 字 阅读 →
论文解读

Robust Accent Identification via Voice Conversion and Non-Timbral Embeddings

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3282 字 阅读 →
论文解读

Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4626 字 阅读 →
论文解读

SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5790 字 阅读 →
论文解读

SED: Structural Entropy Based Speech Discretization for Discrete Token-Based ASR

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4993 字 阅读 →
论文解读

Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical Study

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3356 字 阅读 →