论文解读

Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5297 字 阅读 →
论文解读

Voting-Based Pitch Estimation with Temporal and Frequential Alignment and Correlation Aware Selection

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5178 字 阅读 →
论文解读

WAV2LEV: Predicting Levenshtein Edit Operation Sequences For Fine-Grained Estimation of Automatic Speech Recognition Error

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Whisper-FEST: Single-Channel Far-Field Enhanced Speech-to-text without Parallel Data

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4962 字 阅读 →
论文解读

Whisper-MLA: Reducing GPU Memory Consumption of ASR Models Based on MHA2MLA Conversion

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4484 字 阅读 →
论文解读

Whisper: Courtside Edition - Enhancing ASR Performance through LLM-Driven Context Generation

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3477 字 阅读 →
论文解读

WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3139 字 阅读 →
论文解读

Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-Resource Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3795 字 阅读 →
论文解读

Z-Scores: A Metric for Linguistically Assessing Disfluency Removal

模型评估 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4710 字 阅读 →
论文解读

RAS: a Reliability Oriented Metric for Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4410 字 阅读 →
论文解读

Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5316 字 阅读 →
论文解读

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

说话人识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4588 字 阅读 →
论文解读

Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4567 字 阅读 →
论文解读

"This Wasn't Made for Me": Recentering User Experience and Emotional Impact in the Evaluation of ASR Bias

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 4 分钟 · 1997 字 阅读 →
论文解读

Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4532 字 阅读 →
论文解读

Evaluation of Automatic Speech Recognition Using Generative Large Language Models

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3189 字 阅读 →
论文解读

Aligning Stuttered-Speech Research with End-User Needs: Scoping Review, Survey, and Guidelines

1. **问题**:当前口吃语音技术研究与口吃者(PWS)及言语语言病理学家(SLP)的实际需求存在系统性脱节,研究重点、任务定义和评估方法未能充分以用户为中心。 2. **方法核心**:通过两部分结合分析:1)对228篇相关论文进行范围综述,提出研究任务分类法并分析研究现状;2)对70名利益相

 · 更新于 2026-09-06 · 约 6 分钟 · 2799 字 阅读 →
论文解读

Enhancing ASR Performance in the Medical Domain for Dravidian Languages

这篇论文旨在解决达罗毗荼语言(Telugu和Kannada)在医疗领域自动语音识别(ASR)中面临的标注数据稀缺和语言形态复杂两大挑战。其核心方法是提出一个“置信度感知训练框架”,该框架通过一个混合置信度评分机制(结合静态的感知、声学相似性、WER分数和动态的模型熵),对混合了真实与合成语音的训练数

 · 更新于 2026-09-06 · 约 8 分钟 · 3962 字 阅读 →
论文解读

Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

1. **问题**:训练一个既能高精度离线转录又能低延迟流式识别的统一ASR模型极具挑战性,传统方法在低延迟下性能会急剧下降。 2. **方法核心**:提出一个统一的Transducer框架,结合分块注意力(含右上下文)和动态块卷积(DCConv)来适配两种模式。核心创新是引入了模式一致性正则化损失

 · 更新于 2026-09-06 · 约 8 分钟 · 3882 字 阅读 →
论文解读

Tadabur: A Large-Scale Quran Audio Dataset

1. **问题**:现有的古兰经语音数据集在规模、诵读者多样性、音频质量和标注深度上存在严重不足,限制了古兰经ASR、诵读者识别等任务的研究进展。 2. **方法核心**:提出Tadabur数据集及其构建流水线。流水线核心是“古兰经经文对齐模块”(AAM),它结合WhisperX进行初步转录,再利用

 · 更新于 2026-09-06 · 约 8 分钟 · 3619 字 阅读 →