论文解读

Utterance-Level Methods for Identifying Reliable ASR-Output for Child Speech

1. **要解决什么问题**:儿童语音自动识别(ASR)错误率高,影响语言学习、阅读辅助等应用。传统置信度估计方法在噪声大、模式多变的儿童语音上可能失效。需要一种在转录后(utterance级别)自动识别哪些ASR输出是可靠的方法,以减少人工审核负担。 2. **方法核心是什么**:提出两种基于

 · 更新于 2026-09-06 · 约 10 分钟 · 4959 字 阅读 →
论文解读

APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track

这篇论文报告了APRVOS系统,一个专为MEVIS_Audio(音频条件下的指代视频对象分割)任务设计的冠军方案。**要解决的问题**是传统文本指代分割模型无法直接处理包含噪声、不完整且可能描述视频中不存在物体的语音输入。**采用的方法**是一个四阶段流水线:首先使用VibeVoice-ASR将语音

 · 更新于 2026-09-06 · 约 9 分钟 · 4115 字 阅读 →
论文解读

Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps

本文旨在解决语音大模型(SpeechLLMs)在推理时产生的“幻觉”问题,即生成与输入音频不符的流畅文本。现有方法依赖昂贵的黄金标准输出,而文本LLM的方法无法捕捉音频特有信号。为此,作者提出了四个基于注意力图的轻量级指标(AudioRatio, AudioConsistency, AudioEnt

 · 更新于 2026-09-06 · 约 9 分钟 · 4059 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇技术报告全面介绍了Qwen3.5-Omni,一个能够统一理解与生成文本、图像、音频和音视频内容的全模态大语言模型。**要解决的问题**是现有模型在实时交互、跨模态推理和自主智能体行为方面的局限性。**采用的方法**是基于“思考者-说话者”架构,引入了多项关键创新:1)思考者和说话者均采用混合注意

 · 更新于 2026-09-06 · 约 12 分钟 · 5641 字 阅读 →
论文解读

Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

本文旨在解决训练单一自动语音识别(ASR)模型同时高效支持高精度离线转写和低延迟流式识别这一挑战。现有统一模型在低延迟流式模式下性能下降明显。作者提出了一个统一的RNN-Transducer (RNNT) 框架,其核心是结合了**带右上下文的chunk限制注意力**和**动态chunk卷积(DCCo

 · 更新于 2026-09-06 · 约 11 分钟 · 5017 字 阅读 →
论文解读

Tadabur: A Large-Scale Quran Audio Dataset

本文旨在解决古兰经语音研究领域缺乏大规模、多样化、细粒度标注数据集的问题。为此,作者提出了**Tadabur**数据集及其自动化构建流水线。该流水线首先从公共平台收集音频,并利用大语言模型(Gemini)从非结构化文本中提取标准化元数据(如章节、朗诵者)。核心步骤是**Ayah Alignment

 · 更新于 2026-09-06 · 约 8 分钟 · 3844 字 阅读 →
论文解读

Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

这篇论文旨在解决现有印度语言语音识别(Indic ASR)基准不反映真实场景、评估方法不公平的核心问题。为此,作者构建了“Voice of India”大规模基准,其数据源自3.6万名说话者的非脚本化电话对话,覆盖15种主要印度语言和139个地区集群,总计536小时。关键创新在于采用了考虑拼写变体的

 · 更新于 2026-09-06 · 约 8 分钟 · 3765 字 阅读 →
论文解读

ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning

本文针对卫星、水下通信等超低比特率(200bps)场景下,传统神经语音编解码器因优化重建质量而牺牲可懂度的问题,提出了ClariCodec。其核心方法是将编码器的量化过程重新定义为一个随机策略,并利用强化学习(RL),以词错率(WER)作为奖励信号对编码器进行微调,而冻结解码器等声学重建管线。实验表

 · 更新于 2026-09-06 · 约 8 分钟 · 3918 字 阅读 →
论文解读

Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

这篇论文针对两种音系极其复杂、资源极度匮乏的濒危东高加索语言(Archi和Rutul),首次建立了语音识别(ASR)基准。作者们整合并标准化了现有的语言学记录,创建了约50分钟和1小时20分钟的语音-文本数据集。他们评估了多种前沿ASR模型(wav2vec2, Whisper, Qwen2-Audi

 · 更新于 2026-09-06 · 约 10 分钟 · 4554 字 阅读 →
论文解读

NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR

本文提出了NIM4-ASR,一个面向生产环境的高效、鲁棒且可定制的实时语音识别框架。该工作旨在解决现有LLM-based ASR在实际部署中的三大挑战:1) 轻量化模型性能严重下降(有限的向下扩展性);2) 在声学挑战条件下产生幻觉;3) 缺乏生产就绪的热词定制机制。为此,作者提出了一套原则性的多阶

 · 更新于 2026-09-06 · 约 10 分钟 · 4907 字 阅读 →
论文解读

Where Do Self-Supervised Speech Models Become Unfair?

这篇论文旨在探究自监督语音模型(S3M)的不公平性究竟在模型的哪个层级产生。研究团队采用了一种轻量级的线性探针方法,在多个S3M(如WavLM, Wav2Vec2, BEST-RQ, Whisper)的每一层嵌入上,同时评估了说话人识别(SID)和自动语音识别(ASR)任务的整体性能及对不同说话人组

 · 更新于 2026-09-06 · 约 8 分钟 · 4007 字 阅读 →
论文解读

BlasBench: An Open Benchmark for Irish Speech Recognition

这篇论文旨在解决爱尔兰语语音识别(ASR)领域缺乏统一、可靠评估标准的问题。现有工作或基准要么忽略爱尔兰语特有的文本规范(如保留fada变音符号、初始辅音突变),要么在不同数据集和归一化方法下进行,导致结果无法比较。为此,作者提出了**BlasBench**,一个开放的评估框架,其核心是一个**爱尔

 · 更新于 2026-09-06 · 约 10 分钟 · 4640 字 阅读 →
论文解读

HARNESS: Lightweight Distilled Arabic Speech Foundation Models

这篇论文针对阿拉伯语语音识别、方言识别和情感识别中通用多语言/英语模型性能不足、且大模型难以部署的问题,提出了 HArnESS——一个以阿拉伯语为中心的自监督语音模型家族。作者采用 HuBERT 风格的迭代自蒸馏框架,先在大规模阿拉伯语-英语双语数据(约 23K 小时)上训练 24 层的教师模型 H

 · 更新于 2026-09-06 · 约 12 分钟 · 5602 字 阅读 →
论文解读

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

这篇论文针对传统ASR的两大盲区——WER指标对语义错误不敏感、以及系统无法通过自然交互进行纠错——提出了Interactive ASR框架。首先,作者引入S²ER(Sentence-level Semantic Error Rate),利用LLM-as-a-Judge二元判断识别结果与参考文本是否

 · 更新于 2026-09-06 · 约 13 分钟 · 6288 字 阅读 →
论文解读

MUSCAT: MUltilingual, SCientific ConversATion Benchmark

本文提出了 MUSCAT,一个用于评估多语言科学对话场景下自动语音识别(ASR)性能的新基准。数据集包含 6 组双语对话录音(共约 65 分钟,9,066 词),涉及英语与德语、土耳其语、中文、越南语的配对对话;每组对话使用 Meeting Owl 3、ReSpeaker USB 麦克风阵列和 Me

 · 更新于 2026-09-06 · 约 15 分钟 · 7508 字 阅读 →
论文解读

ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning

这篇论文旨在解决卫星、水下等极端带宽受限场景下(如200bps)语音通信清晰度严重下降的问题。传统编解码器以波形重建为目标,在超低比特率下会将宝贵的比特分配给不必要的声学细节,而非核心语义信息。为此,

 · 更新于 2026-09-06 · 约 11 分钟 · 5506 字 阅读 →
论文解读

Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction

这篇论文旨在解决语音大模型(SLLM)在识别训练数据中稀有或未见的“偏置词”时性能不佳的问题。传统方法依赖于为偏置词提供精确的音素序列(通过G2P系统生成),但这对用户有专业要求且工具兼容性差。为此,

 · 更新于 2026-09-06 · 约 11 分钟 · 5353 字 阅读 →
论文解读

Diffusion Language Models for Speech Recognition

这篇论文探索了将扩散语言模型(DLM)应用于自动语音识别(ASR)任务的新方法。其核心目标是利用扩散模型的双向注意和并行生成能力,来提升基于传统编码器(如CTC)生成的ASR候选假设的准确性。论文主要

 · 更新于 2026-09-06 · 约 9 分钟 · 4324 字 阅读 →