论文解读

SONAR: Self-Distilled Continual Pre-Training for Domain Adaptive Audio Representation

音频事件检测 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3901 字 阅读 →
论文解读

SSVD-O: Parameter-Efficient Fine-Tuning with Structured SVD for Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5250 字 阅读 →
论文解读

Structure-Aware Diffusion Schrödinger Bridge

数据集对齐 | 7.7/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4076 字 阅读 →
论文解读

Synthetic Data Domain Adaptation for ASR via LLM-Based Text and Phonetic Respelling Augmentation

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4965 字 阅读 →
论文解读

Teaching the Teachers: Boosting Unsupervised Domain Adaptation In Speech Recognition By Ensemble Update

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4428 字 阅读 →
论文解读

Test Time Adaptation for Speech Emotion Recognition

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4724 字 阅读 →
论文解读

The Impact of Audio Watermarking on Audio Anti-Spoofing Countermeasures

音频深度伪造检测 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4839 字 阅读 →
论文解读

The Synergistic Role of Audio and Large Video-Language Model in Source-Free Video Domain Adaptation

领域适应 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4434 字 阅读 →
论文解读

Towards Fair ASR for Second Language Speakers using Fairness Prompted Finetuning

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4138 字 阅读 →
论文解读

Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5297 字 阅读 →
论文解读

Vioptt: Violin Technique-Aware Transcription from Synthetic Data Augmentation

音乐信息检索 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4985 字 阅读 →
论文解读

When Children Talk and Machines Listen: Toward an Interpretable Speech-Based Screener for Dutch Developmental Language Disorder

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4304 字 阅读 →
论文解读

Whisper: Courtside Edition - Enhancing ASR Performance through LLM-Driven Context Generation

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3477 字 阅读 →
论文解读

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5231 字 阅读 →
论文解读

Enhancing ASR Performance in the Medical Domain for Dravidian Languages

这篇论文旨在解决达罗毗荼语言(Telugu和Kannada)在医疗领域自动语音识别(ASR)中面临的标注数据稀缺和语言形态复杂两大挑战。其核心方法是提出一个“置信度感知训练框架”,该框架通过一个混合置信度评分机制(结合静态的感知、声学相似性、WER分数和动态的模型熵),对混合了真实与合成语音的训练数

 · 更新于 2026-09-25 · 约 8 分钟 · 3962 字 阅读 →
论文解读

Enhancing Speaker Verification with Whispered Speech via Post-Processing

1. **问题**:耳语语音因缺乏声带振动,其声学特征与正常语音差异显著,导致现有的说话人验证系统性能严重下降。这在用户为保护隐私而低语、或因疾病无法正常发声等实际场景中构成挑战。 2. **方法核心**:在预训练的说话人验证骨干网络(ReDimNet-B6)之上,添加一个轻量级的编码器-解码器结构

 · 更新于 2026-09-25 · 约 10 分钟 · 4925 字 阅读 →
论文解读

Tadabur: A Large-Scale Quran Audio Dataset

1. **问题**:现有的古兰经语音数据集在规模、诵读者多样性、音频质量和标注深度上存在严重不足,限制了古兰经ASR、诵读者识别等任务的研究进展。 2. **方法核心**:提出Tadabur数据集及其构建流水线。流水线核心是“古兰经经文对齐模块”(AAM),它结合WhisperX进行初步转录,再利用

 · 更新于 2026-09-25 · 约 8 分钟 · 3619 字 阅读 →
论文解读

Tadabur: A Large-Scale Quran Audio Dataset

本文旨在解决古兰经语音研究领域缺乏大规模、多样化、细粒度标注数据集的问题。为此,作者提出了**Tadabur**数据集及其自动化构建流水线。该流水线首先从公共平台收集音频,并利用大语言模型(Gemini)从非结构化文本中提取标准化元数据(如章节、朗诵者)。核心步骤是**Ayah Alignment

 · 更新于 2026-09-25 · 约 8 分钟 · 3844 字 阅读 →
论文解读

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

这篇论文旨在解决低资源多语言语音情感识别(SER)中标注数据稀缺的核心瓶颈。作者提出了一个颠覆性的范式:**将SER重新定义为无监督的“非言语到言语”迁移问题**。其核心假设是,非言语发声(如笑、哭)中蕴含的韵律情感线索比言语更纯粹、更跨语言,因此可以作为更好的监督源。为此,作者设计了**NOVA-

 · 更新于 2026-09-25 · 约 13 分钟 · 6176 字 阅读 →
论文解读

Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction

这篇论文旨在解决语音大模型(SLLM)在识别训练数据中稀有或未见的“偏置词”时性能不佳的问题。传统方法依赖于为偏置词提供精确的音素序列(通过G2P系统生成),但这对用户有专业要求且工具兼容性差。为此,

 · 更新于 2026-09-25 · 约 11 分钟 · 5353 字 阅读 →