论文解读

Transfer Learning for Paediatric Sleep Apnoea Detection using Physiology-Guided Acoustic Models

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4463 字 阅读 →
论文解读

UJCodec: An End-to-end Unet-Style Codec for Joint Speech Compression and Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4672 字 阅读 →
论文解读

UNMIXX: Untangling Highly Correlated Singing Voices Mixtures

语音分离 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4383 字 阅读 →
论文解读

Unsupervised Lexicon Learning from Speech is Limited by Representations Rather than Clustering

语音发现 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4486 字 阅读 →
论文解读

Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5297 字 阅读 →
论文解读

WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3139 字 阅读 →
论文解读

Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-Resource Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3795 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 87 分钟 · 43144 字 阅读 →
论文解读

Dilated CNNs for Periodic Signal Processing: A Low-Complexity Approach

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2311 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-24

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 59 分钟 · 29279 字 阅读 →
论文解读

Enhancing ASR Performance in the Medical Domain for Dravidian Languages

这篇论文旨在解决达罗毗荼语言(Telugu和Kannada)在医疗领域自动语音识别(ASR)中面临的标注数据稀缺和语言形态复杂两大挑战。其核心方法是提出一个“置信度感知训练框架”,该框架通过一个混合置信度评分机制(结合静态的感知、声学相似性、WER分数和动态的模型熵),对混合了真实与合成语音的训练数

 · 更新于 2026-09-06 · 约 8 分钟 · 3962 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-23

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 73 分钟 · 36076 字 阅读 →
论文解读

Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

这篇论文旨在解决现有印度语言语音识别(Indic ASR)基准不反映真实场景、评估方法不公平的核心问题。为此,作者构建了“Voice of India”大规模基准,其数据源自3.6万名说话者的非脚本化电话对话,覆盖15种主要印度语言和139个地区集群,总计536小时。关键创新在于采用了考虑拼写变体的

 · 更新于 2026-09-06 · 约 8 分钟 · 3765 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 44 分钟 · 21691 字 阅读 →
论文解读

BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

这篇论文旨在解决印度语言NLP研究资源分散、缺乏统一概览的痛点。作者首次提出了一个以任务为中心的统一分类体系,系统性地梳理和整合了超过200个数据集、50个基准测试以及100多个模型、工具和系统,覆盖了从核心语言处理(如分词、词性标注)到文本分类、生成翻译、信息检索、语音与多模态,乃至社会文化任务(

 · 更新于 2026-09-06 · 约 6 分钟 · 2997 字 阅读 →
论文解读

ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning

本文针对卫星、水下通信等超低比特率(200bps)场景下,传统神经语音编解码器因优化重建质量而牺牲可懂度的问题,提出了ClariCodec。其核心方法是将编码器的量化过程重新定义为一个随机策略,并利用强化学习(RL),以词错率(WER)作为奖励信号对编码器进行微调,而冻结解码器等声学重建管线。实验表

 · 更新于 2026-09-06 · 约 8 分钟 · 3918 字 阅读 →
论文解读

Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

这篇论文针对两种音系极其复杂、资源极度匮乏的濒危东高加索语言(Archi和Rutul),首次建立了语音识别(ASR)基准。作者们整合并标准化了现有的语言学记录,创建了约50分钟和1小时20分钟的语音-文本数据集。他们评估了多种前沿ASR模型(wav2vec2, Whisper, Qwen2-Audi

 · 更新于 2026-09-06 · 约 10 分钟 · 4554 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-21

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 73 分钟 · 36177 字 阅读 →
论文解读

BlasBench: An Open Benchmark for Irish Speech Recognition

这篇论文旨在解决爱尔兰语语音识别(ASR)领域缺乏统一、可靠评估标准的问题。现有工作或基准要么忽略爱尔兰语特有的文本规范(如保留fada变音符号、初始辅音突变),要么在不同数据集和归一化方法下进行,导致结果无法比较。为此,作者提出了**BlasBench**,一个开放的评估框架,其核心是一个**爱尔

 · 更新于 2026-09-06 · 约 10 分钟 · 4640 字 阅读 →
论文解读

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,

 · 更新于 2026-09-06 · 约 11 分钟 · 5095 字 阅读 →