每日研究速递
语音/音乐/音频论文速递 2026-04-21
共分析 34 篇语音/AI 论文
共分析 34 篇语音/AI 论文
这篇论文旨在解决爱尔兰语语音识别(ASR)领域缺乏统一、可靠评估标准的问题。现有工作或基准要么忽略爱尔兰语特有的文本规范(如保留fada变音符号、初始辅音突变),要么在不同数据集和归一化方法下进行,导致结果无法比较。为此,作者提出了**BlasBench**,一个开放的评估框架,其核心是一个**爱尔
这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,
这篇论文旨在解决非洲低资源语言在语音翻译(S2ST和S2TT)研究中面临的高质量、多口音平行语音数据严重匮乏的核心瓶颈。为此,作者构建了**NaijaS2ST**数据集,涵盖豪萨语、伊博语、约鲁巴语和尼日利亚皮钦语与英语的平行语音,每种语言约50小时,捕获了真实的说话者与口音多样性。基于此数据集,论
共分析 24 篇语音/AI 论文
本文旨在解决非侵入式语音质量评估在标注数据有限场景下的性能瓶颈。作者提出了GatherMOS框架,其核心是将大语言模型(如GPT-5)作为一个元评估器,通过精心设计的文本提示,融合多类异构信号:包括手
共分析 42 篇语音/AI 论文
共分析 39 篇语音/AI 论文