AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA
音频问答 | 6.5/10
音频问答 | 6.5/10
语音识别 | 7.5/10
语音识别 | 7.5/10
语音对话系统 | 6.5/10
语音情感识别 | 6.0/10
语音合成 | 7.5/10
音乐生成 | 7.0/10
共分析 21 篇语音/AI 论文
这篇论文旨在解决现有音频-文本检索方法无法处理查询和文档中音频与文本交错出现(如多轮对话、混合输入)的局限性。为此,作者定义了音频-文本交错上下文检索(ATIR)任务,并构建了一个包含约8.8万对样本的大规模基准。为解决直接应用多模态大语言模型(MLLM)时音频token冗余导致的效率和精度问题,论
1. **问题**:针对环境声音(包括声音场景和声音事件)的深度伪造检测(ESDD)任务,现有研究不足,且尚不清楚声音场景与声音事件的伪造检测是否需要不同模型。 2. **方法核心**:提出一个深度学习框架,核心是采用预训练的音频模型(BEATs)作为特征提取器,并结合一种三阶段训练策略(包含对
1. **问题**:当前多模态大模型在音乐符号处理(Omnimodal Notation Processing, ONP)领域存在严重缺陷:研究碎片化、模型存在严重的符号偏差(偏向五线谱)、且普遍依赖不可靠的“LLM-as-a-Judge”评估方法,掩盖了模型在音乐理论推理上的系统性失败。 2.
1. **解决的问题**:针对神经退行性疾病(特别是肌萎缩侧索硬化症ALS)的早期诊断和监测,缺乏大规模、有临床标注的语音数据集,以及标准化的算法评估框架。 2. **方法核心**:构建并发布了名为SAND的挑战赛,其核心是提供一个扩展的、包含纵向数据的ALS患者与健康对照语音数据集(VOC-A
1. **问题**:现有大型音频语言模型在副语言(如情绪、语气、音色)生成与理解能力上的评估存在特征覆盖不全、评估方法主观且不可扩展的问题。 2. **方法**:提出了SpeechParaling-Bench,一个包含1000余个中英平行语音查询、覆盖超过100个细粒度副语言特征的综合基准。基准
共分析 27 篇语音/AI 论文
这篇论文旨在解决大型音频语言模型(LALM)中普遍存在的“幻觉”问题(即生成与音频证据不符的内容)缺乏系统性评估工具的难题。为此,作者构建并发布了**HalluAudio**,这是首个大规模、多领域(语音、环境声、音乐)、多任务(二分类、多选、属性验证、开放生成)的人工验证音频幻觉检测基准,包含超过
这篇论文旨在解决当前全双工语音语言模型(FD-SLMs)评测体系的一个关键缺陷:缺乏对多轮、连续对话能力的系统性评估。现有基准多关注单轮交互或特定对话特性(如打断),忽略了模型在多轮语境下维持指令遵循、安全等核心能力的一致性。为此,作者提出了**MTR-DuplexBench**,一个全新的多轮全双
这篇论文旨在解决语音合成(TTS)领域中一个关键但被忽视的问题:如何标准化评估系统生成非语言声音(NVV,如笑声、叹息)的能力。作者提出了**NVBench**,一个包含**45类NVV统一分类体系**的双语(英/中)基准。其核心方法包括:1)构建了一个每类50例、总计4500例的高质量平衡评估数据
本文针对文本转语音(TTS)任务,提出了一种名为“细节链”(Chain-of-Details, CoD)的新框架。**要解决的问题**是现有TTS方法在建模语音生成的时域动态(从粗略时序到精细声学细节的渐进过程)方面存在不足。**使用的方法**是将语音生成分解为多个时间分辨率递增的阶段,在每个阶段使
共分析 21 篇语音/AI 论文
这篇论文旨在解决AI生成音乐检测中普遍存在的泛化能力差的问题。当前主流方法(如CLAM、SpecTTTra)通过学习AI音乐的声音特征,在面对未见过的生成器时性能急剧下降。作者提出了一个核心假设:当前主流AI音乐生成器(如Suno, Udio)都依赖神经音频编解码器(如EnCodec)的残差矢量量化