论文解读

AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2444 字 阅读 →
论文解读

Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4532 字 阅读 →
论文解读

Evaluation of Automatic Speech Recognition Using Generative Large Language Models

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3189 字 阅读 →
论文解读

Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge

语音对话系统 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3206 字 阅读 →
论文解读

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

语音情感识别 | 6.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5670 字 阅读 →
论文解读

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3910 字 阅读 →
论文解读

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5170 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-24

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 59 分钟 · 29279 字 阅读 →
论文解读

ATIR: Towards Audio-Text Interleaved Contextual Retrieval

这篇论文旨在解决现有音频-文本检索方法无法处理查询和文档中音频与文本交错出现(如多轮对话、混合输入)的局限性。为此,作者定义了音频-文本交错上下文检索(ATIR)任务,并构建了一个包含约8.8万对样本的大规模基准。为解决直接应用多模态大语言模型(MLLM)时音频token冗余导致的效率和精度问题,论

 · 更新于 2026-09-25 · 约 9 分钟 · 4361 字 阅读 →
论文解读

Environmental Sound Deepfake Detection Using Deep-Learning Framework

1. **问题**:针对环境声音(包括声音场景和声音事件)的深度伪造检测(ESDD)任务,现有研究不足,且尚不清楚声音场景与声音事件的伪造检测是否需要不同模型。 2. **方法核心**:提出一个深度学习框架,核心是采用预训练的音频模型(BEATs)作为特征提取器,并结合一种三阶段训练策略(包含对

 · 更新于 2026-09-25 · 约 10 分钟 · 4902 字 阅读 →
论文解读

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

1. **问题**:当前多模态大模型在音乐符号处理(Omnimodal Notation Processing, ONP)领域存在严重缺陷:研究碎片化、模型存在严重的符号偏差(偏向五线谱)、且普遍依赖不可靠的“LLM-as-a-Judge”评估方法,掩盖了模型在音乐理论推理上的系统性失败。 2.

 · 更新于 2026-09-25 · 约 9 分钟 · 4149 字 阅读 →
论文解读

SAND: The Challenge on Speech Analysis for Neurodegenerative Disease Assessment

1. **解决的问题**:针对神经退行性疾病(特别是肌萎缩侧索硬化症ALS)的早期诊断和监测,缺乏大规模、有临床标注的语音数据集,以及标准化的算法评估框架。 2. **方法核心**:构建并发布了名为SAND的挑战赛,其核心是提供一个扩展的、包含纵向数据的ALS患者与健康对照语音数据集(VOC-A

 · 更新于 2026-09-25 · 约 9 分钟 · 4092 字 阅读 →
论文解读

SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation

1. **问题**:现有大型音频语言模型在副语言(如情绪、语气、音色)生成与理解能力上的评估存在特征覆盖不全、评估方法主观且不可扩展的问题。 2. **方法**:提出了SpeechParaling-Bench,一个包含1000余个中英平行语音查询、覆盖超过100个细粒度副语言特征的综合基准。基准

 · 更新于 2026-09-25 · 约 7 分钟 · 3464 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-23

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 73 分钟 · 36076 字 阅读 →
论文解读

HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

这篇论文旨在解决大型音频语言模型(LALM)中普遍存在的“幻觉”问题(即生成与音频证据不符的内容)缺乏系统性评估工具的难题。为此,作者构建并发布了**HalluAudio**,这是首个大规模、多领域(语音、环境声、音乐)、多任务(二分类、多选、属性验证、开放生成)的人工验证音频幻觉检测基准,包含超过

 · 更新于 2026-09-25 · 约 10 分钟 · 4726 字 阅读 →
论文解读

MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models

这篇论文旨在解决当前全双工语音语言模型(FD-SLMs)评测体系的一个关键缺陷:缺乏对多轮、连续对话能力的系统性评估。现有基准多关注单轮交互或特定对话特性(如打断),忽略了模型在多轮语境下维持指令遵循、安全等核心能力的一致性。为此,作者提出了**MTR-DuplexBench**,一个全新的多轮全双

 · 更新于 2026-09-25 · 约 9 分钟 · 4354 字 阅读 →
论文解读

NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations

这篇论文旨在解决语音合成(TTS)领域中一个关键但被忽视的问题:如何标准化评估系统生成非语言声音(NVV,如笑声、叹息)的能力。作者提出了**NVBench**,一个包含**45类NVV统一分类体系**的双语(英/中)基准。其核心方法包括:1)构建了一个每类50例、总计4500例的高质量平衡评估数据

 · 更新于 2026-09-25 · 约 10 分钟 · 4905 字 阅读 →
论文解读

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

本文针对文本转语音(TTS)任务,提出了一种名为“细节链”(Chain-of-Details, CoD)的新框架。**要解决的问题**是现有TTS方法在建模语音生成的时域动态(从粗略时序到精细声学细节的渐进过程)方面存在不足。**使用的方法**是将语音生成分解为多个时间分辨率递增的阶段,在每个阶段使

 · 更新于 2026-09-25 · 约 10 分钟 · 4525 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 44 分钟 · 21691 字 阅读 →
论文解读

ArtifactNet: Detecting AI-Generated Music via Forensic Residual Physics

这篇论文旨在解决AI生成音乐检测中普遍存在的泛化能力差的问题。当前主流方法(如CLAM、SpecTTTra)通过学习AI音乐的声音特征,在面对未见过的生成器时性能急剧下降。作者提出了一个核心假设:当前主流AI音乐生成器(如Suno, Udio)都依赖神经音频编解码器(如EnCodec)的残差矢量量化

 · 更新于 2026-09-25 · 约 10 分钟 · 4777 字 阅读 →