论文解读

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

说话人识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4588 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20102 字 阅读 →
论文解读

"This Wasn't Made for Me": Recentering User Experience and Emotional Impact in the Evaluation of ASR Bias

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1997 字 阅读 →
论文解读

Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3626 字 阅读 →
论文解读

Misinformation Span Detection in Videos via Audio Transcripts

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4016 字 阅读 →
论文解读

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3910 字 阅读 →
论文解读

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5231 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-24

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 59 分钟 · 29279 字 阅读 →
论文解读

Aligning Stuttered-Speech Research with End-User Needs: Scoping Review, Survey, and Guidelines

1. **问题**:当前口吃语音技术研究与口吃者(PWS)及言语语言病理学家(SLP)的实际需求存在系统性脱节,研究重点、任务定义和评估方法未能充分以用户为中心。 2. **方法核心**:通过两部分结合分析:1)对228篇相关论文进行范围综述,提出研究任务分类法并分析研究现状;2)对70名利益相

 · 更新于 2026-09-25 · 约 6 分钟 · 2799 字 阅读 →
论文解读

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

这篇论文旨在解决对多语言、多模态句子嵌入(如SONAR, LaBSE)的可解释性问题。核心方法是提出一种称为因子化线性投影(FLiP)的模型,通过将嵌入向量线性投影到词汇表空间来提取关键词,以此作为理解嵌入内容的代理任务。与之前非因子化的线性探测方法(如LiP)和SpLiCE相比,FLiP在关键词提

 · 更新于 2026-09-25 · 约 8 分钟 · 4001 字 阅读 →
论文解读

Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages

1. **问题**:现有针对基于神经音频编解码器的语音深度伪造(CodecFake)检测的研究主要集中在英语和中文,对于语言多样性极高的印度语言缺乏大规模的基准数据集和有效的检测方法。 2. **方法**:作者构建了首个大规模印度语言CodecFake数据集(ICF),并提出了一个名为SATYA

 · 更新于 2026-09-25 · 约 10 分钟 · 4929 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇论文介绍了Qwen3.5-Omni,一个支持文本、图像、音频和音频-视频输入的全模态大语言模型。为解决现有模型在实时交互、跨模态推理和工具使用上的不足,其核心方法是采用“Thinker-Talker”架构,并引入混合专家(MoE)设计以提升效率。与前代相比,主要创新在于:1)模型规模扩展至数千亿

 · 更新于 2026-09-25 · 约 10 分钟 · 4857 字 阅读 →
论文解读

SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation

1. **问题**:现有大型音频语言模型在副语言(如情绪、语气、音色)生成与理解能力上的评估存在特征覆盖不全、评估方法主观且不可扩展的问题。 2. **方法**:提出了SpeechParaling-Bench,一个包含1000余个中英平行语音查询、覆盖超过100个细粒度副语言特征的综合基准。基准

 · 更新于 2026-09-25 · 约 7 分钟 · 3464 字 阅读 →
论文解读

Tadabur: A Large-Scale Quran Audio Dataset

1. **问题**:现有的古兰经语音数据集在规模、诵读者多样性、音频质量和标注深度上存在严重不足,限制了古兰经ASR、诵读者识别等任务的研究进展。 2. **方法核心**:提出Tadabur数据集及其构建流水线。流水线核心是“古兰经经文对齐模块”(AAM),它结合WhisperX进行初步转录,再利用

 · 更新于 2026-09-25 · 约 8 分钟 · 3619 字 阅读 →
论文解读

Utterance-Level Methods for Identifying Reliable ASR-Output for Child Speech

1. **要解决什么问题**:儿童语音自动识别(ASR)错误率高,影响语言学习、阅读辅助等应用。传统置信度估计方法在噪声大、模式多变的儿童语音上可能失效。需要一种在转录后(utterance级别)自动识别哪些ASR输出是可靠的方法,以减少人工审核负担。 2. **方法核心是什么**:提出两种基于

 · 更新于 2026-09-25 · 约 10 分钟 · 4959 字 阅读 →
论文解读

NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations

这篇论文旨在解决语音合成(TTS)领域中一个关键但被忽视的问题:如何标准化评估系统生成非语言声音(NVV,如笑声、叹息)的能力。作者提出了**NVBench**,一个包含**45类NVV统一分类体系**的双语(英/中)基准。其核心方法包括:1)构建了一个每类50例、总计4500例的高质量平衡评估数据

 · 更新于 2026-09-25 · 约 10 分钟 · 4905 字 阅读 →
论文解读

Tadabur: A Large-Scale Quran Audio Dataset

本文旨在解决古兰经语音研究领域缺乏大规模、多样化、细粒度标注数据集的问题。为此,作者提出了**Tadabur**数据集及其自动化构建流水线。该流水线首先从公共平台收集音频,并利用大语言模型(Gemini)从非结构化文本中提取标准化元数据(如章节、朗诵者)。核心步骤是**Ayah Alignment

 · 更新于 2026-09-25 · 约 8 分钟 · 3844 字 阅读 →
论文解读

Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

这篇论文旨在解决现有印度语言语音识别(Indic ASR)基准不反映真实场景、评估方法不公平的核心问题。为此,作者构建了“Voice of India”大规模基准,其数据源自3.6万名说话者的非脚本化电话对话,覆盖15种主要印度语言和139个地区集群,总计536小时。关键创新在于采用了考虑拼写变体的

 · 更新于 2026-09-25 · 约 8 分钟 · 3765 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 44 分钟 · 21691 字 阅读 →
论文解读

BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

这篇论文旨在解决印度语言NLP研究资源分散、缺乏统一概览的痛点。作者首次提出了一个以任务为中心的统一分类体系,系统性地梳理和整合了超过200个数据集、50个基准测试以及100多个模型、工具和系统,覆盖了从核心语言处理(如分词、词性标注)到文本分类、生成翻译、信息检索、语音与多模态,乃至社会文化任务(

 · 更新于 2026-09-25 · 约 6 分钟 · 2997 字 阅读 →