论文解读

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

这篇论文首次系统研究了**良性音频数据微调对音频大模型安全对齐的破坏性影响**。核心问题是:用户出于提升性能的目的,在完全无害的音频数据上微调模型,是否会意外削弱其拒绝有害指令的能力?作者提出了一个**基于嵌入空间邻近性的过滤框架**,通过计算良性音频与有害音频在模型内部或外部参考编码器空间中的距离

 · 更新于 2026-09-25 · 约 9 分钟 · 4286 字 阅读 →
论文解读

BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

这篇论文旨在解决印度语言NLP研究资源分散、缺乏统一概览的痛点。作者首次提出了一个以任务为中心的统一分类体系,系统性地梳理和整合了超过200个数据集、50个基准测试以及100多个模型、工具和系统,覆盖了从核心语言处理(如分词、词性标注)到文本分类、生成翻译、信息检索、语音与多模态,乃至社会文化任务(

 · 更新于 2026-09-25 · 约 6 分钟 · 2997 字 阅读 →
论文解读

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

本文旨在解决现有语音代理评估基准主要关注被动响应,而忽略其主动感知与干预能力的问题。作者提出了**ProVoice-Bench**,这是首个专门用于评估主动式语音代理的基准测试框架。该框架通过一个包含数字状态构建、场景合成、对话生成、声学模拟和对话组装的多阶段数据合成管道,构建了包含1182个高质量

 · 更新于 2026-09-25 · 约 8 分钟 · 3570 字 阅读 →
论文解读

HCFD: A Benchmark for Audio Deepfake Detection in Healthcare

本文针对医疗健康领域中神经音频编解码器生成的语音深伪检测问题,提出了一个全新的研究任务(HCFD)和基准数据集(HCFK)。研究发现,在健康语音上训练的现有深伪检测模型在病态语音上性能显著下降。为此,论文首先验证了预训练音频模型(如PaSST)能更好地应对病理语音带来的变异性。更重要的是,本文提出了

 · 更新于 2026-09-25 · 约 9 分钟 · 4457 字 阅读 →
论文解读

LLM-Codec: Neural Audio Codec Meets Language Model Objectives

本文旨在解决语音语言模型(SLM)中一个根本性矛盾:神经音频编码器以波形重建为目标进行优化,而语言模型以序列预测为目标进行优化,这种目标不匹配导致生成的离散语音令牌熵值高、难以预测。为此,作者提出了LLM-Codec训练框架,在不改变编码器和语言模型架构的前提下,通过引入两个面向语言模型的正则化目标

 · 更新于 2026-09-25 · 约 11 分钟 · 5390 字 阅读 →
论文解读

MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech

这篇论文旨在解决指令跟随文本转语音(TTS)领域缺乏系统化评估工具的问题。当前评估存在覆盖不全、诊断粒度粗、多语言支持弱等缺陷。为此,作者提出了**MINT-Bench**,一个全面的多语言基准测试。其核心方法包括:1)一个基于10种原子声学属性的**分层多轴分类法**,系统性地组织了从简单到复杂(

 · 更新于 2026-09-25 · 约 10 分钟 · 4944 字 阅读 →
论文解读

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

这篇论文旨在解决当前音频-文本检索模型在**真实、多样化用户查询**下性能下降的问题。作者指出,现有基准测试(如AudioCaps, Clotho)依赖描述性标题式查询,与真实世界中简短、多变的搜索行为(如问题、命令、关键词、排除性查询)存在巨大差距。为此,论文提出了两大核心贡献:1) **Omni

 · 更新于 2026-09-25 · 约 9 分钟 · 4160 字 阅读 →
论文解读

Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party Interruptions

本文旨在解决语音语言模型(SLMs)在真实场景中无法有效区分主要用户与第三方插入语音(Third-Party Interruption, TPI)的问题,这会导致上下文理解失败。为此,作者首先创建了 **TPI-Train**,一个包含8.8万个样本的训练数据集,其核心设计是“说话人感知的难负例”,

 · 更新于 2026-09-25 · 约 8 分钟 · 3773 字 阅读 →
论文解读

VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

这篇论文旨在解决大型音频语言模型(LALM)在开放生成任务中社会偏见评估不足的问题。现有基准多依赖合成语音和选择题(MCQ),无法捕捉模型在真实交互中自然流露的刻板印象。为此,作者提出了**VIBE**框架,其核心是使用**真实人声录音**输入模型,并通过**开放生成任务**(如故事创作、个性化推荐

 · 更新于 2026-09-25 · 约 10 分钟 · 4776 字 阅读 →
论文解读

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

本文针对现有视频到音乐(V2M)生成模型缺乏对创作者风格、主题等细粒度意图控制的问题,提出了Video-Robin,一个结合文本提示的视频配乐框架。其核心方法是将生成过程解耦为两个阶段:首先,一个多模态自回归规划头(AR-Head)整合视频帧和文本提示,通过语义语言模型、有限标量量化(FSQ)和残差

 · 更新于 2026-09-25 · 约 11 分钟 · 5422 字 阅读 →
论文解读

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

这篇论文旨在解决当前语音语言模型(SLM)社会对齐评估不全面、不深入的问题。现有基准要么只关注基础音频理解,要么孤立地研究单一风险,无法区分模型是因“不懂”还是因“没用对地方”而失败。为此,作者提出了**VoxSafeBench**,这是首个联合评估SLM在**安全、公平、隐私**三大社会对齐维度上

 · 更新于 2026-09-25 · 约 13 分钟 · 6394 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-21

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 73 分钟 · 36177 字 阅读 →
论文解读

ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing

这篇论文旨在解决现有角色扮演研究局限于文本模态,而忽视了日常交流中主导的语音模态的问题。为此,作者首先**定义了“语音角色扮演”任务**,要求模型能根据角色、场景和对话历史,生成带有个性化语音特征(如特定情感、语调)的自发性回应。为此,他们构建了**ActorMindBench**,这是一个基于《老

 · 更新于 2026-09-25 · 约 11 分钟 · 5323 字 阅读 →
论文解读

BlasBench: An Open Benchmark for Irish Speech Recognition

这篇论文旨在解决爱尔兰语语音识别(ASR)领域缺乏统一、可靠评估标准的问题。现有工作或基准要么忽略爱尔兰语特有的文本规范(如保留fada变音符号、初始辅音突变),要么在不同数据集和归一化方法下进行,导致结果无法比较。为此,作者提出了**BlasBench**,一个开放的评估框架,其核心是一个**爱尔

 · 更新于 2026-09-25 · 约 10 分钟 · 4640 字 阅读 →
论文解读

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

这篇论文针对当前全双工语音代理评估缺乏真实性(依赖合成语音)和任务简单性(单步调用)的问题,提出了**Full-Duplex-Bench-v3 (FDB-v3)** 基准。该基准的核心创新在于使用**100条真实人类录音**(含五种不流畅性注释),在四个任务域中设计了需要**多步API链式调用**的

 · 更新于 2026-09-25 · 约 8 分钟 · 3607 字 阅读 →
论文解读

HARNESS: Lightweight Distilled Arabic Speech Foundation Models

这篇论文针对阿拉伯语语音识别、方言识别和情感识别中通用多语言/英语模型性能不足、且大模型难以部署的问题,提出了 HArnESS——一个以阿拉伯语为中心的自监督语音模型家族。作者采用 HuBERT 风格的迭代自蒸馏框架,先在大规模阿拉伯语-英语双语数据(约 23K 小时)上训练 24 层的教师模型 H

 · 更新于 2026-09-25 · 约 12 分钟 · 5602 字 阅读 →
论文解读

MUSCAT: MUltilingual, SCientific ConversATion Benchmark

本文提出了 MUSCAT,一个用于评估多语言科学对话场景下自动语音识别(ASR)性能的新基准。数据集包含 6 组双语对话录音(共约 65 分钟,9,066 词),涉及英语与德语、土耳其语、中文、越南语的配对对话;每组对话使用 Meeting Owl 3、ReSpeaker USB 麦克风阵列和 Me

 · 更新于 2026-09-25 · 约 15 分钟 · 7508 字 阅读 →
论文解读

NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages

这篇论文旨在解决非洲低资源语言在语音翻译(S2ST和S2TT)研究中面临的高质量、多口音平行语音数据严重匮乏的核心瓶颈。为此,作者构建了**NaijaS2ST**数据集,涵盖豪萨语、伊博语、约鲁巴语和尼日利亚皮钦语与英语的平行语音,每种语言约50小时,捕获了真实的说话者与口音多样性。基于此数据集,论

 · 更新于 2026-09-25 · 约 9 分钟 · 4148 字 阅读 →
论文解读

NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations

本文旨在解决语音合成(TTS)领域中非语言声音(NVV,如笑声、叹息、哭泣)缺乏标准化评估框架的问题。为此,作者提出了NVBench,一个双语(英/中)基准测试。其核心方法包括:1)设计了一个涵盖45种NVV类型的统一分类法;2)构建了一个类型均衡的高质量双语评估数据集;3)提出了一套多轴评估协议,

 · 更新于 2026-09-25 · 约 11 分钟 · 5061 字 阅读 →
论文解读

Spatial-Aware Conditioned Fusion for Audio-Visual Navigation

本论文针对音频-视觉导航(AVN)中目标空间意图模糊、视觉特征缺乏听觉条件引导两大问题,提出了 Spatial-Aware Conditioned Fusion(SACF)框架。该框架首先设计了 Spatially Discretized Localization Descriptor(SDLD),

 · 更新于 2026-09-25 · 约 10 分钟 · 4579 字 阅读 →