论文解读

UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction

**核心贡献**:本文提出了首个专为全双工语音交互设计的统一音频前端大模型(UAF)。它打破了传统级联式前端处理的范式,将语音活动检测(VAD)、说话人识别(SR)、自动语音识别(ASR)、轮次检测(TD)和问答(QA)等多个任务,统一建模为一个自回归序列预测问题。 **关键方法**:模型采用“音

 · 更新于 2026-10-02 · 约 13 分钟 · 6463 字 阅读 →
论文解读

Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

这篇论文旨在解决现有印度语言语音识别(Indic ASR)基准不反映真实场景、评估方法不公平的核心问题。为此,作者构建了“Voice of India”大规模基准,其数据源自3.6万名说话者的非脚本化电话对话,覆盖15种主要印度语言和139个地区集群,总计536小时。关键创新在于采用了考虑拼写变体的

 · 更新于 2026-10-02 · 约 8 分钟 · 3765 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-10-02 · 约 44 分钟 · 21691 字 阅读 →
论文解读

A novel LSTM music generator based on the fractional time-frequency feature extraction

本文提出了一种基于分数阶傅里叶变换(FrFT)和长短期记忆网络(LSTM)的新型AI音乐生成系统。**核心目标**是利用FrFT在分数阶域(时频平面的旋转表示)中提取比传统时域或频域更丰富的音乐信号特征,以解决传统LSTM在捕捉音乐复杂时频结构上的不足。**关键方法**是将输入音乐信号进行FrFT变

 · 更新于 2026-10-02 · 约 8 分钟 · 3725 字 阅读 →
论文解读

A state-space representation of the boundary integral equation for room acoustic modelling

本文旨在解决传统房间声学建模中多种方法(如边界元法、延迟网络、几何声学)彼此独立、缺乏统一理论基础的问题。作者提出了一种名为**边界积分算子状态空间(BIOSS)** 的新框架。该框架的核心是将描述声场的边界积分方程重新表述为一个状态空间模型,其中**状态是房间边界上的声压分布函数**,系统动态由*

 · 更新于 2026-10-02 · 约 8 分钟 · 3667 字 阅读 →
论文解读

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

这篇论文旨在解决大语言模型在歌词到旋律生成任务中,通过监督微调(SFT)训练出的模型常产生音乐上不可行(如节奏怪异、音域超限)的“约束违反”问题。**核心贡献**是提出了一套无需人工标注、基于规则约束的自动化对齐框架。**关键方法**分为三步:首先对预训练LLM进行SFT以获得基础生成能力;其次,利

 · 更新于 2026-10-02 · 约 10 分钟 · 4941 字 阅读 →
论文解读

Anonymization, Not Elimination: Utility-Preserved Speech Anonymization

这篇论文针对语音数据隐私保护中“隐私泄露”与“数据效用损失”的核心矛盾,提出了一个新颖的两阶段框架。首先,为解决语音匿名化(保护“谁在说”)中身份多样性不足和可控性差的问题,提出了基于流匹配的说话人嵌入匿名器(F3-VA),它能生成多样且与原始说话人充分分离的新身份。其次,为解决内容匿名化(保护“说

 · 更新于 2026-10-02 · 约 12 分钟 · 5943 字 阅读 →
论文解读

ArtifactNet: Detecting AI-Generated Music via Forensic Residual Physics

这篇论文旨在解决AI生成音乐检测中普遍存在的泛化能力差的问题。当前主流方法(如CLAM、SpecTTTra)通过学习AI音乐的声音特征,在面对未见过的生成器时性能急剧下降。作者提出了一个核心假设:当前主流AI音乐生成器(如Suno, Udio)都依赖神经音频编解码器(如EnCodec)的残差矢量量化

 · 更新于 2026-10-02 · 约 10 分钟 · 4777 字 阅读 →
论文解读

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

本文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务中能力不足、推理过程不透明的问题。**核心贡献**是提出了一个名为 **Audio-Cogito** 的完全开源解决方案,其核心是一个四阶段的自动化数据构建管道 **Cogito-Pipe**,用于生成高质量、多样化的音频推理链(CoT)数

 · 更新于 2026-10-02 · 约 9 分钟 · 4337 字 阅读 →
论文解读

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

这篇论文旨在解决大型音频语言模型(LALMs)缺乏显式、高质量推理能力的问题。现有方法要么受限于监督数据的质量,要么使用粗糙的奖励,导致生成的思维链形式良好但缺乏声学依据。作者提出了**Audio-DeepThinker**框架,其核心贡献有三:1)设计了一种**混合推理相似度奖励**,结合LLM评

 · 更新于 2026-10-02 · 约 11 分钟 · 5355 字 阅读 →
论文解读

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

本文旨在解决多模态大模型在音视频联合推理任务上缺乏高质量训练数据的核心挑战。**核心贡献**是提出了AVRT框架,通过组合单模态专家模型的能力来合成多模态推理数据。**关键方法**分为两步:1)**数据生成**:使用专门的视觉教师(Kimi-VL-Thinking)和音频教师(Audio Flami

 · 更新于 2026-10-02 · 约 13 分钟 · 6166 字 阅读 →
论文解读

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

这篇论文首次系统研究了**良性音频数据微调对音频大模型安全对齐的破坏性影响**。核心问题是:用户出于提升性能的目的,在完全无害的音频数据上微调模型,是否会意外削弱其拒绝有害指令的能力?作者提出了一个**基于嵌入空间邻近性的过滤框架**,通过计算良性音频与有害音频在模型内部或外部参考编码器空间中的距离

 · 更新于 2026-10-02 · 约 9 分钟 · 4286 字 阅读 →
论文解读

BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

这篇论文旨在解决印度语言NLP研究资源分散、缺乏统一概览的痛点。作者首次提出了一个以任务为中心的统一分类体系,系统性地梳理和整合了超过200个数据集、50个基准测试以及100多个模型、工具和系统,覆盖了从核心语言处理(如分词、词性标注)到文本分类、生成翻译、信息检索、语音与多模态,乃至社会文化任务(

 · 更新于 2026-10-02 · 约 6 分钟 · 2997 字 阅读 →
论文解读

ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning

本文针对卫星、水下通信等超低比特率(200bps)场景下,传统神经语音编解码器因优化重建质量而牺牲可懂度的问题,提出了ClariCodec。其核心方法是将编码器的量化过程重新定义为一个随机策略,并利用强化学习(RL),以词错率(WER)作为奖励信号对编码器进行微调,而冻结解码器等声学重建管线。实验表

 · 更新于 2026-10-02 · 约 8 分钟 · 3918 字 阅读 →
论文解读

Coexisting Tempo Traditions in Beethoven's Piano and Cello Sonatas: A K-means Clustering Analysis of Recorded Performances, 1930-2012

本文旨在挑战音乐表演实证研究中普遍使用的单一回归分析模型,该模型常将历史速度变化描绘为一个单向、统一的过程。作者提出,这种模型掩盖了多种演奏传统并存的事实。研究通过对贝多芬五首钢琴与大提琴奏鸣曲(Op. 5, 69, 102)在1930-2012年间超过一百个乐章录音的逐小节速度数据进行K-mean

 · 更新于 2026-10-02 · 约 7 分钟 · 3095 字 阅读 →
论文解读

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

本文提出**FLiP**,一种**因子化线性投影模型**,旨在**理解并解释**多语言、多模态句子嵌入空间(如SONAR, LaBSE, Gemini)。核心思想是将嵌入空间的解释转化为一个**线性关键词提取任务**:通过一个简单的线性投影,从句子嵌入向量中恢复出构成该句子的词汇。实验表明,训练良好

 · 更新于 2026-10-02 · 约 8 分钟 · 3724 字 阅读 →
论文解读

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

本文旨在解决训练共情语音聊天机器人时面临的**共情语音数据稀缺、模型泛化能力弱、以及微调导致LLM通用能力退化**三大难题。作者提出了**FreezeEmpath**,一种高效的端到端训练框架。其核心方法是**冻结基础LLM**,采用**语义-情感解耦编码策略**,通过独立的语义适配器和情感提取器从

 · 更新于 2026-10-02 · 约 10 分钟 · 4668 字 阅读 →
论文解读

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

本文旨在解决现有语音代理评估基准主要关注被动响应,而忽略其主动感知与干预能力的问题。作者提出了**ProVoice-Bench**,这是首个专门用于评估主动式语音代理的基准测试框架。该框架通过一个包含数字状态构建、场景合成、对话生成、声学模拟和对话组装的多阶段数据合成管道,构建了包含1182个高质量

 · 更新于 2026-10-02 · 约 8 分钟 · 3570 字 阅读 →
论文解读

Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

这篇论文针对两种音系极其复杂、资源极度匮乏的濒危东高加索语言(Archi和Rutul),首次建立了语音识别(ASR)基准。作者们整合并标准化了现有的语言学记录,创建了约50分钟和1小时20分钟的语音-文本数据集。他们评估了多种前沿ASR模型(wav2vec2, Whisper, Qwen2-Audi

 · 更新于 2026-10-02 · 约 10 分钟 · 4554 字 阅读 →
论文解读

HCFD: A Benchmark for Audio Deepfake Detection in Healthcare

本文针对医疗健康领域中神经音频编解码器生成的语音深伪检测问题,提出了一个全新的研究任务(HCFD)和基准数据集(HCFK)。研究发现,在健康语音上训练的现有深伪检测模型在病态语音上性能显著下降。为此,论文首先验证了预训练音频模型(如PaSST)能更好地应对病理语音带来的变异性。更重要的是,本文提出了

 · 更新于 2026-10-02 · 约 9 分钟 · 4457 字 阅读 →