论文解读

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

这篇论文首次系统研究了良性(无害)音频数据微调对音频大模型安全对齐的破坏作用。**要解决的问题**是:用户出于提升模型性能目的进行的常规微调,是否会无意中破坏模型的安全防护?**方法**上,作者提出了一个基于嵌入空间邻近度的过滤框架,从语义、声学及混合维度,选择性地用与有害内容在表示空间上相近的良性

 · 更新于 2026-09-18 · 约 8 分钟 · 3751 字 阅读 →
论文解读

Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features

这篇论文旨在为无声言语接口(SSI)选择更优的中间表示目标。研究系统比较了发音特征(SPARC)和传统的音素独热编码,在预测表面肌电(sEMG)信号包络上的表现。核心发现是:1)在出声、默语和次发声三种模式下,SPARC特征的编码准确性均显著优于音素特征;2)出声和默语模式的编码性能相当,次发声模式

 · 更新于 2026-09-18 · 约 8 分钟 · 3920 字 阅读 →
论文解读

Deep Supervised Contrastive Learning of Pitch Contours for Robust Pitch Accent Classification in Seoul Korean

这篇论文旨在解决将连续变化的基频(F0)曲线映射到首尔韩语中离散、不变的音高重音类别(如LHLH, HHLH)这一难题。传统方法易受F0测量噪声和说话人差异的影响。为此,作者提出了**Dual-Glob**,一个深度监督对比学习框架。其核心是通过一个**双分支(干净视图和增强视图)编码器**,在共享

 · 更新于 2026-09-18 · 约 12 分钟 · 5611 字 阅读 →
论文解读

Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps

本文旨在解决语音大模型(SpeechLLMs)在推理时产生的“幻觉”问题,即生成与输入音频不符的流畅文本。现有方法依赖昂贵的黄金标准输出,而文本LLM的方法无法捕捉音频特有信号。为此,作者提出了四个基于注意力图的轻量级指标(AudioRatio, AudioConsistency, AudioEnt

 · 更新于 2026-09-18 · 约 9 分钟 · 4059 字 阅读 →
论文解读

Disentangling Damage from Operational Variability: A Label-Free Self-Supervised Representation Learning Framework for Output-Only Structural Damage Identification

本文针对结构健康监测中损伤信号易被环境与操作变异掩盖的核心挑战,提出了一种**无标签、自监督的解缠表示学习框架**。该框架采用双流自编码器架构,通过**时间序列重构损失**确保信息完整性,并利用**VICReg自监督损失**(基于假设损伤状态不变的基线期数据)强制损伤敏感表征(`z_dmg`)对操作

 · 更新于 2026-09-18 · 约 11 分钟 · 5106 字 阅读 →
论文解读

Environmental Sound Deepfake Detection Using Deep-Learning Framework

本文针对环境声音(如声音事件、声音场景)的深度伪造检测这一新兴任务,提出了一个系统的深度学习框架。**核心贡献**在于通过大量实验,系统评估了不同频谱图(MEL, CQT, Gammatone)、多种CNN架构(ResNet, Inception等)以及预训练模型(BEATs)在该任务上的表现,并验

 · 更新于 2026-09-18 · 约 8 分钟 · 3862 字 阅读 →
论文解读

HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

这篇论文旨在解决大型音频语言模型(LALM)中普遍存在的“幻觉”问题(即生成与音频证据不符的内容)缺乏系统性评估工具的难题。为此,作者构建并发布了**HalluAudio**,这是首个大规模、多领域(语音、环境声、音乐)、多任务(二分类、多选、属性验证、开放生成)的人工验证音频幻觉检测基准,包含超过

 · 更新于 2026-09-18 · 约 10 分钟 · 4726 字 阅读 →
论文解读

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

 · 更新于 2026-09-18 · 约 1 分钟 · 44 字 阅读 →
论文解读

MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models

这篇论文旨在解决当前全双工语音语言模型(FD-SLMs)评测体系的一个关键缺陷:缺乏对多轮、连续对话能力的系统性评估。现有基准多关注单轮交互或特定对话特性(如打断),忽略了模型在多轮语境下维持指令遵循、安全等核心能力的一致性。为此,作者提出了**MTR-DuplexBench**,一个全新的多轮全双

 · 更新于 2026-09-18 · 约 9 分钟 · 4354 字 阅读 →
论文解读

NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations

这篇论文旨在解决语音合成(TTS)领域中一个关键但被忽视的问题:如何标准化评估系统生成非语言声音(NVV,如笑声、叹息)的能力。作者提出了**NVBench**,一个包含**45类NVV统一分类体系**的双语(英/中)基准。其核心方法包括:1)构建了一个每类50例、总计4500例的高质量平衡评估数据

 · 更新于 2026-09-18 · 约 10 分钟 · 4905 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇技术报告全面介绍了Qwen3.5-Omni,一个能够统一理解与生成文本、图像、音频和音视频内容的全模态大语言模型。**要解决的问题**是现有模型在实时交互、跨模态推理和自主智能体行为方面的局限性。**采用的方法**是基于“思考者-说话者”架构,引入了多项关键创新:1)思考者和说话者均采用混合注意

 · 更新于 2026-09-18 · 约 12 分钟 · 5641 字 阅读 →
论文解读

Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

本文旨在解决训练单一自动语音识别(ASR)模型同时高效支持高精度离线转写和低延迟流式识别这一挑战。现有统一模型在低延迟流式模式下性能下降明显。作者提出了一个统一的RNN-Transducer (RNNT) 框架,其核心是结合了**带右上下文的chunk限制注意力**和**动态chunk卷积(DCCo

 · 更新于 2026-09-18 · 约 11 分钟 · 5017 字 阅读 →
论文解读

Tadabur: A Large-Scale Quran Audio Dataset

本文旨在解决古兰经语音研究领域缺乏大规模、多样化、细粒度标注数据集的问题。为此,作者提出了**Tadabur**数据集及其自动化构建流水线。该流水线首先从公共平台收集音频,并利用大语言模型(Gemini)从非结构化文本中提取标准化元数据(如章节、朗诵者)。核心步骤是**Ayah Alignment

 · 更新于 2026-09-18 · 约 8 分钟 · 3844 字 阅读 →
论文解读

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

本文针对文本转语音(TTS)任务,提出了一种名为“细节链”(Chain-of-Details, CoD)的新框架。**要解决的问题**是现有TTS方法在建模语音生成的时域动态(从粗略时序到精细声学细节的渐进过程)方面存在不足。**使用的方法**是将语音生成分解为多个时间分辨率递增的阶段,在每个阶段使

 · 更新于 2026-09-18 · 约 10 分钟 · 4525 字 阅读 →
论文解读

Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

这篇论文旨在解决生成式目标说话人提取(TSE)模型在流式实时应用中因依赖全局上下文而导致性能严重下降的核心问题。作者首次提出了一个基于自回归语言模型(LauraGPT)的流式TSE框架。其核心创新是“分块交织拼接范式”,通过将混合音频块与对应的目标语音离散编码块交错排列作为模型输入,严格保证了推理的

 · 更新于 2026-09-18 · 约 11 分钟 · 5068 字 阅读 →
论文解读

UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction

**核心贡献**:本文提出了首个专为全双工语音交互设计的统一音频前端大模型(UAF)。它打破了传统级联式前端处理的范式,将语音活动检测(VAD)、说话人识别(SR)、自动语音识别(ASR)、轮次检测(TD)和问答(QA)等多个任务,统一建模为一个自回归序列预测问题。 **关键方法**:模型采用“音

 · 更新于 2026-09-18 · 约 13 分钟 · 6463 字 阅读 →
论文解读

Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

这篇论文旨在解决现有印度语言语音识别(Indic ASR)基准不反映真实场景、评估方法不公平的核心问题。为此,作者构建了“Voice of India”大规模基准,其数据源自3.6万名说话者的非脚本化电话对话,覆盖15种主要印度语言和139个地区集群,总计536小时。关键创新在于采用了考虑拼写变体的

 · 更新于 2026-09-18 · 约 8 分钟 · 3765 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-18 · 约 44 分钟 · 21691 字 阅读 →
论文解读

A novel LSTM music generator based on the fractional time-frequency feature extraction

本文提出了一种基于分数阶傅里叶变换(FrFT)和长短期记忆网络(LSTM)的新型AI音乐生成系统。**核心目标**是利用FrFT在分数阶域(时频平面的旋转表示)中提取比传统时域或频域更丰富的音乐信号特征,以解决传统LSTM在捕捉音乐复杂时频结构上的不足。**关键方法**是将输入音乐信号进行FrFT变

 · 更新于 2026-09-18 · 约 8 分钟 · 3725 字 阅读 →
论文解读

A state-space representation of the boundary integral equation for room acoustic modelling

本文旨在解决传统房间声学建模中多种方法(如边界元法、延迟网络、几何声学)彼此独立、缺乏统一理论基础的问题。作者提出了一种名为**边界积分算子状态空间(BIOSS)** 的新框架。该框架的核心是将描述声场的边界积分方程重新表述为一个状态空间模型,其中**状态是房间边界上的声压分布函数**,系统动态由*

 · 更新于 2026-09-18 · 约 8 分钟 · 3667 字 阅读 →