论文解读

Meta-Ensemble Learning with Diverse Data Splits for Improved Respiratory Sound Classification

音频分类 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4218 字 阅读 →
论文解读

Psychologically-Grounded Graph Modeling for Interpretable Depression Detection

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8689 字 阅读 →
论文解读

Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis

发音错误检测 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6458 字 阅读 →
论文解读

Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4294 字 阅读 →
论文解读

Enhancing ASR Performance in the Medical Domain for Dravidian Languages

这篇论文旨在解决达罗毗荼语言(Telugu和Kannada)在医疗领域自动语音识别(ASR)中面临的标注数据稀缺和语言形态复杂两大挑战。其核心方法是提出一个“置信度感知训练框架”,该框架通过一个混合置信度评分机制(结合静态的感知、声学相似性、WER分数和动态的模型熵),对混合了真实与合成语音的训练数

 · 更新于 2026-09-06 · 约 8 分钟 · 3962 字 阅读 →
论文解读

Enhancing Speaker Verification with Whispered Speech via Post-Processing

1. **问题**:耳语语音因缺乏声带振动,其声学特征与正常语音差异显著,导致现有的说话人验证系统性能严重下降。这在用户为保护隐私而低语、或因疾病无法正常发声等实际场景中构成挑战。 2. **方法核心**:在预训练的说话人验证骨干网络(ReDimNet-B6)之上,添加一个轻量级的编码器-解码器结构

 · 更新于 2026-09-06 · 约 10 分钟 · 4925 字 阅读 →
论文解读

Audio Spoof Detection with GaborNet

本论文旨在解决传统SincNet前端在音频伪造检测中因有限长度sinc函数截断导致的频率泄漏问题。作者提出使用可学习的Gabor滤波器组(GaborNet)替代SincNet,并将其集成到两种先进的端到端检测架构RawNet2和RawGAT-ST中。同时,论文探索了将LEAF(Learnable F

 · 更新于 2026-09-06 · 约 13 分钟 · 6015 字 阅读 →
论文解读

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

这篇论文首次系统研究了良性(无害)音频数据微调对音频大模型安全对齐的破坏作用。**要解决的问题**是:用户出于提升模型性能目的进行的常规微调,是否会无意中破坏模型的安全防护?**方法**上,作者提出了一个基于嵌入空间邻近度的过滤框架,从语义、声学及混合维度,选择性地用与有害内容在表示空间上相近的良性

 · 更新于 2026-09-06 · 约 8 分钟 · 3751 字 阅读 →
论文解读

Environmental Sound Deepfake Detection Using Deep-Learning Framework

本文针对环境声音(如声音事件、声音场景)的深度伪造检测这一新兴任务,提出了一个系统的深度学习框架。**核心贡献**在于通过大量实验,系统评估了不同频谱图(MEL, CQT, Gammatone)、多种CNN架构(ResNet, Inception等)以及预训练模型(BEATs)在该任务上的表现,并验

 · 更新于 2026-09-06 · 约 8 分钟 · 3862 字 阅读 →
论文解读

ArtifactNet: Detecting AI-Generated Music via Forensic Residual Physics

这篇论文旨在解决AI生成音乐检测中普遍存在的泛化能力差的问题。当前主流方法(如CLAM、SpecTTTra)通过学习AI音乐的声音特征,在面对未见过的生成器时性能急剧下降。作者提出了一个核心假设:当前主流AI音乐生成器(如Suno, Udio)都依赖神经音频编解码器(如EnCodec)的残差矢量量化

 · 更新于 2026-09-06 · 约 10 分钟 · 4777 字 阅读 →
论文解读

Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party Interruptions

本文旨在解决语音语言模型(SLMs)在真实场景中无法有效区分主要用户与第三方插入语音(Third-Party Interruption, TPI)的问题,这会导致上下文理解失败。为此,作者首先创建了 **TPI-Train**,一个包含8.8万个样本的训练数据集,其核心设计是“说话人感知的难负例”,

 · 更新于 2026-09-06 · 约 8 分钟 · 3773 字 阅读 →
论文解读

SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model Fusion

本文旨在解决开放集说话人识别中的鲁棒性问题,即系统在仅有少量目标说话人注册样本的情况下,需同时准确识别已知说话人并可靠拒识未知说话人。作者在先前SpeakerRPL V1框架基础上提出了三项关键改进:

 · 更新于 2026-09-06 · 约 10 分钟 · 4758 字 阅读 →