论文解读

Timbre-Aware Audio Difference Captioning for Anomalous Machine Sounds without Paired Training Data via Synthetic Perturbations

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4605 字 阅读 →
论文解读

Timbre-Based Pretraining with Pseudo-Labels for Multi-Instrument Automatic Music Transcription

音乐信息检索 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7980 字 阅读 →
论文解读

Transfer Learning for Paediatric Sleep Apnoea Detection using Physiology-Guided Acoustic Models

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4463 字 阅读 →
论文解读

Transferable Audio Lottery Tickets: Gradient Accumulation for Extreme Sparsity

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3873 字 阅读 →
论文解读

UMV: A Mixture-Of-Experts Vision Transformer with Multi-Spectrogram Fusion for Underwater Ship Noise Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4212 字 阅读 →
论文解读

Unsupervised Discovery and Analysis of the Vocal Repertoires and Patterns of Select Corvid Species

生物声学 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4918 字 阅读 →
论文解读

UVT-LM: Unifying Visual and Tactile Perception with Language Model

跨模态 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4823 字 阅读 →
论文解读

WaveSpikeNet: A Wavelet-Spiking Fusion Architecture for Audio Classification on Edge Devices

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6552 字 阅读 →
论文解读

When Audio Matters: A Lightweight, Hierarchical Fusion Model for Speech and Non-Verbal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4926 字 阅读 →
论文解读

Meta-Ensemble Learning with Diverse Data Splits for Improved Respiratory Sound Classification

音频分类 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4218 字 阅读 →
论文解读

Audio Effect Estimation with DNN-Based Prediction and Search Algorithm

音乐理解 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4821 字 阅读 →
论文解读

Deep Hierarchical Knowledge Loss for Fault Intensity Diagnosis

1. **要解决什么问题**:传统故障强度诊断方法将各类故障视为独立标签,忽略了物理状态之间固有的层次依赖关系(如“空化”是“初期空化”、“稳定空化”等的父类),这限制了模型的性能和鲁棒性。 2. **方法核心是什么**:提出一个名为DHK的通用框架,其核心是设计两个新的损失函数:**层次树损失

 · 更新于 2026-09-25 · 约 11 分钟 · 5217 字 阅读 →
论文解读

Explicit Dropout: Deterministic Regularization for Transformer Architectures

这篇论文旨在解决传统Dropout方法依赖随机掩码、正则化效果不透明且难以精确控制的问题。其核心方法是提出一种确定性公式,将Dropout重新表述为一个可直接加入训练损失函数的显式正则化项,并推导出了适用于Transformer架构中注意力机制(Q、K、V)和前馈网络的正则化表达式。与已有方法相比,

 · 更新于 2026-09-25 · 约 5 分钟 · 2497 字 阅读 →
论文解读

Environmental Sound Deepfake Detection Using Deep-Learning Framework

本文针对环境声音(如声音事件、声音场景)的深度伪造检测这一新兴任务,提出了一个系统的深度学习框架。**核心贡献**在于通过大量实验,系统评估了不同频谱图(MEL, CQT, Gammatone)、多种CNN架构(ResNet, Inception等)以及预训练模型(BEATs)在该任务上的表现,并验

 · 更新于 2026-09-25 · 约 8 分钟 · 3862 字 阅读 →
论文解读

Incremental learning for audio classification with Hebbian Deep Neural Networks

本文针对音频分类中的增量学习(持续学习)问题,提出了一种受生物启发的解决方案。核心是解决深度学习模型在学习新任务时对旧知识的“灾难性遗忘”。作者首次将**Hebbian学习**(一种基于神经元同步激活的无监督、无反馈学习规则)与**增量学习**相结合,并设计了一个**核塑性**机制。该机制通过分析训

 · 更新于 2026-09-25 · 约 8 分钟 · 3781 字 阅读 →
论文解读

Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification

本文旨在解决零样本呼吸音频分类中“一刀切”的推理计算浪费问题。为此,提出了TRIAGE框架,这是一个三层自适应推理管道:第一层(Tier-L)进行快速的标签-文本相似度匹配;若置信度不足则升级至第二层

 · 更新于 2026-09-25 · 约 11 分钟 · 5023 字 阅读 →
论文解读

Classical Machine Learning Baselines for Deepfake Audio Detection on the Fake-or-Real Dataset

本文旨在解决深度伪造音频检测领域缺乏透明、可解释基线的问题。研究团队采用经典机器学习方法,在Fake-or-Real (FoR) 数据集上构建了一个完整的检测流程。他们从高保真(44.1 kHz)和电

 · 更新于 2026-09-25 · 约 10 分钟 · 4970 字 阅读 →
论文解读

Comparison of window shapes and lengths in short-time feature extraction for classification of heart sound signals

本文针对心音信号(PCG)分类任务中,因信号非-stationarity而采用滑动窗口分段提取特征时,窗函数形状和长度选择缺乏系统性研究的问题,进行了一项实验性评估。作者使用双向长短期记忆网络(biL

 · 更新于 2026-09-25 · 约 7 分钟 · 3490 字 阅读 →
论文解读

Elastic Net Regularization and Gabor Dictionary for Classification of Heart Sound Signals using Deep Learning

本文旨在解决心音信号(PCG)的多分类问题,以辅助心血管疾病的自动诊断。核心贡献在于提出了一套结合**优化Gabor字典**和**弹性网络正则化**的特征提取框架,并与**CNN-LSTM深度学习网络

 · 更新于 2026-09-25 · 约 10 分钟 · 4594 字 阅读 →
论文解读

Room compensation for loudspeaker reproduction using a supporting source

本文针对传统房间补偿技术仅能修正频谱(音色)而无法控制空间感知(如距离感)的局限,提出了一种创新的补偿方法。该方法通过引入一个延迟的、经过频谱滤波的辅助扬声器,选择性地向房间的混响声场中添加能量,从而

 · 更新于 2026-09-25 · 约 8 分钟 · 3648 字 阅读 →