论文解读

Low-Latency Audio Front-End Region-of-Interest Beamforming for Smart Glasses

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4308 字 阅读 →
论文解读

Mixture To Beamformed Mixture: Leveraging Beamformed Mixture As Weak-Supervision for Speech Enhancement and Noise-Robust ASR

语音增强 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4195 字 阅读 →
论文解读

Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition

语音情感识别 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5585 字 阅读 →
论文解读

Neural Network-Based Time-Frequency-Bin-Wise Linear Combination of Beamformers for Underdetermined Target Source Extraction

语音分离 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5398 字 阅读 →
论文解读

Qastanet: A DNN-Based Quality Metric for Spatial Audio

空间音频 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4668 字 阅读 →
论文解读

SoundCompass: Navigating Target Sound Extraction with Effective Directional Clue Integration in Complex Acoustic Scenes

语音分离 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4540 字 阅读 →
论文解读

Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization

说话人分离 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5315 字 阅读 →
论文解读

Spectral or Spatial? Leveraging Both for Speaker Extraction in Challenging Data Conditions

语音分离 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5058 字 阅读 →
论文解读

Synchronous Secondary Path Modeling and Kronecker-Factorized Adaptive Algorithm for Multichannel Active Noise Control

主动噪声控制 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4919 字 阅读 →
论文解读

Theory and Application of Circular Relative Harmonic Coefficients

声源定位 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4582 字 阅读 →
论文解读

Earable Platform with Integrated Simultaneous EEG Sensing and Auditory Stimulation

音频事件检测 | 5.5/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2648 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 41 分钟 · 20102 字 阅读 →
论文解读

Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features

这篇论文旨在为无声言语接口(SSI)选择更优的中间表示目标。研究系统比较了发音特征(SPARC)和传统的音素独热编码,在预测表面肌电(sEMG)信号包络上的表现。核心发现是:1)在出声、默语和次发声三种模式下,SPARC特征的编码准确性均显著优于音素特征;2)出声和默语模式的编码性能相当,次发声模式

 · 更新于 2026-09-24 · 约 8 分钟 · 3920 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 44 分钟 · 21691 字 阅读 →
论文解读

Audio Source Separation in Reverberant Environments using $β$-divergence based Nonnegative Factorization

本文针对混响环境下的多通道音频源分离问题,提出了一种基于β-散度非负因子分解的参数估计新方法。传统方法依赖期望最大化(EM)算法估计源频谱方差和空间协方差矩阵,本文则利用包含源频谱先验信息的基矩阵(可

 · 更新于 2026-09-24 · 约 6 分钟 · 2800 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-18

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 276 分钟 · 137848 字 阅读 →