论文解读

Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters

说话人提取 | 6.3/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8630 字 阅读 →
论文解读

Fractional-Order Subband p-Norm Adaptive Filter via Transformation Nearest Kronecker Product Decomposition for Active Noise Control

自适应滤波 | 5/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8577 字 阅读 →
论文解读

MedASR: An Open-Source Model for High-Accuracy Medical Dictation

语音识别 | 7.9/10

 · 更新于 2026-09-09 · 约 17 分钟 · 8271 字 阅读 →
论文解读

MusicDET: Zero-Shot AI-Generated Music Detection

音频深度伪造检测 | 7.4/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7396 字 阅读 →
论文解读

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

音视频 | 7.3/10

 · 更新于 2026-09-09 · 约 19 分钟 · 9061 字 阅读 →
论文解读

PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions

语音数据集 | 6.5/10

 · 更新于 2026-09-09 · 约 20 分钟 · 9997 字 阅读 →
论文解读

Profiling the Voice: Speaker-Specific Phoneme Fingerprinting for Speech Deepfake Detection

语音伪造检测 | 7/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7180 字 阅读 →
论文解读

Robust Audio Tagging under Class-wise Supervision Unreliability

音频分类 | 7.3/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8618 字 阅读 →
论文解读

Robust Soft-Constrained Spatially Selective Active Noise Control for Hearables Under Secondary Path Variations

音频增强 | 5.7/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7281 字 阅读 →
论文解读

S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-09 · 约 20 分钟 · 9578 字 阅读 →
论文解读

SAME: A Semantically-Aligned Music Autoencoder

音频编码 | 8.5/10

 · 更新于 2026-09-09 · 约 26 分钟 · 13010 字 阅读 →
论文解读

SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis

语音合成 | 6.8/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7239 字 阅读 →
论文解读

SIREM: Speech-Informed MRI Reconstruction with Learned Sampling

医学图像重建 | 7.3/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8537 字 阅读 →
论文解读

Sometin Beta Pass Notin (SBPN): Improving Multilingual ASR for Nigerian Languages via Knowledge Distillation

语音识别 | 6.2/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7571 字 阅读 →
论文解读

Sonalyzer-Moz: A Framework for Analyzing the Structure of Mozart's Sonata Form

音乐结构分析 | 7.3/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6193 字 阅读 →
论文解读

Speaker-Disentangled Remote Speech Detection of Asthma and COPD Exacerbations

医疗音频 | 7.5/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8869 字 阅读 →
论文解读

Stable Audio 3

音频生成 | 6.8/10

 · 更新于 2026-09-09 · 约 23 分钟 · 11116 字 阅读 →
论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 语音合成 | 6.7/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7824 字 阅读 →
论文解读

UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations

语音识别 | 7/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7835 字 阅读 →
论文解读

VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

对话情感识别 | 7.4/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6752 字 阅读 →