论文解读

Learnable Mel-Frontend for Robust Underwater Acoustic Target Detection under Non-Target Interference

音频分类 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4531 字 阅读 →
论文解读

Leveraging Multiple Speech Enhancers for Non-Intrusive Intelligibility Prediction for Hearing-Impaired Listeners

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5540 字 阅读 →
论文解读

LipsAM: Lipschitz-Continuous Amplitude Modifier for Audio Signal Processing and its Application to Plug-And-Play Dereverberation

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4661 字 阅读 →
论文解读

Localizing Speech Deepfakes Beyond Transitions via Segment-Aware Learning

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4261 字 阅读 →
论文解读

Low-Frequency Harmonic Control for Speech Intelligibility in Open-Ear Headphones

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3902 字 阅读 →
论文解读

LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3037 字 阅读 →
论文解读

Membership Inference Attack against Music Diffusion Models via Generative Manifold Perturbation

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4376 字 阅读 →
论文解读

MFF-RVRDI: Multimodal Fusion Framework for Robust Video Recording Device Identification

视频设备识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4466 字 阅读 →
论文解读

Multi-Task Learning For Speech Quality Assessment Using ASR-Derived Entropy Features

语音质量评估 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4836 字 阅读 →
论文解读

NeuroSIFT: A Biologically-Inspired Framework with Explicit Signal-Noise Separation for Robust Multimodal Emotion Recognition

多模态情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3891 字 阅读 →
论文解读

Noise-Robust AV-ASR Using Visual Features both in the Whisper Encoder and Decoder

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4647 字 阅读 →
论文解读

Noise-Robust Contrastive Learning with an MFCC-Conformer for Coronary Artery Disease Detection

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5224 字 阅读 →
论文解读

Noise-to-Notes: Diffusion-Based Generation and Refinement for Automatic Drum Transcription

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5198 字 阅读 →
论文解读

Off-The-Grid Multi-Pitch Estimation Using Optimal Transport

音乐信息检索 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4885 字 阅读 →
论文解读

On deepfake voice detection - It’s all in the presentation

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4174 字 阅读 →
论文解读

Optimizing Speech Language Models for Acoustic Consistency

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4747 字 阅读 →
论文解读

Position-Invariant Fine-Tuning Of Speech Enhancement Models With Self-Supervised Speech Representations

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Prompt-Guided Mixture-of-Experts for Robust Multimodal Sentiment Analysis with Missing Modalities

语音情感识别 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4723 字 阅读 →
论文解读

Random Matrix-Driven Graph Representation Learning For Bioacoustic Recognition

生物声学 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4382 字 阅读 →
论文解读

RAS: a Reliability Oriented Metric for Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4136 字 阅读 →