论文解读

SEI-SHIELD: Robust Specific Emitter Identification Under Label Noise Via Self-Supervised Filtering and Iterative Rescue

信号处理 | 7.5/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6041 字 阅读 →
论文解读

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

音频安全 | 7.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5665 字 阅读 →
论文解读

Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement

语音增强 | 7.0/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5050 字 阅读 →
论文解读

Stage Light is Sequence^2: Multi-Light Control via Imitation Learning

舞台技术 | 7.0/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6801 字 阅读 →
论文解读

Stage-adaptive audio diffusion modeling

音频生成 | 7.0/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5813 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6296 字 阅读 →
论文解读

To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6769 字 阅读 →
论文解读

Trustworthy Federated Label Distribution Learning under Annotation Quality Disparity

标签分布学习 | 8.0/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6635 字 阅读 →
论文解读

VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models

音乐转录 | 7.0/10

 · 更新于 2026-09-10 · 约 21 分钟 · 10272 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-07

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 79 分钟 · 39450 字 阅读 →
论文解读

A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

语音识别 | 7.0/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4807 字 阅读 →
论文解读

A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

语音识别 | 6.0/10

 · 更新于 2026-09-10 · 约 5 分钟 · 2387 字 阅读 →
论文解读

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5431 字 阅读 →
论文解读

APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music

音乐理解 | 8.0/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5162 字 阅读 →
论文解读

Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs

模型评估 | 7.0/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4862 字 阅读 →
论文解读

AsymK-Talker: Real-Time and Long-Horizon Talking Head Generation via Asymmetric Kernel Distillation

语音合成 | 7.5/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6222 字 阅读 →
论文解读

Contrastive Regularization for Accent-Robust ASR

语音识别 | 7.5/10

 · 更新于 2026-09-10 · 约 8 分钟 · 3952 字 阅读 →
论文解读

Cosmodoit: A Python Package for Adaptive, Efficient Pipelining of Feature Extraction from Performed Music

音乐信息检索 | 6.5/10

 · 更新于 2026-09-10 · 约 7 分钟 · 3284 字 阅读 →
论文解读

DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition

音频安全 | 7.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5862 字 阅读 →
论文解读

Deepfake Audio Detection Using Self-supervised Fusion Representations

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4110 字 阅读 →