论文解读

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

语音分离 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5723 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-10

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 64 分钟 · 31889 字 阅读 →
论文解读

Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types

音频分类 | 6.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7376 字 阅读 →
论文解读

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7082 字 阅读 →
论文解读

Taste-aware music retrieval from audio embeddings

音乐检索 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6947 字 阅读 →
论文解读

Towards Language-Agnostic Speech Inversion

语音属性识别 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5655 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-07

共分析 58 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 176 分钟 · 87928 字 阅读 →
论文解读

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

音乐生成 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6251 字 阅读 →
论文解读

Bioacoustic Geolocation: Species Sounds as Geographic Signals

音频理解 | 5.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6365 字 阅读 →
论文解读

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

音视频生成 | 8/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9827 字 阅读 →
论文解读

MetaPerch: Learning from metadata for bioacoustics foundation models

音频分类 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6330 字 阅读 →
论文解读

Scaling Transformers for End-to-End Discrete Audio Tokenization

音频编码 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5426 字 阅读 →
论文解读

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

语音交互 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5177 字 阅读 →
论文解读

H-SAGE: Holistic Speaker-Aware Guided Experts for MoE-based Multi-Talker ASR

语音识别 | 6.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5995 字 阅读 →
论文解读

Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack

语音唤醒 | 6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6409 字 阅读 →
论文解读

Two kinds of robustness are not the same: disentangling fault tolerance and low-SNR robustness in multi-domain event detection on real data

音频事件检测 | 8.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4694 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-30

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 51078 字 阅读 →
论文解读

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

语音识别 | 5.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6247 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-29

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 46 分钟 · 22697 字 阅读 →
论文解读

CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents

音频分离 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5663 字 阅读 →