论文解读

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

音视频生成 | 7.6/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7734 字 阅读 →
论文解读

Cross-Talk Speech Reduction, by Separation, for Separation

语音分离 | 9.1/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8921 字 阅读 →
论文解读

Cross-Talk Speech Reduction, by Separation, for Separation

语音分离 | 8.3/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9536 字 阅读 →
论文解读

MedASR: An Open-Source Model for High-Accuracy Medical Dictation

语音识别 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8271 字 阅读 →
论文解读

Stable Audio 3

音频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11116 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

音频事件检测 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7828 字 阅读 →
论文解读

Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models

音频问答 | 6.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9319 字 阅读 →