论文解读

当 AI 自己给艺术分类:28 个簇与 6 个人类标签的错位

音视频理解 | 4.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9446 字 阅读 →
论文解读

不只用文字指挥检索:当嵌入器学会看区域、听时段

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9187 字 阅读 →
论文解读

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

空间音频 | 7.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5435 字 阅读 →
论文解读

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

音视频理解 | 9.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6559 字 阅读 →
论文解读

Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings

语音识别 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5179 字 阅读 →
论文解读

Unified Music Identification for Tracks and Versions

音乐检索 | 8.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6149 字 阅读 →
论文解读

Finetuning Strategies for Querying Sounds by Vocal Imitation

音频检索 | 7.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5013 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-20

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 47 分钟 · 23525 字 阅读 →
论文解读

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

音视频理解 | 7.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8197 字 阅读 →
论文解读

Contrastive Learning with Variational Regularization for Multi-Session EEG-to-Speech Decoding

语音合成 | 5.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6339 字 阅读 →
论文解读

Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement

音视频语音分离 | 6.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5443 字 阅读 →
论文解读

What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models

音乐理解 | 7.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 8007 字 阅读 →
论文解读

Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

音视频生成 | 6.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8252 字 阅读 →
论文解读

S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling

音频检索 | 6.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6459 字 阅读 →
论文解读

Singer-Informed Vocal Source Separation for Multi-Singer Music Mixtures

音乐源分离 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6140 字 阅读 →
论文解读

Beyond Dry References: Learning Relative Audio Effects Representations via Contrastive Distance Learning

音乐理解 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5536 字 阅读 →
论文解读

Rationale-Guided Learning for Multimodal Emotion Recognition

语音情感识别 | 7.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7248 字 阅读 →
论文解读

RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction

音频生成 | 6.9/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9065 字 阅读 →
论文解读

Structured Phonological Representations for Audio-Articulatory rtMRI Speech Classification

语音属性识别 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6013 字 阅读 →
论文解读

Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence

声源定位 | 6.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6953 字 阅读 →