论文解读

不训练模型,只靠对齐:用图像把英文单词钉到印地语语音里

音频检索 | 7.3/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9174 字 阅读 →
论文解读

不只用文字指挥检索:当嵌入器学会看区域、听时段

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9187 字 阅读 →
论文解读

AllMusicCaps:让专辑评论成为可检索音乐语义的补充监督

论文把专家专辑评论转为曲目级 caption,并在混合语料、编码层和目标函数的分轴比较中检验其适用范围。

 · 更新于 2026-09-24 · 约 20 分钟 · 9527 字 阅读 →
论文解读

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

空间音频 | 7.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

音频理解 | 7.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6380 字 阅读 →
论文解读

Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors

音频理解 | 9.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5382 字 阅读 →
论文解读

Finetuning Strategies for Querying Sounds by Vocal Imitation

音频检索 | 7.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5013 字 阅读 →
论文解读

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6787 字 阅读 →
论文解读

S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling

音频检索 | 6.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6459 字 阅读 →
论文解读

omni-macos: On-Device Omni-Modal Search on Apple Silicon

音频检索 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6772 字 阅读 →
论文解读

Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8227 字 阅读 →
论文解读

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

音频理解 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5915 字 阅读 →
论文解读

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

音频检索 | 8.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8119 字 阅读 →
论文解读

Dense-Sparse Dynamic Time Warping for Customizing Piano Concerto Accompaniments

音乐源分离 | 7.8/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7252 字 阅读 →
论文解读

Segmental DTW: A Parallelizable Alternative to Dynamic Time Warping

音频检索 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5278 字 阅读 →
论文解读

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

音频检索 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7023 字 阅读 →
论文解读

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

音频检索 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 7003 字 阅读 →
论文解读

Doppelganger: Sound Effects and Their Synthetic Twins

音频检索 | 9.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6213 字 阅读 →
论文解读

VocSim A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio

音频检索 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6711 字 阅读 →
论文解读

wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval

语音检索 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5876 字 阅读 →