论文解读

AUDIOCARDS: Structured Metadata Improves Audio Language Models for Sound Design

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5242 字 阅读 →
论文解读

Auto-MatchCut: An Audio-Visual Retrieval Framework for Seamless Match Cutting

跨模态检索 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3899 字 阅读 →
论文解读

Automatic Music Sample Identification with Multi-Track Contrastive Learning

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4382 字 阅读 →
论文解读

BEST-STD 2.0: Balanced and Efficient Speech Tokenizer for Spoken Term Detection

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5339 字 阅读 →
论文解读

CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries

音频检索 | 8.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3821 字 阅读 →
论文解读

Contrastive Timbre Representations for Musical Instrument And Synthesizer Retrieval

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3791 字 阅读 →
论文解读

Do Speech LLMs Learn Crossmodal Embedding Spaces?

音频检索 | 6.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4063 字 阅读 →
论文解读

EchoRAG: A Two-Stage Framework for Audio-Text Retrieval and Temporal Grounding

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5031 字 阅读 →
论文解读

GLAP: General Contrastive Audio-Text Pretraining Across Domains and Languages

音频检索 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4462 字 阅读 →
论文解读

Hashing-Baseline: Rethinking Hashing in the Age of Pretrained Models

音频检索 音频分类 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4362 字 阅读 →
会议任务专题

ICASSP 2026 - 音频检索

共 11 篇 ICASSP 2026 音频检索 方向论文

 · 更新于 2026-09-24 · 约 36 分钟 · 17956 字 阅读 →
论文解读

Leveraging Whisper Embeddings For Audio-Based Lyrics Matching

音乐信息检索 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4853 字 阅读 →
论文解读

MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models

基准测试 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4488 字 阅读 →
论文解读

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

音乐推荐 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4258 字 阅读 →
论文解读

Scalable Evaluation for Audio Identification Via Synthetic Latent Fingerprint Generation

音频检索 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3896 字 阅读 →
论文解读

Separate this, and all of these Things Around It: Music Source Separation Via Hyperellipsoidal Queries

音乐分离 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4838 字 阅读 →
论文解读

Shared Representation Learning for Reference-Guided Targeted Sound Detection

音频事件检测 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4764 字 阅读 →
论文解读

SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training

音频检索 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4546 字 阅读 →
论文解读

WavLink: Compact Audio–Text Embeddings with a Global Whisper Token

音频检索 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4681 字 阅读 →
论文解读

Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4499 字 阅读 →