论文解读

MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

音频检索 | 5.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5203 字 阅读 →
论文解读

Quality Audio Prototyping: a prototype system for unified sound retrieval and procedural generation

音频检索 | 6.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4629 字 阅读 →
论文解读

OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation

音频检索 | 9.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5784 字 阅读 →
论文解读

MERIT: Learning Disentangled Music Representations for Audio Similarity

音频检索 | 9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5351 字 阅读 →
论文解读

Audio-Image Cross-Modal Retrieval with Onomatopoeic Images

音频检索 | 7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6984 字 阅读 →
论文解读

FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries

音频检索 | 6.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9517 字 阅读 →
论文解读

ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Multi-Axis Speech Similarity via Factor-Partitioned Embeddings

音频检索 | 6.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4834 字 阅读 →
论文解读

Beyond Instance-Level Alignment: Dual-Level Optimal Transport for Audio-Text Retrieval

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4524 字 阅读 →
论文解读

CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval

音频检索 音乐理解 | 6.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5689 字 阅读 →
会议任务专题

ICLR 2026 - 音频检索

共 4 篇 ICLR 2026 音频检索 方向论文

 · 更新于 2026-09-24 · 约 13 分钟 · 6424 字 阅读 →
论文解读

OmniCVR: A Benchmark for Omni-Composed Video Retrieval with Vision, Audio, and Text

音频检索 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5371 字 阅读 →
论文解读

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

音频检索 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4249 字 阅读 →
论文解读

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

音频检索 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4709 字 阅读 →
论文解读

Beyond Instance-Level Alignment: Dual-Level Optimal Transport for Audio-Text Retrieval

音频检索 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4293 字 阅读 →
论文解读

Learning multimodal dictionary decompositions with group-sparse autoencoders

跨模态 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4031 字 阅读 →
论文解读

MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment

音频检索 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5061 字 阅读 →
论文解读

OmniCVR: A Benchmark for Omni-Composed Video Retrieval with Vision, Audio, and Text

音频检索 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5159 字 阅读 →
论文解读

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4253 字 阅读 →
论文解读

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

音频检索 视频检索 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5230 字 阅读 →