论文解读

A conceptual framework for learning to listen by reward: Curiosity-driven search for novel sources

声源定位 | 5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7501 字 阅读 →
论文解读

Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

音频分类 | 7.0/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2190 字 阅读 →
会议任务专题

ICLR 2026 - 音频场景理解

共 1 篇 ICLR 2026 音频场景理解 方向论文

 · 更新于 2026-09-24 · 约 4 分钟 · 1706 字 阅读 →
论文解读

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

音频场景理解 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4373 字 阅读 →
论文解读

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

音频问答 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5380 字 阅读 →
论文解读

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

音频场景理解 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4566 字 阅读 →
论文解读

A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)

语音分离 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5194 字 阅读 →
论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4835 字 阅读 →
论文解读

Acoustic Teleportation Via Disentangled Neural Audio Codec Representations

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4710 字 阅读 →
论文解读

AUDIOGENIE-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5308 字 阅读 →
论文解读

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

基准测试 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4576 字 阅读 →
论文解读

Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources

音频场景理解 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4177 字 阅读 →
论文解读

DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models

音频问答 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4732 字 阅读 →
论文解读

From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-Modal Understanding in Multimodal LLMS

音频场景理解 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4037 字 阅读 →
会议任务专题

ICASSP 2026 - 音频场景理解

共 3 篇 ICASSP 2026 音频场景理解 方向论文

 · 更新于 2026-09-24 · 约 10 分钟 · 4572 字 阅读 →
论文解读

LAMB: LLM-Based Audio Captioning with Modality Gap Bridging Via Cauchy-Schwarz Divergence

音频描述 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4276 字 阅读 →
论文解读

Lightweight and Generalizable Acoustic Scene Representations Via Contrastive Fine-Tuning and Distillation

音频场景理解 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5226 字 阅读 →
论文解读

Segmentwise Pruning in Audio-Language Models

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4222 字 阅读 →
论文解读

Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-Wise Distillation

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3417 字 阅读 →
论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4909 字 阅读 →