论文解读

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

音频问答 | 7.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4791 字 阅读 →
论文解读

Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

音频问答 | 6.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5968 字 阅读 →
论文解读

Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

音频问答 | 6.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6582 字 阅读 →
论文解读

MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5633 字 阅读 →
论文解读

Audio-Mind: An Auditable Agentic Framework for Audio Understanding

音频问答 | 8.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5702 字 阅读 →
论文解读

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5379 字 阅读 →
论文解读

A Survey of Audio Reasoning in Multimodal Foundation Models

音频推理 | 7.7/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8530 字 阅读 →
论文解读

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7894 字 阅读 →
论文解读

PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding

长音频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7334 字 阅读 →
论文解读

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

音频问答 | 7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8063 字 阅读 →
论文解读

Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities

音频问答 | 6.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8983 字 阅读 →
论文解读

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

模型评估 | 8.0/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10630 字 阅读 →
论文解读

Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

基准测试 | 6.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7890 字 阅读 →
论文解读

Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models

音频问答 | 6.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9319 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频问答 | 6.5/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2680 字 阅读 →
论文解读

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

音频问答 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4402 字 阅读 →
论文解读

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

音频问答 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4607 字 阅读 →
会议任务专题

ICLR 2026 - 音频问答

共 6 篇 ICLR 2026 音频问答 方向论文

 · 更新于 2026-09-24 · 约 16 分钟 · 7983 字 阅读 →
论文解读

Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards

音频问答 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4180 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4699 字 阅读 →