论文解读

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4393 字 阅读 →
论文解读

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4348 字 阅读 →
论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4501 字 阅读 →
论文解读

Advancing Speech Summarization in Multi-Modal LLMs with Reinforcement Learning

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4272 字 阅读 →
论文解读

AQUA-Bench: Beyond finding answers to knowing when there are None in Audio Question Answering

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3971 字 阅读 →
论文解读

AUDIOGENIE-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5308 字 阅读 →
论文解读

Benchmarking Humans And Machines On Complex Multilingual Speech Understanding Tasks

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3566 字 阅读 →
论文解读

DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4732 字 阅读 →
论文解读

Efficient Audio-Visual Inference Via Token Clustering And Modality Fusion

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4866 字 阅读 →
论文解读

Enhancing Audio Question-Answering Performance Through Log-Likelihood Guided Reward Functions

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4398 字 阅读 →
论文解读

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4320 字 阅读 →
会议任务专题

ICASSP 2026 - 音频问答

共 15 篇 ICASSP 2026 音频问答 方向论文

 · 更新于 2026-09-25 · 约 46 分钟 · 23005 字 阅读 →
论文解读

Improving Audio Question Answering with Variational Inference

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4080 字 阅读 →
论文解读

Keeping Models Listening: Segment- and time-aware attention rescaling at decoding time

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4373 字 阅读 →
论文解读

Mitigating Language Prior-Induced Hallucinations via Bi-Level Contrastive Decoding

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3934 字 阅读 →
论文解读

Segmentwise Pruning in Audio-Language Models

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4222 字 阅读 →
论文解读

SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5286 字 阅读 →
论文解读

TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3624 字 阅读 →
论文解读

Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-Wise Distillation

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3417 字 阅读 →
论文解读

Test-Time Scaling for Auditory Cognition in Audio Language Models

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4888 字 阅读 →