论文解读

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

音频问答 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4257 字 阅读 →
论文解读

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

基准测试 | 6.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4606 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5314 字 阅读 →
论文解读

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

基准测试 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4547 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3728 字 阅读 →
论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4010 字 阅读 →
论文解读

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

音频问答 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4693 字 阅读 →
论文解读

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

音频问答 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5380 字 阅读 →
论文解读

Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards

音频问答 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4396 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3963 字 阅读 →
论文解读

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

基准测试 | 7.8/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3836 字 阅读 →
论文解读

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

音频问答 | 8.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6263 字 阅读 →
论文解读

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4714 字 阅读 →
论文解读

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

音频问答 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4393 字 阅读 →
论文解读

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

音频问答 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4348 字 阅读 →
论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 9.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4501 字 阅读 →
论文解读

Advancing Speech Summarization in Multi-Modal LLMs with Reinforcement Learning

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4272 字 阅读 →
论文解读

AQUA-Bench: Beyond finding answers to knowing when there are None in Audio Question Answering

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3971 字 阅读 →
论文解读

AUDIOGENIE-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5308 字 阅读 →
论文解读

Benchmarking Humans And Machines On Complex Multilingual Speech Understanding Tasks

音频问答 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3566 字 阅读 →