论文解读

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

音频大模型 | 6.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7477 字 阅读 →
论文解读

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7894 字 阅读 →
论文解读

Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches

音乐生成 | 8.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7719 字 阅读 →
论文解读

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

音频问答 | 7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8063 字 阅读 →
论文解读

WavFlow: Audio Generation in Waveform Space

音频生成 | 6.7/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11712 字 阅读 →
论文解读

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

说话人验证 | 7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8893 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

音频事件检测 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7828 字 阅读 →
论文解读

Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9319 字 阅读 →
论文解读

Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2190 字 阅读 →
论文解读

VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models

音乐转录 | 7.0/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10272 字 阅读 →
论文解读

Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5630 字 阅读 →
论文解读

AudioTrust: Benchmarking The Multifaceted Trustworthiness of Audio Large Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7563 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10720 字 阅读 →
论文解读

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4607 字 阅读 →
论文解读

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4360 字 阅读 →
论文解读

Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4180 字 阅读 →
论文解读

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

音频安全 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4556 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4699 字 阅读 →
论文解读

Music Flamingo: Scaling Music Understanding in Audio Language Models

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5841 字 阅读 →
论文解读

OWL : Geometry-Aware Spatial Reasoning for Audio Large Language Models

空间音频 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5053 字 阅读 →