论文解读

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

音乐理解 | 7.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7579 字 阅读 →
论文解读

ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning

音频字幕生成 | 7.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8571 字 阅读 →
论文解读

ARENA: Automated Red-Teaming for Large Audio Language Models

音频理解 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7088 字 阅读 →
论文解读

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

音频理解 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7525 字 阅读 →
论文解读

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

音频质量评估 | 6.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 3001 字 阅读 →
论文解读

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

音视频问答 | 6.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6671 字 阅读 →
论文解读

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

语音交互 | 5.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7305 字 阅读 →
论文解读

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

音频理解 | 7.4/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2056 字 阅读 →
论文解读

Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

音频交互 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6613 字 阅读 →
论文解读

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering

音频理解 | 5.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7727 字 阅读 →
论文解读

An Audio Language Model-Based Voice Concept Bottleneck Framework for Interpretable Health Assessment

语音质量评估 | 6.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7062 字 阅读 →
论文解读

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

音频理解 | 9.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7986 字 阅读 →
论文解读

Large Audio Language Models for Spoofing-Aware Speaker Verification

语音伪造检测 | 6.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7545 字 阅读 →
论文解读

Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

语音质量评估 | 8.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7473 字 阅读 →
论文解读

Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models

音频生成 | 7.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7410 字 阅读 →
论文解读

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

音频生成 | 7.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7705 字 阅读 →
论文解读

Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7564 字 阅读 →
论文解读

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

多模态模型 | 7.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7057 字 阅读 →
论文解读

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

语音质量评估 | 7.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7643 字 阅读 →
论文解读

AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning

音频理解 | 6.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5673 字 阅读 →