论文解读
TinyMU: A Compact Audio-Language Model for Music Understanding
音乐理解 | 7.5/10
音乐理解 | 7.5/10
音频问答 | 7.5/10
音频问答 | 6.5/10
音频场景理解 | 8.0/10
音频问答 | 6.5/10
本文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务中能力不足、推理过程不透明的问题。**核心贡献**是提出了一个名为 **Audio-Cogito** 的完全开源解决方案,其核心是一个四阶段的自动化数据构建管道 **Cogito-Pipe**,用于生成高质量、多样化的音频推理链(CoT)数
这篇论文旨在解决大型音频语言模型(LALMs)缺乏显式、高质量推理能力的问题。现有方法要么受限于监督数据的质量,要么使用粗糙的奖励,导致生成的思维链形式良好但缺乏声学依据。作者提出了**Audio-DeepThinker**框架,其核心贡献有三:1)设计了一种**混合推理相似度奖励**,结合LLM评
统一的大型音频-语言模型(LALMs)在自回归解码时存在“时间平滑偏差”:短暂、瞬态的声学线索(如电话铃声、乐器拨弦)容易被语言先验和时间上平滑的上下文所淹没,导致生成结果缺乏音频特异性。本文提出 Temporal Contrastive Decoding (TCD),一种完全免训练、仅在推理时生效