论文解读

从听见写入选项到用选项做决定:音频大模型中声学证据的两阶段路径

在必须依赖声音的选择题上训练能提升准确率并同步增强对真实音频的行为敏感度,其内部机制是早期到中层先让音频塑造选项表征、再在中层到晚层强化选项对最终答案的贡献,而可学习的 LoRA 更新在模型特定的层带上起决定作用。

 · 更新于 2026-09-24 · 约 24 分钟 · 11722 字 阅读 →
论文解读

从描述到可改的反馈:VocalCoachBench 为何把声乐指导拆成结构化判定与主张级评估

针对歌唱音频的专家式指导反馈问题,VocalCoachBench 用同曲可控对比与异曲多样场景的双子集和原子主张拆分来构造可复现评估,12 个音频语言模型的实测显示成对排序可行但细粒度 Top-3 识别与严格诊断命中率仍低于多数类基线且严格命中低于 7%。

 · 更新于 2026-09-24 · 约 20 分钟 · 9800 字 阅读 →
论文解读

会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒

音频理解 | 6.9/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12384 字 阅读 →
论文解读

长字幕为什么总在最后两层才说谎:用问答把数据、训练和推理锁在一起

音频字幕生成 | 6.8/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10434 字 阅读 →
论文解读

把混音师的耳朵写成奖励:SPHERE 如何让 3B 音频语言模型学会摆位

音乐生成 | 6.9/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12674 字 阅读 →
论文解读

波形有用,不等于必须调用生成式音频模型

音频分类 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8679 字 阅读 →
论文解读

当文字说得太漂亮,声音却在摇头:如何让模型听出言外之意

语音交互 | 6.6/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10404 字 阅读 →
论文解读

别把中层热图当读心术:音频 LLM 的工作空间究竟替谁完成了推理

音频理解 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5836 字 阅读 →
论文解读

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6302 字 阅读 →
论文解读

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

音频质量评估 | 8.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 6001 字 阅读 →
论文解读

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

音频理解 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5275 字 阅读 →
论文解读

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5610 字 阅读 →
论文解读

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

语音交互 | 6.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3159 字 阅读 →
论文解读

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

音乐理解 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7579 字 阅读 →
论文解读

ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning

音频字幕生成 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8571 字 阅读 →
论文解读

ARENA: Automated Red-Teaming for Large Audio Language Models

音频理解 | 6.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7088 字 阅读 →
论文解读

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

音频理解 | 6.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7525 字 阅读 →
论文解读

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

音频质量评估 | 6.5/10

 · 更新于 2026-09-24 · 约 6 分钟 · 3001 字 阅读 →
论文解读

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

音视频问答 | 6.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6671 字 阅读 →
论文解读

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

语音交互 | 5.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7305 字 阅读 →