论文解读
从听见写入选项到用选项做决定:音频大模型中声学证据的两阶段路径
在必须依赖声音的选择题上训练能提升准确率并同步增强对真实音频的行为敏感度,其内部机制是早期到中层先让音频塑造选项表征、再在中层到晚层强化选项对最终答案的贡献,而可学习的 LoRA 更新在模型特定的层带上起决定作用。
在必须依赖声音的选择题上训练能提升准确率并同步增强对真实音频的行为敏感度,其内部机制是早期到中层先让音频塑造选项表征、再在中层到晚层强化选项对最终答案的贡献,而可学习的 LoRA 更新在模型特定的层带上起决定作用。
针对歌唱音频的专家式指导反馈问题,VocalCoachBench 用同曲可控对比与异曲多样场景的双子集和原子主张拆分来构造可复现评估,12 个音频语言模型的实测显示成对排序可行但细粒度 Top-3 识别与严格诊断命中率仍低于多数类基线且严格命中低于 7%。
音频理解 | 6.9/10
音频字幕生成 | 6.8/10
音乐生成 | 6.9/10
音频分类 | 6.0/10
语音交互 | 6.6/10
音频理解 | 6.6/10
音频理解 | 8.0/10
音频质量评估 | 8.9/10
音频理解 | 8.3/10
音频理解 | 8.0/10
语音交互 | 6.5/10
音乐理解 | 7.1/10
音频字幕生成 | 7.5/10
音频理解 | 6.5/10
音频理解 | 6.8/10
音频质量评估 | 6.5/10
音视频问答 | 6.6/10
语音交互 | 5.4/10