不用指令做音频任务:用注意力头掩码锁定大音频语言模型的功能通路
针对大音频语言模型对同义指令敏感而不稳定的问题,论文用只训练注意力头开关的声学注意力头掩码替代文本指令,在 7 个单任务和 ASR 与性别识别组合任务上达到与指令相当或更好的表现,代价是每个任务需单独训练一张掩码且掩码不可跨模型复用。
针对大音频语言模型对同义指令敏感而不稳定的问题,论文用只训练注意力头开关的声学注意力头掩码替代文本指令,在 7 个单任务和 ASR 与性别识别组合任务上达到与指令相当或更好的表现,代价是每个任务需单独训练一张掩码且掩码不可跨模型复用。
论文针对多模态 token 与文本从第 0 层共同走完全部语言模型层造成的算力负担,提出仅让文本走完全程而把多模态 token 直接送入中间层的 DeepInsert,并在视觉、音频、分子模态中显示第 4 层插入可持平基线,而更深插入可用可接受回落换取推理加速。
DIFFA 针对语音理解仍依赖自回归解码的问题,选择冻结 Whisper-small 与 LLaDA-8B-Instruct、只训练语义与声学双适配器的两阶段路线,在 960 小时 ASR 加 127 小时合成指令数据下 MMAU 平均 49.71% 与 MMSU 平均 56.04%,代价是音系与副语言细粒度感知仍弱于语义推理。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
SCENEBench 用合成叠加与受控变换构造背景声理解、噪声定位、跨语转写和发声特征四项任务,在五款大音频语言模型上报告自由回答与选择题准确率及本地延迟,发现模型偏向前景文字而系统性漏掉背景与运动线索。
针对 11 种东南亚语言语音理解评测缺失问题,论文构建 97,194 样本与 597 小时音频的 9 任务基准并统一双语提示与归一化,最强证据是时间定位与情感识别全面偏低且缅甸语等低资源提示落后英文可达 41 个百分点,代价是长音频覆盖过度与拒答等边界行为仍需专门处理。
针对从双人对话推断熟人与陌生人及具体熟人关系的问题,论文提出免训练的多角色辩论与竞争裁决流程,在同一过滤测试集上比较零样本与辩论基线,结构化交互在文本与音文结合上取得宏 F1 领先,但纯音频提升不稳定且多次调用带来更高推理成本。
针对多房间中墙体遮挡导致单点麦克风观测碎片化的问题,论文用分布式麦克风的拓扑感知图融合与几何约束的冻结大语言模型推理将声学证据补全为物理一致的叙事,并在受控仿真中以三元组与空间一致性等指标验证其相对集中式基线的优势与代价。
针对海豚发声时长伸缩与连续频谱难以直接比较的问题,论文将 ClustalW 的离散替换得分改为高斯核平均相似度并配合微调 Whisper 的 128 维嵌入做渐进式多序列比对,在成体攻击与幼体游戏攻击两类精细策展数据上以间隙结构与列方差等指标验证了对齐能恢复同步化爆脉冲等时序母题,但代价是领域适配与早停阈值仍需人工校准且过度拉伸会稀释时间分辨率。
论文在 22 名口吃儿童的 44 段朗读与访谈音频上用儿童专属摘要与三类蕴含判断对比端到端音频语言模型与 Whisper 与 Granite 转录后接文本大模型的级联基线,发现端到端能生成流畅且纯净的摘要但忠实度偏低且蕴含判断普遍偏向肯定类,口吃密度升高与成人干扰会进一步拉低保真度与矛盾类准确率。
音频理解 | 6.4/10
音频理解 | 6.9/10
语音情感识别 | 7.1/10
音频字幕生成 | 6.8/10
说话人日志 | 7.0/10
语音识别 | 7.2/10
语音情感识别 | 6.2/10
音频检索 | 8.0/10
音频理解 | 8.5/10
音频理解 | 8.7/10