答对不等于听懂:用六维过程分拆开音频推理的感知与推进
针对大音频语言模型只看准确率会把猜对误判为真推理的问题,论文提出免人工标注金链的六指标 ARIA-Rubrics 做过程评估,在 9 个模型与 2 个基准上显示准确率与过程质量系统性偏离,而完整 ARIA 与人评 Spearman 达 0.671,代价是仍需冻结的轻量打分模型与外部对齐模型。
针对大音频语言模型只看准确率会把猜对误判为真推理的问题,论文提出免人工标注金链的六指标 ARIA-Rubrics 做过程评估,在 9 个模型与 2 个基准上显示准确率与过程质量系统性偏离,而完整 ARIA 与人评 Spearman 达 0.671,代价是仍需冻结的轻量打分模型与外部对齐模型。
该研究把文本选择题改写为可朗读的三语语音题,用同一批题目比较语言、口音、性别与选项顺序的稳定性,发现选项顺序与语言扰动最大而性别与口音较小,推理加深与先转写后作答能部分缓解不稳定,但语音总体放大了文本中已有的敏感性。
论文针对多语言语音事实问答中跨语言与跨模态答案不一致问题,构建 8 语言平行语音文本基准 CCFQA 并用英语为桥的 5 样本迁移训练 LLM-SQA,最强证据是以极少目标语言样本达到与 GPT-4o-mini-Audio 可比的跨语言语音问答表现,代价是仍以英语为中心且仅覆盖语音与文本两种模态。
该研究用 10982 词、84932 条语义维度标注检验多模态大模型能否从发音形式推断意义,发现模型在多数维度上超过 0.50 基线并在深层更关注标志性音素,但与人类的维度分布仍有明显差距。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对统一输入空间大音频语言模型音频窗短的问题,论文提出只改音频区旋转位置编码的部分 YaRN 与训练时随机虚拟长度的位置增强虚拟长音频训练,在 1 至 10 分钟问答上用免训练与微调对照验证长音频泛化收益与调参代价。
论文提出以语速、情感、噪声、口音、音量等声学特征为触发器的后门攻击框架 HIN 与 AudioSafe 评测,在 5% 投毒下语速与情感触发达到 100% 攻击成功率而音量触发不足 6.2%,且训练损失几乎不波动,代价是防御仍需在安全性与可用性之间权衡。
MMAU-Pro 用 5305 组野外音频与 49 项技能考查长时、多音频、空间与文化理解,最强模型仅 59.2% 准确率,暴露感知到推理的断层与指令遵循短板。
针对俄语尚无多模态基准的问题,论文用统一技能分类、块式提示、双指标评分与防泄漏机制构建 18 任务基准,最强证据是全覆盖全模态模型的 Total Score 达到 0.5 且提示 формулировка显著改变分数,代价是专家题人类基线仍低且音频视频能力明显弱于图像。
论文把同一恶意叙事分别用文本、中性语音和五种心理风格语音送入端到端音频大模型,用三数据集攻击成功率证明讲法改变服从性,在 Gemini 上达到 98.26% 而代价是小模型解码不稳定与手工风格难优化。
S3-Bench 用 1980 条科学语音问答与 213 段多轮对话把一次问答拆为识别感知推理发音四段测量,发现前三段正向耦合而生成与上游负耦合,严格事实性与听众适配仍是主要代价。
论文针对大音频语言模型的黑盒音频越狱问题,用两阶段语言与声学风格变换加查询自适应策略搜索 70 种风格组合,在 4 个开源模型和 2 个商用模型上验证了情感、年龄、性别扰动能提升越狱成功率,代价是需要可控 TTS 与多次查询评估。
针对音频问答中少样本演示不稳定且每次推理都要重复传入演示音频的问题,论文提出每个任务只归纳一次纯文字指令的 Audio-Induct,并在 9 个大音频语言模型与两个基准上验证其准确率与推理开销,代价是小模型自行归纳仍不稳定且对策略思维链仅边缘显著。
针对二元音频问答中模型因语言先验而虚报存在的幻觉,TAD 以静默音频为对照做对比解码并仅在首步用音频增益门控惩罚肯定词,在 AudioCaps-Hallucination 与 Clotho-AQA 上提升拒绝能力但在部分设置下以精度与准确率下降为代价。
针对音乐音频语言模型在四选一问答中被迫作答而无法表达不知道的问题,论文用同一 TinyMU 检查点经答案不变扰动构造伪集成,主证据是四种选项排序平均将准确率从 55.7% 提升到 59.2% 并将误差保留曲线面积从 0.293 降到 0.261,代价是每次提问需要 4 次前向传播且无需重新训练。
在必须依赖声音的选择题上训练能提升准确率并同步增强对真实音频的行为敏感度,其内部机制是早期到中层先让音频塑造选项表征、再在中层到晚层强化选项对最终答案的贡献,而可学习的 LoRA 更新在模型特定的层带上起决定作用。
音频检索 | 7.4/10
音频问答 | 7.9/10
音频问答 | 6.9/10
音频问答 | 6.1/10