把扩散解码做实:DIFFA-2 如何用双适配与四阶段课程补齐音频理解
DIFFA-2 针对自回归音频大模型数据贵、串行解码慢的问题,选择冻结 Whisper-Large-V3 加语义与声学双适配器加 LLaDA-8B 扩散主干与四阶段课程,在 MMSU 总体 60.45 分等公开基准上追平同级自回归模型,代价是第一阶段词错误率略高于自回归对照且三元混合音频仍偏弱。
DIFFA-2 针对自回归音频大模型数据贵、串行解码慢的问题,选择冻结 Whisper-Large-V3 加语义与声学双适配器加 LLaDA-8B 扩散主干与四阶段课程,在 MMSU 总体 60.45 分等公开基准上追平同级自回归模型,代价是第一阶段词错误率略高于自回归对照且三元混合音频仍偏弱。
该研究以语音情绪识别为探针比较四种神经元选择器,用失活与放大的自对交叉对照验证情绪敏感神经元的存在,其中均值偏离与对比间隔选择器显示约 11–15 个准确率点的自效应而交叉影响接近零,但标签无关的联合放大效果不稳定且存在跨数据集部分迁移的代价与边界。
针对音频语言模型提示调优在基类上过拟合、新类上掉点的问题,论文提出用大模型生成语义邻居并以带间隔的拉近推远损失约束文本空间,在 11 个数据集平均上把 CoOp 新类准确率从 34.09% 提升到 42.98%,代价是训练时每个类要多编码 10 个邻居文本。
论文提出只用声纹推断八类隐私属性的 HearSay 基准,用 22,064 段真实音频证明模型在性别上平均达到 92.89% 准确率且几乎不拒绝,而思维链推理在强模型上进一步放大泄露,轻量提示防御难以根治生理属性泄露。
针对录音室训练的专用检测器在野外自发语音上泛化崩塌的问题,论文提出免训练的比较引导上下文学习框架,用成对证据生成与对账过滤幻觉,并用分布外路由把难样本交给音频语言模型,在三个野外数据集上报告了高于基线的宏平均 F1,但以录音室数据性能下降和依赖闭源模型生成证据为代价。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对语音、音乐、环境声混在一起导致共享适配器梯度互相打架的问题,论文用稀疏混合专家适配器把音频令牌分流到不同专家,在总参数约 94.4M、激活约 70.8M 的受控预算下把 MMSU 音频准确率从 35.03% 提升到 38.19%、OBQA 从 50.10% 提升到 53.85%、MMAU 从 59.79% 提升到 61.50%,代价是需要负载均衡约束来维 …
论文把可回答性做成输入属性,用语义-声学掩蔽构造配对问答并以不可补偿的 EAR 分数同时考核答题与修复,报告显示多模型答题强但修复弱,而掩蔽加宽能提升修复检出。
论文针对需综合多个独立音频才能作答的多音频推理问题,选择在 Audio Flamingo 3 上做交错多音频指令微调,最强证据是 PolyAudio-Bench 上从 32.9% 提升到 73.5%,代价是依赖合成管线构造数据并把组合范围限制在最多 5 段。
论文针对音频大模型会无意收录并回答旁观者语音的问题,提出只听主说话人的选择性听觉任务与 SH-Bench 评测和 SE 统一指标,并用旁观者隐私微调 BPFT 在保持主说话人理解的同时学会拒答,最强证据是微调后选择模式下旁观者准确率与 SE 大幅超过 Gemini 2.5 Pro,代价是主说话人准确率轻微波动且仅覆盖单主说话人场景。
论文研究如何用极小子集替代上万条音频评测并对齐真人语音助手体验,用 50 条达到 0.93 以上基准相关、用 100 条回归达到 0.978 人类偏好相关,代价是仅 7 个模型的人评与英语对话场景限制。
论文用四种真实声景按 1 到 4 个干扰源叠加构造十万级评测,报告高阶推理在户外强干扰下功能性崩溃而性别感知相对稳定,且常用去噪反而加重词错误率等代价。
针对转写文本丢失语气与环境线索且难以拆解分层话术的问题,SAFE-QAQ 用端到端音频大模型加三阶段规则奖励强化学习做慢思考推理,在 TeleAntiFraud-Bench 上以 SAFE-LS 取得场景 84.64、欺诈 89.61、类型 88.23 的加权 F1,代价是仍依赖单一数据集且实时版类型精度有所下降。
论文针对大音频语言模型在噪声下语义推理不稳定的问题,提出在模型内部嵌入空间度量噪声投影能量的 SEE 并用减去噪声子空间分量的 SEEN 做免训练缓解,最强证据是 SEE 与生成成功率呈约 0.98 负相关,而代价是需要对齐的干净与纯噪声标定数据且只能去除可分离干扰不能补回已丢失语义。
论文以多轮对话中同一说话人是否保持声学一致为问题,用检测、定位、判别三任务与 1818 个人审实例检验 12 个大音频语言模型与 6 种嵌入基线,最强证据是判别可达 81.5% 而检测仅 64.7% 且加文本上下文后不一致检出崩塌,代价是绝对判断阈值不稳与文本压过声学。
针对同时有内部听觉与外部转写建议时朴素融合反而变差的问题,论文用可学习的内部、外部、重写三种动作先裁决再生成,在七个语音识别集与多域音频问答上报告了可运行策略的改进,但重写类样本稀少仍是主要代价。
论文把音频地理定位做成音频语言模型基准,用四步声学过滤加正负类别加权的定位性分数筛出 1444 段录音,最强闭源模型仍只在部分样本上精确定位且高度依赖语言线索。
论文针对音频问答中统一长度推理导致的简单题冗余和难题推理不足,提出随模型感知难度调节长度奖励的 GRDR 与 GA2DR,在保持准确率的同时报告平均推理长度下降至少 50%,代价是 GRDR 在强噪声与高难度集上更易出现奖励投机与不稳定。
该研究用分布外海洋哺乳动物叫声构造感知与认知两类选择题,测低层听觉,最强证据是人类 Remember 达 97.1% 而模型仅 57.1% 左右,代价是题型限于单选题且只覆盖单一生态域。
针对大音频语言模型对同义指令敏感而不稳定的问题,论文用只训练注意力头开关的声学注意力头掩码替代文本指令,在 7 个单任务和 ASR 与性别识别组合任务上达到与指令相当或更好的表现,代价是每个任务需单独训练一张掩码且掩码不可跨模型复用。