英文题目:Noise-Aware In-Context Learning for Hallucination Mitigation in ALLMs

会议身份:conference:interspeech:2026:conference-paper-id:huang26k_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #检索增强 #音频大模型 #模型评估 #音频字幕生成

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Qixuan Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Khalid Zaman:机构信息未能从会议 PDF 纯文本可靠映射
  • Masashi Unoki:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

听觉大语言模型以音频为输入生成自然语言描述,在重叠事件与背景噪声等真实场景下常因声学证据不足而依赖语言先验作过度确定的补全,从而产生听觉幻觉。NAICL离线合成多谱分布宽带噪声并配以结构化保守描述构建先验库,以无稳定语义的噪声刻画声学下界应有的表达模板。在线推理时用BEATs编码器对输入音频与噪声库编码并按余弦相似度检索Top-3最相关噪声-描述对,其输出直接作为上下文进入下一步。被测大模型在输入音频与检索噪声上下文联合条件下解码生成字幕,在证据不足时退回声学层保守表达而非断言具体事件。与用真实音频作示范不同,该方法以弱语义噪声为对比先验,避免强化事件级确定性表达,故为免微调的推理时校准。在Clotho-1K基准下,NAICL的幻觉率指标为16.98%,低于Qwen2.5-Omni-7B基线的幻觉率指标26.53%。该结论适用边界受限于英文众包字幕的短时环境声,尚未验证语音音乐与长音频上的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么研究生要先看幻觉?

这篇论文的输入是一段真实环境录音,输出是一段自然语言描述,任务是音频描述。目标不是把响度或频谱复述一遍,而是说出录音里有哪些可听见的事件、由什么发出、具有什么声学属性。研究生刚进入语音音乐音频领域时容易把这个任务当成分类加翻译,论文提醒的难点在于真实录音常常是多事件重叠、背景噪声大、声学到语义的映射不确定。

在这种不确定下,听觉大语言模型容易走捷径。白话说,听觉大语言模型指能听音频并用大语言模型生成回答的系统,英文是 Auditory Large Language Model,后文简称 ALLM。模型在训练中见过大量文本场景搭配,推理时一旦声音模糊就会用语言常识补全,例如听到一点摩擦就断言是某种具体动作。这种补全在证据不足时就构成听觉幻觉。论文要解决的不是识别率低一两个点,而是模型在证据不足时仍然给出过于确定的解释,可靠性因此受损。

为此论文做了两件事。第一是构造可细分的评测基准 Clotho-1K,第二是提出即插即用的噪声感知上下文学习方法,英文是 Noise-Aware In-Context Learning,后文简称 NAICL。阅读时必须保留的关键信息是基准的筛选修订流程、4 类幻觉的定义边界、噪声库的构造与检索条件、评判模型与指标口径,以及主结果的适用模型与代价。本文按学习依赖展开,先讲已有路线为什么不够,再走完一个样本的完整处理链,最后谈复现条件。

已有评测和已有数据集各卡在哪里?

已有幻觉评测主要分两条路线。第一条是判别式路线,把幻觉检测当成二分类。论文提到的方法通过负采样构造大量正确答案为否的问题,测试模型能否判断声源或事件是否存在,再用分类指标分析偏差,后来又扩展到存在性、时序和属性。它的优点是判定明确,但缺点是容易把漏掉真实事件也混进幻觉讨论,而且只能回答有无,不能刻画生成式描述中那种部分正确、部分编造的细腻错误。

第二条是生成式路线,让模型自由写描述,再从描述中抽名词当作物体集合,统计提到但实际不存在的比例。它的优点是贴近真实使用,但已有工作只做到物体层,没有区分是编造了全新事件、认错了材质来源、加错了属性,还是被语言先验带偏。研究生需要记住这个缺口,因为论文的四分类正是为了补这个缺口。

数据集一侧也有局限。论文指出 AudioSet 本体覆盖广但标注偏向小事件并混入游戏片段等非真实音频,Clotho 虽然每条音频有 5 人独立描述以保留语义多样性,但标注者关注点不同会导致不一致,且对微弱边缘事件覆盖不足。也就是说,直接用原始众包描述当标准答案,会把人的推测和遗漏也当成真值。本文的基准构造就是先剔除连人都无法一致判断的样本,再人工修订去除无声学支撑的推测并补上可靠但常被忽略的微弱事件。

论文把幻觉问题具体化成哪四种可判定行为?

论文从音频描述任务中观察到的常见生成行为出发,把听觉幻觉分成 4 类。第一类是声学属性幻觉,事件或声源确实存在,但模型赋予的属性或动作特征没有声学支撑。第二类是来源或材质幻觉,模型把声音归因到错误的发声物体或材质。第三类是先验驱动幻觉,内容主要由语言先验或常识推动,而不是由输入音频的声学证据支撑。第 4 类是编造事件幻觉,模型生成在输入中完全缺席且在声学层面没有感知基础的事件。

举一个教学例子帮助区分,但例子不是论文数据。假设录音里确实有水声,模型说成湍急的瀑布声而录音并无落差感,这偏向属性幻觉;说成水龙头拧紧的金属声而实际是野外溪流,这偏向来源材质错误;录音只有模糊背景声却补出完整做饭流程,这偏向先验驱动;录音里根本没有狗却写出清晰犬吠,这偏向编造事件。实际判定要回到人工修订后的参照描述,看生成中哪些表达得不到参照支持。

形式化上,评测以样本为单位。设测试集有 N 个样本,对第 i 个样本,模型生成描述,评判者对照修订参照和 4 类定义判断是否含幻觉并归类。幻觉率指生成中含有至少一类幻觉的样本占比,分类型发生率指出现某类幻觉的样本占比。论文强调后者允许诊断模型偏好,因为一个样本可以同时触发多类,所以分类型比例之和可以超过总幻觉率。

NAICL 的全景是什么,先走完一个样本的输入到输出?

NAICL 的核心想法是把噪声当作声学证据的下界。白话说,噪声有可测的频谱结构和能量分布,但没有能稳定对应到真实声源的语义事件。当输入音频在声学上接近噪声或不确定性很高时,模型就不应该把这类信号硬映射到具体事件语义,而应该降低语义肯定程度,采用更保守的声学层表达。

听觉幻觉 × 噪声先验: 听觉幻觉指模型在没有充分声学支撑时仍给出确定性事件断言,噪声先验指把缺乏稳定语义事件的宽带噪声当作声学证据下界的参照;前者说明要约束的行为,后者提供约束的标尺,二者搭配后模型在证据不足时转向声学层面的保守表达而不是事件层面的硬断言。

沿一个样本走一遍。输入是一段待描述音频,例如一段混有风声的犬吠。系统先用声学编码器对输入编码,同时库中已有多种宽带噪声及其保守描述。系统检索出与输入最相似的若干噪声描述对,把它们作为上下文与待查音频一起交给 ALLM。模型看到的提示中既有噪声示例的保守写法,也有当前查询,生成时受到示例风格约束,在证据不足处更倾向写连续背景噪声或不规则低频声,而不是断言具体来源。输出仍是一段描述,但措辞的肯定程度被校准。

下图展示了这条从噪声库到检索再到校准推理的工作流,阅读时先把握左右分工再看拼接顺序。

看图路径: 1. 先从顶部输入音频出发,沿 BEATs 编码器到检索框再到右侧大模型的箭头走一遍主路径;2. 再看左侧噪声先验库经编码形成噪声嵌入,与输入嵌入汇合做 Top 3 选择的位置;3. 最后对照右侧噪声知识三条示例与底部待查查询的拼接顺序,看校准上下文如何先于生成

原论文 Figure 3:Workflow of NAICL, illustrating the retrieval of noise-description pairs for calibrated inference.

论文图 3。原论文 Figure 3:“Workflow of NAICL, illustrating the retrieval of noise-description pairs for calibrated inference.”。

从像素可见,流程从左到右分为四块。最左是噪声先验库,列出多个噪声与描述配对;经中间的 BEATs 音频编码器形成噪声嵌入;中间偏右是检索框,明确标出 Top 3 并列出选中的 3 对编号;最右是听觉大语言模型框,上部是 3 条噪声知识示例,下部是待查查询,箭头最终指向底部生成结果。这种布局说明检索出的示例不是拼在音频波形上,而是拼在语言提示侧作为行为模板,声学相似度只决定选哪几条,真正约束生成的是示例的保守措辞。

噪声库和检索各负责什么,为什么用合成宽带噪声?

噪声先验库的构造是第一步。论文说库由多样宽带噪声样本与保守文本描述配对组成,覆盖不同频谱和能量分布,每段噪声时长固定,描述遵循统一结构模板。模板刻意使用声学层表达,回避具体事件动词和明确实体断言,例如写连续背景噪声而不写具体声源。这样的描述是行为模板,告诉模型在证据不足时应该怎么写。论文明确这些噪声是合成生成,不是真实环境录音,这样可以避免引入新的强语义场景先验。

检索模块是第二步。给定输入音频,系统用 BEATs 提取高层表示,在嵌入空间按余弦相似度选出最相关的 K 个噪声描述对。默认实现是每个输入动态选 3 对。检索的意义在于让校准上下文与当前输入相关,输入偏低频模糊就多给低频噪声示例,输入偏高频嘶声就多给高频噪声示例,而不是每次都用同一套固定示例。

上下文学习 × 检索: 上下文学习负责在不改参数的情况下用示例影响生成风格,检索负责从噪声库中找到与当前输入声学最接近的噪声描述对;前者提供行为模板通道,后者保证模板与当前输入相关,二者组合才形成输入相关的校准上下文而非固定提示。

推理时,被评测的 ALLM 同时以输入音频和检索到的噪声上下文为条件生成描述。论文用条件概率表示,候选描述序列在给定音频和噪声上下文下的概率最大者被选为输出。需要提醒初学者,这个公式描述的是推理时如何利用上下文,不是训练损失,也没有给出梯度路径。论文没有训练被评测模型的参数,NAICL 是推理期校准方案。

结构化描述和关键词频率如何对应到生成行为?

结构化与非结构化的差别是消融重点。结构化指所有噪声描述都按同一保守模板写,句式和用词受控;非结构化则允许自由措辞。论文的论点是结构化模板能更稳定地约束生成行为,因为模型在上下文学习中更容易模仿重复出现的句式,而不是从零散表达中归纳保守意图。消融结果显示结构化优于非结构化,支持这一安排。

为了验证措辞确实变保守,论文构造了 3 组关键词集合,分别对应不同语义承诺层级。事件动词组捕捉模型是否生成具体且可归因的声学事件,确定性用词组捕捉是否对实体属性或时间状态做明确断言,声学用词组捕捉是否采用保守的声学层描述。每组包含 30 个词。统计时对每个样本判断生成中是否出现该组任一词,再在全测试集上平均得到组频率。频率下降意味着肯定断言减少,声学词频率上升意味着保守表达增多。

结构化保守描述 × 语义承诺: 结构化保守描述指统一用连续背景噪声、不规则低频声这类声学层表达并回避具体事件动词和实体断言,语义承诺指生成中对实体属性和因果事件的肯定程度;前者是降低后者的操作手段,后者是衡量是否收敛的观察维度,搭配后消融才能用关键词频率解释幻觉下降。

研究生容易误把关键词频率当成幻觉率。必须区分,前者是生成风格的代理观察,后者是经评判者对照参照判定的错误率。风格变保守支持了幻觉下降的机制解释,但不能替代幻觉判定。论文同时报告两套数字,阅读时要分别核对条件是否一致。

没有模型训练时,基准构造和噪声库构造做了哪些真实计算?

本研究没有训练被评测的 ALLM,也没有微调评判模型。本节的训练应理解为基准构造与先验库构造。Clotho 原始数据包含数千条音频,每条有 5 人独立描述。构造流程先剔除 5 条描述分歧大的样本,只保留事件层基本一致的音频,得到三千余条;再逐条反复听辨核验,确保事件动作属性在声学上可感知,删掉仅靠人生经验或场景先验推断的内容,补上可靠但常被忽略的微弱事件。

最后按 AudioSet 本体补充事件层标注,形成 1000 条的评测集。每条样本包含音频、5 条原始描述、一条人工核验修订后的参照描述和事件标注。

下图帮助理解基准的规模结构,阅读时先看时长覆盖再看事件数量。

看图路径: 1. 先看上方面板横轴音频时长与纵轴样本数的覆盖范围,确认分布是否均匀铺开;2. 再看下面板横轴每条音频事件数与纵轴样本数,确认单事件和双事件是否占主体

原论文 Figure 1:Distribution of audio durations in Clotho-1K bench- mark and event counts based on AudioSet…

论文图 2。原论文 Figure 1:“Distribution of audio durations in Clotho-1K bench- mark and event counts based on AudioSet ontology.”。

从像素可见,上方面板是音频时长分布,横轴为秒,纵轴为样本数,柱子从约 16 秒延续到 30 秒且高度相对均匀,叠加的曲线也呈平缓起伏,说明时长没有集中在某一窄区间。下面板是每条音频提取事件数分布,横轴为事件数,纵轴为样本数,含一个事件和两个事件的柱子明显最高,3 个事件次之,4 个及以上迅速下降。这与论文强调的多事件音频是一致的,但也说明高度复杂的多事件样本占比较少,评估对极端重叠场景的覆盖有限。

噪声库一侧的真实计算是合成与编码。所有噪声样本按统一模板合成并配保守描述,时长固定为 2 秒。推理前用官方微调的 BEATs 模型提取嵌入,检索用余弦相似度完成。这些步骤不更新被评测模型权重,也不产生梯度。论文未报告噪声库的具体样本总数和合成参数细节,这是复现时需要补看代码仓库的缺项。资源状态方面,本次没有发现来源绑定且完成验证的资源,不得声称代码模型或数据已公开,论文正文给出的仓库链接在本次解读中只能当作原文提及的信息,不能写成当前可用。

评测流水线、评判模型与指标口径如何保证可复述?

评测流水线分 4 步。先从 Clotho-1K 载入测试样本,对每段音频让被评测 ALLM 生成描述;再把生成与对应的人工修订参照配对,连同 4 类幻觉定义和判定标准组成统一评测提示;然后用大语言模型做评判,逐样本判定是否存在幻觉、属于哪类、哪些表达得不到参照支持;最后在全集上聚合得到幻觉率和各类发生率。

NAICL 主要在 Qwen2.5-Omni-7B 上实现和测试,评判用的是 Qwen3-Next-80B-A3B-Instruct。检索编码器用官方微调的 BEATs 模型,默认取 3 条。

大模型评判 × 人工修订参照: 人工修订参照负责提供经反复听辨并按 AudioSet 本体标注的可信事件集合,大模型评判负责把模型生成与该参照按 4 类幻觉定义逐样本判定分类;前者决定判定依据是否可靠,后者决定大规模评估是否可行,二者搭配后才能得到幻觉率和分类型发生率。

下图展示基准事件按本体展开的层级,有助于理解修订参照覆盖了哪些语义空间。

看图路径: 1. 先从内圈大类出发,辨认 Things、Human、Animal、Natural 等扇区的相对大小;2. 再沿外圈细分标签看具体事件词,确认标注已按 AudioSet 本体展开到细粒度

原论文 Figure 2:Hierarchy of acoustic events in Clotho-1K benchmark based on the AudioSet ontology.

论文图 1。原论文 Figure 2:“Hierarchy of acoustic events in Clotho-1K benchmark based on the AudioSet ontology.”。

从像素可见,该图是环形层级图,内圈为 Animal、Things、Human、Natural、Ambiguous、Music 等大类,外圈向细分事件展开,标有 Vehicle、Liquid、Domestic sounds、Human voice、Wind、Water 等分支及更细的标签。绿色系的 Things 扇区面积最大,说明家居、液体、机械车辆类事件占比较高;蓝色系的 Ambiguous 与动物类、橙色系的自然水风类、深色系的人声类也各占一块。这种可视化支持论文所说按 AudioSet 本体做事件标注,但它只说明类别覆盖,不说明每个样本的标注质量,质量仍依赖人工听辨流程。

指标方向必须记清。幻觉率越低越好,分类型发生率越低越好,事件词和确定性词频率下降、声学词频率上升被解读为更保守。聚合对象是样本数,不是事件数。论文未报告评判者与人工的一致率、重复运行方差和显著性检验,这是解读时要保留的限制。

主结果测了什么,在什么条件下降低了多少?

主结果要回答的问题是,在同一 Clotho-1K 基准和同一评判流程下,加入 NAICL 后目标模型的幻觉率是否下降且是否跨类型一致。比较对象是同一 Qwen2.5-Omni-7B 不加上下文与加入 2 秒检索三样本 NAICL 的实际可运行策略,不是事后挑选的最优值。指标方向是幻觉率越低越好。论文还横向评测了十余个主流模型以说明幻觉普遍存在,但核心收益只在目标模型上做了前后对照。

下表聚焦核心对照,保留原文报告的百分比写法,表头单位与裸值按原文处理。

条件指标基线本方法比较对象
同一 Clotho-1K 与同一评判流程Hallucination Rate26.53%16.98%Qwen2.5-Omni-7B 前后对照

表前比较问题已经提出,公平条件是同一基准、同一被测模型、同一评判模型和提示,指标方向是越低越好。表中数字显示幻觉率下降约 9.55 个百分点,相对降幅约三分之一。论文同时报告这种下降在 4 类上一致,且横向评测中来源材质类和编造事件类是主导类型,先验驱动类在各模型中持续出现。表后需要强调代价与反例。首先收益不能推广到所有模型,论文只完整报告了目标模型的 NAICL 前后值,其他模型的 NAICL 效果未给出。

其次横向数字显示部分模型幻觉率更高,例如 SALMONN 和部分轻量音频模型问题更严重,说明基准对不同模型的区分度仍在,但不能把单模型的降幅当成方法对所有模型的保证。百分点和相对百分比含义不同,复述时不要混用。

哪些变体被证伪,检索时长与结构化各起了什么作用?

消融要回答的是收益来自哪里,以及哪些看似合理的变体并无效。论文比较了真实音频上下文学习、无检索固定噪声、不同样本数、不同噪声时长、结构化与非结构化描述。条件是同一目标模型和同一基准,指标仍是幻觉率和分类型发生率,外加 3 组关键词频率。

关键发现是真实音频示例没有带来有效改善,幻觉率甚至略升。论文的解释是真实音频自带强语义模式和场景先验,会进一步强化事件层确定性表达。固定噪声无检索能降低幻觉率,但模型呈现过度保守倾向。2 秒噪声优于 10 秒噪声,原因是长噪声引入过长上下文和额外干扰。结构化描述优于非结构化描述。关键词频率上,引入 NAICL 后事件词和确定性词明显下降,声学词上升,说明措辞转向保守。

下表整理构造规模与默认配置,帮助复现时对齐论文实际使用的参数,数字与单位保留原文写法。

阶段对象规模本方法配置关键词配置
基准筛选Clotho 原始音频4,981保留一致样本人工修订参照
基准筛选事件一致子集3,164待修订事件层核验
基准定稿Clotho-1K 评测集1,000每样本含修订参照本体标注
先验库噪声片段时长2 seconds统一模板合成保守描述
推理检索数量Top-3余弦相似度动态选择BEATs 编码
分析关键词组规模30 terms3 组分层统计风格代理观察

表前问题是复现需要哪些规模与配置才能与论文对齐,公平条件是同一 BEATs 编码和同一检索度量。表后解释是规模链显示基准经过大幅筛选,噪声配置强调短时与结构化,未胜出项是真实音频示例和 10 秒长噪声,前者强化先验,后者增加干扰。论文未报告不同随机种子下的波动,也未评测噪声库规模本身的影响边界,这是未评测的边界。

还有哪些没有测到,不能承诺什么?

论文直接报告的是幻觉率下降和措辞变保守,有限解释是噪声下界先验降低了语义承诺,未验证的推测是该机制能推广到所有复杂声学环境。必须区分这 3 层。相关性不等于因果,关键词频率变化与幻觉下降同时出现,但没有证明前者必然导致后者。

缺失证据不是技术错误,但复述时要明确。论文未测量误判率对应的漏检代价,即过度保守是否会删掉真实微弱事件;未报告延迟、显存和检索开销,也未报告输出帧率与实际延迟的关系,因此不能承诺推理成本得到改善。评判依赖大语言模型,但未给出人与模型评判一致性、评判提示鲁棒性和重复聚合方差。基准以 Clotho 为基础,时长集中在十几秒到 30 秒,单双事件为主,对长时、强重叠、音乐专业场景的覆盖需要进一步验证。

总体趋势不等于每组都成立。论文说 4 类一致下降,但不同模型的分类型偏好不同,例如有的模型属性幻觉更高,有的模型来源错误更高,NAICL 在这些细分上的效果只在目标模型上完整报告。引用时应限定为在 Clotho-1K 与指定评判流程下观察到的结果。

要复现先做什么,需要保留哪些超参数和信息条件?

复现先从基准对齐做起。按论文流程准备 Clotho 原始音频,复现筛选与人工修订标准,确认最终 1000 条的参照描述和事件标注口径,再固定评判模型与提示模板。不要跳过人工听辨直接用原始 5 条描述当真值,否则幻觉判定会把人的推测也当成标准。

再准备噪声先验库。按统一结构模板合成多样宽带噪声并配保守描述,时长固定 2 秒,避免混入真实场景录音。编码用官方微调的 BEATs 模型,检索用余弦相似度,每个输入取 3 条。被测模型以 Qwen2.5-Omni-7B 为起点,评判用论文指定的大模型,对比基线必须是不加上下文的同一模型同一解码条件。关键词 3 组各 30 词的词表需要与论文一致才能复现风格分析。

区分代码开源、权重下载和系统可运行。论文正文提及仓库地址,但本次没有完成可达性验证,不能写成已公开或当前可用。复现报告应写明实际使用的模型版本、检索库大小、提示拼接顺序、解码参数和聚合代码,并补做重复运行方差与人工抽查一致率。还需补的验证包括漏检率、检索开销、不同噪声时长与样本数的稳定性,以及跨模型的可迁移性。

何时值得尝试,如何一句话记住这篇论文?

当你的音频任务出现证据不足却被语言常识补足的错误,且不允许微调模型时,值得尝试这种检索噪声保守示例的推理期校准。它的适用条件是输入不确定性高、输出允许采用更保守的声学层表达、系统能承担检索与更长提示的开销。如果任务要求必须给出确定事件结论,或对漏检零容忍,就需要先补漏检与代价评估再决定。

论文特有的误解需要澄清。第一,噪声在这里不是数据增强的干扰项,而是行为标尺,作用在提示侧而不是音频波形叠加。第二,真实音频示例并非越多越好,强语义示例可能加重先验。第三,声学词增多不等于质量提高,它只是保守化的代理信号,最终质量仍要看对照修订参照的幻觉判定。记住这三点,就能在不夸大延迟与泛化收益的前提下,正确复述从输入到检索再到校准生成的方法链。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总