英文题目:RAISE: Resolving Ambiguity in Audio Understanding with Imagination and Selective Extraction

会议身份:conference:interspeech:2026:conference-paper-id:lin26i_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#检索增强 #音频大模型 #音频生成 #音频问答 #音频分离

评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yueqian Lin:机构信息未能从会议 PDF 纯文本可靠映射
  • Qinsi Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yudong Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Hancheng Ye:机构信息未能从会议 PDF 纯文本可靠映射
  • Hai Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Yiran Chen:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为原始音频x、文本问题q与候选项集C,输出为选项预测,难点在于重叠声掩蔽目标与相似音色缺乏可比参照,使单遍解码只能猜测。语义路由仅依据文本判断比较还是分离需求,分流至直接回答、想象或提取路径,前者输出直接进入上下文推理而后两者先实例化证据再推理。听觉想象先由音频大模型做候选校验生成可发声提示,再用Stable Audio Open合成参照集Z,将原音频与参照拼接做相对判别。选择性提取先由模型生成目标声物理描述,再调用SAM-Audio得到干净波形x'后重新判定。与内置思考链不同,该框架把验证外置为可听证据而非潜表示自我修正,将绝对分类转为相对判别以降低感知负荷。在MMAR基准下,关于准确率等指标原文未提供可核对的关键定量结果。其结论适用边界受限于支持多音频输入的Qwen系模型与两类推理基准,抽象语义任务增益有限且强制套用工具会剥离有用上下文构成失败条件,工具路径显著增加推理开销而直接路径仅引入路由延迟。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,模型要在什么条件下做判断?

这篇论文的输入是一个三元组:一段待判音频、一个自然语言问题,以及一组候选答案。目标是从候选项中选出与音频内容最一致的一项,评价指标是选择准确率,方向是越高越好。对于刚入门的读者,白话解释是:模型不是自由描述听到了什么,而是在给定选项里做单选,这让错误可以被计数,也让是否听准变得可核对。论文强调两类必须保留的困难条件。

第一类是高干扰,例如鸡尾酒会式多人重叠、背景音乐与环境噪声盖住目标事件,任务可能是计数或定位被遮挡的时间戳。第二类是细粒度混淆,例如电钻与电锯音色接近、流水声可能来自浴缸也可能来自喷泉,单靠内部表征难以区分。输出就是预测的选项编号,论文要求每 1 次预测都能回溯到显式声学证据,而不是 1 次前向猜测。

单遍推理这个术语先用白话说清楚:它指音频大模型把音频与问题编码 1 次,直接估计每个选项的概率并取最大者,中间没有回查原声的动作。英文是 single-pass inference。分析合成的英文是 analysis-by-synthesis,指人先在心里模拟如果真是某个声源会听到什么,再拿这个预期去对照实际听感。论文的判断是,即使带思考链的先进推理模型,在被迫解码含混的内部表征时仍会出现感知幻觉,也就是听错了还自信作答。后续所有设计都是为了给单遍推理加一个可执行的核对动作。

单遍推理 × 分析合成: 单遍推理指对概率分布做 1 次参数化前向就给出答案,无法回查原始信号;分析合成是人耳先假设再用心理预期声去验证的听法,分工是前者快但脆、后者慢但可校验,RAISE 用外部生成器与分离器把分析合成做成推理时验证引擎,正好补上单遍推理缺失的核对环节。

同输入同目标的已有路线差在哪里?

按同输入、同目标、同运行阶段来对照,论文把相关工作分成 3 条线。第一条是音频大模型本身,例如 Qwen2-Audio、Qwen2.5-Omni 与 Qwen3-Omni,它们在开放式任务上很强,但在需要细粒度听辨的基准上暴露短板。第二条是工具增强推理,例如 AudioToolAgent 这类智能体框架,以及把工具用于模块化推理的工作,它们证明了调用外部工具的可行性,但论文指出它们没有把生成与分离当作推理时的感知验证器。第 3 条是离线数据增强,例如用文本到音频模型合成训练集来做环境声分类,这是在训练前造数据,而不是在测试时为当前这道题造参照或做去噪。

这样对照的意义是运行阶段不同不能直接比胜负。离线增强改善的是训练分布,推理时仍是单遍;RAISE 改善的是每道题的推理过程,训练参数完全不动。另一组对照是可提示分离与文本到音频合成的成熟度:论文点名 SAM-Audio 做开放词汇的声音分割,Stable Audio Open 做参照合成,说明按需操作信号在工程上已可行。理解这一点后,就不会把本文误读为又训练了一个更大的音频模型,它本质上是一个免训练的推理框架。

为什么难的是感知而不是想得不够多?

论文把失败归因到感知瓶颈,而不是推理步数不够。举一个教学例子:假设原声里有 6 次高频水滴声,其中 1 次被流水掩蔽,模型只数出 5 次。这不是例子里模型不会数数,而是它听到的混合表征里第 6 次本来就很弱。此时让模型多想几步、写出思考链,并不能把被掩蔽的能量变回来。原文的消融结论支持这个判断:加思维链提示与做两遍自我修正都没有超过单遍基线,反而在 MMAU 上出现回退。

另一个教学例子是音色混淆:电钻是平滑连续的嗡鸣,电锯是粗糙的轰鸣加转速起伏。如果只记绝对音高,两者都偏高,容易都判成电锯;但如果现场合成两段参照并排比较,平滑与粗糙的纹理差异就会被放大。这正是论文把绝对分类转成相对判别的动机。问题形式化也很直接:标准做法是对条件概率直接取最大,而 RAISE 要把推理拆成语义路由、证据实例化与上下文推理 3 段,强迫预测以具体声学证据为条件。

三段式流程如何带着一道题走完全程?

先沿一个样本走完全程。输入仍是音频、问题与选项。第一段语义路由只读问题文本与选项,不听音频,用一个轻量文本模型输出 3 种策略之一:直接回答、想象或抽取。第二段证据实例化按策略行动:想象分支为每个可合成候选项生成参照音频,形成一个小的对照阵容;抽取分支先写出目标声的物理描述,再用该描述去分离混合声,得到更干净的波形。

直接分支跳过工具。第 3 段上下文推理把原声加上新证据一起送入音频大模型做最终单选。失败时有兜底:如果生成无效或分离能量过低,流程退回直接回答,保证工具错误不覆盖有效基线。 下图是全文的方法总览,阅读时先看主干再看分支如何汇合。

看图路径: 1. 先从左侧输入框沿箭头找到语义路由器菱形,再看三条分支的去向;2. 对比上方想象分支合成多条参照与下方抽取分支只输出一条干净信号的差异;3. 确认两条工具分支都要经过上下文推理才汇入最终预测

原论文 Figure 1:The RAISE Framework for Audio Understanding.

论文图 1。原论文 Figure 1:“The RAISE Framework for Audio Understanding.”。

从像素看,左侧是输入框,内含音频波形图标与问题选项图标,箭头指向中间菱形的语义路由器。上方橙色块是听觉想象,标注了合成浴缸、河流与喷泉流水声的动作,下方蓝色块是选择性抽取,标注了分离出干净尖叫的动作。中间灰色直箭头是直接路径直达右侧输出框,两条工具分支则先经过各自的紫色上下文推理框再汇入输出。这种画法把效率意识表达得很清楚:大多数题走中间直路,只有困难尾部走上下两条昂贵支路。

想象分支如何把选项变成可听的参照?

听觉想象的英文是 Auditory Imagination,记作生成路径。它的适用条件在原文写得很窄:只有当候选项描述的是 distinct 且可合成的实体,例如乐器或环境事件,才走这条路。操作分两步。第一步候选校验由音频大模型执行,检查每个选项是否对应物理上可实现的声音,并映射为描述提示,抽象或非声学概念会被排除,避免生成器造出无意义伪影。第二步参照生成调用生成器合成参照集合,论文实现用 Stable Audio Open 1.0,50 步采样、引导系数 7.0、每段 5 秒。推理时把原声、多个参照与问题拼成联合序列,让模型做对照,原文公式含义是对所有候选项取条件概率最大者,若有选项映射失败则退回直接回答。

听觉想象 × 选择性抽取: 听觉想象是加法过程,负责为每个候选项合成可比的参照音频,用相对判别代替绝对记忆;选择性抽取是减法过程,负责从混合声中分离出目标声并压制干扰,二者搭配的原因是前者解决语义可合成但缺少锚点的混淆,后者解决目标被掩蔽而数不清、对不准的问题,组合后让模型每 1 次预测都落在显式声学证据上。

候选校验 × 参照生成: 候选校验先由音频大模型判断每个选项是否描述了物理上可实现的声音并映射为描述提示,排除抽象或非声学概念;参照生成再用文本到音频模型合成参照阵容,分工是前者防无意义伪影、后者提供稳定锚点,搭配后才能把分类变成拿原声与一排真声做相对比较。

对初学者而言,关键是理解为什么要 1 次合成多个参照。单个参照只能告诉模型目标大概长什么样,多个参照才能让模型在同一上下文里比较差异。论文的电钻例子显示,基线只凭高音调判成电锯,而对照 4 个工具的合成声后,原声的平滑嗡鸣与电钻参照对齐,与电锯的粗糙轰鸣不一致,从而纠正答案。这种相对判别降低了感知编码器记忆整个声学空间的负担。

抽取分支与路由器如何分工协作?

选择性抽取的英文是 Selective Extraction,记作抽取路径。它处理的是目标被干扰盖住的题,例如在噪声中计数、从对话与水声里判断地点。操作也是两步。第一步声音描述让音频大模型先听原声,用分析提示写出区分目标的物理特征,得到描述字符串。第二步声源隔离把该描述送入开放词汇分割模型执行滤波,原文记为从混合得到干净波形的过程,论文实现用 SAM-Audio,能量阈值取 0.01。推理时模型只以干净信号与问题为条件重新打分,相当于 1 次聚焦验证,能看清之前被遮挡的时间戳与事件细节。

声音描述 × 声源隔离: 声音描述是先用分析提示从实际音频内容提炼目标的物理特征,而不是照抄问题文本;声源隔离是把该描述送入开放词汇分割模型滤出干净波形,分工是前者架起语义到信号的桥、后者执行减法去噪,搭配理由是直接用问题词做分离会因措辞与声学脱节而切错目标。

语义路由的英文是 Semantic Router,上下文推理的英文是 Contextual Inference。路由器的输入只有问题与选项,输出是 3 种策略,论文用 gpt-4o-mini 实现,并强调可换成任何轻量语言模型。解耦有两个理由:独立性是误听的模型不应自己诊断失败模式,应由外部文本路由按任务语义决定;效率是文本调用避免重复的音频编码。上下文推理则按证据类型自适应:想象路径以原声加参照阵容为条件,抽取路径以干净信号为条件。

语义路由 × 上下文推理: 语义路由只看问题文本与选项做零样本分流,决定走直接回答、想象还是抽取;上下文推理是拿到证据后的音频大模型判别步骤,分工是路由管效率与任务适配、推理管声学对齐,搭配理由是避免让已误听的模型自己诊断失败,同时把昂贵工具只留给困难尾部。

没有训练时,真实计算发生在哪里?

本研究没有训练阶段,没有更新任何音频大模型、生成器、分离器或路由器的参数,也就没有梯度路径、损失函数、优化器与参数重置需要报告。所有模型都是现成调用:骨干是 Qwen 系列,生成器是 Stable Audio Open,分离器是 SAM-Audio,路由器是轻量文本模型。真实计算全部发生在推理时,分为 3 类开销。第一类是路由器的 1 次文本调用,论文报告在直接路径上约占 0.4 秒。第二类是工具调用,想象需要为多个候选项各合成一段音频,抽取需要 1 次描述加 1 次分割。第 3 类是最终的音频大模型推理,想象路径要处理多段音频的联合序列,抽取路径处理单段干净音频。

需要纠正的误解是,参数冻结不等于输出确定。生成器的采样与分离器的数值优化仍会带来随机性与失败可能,论文为此设置了显式兜底:生成无效或分离能量过低就退回直接回答。未报告的缺项也要点明:原文没有给出路由器在文本语义上的准确率,也没有报告生成参照与原录音在声学距离上的质量分布,这些是复现时需要补记的量。

在什么数据、模型与工具配置下比较?

论文在两个基准上评测。MMAR 侧重语音、音频、音乐及其混合的复杂推理,MMAU 侧重大规模多任务音频理解与推理。骨干覆盖 Qwen2-Audio-7B、Qwen2.5-Omni-7B 与 Qwen3-Omni-30B-A3B-Thinking,对比的基线是同一骨干的单遍直接推理,保证除是否使用 RAISE 外条件一致。论文说明选用 Qwen 家族的原因是它们原生支持 1 次对话输入多段独立音频,这是想象路径对照所必需的,同时声明框架与架构无关,只要支持多音频输入即可迁移。

工具与硬件配置按原文交代:路由器用 gpt-4o-mini,只读文本;想象用 Stable Audio Open 1.0,50 步、引导 7.0、5 秒片段;抽取用 SAM-Audio,能量阈值 0.01;实验跑在 NVIDIA H200 上。指标是准确率,方向越高越好,增量用百分点表示,例如从 69.3% 到 79.5% 记为提升 10.2 个百分点,不要误读为相对百分比。资源状态方面,本次收到的证据未绑定任何完成验证的代码、模型或数据链接,因此不能声称代码或权重已公开,复现只能按论文文字重搭流程。

主结果在多大增益下成立,增益集中在哪里?

比较的问题是:在同一骨干与同一测试集上,加了路由加证据的流程是否稳定超过单遍回答,指标方向是准确率越高越好。下表聚焦论文有完整原句覆盖的 Qwen3-Omni 结果,基线是标准单遍推理,本方法是完整 RAISE,最后一列是绝对提升。选择这两行是因为原文对它们的增益有直接的连续陈述,可核对。

数据集模型基线准确率RAISE 准确率绝对提升
MMARQwen3-Omni69.3%79.5%+10.2%

表后需要同时讲收益与边界。收益是即使骨干自带思考模式,RAISE 在 MMAR 上仍有 10.2 个百分点的增益,在 MMAU 上达到 84.9%。论文还报告 Qwen2-Audio 在 MMAR 上从 45.1% 到 57.5%,提升 12.4 个百分点,是全文最大增幅;Qwen2.5-Omni 也有 2 位数的 MMAR 提升与 MMAU 上的数个百分点提升。代价与边界是增益呈长尾分布,大多数简单题并不需要工具,工具只在困难尾部起作用,因此平均增益不能理解为每道题都变好。

下图用 Qwen3-Omni 展示路由分布与分类增益,读图时注意纵轴是样本占比与准确率,不是相对改变量。

看图路径: 1. 先看图 a 两根堆叠柱中直接回答灰段与两种工具色段的占比;2. 再看图 b 四个类别上基线灰柱与方法绿柱的高度差及顶部增量标注;3. 最后看图 c 时间推理等四个子类的增量,确认长尾增益集中在哪里

原论文 Figure 2:Analysis of experimental results using Qwen3-Omni.

论文图 2。原论文 Figure 2:“Analysis of experimental results using Qwen3-Omni.”。

从像素看,图 a 是两根堆叠柱,MMAR 上灰色直接段占 75.8%,蓝色抽取占 15.7%,橙色想象占 8.5%,MMAU 上直接段升至 82.2%。图 b 在信号、文化、感知与语义 4 类上绿柱都高于灰柱,顶部标注约 9.3% 到 12.6% 的增量。图 c 4 个子类增量更大,时间推理达 26.8%,情感摘要达 18.2%,和声与音素类也在 15.1% 左右。这支持论文的判断:增益集中在需要细粒度物理 grounding 的任务,而非抽象推理。

数据集路由直接占比抽取占比想象占比摊薄耗时
MMAR75.8%15.7%8.5%9.1s
MMAU82.2%11.2%6.6%7.6s

该表说明工具成本被摊薄的原因:昂贵路径合计不足 25%,直接路径本身约 3.3 秒,摊薄后单样本约 9.1 秒与 7.6 秒。但这不等于每题都便宜,被路由到的想象样本单次可达 30 秒以上,这是部署前必须接受的条件。

拿掉路由或只留一种工具会发生什么?

消融要回答 3 个问题:不借助工具多想能否纠错,把工具无脑用在所有题上是否更好,只留一种工具是否足够。比较条件保持同一骨干 Qwen3-Omni 与同一基准,指标仍是准确率。下表整理论文有原句支撑的可运行策略,基线是单遍直接推理,静态策略指对所有样本强制使用同一工具,路由变体指在直接与单一工具间二选一。

配置MMAR 准确率策略性质相对基线
Direct 单遍69.3%无工具基线持平
自我修正两遍69.3%无工具推理持平或下降
全部强制抽取54.9%静态工具明显下降
全部强制想象66.7%静态工具下降

表后解释必须包含未胜出项。更多推理不能补偿错误感知:思维链在两集上分别下降约 1.0 与 1.7 个百分点,自我修正在 MMAU 上回退 2.1 个百分点,原因是模型在误听的信号上越想越偏。无脑用工具比不用更差:强制抽取在 MMAR 上掉到 54.9%,因为 aggressive 的隔离会去掉有用背景,例如提供流派线索的背景音乐;强制想象掉到 66.7%,因为合成参照会干扰以语音为主、无需比较的任务。这证明工具强大但危险,必须有选择地路由。 下图展示误差修正与回退的动态,绿色为修好数,橙色为改坏数。

看图路径: 1. 先按横轴六组模型与数据集找到每组上下双向柱;2. 对比上方绿色修正数与下方橙色回退数的高度,读出净增益框;3. 观察回退数在不同骨干上是否稳定存在,确认工具并非零代价

原论文 Figure 4:Error correction dynamics.

论文图 4。原论文 Figure 4:“Error correction dynamics. Green bars indicate sam- ples where RAISE fixed the baseline’s error; orange bars indi- cate regressions.”。

从像素看,横轴 6 组覆盖 3 个骨干乘 2 个数据集,每组上方绿色柱远高于下方橙色柱。Qwen3-Omni 在 MMAR 上修正 133 例、回退 31 例,在 MMAU 上修正 89 例、回退 23 例,修正回退比约三到 5 比 1。论文指出回退多来自抽取去掉了有用上下文,例如混响等计数线索,少数来自想象参照过窄。另一组数字支持两种工具互补:单工具路由在 MMAR 上为 75.2% 与 74.3%,仍低于完整版的 79.5%,差距正是只有缺失工具能处理的样本。

工具失效、回退与延迟的边界在哪里?

论文直接报告的局限有两条:工具依赖与被路由样本的额外延迟。工具依赖指生成器可能合成过窄的参照,例如把排球的闷响做得与录音的脆击不一致;分离器可能剥离有用信息,例如去掉数人声所需的混响。延迟指想象与抽取路径远贵于直接路径,不能把摊薄后的平均耗时当成最坏耗时。未测量即不能承诺的量也要点明:原文没有报告误判率、端到端实时率或不同硬件下的延迟分布,因此不能声称这些量得到改善。 下图拆解每条路径的耗时构成,阅读时区分平均与单次。

看图路径: 1. 先看三行左侧括号内的路由占比,确认昂贵路径只占少数;2. 沿横轴比较直接路径与两条工具路径的条带总长度;3. 找到紫色虚线标出的摊薄后单样本耗时,理解平均代价如何被拉低

原论文 Figure 3:Per-path runtime breakdown (Qwen3-Omni, H200). The dashed line marks the amortized cost.

论文图 3。原论文 Figure 3:“Per-path runtime breakdown (Qwen3-Omni, H200). The dashed line marks the amortized cost.”。

从像素看,三行分别是直接、抽取与想象,左侧括号内占比与路由分布一致。直接行总长最短,标注 3.3 秒,其中蓝色路由段极窄、绿色推理段为主。抽取行橙色工具段占主体,总长标注 23.6 秒。想象行橙色段最长,总长标注 34.1 秒。紫色虚线标出摊薄后 9.1 秒的位置,落在抽取行中部附近,直观说明平均值被大量直接样本拉低。

这意味着何时值得尝试取决于任务构成:如果应用中困难尾部很少,平均成本可接受;如果每题都含混,就要按单次 20 到 30 秒做预算。

复现时先做什么才能对上条件?

复现的第一步是重建 3 段流程,而不是重训模型。先实现文本路由器:输入问题与选项,输出直接、想象或抽取,可用任何轻量语言模型替代原文的 gpt-4o-mini,但要记录路由比例是否接近 75.8% 与 82.2% 的直接占比,否则后续耗时与增益都对不上。第二步实现想象分支:先做候选校验过滤非声学选项,再用文本到音频模型按 50 步、引导 7.0、5 秒片段合成参照,并支持 1 次传入多段音频的骨干。第三步实现抽取分支:先让音频大模型写出目标的物理描述,再送入开放词汇分离器,能量阈值取 0.01,低能量输出必须触发退回直接回答。

第二步是锁死评测条件。用同一骨干比较单遍基线与完整流程,数据集用 MMAR 与 MMAU,指标用准确率并以百分点报告差值。关键超参数与信息条件要保留:生成步数与片段时长、分离阈值、路由器只读文本不听音频、骨干需支持多音频输入。常见坑是把问题文本直接当分离查询,这会因措辞与声学脱节而切错目标;正确做法是先听原声生成物理描述,再用描述驱动分离。另一个坑是为凑宽度混放不同指标,例如把时间推理子类的增量与全集准确率放在同一模型列下比较,这在原文是不同聚合对象,不能直接相减。

这篇论文给新手留下什么可带走的判断?

带走的判断可以写成 3 条。第一,听错与想错要分开治:当错误来自掩蔽或音色相近,多加推理步骤并不能找回丢失的声学细节,此时应先换证据再做判断。第二,工具要用在刀刃上:合成参照适合选项可合成、需要比较的题,分离适合目标被盖住、需要计数定位的题,其他题走直接回答更稳更便宜,静态全量用工具反而低于基线。第三,报告增益时要同时报告代价与回退:全文最大 12.4 个百分点的提升伴随少数样本数十秒的耗时,以及每 100 次修正中数十次回退,修正回退比约为三到 5 比 1。

还需补的验证是生成质量与路由质量的独立评测,例如参照与原声的声学距离分布、路由器在语义层面的选择准确率,以及在非 Qwen 骨干与更多噪声条件下的稳定性。在这些补齐之前,合理的尝试场景是选项明确、可合成或混合干扰明显的音频单选题;不适合的场景是对延迟敏感的流式任务与抽象概念辨析。复现时先对齐路由分布与兜底逻辑,再谈增益是否复现。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总