英文题目:From Noisy Speech to Accurate APIs: LLM-driven Embedding Steering for Resilient Tool Retrieval
会议身份:
conference:interspeech:2026:conference-paper-id:zorila26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据增强 #大语言模型 #鲁棒性 #语音 #音频检索
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Catalin Zorilă:机构信息未能从会议 PDF 纯文本可靠映射
- Qingxiuxiong Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Rama Doddipatla:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音查询到工具检索任务,输入为含混响和加性噪声的语音,输出为相关 API 排序,难点在于 API 描述非标准化、冗长缺失且与嵌入模型训练分布失配,同时自动语音识别(Automatic Speech Recognition,ASR)转写错误进一步放大查询侧噪声。方法链分为三步:先用 ASR 将语音转写为文本并用文本编码器得到查询向量,再离线用 QWEN3-8B 为每个工具生成用户风格的使用场景与查询并编码平均为转向向量,最后以加权插值融合原始 API 向量与转向向量用于余弦检索。与直接使用原始描述相比,该机制显著把工具表示从文档风格搬移到用户查询分布,且无需重训即插即用。在3个数据集平均的噪声查询qn评测下,EMBS增强后bge-large-en-v1.5的NDCG指标N@1为20.5,高于无转向基线的NDCG指标N@1的19.3。该结论限于合成英文语音与 Whisper 转写链路,真实口语、多语言和大规模 API 库外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://huggingface.co/WhisperSpeech/WhisperSpeech — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,哪些信息必须保留?
这篇论文研究的是语音到工具的检索任务,输入是一句用户说出的话,例如想用某个图像模型或数据接口完成一件事。目标是从几百到上 1000 个工具中把正确的工具排到前面,供后续的函数调用使用。输出不是直接执行参数,而是一个按相似度排序的候选工具列表。
必须保留的关键信息有 3 类,第一是工具侧的原始定义,论文明确说这些描述往往不标准、含糊或不完整。第二是查询侧的 3 种形态,分别是参考文本、干净合成语音转写、加噪混响语音转写。第三是评价口径,排序质量用归一化折损累计增益,数值乘以一百后记为 N@x。
对刚入门的读者,白话是这样,先把声音转成文字,再把文字变成向量,最后比谁的向量更接近。难点在于两边都脏,工具文档写得随意,语音转写又会出错。本文的方法不重新训练检索模型,而是离线把工具向量修得更像用户会说的话。
这种离线修正的定位很重要,它意味着查询编码器和语音识别器都不动,只改工具库一侧的表示。后文所有实验都围绕这个选择展开,比较的也是同一查询下换与不换工具向量的排序差异。
已有路线解决了什么,还缺哪一块?
论文把相关路线分成 3 类,第一类是工具使用系统与评测,强调在大规模工具集合中检索往往是端到端精度的瓶颈。第二类是信息检索中的文档与查询扩展,例如为文档生成可能的用户查询或合成训练查询。这类工作证明不改检索器结构也能提升检索,但主要面向静态文本。
第 3 类是语音鲁棒性研究,混响与加性噪声会降低识别精度,常用数据增强思路来缓解。这类工作很少连到工具检索的排序效果,也没有处理工具参数模式和功能语义。文档重叠和版本变化会进一步放大错误,这是工具场景特有的困难。
本文的缺口定位很具体,当工具描述噪声与语音转写噪声同时存在,通用嵌入模型难以保持稳健。作者因此提出离线嵌入转向,只在工具表示侧做增强,查询侧仍走常规语音识别加嵌入流程。这种选择保留了与现有嵌入流水线的兼容性,也为后文只改工具向量、不动查询编码器的实验设计埋下依据。
为什么两边都带噪会让简单比相似失效?
论文给出的问题可以沿一个样本走一遍,用户说出一句任务请求,先被识别成文本,再被编码成查询向量。另一边每个工具只有一段原始描述,也被编码成工具向量,最后用余弦相似度排序。如果描述用的是开发者术语,而用户说的是目标导向的白话,两类文本在嵌入模型预训练中很少成对出现。
再叠加语音因素,混响拖尾和背景噪声先破坏波形,识别器再把错词送入编码器,查询向量进一步偏离。举例只是帮助理解的例子,用户本想说排序表格,噪声下被听成其他词,检索就会偏向错误的表格工具。论文用受控仿真把这种退化量化,后文干净查询与噪声查询的词错率差异就是证据。
因此问题不是识别器单独不够好,也不是嵌入模型单独不够强,而是两侧分布同时偏离。直接微调嵌入模型需要数据和训练,而重写全部工具文档不现实,这就引出用大模型合成用户说法来修正工具侧的动机。
这个动机决定了方法只做表示增强,不做识别纠错,也不改排序算子。理解这一点,才能明白为什么后文噪声下绝对分数依然很低,而相对增益仍然存在。
系统全景:语音进来,工具列表怎样出来?
全景分在线与离线两部分,在线路径是语音查询先过自动语音识别得到文本,再用文本嵌入模型编码为查询向量。然后与预先算好的工具向量比相似度并返回候选,整个在线链路不需要额外学习。
离线路径是针对每个工具,用大模型生成多个用户风格的用法,再把这些合成文本的嵌入取平均。与原始描述嵌入加权融合后,得到增强后的工具表示,再送入同一个向量空间参与比对。读图时先把握主次,在线只有一条从左到右的检索链,离线是下方为检索服务的准备工作。
看图路径: 1. 先从左侧人物查询箭头沿自动语音识别走到嵌入模型再到工具输出;2. 再看下方工具库如何分出两路进入转向模块;3. 确认转向模块的两个输入标记与权重控制在哪里汇入主路径
论文图 1。原论文 Figure 1:“Proposed speech-to-API system.”。
从像素看,该图左侧是人物发出查询箭头进入自动语音识别框,再进入嵌入模型框并向右输出工具,右上有齿轮图标表示排序选择。下方是工具库圆柱体,一路直接送入转向框,另一路先进入大模型框生成多个查询再送入转向框,转向框受权重控制并向上影响嵌入模型。这种画法把可调的部分集中在工具侧,查询侧不做额外学习,与正文所说无需重新训练是一致的。
转向向量如何算:生成什么,怎样平均融合?
组件的第一步是生成,论文对每个工具调用 QWEN3-8B,按给定提示生成多样化的使用场景、任务、子任务或用户式查询。提示要求兼顾专家与非专家的说法,包括高层目标、简单请求和技术操作。这个约束很重要,它迫使生成贴近检索时短查询的形态,而不是长文档。
工具检索 × 嵌入转向: 工具检索负责把用户查询向量与工具描述向量比对并排序,嵌入转向负责把原始工具向量向合成查询均值方向修正,二者搭配是因为原始描述与用户说法分布不一致,组合后工具表示更贴近真实调用时的措辞。
第二步是表示与融合,每个合成查询先用同一个文本嵌入模型编码,再对同一工具的多条合成嵌入取平均。这样得到代表性转向向量,然后与原始工具描述嵌入按权重加权相加。论文用留出验证数据选择权重为 0.5 作为工作点,含义是两边各占一半。
原始描述嵌入 × 合成查询嵌入均值: 原始描述嵌入保留工具文档自带的定义信息,合成查询嵌入均值汇总大模型生成的多种用户说法,二者按权重组合是因为只用前者会受文档噪声牵制,只用后者会丢失定义细节,加权后得到更稳的工具表示。
提示词的写法决定了合成质量,值得单独核对原文措辞,该提示对库中每个工具重复调用。生成条数记为 K,后文消融会比较 K 取一、五、十的效果,约束最多 10 条且每条 3 到 12 词。
看图路径: 1. 先读提示框标题确认这是为每个工具生成用法的指令;2. 再看对专家与非专家说法高层目标与技术操作的要求;3. 最后确认数量不超过十条与每条三到十二词的长度约束
论文图 3。原论文 Figure 2:“LLM prompt used for the proposed speech-to-API method.”。
该图是一个带边框的提示文本框,标题是为工具用法生成,内容要求给定工具定义后列出多样用例。像素中括号内是待填充的工具占位符,说明同一提示会对库中每个工具重复调用,两项要求分别限制条数和长度。直观理解是原始向量保真,合成均值纠偏,加权后既不完全丢掉定义,也不被单一合成说法带偏。
没有训练时,真正计算的是合成、加噪与转写
本研究没有训练任何嵌入模型或识别模型,该节讲的是构造评测数据的真实计算。流程是先用语音合成把已有文本到工具数据集的参考查询变成语音,再做两路转写。一路直接识别得到干净查询,另一路先加混响和噪声再识别得到噪声查询。
自动语音识别 × 语音合成: 语音合成负责把文本查询变成待测语音波形,自动语音识别负责把干净或加噪语音再转回文本,二者分工构成可控的语音到文本退化链,搭配才能系统比较参考文本、干净转写与噪声转写的检索差异。
声学退化的参数按原文交代,混响用踏板效果库的标准混响效果,房间尺寸、阻尼和湿声比例分别从均匀分布中随机抽取。噪声选用语音形噪声,用白噪声过 12 阶线性预测滤波器得到,再与混响后语音按均匀抽取的信噪比混合。识别与合成分别用指定模型默认配置完成转写与发声。
混响 × 语音形噪声: 混响负责模拟房间反射对干净合成语音的卷积畸变,语音形噪声负责模拟与语音长期谱相似的平稳干扰,二者搭配先卷积后按信噪比加噪,才能复现论文的混响加加性噪声 2 阶段退化。
数据生成管线可以用下图按分支复述,该设计让干净与噪声转写的比较条件一致。上支路直接识别,下支路先退化再识别,差异可归因于混响加噪与识别,而非说话内容不同。
看图路径: 1. 先沿上支路看参考查询经语音合成与识别得到干净查询;2. 再沿下支路看同一合成语音经噪声生成与识别得到噪声查询;3. 确认两路共用同一合成源从而保证退化条件可比
论文图 2。原论文 Figure 3:“Data generation pipeline.”。
像素显示左侧参考查询进入语音合成得到干净波形,上支路直接进入识别得到干净查询,下支路先进入噪声生成再进入识别得到噪声查询。中间分叉箭头表明下路复用了上路的同一合成波形,输出符号区分了波形与文本,噪声生成另有一路配置输入。关于资源可达性需要如实说明,正文给出语音合成的开源链接,但本次收到的资源状态为暂时不可达,因此只能写本次未能确认可达。
用什么数据、什么模型、什么指标比?
数据用 3 个文本到工具数据集改造成的语音到工具语料,分别是侧重单工具调用的 Gorilla-HF、取测试集自然语言指令的 Ultratool、规模最大的 ToolACE。论文采用统一格式化,并报告每任务平均需要工具数作为复杂度,以及干净与噪声语音的平均词错率。噪声词错率显著高于干净,这是后文噪声检索分数更低的前提。
检索模型选 4 种,未经工具适配的 BERT 基线、针对工具检索微调的 ToolRetriever、通用高性能的 bge-base 与 bge-large。评价时统一用余弦相似度,指标为归一化折损累计增益乘以一百后的 N@一、N@三、N@五。主结果固定合成条数为十、融合权重为 0.5,消融再单独变动条数与权重。
归一化折损累计增益 × 余弦相似度: 余弦相似度负责在检索时给出查询向量与每个工具向量的排序分数,归一化折损累计增益负责评价排序把正确答案放得多靠前,二者搭配是先用相似度产生列表,再用该指标按位置加权打分,越高表示靠前命中越好。
比较的公平条件是同一查询集合、同一嵌入模型、同一相似度下,只切换是否做嵌入转向。论文报告的是 3 数据集上的平均与分数据集分数,平均分数便于看总体趋势,分数据集分数用于检查是否只在某一标注风格上有效。这种设计把工具表示改进与查询退化分开,便于定位增益来源。
主结果:转向在干净与噪声查询下各带来什么?
比较问题是固定的,在参考文本、干净转写、噪声转写 3 种查询下,转向是否在同一检索器上提升排序。公平条件是转向只改工具向量,查询向量与排序方式不变,指标方向是 N@一、N@三、N@五越高越好。下表整理参考查询下 3 数据集平均的基线与转向对比,数字来自正文连续原句,表头单位为百分比形式。
| 检索器 | 方法 | N@1 | N@3 | N@5 |
|---|---|---|---|---|
| BERT 基线 | 未转向 | 5.0 | 6.6 | 7.9 |
| BERT 基线 | 嵌入转向 | 21.0 | 25.0 | 27.9 |
| ToolRetriever | 未转向 | 43.8 | 47.7 | 52.0 |
| ToolRetriever | 嵌入转向 | 52.0 | 57.0 | 61.1 |
| bge-base | 未转向 | 49.6 | 54.5 | 58.0 |
| bge-base | 嵌入转向 | 59.3 | 63.9 | 67.2 |
| bge-large | 未转向 | 52.7 | 56.8 | 60.3 |
| bge-large | 嵌入转向 | 60.5 | 64.9 | 68.3 |
表后解释需要同时说收益与代价,收益是转向在 4 个检索器上一致提升,弱基线相对提升最大。强模型绝对分数最高且仍有数个点的提升,说明合成查询注入了任务对齐的语义,该表只反映参考查询下的平均。论文同时报告 Ultratool 提升绝对值较大但 Gorilla-HF 绝对分数偏低,表明集合与标注风格影响天花板。
第二个比较看更难的条件,干净转写与噪声转写下是否还有增益,下表整理这两类查询的平均对比。同样只用原文连续原句中的数字,条件切换只涉及查询退化程度,工具侧转向保持不变。
| 检索器 | 查询 | 未转向 N@1 | 未转向 N@3 | 未转向 N@5 | 转向后 N@1 | 转向后 N@3 | 转向后 N@5 |
|---|---|---|---|---|---|---|---|
| ToolRetriever | 干净转写 | 37.0 | 42.0 | 45.7 | 45.7 | 50.7 | 54.8 |
| bge-base | 干净转写 | 44.6 | 49.4 | 53.0 | 53.9 | 58.1 | 61.6 |
| bge-large | 干净转写 | 47.6 | 51.8 | 55.3 | 55.0 | 59.3 | 62.8 |
| bge-large | 噪声查询 | 19.3 | 20.9 | 22.8 | 20.5 | 23.0 | 24.9 |
该表的关键判断是转向具有韧性但不能抹平退化,干净转写下转向保持明显增益。噪声查询下绝对分数降到二十左右,转向仍带来小幅一致提升,未胜出项必须指出。噪声下所有模型的绝对排序质量远低于参考与干净条件,说明声学畸变加识别错误的损失仍是主要瓶颈。
合成条数与融合权重哪个更敏感?
消融回答两个可操作问题,每个工具生成几条合成查询,以及原始与合成各占多大权重。论文固定权重为 0.5 比较 K 取一、五、十,发现即使少量合成查询也有可测增益。更大的集合更稳,但增益会因语义冗余而饱和,这支持改进来自转向机制本身。
权重消融的趋势需要结合曲线读,横轴为权重,纵轴为排序分数,3 条曲线总体先升后降。论文报告中等权重表现最好,较大模型整体位置更高,峰值靠近 0.5 附近。
看图路径: 1. 先确认横轴是转向权重纵轴是归一化折损累计增益百分比;2. 再比较三条检索器曲线随权重从零到一的先升后降形态;3. 定位峰值附近区间并观察权重为一时三条曲线的明显回落
论文图 4。原论文 Figure 4:“Effect of the embedding steering weight on retrieval performance (K=10).”。
像素显示横轴标记为零、0.25、0.5、0.75、一,纵轴为百分比分数,3 条折线分别对应 ToolRetriever 与两个 bge 模型。可见从零开始增加权重时分数上升,在 0.25 到 0.5 附近达到高点,之后向一下降,且权重为一时下降明显。解释是平衡融合保留了原始定义的互补信息,完全替换或完全不用都会损失一侧信息,因此受控修正最有效。该结论来自论文报告的趋势,可能的待验证点是权重是否在其他数据集上仍以 0.5 为最优。
哪些边界没有测,不能承诺什么?
论文直接报告的局限是噪声下绝对分数仍低,转向的增益幅度小于干净条件。有限解释是作者假设大模型能过滤描述噪声并抽取有用语义,这句话是假设而非测量。应用时要用可能、待验证来表达,不能当成已证明的去噪机理。
未评测的边界需要逐项点名,第一是延迟与成本,合成与嵌入计算是离线一次性的。但工具库更新、新工具加入或版本变化时需要重新生成,论文未测量这部分开销。第二是识别器与合成器的选择,只用指定语音合成与识别默认配置,换识别器、换语言或真实录音时效果未知。
第三是统计不确定性,原文未报告置信区间或显著性检验,总体趋势不等于每组查询都提升。第四是参数正确性,评测只看检索排序,不看后续参数填充与执行,因此不能把检索提升等同于端到端调用成功率提升。这些边界决定了方法的应用范围,不应过度推广。
要复现,先做什么,需要哪些超参数?
复现的第一步是重建 3 类查询,按原文用统一格式化后的 3 个数据集文本,调用指定语音合成模型合成语音。再按给定分布抽取混响参数与信噪比生成噪声,最后用识别默认配置转写,得到参考、干净与噪声 3 套查询。并核对词错率是否落在原文报告的干净约十到二十、噪声约 70 到 80 的区间附近。
第二步是对每个工具调用 QWEN3-8B 生成最多 10 条短查询,约束每条 3 到 12 词,再用同一嵌入模型编码并平均。第三步是按权重 0.5 融合原始与合成向量,用余弦相似度排序并计算 N@一、N@三、N@五。每一步都要固定随机种子与模型版本,否则混响和噪声抽样会带来不可比的波动。
关键超参数与信息条件要保留,合成条数主结果取十,融合权重取 0.5,混响房间尺寸、阻尼、湿声与干声取值。噪声为 12 阶线性预测语音形噪声,信噪比从负 5 到 5 分贝均匀抽取,代码与权重方面原文只给出部分模型链接。本次未能确认语音合成链接可达,复现前必须重新验证链接、模型版本与默认配置,不把本次解读当成可运行保证。
何时值得尝试这个方法?
当工具库满足 2 个条件时值得尝试,描述风格不统一且难以全部人工改写,查询又来自语音或带错别字的自然说法。此时离线合成用户式查询再做加权平均,是一种不改检索器、不重新训练的轻量修正。尤其对弱基线与中等强度模型的提升更易观察到,强模型也能获得绝对分数的进一步抬升。
不适合的场景也要明确,如果工具库频繁大批量更新,离线生成的维护成本会上升。如果主要错误来自参数模式而非检索排序,本文方法不直接解决,如果已处于强噪声语音且识别错得过多。排序绝对分数仍会偏低,需要先改善声学前端或识别器,不能指望只靠工具侧修正弥补。
回到中心判断,嵌入转向把工具表示从文档语言拉向用户语言,在多模型多数据集上显示一致增益。并在噪声下保持韧性,但它是对齐手段而非去噪证明,后续验证应补真实语音、更多识别器。还需补检索加执行的端到端效果,以及权重与条数在新领域上的重新选择,才能形成完整结论。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



