英文题目:Audio2Tool: Speak, Call, Act - A Dataset for Benchmarking Speech Tool Use
会议身份:
conference:interspeech:2026:conference-paper-id:pahwa26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #数据集 #基准设计 #语音 #口语意图与槽位识别
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Ramit Pahwa:机构信息未能从会议 PDF 纯文本可靠映射
- Apoorva Beedu:机构信息未能从会议 PDF 纯文本可靠映射
- Parivesh Priye:机构信息未能从会议 PDF 纯文本可靠映射
- Rutu Gandhi:机构信息未能从会议 PDF 纯文本可靠映射
- Saloni Takawale:机构信息未能从会议 PDF 纯文本可靠映射
- Aruna Baijal:机构信息未能从会议 PDF 纯文本可靠映射
- Zengli Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音工具调用(Speech Tool Use)要求将原始音频直接映射为可执行应用程序接口(Application Programming Interface,API)调用,难点在于口音与噪声下的声学鲁棒性、参数精确抽取与多步依赖编排。本文构建约 30000 条查询的 Audio2Tool 基准,先以统一工具分类体系组织 152 个已验证函数与 23 个类别,再按 8 级复杂度生成语言查询并经大语言模型(Large Language Model,LLM)评审加人工核验,接着用零样本语音克隆(Zero-shot Voice Cloning)合成多说话人音频并混入车载与室内噪声。与已有语音语义理解(Spoken Language Understanding,SLU)基准相比,该设计以可执行结构正确性替代意图分类,并显式隔离多意图、隐式推理、长上下文干扰、纠错、多轮与多人混叠等失效模式。评测 15 个开源端到端语音大模型(SpeechLM)与 Whisper 加文本 LLM 级联管线显示,Qwen3-Omni 30B 在 Tier-1 直接命令工具准确率达 92.4%,但 Tier-4 隐式推理精确匹配(Exact Match,EM)仅 11.3%,Tier-7 多轮对话槽位 F1(Slot F1)仅 26.8%,且 Tier-7 与 Tier-8 上最强级联反而反超端到端。该结论限于合成语音与智能汽车(Smart Car)、智能家居(Smart Home)、可穿戴设备(Wearables)三领域封闭工具集,未验证真实录音、开放检索与安全关键拒止行为。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://audio2tool.github.io/ — 链接可访问(HTTP 200)
- 数据相关资源:https://audio2tool.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出又是什么?
这篇论文要解决的输入是原始语音波形,也就是用户在车里、家里或戴着手表时直接说出的一句话或一段对话,带有口音、语速、停顿和背景噪声。目标输出不是转写文本,也不是意图标签,而是一条或多条可直接执行的接口调用,包含接口名和全部参数,且参数格式必须合法、多步顺序必须正确。例如输入是打开后备箱的语音,输出就是对应车身控制接口加正确参数。
学习依赖上,读者需要先理解口语理解只要求语义对,而工具调用要求可执行,语义对但格式错仍然算失败。论文默认从原文独立写作,事实只来自原文证据与官方原图像素。项目与数据集的公开状态以资源声明为准,本文收到的资源状态显示代码与数据集链接当前可用,地址为项目主页。输出是 1 篇可核对、可复述方法的技术解读,不做营销式判断,教学用的例子会明确标为例子。
附:给新生的最小自查清单
读完先能复述输入输出:输入是带噪声的多口音语音,输出是有序可执行调用。再能复述三项指标:接口名对、多调用有序全对、参数归一化后全对,以及第一层无槽位 F1 的原因。然后能说清 8 层各测什么:直接、带参、多意图、隐式、长文提取、修正、多轮、意图混合。最后能说清两类基线:端到端直接听,级联先转写再理解,外加真值查询的甲骨文对照。带着这张清单去看原文表格与 3 张原图,就不容易把意图分类涨点误当成工具调用可用,也不容易把低噪声成绩外推到高噪声部署。
已有路线测了什么,还缺什么?
在语音工具调用之前,相关工作沿两条线走。一条是文本工具调用,以伯克利函数调用榜为代表,测选接口、填参数和多步约束,但输入是干净文本,没有声学变异。另一条是语音理解与语音智能体评测,包括早期只覆盖订机票的语料,后来覆盖多领域多意图的口语理解资源包和任务型语义解析集,以及车舱多意图数据集,还有语音助手评测与音频原生函数调用榜。
原文指出这些工作奠定了基础,但存在 3 个缺口:分类广度不够,声学多样性不够,多为高资源语言或实验室录音;缺少从简单触发到复杂依赖链的分层难度设计;对细粒度音频到工具失败模式支持有限。也就是说,已有工作能告诉你模型听懂了什么类别,但不能告诉你在真实噪声、多口音、多步编排下哪一步先坏。因此论文把自己定位为互补的诊断型基准,不是重复做一个更大的意图分类集。
为什么转写对了还可能调错接口?
问题可以拆成 3 层。第一层是语音感知,模型要扛住发音含混、韵律差异和环境噪声,传统级联路线把语音先转成文本,错误会向后传播,而且文本会丢掉有助于消歧的韵律语调。第二层是语义到可执行的跨越,模型要从一句话里选出正确的接口并填出高保真实体,例如标识符和时间戳,模式无效即失败。第 3 层是组合与状态,模型要处理一句话多意图、言外之意、长独白里的真实意图、说到一半的修正、多轮对话的状态维持,以及主说话人与背景人声重叠时的取舍。
举一个教学例子:用户说我好冷,这不是字面命令,需要推断为调高温度并填出合理数值,这正是隐式推理要测的能力。论文因此把任务定义为在 3 类设备域上做零样本音频原生调用,并用 8 层难度逐层加压,以便把听错、选错、填错和跟丢状态分开。
八层查询如何从一句话长到一段对话?
方法全景是一条从工具分类到查询生成再到语音合成的流水线。先建统一工具分类,覆盖智能车、智能家居和穿戴设备,共 152 个已验证函数和 23 个类别,车域包括气候、驾驶动态、充电与维护,家居覆盖灯光电器与安防传感,穿戴聚焦健康与连接。设计上要求区分改变状态的操作与被动监测,还要求保留设备特有行为。然后按 8 层复杂度生成查询,语言长度和功能推理同步加难。第一层是 2 到 6 词的直接命令,不带参数值。
第二层是带显式参数的槽位填充;第 3 层是一句话 2 到 3 个调用;第 4 层是需要语用推断的间接表达;第五层是 25 到 60 词的冗长独白中提取真实调用;第六层是说到一半用等一下、实际上修正。
第七层是 20 到 200 词的多轮对话;第 8 层是主次说话人重叠。图前导读如下:下面这张图把后 4 层的卡片并排展示,是理解长尾难度设计最直观的入口,建议按标题、词数约束和底部标注三行来读。
看图路径: 1. 先从左到右看 Tier 5 到 Tier 8 四张卡片的标题与副标题,确认各自考验的说话现象;2. 再看每张卡片中部的词数与输入约束,例如长独白、修正词与多轮格式;3. 最后看每张卡片底部的附加标注,区分只需要推理还是要保留原调用与修正类型
论文图 1。原论文 Figure 1:“Overview of the Audio2Tool query generation pipeline detailed for different tiers.”。
这张图显示 Tier 5 强调长而散的独白并允许填充词,目标调用埋在题外话里且多为连写长句,底部只要求附加推理;Tier 6 强调句中修复并给出修正引导词,输入限定为同类相关工具,底部要求保留原调用加修正类型;Tier 7 强调 2 到 4 轮的用户与智能体交替格式,底部同样要求推理与状态维持;Tier 8 强调多说话人重叠与带噪音频,底部要求为主要说话人输出附加调用。看懂这 4 张卡片,就能明白后文为什么说第五层考过滤无关文本而第 8 层考过滤干扰说话人,二者失败原因不同,不能混为一谈。
接口、参数和多步依赖各自由谁负责?
组件分工可以沿一个样本走一遍。假设输入是一句同时要除霜挡风玻璃并找充电桩的语音,先由声学前端把波形变成表示,再由工具选择决定调用哪两个接口,然后由参数填充为每个接口填值,最后由多步编排保证顺序与依赖正确,输出才是两条有序可执行调用。单步命令只需要走完前两步,多意图需要走完全部,隐式表达则在选择前多一步语用推断。
音频原生函数调用 × 级联管线: 音频原生函数调用指模型直接从原始语音信号选接口并填参数,省去中间文本;级联管线指先用自动语音识别转写再交给语言模型做理解。原文把二者对照的原因是转写会丢掉韵律语调并放大识别错,前者保留声学线索但更难,后者稳定但有信息损失,组合比较才能定位失败来自听错还是选错。
意图 × 可执行工具调用: 意图是语义层面的想做什么,槽位是相关实体;可执行工具调用则要求接口名合法、参数格式合法且多步顺序正确。原文强调语义合理仍可能执行失败,因此把传统口语理解的意图槽位评价升级为模式有效、高保真实体和有序依赖的严格检查。
多意图 × 隐式推理: 多意图是一句话里并列 2 到 3 个可执行动作,需要拆分并各自 grounding;隐式推理是用户只说状态或抱怨,需要语用推断出动作。原文用 Tier 3 测前者,用 Tier 4 测后者,分工不同但都考验超越字面槽位填充的组合与常识,搭配起来才能区分是拆不开发还是猜不对。
大海捞针式提取 × 意图混合: 大海捞针式提取要求从 25 到 60 词的冗长独白里找出被闲话淹没的真实工具调用,考验过滤无关上下文;意图混合要求从主说话人与背景人声重叠里只执行主说话人命令,考验说话人区分与上下文感知。前者是滤噪声文本,后者是滤干扰说话人,组合后覆盖真实客厅与车内更难的鲁棒边界。
把这些机制放在一起,论文的诊断逻辑就清楚了:第一二层只看基本选择与显式填参,第三四层看拆分与推断,第五到第 8 层看长上下文、修正、多轮与重叠语音下的鲁棒性。每一层在生成时还控制输入工具串的来源,例如多意图用同域伴生工具,修正用同类相关工具,以便失败可归因。
没有模型训练时,构造流程做了哪些真实计算?
本研究没有训练新的语音大模型或语言模型,训练节对应的是数据集构造与语音合成流程。查询文本先用闭源大模型生成,包括所列的多个版本,再用多模型组成的大模型裁判评估准确性、难度和多样性,对至少一个裁判判错的查询人工核查查询与真值工具的正确性。语音侧用零样本语音克隆合成模型生成,论文点名两种先进模型,并从多个开源语音数据集中挑选说话人以覆盖口音,再用最远点采样在控制规模的同时保留口音多样性。
噪声侧构建包含发动机、路面、风、空调、雨、转向灯、座舱与室内噪声的集合,按信噪比与干净语音混合,模拟真实部署。算法层面是对每个查询采样多个说话人,对每个说话人合成语音后再混入从噪声集采样的噪声,得到查询、说话人与带噪音频三元组。
零样本语音克隆合成 × 环境噪声混合: 零样本语音克隆合成负责用少量参考音色生成多口音多韵律的查询语音,解决说话人多样性;环境噪声混合负责把发动机、风噪、空调、雨声和室内噪声按信噪比叠到干净语音上,解决部署环境真实性。二者搭配才能同时复现听谁说和在哪说,缺一端都会低估野外部署难度。
分布上需要先建立总量概念,下面这张表把原文直接报告的各层数量与总量放在一起,便于复述时核对规模是否对齐。表前问题是各层样本量是否均衡,公平条件是都按原文的层定义计数,指标方向是数量越多覆盖越密,但车域占比高意味着不能把平均分当成各域都好。
| 分组 | Tier 1 直接命令 | Tier 2 参数化 | Tier 3 到 Tier 7 每层 | 数据集总量与域 |
|---|---|---|---|---|
| 查询数量 | 1080 条 | 5800 条 | 每层 4560 条 | 约 30000 条,覆盖智能车、智能家居、穿戴设备 |
| 语言特点 | 2 到 6 词、无填充词 | 显式参数、数字做语音友好处理 | 从多意图到多轮对话逐层加难 | 车域占多数,聚焦免提高风险场景 |
| 例子与用途 | 打开后备箱类 | 设温度到 72 类 | 测拆分、推断、提取、修正与对话 | 强调功能多样性与组合推理 |
| 生成与核验 | 闭源大模型生成 | 大模型裁判评难度多样性 | 判错则人工核查真值工具 | 手工验证合成音频策略 |
| 诊断目标 | 基本调用 | 正确抽参 | 隔离不同失败模式 | 对齐真实工具与声学条件 |
上表的主要收益是让读者一眼看到简单层样本少而中间层每层数量持平,代价是车域倾斜可能抬高对车载术语的依赖。未胜出的边界是原文未给出每层内部三域的完整交叉表,复现时只能先按总量与层量核对,域内细分需回到项目页核查。图前导读如下:下面这张分布图是核对多意图构成与域倾斜的关键,建议先看环形图再看树图面积,最后核对大块数值。
看图路径: 1. 先看左侧环形图中 2 次调用占 61.8% 与 3 次调用占 36.2% 的比例与样本量标注;2. 再看右侧树图中 Smart Car 蓝色块明显大于 Smart Home 与 Wearables 的面积分布;3. 最后核对树图里 Climate Environment 4816 与其他大块的数值标签,确认车域密度
论文图 2。原论文 Figure 2:“Query and domain distributions across complexity tiers.”。
这张图左侧环形图显示在 45560 样本的统计口径下,2 次调用占 61.8%,3 次调用占 36.2%,4 次与 5 次调用只占很少比例,说明多意图以双调用为主。右侧树图显示智能车蓝色面积最大,其中气候环境等大块数值突出,另有其他类别汇总块数值较大,智能家居橙色与穿戴绿色块相对较小。这种分布支持论文优先汽车域的说法,也提醒读者平均指标会被车域主导,跨域比较时要分域看。
测谁、怎么比、指标往哪边算好?
实验比较两类语音系统。第一类是端到端语音语言模型,包括所列的多个开源模型,参数从 70 亿到 300 亿量级。第二类是模块化级联管线,先用第三版转写模型把语音转成文本,再把文本连同工具定义与指令交给文本大模型,文本侧覆盖不同尺寸的两个系列,另设一个用真值查询替换转写结果的甲骨文对照,用于隔离转写错误的影响。评测采用零样本工具调用,三项指标方向都是越高越好:工具准确率看接口名是否对,多调用要求有序序列全对。
精确匹配要求接口与全部参数经确定性归一化后完全一致;槽位级别用微平均的准确率、召回率与 F1 看参数级正确性。第一层无参数,因此槽位 F1 无定义。噪声消融用公开噪声集取噪声文件,分 3 类噪声乘三档信噪比。复现时要保留的关键条件是零样本、同一工具定义、同一确定性归一化,以及转写模型版本固定,否则跨表数字不可比。
简单命令很稳,多步与多轮在哪里掉下来?
主结果要回答的问题是在层层加难下端到端与级联谁更稳,公平条件是同为开源模型零样本调用,指标越高越好。下面这张表把原文直接报告的关键结论组织成可运行的对照,重点不是罗列每个格点,而是保留可部署策略与最难边界的对比。
| 评估切面 | 简单直接命令 | 中间多意图与隐式推理 | 长文本修正与多轮对话 | 最难的多轮与意图混合 |
|---|---|---|---|---|
| 代表层 | Tier 1 | Tier 3 与 Tier 4 | Tier 5 到 Tier 7 | Tier 7 与 Tier 8 |
| 端到端表现 | 大模型准确率超 75% | 精确匹配与 F1 常低于 35% | 最强模型 F1 与精确匹配仍低于 55% | 准确率跌到 56% 以下 |
| 级联表现 | 强级联同样高 | 同样明显下滑 | 部分层接近但仍受转写影响 | 主次人声重叠主要影响音频理解 |
| 规模趋势 | 大模型优于小模型 | 每查询多工具暴露多意图短板 | 长上下文与修正持续挑战全部模型 | 需说话人区分与上下文过滤 |
| 可复现要点 | 零样本、接口名全对 | 有序多调用全对才算对 | 参数归一化后完全一致 | 只执行主说话人命令 |
上表的主要收益是简单层两类路线都可用,但从多意图开始精确匹配快速拉开差距。代价与反例同样明确:端到端并未稳定超过强级联,说明级联仍是语音工具调用的有效路线;第 8 层未在文本模型上评测,因为混合主要影响音频理解,不能把文本榜成绩直接外推。未评测边界包括真实录音与更多安全关键场景,原文已声明未来再补。
噪声加到多大时,哪类系统先扛不住?
消融要回答噪声类型与强度是否改变排名,比较对象是端到端大模型与级联管线在同三档信噪比下的意图分类 F1,条件一致则下降幅度可比。下面这张表把原文的噪声设计与关键趋势固定下来,便于按条件复现。表前问题是 3 类噪声与三档强度下性能如何变化,公平条件是同一噪声集取样与同一信噪比定义,指标方向是 F1 越高越好、随噪声增强而下降为预期。
| 噪声维度 | 巴布尔噪声 | 机械嗡鸣 | 脉冲噪声 | 低噪声条件 | 高噪声条件 |
|---|---|---|---|---|---|
| 来源与混合 | 公开噪声集取文件 | 汽车与室内录音 | 同上 3 类之一 | 正 15 分贝信噪比 | 负 5 分贝信噪比 |
| 中档对照 | 同上 | 同上 | 同上 | 中档正 5 分贝信噪比 | 与低中档形成 3 级阶梯 |
| 报告趋势 | 加噪后显著下降 | 加噪后显著下降 | 加噪后显著下降 | 基线最高 | 各模型明显下沉 |
| 模型分化 | 级联在高噪更陡 | 端到端相对更稳 | 需看具体散点 | 大模型占优 | 排名可能保持但差距拉大 |
| 数据集处理 | 3 类噪声都收入基准 | 覆盖发动机风噪空调雨声等 | 模拟真实部署 | 形成综合评测 | 暴露鲁棒短板 |
上表的主要收益是把噪声从定性抱怨变成 3 乘 3 的可控网格,代价是合成混合仍不是真实远场录音。负结果是高噪声下所有模型都掉,不能只看低噪声榜首就部署。图前导读如下:下面这张双面板图是验证上述趋势的直接像素证据,左图看散点分层,右图看随强度下降的曲线,建议重点看高噪声端的分叉。
看图路径: 1. 先看左图三个模型分组下不同噪声类型的散点高低,确认高噪声点整体下沉;2. 再看右图横轴从低噪声到高噪声三档下三条曲线的单调下降趋势;3. 最后比较 Qwen3-Omni 30B 始终在上、级联路线在高噪声端下滑更陡的分化
论文图 3。原论文 Figure 3:“Effect of noise on the performance.”。
这张图左面板按模型分组显示意图分类 F1 散点,不同颜色代表机械、瞬态与巴布尔噪声,不同深浅代表低中高三档,整体随噪声增强下移,高噪声点明显更低。右面板横轴从低噪声到高噪声三档,纵轴为意图分类 F1,3 条带误差线的曲线都单调下降,其中大参数端到端模型全程在上,级联路线在高噪声端更低且误差线更宽。这支持加噪显著恶化性能的判断,也说明在强噪声下端到端保留声学线索的优势更易显现,但仍未解决根本鲁棒问题。
哪些结论还不能下,缺了哪项验证?
需要分 3 层表达。论文直接报告的是简单命令可靠、多意图与参数 grounding 脆弱、噪声下显著下降、端到端未稳定超过强级联。有限解释是车域倾斜与合成语音多样性可能影响泛化,但原文未给出真实录音对照,因此只能说支持而不能断言野外排名不变。未验证推测包括延迟、误触发成本与安全关键操作的可靠性,原文未测量这些量,不能承诺改善。
数据缺项也很具体:虽然强调口音覆盖与远场采样思路,但基准目前依赖生成语音,真实录音、更多安全关键场景与更广域覆盖留待未来。相关性不等于因果,例如大模型分数高可能来自更强的语言先验而非更好的听觉鲁棒,需要用甲骨文转写对照与分层噪声消融才能拆开,复现时不要把总体趋势推广到每一层每一档都成立。
要复现,先跑通哪三步?
第一步先核对数据与代码可达性,本文收到的资源状态为代码与数据集均可用,入口是项目主页,复现时以正文开源声明与本次实际可达为准,不要沿用旧缓存链接。第二步跑通评测管线:固定转写模型版本与文本大模型版本,用同一工具定义与确定性归一化跑零样本调用,先复现第一层的工具准确率,再复现第三四层的精确匹配与槽位 F1,最后跑第五到第 8 层的长文本与多轮逻辑,第 8 层注意只执行主说话人。
第三步复现噪声网格:从公开噪声集取文件,按低中高三档信噪比混合,分别记录 3 类噪声下的意图分类 F1 与工具级指标,避免只报意图分类而掩盖参数错误。关键超参数与信息条件包括零样本、无微调、工具有序匹配、第一层无槽位 F1。常见误解是把转写准当成调用准,实际上接口选择、参数格式与多步顺序任一错都算失败;另一个误解是把合成语音多样性当成真实录音,部署前仍需补真实车舱与家庭录音验证。
什么时候值得用这个基准,什么时候先别急?
当你的系统要从语音直接调车、家居或穿戴接口,且担心多意图拆分、言外之意、长独白、句中修正、多轮状态或背景人声时,这个基准值得一试,因为它把这些失败模式拆成了可定位的 8 层,并配了可控噪声网格。复现时优先做三件事:用第一层校准基本调用能力,用第三四层检验组合与推断,用噪声消融检验高噪声端的真实可用性,同时保留强级联作为基线,不要只和同类端到端比。还需要补的验证是真实录音、延迟与误执行代价,以及安全关键场景的专项测试。总体判断是简单命令已可用,复杂编排与强噪声仍是短板,选型上不要默认端到端一定更好,应按层级与噪声条件分别决策。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


