英文题目:A frontend-backend architecture for tool calls in full-duplex speech models

标签:#全双工语音交互 | #模型融合 | #语音 | #流式处理

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Ke Hu:机构信息未在 arXiv HTML 中可靠披露
  • Slyne Deng:机构信息未在 arXiv HTML 中可靠披露
  • Chen Chen:机构信息未在 arXiv HTML 中可靠披露
  • Elena Rastorgueva:机构信息未在 arXiv HTML 中可靠披露
  • Edresson Casanova:机构信息未在 arXiv HTML 中可靠披露
  • Punit Kumar:机构信息未在 arXiv HTML 中可靠披露
  • Dharmendra Choudhary:机构信息未在 arXiv HTML 中可靠披露
  • Nikhil Srihari:机构信息未在 arXiv HTML 中可靠披露
  • Ameya Sunil Mahabaleshwarkar:机构信息未在 arXiv HTML 中可靠披露
  • Viet Anh Trinh:机构信息未在 arXiv HTML 中可靠披露
  • Slim Essid:机构信息未在 arXiv HTML 中可靠披露
  • Oluwatobi Olabiyi:机构信息未在 arXiv HTML 中可靠披露
  • Zhehuai Chen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

全双工语音到语音交互要求在用户说话的同时监听、抢答与被打断,而工具调用又需精确参数解析与多轮状态追踪,两者在建模容量与时延上冲突。先由双工语音到文本前端接收用户语音编码、智能体文本与流式识别文本,负责交互与委派判决,检测到工具需求时输出委派标记与安抚话术并保持静默监听。再将端点检测后的流式识别文本送入基于LangGraph的后端文本大模型,由其维持多轮状态并执行工具调用与推理,输出自然语言结果。最后把后端结果经预填充注入前端智能体文本通道,前端逐字复述该文本并经流式语音合成播报,之后恢复常态双工行为。与把工具建模进音频通道的原生方案不同,该机制仅增加工具调用控制标记,几乎不占用前端建模容量并保持原有打断与轮转行为。在BFCL单轮评测下,Ours-7B-intASR的平均分数为71.7,高于Ultravox-v0.6 Llama-3.1-8B的平均分数43.3。该结论适用边界限于单轮与中等长度多轮语音任务,在6步以上工具链与强噪声口音下仍会退化。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完能做什么?

本文的输入是论文原文与一张官方系统框图,目标是让刚进入语音与音频方向的研究生能核对并复述一种给全双工语音模型加工具调用能力的方法。必须保留的信息包括前端与后端的分工、委派记号与预填复述的时序、训练数据的构造与规模、单轮与多轮评测的协议与条件、以及加入工具调用后对轮次与识别的影响。读完你应当能说清一个样本如何从用户语音走完全流程,能指出哪些数字是论文直接报告的,哪些是待验证的推测。

本文只讲论文实际研究的任务,即在保持自然打断与低延迟交互的同时完成查天气、订票、排障等多步工具调用,不讨论纯文本智能体或纯合成语音质量优化。文中教学例子会明确标为例子,不引入无源数值。演示链接当前可用,地址为官方框图之外提供的在线演示空间。

已有路线为什么没同时拿下自然交互与强工具调用?

论文把相关工作分成 3 条线。第一条是级联式前端后端系统,例如英伟达语音智能体与实时通信框架上的研究助手,它们用识别加语言模型加合成做前端,另用后端做规划与工具执行,优点是模块清晰,缺点是往往不是全双工,轮次生硬。第二条是把工具调用直接做进语音原生模型,例如在独立通道放工具调用的做法,论文指出的矛盾是音频记号会占用参数与上下文预算,而文本大模型本可把这些预算用于事实知识、指令跟随与工具调用。

第 3 条是并发的混合委派设计,包括向类双工前端注入后端预言记号、给双工模型加检索增强、以及把深度推理与长程任务交给后台模型的交互后台框架,还有近期语音实时模型配后台智能体的方案。论文报告这些并发设计的委派信号与后台结果回注方式尚不清楚,这正是本文要讲清的缺口。教学例子:好比前台接待负责迎送与打断,档案室负责查单据,前台只需学会何时喊档案室,而不是自己背下所有档案。

要解决的判断是什么,难在哪里?

核心判断有 3 个。第一是何时委派,当用户说纽约天气如何这类需要外部查询时,前端要在智能体文本通道发出委派记号,当用户只是闲聊或问模型自身能答的问题时则不应发出。第二是如何在委派期间保住交互,前端要在约 1 秒的工具执行时间内保持沉默但继续监听,发出简短等待语而不丢失用户可能的纠正或打断。第三是如何把后端结果自然说出,后端返回的是自然语言答案,前端要原样复述并经流式合成播报,随后恢复正常双工行为。

难处在于前端是语音到文本的双工模型,输入有用户语音、用户转写与智能体文本 3 条流,输出要同时产生用户转写与智能体文本,任何大改都会伤及轮次延迟与打断精度。因此论文选择只在预测目标中加工具调用控制记号,保持主干改动最小。另一难处是评测条件差异大,流利合成语音、真人犹豫停顿录音、多轮客服任务对识别与委派稳定性的要求完全不同。

前端后端全景:一个样本走完全程

先沿一个样本走完。用户说纽约天气如何,流式语音编码器把声学块送入主干大模型,主干同时维护用户转写通道与智能体文本通道。在用户话尾后约 320 毫秒处,前端若判定需要工具调用,就不发常规智能体起始符而发委派起始符,随后生成约 1 秒的等我查一下类填充语,再发委派结束符。此时已端点化的用户转写被送往后端,后端在图执行框架中做多轮工具调用并汇总成自然语言答案。答案被预填回前端智能体文本通道,前端从智能体起始符开始逐字复述该答案,合成器据此生成语音。下图把这条主路径与回注路径画了出来,阅读时先看主路径再看回注。

看图路径: 1. 先从底部用户语音经流式语音编码器到解码器主干,再看分出的识别头与文本头两条输出;2. 再看文本头经是否工具调用判断后,一路直连流式语音合成,一路绕到后端大模型再预填回来;3. 最后确认路由与三色输入流在解码器处的汇合点,理解前端保持沉默时仍在监听

原论文 Figure 1:The proposed frontend-backend system for a duplex speech-to-speech model with tool-call capability.

论文图 1。原论文 Figure 1::“The proposed frontend-backend system for a duplex speech-to-speech model with tool-call capability.”。

图中可见底部是用户语音与流式语音编码器,中部是只解码 1 次同时产出两路文本的解码器,顶部是流式语音合成。左侧文本头向上连合成,右侧识别头向右输出用户文本,中间经是否工具调用的菱形判断后向右连到后端大模型,后端结果以预填虚线回到文本头。这种画法对应的真实动作是前端训练时预填区被遮住不计损失,推理时预填区作为上下文强制注入,推理期间智能体通道用填充位抑制输出以保持沉默。模块化体现在后端可换七十亿到两千多亿不同尺寸而前端不动。

前端如何只加记号就学会委派?

前端是双工语音到文本模型,由 600000000 参数的流式语音编码器与纳米级基础大模型主干组成,另有独立的流式识别嵌入与预测头,与智能体文本头共享主干,单次解码同时产出用户文本与智能体文本。训练时若用户问导致工具调用,则把该轮智能体轮次标为工具调用轮,包含最终自然语言工具答复。

具体排布是先用委派起始符替换常规智能体起始符,随后是填充语与委派结束符,约 1 秒后把自然语言工具答复用预填起始与结束符包起来填入智能体通道,前端被训练从智能体起始符开始精确再现这段预填文本。工具调用记号、填充语与再现区按常规智能体文本计损失,预填区被遮住不计损失,预填对应时段的识别通道插填充位、语音区插静音作输入。

推理时一旦前端发出委派检测记号,已由用户结束符端点化的用户转写即被送往后端,返回的自然语言答复在进一步生成前注入智能体文本通道,函数调用期间同样用填充位抑制智能体输出。

全双工 × 工具调用: 全双工负责低延迟双向语音交互与随时打断恢复,工具调用负责查知识库与执行外部动作,二者搭配的原因是前者缺事实与长程推理容量,后者缺实时语音通路,组合意义是前端只学一个委派开关,把重推理留给文本后端。

委派记号 × 流式识别文本: 委派记号是前端在智能体文本通道发出的<tc_bos> 与<tc_eos> 开关信号,流式识别文本是用户语音的逐块转写内容,二者搭配的原因是只有转写能被后端大模型直接消费,组合意义是记号触发后把已端点化的转写 1 次性送往后端执行。

这种只加控制记号的做法保留了原有的轮次启动与打断控制记号,合成器仍接受显式轮次启动与打断信号并增量生成编解码语音记号。

后端与回注如何保证多轮任务不断线?

后端采用图执行框架中的反应式智能体,图是消息列表上的状态机,包含用指令跟随大模型做决策的智能体节点与真正执行模型工具调用的工具节点,二者以条件边连接,只要本轮含工具调用就路由去执行,直到本轮无工具调用才结束。若用户问需要工具调用,用户识别转写作为消息送入图,智能体被唤起调工具作答。多轮上下文由按线程键持久化与恢复累积会话状态的检查点自动维护,因此每轮只需送当前用户转写。

若后端产出语法非法的工具调用请求或普通文本答复,则直接把文本作为预填返回前端,这意味着前端可能误触发了工具调用请求,而更大的后端仍能可靠地退回为对无关问询的自然语言解释。这种退回是论文明确写出的容错路径,不是附加推测。

预填 × 复述: 预填是把后端自然语言结果以<pf_bos> 到<pf_eos> 包起来塞入前端智能体文本通道作上下文,复述是前端从<agent_bos> 开始逐字生成同样文本,分工是后端定内容、前端定语音节奏,组合意义是无需改语音合成器即可把工具结果说出来。

LangGraph 后端 × 线程检查点: LangGraph 后端是由智能体节点与工具节点组成的反应式执行状态机,线程检查点是按会话键保存与恢复消息列表的记忆机制,搭配原因是多轮订票排障需要跨轮保留已调工具与参数,组合意义是每轮只送当前转写也能维持长任务状态。

填充语 × 保持轮次: 填充语是<tc_bos> 后约 1 秒的等一等类短语,保持轮次是工具执行期间不把话筒让给用户误解为结束,分工是前者占住听感、后者用填充位抑制输出,组合意义是在后端延迟约 1 秒时维持自然等待而不丢失打断能力。

教学例子:用户先说查明天纽约天气,随后纠正为后天,后端靠检查点记住城市与工具历史,前端靠持续监听拿到完整纠正后的转写,最终复述的是后天结果而非中途误触发的明天结果。

训练数据如何构造,监督信号落在何处?

训练分预训练与监督微调 2 个阶段。为让前端学会工具调用记号预测,作者先用多种大模型生成用户、智能体、工具调用与工具答复轮次的文本,再用模型裁判过滤掉轮次不一致或工具调用错误的会话。这些文本会话经管线合成音频会话,包括滤除不适合音频的数学与代码重会话、用多音色语音合成、再用识别模型按字错率过滤。

数据还有针对何时调工具、何时追问、何时拒调不可用工具的变体,类似语音版的何时调用判断,并模拟真实多轮交互中的应答声、停顿与打断。另有基于领域的多轮工具调用数据,例如模拟航空与零售库且实体与评测集不重叠,由两个文本大模型互演以实现多样用户目标,未完成任务的样本丢弃,用户轮用另一合成器转语音。训练规模与监督落点需要如实记录,前端训练时随机选用完整工具定义作系统提示或仅含函数名与描述的部分提示以增强泛化。

下表整理论文直接报告的训练量级与加入工具数据后的识别代价,数字来自原文连续句,识别退化原因论文表述为推测。表前问题是训练量级是否足以支撑委派判断,公平条件是同一前端基线只差有无工具调用训练,指标方向是字错率越低越好。

数据与影响规模或指标基线本方法说明
预训练数据约 530k 小时不适用约 530k 小时原文报告总量
监督微调数据约 111k 小时不适用约 111k 小时原文报告总量
识别转写数据约 16k 小时不适用约 16k 小时原文报告总量
多轮工具调用会话约 8.5k 小时不适用约 8.5k 小时原文报告总量
流式识别平均字错率平均字错率10.80%11.47%论文称可能因合成数据为主

表后解释是 8.51000 小时的多轮工具会话让前端见过委派、追问与拒调的对比,但合成语音占比高使开放识别榜平均字错率从 10.8% 升至 11.47%,这是为工具能力付出的具体代价。

未胜出项是识别榜上本方法落后于无工具调用基线,未评测边界是自然停顿数据在当前微调中缺失,论文在后文承认这影响停顿处理。论文未报告梯度是否截断到编码器等细节,此处指出缺项而不从模型名推定冻结与更新。

在什么语音与任务条件下测,与谁比?

评测分四块。第一块是单轮工具调用,用语音版伯克利函数调用榜的单轮集,含简单、多选、并行、并行多选与无关子集,用抽象语法树分数评工具调用请求的结构正确性,容忍参数顺序、空格格式与默认参数差异。比较对象包括实时语音模型、两种主干的轮次语音模型,以及配七十亿与三百亿后端的自家系统,另对比内部识别转写与外部识别转写两种给后端送文本的方式,外部方式在流式识别检出用户结束后再转写 1 次。

第二块是全双工第三版基准,全部为真人用日常内置麦在安静到轻噪环境录制的自然场景,含停顿犹豫与自我纠正,用模拟接口生成工具结果,按官方设置用大模型作裁判并沿用原系统提示与工具描述,指标含工具选择、参数、端到端通过、答复质量、轮次、打断与填充率,作者去掉端到端延迟因后端可本地或云端部署不可比。

第三块是语音智能体多轮客服基准,覆盖航空、信息技术服务与医疗人事共 213 个场景,用大模型扮演呼叫者并合成用户语音逐块送前端,用另一大模型作裁判,为聚焦前端文本质量而直接把智能体文本返回给模拟用户。第四块是常规双工质量,包括内部多轮轮次与打断、语音基准智能、开放识别榜与第一版全双工基准,对比有无工具调用训练的前端基线。

单轮调用能否既敢调又敢拒?

先看前端敢不敢发出委派。论文报告前端在 4 个正例子集上的委派记号召回较高,外部识别设置下后端平均分更高,并行多选提升最大源于更准的转写。表前比较问题是不同后端尺寸与不同转写来源下结构正确性与拒无关能力如何,公平条件是同一语音版单轮集与同一抽象语法树打分,指标方向是分数越高越好。下表用原文连续句中的数字整理召回与平均分对比,七十亿后端已大幅领先小轮次基线。

条件指标基线本方法比较对象
简单集委派召回召回率不适用97.2%前端自身触发
多选集委派召回召回率不适用92.0%前端自身触发
并集委派召回召回率不适用95.0%前端自身触发
并行多选委派召回召回率不适用93.5%前端自身触发

表后解释是召回在 92% 到 97.2 之间,支持前端可靠预测委派记号的判断,但这只是触发率,不等于参数全对,结构正确性还看后端。另一张表看转写质量与后端尺寸的实际可运行收益,仍用原文连续句数字。

条件指标基线本方法比较对象
三百亿后端内部转写平均分不适用73.0%内部识别
三百亿后端外部转写平均分不适用74.6%外部识别
并行多选内部转写子集分不适用55.1%内部识别
并行多选外部转写子集分不适用61.1%外部识别

表后解释是换外部转写平均分从 73% 升至 74.6%,并行多选从 55.1% 升至 61.1%,代价是多 1 次转写。

与实时语音模型比,三百亿后端在部分子集接近,但在并行多选与无关项差距最大,无关项上本方法为 81.2%,显示拒调能力仍有提升空间。未胜出项是并行多选仍落后,这是多参数多工具并行的固有难点。

真人犹豫与多轮客服任务表现如何?

在全双工第三版真人录音上,系统满足用户请求的答复质量约在 54% 到六十七之间,更大后端更好,轮次达成 100%。表前问题是自然犹豫停顿下任务完成与交互自然性如何权衡,公平条件是按官方裁判与原提示词,指标方向是工具与参数准确、通过与答复质量越高越好,打断越低越好,填充率按设计解读。下表整理论文直接报告的区间与设计性高填充的原因。

论文解释高填充是设计使然,前端在后端执行前发简短等待语,高打断的另一原因是前端会在用户不流利停顿时先发嗯我在听类应答声,但因边说边听,最终工具调用通常仍能看到完整请求,答复质量最高达六十七。与实时迷你模型比,配两千多亿后端的系统在通过与答复质量上相近,完整实时模型在几乎所有指标最好,轮次小基线因多场景无响应而显著更差。

转向更难的多轮客服基准,配三百亿后端的系统与实时迷你模型在综合分相近,配两千多亿后端的系统显著更好但仍落后于第二代实时模型,与轻量闪存模型相近且显著领先同尺寸轮次模型。表前第二问是长链工具调用在哪类领域掉链,公平条件是同为文本输出直返模拟用户,指标为任务完成率越高越好。下表用原文连续句数字呈现领域差异。

条件指标本方法比较对象差异
航空域任务完成任务完成率72%54%本方法领先
信息技术服务域任务完成任务完成率56.3%75%本方法落后
医疗人事域任务完成任务完成率49.4%69.9%本方法落后

表后解释是航空域本方法以 72% 对 54% 领先,但在需连续 6 到 8 次成功工具调用的信息技术与医疗人事域落后,论文将其归因于长对话中前端可靠检出委派的难度,这支持委派稳定性是长程任务瓶颈的判断。

限制是该归因是有限解释而非因果证明,未测量误检率随轮数变化曲线。理想文本上限任务完成率为 78.4%,说明语音通路仍有差距。

换转写与换后端尺寸带来什么变化?

论文做了两组可复述的对照。第一组是内部识别对外部识别,在三百亿后端下外部转写平均分更高,提升集中在并行多选,机制是外部转写在检出用户结束后再做 1 次更准的识别,减少了参数听错。第二组是 7000000000 对 30000000000 对两千多亿后端,简单与多选上两者相近,更大后端在并行与并行多选更好且更可靠地拒绝无关语音。表前问题是这些增益是否来自可部署的改动,公平条件是前端不动只换后端或转写源,指标方向是平均分与无关拒绝越高越好。

下表已在前节用原文句子呈现,此处补充反证是更大后端并未在所有全双工指标单调变好,例如工具选择准确上三百亿与两千多亿版本各有高低,说明后端尺寸主要改善推理与参数组织而非前端触发时机。另一反证是外部转写虽提分但增加 1 次识别延迟,论文为此在后文单独报告前端轮次延迟为一百多到三百多毫秒,而不把端到端延迟混入主表。教学例子:好比听写员换成更准的人,复杂并列地址听错减少,但等听写员复核会多花时间。

加上工具能力后,正常说话能力掉了吗?

论文用无工具调用基线做了 4 组对照。轮次与打断上精度召回略降,延迟相近。语音智能上开放问答与长对话评测相近,另一常识评测略降。开放识别榜平均字错率退化已在训练节列出。第一版全双工基准上模型变得更灵敏,平滑轮次达成率更高且延迟更低,但停顿处理变差,论文明确说可通过加自然停顿训练数据解决,而当前微调缺这类数据。下表直接选用原文 eligible 的开放识别榜原表,表前问题是合成工具数据是否伤及通用识别,公平条件是同一榜单 8 个子集,指标方向是字错率越低越好。

ModelLS-CLS-OTEDVoxEarnAMIGigaSPGIAvg
Baseline (no TC)3.938.595.898.9020.0020.4513.455.1510.80
Ours (frontend)4.168.186.719.9021.5221.6614.644.9811.47

表后解释是基线平均 10.8%,本方法平均 11.47%,多数子集小幅变差,个别子集略好,支持合成数据为主导致退化的推测。未胜出项是除个别子集外本方法全面略逊,未评测边界是内部轮次集的细节未公开,复现时只能用公开榜单近似。另一限制是高打断率虽可解释为边听边说的应答声,但在真人评测中仍可能被判为打断,需要未来区分礼貌应答与抢话的指标。总体趋势不等于每组每步都成立,引用时应分开讨论训练资源、推理开销与实际延迟。

要复现,先搭什么,再验什么?

先搭最小可运行链。前端需流式语音编码器加双头双工文本模型,能输出用户转写与智能体文本并支持委派起止与预填起止 4 种控制符,合成用支持显式轮次启动与打断的流式合成器。后端用图执行框架搭智能体节点与工具节点,配线程键检查点存多轮状态,前端触发后把端点化转写送后端,后端自然语言答案预填回前端再复述。

训练先按论文管线生成文本多轮工具会话并过滤不一致,再合成音频并按字错率过滤,工具定义在全量与仅名描述间随机切换,预填区遮损失、对应识别区插填充位。先验单轮语音版函数调用榜的召回与平均分,再验真人犹豫集的答复质量与轮次,最后验多轮客服的领域任务完成。复现时保留关键超参数与信息条件,例如委派起始约在用户话尾后 320 毫秒、填充约 1 秒、预填约在委派结束 1 秒后。

代码与权重方面,论文只声明在线演示当前可用,未声明训练代码与权重下载,因此应区分为系统可交互但不可直接复训。若无算力全量复训,可只复现推理链并换不同尺寸后端,观察并行多选与无关拒绝的变化。

何时值得尝试这种委派,还缺哪项验证?

当已有较强文本工具智能体而不想重训语音大模型、当任务以查库调接口为主且能容忍约 1 秒工具延迟、当需要保留打断与低延迟轮次时,这种前端判时机、后端做推理的委派值得尝试。当任务全是闲聊或端侧离线无后端时则不必引入。论文直接报告的是高委派召回、换外部转写与换大后端带来的可运行增益、以及真人与多轮客服上的可比结果,支持后端委派是模块化有效路径的判断。

可能待验证的是长链六到八跳任务的前端漏检分布、自然停顿下的误触发率、以及真实端到端延迟与成本,这些在原文或未测或明确不可比,不应承诺改善。还需补的验证包括区分应答声与抢话的打断指标、更多口音噪声下的召回曲线、以及预填文本与复述一致性的自动检查。常见误解是把高填充率当成啰嗦,实际它是占位等待的刻意设计,另一误解是把平均字错率小幅上升当成模型变差,实际它是为工具数据付出的已知代价,可通过补自然语音数据缓解。

📎 论文与评分元数据

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-18 语音/音乐/音频论文速递