英文题目:VoxMind: An End-to-End Agentic Spoken Dialogue System
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.459
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据集 #端到端学习 #语音大模型 #语音 #语音对话系统
评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告
👥 作者与机构
- Tianle Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Yifu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shengpeng Ji:机构信息未能从会议 PDF 纯文本可靠映射
- Yijun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyang Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Jingyu Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Zhuo:机构信息未能从会议 PDF 纯文本可靠映射
- Xueyi Pu:机构信息未能从会议 PDF 纯文本可靠映射
- Yangzhuo Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhou Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端口语智能体需直接从语音输入完成理解、规划、工具调用与语音回复,难点在于语音编码 token 量大而语义粒度粗、工具参数结构化生成难,且大工具库易引发延迟爆炸与数据稀缺。为此作者先给出含规划与执行的智能体形式化定义,再构建VoxMind系统:语音状态先经思考策略生成内部推理轨迹,再由行动策略据此选择口头回复或工具调用。同时辅助大语言模型并行检索候选工具并按需扩充局部工具集,使主流程与全局工具检索解耦,推理轨迹所需 token 仅占语音生成的约12.6%而保持有界。数据上通过反向生成与评分过滤构建AgentChat语料,合成推理链与工具标注以补足语音智能体监督。与已有检索式语音助手的关键差异在于显式先思考后说话与推理触发的局部工具空间管理,具有将任务执行延迟与工具总数解耦为近似常数的实际意义。在自建智能体评测下,VoxMind的Overall得分为74.57,高于Gemini-2.5-pro的Overall得分71.51。结论适用边界受限于合成语音主导的单轮与短多轮工具任务,对真实自发口语与长程多工具依赖尚未验证;硬件上训练采用2块H20-NVLink GPU,推理开销方面主智能体等待开销保持在15ms以下使检索延迟被并行推理隐藏。
🔗 开源与复现资源
- 第三方资源:https://bailian.console.aliyun.com — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么语音智能体更难?
这篇论文的输入是用户语音与工具或环境返回的结构化反馈,目标是直接输出语音回复或结构化工具调用,中间不依赖外部级联转写模块。论文首先给出判断:文本智能体已有成熟工具调用与规划机制,而端到端语音模型在细粒度语义理解与结构化动作生成上落后,例如理解工具语义并生成参数正确的调用。
对刚入门的读者,白话理解是:语音信号比文本长得多,同样一句话转成声学 token 数量远大于文本 token;如果再把几十上 100 个工具的描述全部拼进提示,推理会变慢且容易选错工具。数据侧也缺带推理轨迹与工具交互标注的语音数据,模型学不到先分解任务再调用的习惯。
图前导读:下面这张示意图用两个生活例子展示论文要解决的完整闭环,建议先看懂单轮与多轮如何统一到同一执行框架。
看图路径: 1. 沿顶部用户语音到工具调用再到工具返回最后到助理语音的纵向顺序看主链路;2. 观察关家电单轮与订机票多轮两段例子如何共用同一调用加反馈模式;3. 注意虚线 More turns 表示多轮历史被保留而非单轮问答
论文图 1。原论文 Figure 1:“VoxMind can dynamically perceive the inter- action context, autonomously determine when to invoke external tools, and drive the generation of subsequent responses based on the…”。
这张图展示了从上到下的执行链:顶部用户说要出门请关闭所有家电,智能体生成关闭家电的工具调用,工具返回客厅空调与书房灯等已关闭,助理再用语音确认;下半段是查北京到上海航班并选靠窗座的多轮订票,最后返回确认与座位号。两段共同说明交互上下文被动态感知,是否调工具由模型自主决定,后续回复由工具执行结果驱动。虚线 More turns 表示历史被保留,这是后文状态中历史项的直观来源。
端到端语音智能体 × 文本智能体: 端到端语音智能体负责直接从语音输入理解意图并生成语音回复或工具调用,文本智能体负责在纯文本上做规划与工具调用;两者搭配的原因是文本侧已验证规划与工具机制有效,语音侧缺统一定义与监督,组合意义在于把文本侧的推理与工具范式迁移到语音交互全链路。
本解读的输出是一套可复述的方法与实验条件:定义、架构、数据构造、训练配置、评测协议与代价,不做超出证据的效果承诺。必须保留的信息包括工具规模与延迟的关系、是否带推理的消融对照、通用对话能力是否退化。
同输入同目标的已有路线在做什么,缺口在哪里?
论文把相关工作放在预训练大语言模型依赖静态数据、难以适应动态场景的背景下。自主智能体范式通过让模型调用外部工具来弥补,文本侧已有推理与行动结合的框架,但扩展到端到端语音交互仍处于早期。文中点名的初步尝试包括流式检索、音频检索增强、过程监督多模态工具使用与全模态模型等,功能多集中在信息检索或基础工具使用。
对学习的意义是:不要把类别差异当成同条件胜负。级联系统把语音先转文本再交给文本大模型,在不考虑副语言信息与延迟时可能占优;端到端系统要求从语音直接规划与调用,难度更高但交互更自然。论文的缺口陈述很明确:缺少统一的端到端语音智能体定义,缺少带推理与工具监督的语音数据,缺少工具规模增大时仍低延迟的机制。
因此后文三项工作一一对应:给定义与形式化,建带推理轨迹的语音数据 AgentChat,做动态工具管理。理解这层对应关系,再看架构图就不会迷路。
论文如何定义端到端语音智能体,要满足哪两条原则?
论文提出端到端语音智能体需要同时满足规划能力与动作执行。规划能力被形式化为不能只做输入到输出的直接映射,而需要中间推理阶段。原文把直接映射记为从输入到输出,把有效智能体记为输入经由中间推理再到输出,其中输入包含多模态观测,中间推理包括思维链、任务分解或潜在逻辑生成,输出是最终动作或语音回复。
动作执行围绕工具使用展开,分为两个顺序决策阶段。第一步是判断:评估当前上下文是否需要外部帮助;第二步是选择与调用:确认需要后从可用接口集合中选出最优工具并生成精确调用参数。这种两步划分对应后文评测先看工具名是否选对、再看参数是否填对的顺序。
举例说明:用户说查欧洲和亚洲游戏耳机降噪可用性并总结某型号评论,模型不能直接编答案,而应先拆成查可用性与查评论两个子任务,分别调用对应工具,再综合工具返回生成语音。这正是后文训练样本 dialog-781 的逻辑,也是 6 种核心能力中单任务处理与任务分解的来源。
VoxMind 全景:谁先想,谁行动,谁补工具?
VoxMind 全景可以沿一个样本走完:语音用户输入与工具观察进入语音对话模型,模型先生成显式推理轨迹,再基于该轨迹生成回复或工具调用;与此同时辅助语言模型并行从全局工具池提名候选工具;两者共同决定下一时刻局部工具空间是否扩展;工具后端执行后返回反馈,再进入下一轮决策。
图前导读:下图是全文最重要的架构图,建议按主决策链与工具补充链两条线分别跟踪箭头,再看它们在局部工具处如何汇合。
看图路径: 1. 先从左下用户语音经语音与观察进入中上语音对话模型再到推理框的主路径看起;2. 再看右上辅助语言模型从全局工具池选 Top K 工具回补左侧局部工具的支路;3. 观察底部工具后端执行与调用反馈如何回流到上部决策
论文图 2。原论文 Figure 2:“Overall architecture of the VoxMind. Given spoken user input, the speech-centric agent first generates an explicit reasoning trajectory in a “think-before-speak” manner.”。
这张图左侧绿色框是语音为中心的智能体,输入为语音与观察,内部有显式推理框与语音生成及工具调用出口,底部有动态局部工具与新工具更新回路;右侧蓝色框是辅助语言模型与工具池,根据意图选出 Top K 工具回补左侧;底部紫色框是工具后端执行与调用反馈,并触发是否需要搜索工具。关键是推理输出同时送给行动选择与辅助检索,使行动与工具补充可以并行推进。
这种安排的理由在原文写得很直接:语音编码已很长,若每次都拼接全量工具描述会导致显著计算开销与延迟;用推理条件化的紧凑局部工具空间动态更新,就能把推理效率与工具集规模解耦。下一节把状态、推理与行动的计算关系讲清楚。
状态、推理与行动如何计算,工具空间何时扩展?
论文把时刻 t 的系统状态定义为观测集合、累积交互历史与动作空间的三元组。观测包括当前用户输入与工具或环境返回的结构化反馈,历史是之前多轮的累积,动作空间包括语音回复与当前局部可调用工具子集。形式化有助于复述:每一步决策都依赖这三者,而不是只看当前一句话。
\[St = (Ot, Ht, At)\]核心是分层策略与先想后说机制。在产生语音或调用工具之前,智能体先从思考策略中采样推理轨迹,该轨迹以当前观测、上一时刻历史与局部工具为条件,捕捉意图理解、上下文分析与任务规划。以该轨迹为条件,行动策略再采样下一步动作,动作或是语音回复或是调用外部工具,从而保证可观察行为 grounded 在显式推理上。
Think-before-Speak × Chain-of-Thought: Think-before-Speak 负责规定先推理后行动的执行顺序,Chain-of-Thought 负责承载意图理解与任务分解的具体中间文本;搭配理由是只有顺序约束没有内容载体仍无法训练,组合后模型每次输出语音或工具前都先生成可监督的推理轨迹。
为实现可扩展工具使用,论文采用并行动动态工具更新。推理轨迹生成后,两个过程并行:智能体基于当前局部工具集采样下一步动作,辅助模型基于推理轨迹从全局池提名候选工具。若采样动作是检索动作,表示当前局部工具不足,则把候选工具并入下一时刻局部工具集;否则局部工具集不变。再基于更新后的工具可用性做下一时刻决策。
局部工具空间 × 全局工具池: 局部工具空间负责当前决策可见的少量候选工具以控制提示长度,全局工具池负责存放全部可用工具定义;搭配理由是语音输入本身已占大量 token 而无法每次拼接全库,组合意义是通过按需从全局向局部补充实现规模与延迟解耦。
教学例子:局部工具只有查天气,推理判断用户要订机票,模型发出检索工具不足的信号,辅助模型从全局池找出查航班与订票工具并入局部,下一轮就能正确调用。这种显式触发扩展的设计使检索延迟可被并行推理过程掩盖,是后文延迟实验的机制基础。
主动索取 × 结果反馈: 主动索取负责在局部工具不足时发起检索新工具的动作,结果反馈负责根据工具返回调整下一步行动;搭配理由是前者解决开放世界工具缺失,后者解决执行后纠偏,组合后智能体具备发现不足并闭环修正的能力。
AgentChat 如何构造,推理链如何生成与筛选?
AgentChat 分为工具交互语料与通用对话语料两大类。工具交互语料源自 ToolACE 与 APIGen-MT 等基准,先做粗规则过滤去掉不适合语音合成的内容如超文本标签与代码片段,再用语言模型做细粒度过滤与口语化改写,并基于已有工具描述生成任务特定对话。通用对话语料整合 SciQ、GSM8K、ARC 与中学教材常识,选出适合语音合成的子集以保证领域平衡。所有清洗后文本用 CosyVoice2 合成语音,并用 600 多种提示音色增加说话人多样性。
图前导读:下面训练样本展示了工具交互数据的完整形态,建议重点看角色交替与工具观察如何构成监督信号。
看图路径: 1. 沿用户音频到第一次工具调用到观察再到第二次工具调用最后到音频回复的顺序阅读;2. 核对两次工具名与参数如何分别对应查可用性与查评论两个子任务;3. 观察每步助理动作旁附带的推理占位符表示先想后动
论文图 7。原论文 Figure 7:“Tool Interaction Data Training Example.”。
该样本编号为 dialog-781,可用工具为耳机评论分析与功能可用性检查。用户音频提出查欧洲和亚洲降噪可用性并总结 HyperX Cloud II 在两个来源的情感;助理先调用功能可用性检查,观察返回两地均可用;再调用评论分析,观察返回情感分与主题;最后生成语音总结。这种用户音频、工具调用、观察、音频回复的交替就是模型的训练序列,每次工具调用与最终回复前都附有推理占位符。
推理链构造采用逆向条件生成:给定任务输入与最终输出,模型生成逻辑衔接两者的推理链。质量控制用打分迭代过滤,每条候选链打 0 到 10 分,只有达到阈值 7 才保留,低于阈值最多重新生成 3 次,仍不达标则丢弃,最后由大模型压缩润色但严格保留核心逻辑。
\[Rretain = {R | S(R) ≥τ}.\]\[R′ = LLMrefine(R | I).\]论文还列出 6 种核心能力目标:单任务处理、任务分解、并行处理、上下文规划、主动索取与结果反馈。附录进一步把工具数据细分为单工具选择、多工具选择、参数填充、并行调用、主动检索与观察理解等,工具子集约 14805 样本约 109 小时,通用对话主体约 38681 样本约 361 小时。训练还补充跨模态无工具数据、安全文本与纯文本对话以稳定生成。
用什么数据评,用什么指标判,如何保证公平?
评测分三块:智能体核心能力、通用对话能力保持、动态工具管理。核心能力覆盖单任务处理、任务分解、并行处理、上下文规划、主动索取与结果反馈。指标为工具选择准确率、参数填充准确率、工具使用准确率与反馈完整性,方向均为越高越好。评估用 Gemini-2.5-Flash 作专家评判,对照预设标准答案而非主观打分,每个输出评 3 次取平均以降低方差。
工具选择准确率 × 参数填充准确率: 工具选择准确率负责判断是否选对工具名及数量,参数填充准确率负责在选对工具后判断参数名值是否填对;搭配理由是选错工具则参数无意义,组合后形成先卡工具名再卡参数的 2 阶段严格评测。
严格评估流程是先抽取工具调用再判正确:从目标与模型输出中抽取工具名与参数名值对,忽略文本格式与空格引号;先比工具名,大小写敏感、顺序不限但出现次数必须完全一致,否则直接判选择与填充均错;只有选择正确才比参数,参数名忽略大小写空格,参数值要求精确匹配但允许引号差异与数值等价,参数顺序不限。
通用对话用 VoiceBench 验证智能体训练是否损害日常对话,动态工具管理用 Gemini 生成的跨域数据集,对比有无辅助工具管理智能体,在工具数变化下测任务准确率与相对推理延迟。训练配置为 2 块 H20-NVLink,批量大小 1 加梯度累积 8,初始学习率 1e-5 加余弦调度,权重衰减 0.01,梯度裁剪 1.0,AdamW 优化器,DeepSpeed ZeRO-3 加 bfloat16 与梯度检查点。资源状态依据本次核验为可用,链接当前可用,但这只说明资源可达,不代表权重或代码已公开可运行。
主结果:VoxMind 相对基线提升多少,代价初现在哪里?
比较问题是:在同一智能体任务上,带推理与动态工具的端到端模型是否优于直接推理的开源端到端、级联系统与闭源模型。公平条件是同一工具调用抽取加正确性流程与 3 次平均,指标方向为选择与填充准确率越高越好。下表整理论文报告的核心总体分与关键基线,重点看可运行的端到端与级联对照。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 智能体综合 | 总体分 | 34.88 | 74.57 | 54.94 |
| 智能体综合 | 总体分 | 64.00 | 74.57 | 71.51 |
| 相对基线 | 相对提升 | 34.88 | 113.79% | 74.57 |
| 开源端到端 | 总体分 | 54.94 | 74.57 | 39.85 |
| 闭源直接推理 | 总体分 | 71.51 | 74.57 | 68.40 |
上表显示论文报告 VoxMind 总体 74.57 分,基座 StepAudio2 为 34.88 分,相对提升 113.79%,同时超过 Kimi-Audio 的 54.94 分、级联 Qwen3-8B 加 Whisper 的 64.00 分与 Gemini-2.5-pro 的 71.51 分。主要收益是工具选择与参数填充在多类任务上同时改善,尤其主动索取从接近零提升到可用水平。代价在后文显现:推理轨迹带来固定 token 开销,通用对话若去掉推理会明显退化。未胜出项也需记录:上下文规划的部分参数填充低于某些对照,说明推理并未在所有子项全面占优,限制节将继续讨论合成数据与延迟权衡。
去掉推理会怎样,数据比例与工具规模如何影响结果?
消融问题是:性能提升来自更多智能体数据还是来自显式推理,以及工具增多时有无辅助模型的表现分叉。论文对比无思考与有思考在两种数据配比下的总体分,并对比有无辅助大模型在工具数 1 到 100 下的效率与准确率。
| 条件 | 指标 | 无思考 1 比 1 | 无思考 1 比 0.5 | 有思考 1 比 0.5 |
|---|---|---|---|---|
| 智能体综合 | 总体分 | 68.83 | 70.97 | 74.57 |
| 智能体综合 | 总体分 | 68.83 | 71.97 | 74.57 |
| 通用对话 | 总体分 | 59.72 | 54.80 | 64.21 |
| 通用对话 | 总体分 | 64.15 | 59.72 | 64.21 |
| 主动索取 | 工具使用 | 31.34 | 37.31 | 68.66 |
上表支持的判断是:无推理时把通用与智能体数据比从 1 比 1 调到 1 比 0.5 仅从 68.83 微增到 70.97,遭遇直接语音到答案范式的瓶颈;有推理的 1 比 0.5 达到峰值 74.57,比 1 比 1 基线高 2.6 分,且通用评价升到 64.21,超过基座的 64.15。反例是无推理模型在通用对话上从 59.72 退到 54.80,而有推理变体最大退化仅 0.53 分,说明推理稳定了训练并缓解专业化与通用能力的权衡。
图前导读:下图是动态工具管理的关键反证,建议重点比较工具数增大后两类配置的走势是否分叉。
看图路径: 1. 先看左图横轴工具数从 1 到 100 时两条推理耗时曲线的分叉趋势;2. 再看右图工具数增大时无辅助模型两条准确率曲线的下跌与有辅助模型两条曲线的平稳;3. 对照左右图同一横轴确认效率与性能是同一工具规模实验的两面
论文图 4。原论文 Figure 4:“Comparison of inference efficiency and task accuracy with and without the auxiliary LLM across varying tool pool sizes.”。
左图归一化平均推理时间随工具数变化显示,无辅助模型时曲线随工具数指数上升,到 100 个工具时远高于有辅助模型的平稳线,仅在单工具时略低;右图任务性能显示无辅助模型的工具选择与参数填充在工具超过 25 后快速下跌,而有辅助模型的两条线保持平稳。这支持延迟与规模解耦的判断,但论文也报告辅助检索本身从 1.3 秒增到 2.6 秒,只是被并行掩盖,等待开销平均低于 15 毫秒,属于有限解释而非零成本。
真实语音、延迟与 token 开销的边界在哪里?
论文用 3 组特有细节验证边界:真实录制语音泛化、延迟规模解耦的运行时分解、token 级开销。真实语音实验抽 150 条跨域查询,构造含口吃、犹豫、噪声与正常语音的录制集与同文本合成集对照,合成集保证语义内容对齐以形成可比条件。下表把真实语音鲁棒性与延迟解耦放在同一视图,便于 1 次看清收益与代价,所有数值与单位写法与引文保持一致。
| 维度 | 评估对象 | 原文条件描述 | 原文数值与单位 | 结论指向 |
|---|---|---|---|---|
| 真实语音鲁棒性 | 任务成功率 | 真实录制语音含不流畅与噪声 | (86%) | 在真实条件下仍维持高成功率 |
| 延迟规模解耦 | 辅助检索延迟 | as the global toolset size grows from 10 to 100 | from 1.3s to 2.6s | 检索延迟随工具规模增长 |
| 延迟规模解耦 | 主智能体等待开销 | 主从并行执行下的等待时间 | (below 15 ms on average) | 等待开销始终可忽略 |
| token 级开销 | 语音输出占比 | THINK 占总生成 token 比例 | (approximately 12.6%) | 推理开销相对语音生成可忽略 |
| token 级开销 | 推理绝对量 | 推理 token 数量稳定性 | (approximately 80–90 tokens) | 不随工具库增大而增大 |
表后解释:真实语音下系统在不流畅与噪声输入下仍维持(86%) 的高任务成功率,推理机制在噪声与迟疑输入下保持稳定,合成评估略乐观但仍具参考性。延迟分解显示辅助检索延迟随全局工具从 10 增到 100 由 from 1.3s to 2.6s 变化,但主智能体等待开销为(below 15 ms on average),体现并行掩盖而非消除计算,任务执行延迟相对工具总数呈实际常数特性。token 分析显示语音输出时 THINK 占比为(approximately 12.6%),绝对量为(approximately 80–90 tokens) 且不随工具库增大,推理阶段引入的是有界常量开销而非规模化成本。论文在局限中承认先想后说必然带来计算开销,且 AgentChat 依赖成熟文本推理语料合成,语义结构偏书面而缺日常口语的自发与迟疑,未来需原生口语数据。
为进一步说明推理开销的有界性,下表单独整理语音与文本两种输出模式下的原文 token 描述,避免把不同模式的回答长度混为一谈,所有写法同样与引文保持一致。
| 输出模式 | 原文对象 | 原文数值与单位 |
|---|---|---|
| 语音输出 | THINK 占总生成比例 | (approximately 12.6%) |
| 文本与语音 | THINK 绝对量稳定性 | (approximately 80–90 tokens) |
| 延迟分析 | 主智能体等待开销 | (below 15 ms on average) |
表后补充解释:该补充视图强调语音输出场景下推理占比仅为(approximately 12.6%),绝对量稳定在(approximately 80–90 tokens),主智能体等待开销为(below 15 ms on average),三者共同说明推理与工具管理引入的是可预测的常量开销,延迟随工具规模解耦的结论不依赖于对回答长度的额外假设。
要复现先做什么,需要哪些数据与配置?
复现先做数据与评测两件事,再谈训练。数据侧需按论文重建工具交互与通用对话两类语料:对 ToolACE 与 APIGen-MT 做规则过滤去掉超文本与代码,再用语言模型口语化改写;通用侧选 ARC、GSM8K、SciQ 与教材中适合语音合成的子集;统一用 CosyVoice2 与多种音色合成,并为每条样本按逆向条件生成推理链,打分阈值 7 过滤,最多重试 3 次后压缩润色。缺少任一环节都会改变监督分布,复现时应先对齐过滤与打分提示。
训练侧关键超参数为批量 1 加累积 8、学习率 1e-5 余弦调度、权重衰减 0.01、梯度裁剪 1.0、AdamW、DeepSpeed ZeRO-3、bfloat16 与梯度检查点,硬件为 2 块 H20。数据配比建议从通用与智能体 1 比 1 与 1 比 0.5 两档起步,优先验证带推理的 1 比 0.5 是否复现峰值,同时监控 VoiceBench 是否出现无推理时的大幅退化。
评测侧必须实现先抽取再判分的严格流程:抽取工具名与参数名值,忽略格式空格引号;工具名大小写敏感且次数必须一致,否则直接判错;参数名忽略大小写空格,参数值精确匹配但允许引号与数值等价。每个输出评 3 次取平均。还需补的验证是真实录制语音与大工具池下的延迟测量,因为论文主表多基于合成语音与相对延迟,未测量误判率与端到端绝对延迟时不应承诺线上改善。
何时值得尝试这种先想后调的语音智能体?
当任务需要多步工具调用、参数必须精确且工具库较大时,值得尝试先显式推理再行动,并用辅助模型并行补工具。论文证据支持该组合在智能体综合分上超越直接回答的基座与部分闭源对照,且在工具数增至 100 时保持性能平稳,同时用推理缓解通用对话退化。
当任务只是单轮问答、工具很少或对首字延迟极敏感时,不必照搬全套机制,因为推理轨迹固定增加约 80 到 90 个 token,辅助检索本身也随工具规模增长,只是被并行掩盖。真实口语含口吃犹豫与噪声时会带来数个百分点的下降,部署前应在目标麦克风与噪声下重测。
一句话收束:把语音智能体理解为状态驱动的规划加执行闭环,推理解决想清楚,动态工具解决够得着,数据解决学得到,三者缺一都会回到直接映射的瓶颈。后续工作应补原生口语数据、绝对延迟与误调用代价的联合评估,再谈规模化落地。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



