📄 \(\tau\)-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

#语音交互 #基准测试 #语音大模型 #模型比较

9.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5

🔥 9.1/10 | 前10% | #语音交互 | #语音大模型 | #基准测试 #模型比较 | arxiv

👥 作者与机构

  • 第一作者:Soham Ray(Sierra.ai, USA)
  • 通讯作者:Victor Barres(Sierra.ai, USA; 另外 Soham Ray、Keshav Dhandhania 亦列通讯)
  • 作者列表:Soham Ray(Sierra.ai, USA)、Keshav Dhandhania(Sierra.ai, USA)、Victor Barres(Sierra.ai, USA)、Karthik Narasimhan(Princeton University, USA)

💡 毒舌点评

这是一个填补空白的有力基准工作,巧妙地将对话动态测量与硬核任务完成揉在一起,提出的离时钟时间解耦框架虽不惊天动地,但工程上有可贵的可控性。然而论文对语音生成质量本身不评估,且用TTS模拟真实口音的说服力打折扣,实验仅英文、集中三大闭源模型也限制了结论的泛化性。好在小众但尖锐的声学消融实验给无障碍评估敲了警钟。

📌 核心摘要

  1. 问题:现有语音代理评测要么只测对话动态,要么只测任务完成,没有同时结合真实音频环境、全双工会话和复杂工具调用。τ-Voice 扩展 τ2-bench,填补了这一空白。
  2. 方法核心:基于 tick 的仿真协调器,将仿真时间与真实时间解耦,使得用户模拟器可以用最强大的 LLM 而不受实时约束;并提供可配置的口音、背景噪声、丢帧、打断策略等音频环境。
  3. 新颖性:首个将可验证的任务完成(数据库状态比对)、全双工声学交互和可控的声学现实三者合一的语音代理基准。
  4. 主要实验结果:在 278 个任务上,GPT-5(reasoning)文本 pass@1 为 85%,最佳语音模型(grok-voice)干净条件下 51%,现实条件下 38%,是文本能力的 30-45%。口音是最大退化因素;79-90% 的失败归因于代理本身。
  5. 实际意义:为工业界语音代理的开发提供了标准化、可复现的评测床,并明确指出了当前语音模型在认证、拼写、多步任务跟随方面的具体短板。
  6. 主要局限性:仅英文、使用 TTS 模拟口音而非真实录音,未评估代理自身语音生成质量,用户模拟器的“完美记忆”和瞬时工具调用略高于真人用户。模拟器语音韵律真实感评分为 2.6/4,整体真实感 3.1/4。

🔗 开源详情

  • 代码:https://github.com/sierra-research/tau2-bench
  • 模型权重:论文中未提及(评估使用商业闭源API:OpenAI gpt‑realtime‑1.5、Google gemini‑live‑2.5‑flash‑native‑audio、xAI grok‑voice‑agent,无公开权重)
  • 数据集:基于 τ2‑bench 的 278 个任务(Retail 114、Airline 50、Telecom 114),添加语音端用户指令后构建,未单独发布新数据集;任务配置、用户指令、语音人物(personas)系统提示、音频效果配置、turn‑taking 与 backchannel 决策提示、代理系统提示等均可通过上述代码仓库获取
  • Demo:论文中未提及
  • 复现材料:代码仓库包含完整的全双工编排器、语音用户模拟器、仿真参数(tick 时长、turn‑taking 阈值)、音频效果配置(背景噪声、突发噪声、帧丢失、电话压缩等),详细附属配置见论文附录 A‑I。模拟器 TTS 使用 ElevenLabs v3(需用户自行提供API密钥)。
  • 论文中引用的开源项目:
    • τ‑bench(Yao et al., 2025):https://openreview.net/forum?id=roNSXZpUDN
    • τ2‑bench(Barres et al., 2025):https://github.com/sierra-research/tau2-bench
    • Full‑Duplex‑Bench(Lin et al., 2025):https://arxiv.org/abs/2503.04721
    • Full‑Duplex‑Bench‑V2(Lin et al., 2026):https://arxiv.org/abs/2510.07838
    • TalkingTurns(Arora et al., 2025):https://openreview.net/forum?id=2e4ECh0ikn
    • VoiceBench(Chen et al., 2026):https://direct.mit.edu/tacl/article/doi/10.1162/tacl.a.628/136245
    • VocalBench(Liu et al., 2026):https://arxiv.org/abs/2505.15727
    • Audio MultiChallenge(Gosai et al., 2025):https://arxiv.org/abs/2512.14865
    • VoiceAgentBench(Jain et al., 2026):https://arxiv.org/abs/2510.07978
    • AudioBench(Wang et al., 2025a):会议论文 (NAACL 2025)
    • ParaS2S(Yang et al., 2026):https://openreview.net/forum?id=CcmDDh070o
    • WildSpeech‑Bench(Zhang et al., 2025):https://arxiv.org/abs/2506.21875
    • Moshi(Défossez et al., 2024):https://arxiv.org/abs/2410.00037
    • LLaMA‑Omni(Fang et al., 2025):https://openreview.net/forum?id=PYmrUQmMEw
    • SALMONN‑omni(Yu et al., 2025):https://openreview.net/forum?id=AsRB5nmlOD
    • MiniCPM‑o 4.5(OpenBMB, 2026):https://huggingface.co/openbmb/MiniCPM-o-4_5
    • Qwen3‑Omni(Xu et al., 2025):https://arxiv.org/abs/2509.17765
    • PersonaPlex(Roy et al., 2026):https://arxiv.org/abs/2602.06053
    • NTPP(Wang et al., 2025b):https://arxiv.org/abs/2506.00975

🏗️ 方法概述和架构

τ-Voice 构建了一个面向全双工语音代理的评估框架,它扩展自 τ2-bench,将文本交互替换为可控的语音流,同时复用其任务场景(零售、航空、电信共278项)和数据库验证。整个系统由三大部分组成:全双工协调器、语音用户模拟器和多维度评估指标。

[图像补充] 图1(原文图2)展示了τ-Voice的整体框架示意图。它基于τ2-bench(灰色部分),新增了语音专用组件(绿色部分):一个可配置的语音用户模拟器、一个离散化为仿真 tick 的全双工音频流通道,以及用于添加新语音API的模型适配器。任务基础设施(指令、工具、数据库、域策略)则被继承。

全双工协调器(Tick-based Orchestrator):核心创新是将仿真时间离散化为固定时长(默认 200ms)的“tick”,每一 tick 双方交换 τ ms 的音频,实现真正的全双工。协调器通过与真实时间解耦,使得用户模拟器使用的 LLM 可以超越实时约束,保证了指令跟随的可靠性。音频流的处理采用缓冲机制:生成的音频若未对齐 tick 边界则进入缓冲区,发生打断时缓冲区清空,从而精确截断代理正在说的话;同时,代理返回的文本按音频时长比例分配到各 tick,保证转录时序对齐。时间上重叠的语音通过线性化算法转为顺序文本,供用户模拟器 LLM 读取。关键设计动机是为了获得可控性、可复现性,同时允许消融实验精确调整打断、背景噪声、帧丢失等参数。

[图像补充] 图9更详细地展示了Tick-based协调器的工作流程。它清晰地描绘了每个Tick内发生的事件:代理产生音频(可能不完整)、进入缓冲区、用户产生音频、协调器接收双方音频、缓冲区处理(针对中断)、以及最终将双方的“文本转录”传递给“用户模拟器 LLM”。这完美地视觉化了主模型文字中提到的“缓冲机制”、“打断时缓冲区清空”以及“代理返回的文本按音频时长比例分配到各 tick”等细节。

语音用户模拟器:该模块负责生成真实的呼入用户音频,其流水线包含4步。(1) 文本生成:用户 LLM(默认 GPT-4.1)根据场景指令生成含自然不流利、填充词、逐字母拼写特殊字符的自然语言回复。(2) 语音合成:7 种 TTS 人格(ElevenLabs)分别代表美式及多种口音(孟加拉、四川普通话、法音英语等),并通过风格 prompt 控制语音韵律。(3) 音频环境模拟:混合连续背景噪声(室内/室外)和泊松脉冲式突发噪声,叠加丢帧(Gilbert-Elliott 模型,平均 2% 丢包率)、G.711 μ-law 8kHz 电话压缩、动态消声效果,并插入离向语音(如“hold on”)和非言语声音(咳嗽、喷嚏)。(4) 对话动态策略:用户模拟器基于 LLM 决定打断、回传频道、让出话轮,默认设定包含 1.0 秒静默阈值后回复,每 2 秒检查打断和回传频道。该模块允许研究者单独开启或关闭噪声、口音、打断等因素。模拟器默认通过直接读取代理的文本转录(而非ASR)来感知代理话语,以将评估聚焦于代理的语音交互与决策,但同时也提供了ASR模式作为端到端的压力测试选项。

[图像补充] 图4用时间线形式直观地解释了对话动态策略中的“打断”机制。它展示了代理和用户的时间线,并明确标注了“代理正在说话(音频产生)”、“用户打断(开始说话)”、“协调器检测到用户打断”、“协调器清空代理缓冲区”等关键步骤。这帮助理解主模型提到的“发生打断时缓冲区清空,从而精确截断代理正在说的话”这一过程。

评估指标:分为任务完成和语音交互质量两方面。任务完成沿用 τ2-bench 的 pass@1,直接比对数据库最终状态与黄金标准。语音交互质量涵盖延迟(反应延迟、让出延迟)、响应性(回应率、让出率)、打断(代理打断率)和选择性(对回传频道、非言语声、非定向语音的正确忽略率)。此外还进行了定性失败分析,将源于代理的错误归纳为拼写、对话接地、诚实、多部请求跟踪等通用会话技能类错误。

整体架构在文本侧提供半双工通道处理工具调用,在音频侧维持全双工流;一个关键细节是模拟器默认直接读取代理的文本转写而非再次 ASR,从而将评测聚焦于代理的语音交互与决策,但同时也提供了 ASR 模式作为端到端的压力测试选项。

💡 核心创新点

  1. 将任务完成和全双工对话动态统一到同一评测框架:以往 τ-bench 只测文本下的工具使用,Full-Duplex-Bench 只测对话动态而不涉及真实 API 调用;τ-Voice 首次在含数据库状态变更的客户服务任务上同时评估这两种能力,揭示了语音模态下任务完成的大幅退化。
  2. 可控的声学环境消融:框架支持独立开关口音、背景噪声、电话压缩、打断等因素,使研究者能精确定位哪些声学现实因素对代理性能损害最大,得出口音是最脆弱维度的结论。
  3. 解耦仿真时间解决 LLM 模拟器瓶颈:通过基于 tick 的调度,用户模拟器 LLM 不必实时响应,从而能使用更强模型(如 GPT-4.1)来产生复杂的、语境相关的打断和回传频道决策,在保持交互逼真度的同时提升了模拟器的可控性和指令跟随质量。
  4. 大规模跨域对比和定性错误分类:在 278 个任务上对三个领先的全双工音频原生模型提供详细对比,并通过人工定性分析将 94.8% 的代理失败归因于通用会话技能(拼写、接地、诚实)而非领域策略知识,指出了当前语音模型在基础会话能力上的共性短板。

📊 实验结果

[图像补充] 图2是数据库状态验证的示意图,它直观展示了τ-Voice任务的核心流程:从初始数据库状态,经过用户陈述意图、代理执行操作(可能成功或失败),到最终数据库状态的转变,并与黄金标准进行比对。这清晰地解释了pass@1指标的计算依据。

主要 pass@1 结果(文本 vs 语音)

模型/条件All 平均RetailAirlineTelecom
GPT-5 (reasoning) 文本85%81%83%90%
GPT-4.1 文本 (non-reasoning)54%76%53%34%
gemini-live-2.5 (干净)31%45%28%20%
gemini-live-2.5 (现实)26%30%30%18%
gpt-realtime-1.5 (干净)49%71%48%28%
gpt-realtime-1.5 (现实)35%45%40%21%
grok-voice (干净)51%48%46%58%
grok-voice (现实)38%39%36%40%

消融实验(Retail 域)

条件gemini-live-2.5gpt-realtime-1.5grok-voice平均
干净45%71%48%55%
+噪声40% (-5pp)67% (-4pp)46% (-2pp)51% (-4pp)
+口音44% (-1pp)60% (-11pp)30% (-18pp)44% (-10pp)
+交互动态33% (-11pp)57% (-14pp)52% (+4pp)47% (-7pp)
现实 (全部)30% (-15pp)45% (-26pp)39% (-10pp)38% (-17pp)

[图像补充] 图5以柱状图的形式可视化了消融实验的结果。它清晰地显示了从“Clean”基线开始,逐一添加“Noise”、“Accent”、“Interactive Dynamics”直至“Full Realistic”条件后,三个模型(以及平均)的pass@1分数如何逐步下降。这使得“口音(Accent)导致的性能下降在grok-voice上尤为剧烈”以及“交互动态(Interactive Dynamics)对gemini和gpt负面影响更大”等结论一目了然。

语音交互质量(现实条件,全域平均)

模型响应延迟↓响应性↑打断率↓选择性↑
gemini-live-2.51.14s69%21%54%
gpt-realtime-1.50.90s100%14%6%
grok-voice1.15s83%84%57%

[图像补充] 图6使用雷达图对比了三个模型在四个语音交互质量维度(延迟、响应性、打断率、选择性)上的表现。这种呈现方式非常直观,例如可以立刻看出gpt-realtime-1.5在“延迟”和“响应性”两个轴上表现优异,但在“选择性”轴上表现极差,与表格数据完全吻合,并提供了更易比较的全局视图。

关键发现:

  • gpt-realtime-1.5 延迟最低(0.90s)、响应最佳(100%)但选择性极差(6%),几乎对所有回传频道和非定向语音反应。
  • grok-voice 选择性最佳(57%)但打断率极高(84%)。
  • gemini-live-2.5 打断最低(21%)但响应不足(69%)。
  • 统计显著性分析显示,文本→现实语音和干净→现实语音的差距对所有三个模型均显著(所有 \(p \leq 0.002\))。
  • 失败分析:79% 的干净条件失败和 90% 的现实条件失败来自代理自身,且 94.8% 的代理失败映射到拼写、对话接地、诚实等通用会话技能,仅 5.2% 与领域特定知识相关。

[图像补充] 图7是失败原因分类的饼图。它直观地将“通用会话技能”错误(占比高达94.8%)细分为了“拼写/格式”、“对话接地”、“诚实性”、“任务跟踪”等子类别,而将“领域特定知识”错误(仅占5.2%)单独列出。这强有力地支持了“失败主要源于基础会话能力不足”的核心结论。

🔬 细节详述

  • 训练数据:本论文未训练新模型,因此无训练数据。评估使用的语音模型均为闭源 API。
  • 损失函数/训练策略/关键超参数/训练硬件:均不适用,未提供模型训练细节。
  • 推理细节:评估时使用各供应商的实时全双工 API(OpenAI Realtime、Gemini Live、xAI Grok Voice Agent)。模拟器端 TTS 为 24kHz ElevenLabs v3。协调器 tick=200ms,最大会话时长1200秒,打断/回传频道检查间隔2秒,安静等待回应阈值1秒,让出时间1秒(被中断时)和5秒(中断他人时)。模拟器 LLM 为 GPT-4.1。实验运行两次以评估统计显著性,使用配对置换检验(100k次)并进行了 Holm-Bonferroni 校正。

[图像补充] 图3以音频波形图直观地展示了音频环境模拟中的两个关键效果。左侧是原始干净语音,中间是添加了背景噪声后的波形(可以看到噪声填充),右侧是经过电话压缩(G.711 μ-law 8kHz)后的波形(可以看到明显的频带限制和幅度变化)。这生动地说明了主模型提到的“混合连续背景噪声”和“G.711 μ-law 8kHz 电话压缩”对原始语音信号的改变。

  • 正则化或稳定技巧:不适用。
  • 模拟器真实感验证:对60个模拟对话进行人工评估,两个独立标注员在1-4分量表上评分。模拟器总体平均分3.1/4,83%的评分在3分或以上。回传频道自然感得分最高(3.5/4),语音韵律得分最低(2.6/4)。

⚖️ 评分理由

  • 创新性 (1.5/2):将任务完成基准与全双工语音交互系统结合并引入可控声学环境,在语音代理评测领域是明显的新方向,解决了以往“单一维度”评测的局限性。解耦时钟时间的设计虽似简单但带来很高的可控性和复现性。不过各个组件(tick 调度、TTS 模拟用户、噪声布置)均非首发技术,创新性更偏向系统工程整合而非方法原理突破,故给1.5。

  • 技术严谨性 (1.2/1.5):评测框架设计考虑周全,包括缓冲机制、线性化、声学效果参数化等,提供了详细的参数表和形式化缓冲公式。但存在一些依赖“工程正确”但未严格验证的部分,如模拟器通过文本转写而非 ASR 接收代理话语,这在干净条件下相当于假设完美转录,低估了声学-语义联合退化。虽然论文在附录H.7中提供了ASR模式初步实验,但该环节仅单次运行且未正式分析。用户模拟器的 LLM 决策的可靠性虽进行了小规模拟人感验证,但样本有限(60个模拟),且“语音真实感”仅3.1/4分,对某些微妙交互行为(如虚假打断)的保真度存疑。

  • 实验充分性 (1.3/1.5):三个域 278 项任务规模适中,对比了三个主流全双工 API,有文本基线(GPT-5 reasoning 和 GPT-4.1)以及逐因素消融,且进行了严格的统计显著性检验(配对置换检验,Holm-Bonferroni校正)和定性失败分析(双人标注,84%一致性),实验设计较为完整。不足在于:未与级联式语音代理(ASR→LLM→TTS)作对比,无法分离端到端模型的模态特有影响;ASR 模式下仅有一个小规模初步实验;实验只覆盖英文,口音通过 TTS 模拟而非自然语音记录,生态有效性有待进一步验证。

  • 清晰度 (0.9/1):论文结构清晰,图表和表格充分(如 architecture 图、timeline 图、各维度对比表),对 τ2-bench 的继承和新增部分描述清楚。附录包含了提示词全文和详细的参数表,有助于复现。缺点在于部分核心设计(如线性化算法)仅在附录中给出,正文提及过简;同时大量采用记号符号但个别地方解释不够直观(如中断率 >100% 的含义)。整体可读性良好。

  • 影响力 (1.2/1.5):这项工作瞄准了当下语音代理落地中的评测真空,对开发全双工客户服务系统的工业界和研究界均有直接参考价值,体现在它带来了具体的失败分析、声学脆弱性洞察(口音导致严重性能下降,有明确的无障碍启示)以及公开的基准测试框架。来自 Sierra.ai 的生产背景使该基准更贴近实际部署。局限性在于基准场景较传统(客服),且限于英文和三个闭源模型,跨语言和开源自部署模型的推广还需后续工作。因此影响力给1.2。

  • 开源 (1.2/1.5):论文中提供了代码仓库链接(https://github.com/sierra-research/tau2-bench)并说明开源,代码确实可用。数据集(任务场景、模拟设定、语音人物提示)随代码/配置一同提供。但未提供预训练模型权重(评估均使用商业闭源API)。文档和 README 状况论文中未详述,但从链接名称推断应有一定说明。因此核心内容(代码+任务框架)已开源,但权重缺失,扣分至1.2。

  • 可复现性 (0.4/0.5):提供了完整的模拟器参数表、主要提示词、音频效果配置和评价指标定义,总体细节详尽。附录包含完整的用户模拟器和代理系统提示词。缺少的是各评估 API 调用的具体成本/延迟细节和具体声学处理库的版本信息,但已足够让研究人员复现框架、更换模型。未给出实际运算环境和运行时间统计数据,但主要依赖 API 调用,影响较小。可复现性较高。

  • 工程/实践价值 (1.4/1.5):这是一个工程密集型系统基准,包含全流水线模拟、声学效果注入、全双工时间管理,对工业界语音代理评测有很强的指导性。很多工程抉择(如 tick 调度、可配置环境、解耦真实时间)可直接被产品团队借鉴。因此工程价值很高,但因未提供直接的生产级部署方案(仅为评测框架),稍扣 0.1。

🚨 局限与问题

论文明确承认的局限:

  • 仅支持英文且使用 TTS 模拟口音,口音发现应视为指示性而非定论。
  • 评估范围不包括代理语音生成质量(音色、自然度)、用户满意度或部分任务成功。
  • 模拟器“比真实用户更有耐心,具有完美记忆和瞬时工具调用”,语音韵律真实感评分较低(2.6/4)。
  • 未来需要非英语语言、人类用户验证和级联式 ASR-LLM-TTS 基线。

审稿人发现的潜在问题:

  1. 默认配置假设过于理想:默认配置使用文本转录绕过 ASR 对代理语音的识别,这相当于在干净条件下假设完美转录,可能低估了声学-语义联合退化,导致基准估算上界过于乐观;即使在 ASR 模式试验中观察到相似趋势,但该环节仅进行了单次非正式运行,缺乏正式分析和统计检验,说服力有限。
  2. 模拟器行为的文化真实性与“最小简洁”指令的张力:模拟器 LLM 指令中明确要求“最小简洁”(MINIMAL VERBOSITY),使用1-2个词的简短回答,这一设定虽有助于压力测试,但可能与真实人类打电话时的多样性行为模式不一致。不同文化、性格的用户可能有完全不同的对话习惯,而当前框架未体现这一点。
  3. 实验未包含级联式基线:论文解释了未包含级联式 ASR→LLM→TTS 基线的操作性原因(聚焦于音频原生模型),但缺乏这一关键参照系,读者无法量化全双工音频原生架构相对于传统级联方案在任务完成上的增益或损失。
  4. 失败归因可能过度简化:将 94.8% 的失败归因为通用会话技能虽然与结论一致,但可能存在过度简化:某些失败可能源于声学压缩导致的多模态错误传播(如ASR错误引发下游连锁错误),而非纯粹的对话策略缺陷。目前的归因方式将所有转录、拼写问题均归为“通用技能”,可能模糊了语音模态特有的错误传播机制。
  5. 商业闭源模型的版本锁定与可复现性危机:基准对比的三个模型均为闭源商业API,其底层模型版本持续更新。论文发表时的结果可能在短时间内即失去可比性,这对长期基准跟踪构成挑战。题目和结果表格中使用的模型名称(如 gemini-live-2.5-flash-native-audiogrok-voice-agent)在未来的API文档中可能已被弃用或变更。

← 返回 ICML 2026 论文速递