英文题目:From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

会议身份:conference:interspeech:2026:conference-paper-id:xu26k_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #语音 #语音交互

评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Ke Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuhao Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu Wang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

主动式语音交互(proactive voice interaction)要求智能体在连续对话音频 \(Ca\) 与手机数字上下文 \(Dc\) 中自行判断是否介入,并输出工具调用 \(Tp\) 与文本回应 \(Rp\),难点在于隐式意图推断、长时静默监听与言语和记录矛盾的联合推理。本文构建五阶段合成流水线,先由 Qwen3-Max 按对话主题合成移动应用状态,再合成触发场景与双人对话脚本,经 CosyVoice3 语音合成与声学仿真拼装为自然音频,最后配以语义线索 \(Sc\) 与标准答案 \(Tg,Rg\) 形成五元组样本。与既有被动问答基准相比,该设计将显式指令改为条件触发与知识纠错,迫使模型同时完成何时说话与说什么的决策。在包含 1182 个正负平衡样本的 ProVoice-Bench 上,Step-Audio-R1(T) 33B 总体准确率(Overall Acc)为 0.793,Qwen3-Omni(T) 30B 为 0.787 且总体响应准确率(Overall Racc)以 0.759 反超,思维链显著降低监听类任务误触发但环境声感知仍弱。该结论仅适用于合成英语对话与给定数字上下文,尚无真实远场录音、跨语言与在线打断时延验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

这篇解读的输入是会议论文正文与 3 张官方原图像素,目标是让刚进入语音与音频方向的研究生能复述方法与实验条件。必须保留的信息包括 4 个任务的定义、每个样本由对话音频、数字上下文、语义线索、工具调用真值与文本回复真值构成的五元组、5 阶段合成流程的关键操作与参数、以及评测指标的方向与主要数字。

输出按学习依赖展开,先讲为什么被动应答不够,再讲任务划分与相关路线,然后走完一个样本从输入到输出的全过程,最后讲实验条件、结果与可复现细节。阅读时请把主动理解为两件事,一是判断现在该不该说话,二是说话时工具调用与回复内容是否准确。论文共整理出 1182 条高质量样本,正负样本兼顾,用来同时考克制与敏感。后续所有数字都回到原文核对,不引入外部评价。

已有语音智能体与主动智能体分别走到了哪里?

论文把背景分成两条线。第一条是多模态大模型驱动的语音智能体,它们能感知音频并生成自然语音,也能借助文本能力做推理、规划与工具使用,但交互范式主要是被动的,也就是只有收到明确指令才回应。这类工作让交互更自然,但不能从隐含需求或特定触发点出发主动提供帮助。第二条是主动智能体,强调人类对话本身具有主动性,会根据对上下文与环境的持续评估灵活介入,例如听到犹豫时提供帮助,或听到预设的闹铃声时触发提醒。

已有探索如 ContextAgent 与 ProAgent 更关注视觉线索,较少挖掘音频模态的丰富信息,且多局限于隐式线索,没有系统探索用户自定义触发点的范式。ProVoice-Bench 的定位就是补上音频与数字上下文结合的主动评测,重点不是把语音识别做得更准,而是测在连续监听中何时保持沉默、何时打断或行动。

四个主动任务到底要模型做什么?

论文提出 4 个任务,覆盖从语言理解到环境感知的不同触发来源。第一个任务是主动意图捕捉,要求模型从犹豫或讨论中的未来行动项等细微语言线索推断隐式意图,主动发起工具调用请求并向用户确认,部分请求还需要结合数字上下文才能保证操作准确,例如从柏林酒店需求中补全日期与城市。

第二个任务是潜在主题监听,用户事先要求模型监听周围对话,模型平时保持沉默,只在对话者 speech 中出现用户指定的语义触发时才介入,例如听到特定饮品名称就记入生日派对笔记。第 3 个任务是上下文事实核查,当口头陈述与手机上的数字上下文矛盾时,模型要主动打断并给出事实纠正,例如把改签说成无安排但消息历史明确写有探戈演出。

第 4 个任务是环境声音感知,模型在听到用户预设的特定声学事件前保持沉默,听到后才提供帮助,例如听到火车声提醒放下书准备上车。形式化上,智能体把对话音频与数字上下文映射为工具调用请求与文本回复,每个样本再配语义线索与两类真值,用于评测触发判断与回复质量。 下面这张总览图把 4 个任务的输入形态与期望输出并排展示,读懂它就抓住了全篇任务划分。

看图路径: 1. 先看左上与右上面板中用户指令与触发内容的位置关系;2. 再看左下面板中口头陈述与消息历史矛盾点的表述方式;3. 最后看右下面板中环境声出现时模型回复的动作指向

原论文 Figure 1:Overview of the four designed tasks in ProVoice-Bench.

论文图 1。原论文 Figure 1:“Overview of the four designed tasks in ProVoice-Bench.”。

图中上方面板为潜在主题监听,用户先给出若提到特定饮食就记入生日派对笔记的指令,对话者随后提到 Sparkling Hibiscus Ginger Ale,模型随即生成记笔记工具调用并追问是否查找供应商联系方式,完整呈现了静默监听到条件触发再到确认的链路。下方面板为环境声音感知,用户先声明听到火车就提醒准备上车,中间出现火车声音标记,模型直接说听到 approaching train 并提示收书准备上车,说明非语音声学事件同样可以作为合法触发。两块面板并排说明主动既包括语义条件触发,也包括声学事件触发。

为什么克制比敏感更难,误触发从哪里来?

从任务设计看,敏感只要求在触发出现时不漏掉,克制要求在大量无触发时刻保持沉默。潜在主题监听的难点是周围对话会提到大量相关但不满足用户定义条件的实体,模型容易把语义相关当成触发。上下文事实核查的难点是需要逐句对照数字记录,模型容易在没有矛盾时仍过度联想。环境声音感知的难点是声学事件稀疏且易被噪声掩盖,模型可能把背景声当成信号或反之。

论文观察到的高误触发率说明当前多模态模型偏向宁可说话也不沉默,这在被动问答中不是大问题,但在主动监听中会频繁打扰用户。教学例子是生日派对笔记任务,只有当特定食品饮料被提及时才应记录,若把任何食物词都记录就是典型的过度触发。理解这一点后,就能明白为什么基准要设置负样本,以及为什么误触发率必须与召回率并列报告。

从数字状态到可播放音频的全景流程是什么?

论文用 5 阶段流水线合成数据,目的是得到语义可控且听感自然的连续对话音频。第一步构造数字状态,随机选择主题后用大模型合成细粒度的移动应用状态,包含约会时间、饮食限制等隐式线索,为后续是否值得介入提供依据。第二步做场景合成,大模型结合数字状态、指定任务类别与可用工具,生成触发线索、对话背景描述与显式时间元数据,确保相对时序可被模型解读。

第三步生成对话,把高级场景实例化为详细脚本,再用语音合成引擎与按性别匹配的提示音频生成语音段,其中环境声音感知任务会混入来自环境声音数据集的特定事件。第四步做声学仿真,统一响度并模拟远场与混响。第五步做对话拼接,按截断高斯分布采样轮替间隔并加入众包场景噪声,模拟真实声场。整个流程沿一个样本走就是状态给出约束,场景决定触发点,脚本与合成给出声音,仿真与拼接给出连续感,最终形成可用于判定该不该说话的输入。

下图左侧给出 4 个任务的样本分布,右侧给出 5 个阶段的流转,是复述方法时最值得对照的一张图。

看图路径: 1. 先看左侧饼图中正负样本在四个任务上的大致配比;2. 再沿右侧五个方框追踪从数字状态到最终音频的箭头顺序;3. 最后核对声学仿真框内归一化、远场与混响三个子步骤

原论文 Figure 2:ProVoice-Bench data synthesis overview.

论文图 2。原论文 Figure 2:“ProVoice-Bench data synthesis overview.”。

从像素可见,右侧流程从数字状态示例中的家庭地址与当前位置出发,经过场景合成形成打车需求,再到对话生成中用户说不知道怎么回家,模型给出从办公室到家的打车工具调用与确认问句,链路完整。第四步明确标出归一化、远场与混响 3 个子操作,第五步标出拼接与背景声两个子操作,说明自然感是靠显式声学处理而非仅靠文本脚本实现的。左侧饼图同时显示正负样本划分,意味着评测不仅看能否抓住触发,也看无触发时能否忍住不说,这直接对应后文误触发率指标的设计动机。

数字状态与场景如何决定触发线索?

数字状态构造是整个合成的地基。论文采用应用状态格式模拟真实且语义丰富的数字上下文,生成过程从对话主题数据集中随机选主题,再用 Qwen3-Max 合成细粒度状态。这些状态不是装饰,而是后续判断的依据,例如已有的演出安排决定了改签陈述是否构成矛盾,家庭地址决定了打车工具调用的目的地是否正确。场景合成阶段,大模型分析数字状态中的隐式信息,构造自然且无歧义的任务场景,输出包括触发线索、对话背景与时间元数据。

触发线索指明何种用户动作或环境输入应引起主动响应,背景描述交代人物关系与场合,时间元数据保证模型能分辨事件先后。教学上可以这样理解,数字状态提供事实答案,场景提供出题方式,对话音频提供题面,模型要在题面中发现与事实或指令对应的信号。

对话音频 × 数字上下文: 对话音频负责给出说了什么和怎么说的线索,数字上下文负责给出手机应用状态等可核对事实,二者搭配的理由是仅听声音无法判断是否与事实冲突或是否具备执行条件,组合后智能体才能同时完成时机判断与动作 grounding。

语义线索 × 工具调用请求: 语义线索是触发主动交互的关键信号说明,工具调用请求是模型决定介入后要执行的机器动作,前者分工是让评测知道为什么该说,后者分工是让评测知道要做什么,二者搭配才能区分知道何时说话与知道做什么事。

沿样本走一遍,输入是包含 2 人轮替的对话音频与包含地址、日程的应用状态,表示是模型对语音内容与数字事实的联合理解,组件是触发判断与工具调用生成,目标是输出工具调用请求与文本回复,输出只有在语义线索成立时才应出现。这种设计把可解释性留给了语义线索,评测时裁判模型也是以它为上下文判断预测输出与真值在功能上是否合理。

走通一个打车样本:输入如何变成工具调用?

以总览流程中的打车例子串起全链路。输入是两段对话音频与包含家庭地址与当前位置的数字状态,用户说面试后想回家但不知道怎么回。表示阶段模型需要理解回家意图与当前位置到家庭地址的位移需求,同时确认数字状态中有明确的目的地。组件阶段先做触发判断,此时存在隐式用车需求且无否定条件,应判定为需要介入,再生成打车工具调用并补全起点与终点。目标是工具调用参数准确且回复先说明能帮忙打车再向用户确认,避免直接下单。

输出包括工具调用请求与确认问句,评测时裁判模型对照语义线索检查起点终点是否来自数字上下文、意图是否来自语音。若把数字上下文拿掉,模型可能仍能猜到要打车,但目的地只能幻觉,这正是消融中意图捕捉性能下降的机制。

隐式意图指从犹豫或未来行动讨论等细微语言线索中推断的未明说需求,由模型主动发起工具调用来承接;用户定义触发点指用户事先声明的语义主题或声学事件条件,模型平时保持沉默只在条件满足时介入。两者分工在于前者考验语言理解与意图补全,后者考验条件监听与克制触发,组合起来才能覆盖从语言理解到环境感知的不同触发来源,完整刻画何时介入与如何执行。

隐式意图 × 用户定义触发点: 隐式意图分工是要求模型从犹豫、未来安排等模糊表达中推断需求,用户定义触发点分工是要求模型在被明确告知条件下保持静默直到条件出现,二者搭配的理由是前者考理解能力后者考克制能力,组合后才构成完整的主动性。

本研究训练了什么,没有训练什么,真实计算在哪里?

本研究没有训练新的语音模型,也没有报告梯度路径、参数冻结或优化器配置,训练节在此的职责由数据构造与评测计算承担。真实计算分为 3 类。第一类是文本生成计算,用大模型生成数字状态、场景与对话脚本,调用时需要给定主题、任务类别与可用工具,输出结构化的触发线索与脚本。第二类是语音与声学计算,用 CosyVoice3 与随机采样的种子语音作为音色提示,按性别匹配角色生成语音段,再做响度归一化、远场滤波、混响卷积与拼接混噪,得到连续波形。

第 3 类是评测计算,用被测多模态模型对每个样本输出是否介入、工具调用与回复文本,再用裁判模型对工具调用精度与语义对齐打分。需要明确的缺项是论文未给出合成所用大模型的具体采样参数,也未报告人工质检比例与通过率,因此不能把 1182 条理解为 1 次生成即得,也不能从调用既有模型推定输出确定。复现时应把重点放在流水线可执行性,而非模型权重训练。

远场仿真 × 对话拼接: 远场仿真分工是让第二说话人的声音带上距离感与混响,对话拼接分工是按高斯间隔把语音段连成自然轮替并加入环境噪声,二者搭配的原因是单句合成过于干净,组合后才能得到可用于测试环境感知与打断时机的连续音频。

测什么、和谁比、在什么条件下比?

评测要回答两个问题,一是能不能在正确时机说话,二是说话后做得对不对。第一个问题用主动交互预测指标,包括总体二分类准确率、误触发率与召回率。准确率越高越好,误触发率衡量无有效触发时不必要的介入频率,越低越好,召回率衡量对真实触发的敏感度,越高越好。第二个问题用回答准确率,每个样本把工具调用精度与语义回复对齐各按 0、0.5、1.0 打分后取平均,再乘以触发判断是否正确的指示函数,最后在全部样本上取算术平均。

裁判模型为 Qwen3-80B,以语义线索为评价上下文。被测模型包括 Mimo-Audio、Qwen3-Omni、Step-Audio-R1 与 Qwen2.5-Omni,部分带思维链思考模式,参数量从 7B 到 33B 不等。论文报告评测覆盖 4 个任务的正负样本,强调触发判断正确是得分前提,判断错则该样本得零分,这使得过度触发与漏触发都会直接拉低回答准确率。

主动交互预测 × 回答准确率: 主动交互预测只判定该不该介入,用准确率、误触发率和召回率衡量,回答准确率进一步判定介入后工具调用与文本回复是否对齐语义线索,二者搭配的原因是只测开关会掩盖语义漂移与幻觉工具调用,组合后才能暴露决策到执行的落差。

理解指标方向很关键,误触发率低不等于召回率高,模型可以靠少说话降低误触发,但会牺牲召回。后文结果正是围绕这对矛盾展开,思考模式的作用也要放在这个权衡下看。

主结果显示了什么权衡,谁在何处占优?

论文报告的主要现象是普遍的过度触发倾向,尤其在潜在主题监听与上下文事实核查任务中,多数模型无论是否存在真实触发都倾向于回应,说明克制比敏感更难。思维链带来明显改善,在需要分析数字上下文或语音中隐式线索的任务上,思考模式的准确率与回答准确率普遍高于非思考模式,并且有助于弥合决定介入与执行正确回复之间的差距。

第 3 个现象是知道何时说话与知道做什么之间存在落差,模型常出现语义漂移或幻觉工具调用,表明上下文感知与环境感知仍是短板。从可运行策略看,带思考的 Qwen3-Omni 与 Step-Audio-R1 在总体上处于较好位置,但不同任务各有代价,例如非思考的 Step-Audio-R1 召回很高但误触发也很高,属于以频繁介入换取少漏报。阅读时不要把总体趋势当成每组都成立,具体任务的准确率、误触发率与召回率需要分开核对。

下面整理声学仿真与拼接阶段的原文参数,说明自然感是如何用具体数值实现的,表中单位保留原文写法。

条件指标基线本方法比较对象
响度归一化目标有效值未归一化提示音频−20 dBFS全部合成语音
远场高频搁架滤波近场原声−3 dB 在 4 kHz第二说话人
远场能量衰减近场原声4 dB第二说话人
混响混合湿干比干声0.3远场语音
通用轮替间隔高斯参数无(0.75, 0.35, −1.5, 2.5)s通用对话
环境感知间隔高斯参数无(10.0, 1.66, 2.5, 20.0)s环境声音感知任务

该表提出的问题是声学真实感是否可复现,公平条件是同一套归一化与远场处理同时作用于合成语音,指标方向是参数越接近原文越利于复现对比。

主要收益是给出可直接设置的数值,代价是混响所用随机房间冲激响应的具体种子与噪声片段选择未完全固定,复现时只能做到分布一致而非波形一致。未胜出项在此体现为通用间隔允许负值表示的重叠语音只用加性混合处理,对真实打断的韵律建模仍然简化。 随后整理带思考模式与基线在触发判断上的关键数字,单位为原文裸值,方向是召回与准确率越高越好,误触发率越低越好。

条件指标基线本方法比较对象
上下文核查召回0.3220.737Qwen2.5-Omni 对比 Qwen3-Omni 思考模式
上下文核查准确率0.4470.838Qwen2.5-Omni 对比 Qwen3-Omni 思考模式
上下文核查回答准确率0.3280.826Qwen2.5-Omni 对比 Qwen3-Omni 思考模式
潜在主题监听准确率0.6320.832Qwen2.5-Omni 对比 Qwen3-Omni 思考模式
总体准确率0.6200.787Qwen2.5-Omni 对比 Qwen3-Omni 思考模式
总体回答准确率0.4840.759Qwen2.5-Omni 对比 Qwen3-Omni 思考模式

该表比较的是可实际运行的开源多模态模型,条件一致为同一基准与同一裁判模型。

主要收益是思考模式在核查类任务上提升显著,代价是推理开销未在原文量化,且 Step 类模型的非思考版本显示高召回伴随高误触发,说明只看召回会误判能力。未胜出项是 7B 量级的 Qwen2.5-Omni 在多个任务上落后,表明参数量与思考过程共同影响主动判断,不能单归因于规模。

拿掉数字上下文后,哪些任务最受伤?

论文做的关键对照是去掉数字上下文后重新评测,目的是验证主动判断对可核对事实的依赖。报告显示,上下文事实核查任务的召回大幅下降,因为该任务本来就要靠数字信息决定交互时机,没有消息历史就无法判定矛盾。主动意图捕捉任务的准确率与召回也下降,因为数字上下文对准确推断隐式意图必不可少,例如目的地与时间缺一不可。

这个消融不支持拿掉数字上下文后模型必然沉默的说法,实际现象是判断依据缺失导致该打断时漏掉、不该打断时仍可能误触发,需要结合误触发率一起看。 下图对比带与不带数字上下文的 3 组模型表现,是理解信息条件作用的最直接证据。

看图路径: 1. 先按图例区分实心与斜线柱分别代表带与不带数字上下文;2. 再比较左侧上下文核查任务中召回率柱的落差幅度;3. 最后观察右侧意图捕捉任务中三组模型的下降是否一致

原论文 Figure 3:Experiments comparing model performance with (w/ DC) and without (w/o DC) Digital Context on…

论文图 3。原论文 Figure 3:“Experiments comparing model performance with (w/ DC) and without (w/o DC) Digital Context on ProVoice-Bench.”。

从像素可见,横轴分为上下文核查的召回、准确率、回答准确率与意图捕捉的召回、准确率、回答准确率 6 组,每组内实心柱普遍高于同色斜线柱,说明去掉数字上下文后性能系统性下降。其中上下文核查召回组的斜线柱几乎贴近零线,落差最大,而意图捕捉回答准确率组的落差相对较小,表明事实核查更依赖外部记录,意图捕捉还可部分依赖语言线索。这个图也提醒复现时必须保留数字上下文输入,否则会低估模型本应具备的触发能力。

哪些结论有边界,哪些量根本没测?

论文直接报告的是在合成数据上的触发判断与回复质量,支持的判断是当前模型存在过度触发与决策到执行落差,思维链能部分缓解。需要限定的是合成语音与仿真声场不能等同于真实远场、多人重叠与强噪声环境,环境声音感知任务的间隔虽然拉长,但真实部署中的延迟、误唤醒成本与打断礼貌仍未测量。

未测量的量包括推理延迟、实时因子、计算开销与人工主观自然度,原文用裁判模型打分代替人工评价,因此不能把回答准确率高直接等同于人觉得自然。相关性不等于因果,例如思考模式伴随更好成绩,但论文未分离是更长的推理、更好的指令遵循还是模型版本差异起主导作用。数据层面,主题来自公开对话主题数据集并经大模型扩展,数字状态的多样性受主题采样与生成模型偏好影响,1182 条的分布不能推广为真实生活触发的先验分布。

要复现这套基准,先做什么,需要什么?

复现应先从数据规格入手,而不是先调模型。第一步固定样本五元组的字段含义,确认对话音频为连续波形、数字上下文为应用状态文本、语义线索为触发依据说明、工具调用与回复为真值。第二步按 5 阶段重建流水线,依次实现主题采样、数字状态生成、场景合成、脚本转语音、响度归一化到负 20 分贝全刻度、远场滤波与衰减、混响混合比 0.3、截断高斯拼接与场景噪声混合。

第三步固定评测协议,先跑触发二分类得到准确率、误触发率与召回率,再用同一裁判模型按语义线索打工具调用与回复,最后乘以触发正确指示取平均。关键超参数与信息条件包括通用与环境感知两组间隔参数、远场处理数值、裁判模型选择,这些在复现报告中应原样保留。资源状态方面,论文引用的对话主题数据集链接本次可达,状态为可用,但这只说明主题来源可获取,不代表 1182 条合成样本已公开,复现前需核对基准发布页。

常见误解是把思考模式当成万能开关,实际上它改善的是分析密集型任务,对纯声学事件检测的增益需要单独验证。

何时值得尝试主动语音,这篇工作留下了什么?

当应用同时满足 3 个条件时值得尝试文中的思路,一是有可核对的数字上下文,例如日程、订单或笔记应用状态,二是触发条件可以事先说清楚,例如特定主题或特定声音,三是允许模型在不确定时先确认再执行。复现时先做最小闭环,用少量合成样本验证触发判断与工具调用 grounding,再扩展到完整评测。还需要补的验证包括真实录音上的泛化、不同裁判模型下分数的稳定性、以及延迟与打扰成本的测量,这些在原文中尚未充分报告。

这篇工作的价值在于把主动从口号拆成可判定、可计分的 4 个任务,并给出从状态合成到声学仿真的完整构造方法,让后续研究可以直接定位是时机判断错了,还是工具调用与回复错了。回到起点,被动模型回答得再好,也回答不了何时该开口的问题,而这正是主动语音智能体必须补上的一课。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总