英文题目:Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction

标签:#语音对话系统 | #强化学习 | #全双工语音交互 | #实时处理

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • Lujia Bao:机构信息未在 arXiv HTML 中可靠披露
  • Qian Chen:机构信息未在 arXiv HTML 中可靠披露
  • Luyao Cheng:机构信息未在 arXiv HTML 中可靠披露
  • Chong Deng:机构信息未在 arXiv HTML 中可靠披露
  • Yuxiang Kong:机构信息未在 arXiv HTML 中可靠披露
  • Xiangang Li:机构信息未在 arXiv HTML 中可靠披露
  • Xu Li:机构信息未在 arXiv HTML 中可靠披露
  • Jiaqing Liu:机构信息未在 arXiv HTML 中可靠披露
  • Chao-Hong Tan:机构信息未在 arXiv HTML 中可靠披露
  • Haoyu Wang:机构信息未在 arXiv HTML 中可靠披露
  • Wen Wang:机构信息未在 arXiv HTML 中可靠披露
  • Xilou Wang:机构信息未在 arXiv HTML 中可靠披露
  • Junhao Xu:机构信息未在 arXiv HTML 中可靠披露
  • Liang Yi:机构信息未在 arXiv HTML 中可靠披露
  • Binbin Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Qinglin Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Qiquan Zhang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

实时语音交互输入为流式语音与不断演化的用户请求,输出为即时语音回应与可执行工具操作,难点在于长程状态保持、随意打断、背景语音干扰与权限边界约束。方法第一步做思考层基础构建,以核心混合监督微调冷启动音频语言模型,再经多模态多教师在策略蒸馏把文本推理能力迁移并固化原生音频能力,输出具备推理能力的音频基座。第二步做行动层策略学习,将上步音频基座放入自演化可执行环境,以对话级、里程碑级与单轮级三级回放做组相对策略优化,学会工具调用、反馈解读与任务完成,并将可执行策略交给协调层。第三步做说话与协调约束,对协调层输出按数据库状态校验、写入路径合法性、行为断言的固定顺序给予奖励,明确如何说、何时说以及是否说或做。与仅优化延迟或单轮函数调用的已有实时语音系统不同,该方法把状态正确性与行为合规直接绑定为奖励顺序,具有可执行任务的实际意义。在半双工语音到文本改编的τ-Voice上总体任务成功率从78.4%提升至82.0%,在语音到语音Full-Duplex-Bench v1.5上背景语音回应率从73.0%降至13.0%。结论限于合成语音、自动裁判与受控环境口径,长程可执行口语任务、真实录音与大规模人工评测尚未验证。原文未披露训练与推理成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

本文解读的对象是 Qwen-Audio-3.1-Realtime,输入是连续流式语音加对话历史与系统状态,目标是在实时语音交互中完成推理、工具执行与说话控制。论文把问题组织为思考、行动、说话与协调 3 层,而不是只优化首包延迟。

读者需要保留的关键信息是方法如何连接文本能力与音频能力、动作如何在可执行环境中被验证、以及何时说话如何被评价。输出是一套可复述的训练与评估流程说明,所有数字都限定在原文声明的模态与评测条件下理解。

例如用户先要路线又加约束、要求等待、再改目的地且查询仍在运行,系统要同时跟踪目标、执行状态与是否开口说话。解读按学习依赖展开,先讲任务与相关路线,再讲全景与组件计算,然后讲训练构造与推理,最后讲实验条件、结果反证与复现要点。

关于资源可用性,本次未发现来源绑定且完成验证的资源,因此不声称代码、模型或数据已公开。

同输入同目标的工作此前做到哪里?

在同输入同目标上,实时语音助手已有流式听与说的基础,Qwen-Audio-3.0-Realtime 即被论文作为起点。相关路线包括通用音频理解与语音指令跟随、多轮交互与工具调用请求、情感共情与语用意图、声学场景理解。

论文沿用的基础是 DrVoice 与 Fun-Audio-Chat 提出的 Core-Cocktail 后训练策略,强调先调和语言参数再做音频文本指令微调。评估路线上,公开基准包括 OpenAudioBench、VoiceBench、Big Bench Audio、Audio MultiChallenge 与 MultiChallenge,工具侧包括 τ-Voice、SpeechFCEval 与 EVA-Bench,全双工侧包括 Full-Duplex-Bench 系列。

与类别差异的比较需要谨慎,例如半双工语音到文本改编结果不能直接等同官方全双工语音到语音协议,自动裁判不同的分数也不能直接对比官方裁判分数。论文的增量在于把可执行环境自演化与多粒度展开引入语音动作学习,并把说话方式、时机与是否说话做成显式会话策略分别评估。

要解决的具体困难是什么?

具体困难是请求在说话过程中演化,约束、执行与说话规则相互交织。模型可能需要识别口语参数、查记录、请求确认、更新数据库并如实汇报发生了什么。只生成合法函数调用语法是不够的,还要验证状态是否真的改变、写入是否走允许路径、是否在承诺前核实信息、是否在写入前确认、是否如实报告执行状态。

另一个困难是说话时机,系统要在继续听、开始说、停止播放与被打断后恢复之间选择,还要区分回声式应答、讲给他人听的语音与真正打断。第三个困难是能力边界,口头承诺既不是执行证明也不是授权令牌,学到的策略遵守要与运行时工具权限分开。

论文用路由查线路、加约束、让等待、改目的地且查询运行中的例子,把目标理解、执行跟踪、是否说话与证据支持的表达绑在一起考察。

三层方法全景如何分工?

论文把系统分为思考、行动、说话与协调。思考提供音频推理与多轮指令跟随的基础,通过来源文本大模型的监督与音频条件信号共同训练。行动把口语意图转为可执行决策,在任务与业务策略约束下选择工具并解释反馈。说话与协调控制如何说、何时说以及是否说或做。

架构上流式音频同时进入两条音频编码器加大语言模型路径,全双工决策模型控制听与说的时机,语音到文本模型生成回复内容,上下文感知语音渲染器结合对话历史、音色与声学上下文生成流式语音。下图展示了持续交互循环与三块训练的对应关系,适合先建立听想做说的整体回路,再定位各节细节所在位置。

看图路径: 1. 先从左到右看听、想、做、说四个主框与下方三块训练的对应关系;2. 再看从行动指回思考的执行反馈箭头与从说指回听的对话继续箭头;3. 最后确认三块训练分别标注的文本 grounding、可执行环境与何时是否说话

原论文 Figure 1:Conceptual interaction loop and three technical layers.

论文图 1。原论文 Figure 1::“Conceptual interaction loop and three technical layers. The stages can overlap in time, and a separate runtime extends the loop to persistent tasks.”。

上图可见 4 个主框为听音频与上下文、想推理与决策、做执行与验证、说回应等待或恢复,行动到思考有执行反馈回边,说到听有对话继续回边。下方三块分别为基础训练对应文本 grounding 与音频条件学习、智能体训练对应可执行环境与多粒度展开、会话策略对应如何何时与是否说话或行动。

图注强调阶段可在时间上重叠,且独立运行时把循环扩展到持久任务。这解释了为何延迟只是其中一个要求,而状态验证与说话控制是同等重要的接口。

思考层如何把文本能力搬到音频上?

思考层先用白话说就是让音频模型学会像文本模型那样推理,但输入必须是声音。英文名是 Foundation Training for Spoken Intelligence,核心是 Core-Cocktail 监督微调与多模态多教师在策略蒸馏。先沿一个样本走完流程:输入一段音频与其语义等价文本,音频学生根据音频采样出一段自生成轨迹,文本教师在等价文本加同一前缀下逐位置打分,冻结音频参考在原始音频加同一前缀下也逐位置打分,学生分布向这两路分布对齐,输出仍是音频条件下的统一策略。

文本教师 × 音频学生: 文本教师负责提供知识、推理与工具决策的词分布监督,因为它能看到语义等价文本并给出稳定判断;音频学生负责在真实音频输入下生成轨迹并接受打分,因为部署时只有语音可用。二者搭配的理由是同一学生前缀下同时打分,避免预生成答案掩盖音频条件下的行为差异,组合后使跨模态能力迁移的同时保留音频条件行为。

符号与计算目标如下。学生策略记为音频学生策略,音频输入记为音频,轨迹为采样长度为 J 的词序列,学生分布为给定音频与此前前缀的下一词分布,教师分布为给定等价文本与同一前缀的下一词分布。原文强调教师不提供预生成答案,只对学生已生成前缀逐位置打分,对齐目标是沿生成轨迹的行为而非输入特征相似度。

\[y\sim\pi_{\theta}(\,\cdot\mid x_{a}).\]\[q_{T}^{(j)}=q_{T}(\,\cdot\mid x_{t},y_{\lt j}).\]\[q_{\mathrm{ref}}^{(j)}=q_{\mathrm{ref}}(\,\cdot\mid x_{a},y_{\lt j}).\]

上三式分别对应学生采样、文本教师打分与冻结音频参考打分,参考在该阶段开始时从学生初始化并冻结。该路径适用于任务相关信息可用文本表示的情形,对于情感与语用或声学上下文塑造的任务,音频条件监督提供超出转写稿的学习信号。

数据规模上基础配方使用约 1000000 小时配对音频文本数据,覆盖通用音频理解、口语指令跟随、多轮交互、工具请求、情感共情、语用意图与声学场景。

音频参考模型 × 多模态在策略蒸馏: 音频参考模型是冻结的初始音频策略,负责锚定原始音频上下文下的行为分布;多模态在策略蒸馏负责同时用文本教师和音频参考去更新学生同一位置的分布。二者搭配是因为只用文本教师会丢失语气与场景信息,只用音频参考则无法继承语言推理,组合后形成知识迁移与音频保真两路互补监督。

第二步是专家分化再合并。先用领域数据与 GRPO 训练情感共情、语用意图与声学场景等专家,这一步只形成教师不合并行为。随后多教师在策略蒸馏让主模型生成自己的音频轨迹,每个相关专家在同一音频上下文与同一前缀下给出词分布,主模型向这些专家分布学习,最终部署只需要合并后的单个主音频语言模型。

领域专家 × 多教师在策略蒸馏: 领域专家指用领域数据与 GRPO 分别训练出的情感共情、语用意图与声学场景等专用模型,负责捕捉超越转写文本的旁语言信号;多教师在策略蒸馏负责让主模型生成自己的音频轨迹,再请相关专家在同一前缀下给出词分布并合并蒸馏。搭配原因是专家分散则部署困难,集中蒸馏后推理时只需要统一的主音频语言模型。

行动层如何在可执行环境中学会做事?

行动层的白话目标是让模型在会说话之外真正把事做对并能查证。英文概念是 Executable Environments 与 Group Relative Policy Optimization。每个可执行域打包工具、共享数据库、业务策略、任务与验证器,任务只允许 3 种合法结局:合规的状态改变写入、合理拒绝或声明不支持,仅第一种允许改库。

工具集合中故意加入相似与无关工具,要求模型必须选对工具而非靠明显候选。沿一个样本走:代码智能体按工具定义与任务需求构建域,所有工具作用于同一数据库以便事后检查;静态门从初始库重放参考解检查预期结果与允许写入;展开门检查模型轨迹的库结果与行为要求;难度门多次运行标注持续解决、持续失败或能力边界。下图是自演化生产可执行训练环境的核心闭环,适合理解三道门与演化智能体如何把无效构建与有效失败分开处理。

看图路径: 1. 先沿上排任务设计到构建环境到门 1 验证到可执行第 N 代的顺序看;2. 再看下排展开验证分流演化回到再评估的闭环与右侧强化学习信号;3. 最后确认挑战库与修无效构建两条虚线反馈的作用位置

原论文 Figure 4:Self-evolving production of executable training environments.

论文图 4。原论文 Figure 4::“Self-evolving production of executable training environments.”。

上图上排为构建与验证,依次是任务设计组合服务与工具、构建环境形成可执行包、门 1 重放参考解并检查奖励与策略、形成第 N 代可执行体并保留相关动作与干扰项,门 1 失败会修无效构建。下排为展开与演化,依次是展开做多次带执行轨迹的试验、可选语音注入、门 2 核验状态与允许写入并重采样无效展开、门 3 按易难边界分流、演化智能体加约束修缺陷保留差距,验证通过的下一代回到评估。

右侧强化学习信号只收有效成功与有效任务失败,挑战库把困难模式沉淀给后代。奖励顺序固定为先查库是否达到要求状态,再查每次写入是否走允许路径,最后用行为断言检查库状态表达不了的要求,例如承诺前核实、写入前确认与如实报告,断言只记录违反且前件不适用时跳过。

无效展开指基建失败或轨迹残缺或缺必要判断,会重采样而不给零分;有效失败指执行与评估完整但违反目标或策略,保留为负例与难度估计。

对话级展开 × 里程碑级展开: 对话级展开负责采样完整多轮对话并比较最终结果,直接训练任务完成与策略合规;里程碑级展开负责在参考工具链定义的中间状态处保存对话与数据库状态,再从同一点采样多条延续以比较下一步决策。搭配理由是只看终局难以定位中间哪一步出错,而只看单步又缺全局约束,组合后实现终局目标与中间决策的共同定位。

说话与协调层如何决定怎么说、何时说与是否说?

说话与协调的白话含义是给开口说话加上方式、时机与边界 3 套约束。英文是 Conversational Policy Alignment,分为如何说、何时说与是否说或做。如何说约束长度风格人设一致性、情感恰当与口语自然度,训练用监督微调与 GRPO 训练的专家做教师,会话级展开打分重复模板化追问、对话停滞与长程人设漂移,确定性过滤器抓截断与极端长度,奖励是长度中性且不奖励人设关键词匹配,音频依赖共情要求利用犹豫疲惫哭泣等可操作线索而不机械复述每个可听属性。

何时说用双工决策策略建模,动作为继续听、开始回应、停止播放与打断后恢复,历史可含等待完成信号等临时约定,运行时用户约定优先于静态场景策略再优先于默认行为,回声应答、讲给他人与真正打断需不同响应,停止播放与是否回答是两个不同决策。是否说或做要在直接回答、调工具、追问确认、拒绝与保持沉默间选择,由工具触发、不确定性、核实需求与能力边界决定,能力边界评估只检查回复是否与固定能力配置一致,不证明所述能力真实可用。

决策的形式化如下,观察为到时间 t 的流式音频,历史为对话与交互事件,状态含是否在说话或执行中。

\[a_{t}=\pi(o_{\leq t},h_{\leq t},s_{t}).\]

上式目标是输出听说打断恢复 4 类动作中的一个,原文明确实现是条件于观察历史与系统状态的策略,未给出梯度路径细节则不猜测。工具训练细节留在行动层,本层强调它们共享的约束,例如工具调用前可简短告知开始但不得提前声称成功,每次工具调用轮次被标为需要、禁止或可选,更高层规则如只确认首次调用会被转成轮次标签,评估检查确认位置长度重复语言一致与内部细节披露。

前台 × 后台: 前台指实时前台智能体,负责理解流式语音、维持对话、做短时直接工具调用并整合结果;后台指编排运行时创建持久任务记录后由后台智能体执行的多步工作,负责文档处理与环境探索等耗时任务。二者搭配的理由是长任务不能阻塞对话,组合后通过接受事件、进度与结果事件解耦说话中断、任务取消、任务完成与结果播报 4 种语义。

训练与任务演化按什么顺序真实执行?

训练按 4 阶段真实执行。第一阶段 Core-Cocktail 监督微调从音频预训练模型出发,以来源文本大模型做语言参数锚,先调和共享语言参数再做受控音频文本指令微调,输出可用初始音频策略。第二阶段多模态在策略蒸馏在学生自生成轨迹上同时接受文本教师与冻结音频参考的词分布监督,输出跨模态迁移后的音频策略。

第三阶段领域专家训练用领域音频数据与奖励加 GRPO 做出情感、语用与声学等专家。第 4 阶段多教师在策略蒸馏用这些专家在主模型自生成轨迹上的词分布做合并,输出可部署统一主模型。两条在策略蒸馏路径合称 M2-OPD,推理时只需要合并后的主模型。下图为后训练管线全景,适合按从左到右的编号确认参数重锚、行为迁移、专家分化与合并的先后关系。

看图路径: 1. 先看左侧预训练音频语言模型经参数调和进入受控监督微调的顺序;2. 再看中间音频学生自生成轨迹同时接受文本教师与冻结音频参考打分;3. 最后看右侧多专家汇入多教师蒸馏并只输出一个主模型用于推理

原论文 Figure 3:Qwen-Audio-3.1-Realtime post-training pipeline.

论文图 3。原论文 Figure 3::“Qwen-Audio-3.1-Realtime post-training pipeline.”。

上图左侧显示预训练音频语言模型进入参数调和再进入受控监督微调,中间显示音频学生自生成轨迹进入在策略监督并同时接受等价文本教师与原始音频冻结参考的分布,右侧显示情感共情、语用意图与声学场景等专家汇入多教师蒸馏并只输出单个主音频语言模型用于推理。底部标注两条蒸馏路径合称 M2-OPD,进展为重锚参数、迁移行为、分化专家再合并为可部署模型。

动作训练用对话级、里程碑级与回合级 3 级展开做 GRPO,三者共享同一环境状态任务规则与验证器,仅在比较的行为量与反馈附着点不同。对话级采样多段完整对话比较终局,直接训练完成与合规并提供难度门通过率,但终局奖励难定位中间错误。

里程碑级按参考工具链定义重要中间状态,要求期望成功调用按序且参数正确,失败调用不计,到达即保存对话与库状态再采样多条延续,使终局回报更直接比较下一步。回合级在选定决策点让模型提话语或工具调用,局部检查工具选择参数 grounding、未授权写入与回复质量,可复用历史前缀与库状态含失败状态,实现聚焦纠正而不重放整轮。

训练前会过滤与评估数据重叠的工具名对话片段与策略文本。语音条件工具使用可把用户轮合成为语音再送模型,使口语数字、同音名与否定进入选参与参数 grounding,但对真实录音的鲁棒性仍需单独评估。检索训练分离是否搜、发什么查询与如何据证据回答,搜与不搜请求配对,涉时效加日期上下文,搜时训练发少量互补查询再据真实搜索结果回答。报告进度要求工具调用前可简短告知开始但不得提前承诺,评估同时查位置与长度重复语言一致性与内部细节披露。

实验测什么,在什么条件下比较?

实验按智能、行动、交互与实时组织。模态标记中语音到文本指语音输入文本输出,语音到语音指语音输入语音输出,除非声明默认用语音到文本,全双工系列与 EVA-A 用语音到语音。τ-Voice 结果用自研半双工语音到文本改编,不可直接对比官方全双工语音到语音协议。除非声明 GPT-Realtime-2 用低努力设置。

百分比指标的绝对差用百分点并显式标注相对变化,其他量表差用分数点,下箭头表示越低越好,加粗表示该列展示最优含并列但不意味统计显著,横线表示无可用结果,版本级比较不分离单个训练组件,所有比较均为描述性。公开基准用发表名,自研评估包括 Long-AMC、WebSearch1K、PersonaCross、20 轮以上剧情推进、中文真实与两套合成共情集、VoiceChat、VoiceChat-L、Qwen-Audio-FDB、中文英文多轮攻击集与能力边界,表注报告任务范围与指标定义。

智能侧覆盖通用指令跟随、多语言音频推理、音频理解与多语言识别、长上下文。行动侧覆盖 Retail、Airline、Telecom 三域 grounded 任务、语音函数调用与 EVA-A 准确率复合指标,其中 EVA-A 配置与公开略有差异且 3.1 结果覆盖 213 场中的 200 场。

交互侧覆盖人设共情、218 组中文 2706 轮 VoiceChat 分场景口语分与规则分、全双工暂停处理平滑接管打断回声背景音与对他人说话、多方交互与语义控制。可靠性侧用 450 题中文幻觉问答、790 条 TruthfulQA、939 条 Do-Not-Answer 与 2726 条中文 Do-Not-Answer,幻觉与真实问答报告无幻觉通过率,拒绝类报告安全通过率,另有各 200 场中英文多轮攻击报告攻击成功率越低越好,68 组对话 619 条回复的能力边界报告回复级准确率。

持久语音智能体是独立 Voice Harness 原型,前台用 Qwen-Audio-3.0-Realtime 而非 3.1,134 例座舱任务中 86 例短或上下文依赖与 48 例多步,音频路径听同等合成语音,文本后台基线听对应文本,能力与延迟来自不同批次且延迟只在 4 路径共成功子集上测量。

主结果在公平条件下支持什么判断?

本节先看通用与指令跟随,再看多语言推理。第一个比较问题是 3.1 相对 3.0 与外部基线在相同裁判与指标方向下是否提升音频指令跟随,公平条件是同表同裁判同聚合,指标方向为越高越好,AMC 因官方裁判不可用而改用 GPT-4o-mini 故不可比官方分。

ModelOABVoiceBenchBBAAMCMC
Qwen-Audio-3.0-Realtime88.9292.5498.8047.1252.38
Qwen-Audio-3.1-Realtime88.8292.7398.5052.2153.85

上表显示 3.1 的 AMC 从 47.12 升至 52.21,MC 从 52.38 升至 53.85,OAB 与 VoiceBench 与 BBA 基本持平,分别为 88.82、92.73 与 98.50。支持的判断是音频推理与多轮指令跟随得到改善,限制是该表未报告置信区间与重复种子,且版本比较不分离具体组件贡献。未胜出项是 AMC 上 GPT-Realtime-2 为 50.33 低于 3.1 但裁判已更换故只能做表内比较。

第二个比较问题是多语言 Big Bench Audio 的 14 语言平均与弱语言是否改善,公平条件是同为准确率百分比且平均为加权前未舍入均值。

ModelarfrruthAvg.
Qwen-Audio-3.0-Realtime52.583.186.351.581.7
Qwen-Audio-3.1-Realtime79.187.488.379.088.1

上表显示 3.1 平均 88.1 相对 3.0 的 81.7 提升 6.4 个百分点,阿拉伯语从 52.5 升至 79.1,泰语从 51.5 升至 79.0,越南语从 61.5 升至 79.2,德法西印尼意日韩葡俄中均有提升,英语从 98.8 微降至 98.5。支持的判断是多语言推理短板被明显补齐,代价或反例是英语微降与中文持平 90.9,说明总体趋势不等于每组都升。

语音识别上原文报告 FLEURS 宏平均词错率从 9.01 降至 3.98,LibriSpeech clean 与 other 为 1.19 与 2.31,长上下文 LongBench v2、MiniLongBench 与 Long-AMC 分别提升 6.76、4.40 与 8.04 个百分点,VoiceChat-L 为 4.58 对 4.61 基本持平。工具侧原文报告半双工 τ-Voice 总成功率从 78.4% 升至 82.0%,其中 Retail 从 72.8% 到 73.7%,Airline 从 64.0% 到 74.0%,Telecom 从 90.4% 到 93.9%,SpeechFCEval 从 83.28% 到 86.00%,EVA-A 在自有配置下通过率 47.74% 对 43.10% 但均值 66.26% 对 70.50% 反向,WebSearch1K 平均查询数从 4.37 降至 1.05 相对降 76.0% 而 F1 从 60.87% 到 58.61% 降 2.26 个百分点,调用率仍在目标区间。以上说明任务成功与查询精简同时出现,但回答质量分并未同步最优,需把成功率与忠实有用安全分开读。

交互与全双工的收益与代价在哪里?

本节按问题组织人设共情与分场景对话,再看全双工取舍。比较问题是 3.1 在口语自然度与规则质量上是否同时提升,公平条件是同为语音到文本评估与同裁判,指标方向为越高越好。

ModelPersona evaluationPersona evaluationEmpathy evaluationEmpathy evaluationEmpathy evaluation
GPT-Realtime-23.963.693.204.333.54
Qwen-Audio-3.0-Realtime3.863.463.704.734.37
Qwen-Audio-3.1-Realtime3.933.734.034.994.74

上表显示 3.1 相对 3.0 在 CharacterEval 从 3.86 到 3.93,PersonaCross 从 3.46 到 3.73,20 轮以上剧情推进从 3.29 到 3.46,RMTBench 从 3.31 到 3.49,EchoMind 从 3.70 到 4.03,两组合成共情均到 4.99,真实对话到 4.74。代价是展示系统中 SeedDuplex 在 CharacterEval、20 轮与 RMTBench 仍领先,3.1 只在 PersonaCross 与四列共情领先,说明人设保持的长程推进仍有未胜出项。共情评估用共同高共情人设,故结论限于该角色约束而非所有人设。

第二个比较问题是 VoiceChat 分场景口语分与规则分是否一致提升,公平条件是同为 218 组中文对话与 Qwen-Plus 裁判,口语分 1 到 5 测自然度与请求推进,规则分 0 到 1 平均 12 个二值标准,长度仅描述性。

ModelOverallOverallInformation QueryInformation QuerySkill ControlSkill ControlInstruction & Style ControlInstruction & Style ControlDaily ChatDaily Chat
GPT-Realtime-23.8810.9453.8640.9433.5810.9214.2570.9643.9390.952
Qwen-Audio-3.0-Realtime4.0460.9564.1420.9743.9510.9454.0700.9284.0160.955
Qwen-Audio-3.1-Realtime4.1000.9614.2460.9783.9490.9414.3800.9393.9650.965

上表显示 3.1 总体口语 4.100 与规则 0.961 为展示最高,相对 3.0 增 0.054 与 0.005,信息查询增 0.104 与 0.004,指令风格控制从 4.070 到 4.380 为最大口语增益,声音人设切换从 3.469 到 4.106,复合情感切换从 2.929 到 4.000。反例是日常闲聊口语从 4.016 降至 3.965 而规则从 0.955 升至 0.965,其人设交互切片口语从 3.685 降至 3.371 而规则从 0.916 升至 0.951,技能控制基本持平为 3.949 对 3.951 与 0.941 对 0.945,平均每轮中文字符从 58 降至 53,技能控制从 45 到 36 与日常从 58 到 48 最明显。这支持口语分与规则分需一起读,更短并不必然更好。

全双工上 3.1 在背景音回应率从 0.73 降至 0.13 而恢复率从 0.26 升至 0.87,对他人说话回应率从 0.13 降至 0.03 而恢复率从 0.82 升至 0.96,暂停处理合成集并列最低 0.0073,Candor 从 0.11 降至 0.0509,平滑接管为 0.9664 延迟 1.9210 秒,打断回应与恢复为 0.8450 与 0.1300,回声回应 0.0306 恢复 0.9694 且不确定与未知均为 0,回应延迟 1.7000 秒为展示最低。FDB v3.0 填充率从 0.7590 降至 0.2960,接管 0.9900 打断错误 0.1110,自研多方交互会话级通过率从 0.08 到 0.96,语义控制从 0.07 到 0.68,点级到 0.9943 与 0.8930。安全上 HalluQA、TruthfulQA、DNA、CDNA 与能力边界分别增 2.89、3.55、3.19、7.08 与 2.26 个百分点,多轮攻击成功率中文降 54.50 个百分点英文降 40.00 个百分点,展示系统六项领先而 TruthfulQA 最高仍是 GPT-Realtime-2 的 83.92%,50 场人工红队 3.1 会话安全通过 92.00% 对 96.00% 反向,说明基准安全与人工对抗安全需分开理解。

证据缺口与适用边界是什么?

论文明确指出证据覆盖在 3 维策略上不均,已有 3.1 结果覆盖人设共情、VoiceChat、全双工、工具使用、检索触发与查询生成、EVA-A、语音到文本安全与 50 场人工红队,但双工评估结合公开与受控自研集,对真实录音与部署条件的更广覆盖仍需补充。

EVA-A 仅覆盖 213 场中的 200 场且配置与官方略有差异,VoiceChat-L 与 20 轮以上只探长上下文交互与人设持续,未评估长时程可执行口语任务与大规模人工红队。多数比较为描述性,部分用自动裁判、合成语音或小切片,全套置信区间、重复种子测试与污染分析缺失,需要受控消融才能把变化归因到 Core-Cocktail、任一在策略蒸馏路径、环境演化或展开粒度。

持久智能体证据来自独立 Voice Harness 与仿真路由评估且音频前台为 3.0,只支持该协议下的直接与委托互补,3.1 模型端到端与正式异步生命周期仍开放,运行时记忆权限与任务状态机制需超越模型合规的验证。未来评估应扩到真实录音与部署条件,并加长时程可执行任务、更大人工安全研究与端到端延迟成本测量。复述时不得把自动指标当人评,不得把不同指标差值混入模型列,不得把百分点与相对百分比混用。

复现先做什么,需要哪些信息条件?

复现先固定模态与协议再跑基线。第一步按表注固定语音到文本或语音到语音、半双工或全双工、裁判与样本量,例如 τ-Voice 必须用半双工语音到文本改编而非官方全双工协议,AMC 若用 GPT-4o-mini 则不可比官方 o4-mini 分。

第二步准备 3 类数据:约 1000000 小时级配对音频文本的多域数据用于冷启动,文本等价对用于多模态蒸馏,情感语用声学等领域音频与奖励用于专家训练,动作侧需工具共享库业务策略任务与验证器五件套。第三步按顺序执行基础 4 个阶段:参数调和后受控监督微调得初始策略,学生自生成轨迹上加文本教师与冻结音频参考监督,领域 GRPO 做专家,多教师蒸馏合并为单主模型,推理只需主模型。

第四步搭建三门与演化循环:静态门重放参考解,展开门查库结果允许写入与行为断言,难度门多次运行标注易难边界,易则加策略依赖或状态约束,坏环境先修,有效失败保留,边界保留,每代新任务过同样三门。第五步用 3 级展开做 GRPO,对话级比终局,里程碑级在中间状态保存后比延续,回合级在决策点做局部纠正,训练前过滤与评估重叠的工具名片段与策略文本。

关键超参数与冻结更新梯度路径以原文为准,未报告处记为缺项不从模型名推定。持久 Harness 复现需另搭前台后台编排运行时与有界记忆,任务记录、执行状态与结果投递分开跟踪,语音打断不等于任务取消,任务完成不等于结果投递,前台可用 3.0 做对照但不可当作 3.1 模型评估。

何时值得尝试,还需补哪项验证?

当任务是多轮口语约束跟踪加工具执行,且需要控制何时开口与如何汇报进度时,该 3 层拆分值得尝试。基础蒸馏适合文本推理强但音频数据偏弱的起点,领域专家合并适合情感语用声学等超越转写稿的信号,可执行环境适合写入合规与拒绝边界重要的业务,里程碑展开适合终局对但中间易错的长链任务。

尝试前应确认信息条件:任务信息能否用文本等价表示以适用多模态路径,工具是否共享可查库以支持状态验证,是否有参考工具链可定义里程碑,是否有干扰工具与确认策略以测选择与边界。还需补的验证包括真实录音下的双工与识别鲁棒性、长时程可执行口语任务的端到端成功与延迟成本、大规模人工红队与权限执行的分离测试、以及消融到各组件的受控对比。

常见误解是把口头承诺当执行完成、把能力边界回复一致当能力真实可用、把查询数下降当回答质量提升、把总趋势当每组每步成立,论文已通过分离库验证与行为断言、分离承诺与授权、分离查询负载与答案质量、分离口语分与规则分来纠正这些误读。

📎 论文与评分元数据

排名:前50% | 文档类型:模型报告 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-24 语音/音乐/音频论文速递