英文题目:Realtime-Venus: A full-duplex interaction system with asynchronous delegation

标签:#全双工语音交互 | #自回归模型 | #音视频 | #流式处理

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • Ruixiang Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Hualei Wang:机构信息未在 arXiv HTML 中可靠披露
  • Renhe Sun:机构信息未在 arXiv HTML 中可靠披露
  • Enzhi Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Jincenzi Wu:机构信息未在 arXiv HTML 中可靠披露
  • Xujie Song:机构信息未在 arXiv HTML 中可靠披露
  • Kexin Shi:机构信息未在 arXiv HTML 中可靠披露
  • Zihang Liu:机构信息未在 arXiv HTML 中可靠披露
  • Pengcheng Zhu:机构信息未在 arXiv HTML 中可靠披露
  • Jiayi Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Baoyue Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Changhao Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Zitong Wang:机构信息未在 arXiv HTML 中可靠披露
  • Jinhong Wang:机构信息未在 arXiv HTML 中可靠披露
  • Tong Niu:机构信息未在 arXiv HTML 中可靠披露
  • Jingjing Liu:机构信息未在 arXiv HTML 中可靠披露
  • Junan Lin:机构信息未在 arXiv HTML 中可靠披露
  • Haolin He:机构信息未在 arXiv HTML 中可靠披露
  • Hengshuo Chu:机构信息未在 arXiv HTML 中可靠披露
  • Yuhui Chen:机构信息未在 arXiv HTML 中可靠披露
  • Jian Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yuge Huang:机构信息未在 arXiv HTML 中可靠披露
  • Junliang Xing:机构信息未在 arXiv HTML 中可靠披露
  • Yuntao Wang:机构信息未在 arXiv HTML 中可靠披露
  • Weiqiang Wang:机构信息未在 arXiv HTML 中可靠披露
  • Chun Yu:机构信息未在 arXiv HTML 中可靠披露
  • Yuanchun Shi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

全双工交互的输入是持续到达的音频与视频流及重叠语音,输出是即时语音回复与说听控制决策,实际难点在于长时视觉记忆与外部工具执行时间尺度不同,还需在播放与推理期间持续感知打断与意图变化。方法分三步衔接:先以一秒块共享时钟把用户音频、视觉帧、助手语音与后台回送结果序列化为统一因果时间线,为后续判断提供对齐上下文;再由前端大模型在该时间线上联合预测交互控制、前景讲文本与私有委托请求,其委托文本进入后台队列而不直接播放;最后由Realtime-Venus-Harness按请求边界快照固定证据并异步调度多模态问答与工具执行,再把制备好的可讲回复送回同一会话 timeline 择机播报。与仅做语音活动检测打断或同步阻塞式工具调用不同,该双环把委托内容隐藏于播放之外并允许执行期间继续感知与说话,其实质意义是把耗时推理与实时交互解耦以保持对话连续性。在MMAU基准下,Realtime-Venus-Audio的准确率为78.0%,高于MiniCPM-o 4.5的准确率76.9%。该结论限于短窗评测与自建委托判定,复杂多步工具与长时意图漂移尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么?为什么研究生要先看懂任务再看模型?

本文输入是连续的语音、音乐与环境音频,对全能版还包括连续视频帧,目标是在用户说话、他人说话、背景噪声与画面变化不断到来时,系统能持续感知并决定何时听、何时说、何时在后台查资料或调工具。本文面向刚进入语音音频领域的研究生,因此先把必须保留的信息说清:两个前端都是 9B 量级,分别处理音视频与纯音频;共享双环运行时与委派线;训练混合离线理解、前瞻全双工轨迹与委派工作流。

评测覆盖流式视频理解、音频理解、口语问答、全双工重叠处理、工具使用与委派判断。输出是可核对的技术解读,不做营销式判断,所有数字回到原文核对。学习依赖是先理解全双工与异步这两个时间尺度,再看统一序列化如何把用户流、助手流与后台流放在同一因果时钟上,最后看数据如何同时监督说话动作与后台任务管理。

举一个教学例子:用户边听回答边说对,不是,是错,这在声学上都是重叠语音,但前者是短促附和应继续说,后者是纠正应停掉未播部分并重写后续,这正是本文要建模的语义级控制,而不是简单的语音活动检测触发停止。

已有路线走到哪里?本文与它们是什么关系?

第一条路线是全能理解与流式语音生成。原文回顾了交错多模态学习、端到端语音交互、时间对齐的音视频表示与思考者说话者分离等工作,指出这些工作提供了模态覆盖与流式输出,但没有解决输入如何在回应生成过程中影响正在进行的回应。

第二条路线是音频理解与语音生成,包括用窗口级查询变换器连接语音与通用音频编码器、多任务预训练统一音频任务、离散语音表示做跨模态指令微调,以及连续声学特征加离散语义令牌等,本文音频前端希望在保留声学与语义能力的同时联合学习会话控制与委派。

第三条路线是前瞻与全双工交互,包括把用户与助手音频建模为并行流、用辅助分类器预测块级对话状态、用并行输入流与合成并发对话学习打断处理,以及在视频侧学习何时回应与记忆感知流推理,本文把会话控制、回应生成与私有委派放在同一策略与时间线内。

第四条路线是工具使用与异步委派,包括交错推理与行动、联合语音与结构化动作通道、选择性异步检索、可插拔异步思考层与异步函数调用,本文的差别是为分别训练的音频与全能前端提供私有委派接口,由线束固定请求边界证据、执行注册能力并把结果返回原会话。理解这些对照有助于避免把类别差异当成同条件胜负,例如离线模型可以看到完整片段而流式模型只能看到查询时刻之前的观测。

核心矛盾是什么?为什么稳定证据与变化对话难以兼得?

核心矛盾是连续交互与外部计算运行在不同时间尺度上。后台任务需要一份稳定的请求记录与其支撑证据才能可靠执行,但当结果返回时,对话可能已经推进,用户意图可能已经改变。原文明确指出,协调任务捕获与会话结果投递对保持连贯交互至关重要。如果每次都等后台算完再说话,延迟敏感的前台会被拖住;如果后台拿到的证据随对话漂移,结果就不可复现且难以排错。

因此问题被定义为如何在同一会话内同时做到三件事:前台持续感知并管理语音输出,后台异步执行推理与工具调用并准备可播报文本,以及在结果回到对话时由前台根据最新状态决定何时说与如何说。评价也要相应分开:理解能力看离线与流式基准,会话连续性看重叠语音下的回应与继续,委派能力要区分选对工具与真正完成任务,还要区分该委派时是否委派与不该委派时是否克制。

系统全景如何分工?双环与共享时钟解决什么?

系统由全双工会话前端与异步能力执行线束组成。每个会话选用音频前端或全能前端之一,前者处理连续音频,后者额外处理视觉输入,两者共享同一委派接口:前端管实时交互与语音输出,线束管委派任务执行与回复准备。交互环持续运行且延迟敏感,能力环按需运行且可能耗时更长,两者交换的是受因果上下文约束的任务包与绑定原会话的准备好回复,允许异步执行与实时交互并行。

统一流序列化把用户观测、模型输出、私有委派请求与后台结果对齐到共享因果时间线,前端联合预测交互控制令牌、回应文本与委派请求。共享策略支持在用户附和时保持回应、在纠正后修改未说出的延续、在需要外部能力时发起后台工作。训练需要把会话事件与交互决策及委派执行连起来的轨迹,数据管线通过场景规划、语音实现与时间对齐来构造。

全双工交互 × 异步委派: 全双工交互负责在说话的同时继续听,分工是决定每 1 秒是继续听、继续说还是结束当前轮;异步委派负责把需要外部信息或长推理的请求交到后台,分工是固定请求时刻的证据并在后台执行。两者搭配的理由是时间尺度不同:说话要求低延迟,后台允许长延迟;组合意义是前端用私有自然语言请求触发后台,前台继续对话,后台结果再以私有文本回到同一会话,由前端选择播报时机。

以下导读帮助建立双环的整体图像:左侧是用户与前端的持续交互,右侧是捕获分发返回的 3 段式后台,底部是工作状态的推进,理解这张图后再读公式与组件会更顺。

看图路径: 1. 先看左侧交互环中用户到前端的音频视频文本箭头与前端回到用户的语音箭头;2. 再看中间从前端指向捕获的横向箭头如何启动右侧能力环;3. 最后看底部从排队到已投递的五个工作状态如何与上方的捕获分发返回对齐

原论文 Figure 3:Realtime-Venus runtime: full-duplex interaction with asynchronous delegation.

论文图 3。原论文 Figure 3::“Realtime-Venus runtime: full-duplex interaction with asynchronous delegation.”。

这张运行时总览显示左侧交互环中用户发出音频视频文本,前端模型持续更新会话状态并经语音通道返回输出,同时把需要外部能力的请求横向送往右侧;右侧能力环先捕获并冻结证据形成被跟踪的工作项,再经分发选择后端能力执行,最后经返回把打磨好的文本送回原会话的文本输入。底部状态条从排队经运行、完成、投递中到已投递,区分了回复已准备好与语音已播放确认两种不同完成度,这正是稳定执行与灵活播报分工的可视化。

前端如何把一秒一切块?听与说由谁决定?

两个前端都按 1 秒为单位组织流。每个全能单位交错当前帧的视觉令牌与时间对齐的音频特征,每个音频单位只含音频特征。每单位语言模型先预测听还是说,说话单位再生成回应文本并以此为条件生成对齐的语音令牌,用块结束符关闭语音块,用轮结束符关闭助手轮。这种按块调度使感知与说话并发,且未说出的延续可修改,支撑全能主动注视监听并在新事件值得回应时主动发起语音,也支撑区分附和与打断的全双工会话。

编码器上全能版用视觉与音频双分支,音频版去掉视觉分支,主干为语言模型,生成文本与隐藏状态再条件化离散语音令牌预测,流匹配解码器把令牌转为波形块。运行时把媒体与新返回的后台回复作为输入,更新保留的会话状态,再决定交互行为与输出,其中只有前台文本与语音令牌是用户可见的。

交互控制令牌 × 委托文本: 交互控制令牌分工是做块级开关,例如输出<|listen|>或<|speak|>或<|turn_eos|>,控制听与说的切换;委托文本分工是写出后台能执行的自包含自然语言任务,放在<delegate> 区间内且不进入语音。搭配理由是同一语言模型隐藏状态同时决定说什么和是否需要外部帮助;组合意义是打断、反驳、继续说与发后台任务共享语义判断,避免把所有重叠语音都当成停止信号。

运行时因果转移刻画了上述单块更新,状态保留模型上下文、部分输出与待投递回复,后台输入只含本块新准入的私有回复文本,反馈记录播放确认等因果事件。

\[(s_{k+1},O_{k})=F_{m}(s_{k},x_{k}^{m},b_{k};\eta_{k}).\]

该式输入是保留状态、当前媒体、后台新文本与反馈,输出是下一状态与本块的控制、前台文本、委派文本与语音段,强调块内因果顺序与跨块状态携带。语音与时钟同步靠播放进度调度:根据已调度语音结束时间与候选文本估计时长,选择使累计结束时间最接近当前块边界的文本令牌数,落后则少发、有空则多发,从而让回应与最新用户音频及后台结果对齐。

\[n_{k}=\arg\min_{n}\left|\tau_{k-1}+\mathcal{D}(Y_{k,1:n})-t_{k}\right|,\]

该式中符号分别表示上一块语音结束时间、候选前若干文本的估计时长与当前块边界时间,目标是最小化对齐误差。联合策略把控制、前台文本、委派与语音放在同一语义表示下分解,声学解码器在主语言模型之外但共享隐藏状态。

\[p_{\theta,\phi}(O_{1:K}\mid U,B)=\prod_{k=1}^{K}p_{\theta}\!\left(c_{k},Y_{k},D_{k}\mid U_{\leq k},B_{\leq k},O_{\lt k}\right)p_{\phi}\!\left(S_{k}\mid H_{\leq k},Y_{\leq k},S_{\lt k}\right).\]

该式把整段输出概率写成每块控制文本委派与语音段的连乘,背景结果是外部观测而非模型输出,只在后端算完后可用。控制变量区分暂停背景噪声、短附和、需抢夺话轮的打断 3 类:前两者保持监听或说话,后者用轮结束符终止过期回应并结合新意图生成下一说段或委派请求,支持停止拒绝、修复更新与重定向跟进等不同后续。

Thinker-Talker 架构 × 流式语音解码: Thinker 分工是基于 Qwen3-8B 主干消费交错的视觉与音频投影特征,预测控制令牌、前台文本与委托文本;Talker 与流式语音解码分工是以后者隐藏状态为条件预测离散 S3 语音令牌,再经流匹配声码器合成波形。搭配理由是语义决策与声学实现分离但共享表示;组合意义是已播放音频不可改、未说出的延续可改,调度器按播放进度调节每秒放出多少文本令牌以对齐时钟。

线束如何捕获、分发与返回?证据冻结在哪里?

线束包含捕获、分发与返回 3 段并跨段跟踪工作生命周期。捕获从原始思考器令牌流提取私有区间内的自然语言请求,对用户可见文本与语音隐藏该区间,经协议校验与任务身份检查保证一个被接受请求至多创建一个工作项。前端因此无需编码后端工具调用或能力模式,只需写出目标。

捕获用有界会话缓冲构造快照,包含请求标识、开始时间戳与当时可见的最新输入序列,时间戳与序列围栏把证据限制在请求开始时刻可用的观测,媒体裁剪到允许窗口,已播助手语音需经播放确认,后续观测不能修改该证据边界。

分发把每个工作项指派给注册后端能力,注册表提供多模态与通用两种核心能力并支持通过注册技能扩展,路由器只用契约、证据摘要与许可元数据做 1 次基于模型的决策,选出能力与参数而不看原始媒体,经模式校验后执行并产出归一化结果。

返回用共享纯文本打磨把执行结果转为可播报回复,去除保留控制令牌并包成单条私有后台消息,经私有后台通道回到原会话,前端用当前交互状态选择合适时机经原生说话者播出,打磨内容与措辞由线束定,说话时机与语音输出由前端定。

快照证据边界 × 新鲜度检查与回放感知投递: 快照证据边界分工是在委托请求闭合时冻结当时可见的会话缓冲与媒体窗口,作为后台执行的稳定输入;新鲜度检查与回放感知投递分工是在结果返回时判断是否过期以及在哪个块边界插入,避免在用户意图已变时硬播旧答案。搭配理由是后台需要稳定上下文而前台对话持续变化;组合意义是执行用旧证据保证可复现,播报用新对话状态决定说什么与何时说。

以下导读对应线束架构:从左到右是捕获、分发、返回,底部是工作状态,理解证据冻结与结果重入的分离是关键。

看图路径: 1. 先看捕获列中委托请求协议门冻结快照创建工作的自上而下顺序;2. 再看分发列中路由器指向多模态通用与技能三条分支的汇合点;3. 最后看底部工作状态条如何从排队经运行到完成投递与播放确认

原论文 Figure 7:Architecture of Realtime-Venus-Harness for asynchronous task execution and result delivery.

论文图 7。原论文 Figure 7::“Architecture of Realtime-Venus-Harness for asynchronous task execution and result delivery.”。

图中捕获列自上而下为委托请求、协议门、冻结快照与创建工作,强调证据在请求边界固定;分发列中路由器分出直接感知、迭代推理与用户定义技能 3 路再汇合到同一返回入口,体现共享结果格式;返回列为打磨成口语形式、同会话重入与作为思考器文本输入,底部状态条显示排队与运行覆盖执行阶段,完成对应回复已准备好,投递中对应已预留准入,已投递还需前端生成完成与每块语音播放确认,适合对照原文生命周期定义理解。路由器决策与回复打磨可用两式概括,前者选择能力与参数,后者把工作项与执行结果映射为准备好文本。

\[(\gamma_{i},\alpha_{i})=R(q_{i},z_{i},\mathcal{C}),\qquad\gamma_{i}\in\mathcal{C},\quad\alpha_{i}\in\mathcal{A}_{\gamma_{i}}.\]\[\widetilde{b}_{i}=A(w_{i},r_{i}),\]

工作生命周期成功路径为排队到运行到完成到投递中到已投递,不可恢复执行错误进入失败,请求带新鲜度截止期,过期结果不重入。完成表示回复已准备好,投递中表示已预留准入,已投递要求该回复的前端生成完成且每块语音播放确认,从而区分准备好与已播出。

长视频记忆如何在不训练的情况下找回一小时前?

流式音视频输入持续增长而基模型只能维持有限滚动上下文,会话延长到数十分钟甚至小时后,早期内容会滑出窗口。外挂长期记忆模块无需额外训练或参数更新,与微调后的对话策略解耦。构造阶段为避免存每帧的高成本,用基于运动补偿预测代价的视觉记忆门比较相邻采样帧的块级运动匹配残差与运动代价以估计变化,并加局部变化保护与最大连续丢弃约束以降低丢掉短暂事件的风险。

门控只决定是否归档长期记忆,不影响短窗正常处理,保留帧存视觉表示与时间戳,音频独立保存并与视频时间线对齐。检索阶段受细粒度匹配算子启发,对每个查询令牌取其在帧内视觉令牌上的最大余弦相似度作为令牌级匹配分,再用跨历史帧的中位绝对偏差归一化为令牌权重,加权聚合得到帧语义相关分。

按相关分取候选并排序,对每个候选与更高排名候选比较估计视觉新颖度,受最大边缘相关启发把语义相关与视觉新颖结合为最终检索分,1 次算定不再迭代,选最高分者为历史证据以保相关并去冗余。重组阶段为每帧取时邻音频段并合并重叠区间,再与近期短窗音视频及当前查询按时间排成回答上下文,使模型在不常驻全量历史的情况下恢复窗外相关信息。

以下导读对应全能架构与记忆 3 步,左侧是流感知到模型上下文到全双工大模型再到流输出的主路,右侧是记忆的构造检索组装。

看图路径: 1. 先看左侧从流感知经视觉音频编码器到模型上下文再到全双工大模型的纵向主路;2. 再看右侧记忆模块中构造检索组装三步的箭头走向;3. 对比相关性面板中被打叉的低匹配帧与新颖性面板中被合并的重复场景

原论文 Figure 5:Architecture of Realtime-Venus-Omni for audio-visual perception, full-duplex interaction, and…

论文图 5。原论文 Figure 5::“Architecture of Realtime-Venus-Omni for audio-visual perception, full-duplex interaction, and asynchronous delegation.”。

图中左侧显示视觉音频编码器输出进入模型上下文,查询同时指向上下文与右侧记忆检索;右侧构造面板显示帧过滤器打勾保留与打叉丢弃,长期区保留视觉帧与全部音频,短期区保留近期窗;检索面板显示查询匹配条长短代表相关度,被打叉的低分帧被滤除,重复场景被合并而独特内容保留,最终相关加新颖合成排序;组装面板显示检索到的远历史与近期窗相加后召回模型上下文。这种设计把记忆召回做成上下文重组而非改策略,适合对照消融中不同时长分桶的增益理解。

数据如何同时教会说话时机与后台任务管理?

公共后训练语料超 2,800,000 样本,分 9 类覆盖离线理解、前瞻全双工与委派。全能版用视频加音频,全音频版只用音频子集。离线理解约占一半以上,前瞻双工约占三分之一以上,委派工作流约占 6% 左右,双工与委派源都含带打断会话,使重叠语音作为普通交互被监督而非独立模块。统一训练配方支持视频、纯音频与纯文本输入,在单次后训练中混合全双工与离线轮流格式,监督稀疏只算回应区间,不含系统用户与媒体占位符。

全双工数据监督每秒听说决策令牌与口语文本,长回复跨多单位连续监督;每样本加权损失先除以其监督权重再在批内平均,避免长样本主导;长答案在语言模型头分块算交叉熵带重算以控显存;解码失败或超长样本在预处理丢弃;只更新思考器,声学解码器固定不计入目标。

双工目标 × 委派目标: 双工目标分工是监督遇到重叠语音时立即的会话动作,例如继续说、等待输入、停止排队音频或修订回应;委派目标分工是监督计算侧处理,例如保留、取消、修订、重试或回退后台工作。搭配理由是同一事件同时影响说话与计算,例如意图不变的打断可停播但保留语义计划,意图改变的纠正则取消依赖工作;组合意义是轨迹在共享时间线上同时标注交互控制与计算管理,使模型学会边说边管后台任务。

管线分 3 段:场景与交互规划、副语言与声学实现、时间对齐与模型物化。种子指定场景参与者用户目标语言画像声学环境与目标交互条件,再展开为事件级计划决定语义推进、说话人与受话人、话轮归属及每个输入事件是保留还是改变现行意图,覆盖日常沟通、信息寻求、协作任务、决策、服务与多方会话,也含停顿附和打断纠正对他人说话与背景语音。

计划轮转为语音并按意图边界与重叠排布,加入犹豫填充停顿重复自我纠正不完整话笑声呼吸以暴露轮流线索,前台对话与场景匹配的次要说话人及环境音混合,覆盖中文英文与语码切换,音视频实例把合成音频与视频同步并保留交互结构与委派标注。

对齐把音频视频文本与系统动作映射到单调会话时钟,每个事件记录来源时间跨度会话功能预期受话人与系统行为,保留重叠区间回应边界与受影响的助手输出部分,再物化为音频版或视频版数据,共享轨迹与监督:紧凑模型可见词表编码在线交互控制动作,不可闻委派请求后台结果与执行元数据留在结构化事件流。

事件对用户意图的影响连接两类目标:附和保语音与计算,他人 directed 与背景语音不建新路由,意图稳定的打断可停播但保留语义计划,意图改变的纠正取消依赖工作并重规划,工具依赖请求配即时反馈加异步执行,监督指明现行工作是保留取消修订对账重试还是回退。

评测在什么条件下进行?指标方向如何读?

视频侧用流式与离线两组基准。流式包括覆盖实时视觉、全源与上下文理解的任务集,覆盖实时感知回溯与前瞻主动回应的任务集,以及报告主动曲线下面积与探测模式准确率在线模式值的两套前瞻基准;离线报告总体准确率。音频理解用 4 套基准分别测语音音乐声音、长形空间多音频挑战、上下文声学推理与含语言副语言线索的口语理解,报告任务配置下的准确率。

口语问答用指令跟随、事实知识与中文学科知识的语音查询任务,其中一项用裁判打分,其余用答案准确率。全双工用 4 个场景:用户打断、用户附和、对他人说话与背景语音,4 类回应为回应、继续、表达不确定与无关或缺席,打断期望回应,其余期望继续前一回应。

工具使用用含填充停顿犹豫误起自我纠正的人录语音任务,跨四应用域,需单步或链式调用确定性模拟接口,工具选择用 F1 惩罚漏调多调,参数准确率测语义正确性,单次通过率要求调全预期工具、无多余调用且每调用参数正确。委派判断用自建基准分全能与音频两种输入模式,含外部能力、常规交互与推理 3 类,分别报告总体路由准确率、外部类委派召回、常规类非委派特异度与推理类路由准确率。

默认视频每秒采样 1 帧至多保留帧并缩放到约 448 像素保宽高比,流式预测只用查询或回应时刻可用的观测,离线可用采样片段;音频转单声道重采样到 16 千赫,全双工按 1 秒块处理且说话时感知保持开启,需语音输出时以 24 千赫生成。在线与离线基线分开报告,加粗与下划线只在在线模型中标最好与次好。

理解能力的主结果是什么?哪些领先哪些没有?

先看视频理解的比较问题:在相同在线流式条件下,全能版是否在流式与离线基准上同时保持竞争力,指标均为越高越好,离线模型仅供参考不参与最好标注。下表整理原文直接报告的全能版八项得分,覆盖流式四项与离线四项,便于 1 次核对。

基准StreamingBenchOVO-BenchDaily-OmniOmniProWorldSense
Realtime-Venus-Omni 得分70.264.781.329.054.0

表后解释需要同时说收益与代价。原文报告全能版在在线模型中六项最高,包括上述流式两项与离线日常项,相对基座在流式两项提升 2.3 与 4.0 个百分点,在线探测准确率提升 3.4 个百分点,并在其余两项离线基准更高。

但在前瞻视频问答与世界感知两项低于基座,说明流式理解、前瞻回应质量与离线理解需分开评估,且结果未分离各训练成分贡献,需受控消融才能归因。 再看音频理解与口语问答:在相同任务配置下,音频版是否保留通用音频理解,指标方向均为越高越好。下表整理原文直接报告的音频版得分。

模型MMAU 准确率MMAU-Pro 准确率Llama Questions 准确率Speech CMMLU 准确率AlpacaEval 裁判分
Realtime-Venus-Audio78.0%63.2%83.8%67.8%4.81

表后解释要给出未胜出项。

音频版在两项音频理解与两项口语问答领先并与基座并列裁判最高分,但在上下文声学推理基准次于大参数对照,在细粒度口语理解基准次于另 2 对照,在 trivia 类语音问答次于大参数对照,原文明确指出上下文声学推理与细粒度口语理解仍待改进,且总分不区分语音识别错与答案生成错。记忆增强按时长分桶显示全能版在所有报告区间提升,尤其长时段提升更明显,但对另一基座并非每桶都提升,说明增益依赖基座与评测设置。

重叠语音与工具委派能否同时做好?失败模式在哪里?

全双工的比较问题是:在打断需回应而附和他人说话背景语音需继续的不同要求下,模型是否选对动作,回应率在打断场景越高越好、继续率在其余三场景越高越好。下表整理原文直接报告的音频版四场景关键率。

场景用户打断回应率用户附和继续率对他人说话继续率背景语音继续率
Realtime-Venus-Audio0.750.970.880.86

表后解释要强调权衡而非单调胜利。

音频版在附和与背景语音继续率最高,对他人说话继续率次于全能版,但打断回应率低于 3 个对照,说明强继续不必然意味着强打断处理;原文要求四场景分开报告,加权聚合需显式权重,模糊重叠与回应切换时序还需进一步评估。以下导读对应全双工条形图,4 个面板分别对应 4 种重叠,左右两条分别对应错误与正确方向。

看图路径: 1. 先按四个面板确认用户打断要求回应而其余三者要求继续的方向标注;2. 再对比同一模型在回应率条与继续率条上的左右位置差异;3. 重点观察音频版与全能版在他人说话与背景语音两组继续率上的相对高低

原论文 Figure 2:Full-duplex interaction performance of Realtime-Venus.

论文图 2。原论文 Figure 2::“Full-duplex interaction performance of Realtime-Venus.”。

图中用户打断面板左侧回应条越长越好,右侧继续条越短越好,其余三面板相反;可见音频版在附和继续条最长且回应条为零,在背景语音继续条居首,在他人说话继续条略短于全能版,而在打断回应条明显短于最长的对照,这种交叉排序正是中断继续权衡的可视证据,读图时应先按箭头确认方向再判断好坏,不把单面板领先推广为全双工整体最优。 工具与委派的比较问题是:选对工具是否等于做对任务,该委派时是否委派与不该委派时是否克制。

下表整理原文直接报告的两前端工具三指标与自建委派四指标。

模型工具选择 F1参数准确率单次通过率委派总体准确率外部召回与常规特异度
Realtime-Venus-Omni86.0%53.1%43.0%75.93%68.33% 与 84.44%

表后解释要指出具体代价与反例。两前端工具选择分列第二第三,但参数准确率与整轮成功率低于领先对照,音频版参数准确率 54.2% 而单次通过率 48.0%,两者成功标准不同不能相减为中间失败率,需看单轨迹定位是参数接地、口语约束保持还是多调用协调问题。

委派上音频版外部召回高达 92.22% 但常规特异度仅 39.44% 表现为过度委派,全能版常规特异度 84.44% 但外部召回仅 68.33% 表现为漏委派,两者推理类同为 75.00%,且该基准只评决策正确不评执行与重入效果。

哪些结论不能下?边界与缺项是什么?

原文明确做了多处限定,复述时应保留。视频部分在两项基准低于基座,记忆增益依赖基座与时长设置,不能把总体趋势说成每组每步都成立。音频部分总分不区分识别错与生成错,上下文推理与细粒度理解的短板已点名,不能用领先项掩盖未胜出项。全双工部分强继续与弱打断并存,聚合需权重,模糊重叠与切换时序未充分评估,不能把曲线末步推广全程。工具部分选择强而参数与整轮弱,限制因素需查个体执行轨迹,不能把选对工具等同于任务完成。

委派基准为内部构建,只测路由决策,不测执行成功与结果重入对话的效果,且 2 模型呈现相反失败模式,需同时改进识别与本地直接处理。资源侧原文未给出训练算力、推理延迟、输出帧率与实际延迟的完整对照,训练资源、推理开销与实际延迟应分开讨论,未测量误判率延迟成本时不承诺这些量改善。相关性不等于因果,缺失证据不是技术错误,还需补的验证包括更细粒度流块、更长上下文下的意图跟踪、多步协调工具与延迟失败恢复。

要复现应先固定什么?最小可运行链路是什么?

复现先固定信息条件与时钟。视频默认每秒 1 帧至多 128 帧并缩放到约 448 像素保宽高比,音频转单声道 16 千赫,输出波形 24 千赫,全双工按 1 秒块处理且说话时感知保持开启;流式评测只用时刻可用观测,离线可用采样片段。

最小链路可沿一个样本走完输入到输出:输入 1 秒音视频特征与后台新文本,更新保留状态,预测听说结束三态之一,若说则生成前台文本并条件化语音令牌,若需外部能力则写私有委托区间并隐藏播报,后台冻结请求时刻证据异步执行,打磨为私有后台文本在可用块边界重入,前端按播放进度选文本放出量并经说话者合成。只更新思考器、冻结声学解码器的设置要保留,损失只算回应区间并按样本归一化,长答案分块算交叉熵的内存做法也应保留。

数据侧先复刻 3 段管线:场景种子到事件计划,再到副语言声学实现与重叠排布,最后到单调时钟对齐与双模态物化,并同时标注双工动作与委派管理。评测先跑四场景全双工与工具三指标,再跑自建委派四指标,注意回应与继续方向相反、百分点与相对百分比不同、不同指标差值不放模型列下、自动指标不當人评。

当前资源状态为未发现来源绑定且完成验证的资源,不得声称代码模型或数据已公开,本次也未能确认可达,应按原文方法自行实现或等待官方发布。

何时值得尝试这套做法?一句话收束是什么?

当任务同时满足三点时值得尝试:输入是连续到达的语音或音视频而非单轮文件,对话中会出现附和、他人说话与背景语音等不应打断的 overlapping speech,以及部分请求需要查外部信息或跑长推理但又不能停下对话。此时可借鉴双环分工:前台用块级听说结束控制保连续性,后台用冻结快照保可执行性,返回用新鲜度与回放感知保播报时机。

常见误解是把重叠都当打断、把选对工具当做对任务、把长记忆当成无限上下文,原文用附和继续与打断回应的分离、选择与参数及整轮的三指标分离、记忆分桶增益依赖基座的对照纠正了这些误解。收束是:把说话时机与后台任务放在同一因果时间线上联合监督,可以在保持对话的同时获得外部能力,但打断灵敏度、参数接地与委派阈值仍需按场景调参并补足延迟与失败恢复的测量。

📎 论文与评分元数据

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-16 语音/音乐/音频论文速递