从能说话到能办事:Qwen-Audio-3.1-Realtime 如何把推理、执行与说话时机分开训练
该工作把实时语音交互拆为思考、行动与说话协调三层,用文本教师蒸馏加可执行环境强化学习提升多轮约束跟踪与工具执行,在半双工语音版 τ-Voice 上总成功率从 78.4% 升至 82.0%,代价是部分流畅性与延迟指标并未同步最优且长时程口语任务仍未验证。
该工作把实时语音交互拆为思考、行动与说话协调三层,用文本教师蒸馏加可执行环境强化学习提升多轮约束跟踪与工具执行,在半双工语音版 τ-Voice 上总成功率从 78.4% 升至 82.0%,代价是部分流畅性与延迟指标并未同步最优且长时程口语任务仍未验证。
论文要解决长音视频生产力任务中感知与长程规划脱节的问题,选择原生多模态共训加百万上下文与按需取证的智能体执行,证据是多说话人识别与长视频推理的大幅提升,代价是通用转写翻译仍有差距且实时交互需非思考模式换取低延迟。
针对串行先想后说导致长时间无声等待的问题,该工作用推理主路加轻量报幕支路的异步结构,在保持串行推理问答精度基本相当的同时,把用户可感知的静音大幅压低,代价是需要额外的报幕生成与动态调度。
MSI-Bench 用 1152 个多人多轮语音场景考查说话人限定的记忆、指令跟随与推理,最强配置英文全通过率仅 66.8%、中文 54.5%,开源模型主要卡在多人语音感知,前沿模型则卡在干净文本上的说话人限定决策与开口克制。
RoleBreak 用 310 个角色与 6688 个多轮语音轮次同时测语义角色保持与声音情感表达,发现最强系统仍在平均 10.4 轮出现人格失败且全部系统情感分低于 14.7,而把语言模型从 2B 放大到 27B 能推迟语义失败却几乎不改善声音情感。
针对语音共情对话中只做情绪识别就直接生成的问题,ER-EDF 用感知加规则调节再提示生成的链路组织回复,在 IEMOCAP 与 MELD 构造的两种共情参考上多数情况下提升共情指标,但高强度表演式对话与小模型接地能力仍是代价与边界。
MP-Bench 用合成四人语音与显式、隐式、消极三类轮次条件测语音智能体,12 个系统的最强证据是带完美说话人标签的文本上限接近满分而实时语音系统在游戏轮次上徘徊于随机水平,代价是完全受控合成、无重叠与单决策点评估。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
论文提出只用原始音视频判断最后说话人在跟谁说话的 Omni-MMSI 任务,并用参考引导的工具抽取加两步思维链推理的 Omni-MMSI-R 解决身份归属难题,在 Ego4D 和 YouTube 上取得报告的最优准确率,代价是需手工构建参考对和过滤生成推理标注。
针对多人交互中只建模说话或只建模双人的不足,PolySLGen 用过去全组语音与动作为条件联合生成目标人的文本、语音风格、身体动作和说话状态分,证据是动作与说话状态预测上优于多个基线,代价是推理约 5 帧每秒且说话状态预测仍困难。
ViBES 针对多轮对话中语言与身体脱节的问题,采用文本语音专家加面部与身体专家的混合模态专家结构并在 25 帧统一时钟上联合生成,在对话行为基准上取得高于共语音手势与文本到动作基线的对齐度,代价是依赖单目重建数据与尚不完善的行为评价。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对文本角色扮演忽略语音自发性和人物声音一致性的问题,ActorMind 用眼耳脑口四智能体的现成推理流程组织语音合成,在 Friends 第一季构建的 7653 句基准上以 RP-MOS 取得平均 3.56 分的报告结果,但其评估依赖小规模主观打分且未训练模型参数。
AEQ-Bench 用 1,885 个音频加文本实例把共情拆成生成回应与判断回应 2 类任务,用相同话语换语境和相同语境换语调 2 种对照进行测试,报告显示带音频输出的模型在自然度与语音表达上占优,而细粒度韵律自动评估仍不可靠,代价是依赖人工核验与粗粒度量表。
该研究把多轮语音交互拆成记忆、指令、一致性和语音改口四个轴,用 452 段无脚本真人录音和 1712 条原子细则做固定上下文评测,报告最高模型仅 54.65% 通过率且语音改口最难,同时付出长音频一致性下降与声音线索记忆明显弱于语义记忆的代价。
AV-Dialog 针对多人干扰下跟丢目标说话人与抢话时机错乱问题,用声学码加唇部视觉做流式理解与轮次预测,在干扰下把轮次预测准确率从 54% 提升到 79%,代价是双模型并行与视觉前视带来的额外延迟与显存开销。
针对中文儿童语音数据少、方言覆盖窄、缺少完整对话的问题,论文构建 112.5 小时 498 名 2-8 岁儿童与 500 名看护人的 ChildTalk 语料,并在同库与跨库上证明微调能稳定降低字错率,而加入上文提示可进一步减少替换与删除错误,但低资源方言与低龄段仍很困难。
针对多语平行口语对话稀缺且翻译腔重的问题,论文用 WHO 知识库加对话行为大纲加母语者即兴实现的方法造出 6 千对话与 163 小时语音,基准显示英语检索与过滤持续领先而阿拉伯语最低,代价是内容未经临床验证且语音到文本检索几乎失效。
针对先想后说首音等待过长而边想边说又破坏思维块原子性的矛盾,论文用流式掩蔽机制保证音频不欠载、用原子一致性修复重建逻辑因果,在 VoiceBench 上从 67.24 提升到 73.41 的同时把首次音频延迟从 20.35s 降到 3.65s、实时率从 7.04 降到 1.05,代价是依赖外部教师模型打分且复杂混合推理仍与串行思考存在小幅差距。