英文题目:PUBG Ally: A Conversational Embodied Agent as an AI Teammate
标签:#语音对话系统 | #知识蒸馏 | #游戏音频 | #端侧运行
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.3/1.5
👥 作者与机构
- Beomsoo Kim:机构信息未在 arXiv HTML 中可靠披露
- Byeongju Kim:机构信息未在 arXiv HTML 中可靠披露
- Dohyun Kim:机构信息未在 arXiv HTML 中可靠披露
- Dongwon Kim:机构信息未在 arXiv HTML 中可靠披露
- Eunchong Kim:机构信息未在 arXiv HTML 中可靠披露
- Hongmin Kim:机构信息未在 arXiv HTML 中可靠披露
- Hyeojung Im:机构信息未在 arXiv HTML 中可靠披露
- Hyeonbin Hwang:机构信息未在 arXiv HTML 中可靠披露
- Hyeonghwan Kim:机构信息未在 arXiv HTML 中可靠披露
- Hyoseok Seol:机构信息未在 arXiv HTML 中可靠披露
- Insub Im:机构信息未在 arXiv HTML 中可靠披露
- Irene Chen:机构信息未在 arXiv HTML 中可靠披露
- Jaeseung Jeon:机构信息未在 arXiv HTML 中可靠披露
- Jimin Hong:机构信息未在 arXiv HTML 中可靠披露
- Kiyoon Yoo:机构信息未在 arXiv HTML 中可靠披露
- Minkyoung Park:机构信息未在 arXiv HTML 中可靠披露
- Seohyeon Jung:机构信息未在 arXiv HTML 中可靠披露
- Seungjun Chung:机构信息未在 arXiv HTML 中可靠披露
- Sue Hyun Park:机构信息未在 arXiv HTML 中可靠披露
- Sungwoo Kim:机构信息未在 arXiv HTML 中可靠披露
- Youngin Cho:机构信息未在 arXiv HTML 中可靠披露
- Yujeong Son:机构信息未在 arXiv HTML 中可靠披露
- Kangwook Lee:机构信息未在 arXiv HTML 中可靠披露
- Hyunseung Kim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是为PUBG Sanhok地图双排提供可语音协作的具身队友,输入为持续演化的游戏状态与玩家按键发话语音,输出为同步的语音回复与游戏内高层动作,难点在于实时性、语音与行为一致性、意图理解与跨轮记忆。事件驱动的System 2语言模型智能体经有界工具按需观测对局信息并解析语音维持上下文,其输出的高层意图与语音决策进入下一步执行。System 1行为树以游戏节拍将该意图转译为移动战斗拾取救援等实时控制并支持抢占恢复,其沉淀的对局轨迹进入下一步训练。基于近39k真人陪玩会话轨迹的教师修正与三阶段蒸馏再将该行为压缩到端侧小语言模型用于部署。与全量状态输入与单速率控制的既有游戏智能体不同,该设计以按需观测保持上下文新鲜并以深思与快控解耦把推理移出实时环路。在能力评测设置下,蒸馏后2B学生的Fact得分为0.932,低于教师的Fact得分0.944。该结论限于Sanhok单人配Ally双排与韩英中三语,其战斗评分仅2.58/5且残留跟随失败与边界击穿,跨地图与跨人群外推尚未验证。原文附录披露了云端教师单局API成本,端侧推理无API成本但未披露训练成本。
🔗 开源与复现资源
- 复现相关资源:https://pubg.com/en/clause — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么难到需要两套脑子?
这篇论文的输入是真实双排对局中的连续信号:1 名人类玩家的按住说话语音、不断收缩的安全区与蓝圈、散布的武器防具与补给、敌情枪声与击倒事件,以及跨对局的偏好与承诺。目标是做出一个可共玩角色,即与人类共享胜负、能边打边聊的语音队友,而不是只会自己打的对战智能体。论文把部署范围收窄到萨诺地图 64 人双排、人类加 Ally 的设定,玩家用专用按住说话通道给出每句话的清晰起止,对局在推理期间继续推进。
必须保留的信息包括近 39k 场真实对局的交互轨迹、端侧运行约束、以及玩家把 Ally 当工具还是队友与伙伴的主观评价。输出是一套可复述的方法:慢层语言模型负责意图与说话,快层行为树负责每刻控制,二者用有界工具衔接。图 1 把这种目标具体化为一局内的 4 个例子:商量跳点、搜刮时找药并标记、转移中报敌、倒地后封烟扶人。 导读这张总览图时,先把它当作一局的时间线来读,不要只看单张游戏截图。
每列上方的小地图表示阶段,中间是游戏画面,下方是对话与动作条,观察点是语音与动作是否指向同一件事。
看图路径: 1. 从左到右看 DROP、LOOTING、ENGAGEMENT、TEAMWORK 四个阶段的标题与小地图;2. 对照每列下方玩家话语、Ally 的 OBSERVES 与 CHECKS 行再看回复与黑色 ACTION 条;3. 重点看最右列倒地后先报方位再写烟雾与扶人的两步动作
论文图 1。原论文 Figure 1::“PUBG Ally as a Co-Playable Character (CPC).”。
四列的教学价值在于展示同步要求。第一列玩家问跳哪里,Ally 回顾过去常跳卡豪再提议遗迹并设置目的地;第二列玩家问药,Ally 观测到附近医疗包后说话并标记;第三列游戏事件先给西南枪声与南侧发现敌人,Ally 报出 80 米南侧敌人;第四列玩家倒地后 Ally 先报 2 点钟敌人,再检查烟雾与扶人条件,最后连续执行封烟与扶人。
例子表明,好的队友不是每句都回,而是观测、检查、说话、动作四者一致。对语音音频方向的研究生而言,这里真正的输入不是干净语音文件,而是带噪声、省略与俚语的短句,输出也不只是文字,而是必须在 1 秒量级内落到游戏动作上的语音。
与纯打游戏智能体和纯聊天智能体有何不同?
论文把相关路线分成 3 条。第一条是自主对战智能体,目标是把游戏打赢,典型做法是给固定观测与动作空间做大规模训练;这类系统不需要长期对话,也不必向人类解释意图。第二条是基础模型做成的工具型产品智能体,目标是在仓库、终端、文档等可暂停环境中检查外部状态、用工具、看反馈再迭代;这类环境允许等模型慢慢想。
第 3 条是游戏内会话角色与队友,例如扩展对话的非玩家角色、世界模拟角色、自适应对手,以及近期出现的语音队友。论文报告的对照是:Ally 属于第 3 条中的队友分支,但约束更严,需要在实时多人对局中同时满足 timing、安全与竞技完整性,还要支持韩英中三语的端侧部署。教学例子是:若把软件编码智能体的成功做法直接搬过来,模型可以在终端前思考 10 秒再改代码;但在吃鸡决赛圈多想 2 秒,报点就过时了,烟雾也封晚了。
因此论文没有把全屏像素流或全量对局状态丢给模型,而是用受控观测工具每次只取决策相关的切片。
双排一局到底要求智能体解决哪些子问题?
论文把双排拆成通信、记忆、行动与时机 4 类问题。通信上,玩家指令常不完整,例如注意那一侧、安全打法等说法需要结合地形与敌情推断意图,还要听懂地名、武器配件与社区黑话。记忆上,偏好、此前的决定和局内承诺要跨情境携带,例如答应找的物资、约好的转移路线。行动上,说话与动作必须同源,不能出现嘴上说进攻、实际不动,或声称跟随了根本不存在的标记。时机上,反应慢、目的地过期、回复太长都会让队伍脱节。
论文明确指出,语音与动作不是相加关系:播报一旦与观测和意图脱节,就会误导队友做错误决策。一个可复述的检查方法是,每次 Ally 说话后去核对三件事:它刚才调了哪个观测工具、工具返回了什么、随后是否发了对应的高层动作。若三者断裂,就属于语音动作不一致,这也是后文新增评分器的来源。
总览:慢想快做如何分工又不各说各话?
Ally 的运行时分成语音、推理与执行 3 段。语音转文字把玩家话语转成文本,语言模型智能体结合文字化游戏事件与主动请求的观测生成回复文本,语音合成再把回复变成 Ally 语音;同时语言模型向行为树发高层动作请求,行为树以游戏节拍执行。论文强调只有行为树每刻与对局交互,语言模型不在实时控制环内,对局在模型推理期间继续演化。
部署上语言模型与语音转文字、语音合成都跑在玩家本机,避免网络往返,并与吃鸡客户端共享计算与显存,目标是至少 8 GB 显存的消费级显卡,且同一时间只跑一路语言模型推理。 下面先看运行时管线,再解释双系统如何耦合。管线图左侧是玩家与游戏世界,中间是端侧运行时的语音与状态输入,右侧是语言模型与行为树,箭头方向就是数据方向。
看图路径: 1. 先沿玩家语音到语音转文字再到 System 2 的主路径看输入方向;2. 再看文本游戏状态输入从游戏世界进入 System 2 的另一条输入;3. 最后看 System 2 向下发动作请求到 System 1 再发游戏动作的执行路径
论文图 2。原论文 Figure 2::“PUBG Ally runtime pipeline. Speech-to-text converts player speech into text.”。
这张图的可执行读法是区分两种箭头。黑色横向箭头是信息进入语言模型:玩家说带我走变成文字,安全区更新与航点方位距离变成文本事件与观测。紫色环形表示语言模型内部多轮工具推理。绿色向下与向左箭头是执行:语言模型发动作请求,行为树发游戏动作。耦合的关键在论文的一句话设计:语言模型设定当前意图,行为树在立即响应对局变化的同时把意图执行下去。
举例来说,语言模型决定去扶人并说正在扶,行为树负责顶着枪线走位、扔烟、读条扶人;若中途出现更高优先级的自保条件,行为树可以抢占,但语言模型下一轮会收到失败或中断事件并重新解释。
System 2 × System 1: System 2 指语言模型智能体,负责理解玩家语音、查阅对局信息、决定说什么和提交高层动作意图;System 1 指行为树执行层,负责在每个游戏节拍把意图翻译成移动、交战、搜刮、扶人和自保等即时控制。二者搭配的理由是语言模型推理慢但擅长意图与上下文,行为树快且可抢占但不懂对话,组合后慢层定方向、快层保底线,新增作用是让说话内容与正在执行的动作保持一致。
这种分离也决定了后文所有训练与评测的组织:语言模型学的是何时观测、说什么、是否维持或更新高层动作;行为树的反应速度与手感则由数据结构与优先级保证,不靠语言模型每刻输出鼠标键盘。
智能体一轮循环看到什么、能调什么、留下什么?
语言模型一轮循环的上下文按稳定程度排布:系统提示、工具定义、事件历史、结转计划、当前输入。系统提示规定队友角色、可见信息、通信约束与功能边界;工具共 16 个,分 6 组,覆盖对局观测、知识记忆、动作执行、玩家通信、循环控制与安全控制。动作发出前先调可用性检查工具确认可执行并拿到合法参数;若玩家要的信息不可观测,模型被要求直说不可用而非猜测。
若请求超出可用控制,模型给出可执行的替代,例如跟随、去地标或打标记。每轮结束时,经观测工具拿到的对局事实不向后携带,避免过时信息污染下一轮;未完成的工作则经精简调用写成短计划带到下一轮。事件历史超限时批量删除最旧一批,以保持提示前缀稳定、复用键值缓存。论文报告这种缓存友好的布局在部署运行时达到每会话平均约 90.7% 的前缀复用。
有界工具接口 × 文本化观测: 有界工具接口指智能体只能调用的 16 个受控工具,分为对局观测、知识记忆、动作执行、玩家通信、循环控制和安全控制;文本化观测指把快速变化的原始游戏信号转成简短文字摘要再交给模型。分工是前者限定能做什么,后者限定能看到什么,搭配理由是避免把全量对局状态灌给模型造成过时与幻觉,新增作用是让每次决策只基于当前需要刷新的事实。
事件调度进一步控制主动性。每个事件类型独立规定对说话与动作的期待强度,例如玩家对你说话要求说话、建议动作,玩家倒地要求说话、建议动作,敌人暴露建议说话、可选动作,找到玩家要的物品要求说话但抑制动作,当前动作完成则抑制说话但建议动作。冷却抑制重复触发,事件描述的措辞也避免不重要事件打断正在进行的任务,空闲超时会周期性唤醒。教学例子是扶人序列:玩家倒地事件唤起模型,模型查战斗状态与装备,扔烟并播报,下一轮收到烟雾完成事件后再查队友状态并执行扶人,同时把中断的清敌任务留在计划里。
事件驱动唤醒 × 反应先验: 事件驱动唤醒指智能体不是按固定时钟运行,而是被玩家说话、被击倒、发现敌人、动作完成等事件或空闲超时唤起;反应先验指每个事件类型独立规定对说话和动作的期待强度。分工是前者决定何时运行,后者决定多强的回应倾向,搭配理由是既要主动又不能打扰,新增作用是不改模型权重就能调积极程度。
执行侧的行为树是类型化数据而非写死代码,根部是每刻重查优先级的反应式选择器,高优先级分支可抢占低优先级分支。语言模型经两条通道操纵它:临时动作注入把跟随、去标记点、原地待命、扶人、优先指定物品等参数化子树插到最高优先级的直接指令分支,完成后占位自动回退;持久模式变量则改变战斗、搜刮、移动等整条分支是否可用。任务节点从不阻塞等待游戏结果,而是报告运行中,结果以后续事件回到语言模型,失败则回退并发出事件供下一轮重试或向玩家解释。
近 39k 场真人对局如何变成端侧小模型?
数据采集在韩国网吧进行 28 天,1046 名参与者与 Ally 打完整对局,记录玩家语音、游戏事件、Ally 请求的信息、工具结果、Ally 回复与执行动作,并关联赛后反馈但不直接把反馈当训练目标。前两周用 31B 教师模型加优化后的提示收集初始演示,后两周让 successive 小模型版本上场,从而采到由学生自身行为诱发的新情境,再用教师对选定的学生交互生成修正,累积加入语料。论文称此思路受在线聚合启发:只学教师走过的地方不够,还要纠正学生会走到的地方。
语料还要做平衡,压制附近枪声与发现敌人等高频重复模式,保留需要对话、观测与合作决策的样本;另有合成与安全样本补覆盖。划分上按对局阶段、Ally 存活结构与说话强度分成 36 格,每日按比例抽约 5% 验证与 5% 测试,同对局的会话不跨划分泄露。 下表把采集规模整理成可核对的一览,重点是人数、天数、场次与每场平均轨迹数,便于估算训练与评测成本。
表前比较问题是:数据是否来自真实交互而非脚本回放,公平条件是同一网吧环境与完整对局,指标方向是场次越多、轨迹越密,对学生诱发分布的覆盖越好。
| 数据条件 | 统计口径 | 采集规模 | 平均强度 | 可用性 |
|---|---|---|---|---|
| 网吧真人采集 | 天数 | 28 天 | 每天连续组局 | 真实交互 |
| 网吧真人采集 | 人数 | 1046 人 | 有吃鸡时长门槛 | 签署同意 |
| 网吧真人采集 | 场次 | 38956 场 | 全量对局 | 完整录制 |
| 单场平均 | 时长 | 14.1 分钟 | 每场 | 含语音 |
| 单场平均 | 轨迹数 | 59 条 | 每场 | 工具全记录 |
表后解释是:平均每场 14.1 分钟、59 条轨迹意味着单条轨迹约十几秒,恰好对应 1 次唤醒到精简调用的决策单元;近 39k 场的价值不在于时长本身,而在于玩家与 Ally 互相改变行为后产生的分支。
未胜出项是:若只用教师演示而不补学生诱发轨迹,部署后会进入训练未见的上下文;论文用教师修正而非直接拿学生错误回复做目标来避免强化错误。 3 阶段训练的图像把蒸馏过程讲得很直白。第一行是 8B 中间教师在记录轨迹上做有监督微调,目标是硬的独热标记;第二行是 2B 学生在同样记录轨迹上学 8B 的软分布; 第三行是 2B 学生自己生成轨迹再学 8B 对这些新轨迹的软目标。
看图路径: 1. 对比三行中浅紫记录轨迹与浅绿学生生成轨迹的来源差异;2. 看每行末端指向 8B 或 2B 的训练箭头与虚线延续训练箭头;3. 注意硬目标单条标记与软目标分布标记在回复位置的不同画法
论文图 5。原论文 Figure 5::“Three stages of language model training.”。
读图时不要把箭头当权重拷贝。粗箭头表示训练,虚线表示把第二阶段学到的 2B 权重继续带到第 3 个阶段;蓝色与绿色区分记录回复与学生生成回复,单条与分布图标区分硬目标与软目标。论文还说明每个地区用不同基座:英语用 Mistral-NeMo-Minitron 的 8B 与 2B,韩语用 Kanana 1.5 的 8B 与 2.1B,中文用 Qwen3 的 8B 与 1.7B;韩语基座在 3 阶段前另有知识注入。
离策略蒸馏 × 智能体在线蒸馏: 离策略蒸馏指用已记录轨迹训练 2B 学生,以固定 8B 教师的输出分布为软目标;智能体在线蒸馏指让当前 2B 学生自己生成回复和工具调用,再由运行框架重建游戏上下文并给出工具结果,最后仍用 8B 教师对这些学生生成的位置给出软目标。分工是前者学历史正确做法,后者学自己会走到的新上下文,搭配理由是学生上线后会改变玩家与对局分布,新增作用是把工具交互形成的轨迹也纳入蒸馏。
对音频方向的启示是:语音识别与合成也做了游戏域适配,但论文把主要训练火力放在语言模型的交互轨迹上,因为同步问题的瓶颈在何时说什么与是否更新动作,而不在单个词的发音。
评测如何从玩家偏好反推该测什么、权重给谁?
论文把评测本身当作学习问题,因为队友好坏没有标准答案,只能从玩家体验反推。离线评测用固定上下文让模型生成新轨迹再打分,成本低但只是代理;在线评测让玩家打完整对局并做盲测偏好,保真但贵。流程是:每轮新模型先过离线能力与离线安全,再经小规模在线选出候选,最后与现任最优做大规模组内偏好对比,共 797 份偏好来自 433 名不重复玩家。
能力测试集从留出轨迹中按赛后反馈分成负反馈子集与正反馈子集,前者多为激烈战斗与复杂动作,后者多为平静对话;评分器包括规则检查与大模型裁判,裁判用零温度的 Gemini 3 Flash 与 GPT-5.1,维度覆盖事实 grounded、事件响应、意图理解、指令坚持与轨迹质量,另有可部署门拦截退化生成与非法工具调用。安全评测分有害输入与良性输入,有害分广覆盖公开基准与产品级多轮对话,后者按此前边界是无压力、守住、松动、已破分组;裁判主要用 Gemini 3 Flash,并在 266 条专家标定上报告灵敏度与一致性。
无害回复率 × 过度拒答率: 无害回复率指在有害输入评测中经由说话工具生成的候选话语被判为不助长伤害的比例;过度拒答率指在良性游戏语音中模型不必要地转入戒备或拒绝的比例。分工是前者量安全下限,后者量合作可用性,搭配理由是游戏内击杀、包抄、击倒等说法表面像有害内容,新增作用是同时约束漏过有害内容和误伤正常战术交流。
下面两条公式是迭代精化的概念写法,不是可直接优化的损失。第一条说某行为主题得分是各评分器得分的加权和,权重非负且和为 1;第二条说理想目标是找到让未知玩家偏好函数最大的模型。
\[G_{t}(h)=\sum_{i}w_{t,i}\,G_{i}(h;\theta_{t,i}),\qquad w_{t,i}\geq 0,\qquad\sum_{i}w_{t,i}=1,\]\[\max_{h}\;M^{\star}(h).\]公式符号解释是:h 为候选模型,t 为轮次,theta 为评分标准,w 为主题内权重,alpha 为聚合设置,G 为主题分,M 星为未知的真实玩家偏好。计算目标是先用当前套件做离线两两比较,再用在线偏好、自由文本与轨迹修正评分标准、权重与聚合。原文未给出 w 的具体优化器与梯度路径,因此只能复述学习排序的思想,不能脑补为端到端可微训练。缺项也要点明:权重在每轮比较内固定、轮间更新,但更新所用的配对样本量与正则化细节未完全展开。
小模型能否追平大模型,端侧延迟到底赢多少?
能力部分先看教师提示优化。优化前 Gemma 4 31B 在事件、指令、轨迹三项落后外部参照 Claude Opus,优化后事件与轨迹的置信区间不再重叠,事件追平参照,轨迹差距大幅缩小,指令项虽提升但区间仍重叠。蒸馏前 2B 基座的最大短板在轨迹与指令,说明能听懂意图但难以贯彻为动作;蒸馏后五项均与教师区间重叠。下表把可运行策略与基线放在同一视野,比较问题是端侧可部署的 2B 是否达到教师水平,公平条件是同一能力测试集与同一运行框架,指标方向是越高越好。
| 评测条件 | 评测指标 | 外部参照 | 教师模型 | 可部署策略 |
|---|---|---|---|---|
| 能力评分 | 事实 grounded | 0.951 | 0.944 | 0.932 |
| 能力评分 | 事件响应 | 0.951 | 0.952 | 0.954 |
| 能力评分 | 意图理解 | 0.925 | 0.960 | 0.953 |
| 能力评分 | 指令坚持 | 0.925 | 0.889 | 0.876 |
| 能力评分 | 轨迹质量 | 0.924 | 0.910 | 0.902 |
表后解释是:主要收益在事件与意图两项基本追平,代价是轨迹与指令仍略低于教师但差距已在抽样不确定性内;未胜出项是未经 Ally 后训练的 2B 基座在轨迹与指令上明显落后,说明交互后训练而非基座本身带来贯彻能力。限制是这些是离线裁判分,不是真实对局胜率,裁判偏好与玩家偏好的差距正是下一节要修的。
延迟部分看整条语音往返。端侧 1 次说话交换约 1.6 秒,云端约 3.4 秒;语言模型中位 0.80 秒对 2.54 秒,90 分位 0.91 秒对 3.46 秒,语音转文字与语音合成分别约 0.12 秒与 0.70 秒。轨迹越长差距越大,每多 1 次模型推理端侧约加 0.78 秒而云端约加 2.45 秒,6 次推理的轨迹端侧仍在 5 秒内而云端超 10 秒。
看图路径: 1. 先确认横轴是每条轨迹的语言模型推理次数、纵轴是整条轨迹总延迟;2. 比较蓝色端侧与橙色云端两条中位线随推理次数上升的斜率;3. 观察每条线周围从中位到 90 分位的阴影带宽窄差异
论文图 8。原论文 Figure 8::“Total LM latency by trajectory length, computed from recorded gameplay trajectories (Section 4.1).”。
这张图横轴是每条轨迹的推理次数,纵轴是整条轨迹的语言模型总耗时,蓝色端侧线更平且阴影更窄,橙色云端线更陡且阴影更宽。像素细节支持的判断是:端侧优势不仅是单次更快,而且多步工具交互下仍可用;不能把曲线向下直接读成性能变差,因为纵轴是耗时,越低越好。未评测边界是:这里只计语言模型耗时,不含网络抖动与渲染争用,真实低端显卡的尾延迟需另测。
安全配方与数据成分各自补了哪块短板?
安全主结果显示,从 2B 基座到能力后训练再到最终安全配方,有害输入的无害回复率逐段上升。最终模型在广覆盖基准上模型侧达 98.3% 到 99.4%,在产品级对话上模型侧达 84.1% 到 99.0%,再加运行时关键词过滤后产品级达 91.0% 到 99.0%,其中韩语因直接复述式残留多而最吃过滤增益。代价是良性过度拒答从接近零升到 2.2% 到 6.1%,绝对值仍低,说明多数战术黑话仍被当作正常游戏交流。
成分分析进一步拆开:广覆盖合成数据把基准从 72.3% 拉到 94.8% 但产品级几乎不动,加入真实对局安全数据后产品级升到 84.1%,最终配方保住产品级并把基准推到 98.3%。按边界分组看,真实对局数据对已松动与已破的恢复组提升更大,但已破组仍是主要残留失败,模型侧仅 63.6%。下表把 3 阶段参照放在同一行,便于看到每一步的收益与代价,比较问题是安全加强是否以误伤正常交流为代价,公平条件是同一有害与良性集合,指标方向是无害越高越好、拒答越低越好。
| 评测条件 | 评测指标 | 基线行为 | 中间策略 | 可部署策略 |
|---|---|---|---|---|
| 良性游戏语音英文 | 过度拒答率 | 1.6% | 0.8% | 6.1% |
表后解释是:表格数字以韩语等条件为代表整理趋势,英文与中文的绝对值更高但走向一致;主要收益是广覆盖几乎封顶且产品级大幅改善,具体代价是良性拒答小幅上升。
反例是中文产品级在最终模型的回复覆盖率从 100.0% 降到 91.5%,说明更安全的模型有时选择沉默,沉默不计入无害率分子,需要同时看回复率。质性模式也分地区:中文主要是区分击杀与急救等游戏速记,英文是更稳定地拒绝仇恨诱饵,韩语残留多为音译脏话与专名的字面复述,更适合用运行时过滤拦截。 在线偏好侧,云端切端侧时 v1 以 69.5% 对 18.8% 大胜,但论文提醒这主要是响应更快而非质量更高,中途等延迟重测反而云端占优。
后续端侧版本间只有 2 次显著提升,其余在统计噪声内,而净推荐在阶段层面维持在 30 多个百分点。这支持离线分追平不等于在线体验封顶,延迟本身就是体验。 比较问题是有害评测的无害率提升是否以回复覆盖率为代价,公平条件是同一有害输入集合下同时报告是否发声与发声是否有害,指标方向是覆盖率与无害率越高越好。
| 评测集合 | 语言条件 | 基线响应率 | 能力训练后响应率 | 最终模型响应率 |
|---|---|---|---|---|
| 生产代表对话 | 韩语输入 | 16.4–17.9% | 92.3–100.0% | 91.5–100.0% |
| 生产代表对话 | 英语生产代表输入 | 23.4% | 92.3–100.0% | 91.5–100.0% |
表后差异解释是基线经常不发声因而分母很小,能力训练先把发声覆盖率拉满,最终安全配方在中文生产代表对话上覆盖率从 100.0% 回落到 91.5%,说明更谨慎的模型用沉默代替了部分高风险回复,边界已破仍是主要残留挑战,需要同时看覆盖率与无害率才能判断真实玩家暴露面。
哪些问题论文承认还没解决?
论文明确列出 3 类未解决。首先是支架与模型未联合优化,提示、工具、事件冷却与上下文压缩是先定后训,未来可用自动支架优化或交替更新思路改进。其次是交互仍是按住说话加轮流发言,模型在工具调用期间不能处理新话语,不支持全双工打断与重叠语音,论文点名了可能的流式语音方向。
第三是队友行为的长尾失败:玩家反馈提到扶人犹豫、报点滞后、找物目标在玩家不想要后仍残留、跨对局记忆偶发不一致,这些在案例中是能做出的行为,不代表每次都成功。安全上,已破边界的恢复仍是最弱环,过度拒答虽低但非零,运行时过滤只能拦关键词而不能保证上下文安全,输入侧的标记删除又依赖模型先正确识别有害输入。评测上,离线与在线的差距需要持续修补,生活 beta 与网吧人群的招募与暴露不同,不能把两地分数差读成同一批人的进步。
资源状态方面,论文正文给出隐私条款链接,本次资源检查显示该链接当前可用,但这只说明条款页可达,不代表代码或权重已公开。
若要复现,先搭什么、用什么条件、核对哪些数字?
复现应先搭双层运行框架,而非先训大模型。第一步实现事件循环:按玩家说话、倒地、敌情、动作完成与空闲超时唤起语言模型,配冷却与反应先验;实现 16 工具的最小可用子集,至少包括战斗信息查询、装备查询、动作可用性检查、动作执行、说话、精简与不安全标记。第二步实现上下文管理:每轮结束丢弃观测事实、保留短计划,提示按系统、工具、事件历史、计划、当前输入排序,历史超限批量截断。
第三步实现行为树最小优先级:直接指令高于自保反射,自保高于战斗、支援、区域、搜刮、移动与空闲跟随,动作注入用完即回退。数据侧按论文口径记录玩家语音文本、游戏事件、请求观测、工具结果、智能体话语与动作,并按对局阶段、存活结构与说话强度分层划分,同对局不跨划分。训练侧用 3 个阶段:8B 硬目标微调、2B 离线软目标蒸馏、2B 在线交互蒸馏,温度 1.0 的前向散度在记录与学生生成轨迹上分别实施。
核对数字时要同时锁定数据集、模型、阶段、指标与聚合:能力五项是裁判均分,安全是说话候选上的无害率与良性拒答率,延迟是中位与 90 分位,推荐度是首二减末二的百分点。硬件按消费级显卡加端侧语音栈估算,语音转文字跑 CPU、语音合成约 700 MB 显存、语言模型 4 比特量化后每地区约 1.0 到 1.4 GB 权重加缓存总计约 1.6 到 2.1 GB。常见误解是把自动裁判分当成人评,或把百分点差当成相对百分比,或把末步最优当可部署收益;论文的在线偏好明确用组内盲测与二项检验,避免这些误读。
何时值得借鉴这套做法,还差哪项验证?
当任务同时满足三点时值得借鉴:环境在推理期间继续变化、语音与动作必须同源、端侧延迟与内存有硬约束。此时把全量状态换成按需文本观测、把实时控制换成行为树保底、把评测换成离线代理加在线偏好双轨,往往比单纯放大模型更有效。生活 beta 的描述性结果也提示了产品含义:在 141 国问卷中经对局记录确认的玩家里推荐净值高出负面 25.1 个百分点,信息战术最被看重,同时约三成选伙伴 framing、近二成选队友 framing,说明对话价值与战斗贡献是两条独立轴线。
对语音音频研究生的具体建议是:先复现事件到话语到动作的对齐检查,再补全双工与打断;安全上先立游戏内暴力为例外的分类,再补多轮已破边界的恢复数据;评测上先固定上下文与运行框架做离线选型,再用小规模盲测校准权重。还需补的验证包括低端显卡的尾延迟、长期记忆的一致性、以及在非招募人群中的推荐度是否保持。论文未报告这些就不要承诺改善,只说可能与待验证。
📎 论文与评分元数据
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses

