SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
📄 听错一个字就全盘皆输:SpeechGym 把语音智能体的失败变成可训练的梯度 英文题目:SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 一句话:针对语音智能体在纯语音多轮工具调用中因听错槽位值而级联失败的问题,SpeechGym 用本地音频闭环与过程奖励将稀疏的终局成功信号稠密化,使开放 30B 模型在独立语音管线上成功率从 24% 翻倍至 53%,代价是任务域与声学多样性仍局限于客服场景。 标签:#语音交互 #强化学习 #音频交互 #语音大模型 #基准测试 评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Jiajun Fan:机构信息未在 arXiv HTML 中可靠披露 Jingyuan Li:机构信息未在 arXiv HTML 中可靠披露 Prashanth Gurunath Shivakumar:机构信息未在 arXiv HTML 中可靠披露 Jia-Hong Huang:机构信息未在 arXiv HTML 中可靠披露 Qi Luo:机构信息未在 arXiv HTML 中可靠披露 M. Maruf:机构信息未在 arXiv HTML 中可靠披露 Ivan Bulyko:机构信息未在 arXiv HTML 中可靠披露 Ge Liu:机构信息未在 arXiv HTML 中可靠披露 Roger Ren:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语音智能体从只能测量的 API 级联中解放出来,用本地原生音频闭环让强化学习真正跑通,并以跨管线翻倍的成功率证明感知缺陷可被训练弥补。短板是所有训练与评估仍围绕 τ2-bench 这类客服数据库任务展开,且开源与复现材料几乎空白,让人难以判断该收益能否外推到更嘈杂、更开放的真实语音场景。 ...