📄 AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions 📝 5.6/10 | 前50% | arxiv
学术质量 3.7/7 | 影响力 0.3/2 | 可复现性 1.6/2 | 置信度 中
👥 作者与机构 未在提供的全文中明确列出所有作者的所属单位。论文致谢部分列出了部分作者(JWS, BH, TLL)获得的资金支持,包括香港研究资助局(RGC)、国家自然科学基金(NSFC)和澳大利亚研究理事会(ARC)项目。
💡 毒舌点评 这篇论文的工作动机清晰,直指当前GUI智能体在理想化测试集上表现良好但在真实杂乱环境中脆弱的“皇帝新衣”问题,这一点值得肯定。提出的AgentHijack基准测试本身有一定工程价值,填补了“非对抗性”鲁棒性评估的空白。然而,作为一篇投向ICML的论文,其方法部分的深度和创新性严重不足。“观察者”模块的概念过于朴素,本质上是将环境状态变化显式文本化的外挂模块,缺乏理论上的新颖性。所谓的DA-GRPO算法,其核心创新(在多环境rollout)在正文中公式(1)里几乎没有体现,创新点隐藏在附录的描述性文字中,这在顶会论文中是不可接受的写作方式。更关键的是,论文的领域相关性非常弱。作为一个针对通用GUI智能体的鲁棒性测试与简单模块增强工作,它与ICML核心关注的机器学习理论、算法或根本性模型突破关联甚微。对于语音/音乐/音频领域的读者而言,本文几乎没有直接启发或技术迁移价值。实验中仅使用UI-TARS-1.5-7B作为基座模型进行微调和观察者构建,限制了结论的普适性。整体感觉像是一篇扎实的系统工程报告(benchmark + hack),而非一篇有深度的机器学习研究论文。
📌 核心摘要 本文针对多模态大语言模型驱动的计算机使用智能体在真实环境中易受常见非对抗性干扰影响的脆弱性问题,提出了首个可配置的基准测试AgentHijack。该基准在OSWorld平台上构建了包含9类干扰(如弹窗、分辨率变更、意外触控等)的3321个任务。实验评估发现,即便是先进的UI-TARS系列智能体,在干扰下的平均成功率也显著下降。为提升鲁棒性,作者提出了AgentHijack-Agent框架,其核心包括一个采用数据增强群体相对策略优化(DA-GRPO)训练、具有增强定位能力的动作生成器,以及一个负责行为总结与初始环境检查的观察者模块。消融实验验证了各组件的有效性,该框架在所有干扰类型上均优于基准模型。
🔗 开源详情 代码:https://AgentHijack.github.io 模型权重:论文中未提及提供微调后的AgentHijack-Agent或观察者模型权重。 数据集:AgentHijack基准基于OSWorld构建,数据集链接通过代码仓库提供。 Demo:论文中未提及。 复现材料:论文提供了非常详细的复现材料,包括:1) 训练配置(Section 5.1,附录F);2) 所有实验中使用的系统提示词(附录F.3);3) 每类干扰的具体配置参数(表5);4) 消融实验的设置(附录F.2);5) 评估所用的基线模型及统一推理参数。复现环境基于OSWorld提供的虚拟机。 论文中引用的开源项目: VERL:用于强化学习微调的框架。 pyautogui:用于程序化控制鼠标和键盘的Python库。 UI-TARS:论文评估的基线GUI智能体模型系列。 OSWorld:作为基准构建基础的计算机任务评估环境。 🏗️ 方法概述和架构 论文提出的AgentHijack-Agent框架(如图3所示)旨在增强GUI智能体对常见环境干扰的鲁棒性,其设计基于对现有智能体在干扰下表现的三项关键观察:1) 视觉干扰破坏定位能力;2) 意外操作干扰决策;3) 智能体无法感知初始环境错误。框架由两个核心组件构成,协同工作以提升鲁棒性。
动作生成器与数据增强群体相对策略优化(DA-GRPO):
功能与实现:动作生成器负责根据用户指令、历史轨迹和观察者的总结,输出下一步操作。其核心能力的提升源于DA-GRPO训练算法。DA-GRPO是标准群体相对策略优化(GRPO)的扩展,关键在于“数据增强”。在标准GRPO中,模型从单一(通常是清洁)环境中采集多条轨迹进行策略更新。而DA-GRPO在为一个任务进行策略更新时,会同时从多个不同的随机化干扰环境中采集轨迹\(\{o_{i}^{c}|i\in[1,G],c\in\mathcal{C}\}\)(\(c\)代表不同的干扰环境)。目标函数如公式(1)所示,旨在最大化这些来自多样干扰环境下的轨迹的累积优势。这强迫策略在优化过程中就适应多样化的环境扰动,从而学习到更鲁棒的行动策略。 奖励设计:奖励函数\(r_{i}\)(公式(2))结合了任务成功奖励\(r_{i}^{\text{success}}\)(成功为1,失败为0)和格式奖励\(r_{i}^{\text{format}}\)(格式错误为-1,正确为0)。为应对稀疏的成功奖励,训练过程中引入了经验回放缓冲区,用于存储成功的轨迹。当一个批次内所有采样轨迹的奖励均为零时,会从缓冲区中随机替换一条,以确保优化过程始终有正向信号。 基座模型:实验中采用UI-TARS-1.5-7B作为基座模型进行DA-GRPO微调。 观察者(Onlooker)模块:
功能:观察者是一个额外的、环境聚焦的辅助智能体,其职责有两个: 行为总结:在动作生成器执行每一步动作后,观察者对比动作前后的屏幕截图,将环境发生的变化(尤其是由意外操作引起的非预期变化)总结成简洁的描述\(d_{t}\)。这使得历史上下文从传统的\(\{o_{1},a_{1},...,o_{t},a_{t}\}\)扩展为\(\{o_{1},d_{1},...,o_{k},d_{k},...o_{t},d_{t}\}\),帮助动作生成器更准确地归因状态变化,避免被意外操作触发的内容分散注意力。 初始环境检查:在任务执行前,观察者检查初始环境状态。通过对比屏幕截图和预设的错误信息仓库(如网络断开、需要登录验证),若检测到初始化异常(如网络错误、锁屏状态),则会报告错误并提示重新初始化环境,防止智能体在故障环境中进行无意义的尝试。 实现:在实验中,默认使用另一个经过微调的UI-TARS-1.5-7B实例作为观察者。论文也探索了使用更强大的模型(如Qwen3-VL-235B)作为观察者的可能性。 框架流程与交互:如图3所示,在任务开始前,观察者先执行环境检查,确保环境就绪。任务执行时,动作生成器接收用户指令、当前截图和包含历史截图及观察者总结的历史记忆,输出动作。观察者持续监控每一步后的环境变化,更新行为总结并将其追加到历史记忆中,供动作生成器在下一步决策时参考。通过这种显式记录环境变化的方式,框架增强了智能体对动态环境的感知和抗干扰能力。
...