GUI Agent是能够像人类一样通过图形用户界面操作计算机的AI系统,是AI自主性的重要里程碑。国元证券研究报告梳理了GUI Agent的发展历程:2024年10月Anthropic发布Claude 3.5 Sonnet加持Computer Use能力,2025年1月OpenAI推出Operator,2025年3月中国团队发布Manus。GUI Agent正从规则驱动迈向自治的端到端应用。
GUI Agent——AI自主操作的新范式
GUI Agent能够通过处理原始像素数据了解屏幕上发生的情况,并使用虚拟鼠标和键盘完成操作,导航多步骤任务、处理错误并适应意外变化。与传统的API调用Agent不同,GUI Agent不需要目标系统提供API接口,而是像人类一样通过视觉理解和操作界面,极大地扩展了AI Agent的适用场景。任何运行在图形界面上的软件都可以成为GUI Agent的操作对象。
OpenAI CUA——计算机使用的技术先锋
2025年1月24日,OpenAI发布AI Agent Operator,由基于GPT-4o构建的新模型Computer-Using Agent(CUA)提供支持。CUA通过处理原始像素数据了解屏幕上发生的情况,使用虚拟鼠标和键盘完成操作,可导航多步骤任务、处理错误并适应意外变化。在全计算机使用任务中,CUA在OSWorld基准测试中达到38.1%成功率,在WebArena达58.1%,WebVoyager达87%,超越之前最先进的基准结果,但落后于人类在OSWorld测试中的72.4%表现。
Claude Computer Use——首创GUI Agent能力
2024年10月,Anthropic发布了Claude 3.5 Sonnet并加持Computer Use能力,使其成为首个以图形用户界面(GUI)Agent形式可在公开测试中控制电脑的AI模型。这一突破标志着AI从“语言交互”向“界面操作”的范式转变。Claude Computer Use能够理解屏幕内容、移动光标、点击按钮、输入文本,像人类一样完成跨应用的复杂工作流程。
Manus——通用AI Agent的产品化标杆
2025年3月6日,中国创业团队Monica发布Manus,在GAIA基准测试中取得最先进成绩,性能超越OpenAI Deep Research。作为全球首款真正意义上的通用AI Agent,Manus能够独立思考、规划并执行复杂任务,直接交付完整成果。Manus本质是“虚拟机+compute use+artifacts+多Agent协同”的集成,核心是对现有Cursor类产品的再封装,降低使用门槛,让非技术用户也能轻松利用AI进行复杂任务编排。
字节TARS——开源GUI Agent的代表
2025年1月,字节跳动开源智能体系统TARS,基于自研原生GUI代理模型UI-TARS,能通过屏幕视觉解析与动作序列规划自动完成跨应用操作。TARS支持MCP协议,能够灵活对接各类工具。在多项基准测试中表现出色:在VisualWebBench、WebSRC和ScreenQA-short等感知能力评测中取得领先,在ScreenSpot Pro、ScreenSpot和ScreenSpot v2等定位能力评测中也表现优异。
主流GUI Agent产品性能对比| 产品 | 发布方 | 发布时间 | 核心技术 | OSWorld成功率 |
|---|
| Claude Computer Use | Anthropic | 2024年10月 | GUI Agent首创 | — |
| Operator(CUA) | OpenAI | 2025年1月 | GPT-4o + CUA | 38.1% |
| TARS | 字节跳动 | 2025年1月 | UI-TARS + MCP | — |
| Manus | Monica团队 | 2025年3月 | Multi-Agent + 虚拟机 | — |
GUI Agent的技术挑战与演进趋势
GUI Agent面临的核心挑战包括:屏幕理解需要处理不同应用、不同分辨率的界面差异;动作规划需要处理多步骤任务的组合爆炸;错误恢复需要在操作失败时自主调整策略。当前CUA在OSWorld上38.1%的表现与人类72.4%仍有差距,但随着多模态模型能力的提升和训练数据的丰富,GUI Agent的自主性和通用性正在快速提升。OpenAI已开源Agent SDK,提供Responses API、Agents SDK和三种内置工具,正在简化Agent的开发与大规模部署。