返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

端侧Agent与Computer Use

国盛证券研报指出,2024年10月AI端侧Agent迎来里程碑时刻。Anthropic推出Claude 3.5 Sonnet实现Computer Use能力,在OSWorld基准测试中以22%准确率位居行业首位。智谱AutoGLM实现Phone Use能力,在AndroidLab评测中成功率36.2%超越GPT-4o,淘宝任务成功率高达93%。端侧Agent正从概念走向现实,2025年有望看到更多Agent产品落地。

Computer Use——AI自主操作计算机的突破

2024年10月22日,Anthropic发布Claude 3.5 Sonnet,被其产品经理Michael Gerstenhaber誉为“迄今为止最智能的模型”。Claude 3.5 Sonnet最引人注目的功能是其计算机使用能力——通过相应API,电脑可以模拟人类操作,完成读屏、移动光标、点击按键、输入文本等任务动作。

这一功能的实现主要依靠四个步骤。首先是屏幕识别,读屏能力依然是重要前提。其次是逻辑推理,针对识别出的屏幕内容推理出何时、如何进行相应操作。第三是定位执行,准确计算像素定位非常重要——为了正确点击相应位置,需要计算垂直或水平移动多少像素。最后是快速泛化并持续迭代,研究团队观察到模型泛化非常迅速,在遇到困难时会自我修正后重新尝试任务。

在OSWorld这一评估计算机使用能力的基准测试中,Claude 3.5 Sonnet的准确度达到14.9%,在给予更多步骤的情况下达到22.0%,位列行业首位。相比之下,GPT-4 Vision准确率7.69%,Gemini-Pro Vision仅5.80%。Claude 3.5 Sonnet的Computer Use能力标志着AI从“对话”向“行动”的范式转变。

Phone Use——AutoGLM革新端侧交互

智谱推出的AutoGLM是端侧Agent领域的另一重要突破。AutoGLM能够接收简单的文字或语音指令,模拟人类操作手机,完成一系列复杂的任务。在淘宝上购买历史订单中的商品、在美团点外卖、在12306购买火车票等任务都能轻松完成。

AutoGLM的强大功能依托两大核心技术创新。第一,通过中间界面设计实现了“任务规划”和“动作执行”前后两个阶段的解耦合,使智能体在任务规划和动作执行时更加精确和灵活。第二,采用“自进化在线课程强化学习框架”来训练和提升大模型智能体的能力,通过自进化学习策略实现不断的自我考察、鞭策和提升。

在性能表现上,AutoGLM在AndroidLab评测基准中成功率达到36.2%,显著超越GPT-4o和Claude 3.5 Sonnet。在WebArena-Lite评测基准中相对GPT-4o取得约200%的性能提升。在常见任务中,微信成功率92%、淘宝93%、美团70%、大众点评100%、高德地图92%、小红书100%,展现了端侧Agent在实际应用中的巨大潜力。

技术路径——多模态读屏与强化学习的结合

端侧Agent的核心技术路径围绕多模态读屏、行为克隆、课程学习、奖励建模和强化学习展开。传统的RPA(机器人流程自动化)中通过OCR进行GUI识别,但难以被泛化。而大型多模态模型则可以进行模糊匹配和长任务规划,对GUI理解很有帮助。

行为克隆对于Agent训练非常重要,一个基础的问题是agent可能仅仅是在模仿而非理解。Agent任务通常很复杂,因此渐进式的课程学习非常重要。相对于过去的特定任务训练,现在agents在所处的开放世界中要进行泛化的任务,需要有更加泛化的奖励建模和强化学习。

从长远看,Agent的发展方向是功能泛化、任务复杂化和交互拟人化。Claude 3.5 Sonnet的Computer Use和智谱AutoGLM的Phone Use分别代表了PC端和手机端Agent的探索方向。我们预计2025年有望看到更多不同领域Agent产品实现更多不同的功能。

端侧Agent的应用前景与投资机会

端侧Agent的应用前景广阔。在办公场景中,Agent可以自动完成数据录入、报表生成、邮件处理等重复性工作。在生活场景中,Agent可以帮用户完成订餐、购物、订票等日常任务。在企业场景中,Agent可以集成到CRM、ERP等系统中,实现业务流程自动化。

从产业链角度看,端侧Agent的落地将催生多个投资机会。一是大模型能力提升,支持更复杂的Agent任务;二是端侧推理芯片需求增长,支持Agent在本地运行;三是Agent应用开发,在各垂直场景中打造Agent产品。

建议关注在端侧Agent领域积极布局的公司。Anthropic Claude 3.5 Sonnet展示了Computer Use能力,智谱AutoGLM展示了Phone Use能力。随着Agent产品的成熟和场景的拓展,端侧Agent有望成为AI应用的重要方向。
表:端侧Agent核心性能对比
模型/产品能力类型核心测试准确率/成功率
Claude 3.5 SonnetComputer UseOSWorld(50步)22.0%
Claude 3.5 SonnetComputer UseOSWorld(15步)14.9%
GPT-4 VisionOSWorld7.69%
AutoGLMPhone UseAndroidLab36.2%
AutoGLMPhone Use淘宝任务93%
点击阅读报告原文: 人工智能行业海外市场:寻找2025爆款AI应用-241204(20页)
相关报告