国盛证券计算机行业报告指出,AI智能助理迎来PhoneUSE时刻。10月26日智谱推出AutoGLM,只需接收文字/语音指令即可模拟人类操作手机,支持微信、淘宝、美团等8类APP。10月22日Anthropic推出Claude Computer Use功能,让AI像人类一样使用计算机。OpenAI CEO确认Agent为下一阶段目标,谷歌DeepMind同步布局。智谱在Claude推出Computer Use几天后即推出Phone Use,验证中国大模型公司技术能力处于世界前沿。智能助理正从"演示功能"走向"日常工具",终端厂商与推理侧算力有望高度受益。
AutoGLM Phone USE:人机交互的新范式
10月26日,智谱技术团队推出GLM第一个产品化的智能体AutoGLM。只需接收简单的文字/语音指令,就可以模拟人类操作手机。安卓端目前可操作的APP包括微信(发消息/公众号总结/朋友圈点赞)、淘宝(商品选购/店铺查找/评价总结)、美团(点外卖)、大众点评(打卡/写好评/查评价)、小红书(点赞评论/关注用户)、高德地图(导航/路线规划)、12306(订车票机票)、携程(订酒店)。
AutoGLM的设计体现了对用户体验的深度思考。任务执行中若出现多个符合条件的搜索结果,AutoGLM会主动询问用户意见,避免错误执行。任务完成后反馈成功/失败状态,用户可通过悬浮球反馈。用户还可创建常用指令一键触发,省去反复输入。智谱团队表示,理论上通过对GUI的深刻理解,AutoGLM可以完成人类在可视化电子设备上能做的任何事,不受限于简单任务或API调用,操作逻辑与人类类似。
AutoGLM的重大突破在于操作APP的方式是直接理解屏幕内容然后模拟触屏操作,可以有效打通应用。这与传统APP间通过API调用实现功能打通有本质区别。API调用需要APP提前开放接口,而AutoGLM通过视觉理解和触屏模拟,理论上可操作任何APP,无需APP厂商配合。这种通用性打开了智能助理从"部分APP可用"到"全场景覆盖"的想象空间。
Agent产业趋势:OpenAI/Anthropic/谷歌全线布局
Agent已成为全球顶尖AI公司的共识方向。10月22日Anthropic推出Claude3.5Sonnet的Computer Use功能,开发人员可在API上指导Claude像人类一样使用计算机——查看屏幕、移动光标、单击按钮、键入文本。在OSWorld评测中,Claude在纯屏幕截图类别得分14.9%,远超第二名AI系统的7.8%。Anthropic预计该能力将在未来数月快速提升。
OpenAI将AGI分为五级:1级聊天机器人→2级推理者→3级Agent→4级创新者→5级组织。9月推出的o1模型达到2级推理者水平,9月18日CEO Sam Altman发文确认"在目标3上表现出色",Agent成为下一阶段明确目标。OpenAI和谷歌DeepMind均已开始招聘multiagent团队成员。谷歌DeepMind的Multi-Agent AGI团队研究多智能体方法,探索人工智能与社会科学的交叉。
智谱在Claude推出Computer Use几天后即推出Phone Use,验证了中国大模型公司在技术能力上处于世界前沿水平。如果说Computer Use开启了人机交互的新范式,那么Phone Use则更进一步——手机陪伴用户的时间更长,解锁更多应用可能性,让AI真正惠及每一个人。业界顶尖公司纷纷布局Agent,明确了产业方向。
技术突破:解耦合中间界面破解Agent两大挑战
AutoGLM解决了大模型作为智能体时的两个关键挑战。第一,动作执行不够精确。训练大模型智能体的一大难题在于让模型学会精准操作屏幕上显示的元素。端到端训练受制于轨迹数据获取成本高昂,导致动作执行能力训练不充分。
AutoGLM引入"基础智能体解耦合中间界面"设计,将任务规划与动作执行通过自然语言中间界面进行解耦合。以"点外卖提交订单"为例,传统方案直接在GUI上点击按钮(容易点错),中间界面方案先将屏幕信息转化为自然语言描述,再由模型决定点击哪个按钮。该方案极大提升了动作执行精度。
第二,任务规划不够灵活。GUI智能体训练轨迹数据极其有限且成本高昂,面对复杂任务需要灵活即时规划和纠正能力。智谱研发"自进化在线课程强化学习框架",在真实在线环境中从头开始学习提升大模型智能体能力。模型根据当前能力动态调整学习任务难度,通过KL散度控制策略更新及置信度经验回放避免遗忘。
在AndroidLab评测基准上,AutoGLM显著超越GPT-4o和Claude-3.5-Sonnet表现。开源版GLM-4-9B在WebArena-Lite中相对GPT-4o提升超160%,总体任务成功率43%。在简单任务的人工评测中,AutoGLM表现令人满意。随着模型能力持续提升,AutoGLM有望从支持部分APP扩展到全场景覆盖。
表:主流AI Agent产品对比| 产品 | 发布时间 | 核心能力 | 评测表现 |
|---|
| 智谱AutoGLM | 2024年10月 | Phone USE,模拟人类操作手机 | AndroidLab超越GPT-4o/Claude |
| Anthropic Computer Use | 2024年10月 | Computer USE,模拟操作电脑 | OSWorld 14.9%(领先第二名7.8%) |
| OpenAI o1 | 2024年9月 | 复杂推理能力 | AGI五级达到第2级 |