当前AI Agent产品虽已展现出强大的任务处理能力,但距离真正的“通用Agent”仍有差距。华泰证券认为,Agent能力提升的核心方向在于任务规划的自主化迭代和工具使用的创造性拓展。腾讯AppAgent通过模仿人类交互方式绕过系统后端限制,多Agent协同从协作走向对抗与平等伙伴关系,Agent正从辅助工具迈向独立执行者。本文系统梳理通用Agent技术的发展趋势与应用前景。
任务规划能力:从规则驱动到反思迭代
当前Agent主要基于成熟的现有任务流程进行复现,或基于训练数据对任务进行简单的拆分。未来Agent在任务规划方面的核心进化方向是从基于规则、参数的规划能力逐步向基于实践的反思、迭代进化。这意味着Agent不仅能执行预设流程,还能从执行结果中学习、反思并优化策略。Manus在GAIA Level 3任务上的优异表现已初步验证了这一方向的可行性——在信息不完全、步骤不确定的情境中,Agent能够自主发现最优路径。
工具使用与创造:从API调用到自主工具开发
当前Agent的工具使用主要通过调用第三方API进行,基本按照人类的部署进行流程化操作。未来的能力跃迁体现在两个层面:一是从基于人类配置的特定工具向多种工具的选择规划进化,Agent能够根据任务需求自主选择最合适的工具组合;二是更进一步地,Agent可能创造适用于LLM的新工具,实现工具能力的自我扩展。这一方向将使Agent从“工具使用者”进化为“工具创造者”,极大拓展其解决新问题的能力边界。
AppAgent:绕过系统限制的通用应用交互
腾讯团队发表的AppAgent论文代表了通用Agent在应用交互层面的重要突破。AppAgent让AI模仿人类的交互方式(点击和轻扫),绕过了对系统后端访问的需求,从而扩大了在各种应用程序中的适用性。通过自主探索或观察人类演示,Agent学习导航和使用新应用,生成知识库,在执行复杂任务时参考该知识库。应用场景覆盖自动填写Gmail、社交媒体、电子邮件、地图、购物及复杂图像编辑工具。类比WWDC中Apple Intelligence演示的复杂情境——在会议推迟情况下从设备检索女儿演出信息并评估能否赶上,展示了Agent在多应用数据关联中的潜力。
多Agent协同与Agent社会框架
从Agent落地方式看,可分为单Agent部署、多Agent交互和人工Agent交互三种方式。多Agent交互通过不同方式给予Agent反馈,有助于强化解决问题的能力。多Agent协同范式包括协作交互(以有序/无序方式协作实现共同目标)、对抗性交互(针锋相对的竞争提升表现)、指导者-执行者范式(人类提供指令,Agent执行)、平等伙伴关系范式(与人类进行共情对话与协作)。Agent社会框架中,个体层面表现出计划/推理/反思等内在行为及认知/情感/性格特征;团体层面可组成团队并表现出合作行为。
表:Agent能力进化方向对比| 能力维度 | 当前水平 | 未来方向 |
|---|
| 任务规划 | 基于规则/参数 | 基于实践的反思、迭代进化 |
| 工具使用 | 人类配置的特定工具 | 多工具选择规划、创造新工具 |
| 部署方式 | 单Agent为主 | 多Agent协同、人机协作 |