返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

智谱AutoGLM技术

财通证券研报深入拆解了智谱Agent的技术体系。CogAgent是18B参数的视觉语言模型(VLM),专门用于GUI理解和导航,基于CogVLM并结合高分辨率交叉模块(1120×1120像素),实现了高效GUI推理,在VQAv2(83.7%)、DocVQA(81.6%)等基准上显著领先。AutoWebGLM基于ChatGLM3-6B微调,通过HTML简化算法、人类与AI混合构建网页浏览数据集、强化学习和拒绝采样微调,在Mind2Web上以6B参数实现59.5%平均成功率,超越GPT-4的30.9%。AutoGLM实现图形用户界面的自主基础Agent,在VAB-WebArena-Lite上达55.2%成功率(第二次59.1%),与人类表现差距进一步缩小。

CogAgent:高分辨率GUI视觉理解的突破

CogAgent是智谱Agent技术的核心视觉底座。财通证券研报指出,CogAgent是18B参数的视觉语言模型(VLM),专门用于GUI理解和导航,可接受1120×1120高分辨率图像输入,能够识别微小的页面元素和文本。其架构基于预训练的CogVLM-17B,并添加了交叉注意模块(EVA2-CLIP-L,0.30B参数)处理高分辨率输入。这一设计的核心价值在于解决了高分辨率图像导致的计算时长和内存开销问题——视觉语言模型通常将文本和图像特征序列连接输入解码器,自注意力模块的计算成本与视觉补丁数量成二次方。CogAgent通过合理分配资源,使模型能理解高分辨率GUI图片,同时有效降低了显存与计算开销。预训练数据集包括文本识别(8000万合成图像+1800万OCR+900万学术文献)、视觉定位(4000万图像-标题对)和GUI图像分析(开创性GUI定位任务)三大模块,并在超过2000张人工标注截图上进行微调对齐。

AutoWebGLM:6B参数超越GPT-4的Web导航能力

AutoWebGLM验证了小参数模型通过高质量数据+强化学习可实现超越大模型的Agent能力。财通证券研报详细拆解了其技术架构:HTML简化算法降低HTML文本数据复杂性,通过简化和OCR模块生成简洁HTML表示并标记可操作元素;采用人类与AI混合方法构建网页浏览数据进行课程训练(人工筛选网站并构建操作类型分割,大模型辅助生成任务和意图);通过强化学习(模型采样与正确答案对比,让模型通过认识错误学习)和拒绝采样微调(监督学习生成推理路径,奖励模型收集准确路径并拒绝错误路径)增强模型。在Mind2Web上,AutoWebGLM(6B参数)跨任务/跨网站/跨域平均成功率59.5%,显著优于GPT-3.5-Turbo(17.4%)和GPT-4(30.9%);在MiniWoB++上达89.3%,在WebArena上达18.2%,在小参数规模下实现更高的网页导航能力。

AutoGLM:GUI自主基础Agent,缩小与人类表现差距

AutoGLM实现了图形用户界面的自主基础Agent。财通证券研报指出,清华与智谱团队开发了AutoGLM作为适用于现实GUI交互的基础Agent系统,在网络浏览器和手机上实现适合用户交付的可靠Agent系统。两大创新设计:一是设计适当的“中间界面”用于GUI控制,将规划和定位行为分离(分别优化灵活性和准确性);二是开发新颖的渐进式训练框架,使AutoGLM能够进行自我演进的在线课程强化学习。评估显示,AutoGLM在VAB-WebArena-Lite上实现55.2%成功率(第二次尝试提高到59.1%),在OpenTable上达96.2%;在AndroidLab(VAB-Mobile)上实现36.2%成功率,在中国热门App常见任务上达89.7%。AutoGLM成功的关键在于建立了网页浏览交互数据集,并通过强化学习、微调阶段算法创新,实现了在大语言模型上操作系统级Agent的突破。

技术展望:从“Chat”到“Act”的能力跃迁

财通证券认为智谱的技术路径代表了大模型从“对话”向“行动”的能力跃迁。CogAgent解决了“看”的问题(高分辨率GUI理解),AutoWebGLM解决了“理解”的问题(Web导航推理),AutoGLM解决了“做”的问题(跨APP自主执行)。三者的协同构成了“眼看-脑思-手动”的完整Agent能力闭环。财通证券预计,随着推理Scaling Law的持续验证和训练数据的不断丰富,Agent能力将从50+步向更复杂任务演进,从单终端向跨终端延伸。建议关注智谱Agent技术对AI算力、端侧硬件和应用软件的产业链拉动效应。

智谱Agent技术核心指标对比

| 模型 | 参数量 | 核心任务 | 关键数据 | 对比优势 |

|

|

|

|

|

|

| CogAgent | 18B | GUI理解/导航 | VQAv2 83.7%, DocVQA 81.6% | 领先通用模型及部分专业微调模型 |

| AutoWebGLM | 6B | Web导航 | Mind2Web 59.5%(平均) | 超越GPT-4(30.9%) |

| AutoGLM | — | GUI自主Agent | WebArena-Lite 55.2% | 接近人类表现 |

投资启示:底层大模型能力决定Agent终局

财通证券认为Agent赛道的终局将由底层大模型能力决定。通用层级的壁垒在于底层大模型能力,终局大概率为少数有实力的大型厂商。智谱凭借CogAgent视觉理解模型、AutoWebGLM网页导航模型和AutoGLM自主执行模型的三层技术栈,在国内Agent领域构建了差异化壁垒。建议关注智谱在Post-Training阶段(强化学习、拒绝采样微调)的算法创新对Agent能力的持续提升效应,以及其在手机、PC、汽车等多终端的商业化落地进展。
点击阅读报告原文: 计算机行业专题报告:“AI操作系统”时代已至-241201(21页)
相关报告