返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

CogAgent视觉语言模型

财通证券研报指出,CogAgent是智谱Agent技术体系的视觉理解底座。2023年12月,清华KEG实验室与智谱AI联合推出CogAgent,一个18B参数的视觉语言模型(VLM),专门用于GUI理解和导航,可接受1120×1120高分辨率图像输入,能够识别微小的页面元素和文本。CogAgent基于预训练的CogVLM-17B,并添加了交叉注意模块(EVA2-CLIP-L,0.30B参数)处理高分辨率输入,通过合理分配资源理解高分辨率GUI图片,同时有效降低显存与计算开销。在VQAv2(83.7%)、OK-VQA(61.2%)、OCR-VQA(75.0%)、TextVQA(76.1%)、DocVQA(81.6%)等基准上实现最先进水平,显著领先通用模型,部分领域领先专业微调模型。

CogAgent架构:高分辨率GUI理解的突破

CogAgent解决了传统VLM在高分辨率GUI理解上的痛点。财通证券研报指出,视觉语言模型通常将文本和图像特征序列连接输入解码器,自注意力模块计算成本与视觉补丁数量成二次方。低分辨率下图像能有效描绘大多数物体和布局,但在清晰呈现文字方面有所不足;高分辨率对理解图形用户界面至关重要。CogAgent通过添加交叉注意模块(EVA2-CLIP-L)处理高分辨率输入,采用双编码器架构:低分辨率编码器处理全局视觉特征,高分辨率编码器聚焦文本相关特征。这种设计使CogAgent既能理解高分辨率GUI图片,又能有效降低显存与计算开销。CogAgent可接受1120×1120分辨率图像输入,能够识别微小的页面元素和文本,为后续的GUI Agent任务提供了高质量的视觉理解基础。

预训练策略:文本识别+视觉定位+GUI图像分析

CogAgent的预训练策略与一般多模态训练有显著不同。财通证券研报拆解了其三大预训练数据集。文本识别:识别高分辨率图像中各种大小、方向和字体的文本能力,数据包括语言预训练数据集(8000万)的合成渲染图像文本、自然图像OCR(1800万张)、学术文献(900万)。视觉定位:图像中文本和对象的定位能力,使用从LAION-115M采样的4000万张图像及其图像-标题对构建的视觉定位数据集,将标题中实体与边界框关联。GUI图像分析:对GUI图像(如网页)的专门理解,设计了两个开创性GUI定位任务——GUI引用表达式生成(根据屏幕截图指定区域为DOM元素生成HTML代码)和GUI引用表达式理解(为给定DOM元素创建边界框)。这些针对性预训练使CogAgent在GUI场景中具备独特的理解优势。

模型对齐:2000+人工标注截图+公开数据集微调

为提升模型在GUI环境中与人类指令的一致性,CogAgent进行了专门的微调与对齐。财通证券研报指出,作者手动从手机和电脑收集了超过2,000张截图,每张都由人类标注员以问答形式标注了屏幕元素、潜在任务和操作方法。同时利用Mind2Web和AITW(专注于网络和安卓行为的数据集),使用GPT-4转换为自然语言问答格式。此外,多个公开可用的VQA数据集也被纳入对齐数据集。这种“真实GUI场景人工标注+高质量公开数据转换”的混合对齐策略,使CogAgent能够理解人类在GUI操作中的自然语言指令,为AutoGLM和GLM-PC等产品提供了模型基础。

性能验证:多个基准测试领先通用模型及部分专业模型

CogAgent的性能已在多个基准测试中得到验证。财通证券研报引用测试结果显示,CogAgent在一般视觉问答与富含文本的视觉问答基准中均表现优异:VQAv2 83.7%、OK-VQA 61.2%、OCR-VQA 75.0%、TextVQA 76.1%、STVQA 68.4%、InfoVQA 44.5%、DocVQA 81.6%。相比通用模型(如Qwen-VL、LLaVA-1.5、Fuyu-8B)有明显得分优势,部分领域领先专业微调模型(如PALI-X-55B在DocVQA上为80.0%,CogAgent为81.6%)。在PC和Android GUI导航任务Mind2Web和AITW上,CogAgent也优于基于LLM的方法如GPT-4、LLaMA2等。CogAgent作为GLM-PC和AutoGLM的视觉理解底座,其高分辨率GUI理解能力直接决定了上层Agent对屏幕界面元素的识别精度和操作准确性。

CogAgent性能对比关键数据

| 测试基准 | CogAgent | 最佳通用模型 | 最佳专业微调模型 | 排名 |

|

|

|

|

|

|

| VQAv2 | 83.7% | 83.4%(CogVLM) | 86.0%(PALI-X) | 领先通用 |

| OK-VQA | 61.2% | 60.6%(Fuyu) | 66.1%(PALI-X) | 领先通用 |

| TextVQA | 76.1% | 68.1%(CogVLM) | 79.9%(PALI-X) | 领先通用 |

| DocVQA | 81.6% | — | 80.0%(PALI-X) | 领先专业 |

| OCR-VQA | 75.0% | 74.5%(CogVLM) | 75.0% | 领先 |

投资启示:视觉语言模型是端侧Agent的关键瓶颈

财通证券认为视觉语言模型是端侧Agent能力的关键瓶颈。GUI Agent的核心能力是对屏幕图像的理解——识别按钮、文本、图标、布局等视觉元素,并判断可操作区域。CogAgent通过高分辨率输入(1120×1120)和专门化的GUI预训练数据集,实现了对微小程序元素和文本的精准识别,为AutoGLM的跨APP操作和GLM-PC的Computer Use提供了底层能力支撑。建议关注具备自研视觉语言模型能力的AI公司(如智谱、科大讯飞等),以及在端侧部署VLM所需的AI芯片、存储和散热产业链。
点击阅读报告原文: 计算机行业专题报告:“AI操作系统”时代已至-241201(21页)
相关报告