AI Agent正通过多模态UI交互实现与手机、电脑等终端设备的深度协同。东吴证券研报显示,苹果Ferret-UI在UI元素定位(Grounding)和识别(Referring)任务中准确率超82%,大幅领先GPT-4V的约37%。谷歌ScreenAI模型同样验证了参数提升对UI理解的显著效果——5B模型在复杂任务中的性能提升尚未饱和。Transformer架构正在克服任务和UI元素之间的隐含关系,大幅提升GUI Agent的可行性,为端侧AI的深度应用铺平了道路。
Transformer架构开启UI交互革命,GUI Agent可行性大幅提升
AI智能助理的任务执行过程包括规划和定位两个关键环节。规划是决定“做什么、用什么工具、按什么步骤执行”,定位则是执行过程中精准找到UI界面中的具体元素并操作。
根据交互模式,任务执行方法可分为基于API和基于用户界面(UI)两大类。API交互方式依赖公开可用的API,存在应用支持不全(无法覆盖所有App)、人类能轻松执行但API难以实现的任务、拓展性和自动化能力较弱等不足。UI界面方式在Transformer架构下较好克服了任务和UI元素之间的隐含关系,大幅提升了GUI Agent的可行性。
GUI交互可进一步分为基于文本和多模态两种方式。当前多模态GUI交互中,视觉定位(Grounding)难度甚至比规划决策(Planning)更大。UI界面复杂、元素众多且尺寸不一,元素识别错误是当前LMMs GUI模型的主要错误来源。多模态GUI交互面临数据不足、屏幕录制要求高以及当前LMMs模型推理能力有限的困扰。
Ferret-UI与GPT-4V UI任务准确率对比| 模型 | Grounding-iPhone | Grounding-Android | Referring-iPhone | Referring-Android |
|---|
| GPT-4V | 37.7% | 70.3% | 4.7% | 114.3% |
| Ferret-UI-anyres | 82.4% | 81.4% | 83.8% | 93.9% |
注:Referring-Android中GPT-4V的114.3%为异常值,源于其过度生成导致的评价失真
苹果Ferret-UI:专用视觉模型精准定位UI元素
苹果在2024年4月推出Ferret-UI模型,专为移动UI理解设计。Ferret-UI通过视觉编码器对图像进行编码,加入任意分辨率(Anyres)技术切割放大子图像来解决UI交互中的小型对象识别问题(如小图标、小按钮),同时采用混合区域表示方法提高图像特征提取能力,将图像特征和文本指令联合编码后进行推理。
在基准测试中,Ferret-UI-anyres在Grounding(定位)任务中iPhone和Android准确率分别为82.4%和81.4%,在Referring(识别)任务中分别为83.8%和93.9%,而GPT-4V的Grounding准确率仅为37.7%(iPhone)和70.3%(Android),Referring-iPhone仅4.7%。Ferret-UI在定位任务中准确率是GPT-4V的两倍以上,证明专用UI视觉语言模型在精确识别和定位UI元素方面的巨大优势。
谷歌ScreenAI:模型参数提升对UI理解性能影响显著
谷歌2024年2月推出ScreenAI可读屏AI视觉语言模型,专门设计用于理解和处理用户界面和信息图标。ScreenAI使用Vision Transformer视觉编码器和T5语言编码器,采用更灵活的屏幕分割策略以适用于不同手机和电脑屏幕。
谷歌发布了670M、2B和5B三个参数版本。参数差异主要在图像和文本编解码器的大小,5B版本支持812×812最大输入分辨率。从模型表现看,增加模型规模能持续提升所有任务的性能,最大5B模型性能提升尚未饱和。在复杂任务中,2B到5B的性能提升(约8-12个百分点)远大于670M到2B(约3-5个百分点),说明在UI理解这种复杂多模态任务中,更大的模型参数仍能带来显著的性能收益。
苹果Ferret-UI和谷歌ScreenAI的进展表明,UI多模态交互正成为AI Agent落地终端设备的关键技术路径。随着模型持续迭代和硬件能力提升,端侧AI有望通过GUI界面实现真正的“人机协同”,开启Agent规模化应用的历史机遇。