返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

多模态UI交互模型

AI Agent正通过多模态UI交互实现与手机、电脑等终端设备的深度协同。东吴证券研报显示,苹果Ferret-UI在UI元素定位(Grounding)和识别(Referring)任务中准确率超82%,大幅领先GPT-4V的约37%。谷歌ScreenAI模型同样验证了参数提升对UI理解的显著效果——5B模型在复杂任务中的性能提升尚未饱和。Transformer架构正在克服任务和UI元素之间的隐含关系,大幅提升GUI Agent的可行性,为端侧AI的深度应用铺平了道路。

Transformer架构开启UI交互革命,GUI Agent可行性大幅提升

AI智能助理的任务执行过程包括规划和定位两个关键环节。规划是决定“做什么、用什么工具、按什么步骤执行”,定位则是执行过程中精准找到UI界面中的具体元素并操作。

根据交互模式,任务执行方法可分为基于API和基于用户界面(UI)两大类。API交互方式依赖公开可用的API,存在应用支持不全(无法覆盖所有App)、人类能轻松执行但API难以实现的任务、拓展性和自动化能力较弱等不足。UI界面方式在Transformer架构下较好克服了任务和UI元素之间的隐含关系,大幅提升了GUI Agent的可行性。

GUI交互可进一步分为基于文本和多模态两种方式。当前多模态GUI交互中,视觉定位(Grounding)难度甚至比规划决策(Planning)更大。UI界面复杂、元素众多且尺寸不一,元素识别错误是当前LMMs GUI模型的主要错误来源。多模态GUI交互面临数据不足、屏幕录制要求高以及当前LMMs模型推理能力有限的困扰。
Ferret-UI与GPT-4V UI任务准确率对比
模型Grounding-iPhoneGrounding-AndroidReferring-iPhoneReferring-Android
GPT-4V37.7%70.3%4.7%114.3%
Ferret-UI-anyres82.4%81.4%83.8%93.9%


注:Referring-Android中GPT-4V的114.3%为异常值,源于其过度生成导致的评价失真

苹果Ferret-UI:专用视觉模型精准定位UI元素

苹果在2024年4月推出Ferret-UI模型,专为移动UI理解设计。Ferret-UI通过视觉编码器对图像进行编码,加入任意分辨率(Anyres)技术切割放大子图像来解决UI交互中的小型对象识别问题(如小图标、小按钮),同时采用混合区域表示方法提高图像特征提取能力,将图像特征和文本指令联合编码后进行推理。

在基准测试中,Ferret-UI-anyres在Grounding(定位)任务中iPhone和Android准确率分别为82.4%和81.4%,在Referring(识别)任务中分别为83.8%和93.9%,而GPT-4V的Grounding准确率仅为37.7%(iPhone)和70.3%(Android),Referring-iPhone仅4.7%。Ferret-UI在定位任务中准确率是GPT-4V的两倍以上,证明专用UI视觉语言模型在精确识别和定位UI元素方面的巨大优势。

谷歌ScreenAI:模型参数提升对UI理解性能影响显著

谷歌2024年2月推出ScreenAI可读屏AI视觉语言模型,专门设计用于理解和处理用户界面和信息图标。ScreenAI使用Vision Transformer视觉编码器和T5语言编码器,采用更灵活的屏幕分割策略以适用于不同手机和电脑屏幕。

谷歌发布了670M、2B和5B三个参数版本。参数差异主要在图像和文本编解码器的大小,5B版本支持812×812最大输入分辨率。从模型表现看,增加模型规模能持续提升所有任务的性能,最大5B模型性能提升尚未饱和。在复杂任务中,2B到5B的性能提升(约8-12个百分点)远大于670M到2B(约3-5个百分点),说明在UI理解这种复杂多模态任务中,更大的模型参数仍能带来显著的性能收益。

苹果Ferret-UI和谷歌ScreenAI的进展表明,UI多模态交互正成为AI Agent落地终端设备的关键技术路径。随着模型持续迭代和硬件能力提升,端侧AI有望通过GUI界面实现真正的“人机协同”,开启Agent规模化应用的历史机遇。
点击阅读报告原文: 【东吴证券】电子行业深度报告:端侧AI:模型创新快速迭代,看好苹果引领AI硬件起飞-250223(21页)
相关报告