具身智能与普通AI的本质区别在于“感知-理解-行动”的闭环能力。海通国际报告指出,具身感知让智能体理解物理世界中的视觉推理和空间关系,技术包括视觉同步定位与绘图(vSLAM)、3D视觉定位和视觉语言导航(VLN)。具身交互则强调智能体在物理空间中的主动探索和问题解答能力。这些技术正在让机器人从“执行预设程序”走向“理解动态环境并自主决策”。
vSLAM——视觉同步定位与绘图
SLAM解决移动机器人在未知环境运行时定位导航与地图构建的问题。vSLAM(Visual SLAM)主要用相机解决定位和建图,通过一张张连续运动的图像推断相机运动和周围环境情况。技术框架由五部分组成:传感器数据预处理、前端视觉里程计(VO,研究如何根据相邻帧图像定量估算帧间相机运动)、后端优化、回环检测(解决累积误差)、建图。把相邻帧的运动轨迹串起来,构成机器人运动轨迹(定位),再根据每个时刻相机位置计算各像素空间点位置(建图)。vSLAM相比激光雷达方案成本更低,但计算复杂度更高,对光照变化敏感。
3D视觉定位——从粗到细分级方案
3D视觉定位的核心是确定当前图像中相机的位置和姿态,最直接方法是构建3D点与2D点的对应关系,通过PnP(Perspective-n-Point)问题求解。Sarlin在论文《From Coarse to Fine: Robust Hierarchical Localization at Large Scale》中提出分级定位方案,分为三步:预检索(获取前K张最相似图像,通过全局特征匹配,如NetVLAD/MobileNetVLAD)、共视聚类(将面向不同场景的图像区分开,共视关系的图像聚成一类)、局部匹配与定位(从图像数量较多的类开始,匹配2D-3D点对应关系,求解PnP获取相机位姿)。
视觉语言导航(VLN)——自然语言指令驱动的导航
VLN结合计算机视觉、自然语言处理和自主学习三大核心技术,使智能体能够跟随自然语言指令进行导航。例如将机器人放置在一间卧室并指令“去另一间卧室取足球”,机器人需走出房间经过走廊、客厅等场所,理解并处理每处环境信息,判断下一步行进方向。NaVid是首个专为VLN任务设计的视频大模型,仅将视频信息作为输入,无需地图、里程计或深度数据支持。当前两大难点:导航数据模态与大模型常见模态不一致、高质量的VLN真实数据匮乏。
具身交互与EQA——主动探索与问题解答
具身交互任务指智能体在物理或模拟空间中与人类和环境交互。典型任务为具身问题解答(EQA):agent在三维虚拟空间中被询问(如“车是什么颜色的?”),需主动探索环境寻找视觉信息,整合后返回答案。EQA要求agent具备:主动探索性(随机生成位置下寻找视觉信息)、常识推理(像人一样有目的探索,如问厨具颜色直接去厨房)、收敛性分析(采用模仿学习策略提供示范引导)。当前四大难题:通用本体平台挑战(关键零部件突破)、智能体系统设计(实时感知决策+LLM算力需求)、高质量数据需求、虚拟与真实交互中的学习进化。
表:具身智能感知交互核心技术对比| 技术 | 核心功能 | 技术框架 | 关键挑战 |
|---|
| vSLAM | 定位与建图 | VO+后端+回环+建图 | 光照变化、计算复杂度 |
| 3D视觉定位 | 相机位姿估计 | 预检索+共视聚类+PnP | 2D-3D匹配精度 |
| 视觉语言导航 | 自然语言指令驱动导航 | CV+NLP+强化学习 | 数据模态不一致、数据匮乏 |
| 具身问答EQA | 主动探索+信息整合+回答 | 感知+推理+行动闭环 | 长序列收敛、常识推理 |