常见MLLMs 的架构组成与训练:常见的MLLMs 架构一般可分为 4个模块,即预训练的多模态编码器、对齐模块、预训练的 LLM、解码器(生成器)。以理想 VLA 架构(详见图表25)为例,其空间智能部分集成了多模态编码器和对齐模块,使用一个 3D Enconder 编码图像和激光雷达信息并输出 3D 特征,一个普通 Encoder 编码位置、导航信息等文字信息,一个 3D 投影仪(对齐模块)将编码器信息投射对齐至语言空间;语言智能部分为从零训练的Mind GPT 语言大模型,用于理解场景和输出高层次决策规划;行为智能部分为一个扩散模型解码器,用于将语言模块输出的高层次指令(视作语言 prompt)精细化为低层次的具体车端执行动作,完成“抽象到具体”的映射。整体而言,MLLMs 模型的训练过程主要包括模型预训练、垂域数据微调、对齐调优(例如自动驾驶中的人类行为对齐)、模型强化学习等环节。