5.1 多模态模型:从跨模态协同迈向原生融合,技术架构持续突破 多模态模型是处理图像、音频、视频等非文本模态数据,融合多模态信息实现理解与生成的 AI 模型,其核心架构包含编码器、连接器与大语言模型(LLM),还可选择性附加生成器以输出非文本模态内容。其中,编码器负责将图像、音频或视频等输入转化为模型可处理的特征;连接器作为关键中间模块,分为基于投影、基于查询与基于融合三类,以适配 LLM 的语义理解逻辑;LLM 则承担信息整合、推理及文本生成的核心任务,附加的生成器可进一步拓展其输出范围,实现图像、音频等非文本模态内容的生成。