传统方法下,多模态理解主要应用于图像描述、视频描述及视觉问答,多模态推理主要应用于视觉常识推理、跨模态检索任务。其中,图像描述旨在让计算机根据给定图像自动生成描述性文字。受机器翻译领域中编码器-解码器(Encoder-Decoder)模型的启发,图像描述可以通过端到端的学习方法直接实现图像和描述句子之间的映射,将图像描述过程转化成为图像到描述的“翻译”过程。这一过程通常使用卷积神经网络(CNN)来提取图像中的视觉特征,如颜色、纹理、形状等;然后利用循环神经网络或其变体或 Transformer架构来捕捉这些特征之间的时序依赖关系,并生成对应的自然语言描述。在生成描述的过程中,还可能采用注意力机制来增强模型对图像关键区域的关注度,从而提高描述的准确性和相关性。注意力机制并非简单地将输入图像编码成一个固定的特征向量,而是通过引入上下文向量,对每个时间步的解码过程进行动态调整,以此增强图像区域与生成单词之间的相关性,从而捕捉并表达更多的图像语义细节。