视觉语言模型(VLM)是一种多模态系统,经过联合训练以理解图像和文本,能够执行图像描述、视觉问答、图像-文本检索以及将语言与特定视觉内容相联系的接地推理等任务。VLM属于更广泛的基础模型类别,通常基于Transformer (architecture)架构构建。
历史
现代VLM可追溯至OpenAI的CLIP(2021年),该模型利用从网络抓取的数亿个图像-文本对进行对比学习,在无需人工标注类别的情况下,将图像及其描述在共享嵌入空间中对齐。CLIP的嵌入不仅限于分类任务,还为早期Text-to-image generation系统的引导机制提供动力,并成为后续模型的标准视觉编码器。在2021年至2023年间,Flamingo、BLIP和LLaVA等模型探索了将冻结或轻度微调的视觉编码器与预训练的Large language model相连接的方法,使语言模型的推理和知识能够以相对较少的额外训练扩展到视觉输入。
架构
大多数VLM将视觉编码器(通常是CNN或视觉transformer)与语言模型主干相结合,通过投影层将图像特征映射到语言模型已理解的词元嵌入空间中。随后,组合模型在配对的图像-文本数据上进行训练或微调,使语言模型学会通过Attention mechanism以与文本词元相同的方式关注视觉词元。一些较新的系统,包括Gemini和GPT-4o,是作为统一的多模态模型原生训练的,而非由单独预训练的组件组装而成,这模糊了VLM与通用多模态基础模型之间的界限。
能力与应用场景
VLM能够描述图像、回答关于图表和示意图的问题、读取并推理嵌入文本(与OCR有所重叠)、比较多张图像,并且在与工具使用或智能体循环结合时,能够根据所见内容采取行动,例如计算机使用智能体通过解释屏幕截图来操作软件。它们支撑着无障碍功能、机器人感知、医学图像分诊工具以及需要推理图像而不仅仅是分类的内容审核系统。
评估与局限
VLM在涵盖视觉问答、图表和文档理解以及细粒度识别的基准上进行评估;在需要精确计数、空间关系或读取小号或旋转文本的任务上,性能仍会下降。与其他多模态系统一样,VLM可能幻觉出图像中不存在的对象或细节,这一失败模式被称为“对象幻觉”,并且其行为可能受到对抗性或误导性视觉输入的影响,包括图像中嵌入的文本被模型视为指令,这是一种视觉形式的Prompt injection。
典型示例
广泛使用的VLM及具备VLM能力的系统包括作为基础编码器的CLIP、开放研究社区中的LLaVA及其后继者,以及主要实验室发布的多模态产品,如Claude、Gemini和GPT-4/GPT-4o,这些都将视觉理解融入通用助手,而非作为独立产品提供。