多模态AI描述的是机器学习系统,特别是现代的基础模型,它们能够在单一模型中接受、处理并通常生成多种类型的数据,如文本、图像、音频和视频,而不是将各自独立的专门系统拼接在一起。该术语与早期的单模态系统形成对比,例如仅处理文本的大语言模型或仅处理图像的卷积神经网络分类器,这些系统只处理单一输入和输出类型。
历史
多模态研究早于当前这一代模型;早期工作结合了计算机视觉和自然语言处理,用于图像描述和视觉问答等任务,使用由较小连接网络桥接的独立编码器。一个重大进展是OpenAI的CLIP(2021年),它通过对比预训练学习了图像和文本的共享嵌入空间,使模型能够在没有任务特定标签的情况下关联视觉和语言概念。CLIP风格的嵌入成为后来文本到图像系统的基础,包括引导基于扩散的生成。
统一模型转变
在2023年和2024年间,领先实验室从将视觉编码器附加到文本模型上,转向从一开始就在交错的文本、图像、音频以及有时视频数据上训练真正统一的基于Transformer架构。谷歌的Gemini被描述为原生多模态,OpenAI的GPT-4o也体现了这一转变,它们在单一模型内跨模态处理和生成,而不是在不同子模型之间路由。这使得诸如具有视觉理解的实时语音对话,以及需要联合推理图像和伴随文本的问题回答等能力成为可能。
架构
多模态模型通常将每种模态标记化或嵌入到一个共享表示空间中,使Transformer主干能够统一处理,有时使用针对图像或音频的模态特定编码器,其输出被投影到与文本标记相同的嵌入维度。输出同样可以是多模态的:模型可能生成文本,或将生成任务交给基于扩散的图像解码器,如谷歌的Nano Banana图像编辑器。核心的注意力机制允许模型跨模态关联标记,例如将文本描述锚定到特定图像区域。
应用
多模态AI支持结合OCR式嵌入文本读取与布局和图像理解的文档理解、描述图像内容的无障碍工具、视频问答、结合视觉感知与语言指令的机器人系统,以及能够解释照片、截图或实时摄像头画面的消费级助手。视觉语言模型是一个主要子类别,专门关注联合图像-文本理解,而多模态AI是更广泛的伞形术语,也包括音频和视频。
评估与局限性
多模态系统的基准测试考察跨模态推理,例如回答关于图表、示意图或视频序列的问题,而在需要精确空间推理、计数或读取图像中密集小文本的任务上,性能仍落后于人类能力。模型也可能产生幻觉,虚构图像中不存在的细节,而且组合模态增加了提示注入攻击的表面积,因为恶意指令可以隐藏在图像或音频片段中,而不仅仅在文本中。