Vision Transformer(ViT)

译自英文

视觉变换器(ViT)是一种为计算机视觉调整的变换器模型,它将图像处理为补丁序列而非文本标记。它于2020年作为卷积神经网络的替代方案被引入。

视觉变换器(ViT)是一种专为计算机视觉设计的变换器。与通过卷积滤波器处理像素的卷积神经网络(CNN)不同,ViT将输入图像分解为一系列方形补丁,将每个补丁序列化为向量,并通过单次矩阵乘法将其映射到低维嵌入。这些补丁嵌入随后由变换器编码器处理,该编码器应用多头注意力机制来捕获补丁之间的关系。ViT被引入作为CNN的替代方案,提供了不同的归纳偏置、训练稳定性和数据效率。它们通常比CNN数据效率更低,但具有更高的容量,一些最大的现代计算机视觉模型(例如具有220亿参数的模型)就是ViT。

ViT架构于2020年首次提出,并迅速在图像分类中取得最先进的结果,打破了CNN此前的统治地位。后续研究产生了许多变体,包括结合ViT和CNN特征的混合架构。ViT已应用于图像识别、图像分割、天气预报和自动驾驶等领域。

历史

变换器在2017年的论文《Attention Is All You Need》中引入,并广泛应用于自然语言处理。2019年,一篇论文通过从标准CNN ResNet开始,并将所有卷积核替换为自注意力机制,将变换器思想应用于计算机视觉。该方法取得了优越的性能,但并非真正的视觉变换器。

2020年,一个仅编码器的变换器被适配用于计算机视觉,产生了ViT,并在图像分类中达到最先进水平。掩码自编码器(2022年)将ViT扩展到无监督训练。这些发展也刺激了卷积神经网络的新进展,导致两种方法之间的交叉融合。

2021年,提出了几种重要的ViT变体,以提高效率、准确性或领域适用性。两项研究通过添加CNN作为预处理器来提高效率和鲁棒性。Swin变换器通过使用类似卷积的滑动窗口注意力和金字塔结构,在COCO等目标检测数据集上取得了最先进的结果。

概述

原始2020年ViT的基本架构是一个类似BERT的仅编码器变换器。输入图像表示为形状为H × W × C的张量,其中H、W和C分别是高度、宽度和通道数(通常为RGB)。图像被分割为大小为P × P × C的方形补丁。每个补丁被展平并通过线性层以获得补丁嵌入。位置编码(编码补丁在图像中的位置)被添加到嵌入中。原始论文比较了无嵌入、1D、2D和相对嵌入,并采用了1D。

补丁嵌入序列随后由多个变换器编码器层处理。ViT中的注意力机制反复变换图像补丁的表示向量,捕获补丁之间的语义关系,类似于NLP中的变换器捕获单词之间的关系。

为了将输出用于下游任务,训练了一个额外的头。对于分类,在顶部添加一个浅层MLP(线性-GeLU-线性-softmax),输出类别上的概率分布。

变体

原始ViT

原始ViT是一个仅编码器的变换器,通过监督训练从补丁预测图像标签。它在输入中使用一个特殊的[CLS]标记,相应的输出向量作为最终MLP头的输入。这种架构技巧允许模型将所有标签相关信息压缩到一个向量中。

变换器最初在NLP中取得成功,如BERT和GPT-3等模型所示。相比之下,典型的图像处理使用CNN,著名示例包括Xception、ResNet、EfficientNet、DenseNet和Inception。变换器测量输入标记对之间的关系,成本与标记数量的平方成正比。对于图像,计算每个像素对的关系是不可行的,因此ViT计算小区域(例如16×16像素)内像素之间的关系,大幅降低成本。每个区域被展平,乘以嵌入矩阵,并添加到位置嵌入中,然后输入到变换器。

池化

处理后,ViT产生嵌入向量,必须转换为单个类别预测。原始ViT和掩码自编码器使用一个虚拟的[CLS]标记,遵循BERT的做法。[CLS]处的输出由LayerNorm-前馈-softmax模块处理。

全局平均池化(GAP)改为将所有输出标记的平均值作为分类标记,原始论文中提到这与[CLS]同样有效。多头注意力池化(MAP)应用多头注意力块来池化向量,将向量列表作为输入并产生加权组合。

应用与影响

ViT已应用于分类之外的广泛计算机视觉任务,包括目标检测、分割和视频理解。它们还用于医学成像和遥感。该架构影响了大规模视觉模型的发展,并已集成到结合视觉和语言的多模态系统中。

尽管有优势,ViT比CNN需要更多数据才能有效训练,这导致了混合模型以及知识蒸馏和自监督预训练等技术的发展。掩码自编码器方法实现了无监督学习,减少了对标记数据的需求。

ViT还推动了硬件和软件优化的创新,因为其注意力机制计算密集。研究继续致力于提高效率、可解释性和鲁棒性。

参见

  • 变换器
  • 卷积神经网络(不在列表中,但作为一个概念)
  • 掩码自编码器(不在列表中,但作为一个概念)
  • 图像分类(不在列表中,但作为一个概念)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·transformer·deep-learning·neural-network
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史