비전 트랜스포머(ViT)

영어에서 번역됨

비전 트랜스포머(ViT)는 컴퓨터 비전에 맞게 조정된 트랜스포머 모델로, 이미지를 텍스트 토큰 대신 패치의 시퀀스로 처리합니다. 2020년에 컨볼루션 신경망의 대안으로 도입되었습니다.

비전 트랜스포머(ViT)는 컴퓨터 비전을 위해 설계된 일종의 트랜스포머이다. 합성곱 필터를 통해 픽셀을 처리하는 합성곱 신경망(CNN)과 달리, ViT는 입력 이미지를 일련의 정사각형 패치로 분해하고, 각 패치를 벡터로 직렬화한 후 단일 행렬 곱셈을 사용하여 저차원 임베딩으로 매핑한다. 이러한 패치 임베딩은 멀티-헤드 어텐션 메커니즘을 적용하여 패치 간의 관계를 포착하는 트랜스포머 인코더에 의해 처리된다. ViT는 CNN의 대안으로 도입되었으며, 서로 다른 귀납적 편향, 훈련 안정성, 데이터 효율성을 제공한다. 일반적으로 CNN보다 데이터 효율성은 낮지만 용량은 더 높으며, 220억 개의 매개변수를 가진 모델과 같은 가장 큰 현대 컴퓨터 비전 모델 중 일부는 ViT이다.

ViT 아키텍처는 2020년에 처음 제안되었으며 이미지 분류에서 최첨단 결과를 빠르게 달성하여 CNN의 이전 지배력을 극복했다. 이후 연구는 ViT와 CNN의 특징을 결합한 하이브리드 아키텍처를 포함한 많은 변형을 생성했다. ViT는 이미지 인식, 이미지 분할, 기상 예측, 자율 주행 분야에서 응용되고 있다.

역사

트랜스포머는 2017년 논문 "Attention Is All You Need"에서 도입되었으며 자연어 처리에서 널리 사용되었다. 2019년에는 표준 CNN인 ResNet에서 시작하여 모든 합성곱 커널을 자기-어텐션 메커니즘으로 대체함으로써 트랜스포머 아이디어를 컴퓨터 비전에 적용한 논문이 발표되었다. 이 접근 방식은 우수한 성능을 보였지만 진정한 비전 트랜스포머는 아니었다.

2020년에는 인코더 전용 트랜스포머가 컴퓨터 비전에 적용되어 ViT가 탄생했으며, 이미지 분류에서 최첨단 성능에 도달했다. 마스크 오토인코더(2022)는 ViT를 비지도 훈련으로 확장했다. 이러한 발전은 합성곱 신경망의 새로운 진전을 자극하여 두 접근 방식 간의 교차 수정을 이끌었다.

2021년에는 효율성, 정확성 또는 도메인 적합성을 개선하기 위해 여러 중요한 ViT 변형이 제안되었다. 두 연구는 CNN을 전처리기로 추가하여 효율성과 견고성을 개선했다. Swin Transformer는 합성곱과 유사한 슬라이딩 윈도우 어텐션과 피라미드 구조를 사용하여 COCO와 같은 객체 감지 데이터 세트에서 최첨단 결과를 달성했다.

개요

원래 2020년 ViT의 기본 아키텍처는 BERT와 유사한 인코더 전용 트랜스포머이다. 입력 이미지는 H × W × C 형태의 텐서로 표현되며, 여기서 H, W, C는 높이, 너비, 채널 수(일반적으로 RGB)이다. 이미지는 크기 P × P × C의 정사각형 패치로 분할된다. 각 패치는 평탄화되고 선형 레이어를 통과하여 패치 임베딩을 얻는다. 이미지에서 패치의 위치를 인코딩하는 위치 인코딩이 임베딩에 추가된다. 원래 논문은 임베딩 없음, 1D, 2D, 상대 임베딩을 비교했으며 1D를 채택했다.

패치 임베딩의 시퀀스는 여러 트랜스포머 인코더 레이어에 의해 처리된다. ViT의 어텐션 메커니즘은 NLP에서 트랜스포머가 단어 간의 관계를 포착하는 것과 유사하게, 이미지 패치 간의 의미적 관계를 통합하여 이미지 패치의 표현 벡터를 반복적으로 변환한다.

다운스트림 작업에 출력을 사용하기 위해 추가 헤드가 훈련된다. 분류의 경우 클래스에 대한 확률 분포를 출력하는 얕은 MLP(선형-GeLU-선형-소프트맥스)가 상단에 추가된다.

변형

원래 ViT

원래 ViT는 패치에서 이미지 레이블을 예측하도록 지도 학습으로 훈련된 인코더 전용 트랜스포머였다. 입력에 특수 [CLS] 토큰을 사용했으며, 해당 출력 벡터는 최종 MLP 헤드의 입력으로 사용되었다. 이 아키텍처적 해킹은 모델이 레이블 관련 모든 정보를 하나의 벡터로 압축할 수 있게 했다.

트랜스포머는 처음에 BERT 및 GPT-3와 같은 모델에서 볼 수 있듯이 NLP에서 성공을 거두었다. 반면, 일반적인 이미지 처리는 Xception, ResNet, EfficientNet, DenseNet, Inception과 같은 잘 알려진 예를 포함한 CNN을 사용했다. 트랜스포머는 입력 토큰 쌍 간의 관계를 측정하며, 비용은 토큰 수의 제곱에 비례한다. 이미지의 경우 모든 픽셀 쌍에 대한 관계를 계산하는 것은 금지되므로, ViT는 작은 섹션(예: 16×16 픽셀)의 픽셀 간 관계를 계산하여 비용을 크게 줄인다. 각 섹션은 평탄화되고, 임베딩 행렬로 곱해지며, 위치 임베딩에 추가된 후 트랜스포머에 공급된다.

풀링

처리 후 ViT는 단일 클래스 예측으로 변환되어야 하는 임베딩 벡터를 생성한다. 원래 ViT와 마스크 오토인코더는 BERT를 따라 더미 [CLS] 토큰을 사용했다. [CLS]의 출력은 LayerNorm-피드포워드-소프트맥스 모듈에 의해 처리된다.

전역 평균 풀링(GAP)은 대신 모든 출력 토큰의 평균을 분류 토큰으로 취하며, 원래 논문에서 동등하게 좋은 것으로 언급되었다. 멀티헤드 어텐션 풀링(MAP)은 벡터 목록을 입력으로 받아 가중 조합을 생성하는 멀티-헤드 어텐션 블록을 적용하여 벡터를 풀링한다.

응용 및 영향

ViT는 분류를 넘어 객체 감지, 분할, 비디오 이해를 포함한 광범위한 컴퓨터 비전 작업에 적용되었다. 또한 의료 이미징 및 원격 감지에도 사용된다. 이 아키텍처는 대규모 비전 모델의 개발에 영향을 미쳤으며, 비전과 언어를 결합한 멀티모달 시스템에 통합되었다.

장점에도 불구하고 ViT는 CNN보다 효과적으로 훈련하는 데 더 많은 데이터가 필요하며, 이는 하이브리드 모델과 지식 증류, 자기 지도 사전 훈련과 같은 기술의 개발로 이어졌다. 마스크 오토인코더 접근 방식은 비지도 학습을 가능하게 하여 레이블 데이터의 필요성을 줄였다.

ViT는 어텐션 메커니즘이 계산 집약적이므로 하드웨어 및 소프트웨어 최적화의 혁신을 촉진했다. 효율성, 해석 가능성, 견고성 개선에 대한 연구가 계속되고 있다.

같이 보기

  • 트랜스포머
  • 합성곱 신경망 (목록에 없지만 개념으로)
  • masked-autoencoder (목록에 없지만 개념으로)
  • image-classification (목록에 없지만 개념으로)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·transformer·deep-learning·neural-network
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사