Segment Anything ViT는 Meta가 개발한 프롬프트 기반 이미지 분할 시스템인 Segment Anything Model(SAM)의 이미지 인코더 백본 역할을 하는 비전 트랜스포머 아키텍처입니다. 이 모델은 트랜스포머 기반 설계를 사용하여 입력 이미지를 고차원 특징 임베딩으로 변환하며, 이후 가벼운 마스크 디코더가 이를 처리하여 점, 상자 또는 텍스트와 같은 사용자 프롬프트에 기반한 분할 마스크를 생성합니다. 이 백본은 2023년 SAM 프레임워크 및 1,100만 개 이미지에 10억 개 이상의 마스크를 포함하는 Segment Anything 데이터셋과 함께 도입되었습니다.
Segment Anything ViT는 표준 비전 트랜스포머 구조를 기반으로 하며, 이미지를 고정 크기 패치로 나누고 이를 멀티 헤드 어텐션 레이어를 통해 처리합니다. 잔차 네트워크나 U-Net과 같은 초기 합성곱 백본과 달리, ViT 백본은 모든 레이어에서 전체 이미지에 걸친 전역 컨텍스트를 포착하므로 객체 경계와 관계 이해가 필요한 작업에 적합합니다. 이 아키텍처는 공간 정보를 유지하기 위해 위치 인코딩을 포함하며, ViT-B, ViT-L, ViT-H의 여러 모델 크기를 지원하며 가장 큰 버전은 약 6억 3,200만 개의 매개변수를 가집니다.
아키텍처 및 설계
Segment Anything ViT는 Dosovitskiy와 동료들이 제안한 원래 비전 트랜스포머 설계를 따르며, 밀집 예측 작업에 맞게 수정되었습니다. 16x16 픽셀의 패치 크기를 사용하므로 1024x1024 입력 이미지는 64x64 패치로 나뉩니다. 각 패치는 임베딩 벡터로 선형 투영되며, 트랜스포머 블록 전에 학습 가능한 위치 인코딩이 추가됩니다. 백본은 내부적으로 표준 인코더-디코더 구조를 사용하지만, SAM 프레임워크에서는 순수 인코더로 작동하며 레이어별 업샘플링 과정을 통해 공간 해상도를 유지하는 특징 맵을 출력합니다.
주요 설계 선택은 윈도우 어텐션이 아닌 전역 어텐션 메커니즘의 사용입니다. 이를 통해 모델은 주어진 패치의 특징을 계산할 때 전체 이미지를 고려할 수 있으며, 넓은 영역에 걸친 객체나 모호한 경계를 가진 객체를 분할하는 데 중요합니다. 백본은 또한 마스크 디코더로 출력을 전달하기 전에 특징 차원을 일반적으로 256채널의 컴팩트한 임베딩 공간으로 줄이는 넥 모듈을 포함합니다.
훈련 및 데이터
Segment Anything ViT는 1,100만 개의 이미지와 10억 개 이상의 분할 마스크를 포함하는 대규모 컬렉션인 Segment Anything 데이터셋으로 훈련되었습니다. 이 데이터셋은 자동 마스크 생성과 인간 개선을 결합한 데이터 엔진을 사용하여 만들어졌습니다. 훈련 과정은 마스크 주석에 대한 지도 학습과 모델 인 더 루프 접근 방식을 결합했으며, 새 마스크가 생성됨에 따라 ViT 백본이 반복적으로 개선되었습니다.
훈련은 딥러닝의 표준 기법을 사용했으며, 최적화를 위한 Adam 옵티마이저, 일반화 개선을 위한 데이터 증강, 훈련 안정화를 위한 그래디언트 클리핑이 포함됩니다. 모델은 GPU 클러스터에서 훈련되었지만, 구체적인 하드웨어 세부 사항은 공개적으로 문서화되지 않았습니다. 더 큰 용량을 가진 ViT-H 변형은 가장 높은 분할 품질을 달성했지만 훈련과 추론 모두에서 더 많은 계산 리소스가 필요했습니다.
응용 및 영향
Segment Anything ViT는 SAM 모델이 특정 카테고리에 대한 사전 미세 조정 없이 이미지의 객체를 분할하는 제로샷 분할을 수행할 수 있게 했습니다. 이는 인공지능 분야의 의료 영상, 자율 주행, 로보틱스 등에 광범위하게 적용됩니다. 예를 들어, 백본은 크로스 어텐션 메커니즘과 결합하여 텍스트 프롬프트를 통합할 수 있으며, 사용자가 자연어로 객체를 설명하여 분할할 수 있습니다.
SAM과 그 ViT 백본의 출시는 이후의 대화형 분할 및 컴퓨터 비전 기반 모델 연구에 영향을 미쳤습니다. 이는 다양한 데이터로 훈련된 단일 모델이 대규모 언어 모델이 텍스트 작업에서 일반화하는 방식과 유사하게 보이지 않는 객체와 장면에 일반화할 수 있음을 입증했습니다. 이 아키텍처는 깊이 추정 및 가장자리 감지를 포함한 다른 밀집 예측 작업에 적용되었으며, 다양한 오픈소스 툴킷에 통합되었습니다.
성능 및 한계
벤치마크 평가에서 Segment Anything ViT-H 백본은 여러 데이터셋에서 평균 Intersection over Union(mIoU)과 같은 표준 분할 지표에서 강력한 성능을 달성했습니다. 그러나 모델에는 알려진 한계가 있습니다. 매우 작은 객체, 심하게 가려진 객체 또는 비정상적인 조명 조건의 이미지에서 어려움을 겪을 수 있습니다. ViT 백본은 또한 계산 집약적이어서 상당한 메모리와 처리 능력이 필요하며, 최적화 없이는 엣지 디바이스에서의 사용이 제한됩니다.
연구에 따르면 입력 이미지가 크게 축소되면 패치 임베딩 과정에서 세부 정보가 손실되어 백본의 성능이 저하됩니다. 또한 모델은 객체 의미론을 본질적으로 이해하지 못합니다 - 카테고리 지식이 아닌 시각적 패턴을 기반으로 분할하므로 모호한 경우 과분할 또는 과소분할이 발생할 수 있습니다.
관련 발전
Segment Anything ViT는 원래 ViT 모델과 계층적 설계와 같은 후속 개선을 포함한 초기 비전 트랜스포머 작업을 기반으로 합니다. 이는 로컬 수용 필드를 통해 이미지를 처리하는 잔차 네트워크나 U-Net과 같은 합성곱 접근 방식과 구별됩니다. 백본은 또한 계산 비용을 줄이기 위해 효율적인 어텐션 메커니즘 또는 희소 트랜스포머를 통합한 후속 모델에 영감을 주었습니다.
생성형 AI의 더 넓은 맥락에서 Segment Anything ViT는 단일 아키텍처로 여러 시각적 작업을 처리할 수 있는 통합 모델로의 전환을 나타냅니다. 그 성공은 오디오 및 비디오 분할과 같은 다른 영역에서 유사한 노력을 장려했으며, 오픈소스 AI 모델의 성장하는 생태계에 기여했습니다.