Segment Anything은 메타 AI(구 Facebook AI Research, 이후 Meta Superintelligence Labs)가 개발한 이미지 및 비디오 분할을 위한 오픈소스 컴퓨터 비전 기반 모델 시리즈이다. 이 프로젝트는 2023년 4월, 11억 개 이상의 마스크로 구성된 SA-1B 데이터셋으로 학습된 프롬프트 기반 분할 모델인 Segment Anything Model(SAM)과 함께 도입되었으며, 이후 이미지와 비디오 분할을 통합한 SAM 2(2024), 자연어 개념 프롬프트로 분할을 수행하는 SAM 3(2025)로 확장되었다. 이 모델들은 Apache 2.0 라이선스로 배포되었으며, 의료 영상, 지구 관측, 로봇 공학, 콘텐츠 편집 도구 등 연구 및 산업 현장에서 널리 채택되었다.
배경
이미지 분할은 이미지의 어떤 픽셀이 객체에 속하는지 결정하는 작업으로, 전통적으로 COCO, Cityscapes, Pascal VOC 등 고정된 객체 범주 집합을 가진 작업별 데이터셋으로 학습된 모델이 필요했다. 한 데이터셋으로 학습된 모델은 일반적으로 다른 데이터셋으로 전이되지 못했다. Segment Anything 프로젝트는 분할을 대규모 언어 모델의 프롬프트 방식과 유사한 프롬프트 문제로 취급할 것을 제안했다. 즉, 픽셀을 고정된 어휘로 분류하는 대신, 사용자가 지시하는 객체에 대한 분할 마스크를 생성하는 방식이다.
SAM (2023)
메타 AI는 2023년 4월 5일 SA-1B 데이터셋과 함께 Segment Anything Model(SAM)을 출시했다. SAM은 프롬프트 기반 모델로, 이미지와 전경 포인트, 경계 상자, 대략적인 마스크와 같은 프롬프트가 주어지면, 학습 중에 보지 못한 객체와 이미지 분포에 대해서도 해당 객체에 대한 유효한 분할 마스크를 출력한다. 이러한 능력을 제로샷 전이(zero-shot transfer)라고 한다. SAM의 아키텍처는 무거운 Vision Transformer 이미지 인코더와 가벼운 프롬프트 인코더 및 마스크 디코더를 결합하여, 비용이 많이 드는 이미지 인코딩을 한 번만 계산한 후 다양한 프롬프트에 저렴하게 응답할 수 있도록 설계되었다. 이 설계는 트랜스포머 아키텍처와 딥러닝 기술의 발전을 바탕으로 하였으며, 이러한 기술은 인공지능의 다른 영역에서도 효과적임이 입증되었다.
SAM 2 (2024)
2024년 7월 29일, 메타는 프롬프트 기반 분할을 비디오로 확장한 SAM 2를 출시했다. SAM 2는 이미지를 단일 프레임 비디오로 취급하여 이미지와 비디오 분할을 하나의 아키텍처로 통합했다. SAM 2는 SAM의 Vision Transformer 인코더를 계층적 Hiera 백본으로 대체하고, 메모리 인코더, 메모리 뱅크, 메모리 어텐션으로 구성된 스트리밍 메모리 모듈을 추가하여 과거 비디오 프레임의 임베딩을 저장함으로써 객체가 가려짐을 통과해도 추적할 수 있게 했다. 프레임은 순차적으로 처리되어 실시간 작동이 가능하며, 메타는 이미지 분할에서 초당 약 44프레임을 보고했다. 시간적 데이터를 처리하는 이 모델의 능력은 프레임 간 객체 추적이 중요한 로봇 공학 및 자율 시스템 분야에서 관련성을 갖게 했다.
SAM 3 (2025)
2025년 11월 19일, 메타는 SAM 3를 출시하여 프롬프트 가능한 개념 분할(PCS)을 도입했다. 이 모델은 이전 버전에서 지원된 기하학적 프롬프트(포인트, 박스, 마스크) 외에도 "노란색 스쿨버스"와 같은 짧은 명사구, 예시 이미지, 또는 둘의 조합으로 지정된 개념의 모든 인스턴스를 감지, 분할, 추적할 수 있다. 이러한 능력은 모델이 자연어 입력을 해석하여 시각적 작업을 수행하는 생성형 AI 및 다중 모달 이해의 광범위한 추세와 일치한다. SAM 3의 개념 기반 접근 방식은 객체별 명시적 프롬프트의 필요성을 줄여 자동 콘텐츠 편집 및 대규모 이미지 분석과 같은 응용 분야에 더 적합하다.
영향 및 채택
Segment Anything 모델은 연구 및 산업 전반에 걸쳐 널리 채택되었다. 의료 영상 분야에서는 연구자들이 스캔 이미지의 해부학적 구조를 분할하는 데 SAM을 사용했으며, 지구 관측 분야에서는 토지 피복 분류를 위해 위성 이미지에 적용되었다. 로봇 공학 팀은 객체 조작 및 장면 이해를 위해 SAM을 통합했고, 콘텐츠 편집 도구는 사용자 주도 마스크 생성을 위해 프롬프트 기반 인터페이스를 활용했다. Apache 2.0 라이선스로 오픈소스 배포된 덕분에 다양한 머신러닝 파이프라인에 통합이 용이해졌으며, 이 모델들은 분할 작업의 일반적인 기준점이 되었다. 이 프로젝트의 프롬프트 가능성과 제로샷 일반화에 대한 강조는 이후 컴퓨터 비전 연구에 영향을 미쳐, 이 분야의 기초적 기여로 자리매김했다.