CLIP 논문은 공식 제목이 "Learning Transferable Visual Models From Natural Language Supervision"으로, OpenAI가 2021년에 발표한 연구 간행물로, 대조 언어-이미지 사전 훈련(CLIP)을 제시했다. 이 연구는 고정된 레이블 집합에 의존하는 대신 자연어를 감독 신호로 사용하여 시각 모델을 훈련하는 방법을 도입했다. CLIP은 대규모 이미지-캡션 쌍 데이터셋을 처리하여 공유 임베딩 공간에서 이미지와 텍스트를 정렬하는 방법을 학습하며, 이를 통해 최소한의 하류 적응만으로도 다양한 시각 작업을 수행할 수 있게 했다.
2021년 2월에 발표된 이 논문은 Transformer (architecture) 아키텍처와 Large language model 확장의 초기 발전을 기반으로, 이미지용 비전 트랜스포머와 텍스트 인코더를 결합하여 공동 표현을 만들었다. 핵심 혁신은 대조 학습 목적 함수로, 일치하는 이미지-텍스트 쌍 간의 유사성을 최대화하고 불일치 쌍 간의 유사성을 최소화하도록 모델을 훈련했다. 이 접근 방식은 CLIP이 웹에서 수집된 다양한 말뭉치에서 광범위하고 전이 가능한 특징을 학습할 수 있게 했으며, Computer vision의 패러다임을 선별된 주석 데이터셋에서 인터넷 규모의 원시 텍스트-이미지 쌍으로 근본적으로 전환했다.
아키텍처 및 훈련
CLIP 모델은 두 개의 분리된 인코더로 구성되었다. 이미지 인코더는 ResNet과 같은 Convolutional neural network 변형 또는 비전 트랜스포머일 수 있는 시각 입력을 처리했고, 텍스트 인코더는 트랜스포머를 사용하여 캡션을 처리했다. 두 인코더 모두 512차원 임베딩 공간에 벡터를 출력했다. 훈련 목적 함수는 대조 손실을 사용하여 정렬된 이미지-텍스트 쌍 간의 코사인 유사성을 최대화하고 다른 배치 샘플 간의 유사성을 최소화했다. 이 손실은 배치 내에서 계산되었으며, 32,768개 샘플의 대규모 배치 크기를 사용했다. 인터넷에서 수집한 4억 개의 이미지-캡션 쌍으로 훈련된 모델은 수백 개의 GPU에 걸쳐 확장되었으며, 가장 큰 버전인 ViT-L/14는 완료하는 데 약 500 GPU-일이 필요했다.
제로샷 및 전이 학습
CLIP 논문의 핵심 결과는 제로샷 전이의 입증이었다. 작업별 데이터에 대한 미세 조정 없이도 CLIP은 잠재적 클래스 레이블을 설명하는 텍스트 프롬프트(예: 'a photo of a cat')와 이미지 임베딩을 일치시켜 이미지를 분류할 수 있었다. 시각 인식의 표준 벤치마크인 ImageNet에서 CLIP은 훈련 없이 76.2%의 정확도를 달성하여 지도 방식으로 훈련된 ResNet50의 성능과 일치했다. 논문은 프롬프트 엔지니어링을 통한 추가 개선을 보고했는데, 'a photo of the {class}, a type of pet'과 같은 설명적 레이블은 세분화된 데이터셋에서 성능을 최대 10% 향상시켰다. 이러한 전이 능력은 모델이 학습한 시각 개념과 그 텍스트 설명의 표현에서 비롯되었다.
성능 및 한계
CLIP 논문은 OCR, 행동 인식, 세분화된 분류, 추상적 시각 장면을 포괄하는 30개 이상의 데이터셋에서 모델을 평가했다. ImageNet 및 기타 전이 벤치마크에서의 상당한 개선을 포함하여 여러 데이터셋에서 최첨단 결과를 달성했다. 그러나 저자들은 여러 한계를 인정했다. CLIP은 대조 사전 훈련이 필요한 세분성을 학습하지 못한 계산, 공간 관계, 유사 객체의 세분화된 분류와 같은 작업에서 성능이 저조했다. 모델은 또한 분포 변화에 민감하여 주석이 달린 예제를 보지 못한 새로운 도메인에 대한 견고성이 낮았다.
영향 및 파급
CLIP의 발표는 빠르게 영향력을 갖게 되었으며, 컴퓨터 비전과 다중 모달 학습 모두에서 후속 연구를 형성했다. 이는 명령 튜닝과 텍스트 조건 생성의 확장 가능한 프레임워크를 도입하여 Dall-E 및 GPT-4와 같은 후속 모델에 영향을 주었다. 자연어를 사용하여 모델을 감독하는 접근 방식은 Artificial intelligence 전반에 걸친 더 광범위한 기반 모델의 부상에 기여했다. 그 성공은 시각과 언어의 정렬에 대한 추가 연구를 촉진했으며, 후속 연구에서는 더 정교한 대조 및 생성적 비교와 분포 변화 해결을 탐구했다. 이 논문은 텍스트 설명에서 시각 지식을 도출하는 방법을 이해하기 위한 초석 참고 자료로 남아 있다.
후속 발전
후속 작업은 데이터와 모델 크기를 확장하고, CLIP을 확산 기반 이미지 생성에 통합하며, 프롬프트 학습을 개선하여 CLIP의 아이디어를 확장했다. OpenCLIP과 같은 오픈 소스 재구현은 더 넓은 커뮤니티 실험을 가능하게 했다. 모달리티 간 표현 정렬의 개념은 시각-언어를 넘어 오디오-텍스트 및 로봇 학습과 같은 영역으로도 전파되었다. 2023년에 OpenAI는 추가 적용 가능성을 위해 업데이트된 버전을 출시했지만, 대조 언어-이미지 사전 훈련의 핵심 원리는 이 분야의 표준 구성 요소가 되었으며 수천 편의 논문에서 인용되고 있다.
결론
요약하면, CLIP 논문은 자연어 감독을 사용하여 전이 가능한 시각 모델을 학습하는 새로운 훈련 패러다임을 도입했다. 데이터와 계산을 확장하면 강력한 제로샷 학습 능력을 발휘할 수 있음을 보여주었으며, 동시에 후속 한계를 강조했다. 이 논문의 영향은 직접적인 방법론을 넘어 통합된 다중 모달 모델로의 전환을 촉진하고 후속 생성 시스템의 발전에 영향을 주었다. 모델 평가에 대한 기여와 접근 가능한 코드베이스는 채택을 가속화하여 CLIP을 딥러닝 및 현대 Artificial intelligence 연구의 벤치마크 작업으로 확고히 했다.
참고 문헌
논문의 저자들은 작성 과정에서 동료들과 협력했으며, 아키텍처는 OpenAI의 arXiv 사전 인쇄본에 설명되었다. 이 연구에는 연구자 팀이 참여했으며, 결과는 인공 지능 연구의 발전을 목표로 공개적으로 출시되었다.