CLIP([[contrastive-language-image-pretraining|대조 언어-이미지 사전 훈련]])

영어에서 번역됨

대조 언어-이미지 사전 훈련(Contrastive Language-Image Pre-training)은 2021년 1월 OpenAI가 공개한 신경망으로, 이미지와 텍스트의 공동 표현을 학습하며 이후 많은 텍스트-이미지 생성 시스템의 기초 구성 요소가 되었다.

CLIP(Contrastive Language-Image Pre-training)은 2021년 1월 OpenAI가 공개한 시각-언어 모델이다. 고정된 레이블 집합으로 이미지를 분류하도록 훈련되는 대신, CLIP은 인터넷에서 수집한 대규모 이미지-캡션 쌍 데이터셋(약 4억 쌍으로 보고됨)을 훈련하여 이미지를 자유 형식의 텍스트 설명과 연관 짓는 방법을 학습한다.

방법

CLIP은 공동으로 훈련되는 두 개의 인코더, 즉 이미지 인코더와 텍스트 인코더로 구성되며, 두 인코더는 각각의 입력을 공유 임베딩 공간에 매핑한다. 훈련은 대조적 목적 함수를 사용한다. 즉, 이미지-텍스트 쌍의 배치가 주어지면, 모델은 일치하는 이미지와 캡션의 임베딩을 해당 공간에서 서로 가깝게 끌어당기고 일치하지 않는 쌍은 멀리 밀어내도록 훈련된다. 이전의 대조적 표현 학습 아이디어에 기반한 이 접근 방식 덕분에 CLIP은 ImageNet과 같은 수작업으로 레이블이 지정된 분류 데이터셋을 요구하는 대신, 웹 텍스트와 대체 텍스트에 존재하는 자연어 감독 신호로부터 직접 범용 시각 개념을 학습할 수 있었다.

결과적으로 이 모델은 이미지의 임베딩을 후보 텍스트 레이블의 임베딩과 비교하여 "제로샷" 이미지 분류, 즉 제로샷 학습의 한 형태를 수행할 수 있었으며, 해당 범주에 대해 명시적으로 훈련된 적이 없었다. 이는 이전 10년간 지배적이었던 합성곱 신경망 기반 이미지 분류기와는 확연히 다른 접근 방식이었으며, 이러한 분류기는 일반적으로 작업별 미세 조정이 필요했다.

이미지 생성에서의 역할

CLIP의 가장 큰 영향력은 분류가 아니라 생성적 이미지 모델의 안내 신호로 사용된 데서 비롯되었다. 공개 직후, 독립 연구자와 취미 개발자들은 CLIP을 초기 GAN 기반 방법과 이후의 확산 모델을 포함한 기존 이미지 생성 기술과 결합하여, CLIP의 텍스트-이미지 유사도 점수를 사용해 주어진 프롬프트와 일치하는 이미지로 생성을 유도했다. 이러한 "CLIP 안내" 접근 방식은 전용 시스템이 등장하기 전 초기 오픈 텍스트-이미지 아트 커뮤니티의 기반이 되었다.

CLIP의 텍스트 인코더는 이후 주요 텍스트-이미지 시스템, 특히 Stable Diffusion의 조건화 구성 요소로 직접 통합되었으며, 그 기본 아키텍처와 훈련 방식은 DALL-E의 여러 버전과 후속 시각-언어 시스템을 포함한 업계 전반의 다른 다중 모달 모델에 영향을 미쳤다. CLIP의 임베딩이 이미지와 텍스트 간의 의미적 유사성을 포착하기 때문에, 이 모델은 콘텐츠 기반 이미지 검색, 이미지 컬렉션에 대한 의미 검색, 그리고 생성된 이미지가 프롬프트와 얼마나 잘 일치하는지 평가하는 자동화된 지표로도 사용되었다.

의의와 한계

CLIP은 큐레이션된 레이블에 의존하는 대신, 잡음이 많은 웹 규모 데이터에 대한 대조적 사전 훈련을 확장한 초기이자 영향력 있는 사례로 자주 언급되며, 이 전략은 이후 다중 모달 AI 연구 전반에 걸쳐 반향을 일으켰다. 또한 인터넷 훈련 데이터에서 물려받은 편향의 사례로 연구되었으며, 연구자들은 웹에서 스크랩한 캡션에 내재된 편향을 반영하는 인종, 성별 및 기타 사회적 범주에 따른 왜곡된 연관성을 문서화했다. OpenAI는 이후 대부분 비공개로 공개한 것과는 대조적으로 CLIP의 가중치를 공개적으로 배포했으며, 이는 CLIP이 오픈소스 생성형 AI 생태계 전반에서 널리 재사용되는 구성 요소가 되는 데 기여했다.

분류:computer-vision·multimodal-ai·openai-models
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사