DALL-E 2는 OpenAI가 개발하고 2022년에 출시한 텍스트-이미지 모델이다. 프롬프트로 알려진 자연어 설명에서 딥러닝 방법론을 사용하여 디지털 이미지를 생성한다. 이 모델은 원래 DALL-E의 후속작으로, 더 높은 해상도에서 더 사실적인 이미지를 생성하고 개념, 속성, 스타일을 결합할 수 있도록 설계되었다.
DALL-E 2는 새로운 콘텐츠 생성에 초점을 맞춘 생성형 인공지능의 광범위한 분야의 일부이다. 이 모델은 전임자의 자기회귀적 접근 방식에서 벗어나 확산 기반 아키텍처를 사용한다. 이름은 픽사 로봇 WALL-E와 스페인 초현실주의 화가 살바도르 달리의 합성어이다.
역사와 배경
원래 DALL-E는 OpenAI가 2021년 1월 5일 블로그 게시물에서 발표했으며, GPT-3의 수정된 버전을 사용하여 이미지를 생성했다. 2022년 4월 6일, OpenAI는 DALL-E 2를 후속작으로 발표하며 더 사실적인 이미지 생성과 개념 결합 능력을 강조했다. 처음에는 윤리적 및 안전 문제로 인해 연구 미리보기로 사전 선정된 사용자에게만 접근이 제한되었다. 2022년 7월 20일, DALL-E 2는 베타 단계에 들어가 대기자 명단에 있는 100만 명을 초대했으며, 사용자는 매달 제한된 수의 이미지를 무료로 생성하고 추가 크레딧을 구매할 수 있었다. 대기자 명단 요구 사항은 2022년 9월 28일에 제거되어 모델이 일반 대중에게 공개되었다.
2022년 11월 초, OpenAI는 DALL-E 2를 API로 출시하여 개발자가 모델을 애플리케이션에 통합할 수 있게 했다. API는 이미지당 비용 기준으로 운영되며, 가격은 해상도에 따라 다르고 기업 고객에게는 볼륨 할인이 제공된다. Microsoft는 DALL-E 2를 Designer 앱과 Bing 및 Microsoft Edge의 Image Creator 도구에 통합했다. 2024년 2월, OpenAI는 C2PA(콘텐츠 출처 및 진위 연합) 표준을 사용하여 메타데이터를 임베딩하는 방식으로 DALL-E 생성 이미지에 워터마크를 추가하기 시작했다.
기술
DALL-E 2는 35억 개의 매개변수를 사용하며, 이는 전임자의 120억 개보다 적은 수치이다. 자기회귀적 트랜스포머 대신 CLIP 이미지 임베딩에 조건화된 확산 모델을 사용한다. 추론 중에 사전 모델이 CLIP 텍스트 임베딩에서 이러한 이미지 임베딩을 생성한다. 이 아키텍처는 몇 달 후 출시된 Stable Diffusion과 유사하다. 이 모델은 신경망 및 머신러닝 기술을 활용하며, 인공지능 연구의 발전을 기반으로 한다.
CLIP(대비 언어-이미지 사전 훈련)은 인터넷에서 수집된 4억 개의 이미지-텍스트 쌍으로 훈련된 별도의 모델이다. 이 모델은 DALL-E 2의 출력을 이해하고 순위를 매기는 데 중요한 역할을 하며, 프롬프트와 가장 잘 일치하는 이미지를 선택한다. 확산 과정은 CLIP 임베딩의 안내에 따라 무작위 노이즈를 반복적으로 정제하여 일관된 이미지로 만든다.
기능
DALL-E 2는 사실적인 이미지, 그림, 이모지 등 여러 스타일의 이미지를 생성할 수 있다. 객체를 조작하고 재배열할 수 있으며, 명시적인 지시 없이 새로운 구성에 디자인 요소를 올바르게 배치할 수 있다. 예를 들어, 무를 그려서 코를 풀거나, 라떼를 마시거나, 외발자전거를 타게 하라는 요청을 받으면 모델은 종종 손수건, 손, 발을 그럴듯한 위치에 배치한다. 또한 휴일과 관련된 프롬프트에 크리스마스 이미지를 추가하거나 언급되지 않은 그림자를 렌더링하는 등 적절한 세부 사항을 추론할 수 있다.
이 모델은 시각적 및 디자인 트렌드에 대한 광범위한 이해를 보여주며, 다양한 시점에서 다양한 임의 설명에 대한 이미지를 드물게 실패하면서 생성할 수 있다. 시각적 추론 능력은 인간 지능을 측정하는 데 자주 사용되는 테스트인 레이븐 점진 행렬을 해결할 수 있을 정도이다.
이미지 수정
DALL-E 2는 기존 이미지의 변형을 생성할 수 있을 뿐만 아니라 이미지를 편집하여 수정하거나 확장할 수 있다. 인페인팅 및 아웃페인팅 기능은 원본 이미지의 맥락을 사용하여 주어진 프롬프트에 따라 일관된 매체로 누락된 영역을 채운다. 예를 들어, 사용자는 이미지에 새로운 주제를 삽입하거나 원래 경계를 넘어 확장할 수 있다. OpenAI에 따르면, 아웃페인팅은 그림자, 반사, 질감과 같은 기존 시각적 요소를 고려한다.
영향과 유산
DALL-E 2는 텍스트-이미지 생성의 후속 발전에 영향을 미쳤으며, 2023년 10월에 출시된 DALL-E 3는 ChatGPT에 통합되었고 2025년 3월에 GPT Image로 대체되었다. 이 모델은 또한 생성형 AI의 기능과 윤리적 함의에 대한 광범위한 논의에 기여했으며, 오용에 대한 우려와 워터마킹과 같은 출처 측정의 필요성을 포함한다.