DALL-E는 OpenAI가 딥러닝 방법론을 사용하여 자연어 설명(프롬프트)으로부터 디지털 이미지를 생성하도록 개발한 일련의 텍스트-이미지 모델이다. 첫 번째 버전은 2021년 1월에 발표되었으며, 2022년에는 DALL-E 2, 2023년에는 DALL-E 3가 뒤를 이었다. 이 이름은 픽사 로봇 캐릭터 WALL-E와 스페인 초현실주의 화가 살바도르 달리의 합성어이다.
이 모델들은 이미지, 텍스트 또는 오디오와 같은 새로운 콘텐츠를 만드는 데 초점을 맞춘 생성형 인공지능이라는 더 넓은 분야의 일부이다. DALL-E의 기능은 이후 텍스트-이미지 생성의 발전에 영향을 미쳤으며 다양한 상용 제품에 통합되었다.
역사 및 배경
OpenAI는 2021년 1월 5일 블로그 게시물에서 GPT-3 모델의 수정 버전을 사용하여 이미지를 생성하는 DALL-E를 공개했다. 2022년 4월 6일, 회사는 더 높은 해상도에서 더 사실적인 이미지를 생성하고 개념, 속성 및 스타일을 결합할 수 있도록 설계된 후속 모델인 DALL-E 2를 발표했다. DALL-E 2에 대한 접근은 윤리적 및 안전 문제로 인해 처음에는 연구 미리보기를 위해 사전 선정된 사용자로 제한되었다. 2022년 7월 20일, 모델은 대기자 명단에 있는 100만 명에게 초대장을 보내 베타 단계에 들어갔으며, 월별 일정 수의 무료 이미지를 제공하고 추가 구매 옵션을 제공했다. 대기자 명단 요건은 2022년 9월 28일에 제거되어 모든 사람에게 모델이 공개되었다.
2023년 9월, OpenAI는 이전 버전보다 훨씬 더 많은 뉘앙스와 세부 사항을 이해할 수 있는 DALL-E 3를 발표했다. 이 모델은 2023년 10월에 ChatGPT Plus 및 ChatGPT Enterprise 고객을 위해 ChatGPT에 기본적으로 출시되었으며, 같은 해 11월 초에는 OpenAI의 API 및 Labs 플랫폼을 통해 제공되었다. Microsoft는 Bing의 Image Creator 도구에 DALL-E 3를 구현했으며 Designer 앱에서도 사용할 계획이었고, Microsoft Copilot은 DALL-E 3에서 실행되었다. 2025년 3월, DALL-E 3는 ChatGPT에서 GPT Image의 기본 이미지 생성 기능으로 대체되었다.
2024년 2월, OpenAI는 DALL-E 생성 이미지에 워터마크를 추가하기 시작했으며, 이는 Content Authenticity Initiative가 추진하는 C2PA(콘텐츠 출처 및 진위 연합) 표준의 메타데이터를 포함한다.
기술
최초의 생성 사전 훈련 트랜스포머(GPT) 모델은 2018년 OpenAI가 트랜스포머 아키텍처를 사용하여 개발했다. 이 모델은 2019년 GPT-2, 2020년 GPT-3로 확장되었으며, 1,750억 개의 매개변수를 가졌다. DALL-E는 이 기반 위에 구축되었다.
DALL-E
원래 DALL-E는 세 가지 구성 요소를 가진다: 이산 변분 오토인코더(VAE), GPT-3와 유사한 120억 개의 매개변수를 가진 자기회귀 디코더 전용 트랜스포머 모델, 그리고 CLIP 이미지 및 텍스트 인코더 쌍이다. 이산 VAE는 트랜스포머가 이미지 데이터를 직접 처리하지 않기 때문에 이미지를 토큰 시퀀스로 변환하고 다시 되돌린다. 입력은 토큰화된 이미지 캡션 시퀀스와 그 뒤에 오는 토큰화된 이미지 패치로 구성된다. 캡션은 영어이며, 바이트 쌍 인코딩으로 토큰화되고 어휘 크기는 16,384이며 최대 256개 토큰 길이일 수 있다. 각 이미지는 256x256 RGB이며, 4x4 픽셀의 32x32 패치로 나뉘고, 각 패치는 VAE에 의해 8,192 어휘의 토큰으로 변환된다.
DALL-E는 인터넷에서 수집된 4억 쌍의 이미지와 텍스트 캡션으로 훈련된 대조 학습 기반의 별도 모델인 CLIP(대조 언어-이미지 사전 훈련)과 함께 개발되었다. CLIP은 32,768개의 무작위로 선택된 캡션 목록 중 어떤 캡션이 이미지에 가장 적합한지 예측하여 DALL-E의 출력을 순위화한다. 훈련된 CLIP 쌍은 더 큰 초기 이미지 목록을 필터링하여 텍스트 프롬프트에 가장 가까운 이미지를 선택한다.
DALL-E 2
DALL-E 2는 35억 개의 매개변수를 사용하며, 이는 전작보다 적다. 자기회귀 트랜스포머 대신 CLIP 이미지 임베딩에 조건화된 확산 모델을 사용하며, 이 임베딩은 추론 중에 사전 모델에 의해 CLIP 텍스트 임베딩에서 생성된다. 이 아키텍처는 몇 달 후 출시된 Stable Diffusion과 동일하다.
DALL-E 3
DALL-E 3에 대한 기술 보고서가 작성되었지만 훈련 또는 구현 세부 사항은 포함하지 않으며, 대신 개선된 프롬프트 따르기 기능에 초점을 맞춘다.
기능
DALL-E는 사실적인 이미지, 그림, 이모지 등 여러 스타일의 이미지를 생성할 수 있다. 이미지의 객체를 조작하고 재배치할 수 있으며, 명시적인 지시 없이도 새로운 구성에서 디자인 요소를 올바르게 배치할 수 있다. 예를 들어, 무를 그려서 코를 풀거나, 라떼를 마시거나, 외발자전거를 타게 요청하면 DALL-E는 종종 손수건, 손, 발을 그럴듯한 위치에 그린다. 특정 프롬프트 없이도 적절한 세부 사항을 추론할 수 있으며, 예를 들어 축하와 일반적으로 연관된 프롬프트에 크리스마스 이미지를 추가하거나 그림자를 적절히 배치한다. DALL-E는 또한 시각적 및 디자인 트렌드에 대한 폭넓은 이해를 보여준다.
이 모델은 다양한 관점에서 다양한 임의 설명에 대한 이미지를 드물게 실패하면서 생성할 수 있다. 조지아 공과대학 인터랙티브 컴퓨팅 학교의 부교수인 Mark Riedl은 DALL-E가 인간 창의성의 핵심 요소로 설명되는 개념을 혼합할 수 있다는 것을 발견했다. 이 모델의 시각적 추론 능력은 인간의 지능을 측정하기 위해 종종 인간에게 시행되는 시각적 테스트인 Raven's Matrices를 해결할 수 있을 만큼 충분하다.
DALL-E 3는 전작보다 복잡한 프롬프트를 더 정확하고 세부적으로 따르며, 더 일관되고 정확한 텍스트를 생성할 수 있다. ChatGPT Plus에 통합되어 있다.
이미지 수정
기존 이미지가 주어지면 DALL-E 2 및 DALL-E 3는 원본을 기반으로 개별 출력으로 이미지의 변형을 생성할 수 있을 뿐만 아니라 이미지를 수정하거나 확장할 수 있다. 이 모델의 인페인팅 및 아웃페인팅 기능은 이미지의 컨텍스트를 사용하여 주어진 프롬프트를 따라 원본과 일치하는 매체로 누락된 영역을 채운다. 예를 들어, 이는 이미지에 새 주제를 삽입하거나 이미지를 원래 경계 너머로 확장하는 데 사용될 수 있다. OpenAI에 따르면, 아웃페인팅은 그림자, 반사 및 질감을 포함한 이미지의 기존 시각적 요소를 고려한다.
영향 및 채택
DALL-E는 상용 도구에서 널리 채택되었다. Microsoft는 Designer 앱과 Bing 및 Microsoft Edge에 포함된 Image Creator 도구에 DALL-E 2를 구현했다. API는 이미지 해상도에 따라 가격이 다른 이미지당 비용 기준으로 운영되며, OpenAI의 엔터프라이즈 팀과 협력하는 회사에는 볼륨 할인이 제공된다. 이 모델의 영향은 다른 텍스트-이미지 시스템으로 확장되며 인공지능 안전, 저작권 및 콘텐츠 출처에 대한 논의에 기여했다.