DALL-E 2는 OpenAI가 개발한 텍스트-이미지 모델로, 자연어 설명(프롬프트)으로부터 디지털 이미지를 생성한다. 2022년 4월 6일에 발표되었으며, 원래의 DALL-E 모델의 후속작으로, 더 현실적인 이미지를 더 높은 해상도로 생성하고 개념, 속성, 스타일을 결합할 수 있도록 설계되었다. 이 모델은 딥러닝 방법론, 특히 CLIP 이미지 임베딩에 조건화된 확산 모델을 사용하며, 2022년 동안 단계적으로 대중에게 공개되었다.
DALL-E라는 이름은 애니메이션 로봇 캐릭터 WALL-E와 스페인 초현실주의 화가 살바도르 달리의 합성어이다. 이 모델의 개발은 생성형 인공지능의 중요한 진전을 의미했으며, 머신러닝과 신경망의 초기 발전을 바탕으로 했다.
역사와 배경
DALL-E의 첫 번째 버전은 2021년 1월 OpenAI에 의해 발표되었으며, GPT-3의 수정된 버전을 사용하여 이미지를 생성했다. 2022년 4월 6일, OpenAI는 DALL-E 2를 후속 모델로 발표하며 향상된 현실감과 해상도를 강조했다. 윤리적 및 안전 문제로 인해 초기 접근은 사전 선정된 사용자에게만 연구 미리보기 형태로 제한되었다. 2022년 7월 20일, 모델은 베타 단계에 들어갔으며, 대기자 명단에 있던 100만 명에게 초대장이 발송되었고, 이들은 매달 일정 수의 이미지를 무료로 생성하고 추가 크레딧을 구매할 수 있었다. 2022년 9월 28일에 대기자 명단 요건이 제거되어 DALL-E 2가 모든 사람에게 공개되었다.
2022년 11월 초, OpenAI는 DALL-E 2를 API로 출시하여 개발자들이 애플리케이션에 모델을 통합할 수 있게 했다. API는 이미지당 비용 기준으로 운영되며, 가격은 해상도에 따라 다르고 기업 고객에게는 볼륨 할인이 제공된다. 마이크로소프트는 이후 Bing과 Microsoft Edge 내의 Designer 앱과 Image Creator 도구에 DALL-E 2를 구현했다. 2023년 9월, OpenAI는 DALL-E 3를 발표했으며, 2023년 10월에 ChatGPT의 Plus 및 Enterprise 고객에게 통합되었고, 2025년 3월에 GPT Image로 대체되었다.
기술
DALL-E 2는 35억 개의 파라미터를 사용하며, 이는 전작의 120억 개보다 적은 수치이다. 자동회귀 Transformer 모델 대신 CLIP 이미지 임베딩에 조건화된 확산 모델을 사용한다. 추론 중에는 사전 모델이 CLIP 텍스트 임베딩에서 이러한 이미지 임베딩을 생성한다. 이 아키텍처는 몇 달 후 출시된 Stable Diffusion과 유사하다. 원래 DALL-E는 이산 변분 오토인코더를 사용하여 이미지를 토큰으로 변환했으며, 이를 자동회귀 디코더 전용 Transformer로 처리하고, CLIP 이미지 및 텍스트 인코더 쌍을 사용하여 출력을 순위화했다.
DALL-E 2의 확산 과정은 텍스트에서 파생된 임베딩에 의해 안내되어 노이즈를 이미지로 반복적으로 정제하며, 이를 통해 고해상도 출력과 일관된 객체 배치가 가능하다. 모델의 훈련에는 대규모 이미지-텍스트 쌍 데이터셋이 사용되었지만, 구체적인 세부 사항은 완전히 공개되지 않았다.
기능
DALL-E 2는 사실적인 이미지, 그림, 이모지 등 여러 스타일의 이미지를 생성할 수 있다. 객체를 조작하고 재배치할 수 있으며, 명시적인 지시 없이도 새로운 구성에 디자인 요소를 올바르게 배치할 수 있다. 예를 들어, 무를 그려서 코를 풀거나, 라떼를 마시거나, 외발자전거를 타는 모습을 요청하면, 모델은 종종 손수건, 손, 발을 그럴듯한 위치에 그린다. 또한 빈칸을 채울 수 있는데, 예를 들어 크리스마스와 관련된 프롬프트에 크리스마스 이미지를 추가하거나, 언급되지 않은 이미지에 적절한 그림자를 추가할 수 있다.
이 모델은 시각적 및 디자인 트렌드에 대한 폭넓은 이해를 보여주며, 인간 창의성의 핵심 요소인 개념을 혼합할 수 있다. 시각적 추론 능력은 인간의 지능을 측정하기 위해 자주 사용되는 시각 테스트인 Raven's Matrices를 해결할 수 있을 정도로 충분하다. DALL-E 2는 다양한 관점에서 다양한 임의 설명에 대한 이미지를 생성할 수 있으며, 실패하는 경우는 드물다.
이미지 수정
기존 이미지가 주어지면 DALL-E 2는 원본을 기반으로 한 개별 출력으로 변형을 생성할 수 있을 뿐만 아니라, 이미지를 수정하거나 확장할 수 있다. 인페인팅 및 아웃페인팅 기능은 주어진 프롬프트에 따라 이미지의 맥락을 사용하여 누락된 영역을 채운다. 예를 들어, 이미지에 새로운 대상을 삽입하거나 원래 경계를 넘어 확장할 수 있다. OpenAI는 아웃페인팅이 그림자, 반사, 질감을 포함한 이미지의 기존 시각적 요소를 고려한다고 밝혔다.
안전과 윤리
연구 미리보기 기간 동안 OpenAI는 오해의 소지가 있거나 유해한 콘텐츠를 생성하는 등의 오용 우려로 인해 DALL-E 2에 대한 접근을 제한했다. 회사는 폭력적, 성인, 정치적 콘텐츠를 차단하는 필터를 구현했으며, 2024년 2월에는 생성된 이미지에 워터마크를 추가하여 Content Authenticity Initiative가 추진하는 C2PA 표준의 메타데이터를 포함했다. 이러한 조치는 딥페이크 및 허위 정보와 관련된 윤리적 문제를 해결하기 위한 것이었다.
유산과 영향
DALL-E 2는 이후의 텍스트-이미지 모델과 더 넓은 인공지능 연구에 영향을 미쳤다. 확산 기반 접근 방식은 다른 시스템에 채택되었으며, Bing Image Creator와 같은 제품에 통합되면서 생성 이미지에 대한 대중의 접근이 확대되었다. 이 모델의 성공은 딥러닝 및 멀티헤드 어텐션의 발전과 함께 생성형 AI 분야에서 OpenAI의 명성에 기여했다.