DALL-E 2는 OpenAI가 개발한 텍스트-이미지 모델로, 2022년 4월 6일에 원래 DALL-E의 후속작으로 발표되었다. 이 모델은 자연어 설명(프롬프트)으로부터 딥러닝 방법론을 사용하여 이미지를 생성한다. 이 모델은 이전 모델보다 더 높은 해상도에서 더 사실적인 이미지를 생성하도록 설계되었으며, 개념, 속성, 스타일을 결합하는 능력을 갖추고 있다. 이름은 픽사의 로봇 캐릭터 WALL-E와 스페인의 초현실주의 예술가 살바도르 달리의 합성어이다.
역사 및 배경
원래 DALL-E는 2021년 1월 5일 OpenAI의 블로그 게시물을 통해 공개되었으며, 수정된 버전의 GPT-3를 사용하여 이미지를 생성했다. DALL-E 2는 2022년 4월 6일에 발표되었고, 2022년 7월 20일에 베타 버전에 들어가며 대기자 명단에 있던 100만 명에게 초대장이 발송되었다. 이 기간 동안 사용자들은 매달 일정 수의 이미지를 무료로 생성하고 추가로 구매할 수 있었다. 이전에는 윤리 및 안전 문제에 대한 우려로 인해 사전 선정된 사용자에게만 연구 미리보기 형태로 접근이 제한되어 있었다. 2022년 9월 28일, DALL-E 2는 모든 사람에게 공개되었고 대기자 명단 요건이 제거되었다. 2022년 11월 초, OpenAI는 DALL-E 2를 API로 출시하여 개발자들이 자체 애플리케이션에 모델을 통합할 수 있게 했다. 마이크로소프트는 이후 Bing 및 Microsoft Edge에 포함된 Designer 앱과 Image Creator 도구에 DALL-E 2를 구현했다. API는 이미지당 비용을 지불하는 방식으로 운영되며, 가격은 이미지 해상도와 볼륨 할인에 따라 달라진다. 2024년 2월, OpenAI는 DALL-E 생성 이미지에 워터마크를 추가하기 시작했으며, 이는 Content Authenticity Initiative가 추진하는 C2PA(Coalition for Content Provenance and Authenticity) 표준의 메타데이터를 포함한다.
기술
DALL-E 2는 35억 개의 파라미터를 사용하며, 이는 이전 모델보다 적은 수치이다. 자회귀 트랜스포머 대신 확산 모델을 사용하며, CLIP 이미지 임베딩에 조건화된다. 추론 중에는 사전 모델이 CLIP 텍스트 임베딩에서 이미지 임베딩을 생성한다. 이 아키텍처는 몇 달 후 출시된 Stable Diffusion의 아키텍처와 동일하다. 이 모델은 생성형 AI 및 딥러닝 분야의 초기 연구, 특히 OpenAI와 다른 기관들이 개발한 트랜스포머 아키텍처 개발을 기반으로 구축되었다. 최초의 생성형 사전 학습 트랜스포머(GPT) 모델은 2018년 OpenAI에 의해 개발되었으며, 2019년 GPT-2, 2020년 GPT-3로 확장되었고, GPT-3는 1750억 개의 파라미터를 사용했다. DALL-E 2의 확산 접근 방식은 120억 개의 파라미터를 사용하고 이산 VAE와 디코더 전용 트랜스포머 모델을 사용한 원래 DALL-E의 자회귀 방식과 다르다.
기능
DALL-E 2는 사실적인 이미지, 회화, 이모지 등 여러 스타일의 이미지를 생성할 수 있다. 또한 기존 이미지의 객체를 조작하고 재배열할 수 있으며, 명시적인 지시 없이도 새로운 구도에 디자인 요소를 올바르게 배치할 수 있다. 이 모델은 시각 및 디자인 경향에 대한 광범위한 이해를 보여주며, 다양한 관점에서 광범위한 임의의 설명에 대한 이미지를 생성할 수 있고, 실패하는 경우는 드물다. 시각 추론 능력은 인간의 지능을 측정하는 데 자주 사용되는 시각 테스트인 Raven's Matrices를 해결할 만큼 충분히 뛰어나다. DALL-E 2는 또한 이미지 수정을 지원하며, 인페인팅(inpainting)과 아웃페인팅(outpainting)을 통해 기존 이미지의 변형을 생성하고 편집할 수 있다. 이러한 기능은 원본 이미지의 맥락을 사용하여 누락된 영역을 원본과 일관된 매체로 채우고, 주어진 프롬프트를 따른다. 예를 들어, 아웃페인팅은 그림자, 반사, 질감과 같은 기존 시각적 요소를 고려하여 이미지를 원래 경계 너머로 확장할 수 있다.
영향 및 유산
DALL-E 2는 텍스트-이미지 생성 분야에서 중요한 발전을 의미하며, 공개 베타와 대기자 명단의 궁극적인 제거를 통해 이 기술을 더 많은 대중에게 제공했다. 그 출시는 생성형 AI에 대한 관심을 촉발했고, 이후 2023년 10월 ChatGPT 플러스 및 엔터프라이즈 사용자를 위해 ChatGPT에 기본적으로 통합된 DALL-E 3를 포함한 후속 개발에 영향을 미쳤다. DALL-E 3는 이후 마이크로소프트의 Bing Image Creator와 Copilot에 통합되었으며, 2025년 3월에는 ChatGPT에서 GPT Image의 기본 이미지 생성 기능으로 대체되었다. 이 모델의 확산 기반 아키텍처는 Stable Diffusion과 같은 다른 시스템에도 영향을 미쳤으며, 머신러닝 애플리케이션의 급속한 발전에 기여했다. DALL-E 2의 안전 접근 방식(연구 미리보기 중 접근 제한, 이후 워터마킹)은 생성 모델의 책임 있는 배포에 대한 선례를 설정했다.
평가 및 우려
DALL-E 2의 출시는 상당한 대중적, 학계적 관심을 불러일으켰으며, AI 생성 이미지의 창의적 잠재력과 윤리적 과제를 모두 부각시켰다. 우려 사항에는 오해를 불러일으키는 콘텐츠 생성에 대한 악용 가능성, 저작권 문제, 아티스트와 디자이너에 대한 영향 등이 포함되었다. OpenAI의 단계적 출시(초기 제한 및 대기자 명단 포함)는 이러한 우려를 반영한 것이다. 이 모델이 텍스트 프롬프트에서 사실적인 이미지를 생성하는 능력은 콘텐츠의 출처와 진위성에 대한 의문을 제기했으며, 이로 인해 2024년 C2PA 워터마크 채택으로 이어졌다. 이러한 과제에도 불구하고, DALL-E 2는 기술적 성과와 사용자 친화적인 인터페이스로 널리 찬사를 받았으며, 비전문가들 사이에서 텍스트-이미지 생성의 대중화에 기여했다.