DALL-E 3는 2023년 10월에 출시된 OpenAI가 개발한 텍스트-이미지 모델입니다. DALL-E 시리즈의 세 번째 버전으로, DALL-E와 DALL-E 2의 뒤를 잇습니다. DALL-E 3는 자연어 설명(프롬프트)에서 디지털 이미지를 생성하기 위해 딥러닝 방법론을 사용하며, 이전 모델들보다 "훨씬 더 많은 뉘앙스와 세부 사항"을 이해하는 데 중점을 둡니다. 이 모델은 ChatGPT Plus 및 ChatGPT Enterprise 고객을 위해 ChatGPT에 기본적으로 통합되었으며, 이후 OpenAI의 API와 Labs 플랫폼을 통해 제공되었습니다. 2025년 3월, DALL-E 3는 ChatGPT에서 GPT Image의 기본 이미지 생성 기능으로 대체되었습니다.
역사 및 배경
DALL-E는 2021년 1월 5일 OpenAI에 의해 처음 발표되었으며, 이미지 생성을 위해 수정된 버전의 GPT-3를 사용했습니다. DALL-E 2는 2022년 4월 6일에 뒤를 이어 출시되었으며, 더 높은 해상도와 개념, 속성, 스타일을 결합하는 기능을 제공했습니다. 2022년 7월 베타 단계와 2022년 9월 공개 출시 이후, DALL-E 2는 2022년 11월 API를 통해 제공되었습니다. 2023년 9월, OpenAI는 DALL-E 3를 발표했고, 이는 2023년 10월에 출시되었습니다. Microsoft는 Bing의 이미지 생성 도구에 DALL-E 3를 구현했으며, Microsoft Copilot은 DALL-E 3에서 실행됩니다. "DALL-E"라는 이름은 픽사 로봇 WALL-E와 스페인 초현실주의 화가 살바도르 달리의 합성어입니다. 2024년 2월, OpenAI는 C2PA 표준의 메타데이터를 사용하여 DALL-E 생성 이미지에 워터마크를 추가하기 시작했습니다.
기술
DALL-E 3는 OpenAI의 GPT 모델에 사용된 트랜스포머 아키텍처를 기반으로 합니다. DALL-E 3에 대한 기술 보고서가 작성되었지만, 훈련 또는 구현 세부 사항은 포함하지 않고 개선된 프롬프트 따르기에 초점을 맞춥니다. 이 모델은 더 큰 정확성과 세부 사항으로 복잡한 프롬프트를 해석하도록 설계되었으며, 이전 버전에 비해 이미지 내에서 더 일관되고 정확한 텍스트를 생성할 수 있습니다.
DALL-E 및 DALL-E 2
원래 DALL-E는 이산 VAE, 120억 개의 매개변수를 가진 자기회귀 디코더 전용 트랜스포머, 그리고 출력을 순위화하기 위한 CLIP 모델을 사용했습니다. 35억 개의 매개변수를 가진 DALL-E 2는 이후 Stable Diffusion에서 사용된 아키텍처와 유사하게 CLIP 이미지 임베딩에 조건화된 확산 모델로 전환했습니다.
기능
DALL-E 3는 사실적인 이미지, 그림, 이모지 등 여러 스타일의 이미지를 생성할 수 있습니다. 객체를 조작하고 재배열하며, 새로운 구성으로 디자인 요소를 배치할 수 있습니다. 이전 모델보다 더 큰 정확성과 세부 사항으로 복잡한 프롬프트를 따르며, 이미지 내에서 일관된 텍스트를 생성할 수 있습니다. DALL-E 3는 ChatGPT Plus에 통합되어 사용자가 대화에서 직접 이미지를 생성할 수 있습니다.
이미지 수정
DALL-E 2 및 DALL-E 3는 기존 이미지의 변형을 생성하고 편집할 수 있으며, 인페인팅과 아웃페인팅을 포함합니다. 이러한 기능은 원본 이미지의 컨텍스트를 사용하여 누락된 영역을 채우거나 경계를 넘어 확장하며, 그림자, 반사, 질감의 일관성을 유지합니다.
반응 및 영향
DALL-E 3는 향상된 프롬프트 따르기와 ChatGPT와의 통합으로 주목받았으며, 더 넓은 사용자층이 접근할 수 있게 했습니다. Microsoft의 Bing 이미지 생성 도구와 Copilot에서의 사용은 그 영향력을 확장했습니다. 복잡한 프롬프트에서 세부적이고 정확한 이미지를 생성하는 모델의 능력은 생성형 AI 분야에 영향을 미쳤지만, 윤리와 안전에 대한 우려가 제기되어 워터마크와 같은 조치가 도입되었습니다.