DALL-E는 OpenAI가 개발한 일련의 Text-to-image generation 생성 모델로, 예술가 살바도르 달리와 픽사 로봇 캐릭터 WALL-E의 합성어로 명명되었다. 원래의 DALL-E는 2021년 1월에 120억 개의 파라미터를 가진 Transformer (architecture) 모델로 발표되었으며, GPT-3와 동일한 아키텍처 계열에 기반을 두고 있다. 이 모델은 이미지 생성을 이산 이미지 토큰에 대한 시퀀스 예측 문제로 취급하여 텍스트 설명에서 이미지를 생성하도록 훈련되었으며, 이후 이 분야를 지배하게 될 확산 기법 대신 이 방식을 사용했다.
버전별 진화
2022년 4월에 출시된 DALL-E 2는 기존의 이산 토큰 접근 방식을 CLIP에 의해 안내되는 확산 기반 아키텍처로 대체했다. CLIP은 OpenAI의 이미지-텍스트 결합 Embedding 모델로, 이로 인해 훨씬 더 높은 해상도와 더 사실적인 이미지를 생성할 수 있게 되었으며, 텍스트 설명으로 기존 이미지의 일부를 편집하는 "인페인팅" 기능도 도입되었다. DALL-E 2의 공개 베타와 그 이후 2022년 후반의 일반 공개는 상당한 주류 미디어의 주목을 받았으며, Midjourney 및 Stable Diffusion과 같은 동시대 출시작들과 함께 AI 생성 이미지를 처음으로 주류 대중의 인식에 끌어올린 것으로 널리 평가된다. 2023년에 출시된 DALL-E 3는 구독자에게 ChatGPT에 직접 통합되었으며, 프롬프트 준수와 이미지 내 텍스트 렌더링을 개선했고, ChatGPT 자체를 사용하여 짧은 사용자 프롬프트를 확장하고 다듬은 후 이미지 모델에 전달했다.
수용과 영향
DALL-E의 출시는 시각적 창작 작업의 미래에 대한 상당한 공개 논쟁을 촉발했다. AI 지원 예술과 디자인을 실험하는 사용자들의 열광과 함께, 전문 일러스트레이터와 사진작가들은 일자리 대체와 동의 없는 저작권 이미지의 훈련 데이터 사용에 대한 우려를 표명했으며, 이 분쟁은 생성 AI 산업 전반의 더 광범위한 AI and copyright 소송으로 이어졌다. 이 시스템은 또한 허위 정보와 비동의 이미지를 생성할 가능성에 대한 조사 대상이 되었으며, 이에 OpenAI는 콘텐츠 필터를 구현하고 한동안 공인 얼굴의 인식 가능한 이미지 생성에 대한 제한을 도입했다.
유산
DALL-E는 일반적으로 GAN에 대한 초기 학술 연구와 이후의 오픈 경쟁자들과 함께, 텍스트-이미지 생성을 연구적 호기심이 아닌 주류 소비자 및 상업 기술로 확립한 모델 중 하나로 평가된다. 그 성공은 OpenAI의 더 광범위한 멀티모달 전략에 직접적으로 기여했으며, 이후 GPT-4 및 후속 모델에 통합된 이미지 이해 및 이미지 생성 기능에 정보를 제공했고, 프롬프트 작성이 텍스트뿐만 아니라 시각적 생성 AI 시스템에도 관련된 기술로 대중화되는 데 기여했다.