영어에서 번역됨

DALL-E는 OpenAI가 개발한 일련의 텍스트-이미지 모델로, 딥러닝을 사용하여 자연어 프롬프트로부터 디지털 이미지를 생성합니다. 첫 번째 버전은 2021년 1월에 발표되었으며, 후속 모델인 DALL-E 2와 DALL-E 3는 각각 2022년과 2023년에 출시되었습니다.

DALL-E, DALL-E 2, DALL-E 3(스타일 표기: DALL·E)는 OpenAI딥러닝 방법론을 사용하여 자연어 설명(프롬프트)으로부터 디지털 이미지를 생성하도록 개발한 텍스트-이미지 모델이다. 첫 번째 버전은 2021년 1월에 발표되었으며, 이후 반복 버전들은 사실성, 해상도, 프롬프트 준수 능력을 확장했다. 이름은 픽사 로봇 캐릭터 WALL-E와 스페인 초현실주의 화가 살바도르 달리의 합성어이다.

역사 및 배경

OpenAI는 2021년 1월 5일 블로그 게시물에서 GPT-3의 수정 버전을 사용하여 이미지를 생성하는 DALL-E를 공개했다. 2022년 4월 6일, 회사는 더 높은 해상도에서 더 사실적인 이미지를 생성하고 "개념, 속성, 스타일을 결합"할 수 있는 후속 모델인 DALL-E 2를 발표했다. DALL-E 2에 대한 접근은 윤리적 및 안전 문제로 인해 처음에는 연구 미리보기로 사전 선정된 사용자에게만 제한되었다. 2022년 7월 20일, 모델은 베타 단계에 들어갔으며, 100만 명의 대기자 명단에 있는 개인에게 초대장이 발송되어 매월 일정 횟수의 무료 생성이 가능하고 추가 구매 옵션이 제공되었다. 대기자 명단 요구 사항은 2022년 9월 28일에 제거되어 모든 사람에게 도구가 공개되었다.

2023년 9월, OpenAI는 이전 반복 버전보다 "훨씬 더 많은 뉘앙스와 세부 사항"을 이해할 수 있는 DALL-E 3를 발표했다. 이 모델은 2023년 10월에 ChatGPT Plus 및 Enterprise 고객을 위해 기본적으로 출시되었으며, 11월 초에는 API 및 "Labs" 플랫폼을 통해 제공되었다. Microsoft는 이 모델을 Bing의 Image Creator 도구와 Designer 앱에 구현했으며, Microsoft Copilot은 DALL-E 3에서 실행되었다. 2025년 3월, DALL-E 3는 ChatGPT에서 GPT Image의 기본 이미지 생성 기능으로 대체되었다. 2024년 2월, OpenAI는 DALL-E 생성 이미지에 C2PA(콘텐츠 출처 및 진위 연합) 표준의 메타데이터를 포함하는 워터마크를 추가하기 시작했다.

기술

최초의 생성 사전 훈련 트랜스포머(GPT) 모델은 2018년 OpenAI가 트랜스포머 아키텍처를 사용하여 개발했다. 확장 반복은 2019년 GPT-2와 2020년 GPT-3를 생성했으며, 후자는 1,750억 개의 매개변수를 가졌다. DALL-E는 버전별로 구별되는 아키텍처로 이 기반 위에 구축되었다.

DALL-E

원래 DALL-E는 세 가지 구성 요소로 이루어져 있었다: 이산 변분 오토인코더(VAE), GPT-3와 유사한 120억 개의 매개변수를 가진 자기회귀 디코더 전용 트랜스포머 모델, 그리고 CLIP 이미지 및 텍스트 인코더 쌍. 이산 VAE는 이미지를 토큰 시퀀스로 변환하고 다시 변환했는데, 이는 트랜스포머가 이미지 데이터를 직접 처리하지 않기 때문에 필요했다. 입력은 토큰화된 영어 캡션(최대 256개 토큰, 어휘 크기 16,384)과 그 뒤에 오는 토큰화된 이미지 패치로 구성되었다. 각 256×256 RGB 이미지는 4×4 픽셀의 32×32 패치로 나뉘었으며, 각 패치는 8,192의 어휘를 사용하여 토큰으로 변환되었다.

CLIP(대조 언어-이미지 사전 훈련)은 DALL-E와 함께 개발되어 발표된 별도의 모델로, 인터넷에서 수집된 4억 개의 이미지-텍스트 쌍으로 훈련된 대조 학습에 기반했다. 이 모델은 32,768개의 무작위 선택 캡션 목록에서 이미지에 가장 적합한 캡션을 예측하여 DALL-E의 출력을 순위화했으며, 더 큰 초기 목록을 필터링하여 프롬프트에 가장 가까운 일치 항목을 선택했다.

DALL-E 2

DALL-E 2는 35억 개의 매개변수를 사용하여 전임자보다 적었고, 자기회귀 트랜스포머를 CLIP 이미지 임베딩에 조건화된 확산 모델로 대체했다. 추론 중에 이러한 임베딩은 사전 모델에 의해 CLIP 텍스트 임베딩에서 생성되었다. 이 아키텍처는 몇 달 후 출시된 Stable Diffusion과 동일했다.

DALL-E 3

OpenAI는 DALL-E 3에 대한 기술 보고서를 발표했지만, 훈련 및 구현 세부 사항은 생략하고 개선된 프롬프트 준수 능력에 초점을 맞췄다. 이 모델은 ChatGPT Plus에 통합되어 생성된 이미지의 대화형 개선을 가능하게 했다.

기능

DALL-E는 사실적인 이미지, 그림, 이모지 등 여러 스타일로 이미지를 생성할 수 있었다. 명시적인 지시 없이도 객체를 "조작하고 재배열"하며 디자인 요소를 새로운 구성에 배치할 수 있었다. BoingBoing에 글을 쓴 Thom Dunn은 무를 코를 풀거나 라떼를 마시거나 외발자전거를 타는 모습을 그리도록 요청했을 때 DALL-E가 종종 손수건, 손, 발을 그럴듯한 위치에 그렸다고 언급했다. 이 모델은 관련 프롬프트에 대한 크리스마스 이미지나 텍스트에 언급되지 않은 그림자와 같은 적절한 세부 사항을 추론하여 "빈칸을 채울" 수 있었으며, 시각적 및 디자인 트렌드에 대한 광범위한 이해를 보여주었다.

DALL-E는 다양한 관점에서 다양한 임의 설명에 대한 이미지를 드물게 실패하면서 생성할 수 있었다. 조지아 공과대학 인터랙티브 컴퓨팅 학교의 부교수인 Mark Riedl은 DALL-E가 인간 창의성의 핵심 요소인 개념을 혼합할 수 있다는 것을 발견했다. 시각적 추론 능력은 인간 지능을 측정하기 위해 자주 사용되는 시각적 테스트인 Raven's Matrices를 해결할 수 있을 만큼 충분했다.

DALL-E 3는 전임자보다 더 정확하고 세부적으로 복잡한 프롬프트를 따랐으며, 이미지 내 텍스트를 더 일관되고 정확하게 생성했다.

이미지 수정

기존 이미지가 주어지면 DALL-E 2와 DALL-E 3는 원본을 기반으로 개별 출력으로 "변형"을 생성할 수 있을 뿐만 아니라 이미지를 수정하거나 확장할 수 있었다. "인페인팅" 및 "아웃페인팅" 기능은 이미지의 맥락을 사용하여 주어진 프롬프트를 따르면서 원본과 일치하는 매체로 누락된 영역을 채웠다. 예를 들어, 이는 이미지에 새 대상을 삽입하거나 원래 경계를 넘어 확장하는 것을 허용했다. OpenAI에 따르면, "아웃페인팅은 이미지의 기존 시각적 요소(그림자, 반사, 질감 포함)를 고려하여" 매끄러운 확장을 생성한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:text-to-image·openai·generative-ai·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사