영어에서 번역됨

DALL-E 1은 OpenAI가 개발한 텍스트-이미지 모델로, 딥러닝을 사용하여 자연어 프롬프트에서 디지털 이미지를 생성한다. 2021년 1월에 발표되었으며, 수정된 GPT-3 아키텍처를 사용하고 생성형 AI의 이정표가 되었다.

DALL-E 1은 스타일화된 표기로 DALL·E로 표기되며, 텍스트-이미지 모델로 OpenAI딥러닝 방법론을 사용하여 개발했다. 이 모델은 프롬프트로 알려진 자연어 설명에서 디지털 이미지를 생성한다. DALL-E의 첫 번째 버전은 2021년 1월에 발표되었으며, 대규모 언어 모델과 이미지 생성을 결합한 최초의 주목할 만한 모델 중 하나가 되었다. 이 소프트웨어의 이름은 애니메이션 로봇 WALL-E와 스페인 초현실주의 예술가 살바도르 달리의 이름을 합성한 것이다.

후속 모델인 DALL-E 2는 2022년 4월에 출시되었고, 2022년 7월에 공개 베타가 시작되었다. DALL-E 3는 2023년 10월에 출시되어 ChatGPT의 Plus 및 Enterprise 고객을 위해 기본적으로 통합되었다. DALL-E 3는 2025년 3월 ChatGPT에서 GPT Image의 기본 이미지 생성 기능으로 대체되었다.

역사 및 배경

DALL-E는 2021년 1월 5일 OpenAI의 블로그 게시물을 통해 공개되었다. 이 모델은 이미지 생성에 적응된 Transformer (architecture) 아키텍처를 사용하는 GPT-3의 변형이었다. 당시 OpenAI는 GPT-3와 같은 대규모 언어 모델로 유명했지만, DALL-E는 텍스트와 이미지 영역을 모두 다루는 다중 모드 인공지능으로의 전환을 의미했다. 모델 이름은 OpenAI의 명명 방식에서 흔히 볼 수 있는 장난기 어린 약어와 말장난의 흐름을 따랐다.

2024년 2월, OpenAI는 DALL-E 생성 이미지에 워터마킹을 추가하기 시작했으며, 이미지 출처 추적을 돕기 위해 Content Authenticity Initiative가 추진하는 C2PA(Coalition for Content Provenance and Authenticity) 표준의 메타데이터를 포함했다.

기술

최초의 생성형 사전 훈련 트랜스포머(GPT) 모델은 2018년 OpenAI에 의해 처음 개발되었으며, Transformer (architecture) 아키텍처를 사용했다. 첫 번째 반복인 GPT-1은 2019년에 GPT-2로 확장되었고, 2020년에는 1,750억 개의 매개변수를 가진 GPT-3로 다시 확장되었다. DALL-E는 이미지 생성을 위해 수정된 GPT-3의 별도 변형이다.

DALL-E 1

DALL-E는 세 가지 구성 요소로 이루어져 있다: 이산 변이형 오토인코더, GPT-3와 유사한 자기회귀 디코더 전용 Transformer (architecture) 모델(120억 개의 매개변수), 그리고 CLIP 이미지 인코더와 텍스트 인코더 쌍이다.

이산 변이형 오토인코더(VAE)는 이미지를 토큰 시퀀스로 변환하고, 반대로 토큰 시퀀스를 이미지로 다시 변환한다. 이는 트랜스포머 모델이 이미지 데이터를 직접 처리하지 않기 때문에 필요하다. 트랜스포머의 입력은 토큰화된 이미지 캡션과 토큰화된 이미지 패치의 시퀀스이다. 캡션은 영어이며, 바이트-쌍 인코딩(어휘 크기 16384)으로 토큰화되며 최대 256토큰 길이일 수 있다. 각 이미지는 256x256 RGB 이미지로, 각각 4x4 크기의 32x32 패치로 나뉜다. 각 패치는 이산 VAE에 의해 토큰(어휘 크기 8192)으로 변환된다.

DALL-E는 CLIP(대조 언어-이미지 사전 훈련)과 함께 개발 및 출시되었다. CLIP은 대조 학습을 기반으로 한 별도의 모델로, 인터넷에서 수집한 이미지와 텍스트 캡션 쌍 4억 개로 훈련되었다. CLIP의 역할은 32,768개의 무작위 선택 캡션(그중 하나가 정답) 목록에서 이미지에 가장 적합한 캡션을 예측하여 DALL-E의 출력을 이해하고 순위를 매기는 것이다. 훈련된 CLIP 쌍은 DALL-E가 생성한 더 큰 초기 이미지 목록을 필터링하여 텍스트 프롬프트에 가장 가까운 이미지를 선택한다.

후속 모델

DALL-E 2는 35억 개의 매개변수를 사용하며, 이는 이전 모델보다 적은 수이다. 자기회귀 트랜스포머 대신 CLIP 이미지 임베딩에 조건화된 Diffusion model을 사용하며, 추론 중에는 사전 모델에 의해 CLIP 텍스트 임베딩에서 생성된다. 이는 몇 달 후 출시된 Stable-Diffusion과 동일한 아키텍처이다.

2023년 9월에 출시된 DALL-E 3는 이전 버전보다 복잡한 프롬프트를 더 정확하고 상세하게 따르며, 더 일관된 텍스트를 생성할 수 있다. 기술 보고서가 작성되었지만, 이 보고서는 훈련 또는 구현 세부 사항을 포함하지 않고 개선된 프롬프트 추종에 초점을 맞추고 있다.

기능

DALL-E는 사실적인 이미지, 그림, 이모지 등 여러 스타일로 이미지를 생성할 수 있다. 이미지의 객체를 조작하고 재배열할 수 있으며, 명시적인 지시 없이도 새로운 구성에 디자인 요소를 올바르게 배치할 수 있다. 창의적 추론 능력을 보여주며, 예를 들어 축하와 관련된 프롬프트에 크리스마스 이미지를 추가하거나 언급되지 않은 그림자도 적절히 배치하는 등 프롬프트에 대한 그럴듯한 세부 사항을 채워 넣는다. DALL-E는 시각적 디자인 트렌드에 대한 폭넓은 이해를 보여준다.

DALL-E는 다양한 관점에서 다양한 임의 설명에 대한 이미지를 드물게 실패하면서 생성할 수 있다. 조지아 공과대학 인터랙티브 컴퓨팅 학교의 부교수인 Mark Riedl은 DALL-E가 인간 창의성의 핵심 요소인 개념을 혼합할 수 있다는 것을 발견했다. 시각적 추론 능력은 지능을 측정하기 위해 자주 시행되는 시각적 테스트인 Raven's Matrices를 해결할 수 있을 만큼 충분하다.

이미지 수정

기존 이미지가 주어지면 DALL-E 2와 DALL-E 3는 이미지의 변형을 생성하고, 장면을 수정하거나 확장하도록 편집할 수 있다. 이러한 모델의 인페인팅 및 아웃페인팅 기능은 이미지의 맥락을 사용하여 주어진 프롬프트에 따라 원본과 일관된 스타일로 누락된 영역을 채운다. 이는 새 주제를 삽입하거나 이미지를 경계 너머로 확장하는 데 사용할 수 있다. OpenAI에 따르면, 아웃페인팅은 그림자, 반사, 질감을 포함한 이미지의 기존 시각적 요소를 고려한다.

응용 및 영향

DALL-E 1은 생성형 AI 이미지 생성의 새로운 시대를 열었고, 이후 모델과 응용 프로그램에 영향을 미쳤다. 후속 모델인 DALL-E 2는 2022년 11월 API를 통해 제공되어 개발자가 이미지당 비용을 지불하는 가격으로 모델을 응용 프로그램에 통합할 수 있게 했다. Microsoft는 DALL-E 2를 Designer 앱과 Bing 및 Edge의 Image Creator 도구에 통합했다. DALL-E 3는 2023년 10월 Plus 및 Enterprise 고객을 위해 ChatGPT에 통합되었으며, 11월에는 API 및 Labs에서 사용할 수 있게 되었다. 2024년 2월, OpenAI는 C2PA 표준에 따라 DALL-E 이미지에 워터마크를 추가했다.

참고 문헌

이 기사는 공개 보고서와 OpenAI 자체 간행물의 정보를 기반으로 한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-art·openai·text-to-image·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사