영어에서 번역됨

DALL-E는 OpenAI가 개발한 일련의 텍스트-이미지 모델로, 2021년 1월에 처음 발표되었으며, 딥러닝을 사용하여 자연어 프롬프트로부터 디지털 이미지를 생성합니다.

DALL-E는 OpenAI가 개발한 일련의 텍스트-이미지 모델로, 프롬프트라고 알려진 자연어 설명에서 디지털 이미지를 생성한다. 첫 번째 버전은 2021년 1월에 발표되었으며, 2022년에는 DALL-E 2, 2023년에는 DALL-E 3가 뒤를 이었다. 이름은 애니메이션 로봇 WALL-E와 초현실주의 예술가 살바도르 달리의 합성어이다.

역사와 배경

OpenAI는 2021년 1월 5일 블로그 게시물에서 DALL-E를 공개했으며, GPT-3 모델의 수정 버전을 사용하여 이미지를 생성했다. 2022년 4월 6일, 회사는 더 높은 해상도에서 더 사실적인 이미지를 생성하고 개념, 속성, 스타일을 결합할 수 있도록 설계된 후속 모델인 DALL-E 2를 발표했다. 접근은 윤리적 및 안전 문제로 인해 처음에는 사전 선정된 사용자에게만 연구 미리보기로 제한되었다. 2022년 7월 20일, DALL-E 2는 베타 버전에 들어갔으며, 대기자 명단에 있던 백만 명에게 초대장이 발송되었다. 사용자는 매달 제한된 수의 이미지를 무료로 생성하고 추가로 구매할 수 있었다. 2022년 9월 28일, 대기자 명단이 제거되고 모델이 모든 사람에게 공개되었다.

2023년 9월, OpenAI는 이전 버전보다 훨씬 더 많은 뉘앙스와 세부 사항을 이해할 수 있는 DALL-E 3를 발표했다. 2023년 10월에 ChatGPT Plus 및 Enterprise 고객을 위해 기본적으로 출시되었으며, 11월 초에는 API 및 Labs에서 사용할 수 있게 되었다. Microsoft는 DALL-E 3를 Bing의 Image Creator와 Designer 앱에 통합했으며, Microsoft Copilot은 DALL-E 3에서 실행된다. 2025년 3월, DALL-E 3는 ChatGPT에서 GPT Image의 기본 이미지 생성 기능으로 대체되었다.

2024년 2월, OpenAI는 DALL-E 생성 이미지에 워터마크를 추가하기 시작했으며, Content Authenticity Initiative가 추진하는 C2PA(콘텐츠 출처 및 진위 연합) 표준에 메타데이터를 포함시켰다.

기술

최초의 생성 사전 훈련 트랜스포머(GPT) 모델은 2018년 OpenAI에 의해 개발되었으며, Transformer (architecture) 아키텍처를 사용했다. 2019년에는 GPT-2로, 2020년에는 1,750억 개의 매개변수를 가진 GPT-3로 확장되었다.

DALL-E

DALL-E는 세 가지 구성 요소로 이루어져 있다: 이산 변분 오토인코더(VAE), GPT-3와 유사한 120억 개의 매개변수를 가진 자기회귀 디코더 전용 트랜스포머 모델, 그리고 CLIP(대조 언어-이미지 사전 훈련) 이미지 및 텍스트 인코더 쌍이다. 이산 VAE는 이미지를 토큰 시퀀스로 변환하고 다시 되돌려 트랜스포머가 이미지 데이터를 처리할 수 있게 한다. 트랜스포머는 토큰화된 이미지 캡션 시퀀스와 그 뒤에 오는 토큰화된 이미지 패치를 받는다. 캡션은 영어이며, 어휘 크기 16,384의 바이트 쌍 인코딩으로 토큰화되고 최대 256토큰 길이일 수 있다. 각 이미지는 256×256 RGB이며, 4×4 픽셀의 32×32 패치로 나뉘고, 각 패치는 VAE에 의해 8,192 어휘의 토큰으로 변환된다.

DALL-E와 함께 개발된 CLIP은 대조 학습에 기반한 별도의 모델로, 인터넷에서 수집된 4억 개의 이미지-텍스트 쌍으로 훈련되었다. CLIP은 32,768개의 무작위로 선택된 캡션 목록 중 어떤 캡션이 이미지에 가장 적합한지 예측하여 DALL-E의 출력을 순위 매긴다. 훈련된 CLIP 은 생성된 더 큰 초기 이미지 목록을 필터링하여 프롬프트에 가장 가까운 것을 선텍한다.

DALL-E 2

DALL-E 2는 35억 개의 매개변수를 사용하며, 전임자보다 적다. 자회귀 트랜스포머 대신, CLIP 이미지 임베딩에 조건화된 확산 모델을 사용하며, 이는 추론 중에 CLIP 텍스트 임베딩에서 사전 모델에 의해 생성된다. 이 아키텍처는 몇 달 후 출시된 Stable Diffusion과 유사하다.

DALL-E 3

OpenAI는 DALL-E 3에 대한 기술 보고서를 발표했지만, 훈련 또는 구현 세부 사항은 포함하지 않고 개선된 프롬프트 따르기 능력에 초점을 맞춘다.

능력

DALL-E는 사진적 이미지, 회화, 이모지 등 여러 스타일로 이미지를 생성할 수 있다. 이미지에서 객체를 조작하고 재배열할 수 있으며, 명시적 지시 없이 새로운 구도에서 디자인 요소를 올바르게 배치할 수 있다. 예를 들어, 무를 그려 달라고 요청했을 때 코를 풀거나 라떼를 마시거나 외발자전거를 타는 장면에서, DALL-E는 종종 손수건, 손, 발을 그럴듯한 위치에 그린다. 프롬프트에 언급되지 않은 적절한 세부 사항을 추론할 수 있으며, 예를 들어 가적인 프롬프트에 크리스마스 이미지를 추가하거나 그림자를 적절히 배치한다. DALL-E는 또한 시각적 및 디자인 트렌드에 대한 폭은 이해를 보여준다.

DALL-E는 다양한 시점에서 다양한 임의 설명에 대한 이미지를 생성할 수 있으며, 드물게 실패하는 경우만 있다. 조지아 공과대학 인터랙티브 컴퓨팅 학과의 부교수인 마크 리들은 DALL-E가 개념을 혼합할 수 있다는 것을 발견했으며, 이를 인간 창의성의 핵심 요소로 설명했다. 그 시각적 추론 능력은 인간 지능을 측정하는 데 자주 사용되는 시각적 테스트인 레이븐 행렬을 풀기에 충분하다.

DALL-E 3는 이전 버전보다 복잡한 프롬프트를 더 정확하고 세부적으로 따르며, 더 일관되고 정확한 텍스트를 생성할 수 있다. ChatGPT Plus에 통합되어 있다.

이미지 수정

DALL-E 2와 DALL-E 3는 기존 이미지의 변형을 생산할 수 있고, 이를 수정하여 변형하거나 확장할 수 있다. 인페인팅과 아웃페인팅 능력은 이미지의 맥락을 사용하여 원본과 일치하는 스타일로 누락된 영역을 채운다. 이는 프롬프트를 따르며 새 주제를 이미지에 삽입하거나 원래 경계를 넘어 확장할 수 있다. OpenAI에 따르면, 아웃페인팅은 그림자, 반사, 질감을 포합한 이미지의 기존 시각적 요소를 고려한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:text-to-image·openai·generative-ai·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사