OpenAI DALL-E 3 출시

영어에서 번역됨

DALL-E 3는 2023년 10월 OpenAI가 출시한 텍스트-이미지 모델로, ChatGPT에 통합되어 Plus 및 Enterprise 사용자에게 제공되며, 고급 프롬프트 이해 및 이미지 생성 기능을 제공합니다.

DALL-E 3는 OpenAI가 개발한 텍스트-이미지 모델로, 2023년 10월에 DALL-E 시리즈의 세 번째 버전으로 출시되었다. 이 모델은 ChatGPT Plus 및 ChatGPT Enterprise 고객을 위해 ChatGPT 내에서 기본적으로 제공되었으며, 2023년 11월 초에는 OpenAI의 API 및 Labs 플랫폼을 통해 더 넓은 접근이 가능해졌다. 이 모델은 이전 버전인 DALL-E 및 DALL-E 2의 기반 위에 구축되었으며, 딥러닝을 사용하여 자연어 프롬프트에서 디지털 이미지를 생성한다.

DALL-E라는 이름은 픽사 로봇 캐릭터 WALL-E와 스페인 초현실주의 화가 살바도르 달리의 합성어이다. 첫 번째 버전은 2021년 1월에 발표되었고, DALL-E 2는 2022년 4월에 이어졌다. DALL-E 3는 프롬프트의 뉘앙스와 세부 사항을 이해하는 데 있어 상당한 발전을 나타내며, 마이크로소프트의 빙 이미지 크리에이터 도구에 통합되었고, 마이크로소프트 코파일럿이 이 모델로 실행된다.

역사 및 배경

OpenAI는 2021년 1월 5일 블로그 게시물에서 GPT-3의 수정된 버전을 사용하여 이미지를 생성하는 DALL-E를 처음 공개했다. DALL-E 2는 2022년 4월 6일에 발표되었으며, 더 높은 해상도에서 더 사실적인 이미지를 생성하고 개념, 속성 및 스타일을 결합하도록 설계되었다. 2022년 7월 20일에 대기자 명단에 있는 100만 명에게 초대장을 보내 베타 버전에 들어갔고, 2022년 9월 28일에 모든 사람에게 공개되었다.

2023년 9월, OpenAI는 이전 버전보다 훨씬 더 많은 뉘앙스와 세부 사항을 이해할 수 있는 DALL-E 3를 발표했다. 이 모델은 2023년 10월에 Plus 및 Enterprise 고객을 위해 ChatGPT에 기본적으로 출시되었다. 2023년 11월 초에는 OpenAI API 및 Labs 플랫폼을 통해 사용할 수 있게 되었다. 마이크로소프트는 빙의 이미지 크리에이터 도구에 이 모델을 구현했고, 디자이너 앱에 통합할 계획을 세웠다.

2024년 2월, OpenAI는 DALL-E 생성 이미지에 워터마크를 추가하기 시작했으며, 콘텐츠 진위 이니셔티브가 추진하는 C2PA(콘텐츠 출처 및 진위 연합) 표준의 메타데이터를 포함했다. 2025년 3월, DALL-E 3는 ChatGPT에서 GPT 이미지의 기본 이미지 생성 기능으로 대체되었다.

기술

최초의 생성 사전 훈련 트랜스포머(GPT) 모델은 2018년에 OpenAI가 트랜스포머 아키텍처를 사용하여 개발했다. GPT-1은 2019년에 GPT-2로 확장되었고, 2020년에는 1750억 개의 매개변수를 가진 GPT-3로 확장되었다. DALL-E 3는 딥러닝 방법론을 사용하지만, DALL-E 3에 대한 OpenAI의 기술 보고서는 훈련 또는 구현 세부 사항을 포함하지 않으며, 대신 개선된 프롬프트 따르기 능력에 초점을 맞춘다.

DALL-E 아키텍처

원래 DALL-E는 세 가지 구성 요소로 이루어져 있었다: 이산 VAE, GPT-3와 유사한 120억 개의 매개변수를 가진 자기회귀 디코더 전용 트랜스포머 모델, 그리고 CLIP 이미지 인코더 및 텍스트 인코더 쌍. 이산 VAE는 이미지를 토큰 시퀀스로 변환하고 다시 변환하는데, 이는 트랜스포머가 이미지 데이터를 직접 처리하지 않기 때문에 필요하다.

트랜스포머 입력은 토큰화된 이미지 캡션 시퀀스와 그 뒤에 오는 토큰화된 이미지 패치로 구성된다. 캡션은 영어이며, 바이트 쌍 인코딩으로 토큰화되고 어휘 크기는 16384이며, 최대 256 토큰 길이이다. 각 이미지는 256×256 RGB이며, 각각 4×4의 32×32 패치로 나뉘고, 각 패치는 이산 변이 오토인코더에 의해 어휘 크기 8192의 토큰으로 변환된다.

CLIP(대비 언어-이미지 사전 훈련)은 DALL-E와 함께 개발되었으며, 텍스트 캡션이 있는 4억 쌍의 이미지로 훈련되었다. 이는 32,768개의 무작위로 선택된 캡션 목록에서 이미지에 가장 적합한 캡션을 예측하여 DALL-E의 출력을 순위 매기고, 더 큰 초기 목록을 필터링하여 가장 가까운 일치 항목을 선택한다.

DALL-E 2 및 DALL-E 3 아키텍처

DALL-E 2는 35억 개의 매개변수를 사용하며, 이전 버전보다 적고, CLIP 이미지 임베딩에 조건화된 확산 모델을 사용하며, 추론 중에 CLIP 텍스트 임베딩에서 이러한 임베딩을 생성하는 사전 모델을 사용한다. 이 아키텍처는 몇 달 후에 출시된 스테이블 디퓨전과 유사하다.

DALL-E 3는 이 확산 기반 접근 방식을 계속하지만 향상된 프롬프트 따르기 능력을 갖추고 있다. 공개된 기술 세부 사항은 없지만, 이 모델은 복잡한 프롬프트를 따르고 이미지 내에서 일관된 텍스트를 생성하는 데 있어 향상된 정확성을 보여준다.

기능

DALL-E는 사실적인 이미지, 그림, 이모지 등 여러 스타일로 이미지를 생성할 수 있다. 객체를 조작하고 재배열할 수 있으며, 명시적인 지시 없이 새로운 구성에서 디자인 요소를 올바르게 배치할 수 있다. 예를 들어, 무를 그려서 코를 풀거나, 라떼를 마시거나, 외발자전거를 타게 하라는 요청을 받으면, DALL-E는 종종 손수건, 손, 발을 그럴듯한 위치에 그린다.

이 모델은 특정 프롬프트 없이도 빈칸을 채워 적절한 세부 사항을 추론할 수 있으며, 예를 들어 크리스마스와 일반적으로 연관된 프롬프트에 크리스마스 이미지를 추가하고, 언급되지 않은 이미지에 그림자를 적절하게 배치한다. DALL-E는 시각적 및 디자인 트렌드에 대한 광범위한 이해를 보여주며, 다양한 관점에서 다양한 임의 설명에 대한 이미지를 드물게 실패하면서 생성할 수 있다.

조지아 공과대학 인터랙티브 컴퓨팅 학교의 부교수인 마크 리델은 DALL-E가 개념을 혼합할 수 있다는 것을 발견했으며, 이는 인간 창의성의 핵심 요소로 설명된다. 그 시각적 추론 능력은 인간의 지능을 측정하기 위해 종종 투여되는 시각적 테스트인 레이븐 매트릭스를 해결할 수 있을 만큼 충분하다.

DALL-E 3는 이전 버전보다 복잡한 프롬프트를 더 정확하고 세부적으로 따르며, 이미지 내에서 더 일관되고 정확한 텍스트를 생성할 수 있다. ChatGPT Plus에 통합되어 사용자가 대화형 프롬프트를 통해 이미지를 생성할 수 있다.

이미지 수정

기존 이미지가 주어지면, DALL-E 2 및 DALL-E 3는 원본을 기반으로 개별 출력으로 이미지의 변형을 생성할 수 있으며, 이미지를 수정하거나 확장하기 위해 편집할 수도 있다. 인페인팅 및 아웃페인팅 기능은 이미지의 맥락을 사용하여 주어진 프롬프트를 따라 원본과 일관된 매체로 누락된 영역을 채운다.

예를 들어, 이는 이미지에 새로운 주제를 삽입하거나 이미지를 원래 경계 너머로 확장하는 데 사용될 수 있다. OpenAI에 따르면, 아웃페인팅은 그림자, 반사 및 질감을 포함한 이미지의 기존 시각적 요소를 고려하여 일관성을 유지한다.

통합 및 가용성

DALL-E 3는 2023년 10월에 ChatGPT Plus 및 ChatGPT Enterprise 고객을 위해 ChatGPT에 기본적으로 출시되었다. OpenAI의 API 및 Labs 플랫폼을 통한 가용성은 2023년 11월 초에 이어졌다. 마이크로소프트는 빙의 이미지 크리에이터 도구에 이 모델을 구현했으며, 마이크로소프트 코파일럿이 DALL-E 3로 실행되고, 디자이너 앱에 통합할 계획을 세웠다.

API는 이미지당 비용 기준으로 운영되며, 가격은 이미지 해상도에 따라 다르다. OpenAI의 엔터프라이즈 팀과 협력하는 회사에는 볼륨 할인이 제공된다. 2025년 3월, DALL-E 3는 ChatGPT에서 GPT 이미지의 기본 이미지 생성 기능으로 대체되었다.

안전 및 출처

OpenAI는 유해 콘텐츠에 대한 제한 및 워터마크 추가를 포함하여 DALL-E 모델의 안전 문제를 해결했다. 2024년 2월, OpenAI는 DALL-E 생성 이미지에 워터마크를 추가하기 시작했으며, 콘텐츠 진위 이니셔티브가 추진하는 C2PA 표준의 메타데이터를 포함했다. 이는 AI 생성 이미지의 출처를 확인하는 데 도움이 된다.

유산

DALL-E 3는 Generative AIText-to-image generation 기술의 이정표를 나타내며, Deep learningNeural network 모델의 초기 작업을 기반으로 구축되었다. ChatGPT와 같은 Large language model 시스템과의 통합은 언어 및 이미지 생성의 융합을 보여준다. 이 모델의 기능은 GPT 이미지 및 기타 이미지 생성 시스템을 포함한 분야의 후속 개발에 영향을 미쳤다.

2023년 10월 DALL-E 3의 출시는 더 접근 가능하고 뉘앙스 있는 AI 이미지 생성으로의 전환을 표시했으며, 창의적 산업, 콘텐츠 제작 및 디지털 아트에 영향을 미쳤다. Microsoft Copilot 및 빙 이미지 크리에이터에서의 사용은 더 넓은 청중에게 그 범위를 확장했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:openai·text-to-image·generative-ai·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사