영어에서 번역됨

DALL-E 3는 OpenAI가 2023년 10월에 출시한 텍스트-이미지 모델로, 향상된 프롬프트 이해와 ChatGPT와의 통합으로 알려져 있다. 딥러닝을 사용하여 자연어 설명으로부터 이미지를 생성한다.

DALL-E 3는 2023년 10월에 출시된 OpenAI가 개발한 텍스트-이미지 모델입니다. DALL-E 시리즈의 세 번째 버전으로, DALL-E와 DALL-E 2의 뒤를 잇습니다. DALL-E 3는 자연어 설명(프롬프트)에서 디지털 이미지를 생성하기 위해 딥러닝 방법론을 사용하며, 이전 모델들보다 "훨씬 더 많은 뉘앙스와 세부 사항"을 이해하는 데 중점을 둡니다. 이 모델은 ChatGPT Plus 및 ChatGPT Enterprise 고객을 위해 ChatGPT에 기본적으로 통합되었으며, 이후 OpenAI의 API와 Labs 플랫폼을 통해 제공되었습니다. 2025년 3월, DALL-E 3는 ChatGPT에서 GPT Image의 기본 이미지 생성 기능으로 대체되었습니다.

역사 및 배경

DALL-E는 2021년 1월 5일 OpenAI에 의해 처음 발표되었으며, 이미지 생성을 위해 수정된 버전의 GPT-3를 사용했습니다. DALL-E 2는 2022년 4월 6일에 뒤를 이어 출시되었으며, 더 높은 해상도와 개념, 속성, 스타일을 결합하는 기능을 제공했습니다. 2022년 7월 베타 단계와 2022년 9월 공개 출시 이후, DALL-E 2는 2022년 11월 API를 통해 제공되었습니다. 2023년 9월, OpenAI는 DALL-E 3를 발표했고, 이는 2023년 10월에 출시되었습니다. Microsoft는 Bing의 이미지 생성 도구에 DALL-E 3를 구현했으며, Microsoft Copilot은 DALL-E 3에서 실행됩니다. "DALL-E"라는 이름은 픽사 로봇 WALL-E와 스페인 초현실주의 화가 살바도르 달리의 합성어입니다. 2024년 2월, OpenAI는 C2PA 표준의 메타데이터를 사용하여 DALL-E 생성 이미지에 워터마크를 추가하기 시작했습니다.

기술

DALL-E 3는 OpenAI의 GPT 모델에 사용된 트랜스포머 아키텍처를 기반으로 합니다. DALL-E 3에 대한 기술 보고서가 작성되었지만, 훈련 또는 구현 세부 사항은 포함하지 않고 개선된 프롬프트 따르기에 초점을 맞춥니다. 이 모델은 더 큰 정확성과 세부 사항으로 복잡한 프롬프트를 해석하도록 설계되었으며, 이전 버전에 비해 이미지 내에서 더 일관되고 정확한 텍스트를 생성할 수 있습니다.

DALL-E 및 DALL-E 2

원래 DALL-E는 이산 VAE, 120억 개의 매개변수를 가진 자기회귀 디코더 전용 트랜스포머, 그리고 출력을 순위화하기 위한 CLIP 모델을 사용했습니다. 35억 개의 매개변수를 가진 DALL-E 2는 이후 Stable Diffusion에서 사용된 아키텍처와 유사하게 CLIP 이미지 임베딩에 조건화된 확산 모델로 전환했습니다.

기능

DALL-E 3는 사실적인 이미지, 그림, 이모지 등 여러 스타일의 이미지를 생성할 수 있습니다. 객체를 조작하고 재배열하며, 새로운 구성으로 디자인 요소를 배치할 수 있습니다. 이전 모델보다 더 큰 정확성과 세부 사항으로 복잡한 프롬프트를 따르며, 이미지 내에서 일관된 텍스트를 생성할 수 있습니다. DALL-E 3는 ChatGPT Plus에 통합되어 사용자가 대화에서 직접 이미지를 생성할 수 있습니다.

이미지 수정

DALL-E 2 및 DALL-E 3는 기존 이미지의 변형을 생성하고 편집할 수 있으며, 인페인팅과 아웃페인팅을 포함합니다. 이러한 기능은 원본 이미지의 컨텍스트를 사용하여 누락된 영역을 채우거나 경계를 넘어 확장하며, 그림자, 반사, 질감의 일관성을 유지합니다.

반응 및 영향

DALL-E 3는 향상된 프롬프트 따르기와 ChatGPT와의 통합으로 주목받았으며, 더 넓은 사용자층이 접근할 수 있게 했습니다. Microsoft의 Bing 이미지 생성 도구와 Copilot에서의 사용은 그 영향력을 확장했습니다. 복잡한 프롬프트에서 세부적이고 정확한 이미지를 생성하는 모델의 능력은 생성형 AI 분야에 영향을 미쳤지만, 윤리와 안전에 대한 우려가 제기되어 워터마크와 같은 조치가 도입되었습니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:text-to-image·openai·generative-ai·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사