DALL-E 3 é um modelo de texto para imagem desenvolvido pela OpenAI, lançado em outubro de 2023 como a terceira iteração da série DALL-E. Ele foi disponibilizado nativamente no ChatGPT para clientes do ChatGPT Plus e ChatGPT Enterprise, com acesso mais amplo por meio da API e da plataforma Labs da OpenAI no início de novembro de 2023. O modelo se baseia nos fundamentos de seus antecessores, DALL-E e DALL-E 2, usando aprendizado profundo para gerar imagens digitais a partir de instruções em linguagem natural.
O nome DALL-E é uma combinação do personagem robô da Pixar, WALL-E, e do artista surrealista espanhol Salvador Dalí. A primeira versão foi anunciada em janeiro de 2021, seguida pelo DALL-E 2 em abril de 2022. O DALL-E 3 representa um avanço significativo na compreensão de nuances e detalhes em instruções, e foi integrado à ferramenta Bing Image Creator da Microsoft, com o Microsoft Copilot operando no modelo.
História e contexto
A OpenAI revelou o DALL-E pela primeira vez em uma postagem de blog em 5 de janeiro de 2021, usando uma versão modificada do GPT-3 para gerar imagens. O DALL-E 2 foi anunciado em 6 de abril de 2022, projetado para gerar imagens mais realistas em resoluções mais altas e combinar conceitos, atributos e estilos. Ele entrou em versão beta em 20 de julho de 2022, com convites enviados a 1 milhão de pessoas em lista de espera, e foi aberto a todos em 28 de setembro de 2022.
Em setembro de 2023, a OpenAI anunciou o DALL-E 3, capaz de compreender significativamente mais nuances e detalhes do que as iterações anteriores. O modelo foi lançado nativamente no ChatGPT para clientes Plus e Enterprise em outubro de 2023. No início de novembro de 2023, ficou disponível via API da OpenAI e plataforma Labs. A Microsoft implementou o modelo na ferramenta Bing Image Creator e planejou integração em seu aplicativo Designer.
Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água às imagens geradas pelo DALL-E, contendo metadados no padrão C2PA (Coalition for Content Provenance and Authenticity), promovido pela Content Authenticity Initiative. Em março de 2025, o DALL-E 3 foi substituído no ChatGPT pelas capacidades nativas de geração de imagem do GPT Image.
Tecnologia
O primeiro modelo de transformador pré-treinado generativo (GPT) foi desenvolvido pela OpenAI em 2018, usando uma arquitetura Transformer. O GPT-1 foi ampliado para produzir o GPT-2 em 2019, e o GPT-3 com 175 bilhões de parâmetros em 2020. O DALL-E 3 usa metodologias de aprendizado profundo, embora o relatório técnico da OpenAI para o DALL-E 3 não inclua detalhes de treinamento ou implementação, focando em vez disso nas capacidades aprimoradas de seguir instruções.
Arquitetura do DALL-E
O DALL-E original tinha três componentes: um VAE discreto, um modelo Transformer autoregressivo somente decodificador com 12 bilhões de parâmetros, semelhante ao GPT-3, e um par CLIP de codificador de imagem e codificador de texto. O VAE discreto converte imagens em sequências de tokens e vice-versa, necessário porque o Transformer não processa diretamente dados de imagem.
A entrada do Transformer é uma sequência de legendas de imagem tokenizadas seguida por patches de imagem tokenizados. As legendas estão em inglês, tokenizadas por codificação de pares de bytes com um tamanho de vocabulário de 16384, com até 256 tokens de comprimento. Cada imagem é RGB de 256×256, dividida em patches de 32×32 de 4×4 cada, com cada patch convertido por um autoencoder variacional discreto em um token com tamanho de vocabulário de 8192.
O CLIP (Contrastive Language-Image Pre-training) foi desenvolvido junto com o DALL-E, treinado em 400 milhões de pares de imagens com legendas de texto. Ele classifica a saída do DALL-E prevendo qual legenda de uma lista de 32.768 legendas selecionadas aleatoriamente é mais apropriada para uma imagem, filtrando uma lista inicial maior para selecionar a correspondência mais próxima.
Arquitetura do DALL-E 2 e DALL-E 3
O DALL-E 2 usa 3,5 bilhões de parâmetros, menos que seu antecessor, e emprega um modelo de difusão condicionado a embeddings de imagem CLIP, com um modelo anterior gerando esses embeddings a partir de embeddings de texto CLIP durante a inferência. Essa arquitetura é semelhante ao Stable Diffusion, lançado alguns meses depois.
O DALL-E 3 continua essa abordagem baseada em difusão, mas com acompanhamento aprimorado de instruções. Embora não haja detalhes técnicos públicos disponíveis, o modelo demonstra precisão melhorada em seguir instruções complexas e gerar texto coerente dentro de imagens.
Capacidades
O DALL-E pode gerar imagens em vários estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele pode manipular e reorganizar objetos, e colocar corretamente elementos de design em composições novas sem instrução explícita. Por exemplo, quando solicitado a desenhar um rabanete daikon assoando o nariz, bebendo um latte ou andando de monociclo, o DALL-E frequentemente desenha o lenço, as mãos e os pés em locais plausíveis.
O modelo pode preencher lacunas para inferir detalhes apropriados sem instruções específicas, como adicionar imagens de Natal a instruções comumente associadas à celebração, e colocar sombras apropriadamente em imagens que não as mencionam. O DALL-E exibe uma compreensão ampla de tendências visuais e de design, e pode produzir imagens para uma grande variedade de descrições arbitrárias de vários pontos de vista, com apenas falhas raras.
Mark Riedl, professor associado da Georgia Tech School of Interactive Computing, descobriu que o DALL-E podia combinar conceitos, descrito como um elemento-chave da criatividade humana. Sua capacidade de raciocínio visual é suficiente para resolver as Matrizes de Raven, testes visuais frequentemente administrados a humanos para medir inteligência.
O DALL-E 3 segue instruções complexas com mais precisão e detalhe do que seus antecessores, e pode gerar texto mais coerente e preciso dentro de imagens. Ele é integrado ao ChatGPT Plus, permitindo que usuários gerem imagens por meio de instruções conversacionais.
Modificação de imagem
Dada uma imagem existente, o DALL-E 2 e o DALL-E 3 podem produzir variações da imagem como saídas individuais com base no original, bem como editar a imagem para modificá-la ou expandi-la. As capacidades de inpainting e outpainting usam o contexto de uma imagem para preencher áreas ausentes usando um meio consistente com o original, seguindo uma instrução dada.
Por exemplo, isso pode ser usado para inserir um novo assunto em uma imagem, ou expandir uma imagem além de suas bordas originais. De acordo com a OpenAI, o outpainting leva em consideração os elementos visuais existentes da imagem, incluindo sombras, reflexos e texturas, para manter a consistência.
Integração e disponibilidade
O DALL-E 3 foi lançado nativamente no ChatGPT para clientes do ChatGPT Plus e ChatGPT Enterprise em outubro de 2023. A disponibilidade via API da OpenAI e plataforma Labs seguiu no início de novembro de 2023. A Microsoft implementou o modelo na ferramenta Bing Image Creator, com o Microsoft Copilot operando no DALL-E 3, e planejou integração em seu aplicativo Designer.
A API opera em uma base de custo por imagem, com preços variando dependendo da resolução da imagem. Descontos por volume estão disponíveis para empresas que trabalham com a equipe empresarial da OpenAI. Em março de 2025, o DALL-E 3 foi substituído no ChatGPT pelas capacidades nativas de geração de imagem do GPT Image.
Segurança e proveniência
A OpenAI abordou preocupações de segurança com os modelos DALL-E, incluindo restrições a conteúdo prejudicial e a adição de marcas d'água. Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água às imagens geradas pelo DALL-E, contendo metadados no padrão C2PA, promovido pela Content Authenticity Initiative. Isso ajuda a verificar a proveniência de imagens geradas por IA.
Legado
O DALL-E 3 representa um marco na tecnologia de IA generativa e texto para imagem, baseando-se em trabalhos anteriores em modelos de aprendizado profundo e rede neural. Sua integração com sistemas de modelo de linguagem grande como o ChatGPT demonstra a convergência de geração de linguagem e imagem. As capacidades do modelo influenciaram desenvolvimentos subsequentes no campo, incluindo o GPT Image e outros sistemas de geração de imagem.
O lançamento do DALL-E 3 em outubro de 2023 marcou uma mudança em direção à geração de imagens por IA mais acessível e nuançada, com implicações para indústrias criativas, criação de conteúdo e arte digital. Seu uso em Microsoft Copilot e no Bing Image Creator expandiu seu alcance a um público mais amplo.