DALL-E, DALL-E 2 e DALL-E 3 (estilizados como DALL·E) são modelos de texto para imagem desenvolvidos pela OpenAI usando metodologias de aprendizado profundo para gerar imagens digitais a partir de descrições em linguagem natural, conhecidas como prompts. A primeira versão foi anunciada em janeiro de 2021, e iterações subsequentes expandiram as capacidades em realismo, resolução e seguimento de prompts. O nome é um portmanteau do personagem robô da Pixar WALL-E e do artista surrealista espanhol Salvador Dalí.
História e contexto
A OpenAI revelou o DALL-E em uma postagem de blog em 5 de janeiro de 2021, usando uma versão modificada do GPT-3 para gerar imagens. Em 6 de abril de 2022, a empresa anunciou o DALL-E 2, um sucessor projetado para produzir imagens mais realistas em resoluções mais altas que pudesse "combinar conceitos, atributos e estilos". O acesso ao DALL-E 2 permaneceu inicialmente restrito a usuários pré-selecionados para uma prévia de pesquisa devido a preocupações éticas e de segurança. Em 20 de julho de 2022, o modelo entrou em fase beta com convites enviados a 1 milhão de indivíduos em lista de espera, permitindo um certo número de gerações gratuitas mensais com opções de compra de mais. O requisito de lista de espera foi removido em 28 de setembro de 2022, abrindo a ferramenta para todos.
Em setembro de 2023, a OpenAI anunciou o DALL-E 3, capaz de entender "significativamente mais nuances e detalhes" do que iterações anteriores. Ele foi lançado nativamente no ChatGPT para clientes Plus e Enterprise em outubro de 2023, com disponibilidade via API e uma plataforma "Labs" no início de novembro. A Microsoft implementou o modelo na ferramenta Image Creator do Bing e em seu aplicativo Designer, com o Microsoft Copilot rodando no DALL-E 3. Em março de 2025, o DALL-E 3 foi substituído no ChatGPT pelas capacidades nativas de geração de imagem do GPT Image. Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água às imagens geradas pelo DALL-E, contendo metadados no padrão C2PA (Coalition for Content Provenance and Authenticity).
Tecnologia
O primeiro modelo de transformador generativo pré-treinado (GPT) foi desenvolvido pela OpenAI em 2018 usando uma arquitetura Transformer. Iterações de escala produziram o GPT-2 em 2019 e o GPT-3 em 2020, este último com 175 bilhões de parâmetros. O DALL-E construiu sobre essa base com arquiteturas distintas entre versões.
DALL-E
O DALL-E original compreendia três componentes: um autoencoder variacional discreto (VAE), um modelo Transformer autorregressivo somente decodificador com 12 bilhões de parâmetros semelhante ao GPT-3, e um par de codificadores de imagem e texto CLIP. O VAE discreto convertia imagens em sequências de tokens e vice-versa, necessário porque o Transformer não processa diretamente dados de imagem. A entrada consistia em uma legenda em inglês tokenizada (até 256 tokens, tamanho de vocabulário 16.384) seguida por patches de imagem tokenizados. Cada imagem RGB de 256×256 era dividida em patches de 32×32 de 4×4 pixels, com cada patch convertido em um token usando um vocabulário de 8.192.
O CLIP (Contrastive Language-Image Pre-training), desenvolvido e anunciado junto com o DALL-E, era um modelo separado baseado em aprendizado contrastivo treinado em 400 milhões de pares de imagem-texto extraídos da Internet. Ele classificava a saída do DALL-E prevendo qual legenda de uma lista de 32.768 legendas selecionadas aleatoriamente era mais apropriada para uma imagem, filtrando uma lista inicial maior para selecionar a correspondência mais próxima do prompt.
DALL-E 2
O DALL-E 2 usava 3,5 bilhões de parâmetros, menos que seu predecessor, e substituiu o Transformer autorregressivo por um modelo de difusão condicionado em embeddings de imagem CLIP. Durante a inferência, esses embeddings eram gerados a partir de embeddings de texto CLIP por um modelo anterior. Essa arquitetura era a mesma do Stable Diffusion, lançado alguns meses depois.
DALL-E 3
A OpenAI publicou um relatório técnico para o DALL-E 3, mas omitiu detalhes de treinamento e implementação, focando em vez disso nas capacidades aprimoradas de seguimento de prompts. O modelo foi integrado ao ChatGPT Plus, permitindo refinamento conversacional das imagens geradas.
Capacidades
O DALL-E podia gerar imagens em múltiplos estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele podia "manipular e reorganizar" objetos e colocar elementos de design em composições novas sem instrução explícita. Thom Dunn, escrevendo para o BoingBoing, observou que, quando solicitado a desenhar um rabanete daikon assoando o nariz, bebendo um latte ou andando de monociclo, o DALL-E frequentemente desenhava o lenço, as mãos e os pés em locais plausíveis. O modelo podia "preencher as lacunas", inferindo detalhes apropriados, como imagens de Natal para prompts relacionados ou sombras não mencionadas no texto, e exibia ampla compreensão de tendências visuais e de design.
O DALL-E podia produzir imagens para uma ampla variedade de descrições arbitrárias de vários pontos de vista com apenas falhas raras. Mark Riedl, professor associado da Escola de Computação Interativa da Georgia Tech, descobriu que o DALL-E podia combinar conceitos, um elemento-chave da criatividade humana. Sua capacidade de raciocínio visual era suficiente para resolver as Matrizes de Raven, testes visuais frequentemente administrados para medir a inteligência humana.
O DALL-E 3 seguia prompts complexos com mais precisão e detalhe do que predecessores e gerava texto mais coerente e preciso dentro das imagens.
Modificação de imagem
Dada uma imagem existente, o DALL-E 2 e o DALL-E 3 podiam produzir "variações" como saídas individuais baseadas no original, bem como editar a imagem para modificá-la ou expandi-la. As capacidades de "inpainting" e "outpainting" usavam o contexto da imagem para preencher áreas ausentes em um meio consistente com o original, seguindo um prompt dado. Por exemplo, isso permitia inserir um novo sujeito em uma imagem ou expandir além de suas bordas originais. De acordo com a OpenAI, "O outpainting leva em consideração os elementos visuais existentes da imagem - incluindo sombras, reflexos e texturas - para" produzir extensões perfeitas.