DALL-E 1, estilizado como DALL·E, é um modelo de texto para imagem desenvolvido pela OpenAI usando metodologia de aprendizado profundo. Ele gera imagens digitais a partir de descrições em linguagem natural, conhecidas como prompts. A primeira versão do DALL-E foi anunciada em janeiro de 2021, tornando-o um dos primeiros modelos proeminentes a combinar grandes modelos de linguagem com geração de imagens. O nome do software é um portmanteau dos nomes do robô animado WALL-E e do artista surrealista espanhol Salvador Dalí.
Seu sucessor, DALL-E 2, foi lançado em abril de 2022, com uma versão beta pública em julho de 2022. DALL-E 3, lançado em outubro de 2023, foi integrado nativamente ao ChatGPT para clientes Plus e Enterprise. DALL-E 3 foi posteriormente substituído no ChatGPT pelas capacidades nativas de geração de imagens do GPT Image em março de 2025.
História e contexto
DALL-E foi revelado pela OpenAI em uma postagem de blog em 5 de janeiro de 2021. O modelo usava uma versão de gpt-partnr? mas para imagens, uma arquitetura Transformer (architecture) adaptada para geração de imagens. Na época, a OpenAI era conhecida por grandes modelos de linguagem como o GPT-3, mas o DALL-E marcou uma mudança para inteligência artificial multimodal - lidando tanto com domínios de texto quanto de imagem. O nome do modelo seguia a tendência de acrônimos lúdicos e trocadilhos comuns na nomenclatura da OpenAI.
Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água às imagens geradas pelo DALL-E, contendo metadados no padrão C2PA (Coalizão para Proveniência e Autenticidade de Conteúdo), promovido pela Iniciativa de Autenticidade de Conteúdo, para ajudar a rastrear as origens das imagens.
Tecnologia
O primeiro transformador generativo pré-treinado (GPT) foi inicialmente desenvolvido pela OpenAI em 2018, usando uma arquitetura Transformer (architecture). A primeira iteração, GPT-1, foi ampliada para produzir o GPT-2 em 2019; em 2020, foi ampliada novamente para produzir o GPT-3, com 175 bilhões de parâmetros. DALL-E é uma variante distinta do GPT-3, modificada para gerar imagens.
DALL-E 1
DALL-E tem três componentes: um codificador-variacional-discreto?, um modelo Transformer (architecture) autoregressivo apenas com decodificador (12 bilhões de parâmetros) semelhante ao GPT-3, e um par CLIP de codificador de imagem e codificador de texto.
O autoencoder variacional discreto (VAE) converte uma imagem em uma sequência de tokens e, inversamente, converte uma sequência de tokens de volta em uma imagem. Isso é necessário, pois o modelo transformer não processa diretamente dados de imagem. A entrada para o transformer é uma sequência de legenda de imagem tokenizada seguida por patches de imagem tokenizados. A legenda está em inglês, tokenizada por codificação de pares de bytes (tamanho do vocabulário 16384), e pode ter até 256 tokens. Cada imagem é uma imagem RGB de 256x256, dividida em patches de 32x32 de 4x4 cada. Cada patch é então convertido em um token (tamanho do vocabulário 8192) por um VAE discreto.
DALL-E é desenvolvido e lançado em conjunto com o CLIP (Pré-treinamento Contrastivo de Linguagem-Imagem). CLIP é um modelo separado baseado em aprendizado contrastivo, treinado em 400 milhões de pares de imagens com legendas de texto extraídas da internet. Seu papel é entender e classificar a saída do DALL-E, prevendo qual legenda de uma lista de 32.768 legendas selecionadas aleatoriamente (das quais uma é correta) é mais apropriada para uma imagem. Um par CLIP treinado filtra uma lista inicial maior de imagens geradas pelo DALL-E para selecionar a imagem mais próxima do prompt de texto.
Sucessores
DALL-E 2 usa 3,5 bilhões de parâmetros, um número menor que seu predecessor. Em vez de um transformer autoregressivo, ele usa um modelo de difusão condicionado a embeddings de imagem CLIP, que, durante a inferência, são gerados a partir de embeddings de texto CLIP por um modelo anterior. Esta é a mesma arquitetura da Stable-Diffusion, lançada alguns meses depois.
DALL-E 3, lançado em setembro de 2023, segue prompts complexos com mais precisão e detalhe do que iterações anteriores, e pode gerar texto mais coerente. Embora um relatório técnico tenha sido escrito para ele, o relatório não inclui detalhes de treinamento ou implementação, focando na melhoria do seguimento de prompts.
Capacidades
DALL-E pode gerar imagens em vários estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele pode manipular e reorganizar objetos em suas imagens, e pode colocar corretamente elementos de design em composições novas sem instrução explícita. Ele demonstra habilidades de raciocínio criativo, como preencher detalhes plausíveis para prompts - por exemplo, adicionando imagens de Natal a prompts associados à celebração, ou sombras colocadas adequadamente mesmo quando não mencionadas. DALL-E exibe uma ampla compreensão das tendências de design visual.
DALL-E pode produzir imagens para uma ampla variedade de descrições arbitrárias de vários pontos de vista com apenas falhas raras. Mark Riedl, professor associado da Escola de Computação Interativa do Georgia Tech, descobriu que o DALL-E podia combinar conceitos, um elemento-chave da criatividade humana. Sua capacidade de raciocínio visual é suficiente para resolver as Matrizes de Raven, testes visuais frequentemente administrados para medir inteligência.
Modificação de imagens
Dado uma imagem existente, DALL-E 2 e DALL-E 3 podem produzir variações da imagem e editá-la para modificar ou expandir a cena. As habilidades de inpaint e outpaint desses modelos usam contexto da imagem para preencher áreas ausentes com um estilo consistente com o original, seguindo um prompt dado. Isso pode ser usado para inserir um novo assunto ou estender uma imagem além de suas bordas. De acordo com a OpenAI, o outpaint leva em consideração os elementos visuais existentes da imagem, incluindo sombras, reflexos e texturas.
Aplicações e impacto
DALL-E 1 abriu uma nova era de criação de imagens com IA generativa e influenciou modelos e aplicações posteriores. Seu sucessor, DALL-E 2, foi disponibilizado via API em novembro de 2022, permitindo que desenvolvedores integrassem o modelo em aplicações, com preço por imagem. A Microsoft incorporou o DALL-E 2 em seu aplicativo Designer e na ferramenta Image Creator no Bing e Edge. DALL-E 3 foi integrado ao ChatGPT para clientes Plus e Enterprise em outubro de 2023, com disponibilidade de APIs e Labs em novembro. Em fevereiro de 2024, a OpenAI adicionou marcas d'água às imagens do DALL-E seguindo o padrão C2PA.
Referências
Este artigo é baseado em informações de relatórios públicos e publicações da própria OpenAI.