DALL-E é uma série de modelos de texto para imagem desenvolvidos pela OpenAI que geram imagens digitais a partir de descrições em linguagem natural, conhecidas como prompts. A primeira versão foi anunciada em janeiro de 2021, seguida pelo DALL-E 2 em 2022 e pelo DALL-E 3 em 2023. O nome é uma combinação do robô animado WALL-E e do artista surrealista Salvador Dalí.
História e contexto
A OpenAI revelou o DALL-E em uma postagem de blog em 5 de janeiro de 2021, usando uma versão modificada de seu modelo GPT-3 para gerar imagens. Em 6 de abril de 2022, a empresa anunciou o DALL-E 2, um sucessor projetado para produzir imagens mais realistas em resoluções mais altas e para combinar conceitos, atributos e estilos. O acesso foi inicialmente restrito a usuários pré-selecionados para uma prévia de pesquisa devido a preocupações éticas e de segurança. Em 20 de julho de 2022, o DALL-E 2 entrou em versão beta, com convites enviados a um milhão de indivíduos em lista de espera; os usuários podiam gerar um número limitado de imagens gratuitamente a cada mês e comprar mais. Em 28 de setembro de 2022, a lista de espera foi removida e o modelo ficou disponível para todos.
Em setembro de 2023, a OpenAI anunciou o DALL-E 3, que podia entender significativamente mais nuances e detalhes do que as iterações anteriores. Ele foi lançado nativamente no ChatGPT para clientes Plus e Enterprise em outubro de 2023, com disponibilidade via API e Labs no início de novembro. A Microsoft integrou o DALL-E 3 ao Image Creator do Bing e ao seu aplicativo Designer, e o Microsoft Copilot opera com o DALL-E 3. Em março de 2025, o DALL-E 3 foi substituído no ChatGPT pelas capacidades nativas de geração de imagem do GPT Image.
Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água às imagens geradas pelo DALL-E, incorporando metadados no padrão C2PA (Coalition for Content Provenance and Authenticity) promovido pela Content Authenticity Initiative.
Tecnologia
O primeiro modelo de transformador generativo pré-treinado (GPT) foi desenvolvido pela OpenAI em 2018, usando uma arquitetura Transformer (architecture). Ele foi ampliado para o GPT-2 em 2019 e para o GPT-3 em 2020, com 175 bilhões de parâmetros.
DALL-E
O DALL-E consiste em três componentes: um autoencoder variacional discreto (VAE), um modelo de transformador autorregressivo somente decodificador com 12 bilhões de parâmetros semelhante ao GPT-3, e um par de codificadores de imagem e texto CLIP (Contrastive Language-Image Pre-training). O VAE discreto converte uma imagem em uma sequência de tokens e vice-versa, permitindo que o transformador processe dados de imagem. O transformador recebe uma sequência de legendas de imagem tokenizadas seguida por patches de imagem tokenizados. As legendas estão em inglês, tokenizadas por codificação de pares de bytes com um vocabulário de 16.384, e podem ter até 256 tokens de comprimento. Cada imagem é RGB de 256×256, dividida em patches de 32×32 de 4×4 pixels, cada um convertido pelo VAE em um token de um vocabulário de 8.192.
O CLIP, desenvolvido em conjunto com o DALL-E, é um modelo separado baseado em aprendizado contrastivo, treinado em 400 milhões de pares de imagem-texto coletados da internet. Ele classifica a saída do DALL-E prevendo qual legenda de uma lista de 32.768 legendas selecionadas aleatoriamente é mais apropriada para uma imagem. Um par CLIP treinado filtra uma lista inicial maior de imagens geradas para selecionar aquela mais próxima do prompt.
DALL-E 2
O DALL-E 2 usa 3,5 bilhões de parâmetros, menos que seu predecessor. Em vez de um transformador autorregressivo, ele usa um modelo de difusão condicionado a embeddings de imagem CLIP, que são gerados a partir de embeddings de texto CLIP por um modelo anterior durante a inferência. Essa arquitetura é semelhante à do Stable Diffusion, lançado alguns meses depois.
DALL-E 3
A OpenAI publicou um relatório técnico para o DALL-E 3, mas ele não inclui detalhes de treinamento ou implementação, focando em vez disso nas capacidades aprimoradas de seguir prompts.
Capacidades
O DALL-E pode gerar imagens em vários estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele pode manipular e reorganizar objetos em imagens e posicionar corretamente elementos de design em composições novas sem instrução explícita. Por exemplo, quando solicitado a desenhar um rabanete daikon assoando o nariz, bebendo um latte ou andando de monociclo, o DALL-E frequentemente desenha o lenço, as mãos e os pés em locais plausíveis. Ele pode inferir detalhes apropriados não mencionados nos prompts, como adicionar imagens de Natal a prompts relacionados a feriados ou posicionar sombras adequadamente. O DALL-E também exibe uma ampla compreensão de tendências visuais e de design.
O DALL-E pode produzir imagens para uma grande variedade de descrições arbitrárias de vários pontos de vista, com apenas falhas raras. Mark Riedl, professor associado da Georgia Tech School of Interactive Computing, descobriu que o DALL-E podia combinar conceitos, o que ele descreveu como um elemento-chave da criatividade humana. Sua capacidade de raciocínio visual é suficiente para resolver as Matrizes de Raven, testes visuais frequentemente usados para medir a inteligência humana.
O DALL-E 3 segue prompts complexos com mais precisão e detalhe do que seus predecessores e pode gerar texto mais coerente e preciso. Ele está integrado ao ChatGPT Plus.
Modificação de imagem
O DALL-E 2 e o DALL-E 3 podem produzir variações de imagens existentes e editá-las para modificar ou expandir. As capacidades de inpainting e outpainting usam o contexto de uma imagem para preencher áreas ausentes em um estilo consistente com o original, seguindo um prompt dado. Isso pode inserir um novo assunto em uma imagem ou expandi-la além de suas bordas originais. De acordo com a OpenAI, o outpainting leva em consideração os elementos visuais existentes da imagem, incluindo sombras, reflexos e texturas.