DALL-E 2 é um modelo de texto para imagem desenvolvido pela OpenAI e lançado em 2022. Ele gera imagens digitais a partir de descrições em linguagem natural, conhecidas como prompts, utilizando metodologias de aprendizado profundo. O modelo é o sucessor do DALL-E original e foi projetado para produzir imagens mais realistas em resoluções mais altas, com a capacidade de combinar conceitos, atributos e estilos.
DALL-E 2 faz parte do campo mais amplo da inteligência artificial generativa, que se concentra na criação de novos conteúdos. Ele usa uma arquitetura baseada em difusão, um afastamento da abordagem autorregressiva de seu predecessor. O nome é um amálgama do robô da Pixar WALL-E e do artista surrealista espanhol Salvador Dalí.
História e contexto
O DALL-E original foi anunciado pela OpenAI em uma postagem de blog em 5 de janeiro de 2021, usando uma versão modificada do GPT-3 para gerar imagens. Em 6 de abril de 2022, a OpenAI anunciou o DALL-E 2 como sucessor, enfatizando sua capacidade de gerar imagens mais realistas e combinar conceitos. Inicialmente, o acesso era restrito a usuários pré-selecionados para uma prévia de pesquisa devido a preocupações éticas e de segurança. Em 20 de julho de 2022, o DALL-E 2 entrou em uma fase beta, convidando 1 milhão de pessoas em lista de espera; os usuários podiam gerar um número limitado de imagens gratuitamente por mês e comprar créditos adicionais. O requisito de lista de espera foi removido em 28 de setembro de 2022, abrindo o modelo ao público em geral.
No início de novembro de 2022, a OpenAI lançou o DALL-E 2 como uma API, permitindo que desenvolvedores integrassem o modelo em aplicativos. A API opera com base em custo por imagem, com preços variando por resolução e descontos por volume para clientes empresariais. A Microsoft integrou o DALL-E 2 em seu aplicativo Designer e na ferramenta Image Creator no Bing e no Microsoft Edge. Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água às imagens geradas pelo DALL-E, incorporando metadados usando o padrão C2PA (Coalition for Content Provenance and Authenticity).
Tecnologia
O DALL-E 2 usa 3,5 bilhões de parâmetros, menos que os 12 bilhões de seu predecessor. Em vez de um transformer autorregressivo, ele emprega um modelo de difusão condicionado a embeddings de imagem CLIP. Durante a inferência, um modelo anterior gera esses embeddings de imagem a partir de embeddings de texto CLIP. Essa arquitetura é semelhante à do Stable Diffusion, lançado alguns meses depois. O modelo aproveita técnicas de redes neurais e aprendizado de máquina, baseando-se em avanços na pesquisa de inteligência artificial.
CLIP (Contrastive Language-Image Pre-training) é um modelo separado treinado em 400 milhões de pares de imagem-texto da internet. Ele desempenha um papel crucial na compreensão e classificação das saídas do DALL-E 2, selecionando a imagem que melhor corresponde ao prompt. O processo de difusão refina iterativamente ruído aleatório em uma imagem coerente, guiado pelos embeddings CLIP.
Capacidades
O DALL-E 2 pode gerar imagens em vários estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele pode manipular e reorganizar objetos, e colocar corretamente elementos de design em composições novas sem instrução explícita. Por exemplo, quando solicitado a desenhar um rabanete daikon assoando o nariz, tomando um latte ou andando de monociclo, o modelo frequentemente coloca lenços, mãos e pés em locais plausíveis. Ele também pode inferir detalhes apropriados, como adicionar imagens de Natal a prompts associados ao feriado ou renderizar sombras que não foram mencionadas.
O modelo exibe uma ampla compreensão de tendências visuais e de design, e pode produzir imagens para uma grande variedade de descrições arbitrárias de vários pontos de vista, com apenas falhas raras. Sua capacidade de raciocínio visual é suficiente para resolver as Matrizes de Raven, um teste frequentemente usado para medir a inteligência humana.
Modificação de imagens
O DALL-E 2 pode produzir variações de imagens existentes, bem como editar imagens para modificá-las ou expandi-las. As capacidades de inpainting e outpainting usam o contexto da imagem original para preencher áreas ausentes em um meio consistente, seguindo um prompt dado. Por exemplo, os usuários podem inserir novos assuntos em uma imagem ou estendê-la além de suas bordas originais. De acordo com a OpenAI, o outpainting considera elementos visuais existentes, como sombras, reflexos e texturas.
Impacto e legado
O DALL-E 2 influenciou desenvolvimentos subsequentes na geração de texto para imagem, incluindo o DALL-E 3, lançado em outubro de 2023, que foi integrado ao ChatGPT e posteriormente substituído pelo GPT Image em março de 2025. O modelo também contribuiu para discussões mais amplas sobre as capacidades e implicações éticas da IA generativa, incluindo preocupações sobre uso indevido e a necessidade de medidas de proveniência, como marcas d'água.