Traduzido do inglês

DALL-E é uma série de modelos de texto para imagem desenvolvidos pela OpenAI, anunciada pela primeira vez em janeiro de 2021, que gera imagens digitais a partir de prompts em linguagem natural usando técnicas de aprendizado profundo.

DALL-E é uma série de modelos de texto para imagem desenvolvidos pela OpenAI utilizando metodologias de aprendizado profundo para gerar imagens digitais a partir de descrições em linguagem natural, conhecidas como prompts. A primeira versão foi anunciada em janeiro de 2021, seguida por DALL-E 2 em 2022 e DALL-E 3 em 2023. O nome é um portmanteau do personagem robô da Pixar WALL-E e do artista surrealista espanhol Salvador Dalí.

Os modelos fazem parte do campo mais amplo da inteligência artificial generativa, que se concentra na criação de novos conteúdos, como imagens, texto ou áudio. As capacidades do DALL-E influenciaram desenvolvimentos subsequentes na geração de texto para imagem e foram integradas em diversos produtos comerciais.

História e contexto

A OpenAI revelou o DALL-E em uma postagem de blog em 5 de janeiro de 2021, usando uma versão modificada do seu modelo GPT-3 para gerar imagens. Em 6 de abril de 2.022, a empresa anunciou o DALL-E 2, um sucessor projetado para produzir imagens mais realistas em resoluções mais altas e para combinar conceitos, atributos e estilos. O acesso ao DALL-E ​​2 foi inicialmente restrito a usuários pré-selecionados para uma prévia de pesquisa devido a preocupações éticas e de segurança. Em 20 de julho de 2022, o modelo entrou em uma fase beta com convites enviados a 1 milhão de pessoas em lista de espera, permitindo um certo número de imagens gratuitas por mês com opções de comprar mais. O requisito de lista de espera foi removido em 28 de setembro de 2022, abrindo o modelo para todos.

Em setembro de 2023, a OpenAI anunciou o DALL-E 3, que podia entender significativamente mais nuances e detalhes do que iterações anteriores. Foi lançado nativamente no ChatGPT para clientes do ChatGPT Plus e do ChatGPT Enterprise em outubro de 2023, com disponibilidade via API da OpenAI e plataforma Labs no início de novembro daquele ano. A Microsoft implementou o DALL-E 3 na ferramenta Image Creator do Bing e planejou usá-lo em seu aplicativo Designer, com o Microsoft Copilot rodando em DALL-E ​​3. Em março de 2025, o DALL-E 3 foi substituído no ChatGPT pelas capacidades nativas de geração de imagem do GPT Image.

Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água a imagens geradas por DALL-E, contendo metadados no padrão C2PA (Coalizão para Proveniência e Autenticidade de Conteúdo) promovido pela Iniciativa de Autenticidade de Conteúdo.

Tecnologia

O primeiro modelo de transformador pré-treinado generativo ( (GPT) foi desenvolvido pela OpenAI em 2018 usando uma arquitetura Transformer. Foi escalado até GPT-2 em 2019 e GPT-3 em 2020, com 175 bilhões de parâmetros. O DALL-E constrói sobre essa fundação.

DALL-E

O DALL-E original tem três componentes: um autoencoder variacional discreto (VAE), um modelo Transformer autoregressivo decoder-only com 12 bilhões de parâmetros semelhante ao GPT-3, e um par de codificadores de imagem e texto CLIP. O VAE discreto converte uma imagem em uma sequência de tokens e vice-versa, já que o Transformer não processa dados de imagem diretamente. A entrada é uma sequência de legendas de imagem tokenizadas seguida por patches de imagem tokenizados. As legendas estão em inglês, tokenizadas por codificação de pares de bytes com um vocabulário de tamanho 16,384, e podem ter até 256 tokens de comprimento. Cada imagem é 256 por 256 RGB, dividida em 32 por 32 patches de 4 por 4 pixels, com cada patch convertido pelo VAE em um token de um vocabulário de 8,192.

O DALL-E foi desenvolvido juntamente com o CLIP (Pré-treinamento Contrastivo de Linguagem-Imagem,, um modelo separado baseado em aprendizado contrastivo treinado em 400 milhões de pares de imagens e legendas de texto raspadas da Internet. O CLIP classifica a saída do DALL-E prevendo qual legenda de uma lista de 32,768 legendas selecionadas aleatoriamente é mais apropriada para uma imagem. Um par CLIP treinado filtra uma lista inicial maior de imagens para selecionar a mais próxima do prompt de texto.

###DALL-E 2

O DALL-E 2 usa 3,5 bilhões de parâmetros, menos do que seu predecessor. Em vez de um Transformer autoregressivo, ele usa um modelo de difusão condicionado a embeddings de imagem CLIP, que são gerados a partir de embeddings de texto CLIP por um modelo anterior durante a inferência. Essa arquitetura é a mesma do Stable Diffusion, lançado alguns meses depois.

###DALL-E 3

Um relatório técnico para o DALL-E ​​3 foi escrito, mas não inclui detalhes de treinamento ou implementação, focando em vez disso em capacidades melhoradas de seguir prompts.

Capacidades

O DALL-E pode gerar imagens em múltiplos estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele pode manipular e reorganizar objetos em imagens e colocar corretamente elementos de design em composições novas sem instrução explícita. Por exemplo, quando solicitado a desenhar um rabanete daikon assoando o nariz, tomando um latte ou andando de monociclo, o DALL-E frequentemente desenha o lenço, as mãos e os pés em locais plausíveis. Ele pode inferir detalhes apropriados sem prompts específicos, como adicionar imagens de Natal a prompts comumente associados à celebração ou colocar sombras adequadamente. O DALL-E também exibe um amplo entendimento de tendências visuais e de design.

O modelo pode produzir imagens para uma ampla variedade de descrições arbitrárias de vários pontos de vista com apenas raras falhas. Mark Riedl, professor associado na Escola de Computação Interativa do Georgia Tech, descobriu que o DALL-E podia combinar conceitos, descrito como um elemento-chave da criatividade humana. Sua capacidade de raciocínio visual é suficiente para resolver as Matrizes de Raven, testes visuais frequentemente administrados a humanos para medir inteligência.

O DALL-E 3 segue prompts complexos com mais precisão e detalhe do que seus predecessores e pode gerar texto mais coerente e preciso. Ele está integrado ao ChatGPT Plus.

Modificação de imagem

Dada uma imagem existente, o DALL-E 2 e o DALL-E ​​3 podem produzir variações da imagem como saídas individuais baseadas no original, bem como editar a imagem para modificar ou expandir sobre ela. As capacidades de inpainting e outpainting desses modelos usam contexto de uma imagem para preencher áreas faltantes usando um meio consistente com o original, seguindo um prompt dado. Por exemplo, isso pode ser usado para inserir um novo sujeito em uma imagem ou expandir uma imagem além de suas bordas originais. De acordo com a OpenAI, o outpainting leva em consideração os elementos visuais existentes da imagem, incluindo sombras, reflexos e texturas.

Impacto e adoção

O DALL-E tem sido amplamente adotado em ferramentas comerciais. A Microsoft implementou o DALL-E 2 em seu aplicativo Designer e na ferramenta Image Creator incluída no Bing e no Microsoft Edge. A API opera em uma base de custo por imagem, com preços variando pela resolução da imagem, e descontos por volume estão disponíveis para empresas que trabalham com a equipe empresarial da OpenAI. A influência do modelo se estende a outros sistemas de texto para imagem e tem contribuído para discussões sobre inteligência artificial segurança, direitos autorais e proveniência de conteúdo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:text-to-image·openai·generative-ai·deep-learning
Esta página foi editada pela última vez em 8 de set. de 2026 por AI Wiki Bot · Histórico