Traduzido do inglês

DALL-E 2 é um modelo de texto para imagem desenvolvido pela OpenAI, lançado em abril de 2022, que gera imagens realistas a partir de prompts em linguagem natural usando difusão e embeddings de CLIP. Ele sucedeu o DALL-E original e foi posteriormente seguido pelo DALL-E 3.

DALL-E 2 é um modelo de texto para imagem desenvolvido pela OpenAI que gera imagens digitais a partir de descrições em linguagem natural, conhecidas como prompts. Anunciado em 6 de abril de 2022, sucedeu o modelo DALL-E original e foi projetado para produzir imagens mais realistas em resoluções mais altas, com a capacidade de combinar conceitos, atributos e estilos. O modelo utiliza metodologias de aprendizado profundo, especificamente um modelo de difusão condicionado a embeddings de imagem CLIP, e foi lançado ao público em etapas durante 2022.

O nome DALL-E é uma combinação do personagem robô animado WALL-E e do artista surrealista espanhol Salvador Dalí. O desenvolvimento do modelo marcou um passo significativo na inteligência artificial generativa, baseando-se em avanços anteriores em aprendizado de máquina e redes neurais.

História e contexto

A primeira versão do DALL-E foi anunciada pela OpenAI em janeiro de 2021, usando uma versão modificada do GPT-3 para gerar imagens. Em 6 de abril de 2022, a OpenAI anunciou o DALL-E 2 como sucessor, enfatizando melhorias em realismo e resolução. O acesso foi inicialmente restrito a usuários pré-selecionados para uma prévia de pesquisa devido a preocupações éticas e de segurança. Em 20 de julho de 2022, o modelo entrou em fase beta, com convites enviados a 1 milhão de pessoas em lista de espera, que podiam gerar um certo número de imagens gratuitamente por mês e comprar créditos adicionais. O requisito de lista de espera foi removido em 28 de setembro de 2022, abrindo o DALL-E 2 para todos.

No início de novembro de 2022, a OpenAI lançou o DALL-E 2 como uma API, permitindo que desenvolvedores integrassem o modelo em seus aplicativos. A API opera com custo por imagem, com preços variando por resolução e descontos por volume disponíveis para clientes empresariais. A Microsoft posteriormente implementou o DALL-E 2 em seu aplicativo Designer e na ferramenta Image Creator dentro do Bing e do Microsoft Edge. Em setembro de 2023, a OpenAI anunciou o DALL-E 3, que foi integrado ao ChatGPT para clientes Plus e Enterprise em outubro de 2023 e posteriormente substituído pelo GPT Image em março de 2025.

Tecnologia

O DALL-E 2 usa 3,5 bilhões de parâmetros, menos que os 12 bilhões de seu predecessor. Em vez de um modelo Transformer autorregressivo, ele emprega um modelo de difusão condicionado a embeddings de imagem CLIP. Durante a inferência, um modelo anterior gera esses embeddings de imagem a partir de embeddings de texto CLIP. Essa arquitetura é semelhante à do Stable Diffusion, lançado alguns meses depois. O DALL-E original usava um autoencoder variacional discreto para converter imagens em tokens, processados por um Transformer autorregressivo somente decodificador, com um par CLIP de codificadores de imagem e texto para classificar as saídas.

O processo de difusão do DALL-E 2 refina iterativamente ruído em uma imagem, guiado pelos embeddings derivados do texto, permitindo saídas de alta resolução e posicionamento coerente de objetos. O treinamento do modelo envolveu grandes conjuntos de dados de pares imagem-texto, embora detalhes específicos não tenham sido totalmente divulgados.

Capacidades

O DALL-E 2 pode gerar imagens em vários estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele pode manipular e reorganizar objetos, e colocar corretamente elementos de design em composições novas sem instrução explícita. Por exemplo, ao ser solicitado a desenhar um rabanete daikon assoando o nariz, tomando um latte ou andando de monociclo, o modelo frequentemente desenha o lenço, as mãos e os pés em locais plausíveis. Ele também pode preencher lacunas, como adicionar imagens de Natal a prompts associados à celebração ou sombras apropriadas a imagens que não as mencionam.

O modelo exibe ampla compreensão de tendências visuais e de design, e pode combinar conceitos, um elemento-chave da criatividade humana. Sua capacidade de raciocínio visual é suficiente para resolver as Matrizes de Raven, testes visuais frequentemente administrados a humanos para medir inteligência. O DALL-E 2 pode produzir imagens para uma ampla variedade de descrições arbitrárias de vários pontos de vista, com apenas falhas raras.

Modificação de imagem

Dada uma imagem existente, o DALL-E 2 pode produzir variações como saídas individuais baseadas no original, bem como editar a imagem para modificá-la ou expandi-la. As habilidades de inpainting e outpainting usam o contexto da imagem para preencher áreas ausentes, seguindo um prompt fornecido. Por exemplo, isso pode inserir um novo assunto em uma imagem ou expandi-la além de suas bordas originais. A OpenAI observou que o outpainting leva em consideração os elementos visuais existentes da imagem, incluindo sombras, reflexos e texturas.

Segurança e ética

Durante sua prévia de pesquisa, a OpenAI restringiu o acesso ao DALL-E 2 devido a preocupações com uso indevido, como a geração de conteúdo enganoso ou prejudicial. A empresa implementou filtros para bloquear conteúdo violento, adulto ou político, e adicionou marcas d'água às imagens geradas em fevereiro de 2024, contendo metadados no padrão C2PA promovido pela Content Authenticity Initiative. Essas medidas visavam abordar questões éticas em torno de deepfakes e desinformação.

Legado e impacto

O DALL-E 2 influenciou modelos subsequentes de texto para imagem e pesquisas mais amplas em inteligência artificial. Sua abordagem baseada em difusão foi adotada por outros sistemas, e sua integração em produtos como o Bing Image Creator expandiu o acesso público a imagens generativas. O sucesso do modelo contribuiu para a proeminência da OpenAI no campo, juntamente com desenvolvimentos em aprendizado profundo e mecanismos de atenção.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:text-to-image·openai·generative-ai·diffusion-model
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico