Lançamento do DALL-E 2

Traduzido do inglês

DALL-E 2, lançado pela OpenAI em abril de 2022, é um modelo de texto para imagem que gera imagens digitais a partir de instruções em linguagem natural usando aprendizado profundo, notavelmente um modelo de difusão condicionado a embeddings de CLIP.

DALL-E 2 é um modelo de texto para imagem desenvolvido pela OpenAI, anunciado em 6 de abril de 2022 como o sucessor do DALL-E original. Ele utiliza metodologias de aprendizado profundo para gerar imagens digitais a partir de descrições em linguagem natural, conhecidas como prompts. O modelo foi projetado para produzir imagens mais realistas em resoluções mais altas do que seu antecessor, com a capacidade de combinar conceitos, atributos e estilos. Seu nome é um amálgama do personagem robô da Pixar WALL-E e do artista surrealista espanhol Salvador Dalí.

História e contexto

O DALL-E original foi revelado pela OpenAI em uma postagem de blog em 5 de janeiro de 2021, usando uma versão modificada do GPT-3 para gerar imagens. O DALL-E 2 foi anunciado em 6 de abril de 2022, entrando em fase beta em 20 de julho de 2022 com convites enviados a 1 milhão de pessoas em lista de espera. Durante essa fase, os usuários podiam gerar um certo número de imagens gratuitamente por mês e comprar mais. O acesso havia sido anteriormente restrito a usuários pré-selecionados para uma prévia de pesquisa devido a preocupações com ética e segurança. Em 28 de setembro de 2022, o DALL-E 2 foi aberto a todos e o requisito de lista de espera foi removido. No início de novembro de 2022, a OpenAI lançou o DALL-E 2 como uma API, permitindo que desenvolvedores integrassem o modelo em seus próprios aplicativos. A Microsoft posteriormente implementou o DALL-E 2 em seu aplicativo Designer e na ferramenta Image Creator incluída no Bing e no Microsoft Edge. A API opera em uma base de custo por imagem, com preços variando conforme a resolução da imagem e descontos por volume disponíveis para clientes empresariais. Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água às imagens geradas pelo DALL-E, contendo metadados no padrão C2PA (Coalition for Content Provenance and Authenticity) promovido pela Content Authenticity Initiative.

Tecnologia

O DALL-E 2 usa 3,5 bilhões de parâmetros, um número menor que seu antecessor. Em vez de um Transformer autorregressivo, ele emprega um modelo de difusão condicionado a embeddings de imagem CLIP. Durante a inferência, esses embeddings de imagem são gerados a partir de embeddings de texto CLIP por um modelo anterior. Essa arquitetura é a mesma do Stable Diffusion, lançado alguns meses depois. O modelo se baseia em trabalhos anteriores em Generative AI e aprendizado profundo, particularmente no desenvolvimento da arquitetura Transformer (architecture) pela OpenAI e outros. O primeiro modelo de transformador generativo pré-treinado (GPT) foi desenvolvido pela OpenAI em 2018, ampliado para GPT-2 em 2019 e GPT-3 em 2020, com 175 bilhões de parâmetros. A abordagem de difusão do DALL-E 2 difere do método autorregressivo do DALL-E original, que usava uma VAE discreta e um modelo Transformer somente decodificador com 12 bilhões de parâmetros.

Capacidades

O DALL-E 2 pode gerar imagens em múltiplos estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele pode manipular e reorganizar objetos em suas imagens e colocar corretamente elementos de design em composições novas sem instrução explícita. O modelo exibe uma compreensão ampla de tendências visuais e de design, e pode produzir imagens para uma grande variedade de descrições arbitrárias de vários pontos de vista, com apenas raras falhas. Sua capacidade de raciocínio visual é suficiente para resolver Matrizes de Raven, testes visuais frequentemente aplicados a humanos para medir inteligência. O DALL-E 2 também suporta modificação de imagens, incluindo a geração de variações de imagens existentes e sua edição por meio de inpainting e outpainting. Essas habilidades usam o contexto de uma imagem para preencher áreas ausentes usando um meio consistente com o original, seguindo um prompt fornecido. Por exemplo, o outpainting pode expandir uma imagem além de suas bordas originais, levando em conta elementos visuais existentes, como sombras, reflexos e texturas.

Impacto e legado

O DALL-E 2 marcou um avanço significativo na geração de texto para imagem, levando a tecnologia a um público mais amplo por meio de sua versão beta aberta e da eventual remoção da lista de espera. Seu lançamento despertou interesse em Generative AI e influenciou desenvolvimentos subsequentes no campo, incluindo o DALL-E 3, lançado em outubro de 2023 nativamente no ChatGPT para clientes Plus e Enterprise. O DALL-E 3 foi posteriormente integrado ao Bing Image Creator e ao Copilot da Microsoft, e em março de 2025 foi substituído no ChatGPT pelas capacidades nativas de geração de imagem do GPT Image. A arquitetura baseada em difusão do modelo também influenciou outros sistemas, como o Stable Diffusion, e contribuiu para a rápida evolução de aplicações de aprendizado de máquina para tarefas criativas. A abordagem de segurança do DALL-E 2, incluindo acesso restrito durante a prévia de pesquisa e posterior marca d'água, estabeleceu precedentes para a implantação responsável de modelos generativos.

Recepção e preocupações

O lançamento do DALL-E 2 gerou considerável atenção pública e acadêmica, destacando tanto o potencial criativo quanto os desafios éticos das imagens geradas por IA. As preocupações incluíam o uso indevido para criar conteúdo enganoso, questões de direitos autorais e o impacto sobre artistas e designers. A implementação faseada da OpenAI, com restrições iniciais e lista de espera, refletiu essas preocupações. A capacidade do modelo de gerar imagens realistas a partir de prompts de texto também levantou questões sobre proveniência e autenticidade, levando à adoção de marcas d'água C2PA em 2024. Apesar desses desafios, o DALL-E 2 foi amplamente elogiado por suas realizações técnicas e interface amigável, ajudando a popularizar a geração de texto para imagem entre não especialistas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·text-to-image·openai·deep-learning
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico