Traduzido do inglês

Uma série de modelos de geração de texto-para-imagem desenvolvidos pela OpenAI entre 2021 e 2023, que ajudaram a trazer imagens geradas por IA para o uso público mainstream.

DALL-E é uma série de modelos de geração de texto para imagem desenvolvidos pela OpenAI, nomeados como um portmanteau do artista Salvador Dalí e do personagem robô da Pixar, WALL-E. O DALL-E original foi anunciado em janeiro de 2021 como um modelo transformador de 12 bilhões de parâmetros, baseado na mesma família de arquitetura do GPT-3, treinado para gerar imagens a partir de descrições textuais ao tratar a geração de imagens como um problema de predição de sequências sobre tokens discretos de imagem, em vez de usar as técnicas de difusão que mais tarde dominariam o campo.

Evolução entre versões

O DALL-E 2, lançado em abril de 2022, substituiu a abordagem original de tokens discretos por uma arquitetura baseada em difusão guiada pelo CLIP, o modelo conjunto de incorporação de imagem e texto da OpenAI, produzindo imagens de resolução substancialmente maior e mais fotorrealistas e introduzindo um recurso de "inpainting" para editar partes de imagens existentes a partir de uma descrição textual. A versão beta pública do DALL-E 2, seguida pela disponibilidade geral no final de 2022, atraiu atenção significativa da mídia mainstream e é amplamente creditada, junto com lançamentos contemporâneos como Midjourney e Stable Diffusion, por trazer a imagem gerada por IA ao conhecimento público mainstream pela primeira vez. O DALL-E 3, lançado em 2023 e integrado diretamente ao ChatGPT para assinantes, melhorou a adesão a instruções e a renderização de texto dentro das imagens, e usou o próprio ChatGPT para expandir e refinar instruções curtas dos usuários antes de passá-las ao modelo de imagem.

Recepção e impacto

Os lançamentos do DALL-E geraram um debate público substancial sobre o futuro do trabalho criativo visual, provocando tanto entusiasmo de usuários que experimentavam arte e design assistidos por IA quanto preocupação de ilustradores e fotógrafos profissionais sobre deslocamento e sobre o uso de imagens protegidas por direitos autorais em dados de treinamento sem consentimento, uma disputa que alimentou litígios mais amplos de direitos autorais de IA em toda a indústria de IA generativa. O sistema também atraiu escrutínio por seu potencial de gerar desinformação e imagens sem consentimento, levando a OpenAI a implementar filtros de conteúdo e, por um período, restrições à geração de rostos reconhecíveis de figuras públicas.

Legado

O DALL-E é geralmente creditado como um dos modelos, junto com trabalhos acadêmicos anteriores sobre GANs e concorrentes abertos posteriores, que estabeleceu a geração de texto para imagem como uma tecnologia mainstream de consumo e comercial, em vez de uma curiosidade de pesquisa. Seu sucesso contribuiu diretamente para a estratégia multimodal mais ampla da OpenAI, informando as capacidades de compreensão e geração de imagens posteriormente integradas ao GPT-4 e a modelos subsequentes, e ajudou a popularizar a escrita de instruções como uma habilidade relevante para sistemas de IA generativa visuais, não apenas textuais.

Categorias:generative-ai·image-generation·openai
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico