DALL-E 3 é um modelo de texto para imagem desenvolvido pela OpenAI, lançado em outubro de 2023. É a terceira iteração da série DALL-E, sucedendo DALL-E e DALL-E 2. DALL-E 3 utiliza metodologias de aprendizado profundo para gerar imagens digitais a partir de descrições em linguagem natural, conhecidas como prompts, com foco em compreender "significativamente mais nuances e detalhes" do que seus predecessores. O modelo foi integrado nativamente ao ChatGPT para clientes do ChatGPT Plus e ChatGPT Enterprise, e posteriormente disponibilizado via API e plataforma Labs da OpenAI. Em março de 2025, DALL-E 3 foi substituído no ChatGPT pelas capacidades nativas de geração de imagem do GPT Image.
Histórico e contexto
DALL-E foi anunciado pela primeira vez pela OpenAI em 5 de janeiro de 2021, usando uma versão modificada do GPT-3 para gerar imagens. DALL-E 2 seguiu em 6 de abril de 2022, oferecendo maior resolução e a capacidade de combinar conceitos, atributos e estilos. Após uma fase beta em julho de 2022 e um lançamento público em setembro de 2022, DALL-E 2 foi disponibilizado via API em novembro de 2022. Em setembro de 2023, a OpenAI anunciou DALL-E 3, que foi lançado em outubro de 2023. A Microsoft implementou DALL-E 3 na ferramenta Image Creator do Bing, e o Microsoft Copilot opera com DALL-E 3. O nome "DALL-E" é um amálgama do robô WALL-E da Pixar e do artista surrealista espanhol Salvador Dalí. Em fevereiro de 2024, a OpenAI começou a adicionar marcas d'água às imagens geradas por DALL-E, usando metadados no padrão C2PA.
Tecnologia
DALL-E 3 baseia-se na arquitetura de transformadores usada nos modelos GPT da OpenAI. Embora um relatório técnico tenha sido escrito para DALL-E 3, ele não inclui detalhes de treinamento ou implementação, focando em vez disso na melhoria do seguimento de prompts. O modelo é projetado para interpretar prompts complexos com maior precisão e detalhe, e pode gerar texto mais coerente e preciso dentro de imagens em comparação com versões anteriores.
DALL-E e DALL-E 2
O DALL-E original usava um VAE discreto, um transformador autorregressivo somente decodificador com 12 bilhões de parâmetros, e um modelo CLIP para classificar saídas. DALL-E 2, com 3,5 bilhões de parâmetros, mudou para um modelo de difusão condicionado a embeddings de imagem CLIP, semelhante à arquitetura posteriormente usada em Stable Diffusion.
Capacidades
DALL-E 3 pode gerar imagens em múltiplos estilos, incluindo imagens fotorrealistas, pinturas e emojis. Ele pode manipular e reorganizar objetos, e colocar elementos de design em composições novas. Ele segue prompts complexos com mais precisão e detalhe do que seus predecessores, e pode produzir texto coerente dentro de imagens. DALL-E 3 está integrado ao ChatGPT Plus, permitindo que usuários gerem imagens diretamente em conversas.
Modificação de imagem
DALL-E 2 e DALL-E 3 podem produzir variações de imagens existentes e editá-las, incluindo inpainting e outpainting. Esses recursos usam contexto da imagem original para preencher áreas ausentes ou expandir além das bordas, mantendo consistência com sombras, reflexos e texturas.
Recepção e impacto
DALL-E 3 tem sido notado por seu aprimorado seguimento de prompts e integração com ChatGPT, tornando-o acessível a um público mais amplo. Seu uso no Image Creator do Bing e no Copilot da Microsoft expandiu seu alcance. A capacidade do modelo de gerar imagens detalhadas e precisas a partir de prompts complexos influenciou o campo da IA generativa, embora preocupações sobre ética e segurança tenham sido levantadas, levando a medidas como marcas d'água.