GPT Image é uma família de modelos de geração de texto para imagem desenvolvida pela OpenAI. Ela substituiu a série anterior DALL-E como a linhagem de geração de imagens da OpenAI e, ao contrário do DALL-E, é nativamente multimodal: a geração de imagens é realizada pela mesma família de modelos que alimenta o ChatGPT, em vez de um modelo de difusão separado acionado por um prompt de ponte.
Membros
- GPT Image 1 (abril de 2025). O primeiro lançamento via API da tecnologia por trás da geração nativa de imagens do ChatGPT, que havia se tornado viral semanas antes com a onda de retratos no estilo Studio Ghibli. Estabeleceu os pontos fortes característicos da família: texto legível dentro da imagem e forte adesão a instruções.
- GPT Image 1.5 (final de 2025). Uma atualização intermediária com melhor precisão de edição e geração mais rápida.
- GPT Image 2 (2026). O principal modelo atual, com fotorrealismo aprimorado, renderização de textos mais longos e edição que preserva a identidade.
Importância
A multimodalidade nativa da família mudou a prática de redação de prompts. Como o gerador entende diretamente o contexto conversacional e briefs estruturados, os engenheiros de prompt migraram de listas de palavras-chave (o estilo da era da difusão, ainda típico dos checkpoints de Stable Diffusion) para briefs em linguagem natural de formato longo, com restrições explícitas, um estilo que agora domina as plataformas de compartilhamento de prompts. No Wikiprompt, os modelos da família GPT Image juntos respondem pela maior parcela de prompts de imagem no catálogo.
Ver também
- DALL-E, a série predecessora
- Nano Banana, a linha de modelos de imagem concorrente do Google
- Midjourney