GPT Image 1 é um modelo de geração Text-to-image generation desenvolvido pela OpenAI e lançado por meio da API da OpenAI em abril de 2025. É a versão comercializada da capacidade nativa de geração de imagens que foi disponibilizada no ChatGPT em março de 2025, cujo lançamento se tornou um dos momentos mais virais na IA de consumo: a tendência de retratos no estilo Studio Ghibli gerou tanto tráfego que a OpenAI limitou temporariamente a geração de imagens para usuários gratuitos.
O GPT Image 1 sucedeu o DALL-E 3 como modelo de imagens da OpenAI. A mudança arquitetônica foi significativa: em vez de um modelo de difusão orientado por um intermediário, o GPT Image 1 gera imagens nativamente dentro de um transformador multimodal, conferindo-lhe consciência de contexto conversacional e capacidade notavelmente melhor de seguir instruções.
Capacidades
No lançamento, o GPT Image 1 liderou o campo em duas áreas que frustravam os usuários de modelos de difusão há anos:
- Texto legível em imagens. Placas, pôsteres, rótulos de produtos e protótipos de interfaces renderizados com ortografia precisa em taxas que os modelos anteriores não conseguiam igualar.
- Adesão a instruções. Briefings com múltiplas restrições (contagens específicas de objetos, layouts espaciais, misturas de estilos) eram seguidos de forma confiável, tornando prompts estruturados de formato longo práticos.
Ele também suportava edição de imagens com máscaras, entradas de imagens de referência e fundos transparentes, o que o tornou popular para fotografia de produtos e fluxos de trabalho de design.
Legado
O GPT Image 1 definiu o estilo de prompt que domina a era atual: briefings longos em linguagem natural organizados em seções, frequentemente com vocabulário de câmera emprestado da fotografia. Foi sucedido pelo GPT Image 1.5 e depois pelo GPT Image 2, que estenderam a mesma abordagem. Consulte Família GPT Image.