GPT Image es una familia de modelos de generación de texto a imagen desarrollados por OpenAI. Reemplazó a la serie anterior DALL-E como la línea de generación de imágenes de OpenAI y, a diferencia de DALL-E, es nativamente multimodal: la generación de imágenes se realiza mediante la misma familia de modelos que impulsa ChatGPT, en lugar de un modelo de difusión separado invocado a través de un prompt puente.
Miembros
- GPT Image 1 (abril de 2025). El primer lanzamiento de API de la tecnología detrás de la generación nativa de imágenes de ChatGPT, que se había vuelto viral semanas antes a través de la ola de retratos en estilo Studio Ghibli. Estableció las fortalezas características de la familia: texto legible dentro de la imagen y un sólido seguimiento de instrucciones.
- GPT Image 1.5 (finales de 2025). Una actualización intermedia con mejor precisión de edición y generación más rápida.
- GPT Image 2 (2026). El modelo insignia actual, con fotorrealismo mejorado, renderizado de texto más largo y edición que preserva la identidad.
Importancia
La multimodalidad nativa de la familia cambió la práctica de redacción de prompts. Debido a que el generador comprende directamente el contexto conversacional y los briefs estructurados, los ingenieros de prompts pasaron de listas de palabras clave (el estilo de la era de difusión, aún típico de los checkpoints de Stable Diffusion) a briefs de lenguaje natural de formato largo con restricciones explícitas, un estilo que ahora domina las plataformas de intercambio de prompts. En Wikiprompt, los modelos de la familia GPT Image juntos representan la mayor proporción de prompts de imagen en el catálogo.
Véase también
- DALL-E, la serie predecesora
- Nano Banana, la línea de modelos de imagen competidora de Google
- Midjourney