GPT Image 1 es un modelo de generación texto a imagen desarrollado por OpenAI y lanzado a través de la API de OpenAI en abril de 2025. Es la versión comercializada de la capacidad nativa de generación de imágenes que se incorporó en ChatGPT en marzo de 2025, cuyo lanzamiento se convirtió en uno de los momentos más virales de la IA de consumo: la tendencia de retratos al estilo Studio Ghibli generó tanto tráfico que OpenAI limitó temporalmente la generación de imágenes para usuarios gratuitos.
GPT Image 1 sucedió a DALL-E 3 como modelo de imágenes de OpenAI. El cambio arquitectónico fue significativo: en lugar de un modelo de difusión guiado por un intermediario, GPT Image 1 genera imágenes de forma nativa dentro de un transformador multimodal, lo que le otorga conciencia del contexto conversacional y una adherencia a las instrucciones notablemente mejor.
Capacidades
En su lanzamiento, GPT Image 1 lideró el campo en dos áreas que habían frustrado a los usuarios de modelos de difusión durante años:
- Texto legible en imágenes. Señales, carteles, etiquetas de productos y maquetas de interfaces con ortografía precisa a tasas que los modelos anteriores no podían igualar.
- Adherencia a las instrucciones. Los encargos con múltiples restricciones (recuentos específicos de objetos, disposiciones espaciales, mezclas de estilos) se seguían de forma fiable, lo que hacía prácticos los avisos estructurados de formato largo.
También admitía edición de imágenes con máscaras, entradas de imágenes de referencia y fondos transparentes, lo que lo hizo popular para fotografía de producto y flujos de trabajo de diseño.
Legado
GPT Image 1 definió el estilo de aviso que domina la era actual: avisos largos en lenguaje natural organizados en secciones, a menudo con vocabulario de cámara tomado de la fotografía. Fue seguido por GPT Image 1.5 y luego por GPT Image 2, que ampliaron el mismo enfoque. Véase familia GPT Image.