DALL-E 3 es un modelo de texto a imagen desarrollado por OpenAI, lanzado en octubre de 2023. Es la tercera iteración de la serie DALL-E, después de DALL-E y DALL-E 2. DALL-E 3 utiliza metodologías de aprendizaje profundo para generar imágenes digitales a partir de descripciones en lenguaje natural, conocidas como indicaciones, con un enfoque en comprender "significativamente más matices y detalles" que sus predecesores. El modelo se integró de forma nativa en ChatGPT para los clientes de ChatGPT Plus y ChatGPT Enterprise, y posteriormente se puso a disposición a través de la API y la plataforma Labs de OpenAI. En marzo de 2025, DALL-E 3 fue reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image.
Historia y antecedentes
DALL-E fue anunciado por primera vez por OpenAI el 5 de enero de 2021, utilizando una versión modificada de GPT-3 para generar imágenes. DALL-E 2 siguió el 6 de abril de 2022, ofreciendo mayor resolución y la capacidad de combinar conceptos, atributos y estilos. Después de una fase beta en julio de 2022 y un lanzamiento público en septiembre de 2022, DALL-E 2 se puso a disposición a través de la API en noviembre de 2022. En septiembre de 2023, OpenAI anunció DALL-E 3, que se lanzó en octubre de 2023. Microsoft implementó DALL-E 3 en la herramienta Image Creator de Bing, y Microsoft Copilot funciona con DALL-E 3. El nombre "DALL-E" es un acrónimo del robot de Pixar WALL-E y el artista surrealista español Salvador Dalí. En febrero de 2024, OpenAI comenzó a agregar marcas de agua a las imágenes generadas por DALL-E, utilizando metadatos en el estándar C2PA.
Tecnología
DALL-E 3 se basa en la arquitectura de transformadores utilizada en los modelos GPT de OpenAI. Aunque se escribió un informe técnico para DALL-E 3, este no incluye detalles de entrenamiento o implementación, sino que se centra en la mejora del seguimiento de indicaciones. El modelo está diseñado para interpretar indicaciones complejas con mayor precisión y detalle, y puede generar texto más coherente y preciso dentro de las imágenes en comparación con versiones anteriores.
DALL-E y DALL-E 2
El DALL-E original utilizaba un VAE discreto, un transformador autorregresivo solo de decodificador con 12 mil millones de parámetros y un modelo CLIP para clasificar las salidas. DALL-E 2, con 3.5 mil millones de parámetros, cambió a un modelo de difusión condicionado por incrustaciones de imágenes CLIP, similar a la arquitectura utilizada posteriormente en Stable Diffusion.
Capacidades
DALL-E 3 puede generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas, pinturas y emojis. Puede manipular y reorganizar objetos, y colocar elementos de diseño en composiciones novedosas. Sigue indicaciones complejas con más precisión y detalle que sus predecesores, y puede producir texto coherente dentro de las imágenes. DALL-E 3 está integrado en ChatGPT Plus, lo que permite a los usuarios generar imágenes directamente en las conversaciones.
Modificación de imágenes
DALL-E 2 y DALL-E 3 pueden producir variaciones de imágenes existentes y editarlas, incluyendo el relleno y la expansión de áreas. Estas funciones utilizan el contexto de la imagen original para completar áreas faltantes o expandir más allá de los bordes, manteniendo la consistencia con sombras, reflejos y texturas.
Recepción e impacto
DALL-E 3 ha sido destacado por su mejor seguimiento de indicaciones y su integración con ChatGPT, lo que lo hace accesible a un público más amplio. Su uso en Image Creator y Copilot de Microsoft ha ampliado su alcance. La capacidad del modelo para generar imágenes detalladas y precisas a partir de indicaciones complejas ha influido en el campo de la IA generativa, aunque se han planteado preocupaciones sobre la ética y la seguridad, lo que ha llevado a medidas como las marcas de agua.