DALL-E, DALL-E 2 y DALL-E 3 (estilizado como DALL·E) son modelos de texto a imagen desarrollados por OpenAI mediante metodologías de aprendizaje profundo para generar imágenes digitales a partir de descripciones en lenguaje natural conocidas como indicaciones. La primera versión se anunció en enero de 2021, y las iteraciones posteriores ampliaron las capacidades en realismo, resolución y seguimiento de indicaciones. El nombre es un acrónimo del personaje robot de Pixar WALL-E y del artista surrealista español Salvador Dalí.
Historia y antecedentes
OpenAI reveló DALL-E en una publicación de blog el 5 de enero de 2021, utilizando una versión modificada de GPT-3 para generar imágenes. El 6 de abril de 2022, la empresa anunció DALL-E 2, un sucesor diseñado para producir imágenes más realistas a mayores resoluciones que pudiera "combinar conceptos, atributos y estilos". El acceso a DALL-E 2 inicialmente permaneció restringido a usuarios preseleccionados para una vista previa de investigación debido a preocupaciones éticas y de seguridad. El 20 de julio de 2022, el modelo entró en una fase beta con invitaciones enviadas a 1 millón de personas en lista de espera, permitiendo un cierto número de generaciones gratuitas mensuales con opciones para comprar más. El requisito de lista de espera se eliminó el 28 de septiembre de 2022, abriendo la herramienta a todos.
En septiembre de 2023, OpenAI anunció DALL-E 3, capaz de comprender "significativamente más matices y detalles" que las iteraciones anteriores. Se lanzó de forma nativa en ChatGPT para clientes Plus y Enterprise en octubre de 2023, con disponibilidad a través de la API y una plataforma "Labs" a principios de noviembre. Microsoft implementó el modelo en la herramienta Image Creator de Bing y en su aplicación Designer, con Microsoft Copilot funcionando con DALL-E 3. En marzo de 2025, DALL-E 3 fue reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image. En febrero de 2024, OpenAI comenzó a añadir marcas de agua a las imágenes generadas por DALL-E, que contienen metadatos en el estándar C2PA (Coalición para la Procedencia y Autenticidad de Contenidos).
Tecnología
El primer modelo de transformador generativo preentrenado (GPT) fue desarrollado por OpenAI en 2018 utilizando una arquitectura de transformador. Las iteraciones de escalado produjeron GPT-2 en 2019 y GPT-3 en 2020, este último con 175 mil millones de parámetros. DALL-E se basó en esta base con arquitecturas distintas según las versiones.
DALL-E
El DALL-E original comprendía tres componentes: un autoencoder variacional discreto (VAE), un modelo de transformador autorregresivo solo decodificador con 12 mil millones de parámetros similar a GPT-3, y un par de codificadores de imagen y texto CLIP. El VAE discreto convertía imágenes en secuencias de tokens y viceversa, necesario porque el transformador no procesa directamente datos de imagen. La entrada consistía en un título en inglés tokenizado (hasta 256 tokens, tamaño de vocabulario 16,384) seguido de parches de imagen tokenizados. Cada imagen RGB de 256×256 se dividía en parches de 32×32 de 4×4 píxeles, con cada parche convertido a un token usando un vocabulario de 8,192.
CLIP (Preentrenamiento Contrastivo de Lenguaje e Imagen), desarrollado y anunciado junto con DALL-E, era un modelo separado basado en aprendizaje contrastivo entrenado con 400 millones de pares de imagen y texto extraídos de Internet. Clasificaba la salida de DALL-E prediciendo qué título de una lista de 32,768 títulos seleccionados aleatoriamente era más apropiado para una imagen, filtrando una lista inicial más grande para seleccionar la coincidencia más cercana a la indicación.
DALL-E 2
DALL-E 2 usaba 3.5 mil millones de parámetros, menos que su predecesor, y reemplazó el transformador autorregresivo con un modelo de difusión condicionado en incrustaciones de imagen CLIP. Durante la inferencia, estas incrustaciones se generaban a partir de incrustaciones de texto CLIP mediante un modelo previo. Esta arquitectura era la misma que la de Stable Diffusion, lanzado unos meses después.
DALL-E 3
OpenAI publicó un informe técnico para DALL-E 3, pero omitió detalles de entrenamiento e implementación, centrándose en cambio en las capacidades mejoradas de seguimiento de indicaciones. El modelo se integró en ChatGPT Plus, permitiendo el refinamiento conversacional de las imágenes generadas.
Capacidades
DALL-E podía generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas, pinturas y emojis. Podía "manipular y reorganizar" objetos y colocar elementos de diseño en composiciones novedosas sin instrucción explícita. Thom Dunn, escribiendo para BoingBoing, señaló que cuando se le pedía dibujar un rábano daikon sonándose la nariz, bebiendo un latte o montando un monociclo, DALL-E a menudo dibujaba el pañuelo, las manos y los pies en ubicaciones plausibles. El modelo podía "rellenar los espacios en blanco", infiriendo detalles apropiados como imágenes navideñas para indicaciones relacionadas o sombras no mencionadas en el texto, y mostraba una amplia comprensión de las tendencias visuales y de diseño.
DALL-E podía producir imágenes para una amplia variedad de descripciones arbitrarias desde diversos puntos de vista con solo fallos raros. Mark Riedl, profesor asociado de la Escuela de Computación Interactiva de Georgia Tech, encontró que DALL-E podía combinar conceptos, un elemento clave de la creatividad humana. Su capacidad de razonamiento visual era suficiente para resolver las Matrices de Raven, pruebas visuales a menudo administradas para medir la inteligencia humana.
DALL-E 3 seguía indicaciones complejas con más precisión y detalle que sus predecesores y generaba texto dentro de las imágenes de manera más coherente y precisa.
Modificación de imágenes
Dado una imagen existente, DALL-E 2 y DALL-E 3 podían producir "variaciones" como salidas individuales basadas en el original, así como editar la imagen para modificarla o expandirla. Las capacidades de "inpainting" y "outpainting" usaban el contexto de la imagen para rellenar áreas faltantes en un medio consistente con el original, siguiendo una indicación dada. Por ejemplo, esto permitía insertar un nuevo sujeto en una imagen o expandirla más allá de sus bordes originales. Según OpenAI, "Outpainting tiene en cuenta los elementos visuales existentes de la imagen - incluyendo sombras, reflejos y texturas - para" producir extensiones sin fisuras.