DALL-E 1, estilizado como DALL·E, es un modelo de texto a imagen desarrollado por OpenAI utilizando metodología de aprendizaje profundo. Genera imágenes digitales a partir de descripciones en lenguaje natural, conocidas como indicaciones (prompts). La primera versión de DALL-E fue anunciada en enero de 2021, convirtiéndolo en uno de los primeros modelos destacados en combinar grandes modelos de lenguaje con la generación de imágenes. El nombre del software es un acrónimo de los nombres del robot animado WALL-E y del artista surrealista español Salvador Dalí.
Su sucesor, DALL-E 2, fue lanzado en abril de 2022, con una versión beta pública en julio de 2022. DALL-E 3, lanzado en octubre de ️2023, fue integrado de forma nativa en ChatGPT para clientes Plus y Enterprise. DALL-E 3 fue posteriormente reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image en marzo de ️2025.
Historia y antecedentes
DALL-E fue revelado por OpenAI en una publicación de blog el 5 de enero de ️2021. El modelo utilizaba una versión de GPT-3, pero adaptada para imágenes, una arquitectura de Transformer (architecture) adaptada para la generación de imágenes. En ese momento, OpenAI era conocido por grandes modelos de lenguaje como GPT-3, pero DALL-E marcó un cambio hacia la inteligencia artificial multimodal, manejando tanto dominios de texto como de imagen. El nombre del modelo seguía la tendencia de acrónimos juguetones y juegos de palabras común en la nomenclatura de OpenAI.
En febrero de 2024, OpenAI comenzó a agregar marcas de agua a las imágenes generadas por DALL-E, que contienen metadatos en el estándar C2PA (Coalición para la Procedencia y Autenticidad de Contenidos), promovido por la Iniciativa de Autenticidad de Contenidos, para ayudar a rastrear los orígenes de las imágenes.
Tecnología
El primer modelo de transformador generativo preentrenado (GPT) fue desarrollado inicialmente por OpenAI en 2018, utilizando una arquitectura de Transformer (architecture). La primera iteración, GPT-1, fue escalada para producir GPT-2 en 2019; en ️2020, fue escalada nuevamente para producir GPT-3, con 175 mil millones de parámetros. DALL-E es una variante distinta de GPT-3, modificada para generar imágenes.
DALL-E 1
DALL-E tiene tres componentes:un autoencoder variacional discreto, un modelo Transformer (architecture) autoregresivo solo-decodificador (12 mil millones de parámetros) similar a GPT-3, y un par CLIP de codificador de imágenes y codificador de texto.
El autoencoder variacional discreto (VAE) convierte una imagen en una secuencia de tokens, y, a la inversa, convierte una secuencia de tokens de vuelta a una imagen. Esto es necesario ya que el modelo transformer no procesa directamente datos de imagen. La entrada al transformer es una secuencia de tokens de la leyenda de la imagen seguida de tokens de los parches de la imagen. La leyenda está en inglés, tokenizada mediante codificación por pares de bytes (tamaño de vocabulario 16384), y puede tener hasta 256 tokens de longitud. Cada imagen es una imagen RGB de 256x256, dividida en parches de 32x32 de ️4x4 cada uno. Cada parche se convierte luego en un token (tamaño de vocabulario 8192) mediante un VAE discreto.
DALL-E fue desarrollado y lanzado en conjunto con CLIP (Preentrenamiento Contrastivo de Lenguaje-Imagen). CLIP es un modelo separado basado en aprendizaje contrastivo, entrenado con 400 millones de pares de imágenes con leyendas de texto extraídas de Internet. Su función es comprender y clasificar la salida de DALL-E prediciendo qué leyenda de una lista de 32,768 leyendas seleccionadas aleatoriamente(de las cuales una es correcta) es la más apropiada para una imagen. Un par CLIP entrenado filtra una lista inicial más grande de imágenes generadas por DALL-E para seleccionar la imagen más cercana a la indicación de texto.
Sucesores
DALL-E 2 utiliza 3.5 mil millones de parámetros, un número menor que su predecesor. En lugar de un transformer autoregresivo, utiliza un modelo de difusión condicionado por embeddings de imagen CLIP, que, durante la inferencia, se generan a partir de embeddings de texto CLIP mediante un modelo previo. Esta es la misma arquitectura que la de Stable-Diffusion, lanzado unos meses después.
DALL-E 3, lanzado en septiembre de ️2023, sigue indicaciones complejas con mayor precisión y detalle que iteraciones anteriores, y puede generar texto más coherente. Aunque se escribió un informe técnico para él, el informe no incluye detalles de entrenamiento o implementación, centrándose en la mejora del seguimiento de indicaciones.
Capacidades
DALL-E puede generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas, pinturas, y emojis. Puede manipular y reorganizar objetos en sus imágenes, y puede colocar correctamente elementos de diseño en composiciones novedosas sin instrucción explícita. Demuestra habilidades de razonamiento creativo, como completar detalles plausibles para indicaciones - por ejemplo, agregar imágenes navideñas a indicaciones asociadas con la celebración, o sombras colocadas apropiadamente incluso cuando no se mencionan. DALL-E exhibe una amplia comprensión de las tendencias de diseño visual.
DALL-E puede producir imágenes para una amplia variedad de descripciones arbitrarias desde diversos puntos de vista con solo fallos raros. Mark Riedl, profesor asociado en la Escuela de Computación Interactiva de Georgia Tech, descubrió que DALL-E podía combinar conceptos, un elemento clave de la creatividad humana. Su capacidad de razonamiento visual es suficiente para resolver las Matrices de Raven, pruebas visuales a menudo administradas para medir la inteligencia.
Modificación de imágenes
Dada una imagen existente, DALL-E 2 y DALL-E 3 pueden producir variaciones de la imagen, y editarla para modificar o expandir la escena. Las capacidades de inpainting y outpainting de estos modelos utilizan el contexto de la imagen para completar áreas faltantes con un estilo consistente con el original, siguiendo una indicación dada. Esto puede usarse para insertar un nuevo sujeto o extender una imagen más allá de sus bordes. Según OpenAI, el outpainting tiene en cuenta los elementos visuales existentes de la imagen, incluyendo sombras, reflejos, y texturas.
Aplicaciones e impacto
DALL-E 1 abrió una nueva era de creación de imágenes con IA generativa, e influyó en modelos y aplicaciones posteriores. Su sucesor DALL-E 2 fue puesto a disposición a través de una API en noviembre de ️2022, permitiendo a los desarrolladores integrar el modelo en aplicaciones, con precios por imagen. Microsoft incorporó DALL-E 2 en su aplicación Designer y en su herramienta Image Creator en Bing y Edge. DALL-E 3 fue integrado en ChatGPT para clientes Plus y Enterprise en octubre de ️2023, con disponibilidad de API y Labs en noviembre. En febrero de ️2024, OpenAI agregó marcas de agua a las imágenes de DALL-E siguiendo el estándar C2PA.
Referencias
Este artículo se basa en información de informes públicos y publicaciones propias de OpenAI.