Lanzamiento de DALL-E

Traducido del inglés

DALL-E es una serie de modelos de texto a imagen desarrollados por OpenAI, anunciados por primera vez en enero de 2021, que generan imágenes digitales a partir de indicaciones en lenguaje natural mediante aprendizaje profundo.

DALL-E es una serie de modelos de texto a imagen desarrollados por OpenAI que generan imágenes digitales a partir de descripciones en lenguaje natural, conocidas como indicaciones. La primera versión se anunció en enero de 2021, seguida de DALL-E 2 en 2022 y DALL-E 3 en 2023. El nombre es un acrónimo del robot animado WALL-E y el artista surrealista Salvador Dalí.

Historia y antecedentes

OpenAI reveló DALL-E en una publicación de blog el 5 de enero de 2021, utilizando una versión modificada de su modelo GPT-3 para generar imágenes. El 6 de abril de 2022, la empresa anunció DALL-E 2, un sucesor diseñado para producir imágenes más realistas a mayores resoluciones y para combinar conceptos, atributos y estilos. El acceso se restringió inicialmente a usuarios preseleccionados para una vista previa de investigación debido a preocupaciones éticas y de seguridad. El 20 de julio de 2022, DALL-E 2 entró en versión beta, con invitaciones enviadas a un millón de personas en lista de espera; los usuarios podían generar un número limitado de imágenes gratis cada mes y comprar más. El 28 de septiembre de 2022, se eliminó la lista de espera y el modelo quedó disponible para todos.

En septiembre de 2023, OpenAI anunció DALL-E 3, que podía comprender significativamente más matices y detalles que las iteraciones anteriores. Se lanzó de forma nativa en ChatGPT para clientes Plus y Enterprise en octubre de 2023, con disponibilidad en API y Labs a principios de noviembre. Microsoft integró DALL-E 3 en el Creador de Imágenes de Bing y en su aplicación Designer, y Microsoft Copilot funciona con DALL-E 3. En marzo de 2025, DALL-E 3 fue reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image.

En febrero de 2024, OpenAI comenzó a añadir marcas de agua a las imágenes generadas por DALL-E, incrustando metadatos en el estándar C2PA (Coalición para la Procedencia y Autenticidad de Contenidos) promovido por la Iniciativa de Autenticidad de Contenidos.

Tecnología

El primer modelo de transformador generativo preentrenado (GPT) fue desarrollado por OpenAI en 2018, utilizando una arquitectura Transformer (architecture). Se amplió a GPT-2 en 2019 y a GPT-3 en 2020, con 175 mil millones de parámetros.

DALL-E

DALL-E consta de tres componentes: un autoencoder variacional discreto (VAE), un modelo de transformador autorregresivo solo decodificador con 12 mil millones de parámetros similar a GPT-3, y un par de codificadores de imagen y texto CLIP (Preentrenamiento Contrastivo de Lenguaje-Imagen). El VAE discreto convierte una imagen en una secuencia de tokens y viceversa, permitiendo que el transformador procese datos de imagen. El transformador recibe una secuencia de subtítulos de imagen tokenizados seguidos de parches de imagen tokenizados. Los subtítulos están en inglés, tokenizados mediante codificación por pares de bytes con un tamaño de vocabulario de 16,384, y pueden tener hasta 256 tokens de longitud. Cada imagen es RGB de 256×256, dividida en parches de 32×32 de 4×4 píxeles, cada uno convertido por el VAE a un token de un vocabulario de 8,192.

CLIP, desarrollado junto con DALL-E, es un modelo separado basado en aprendizaje contrastivo, entrenado con 400 millones de pares de imagen-texto extraídos de internet. Clasifica la salida de DALL-E prediciendo qué subtítulo de una lista de 32,768 subtítulos seleccionados aleatoriamente es más apropiado para una imagen. Un par CLIP entrenado filtra una lista inicial más grande de imágenes generadas para seleccionar la más cercana a la indicación.

DALL-E 2

DALL-E 2 utiliza 3.5 mil millones de parámetros, menos que su predecesor. En lugar de un transformador autorregresivo, utiliza un modelo de difusión condicionado a incrustaciones de imagen CLIP, que se generan a partir de incrustaciones de texto CLIP mediante un modelo previo durante la inferencia. Esta arquitectura es similar a la de Stable Diffusion, lanzado unos meses después.

DALL-E 3

OpenAI publicó un informe técnico para DALL-E 3, pero no incluye detalles de entrenamiento o implementación, centrándose en cambio en las capacidades mejoradas de seguimiento de indicaciones.

Capacidades

DALL-E puede generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas, pinturas y emojis. Puede manipular y reorganizar objetos en imágenes y colocar correctamente elementos de diseño en composiciones novedosas sin instrucción explícita. Por ejemplo, cuando se le pide dibujar un rábano daikon sonándose la nariz, bebiendo un latte o montando un monociclo, DALL-E a menudo dibuja el pañuelo, las manos y los pies en ubicaciones plausibles. Puede inferir detalles apropiados no mencionados en las indicaciones, como añadir imágenes navideñas a indicaciones relacionadas con festividades o colocar sombras adecuadamente. DALL-E también muestra una amplia comprensión de tendencias visuales y de diseño.

DALL-E puede producir imágenes para una amplia variedad de descripciones arbitrarias desde diversos puntos de vista, con solo fallos raros. Mark Riedl, profesor asociado en la Escuela de Computación Interactiva de Georgia Tech, encontró que DALL-E podía combinar conceptos, lo que describió como un elemento clave de la creatividad humana. Su capacidad de razonamiento visual es suficiente para resolver las Matrices de Raven, pruebas visuales a menudo utilizadas para medir la inteligencia humana.

DALL-E 3 sigue indicaciones complejas con más precisión y detalle que sus predecesores y puede generar texto más coherente y preciso. Está integrado en ChatGPT Plus.

Modificación de imágenes

DALL-E 2 y DALL-E 3 pueden producir variaciones de imágenes existentes y editarlas para modificarlas o expandirlas. Las capacidades de inpaint y outpaint utilizan el contexto de una imagen para rellenar áreas faltantes en un estilo consistente con el original, siguiendo una indicación dada. Esto puede insertar un nuevo sujeto en una imagen o expandirla más allá de sus bordes originales. Según OpenAI, el outpaint tiene en cuenta los elementos visuales existentes de la imagen, incluyendo sombras, reflejos y texturas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:text-to-image·openai·generative-ai·deep-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial