Traducido del inglés

DALL-E es una serie de modelos de texto a imagen desarrollados por OpenAI, anunciados por primera vez en enero de 2021, que generan imágenes digitales a partir de instrucciones en lenguaje natural mediante técnicas de aprendizaje profundo.

DALL-E es una serie de modelos de texto a imagen desarrollados por OpenAI utilizando metodologías de aprendizaje profundo para generar imágenes digitales a partir de descripciones en lenguaje natural conocidas como indicaciones. La primera versión se anunció en enero de 2021, seguida de DALL-E 2 en 2022 y DALL-E 3 en 2023. El nombre es un acrónimo del personaje robot de Pixar WALL-E y el artista surrealista español Salvador Dalí.

Los modelos forman parte del campo más amplio de la inteligencia artificial generativa, que se centra en crear contenido nuevo como imágenes, texto o audio. Las capacidades de DALL-E han influido en desarrollos posteriores en la generación de texto a imagen y se han integrado en varios productos comerciales.

Historia y antecedentes

OpenAI reveló DALL-E en una publicación de blog el 5 de enero de 2021, utilizando una versión modificada de su modelo GPT-3 para generar imágenes. El 6 de abril de 2022, la empresa anunció DALL-E 2, un sucesor diseñado para producir imágenes más realistas a mayores resoluciones y para combinar conceptos, atributos y estilos. El acceso a DALL-E 2 se restringió inicialmente a usuarios preseleccionados para una vista previa de investigación debido a preocupaciones éticas y de seguridad. El 20 de julio de 2022, el modelo entró en una fase beta con invitaciones enviadas a 1 millón de personas en lista de espera, permitiendo un cierto número de imágenes gratuitas al mes con opciones para comprar más. El requisito de lista de espera se eliminó el 28 de septiembre de 2022, abriendo el modelo a todos.

En septiembre de 2023, OpenAI anunció DALL-E 3, que podía comprender significativamente más matices y detalles que las iteraciones anteriores. Se lanzó de forma nativa en ChatGPT para clientes de ChatGPT Plus y ChatGPT Enterprise en octubre de 2023, con disponibilidad a través de la API de OpenAI y la plataforma Labs a principios de noviembre de ese año. Microsoft implementó DALL-E 3 en la herramienta Image Creator de Bing y planeó usarlo en su aplicación Designer, con Microsoft Copilot funcionando con DALL-E 3. En marzo de 2025, DALL-E 3 fue reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image.

En febrero de 2024, OpenAI comenzó a añadir marcas de agua a las imágenes generadas por DALL-E, que contienen metadatos en el estándar C2PA (Coalición para la Procedencia y Autenticidad de Contenido) promovido por la Iniciativa de Autenticidad de Contenido.

Tecnología

El primer modelo de transformador generativo preentrenado (GPT) fue desarrollado por OpenAI en 2018 utilizando una arquitectura de transformador. Se amplió a GPT-2 en 2019 y GPT-3 en 2020, con 175 mil millones de parámetros. DALL-E se basa en esta base.

DALL-E

El DALL-E original tiene tres componentes: un autoencoder variacional discreto (VAE), un modelo de transformador autorregresivo solo de decodificador con 12 mil millones de parámetros similar a GPT-3, y un par CLIP de codificadores de imagen y texto. El VAE discreto convierte una imagen en una secuencia de tokens y viceversa, ya que el transformador no procesa datos de imagen directamente. La entrada es una secuencia de subtítulos de imagen tokenizados seguidos de parches de imagen tokenizados. Los subtítulos están en inglés, tokenizados mediante codificación de pares de bytes con un tamaño de vocabulario de 16,384, y pueden tener hasta 256 tokens de longitud. Cada imagen es de 256 por 256 RGB, dividida en parches de 32 por 32 de 4 por 4 píxeles, con cada parche convertido por el VAE a un token de un vocabulario de 8,192.

DALL-E se desarrolló junto con CLIP (Preentrenamiento Contrastivo de Lenguaje-Imagen), un modelo separado basado en aprendizaje contrastivo entrenado en 400 millones de pares de imágenes y subtítulos de texto extraídos de Internet. CLIP clasifica la salida de DALL-E prediciendo qué subtítulo de una lista de 32,768 subtítulos seleccionados aleatoriamente es más apropiado para una imagen. Un par CLIP entrenado filtra una lista inicial más grande de imágenes para seleccionar la más cercana a la indicación de texto.

DALL-E 2

DALL-E 2 utiliza 3.5 mil millones de parámetros, menos que su predecesor. En lugar de un transformador autorregresivo, utiliza un modelo de difusión condicionado en incrustaciones de imagen CLIP, que se generan a partir de incrustaciones de texto CLIP mediante un modelo previo durante la inferencia. Esta arquitectura es la misma que la de Stable Diffusion, lanzada unos meses después.

DALL-E 3

Se escribió un informe técnico para DALL-E 3, pero no incluye detalles de entrenamiento o implementación, centrándose en cambio en las capacidades mejoradas de seguimiento de indicaciones.

Capacidades

DALL-E puede generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas, pinturas y emojis. Puede manipular y reorganizar objetos en imágenes y colocar correctamente elementos de diseño en composiciones novedosas sin instrucción explícita. Por ejemplo, cuando se le pide dibujar un rábano daikon sonándose la nariz, bebiendo un latte o montando un monociclo, DALL-E a menudo dibuja el pañuelo, las manos y los pies en ubicaciones plausibles. Puede inferir detalles apropiados sin indicaciones específicas, como añadir imágenes navideñas a indicaciones comúnmente asociadas con la celebración o colocar sombras adecuadamente. DALL-E también muestra una amplia comprensión de las tendencias visuales y de diseño.

El modelo puede producir imágenes para una amplia variedad de descripciones arbitrarias desde varios puntos de vista con solo fallos raros. Mark Riedl, profesor asociado en la Escuela de Computación Interactiva de Georgia Tech, encontró que DALL-E podía combinar conceptos, descrito como un elemento clave de la creatividad humana. Su capacidad de razonamiento visual es suficiente para resolver las Matrices de Raven, pruebas visuales a menudo administradas a humanos para medir la inteligencia.

DALL-E 3 sigue indicaciones complejas con más precisión y detalle que sus predecesores y puede generar texto más coherente y preciso. Está integrado en ChatGPT Plus.

Modificación de imágenes

Dada una imagen existente, DALL-E 2 y DALL-E 3 pueden producir variaciones de la imagen como salidas individuales basadas en la original, así como editar la imagen para modificarla o expandirla. Las capacidades de inpainting y outpainting de estos modelos utilizan contexto de una imagen para rellenar áreas faltantes usando un medio consistente con la original, siguiendo una indicación dada. Por ejemplo, esto se puede usar para insertar un nuevo sujeto en una imagen o expandir una imagen más allá de sus bordes originales. Según OpenAI, el outpainting tiene en cuenta los elementos visuales existentes de la imagen, incluidos sombras, reflejos y texturas.

Impacto y adopción

DALL-E ha sido ampliamente adoptado en herramientas comerciales. Microsoft implementó DALL-E 2 en su aplicación Designer y en la herramienta Image Creator incluida en Bing y Microsoft Edge. La API opera sobre una base de costo por imagen, con precios que varían según la resolución de la imagen, y hay descuentos por volumen disponibles para empresas que trabajan con el equipo empresarial de OpenAI. La influencia del modelo se extiende a otros sistemas de texto a imagen y ha contribuido a discusiones sobre la seguridad de la inteligencia artificial, los derechos de autor y la procedencia del contenido.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:text-to-image·openai·generative-ai·deep-learning
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial