DALL-E 2 Lanzado

Traducido del inglés

DALL-E 2 es un modelo de texto a imagen desarrollado por OpenAI, lanzado en abril de 2022, que genera imágenes realistas a partir de indicaciones en lenguaje natural mediante difusión y embeddings de CLIP. Sucedió al DALL-E original y fue posteriormente seguido por DALL-E 3.

DALL-E 2 es un modelo de texto a imagen desarrollado por OpenAI que genera imágenes digitales a partir de descripciones en lenguaje natural, conocidas como indicaciones. Anunciado el 6 de abril de 2022, sucedió al modelo DALL-E original y fue diseñado para producir imágenes más realistas a mayores resoluciones, con la capacidad de combinar conceptos, atributos y estilos. El modelo utiliza metodologías de aprendizaje profundo, específicamente un modelo de difusión condicionado a incrustaciones de imágenes CLIP, y fue lanzado al público en etapas durante 2022.

El nombre DALL-E es un acrónimo del personaje robot animado WALL-E y del artista surrealista español Salvador Dalí. El desarrollo del modelo marcó un paso significativo en la inteligencia artificial generativa, basándose en avances anteriores en aprendizaje automático y redes neuronales.

Historia y antecedentes

La primera versión de DALL-E fue anunciada por OpenAI en enero de 2021, utilizando una versión modificada de GPT-3 para generar imágenes. El 6 de abril de 2022, OpenAI anunció DALL-E 2 como sucesor, enfatizando una mejora en realismo y resolución. El acceso fue inicialmente restringido a usuarios preseleccionados para una vista previa de investigación debido a preocupaciones éticas y de seguridad. El 20 de julio de 2022, el modelo entró en una fase beta, con invitaciones enviadas a 1 millón de personas en lista de espera, quienes podían generar un cierto número de imágenes gratis cada mes y comprar créditos adicionales. El requisito de lista de espera fue eliminado el 28 de septiembre de 2022, abriendo DALL-E 2 a todos.

A principios de noviembre de 2022, OpenAI lanzó DALL-E 2 como una API, permitiendo a los desarrolladores integrar el modelo en sus aplicaciones. La API opera sobre una base de costo por imagen, con precios que varían según la resolución y descuentos por volumen disponibles para clientes empresariales. Microsoft implementó posteriormente DALL-E 2 en su aplicación Designer y en la herramienta Image Creator dentro de Bing y Microsoft Edge. En septiembre de 2023, OpenAI anunció DALL-E 3, que fue integrado en ChatGPT para clientes Plus y Enterprise en octubre de 2023 y posteriormente reemplazado por GPT Image en marzo de 2025.

Tecnología

DALL-E 2 utiliza 3.5 mil millones de parámetros, menos que los 12 mil millones de su predecesor. En lugar de un modelo Transformer autorregresivo, emplea un modelo de difusión condicionado a incrustaciones de imágenes CLIP. Durante la inferencia, un modelo previo genera estas incrustaciones de imágenes a partir de incrustaciones de texto CLIP. Esta arquitectura es similar a la de Stable Diffusion, lanzado unos meses después. El DALL-E original utilizaba un autoencoder variacional discreto para convertir imágenes en tokens, procesados por un Transformer autorregresivo solo de decodificador, con un par de codificadores de imagen y texto CLIP para clasificar las salidas.

El proceso de difusión de DALL-E 2 refina iterativamente el ruido en una imagen, guiado por las incrustaciones derivadas del texto, lo que permite salidas de alta resolución y una colocación coherente de objetos. El entrenamiento del modelo involucró grandes conjuntos de datos de pares imagen-texto, aunque los detalles específicos no fueron completamente divulgados.

Capacidades

DALL-E 2 puede generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas, pinturas y emojis. Puede manipular y reorganizar objetos, y colocar correctamente elementos de diseño en composiciones novedosas sin instrucción explícita. Por ejemplo, cuando se le pide dibujar un rábano daikon sonándose la nariz, bebiendo un latte o montando un monociclo, el modelo a menudo dibuja el pañuelo, las manos y los pies en ubicaciones plausibles. También puede completar espacios en blanco, como añadir imágenes navideñas a indicaciones asociadas con la celebración o sombras apropiadas a imágenes que no las mencionan.

El modelo exhibe una comprensión amplia de las tendencias visuales y de diseño, y puede combinar conceptos, un elemento clave de la creatividad humana. Su capacidad de razonamiento visual es suficiente para resolver las Matrices de Raven, pruebas visuales a menudo administradas a humanos para medir la inteligencia. DALL-E 2 puede producir imágenes para una amplia variedad de descripciones arbitrarias desde diversos puntos de vista, con solo fallos raros.

Modificación de imágenes

Dado una imagen existente, DALL-E 2 puede producir variaciones como salidas individuales basadas en la original, así como editar la imagen para modificarla o expandirla. Las capacidades de inpainting y outpainting utilizan el contexto de la imagen para rellenar áreas faltantes, siguiendo una indicación dada. Por ejemplo, esto puede insertar un nuevo sujeto en una imagen o expandirla más allá de sus bordes originales. OpenAI señaló que el outpainting tiene en cuenta los elementos visuales existentes de la imagen, incluyendo sombras, reflejos y texturas.

Seguridad y ética

Durante su vista previa de investigación, OpenAI restringió el acceso a DALL-E 2 debido a preocupaciones sobre el mal uso, como la generación de contenido engañoso o dañino. La empresa implementó filtros para bloquear contenido violento, adulto o político, y añadió marcas de agua a las imágenes generadas en febrero de 2024, conteniendo metadatos en el estándar C2PA promovido por la Content Authenticity Initiative. Estas medidas tenían como objetivo abordar problemas éticos en torno a los deepfakes y la desinformación.

Legado e impacto

DALL-E 2 influyó en modelos posteriores de texto a imagen y en la investigación más amplia de la inteligencia artificial. Su enfoque basado en difusión fue adoptado por otros sistemas, y su integración en productos como Bing Image Creator amplió el acceso público a la imaginería generativa. El éxito del modelo contribuyó a la prominencia de OpenAI en el campo, junto con desarrollos en aprendizaje profundo y mecanismos de atención.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:text-to-image·openai·generative-ai·diffusion-model
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial