Traducido del inglés

DALL-E 2 es un modelo de texto a imagen desarrollado por OpenAI, lanzado en 2022, que genera imágenes realistas a partir de instrucciones en lenguaje natural utilizando difusión y incrustaciones de CLIP.

DALL-E 2 es un modelo de texto a imagen desarrollado por OpenAI y lanzado en 2022. Genera imágenes digitales a partir de descripciones en lenguaje natural, conocidas como indicaciones, utilizando metodologías de aprendizaje profundo. El modelo es el sucesor del DALL-E original y fue diseñado para producir imágenes más realistas a resoluciones más altas, con la capacidad de combinar conceptos, atributos y estilos.

DALL-E 2 forma parte del campo más amplio de la inteligencia artificial generativa, que se centra en la creación de contenido nuevo. Utiliza una arquitectura basada en difusión, un cambio respecto al enfoque autorregresivo de su predecesor. El nombre es una combinación del robot de Pixar WALL-E y el artista surrealista español Salvador Dalí.

Historia y antecedentes

El DALL-E original fue anunciado por OpenAI en una publicación de blog el 5 de enero de 2021, mediante una versión modificada de GPT-3 para generar imágenes. El 6 de abril de 2022, OpenAI anunció DALL-E 2 como sucesor, enfatizando su capacidad para generar imágenes más realistas y combinar conceptos. Inicialmente, el acceso estaba restringido a usuarios preseleccionados para una vista previa de investigación debido a preocupaciones de seguridad y éticas. El 20 de julio de 2022, DALL-E 2 entró en una fase beta, invitando a 1 millón de personas en lista de espera; los usuarios podían generar un número limitado de imágenes gratuitas cada mes y comprar créditos adicionales. El requisito de lista de espera se eliminó el 28 de septiembre de 2022, abriendo el modelo al público general.

A principios de noviembre de 2022, OpenAI lanzó DALL-E 2 como una API, permitiendo que los desarrolladores integraran el modelo en aplicaciones. La API funciona bajo un costo por imagen, con precios variables según la resolución y descuentos por volumen para clientes empresariales. Microsoft integró DALL-E 2 en su aplicación Designer y la herramienta Creador de imágenes en Bing y Microsoft Edge. En febrero de 2024, OpenAI comenzó a añadir marcas de agua a las imágenes generadas por DALL-E, insertando metadatos usando el estándar C2PA (Coalición para la Procedencia y Autenticidad del Contenido).

Tecnología

DALL-E 2 utiliza 3.5 mil millones de parámetros, menos que los 12 mil millones de su predecesor. En lugar de un transformador autorregresivo, emplea un modelo de difusión condicionado en las incrustaciones de imágenes CLIP. Durante la inferencia, un modelo previo genera estas incrustaciones de imágenes a partir de las incrustaciones de texto CLIP. Esta arquitectura es similar a la de Difusión Estable, que se lanzó unos meses después. El modelo aprovecha las técnicas de redes neuronales y aprendizaje automático, construyendo sobre avances en la investigación de inteligencia artificial.

CLIP (Pre-entrenamiento Contrastivo de Lenguaje e Imagen) es un modelo separado entrenado con 400 millones de pares de imagen-texto de Internet. Desempeña un papel fundacional en la comprensión y la clasificación de los resultados de DALL-E 2, seleccionando la imagen que mejor coincide con el indicador. El proceso de difusión refina iterativamente el ruido aleatorio en una imagen coherente, guiado por las incrustaciones CLIP.

Capacidades

DALL-E 2 puede generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas, pinturas y emojis. Puede manipular y reorganizar objetos, y colocar correctamente elementos de diseño en composiciones novedosas sin instrucción explícita. Por ejemplo, cuando se le pide que dibuje un rábano daikon que se mecaniza, toma un café con leche o anda en monociclo, el modelo suele colocar pañuelos, manos y pies en lugares plausibles. También puede inferir detalles apropiados, como añadir imágenes de navidad a indicadores asociados con la fiesta o renderizando sombras que no fueron mencionadas.

El modelo muestra una amplia comprensión de las tendencias visuales y de diseño, y puede producir imágenes para una gran variedad de descripciones arbitrarias desde diversos puntos de vista, con solo fallos infrecuentes. Su capacidad de razonamiento visual es suficiente para resolver las Matrices de Raven, una prueba utilizada a menudo para medir la inteligencia humana.

Modificación de imágenes

DALL-E 2 puede producir variaciones de las imágenes existentes, así como edurias para modificarlas o expandirlas. Las habilidades de inpainting y outpainting utilizan contexto de la imagen original para rellenar las áreas automáticas de manera coherente, siguiendo un indicador dado. Por ejemplo, los usuarios pueden insertar nuevos sujetos en una imagen o pr estirarla más allá de sus borderses originales. Según OpenAI, el outpainting considera los elementos visuales existentes como la sombra, los reflejos y las texturas.

Impacto y legado

DALL-E 2 influyó en el desarrollo posterior en la generación de texto a imagen, incluyendo DALL-E 3, lanzado en octubre de 2023, que se integró en ChatGPT y fue reemplazado más tarde por GPT Image en marzo de 2025. El modelo también contribuyó a discusiones más amplias sobre las capacidades e implicaciones éticas de la IA generativa, incluyendo preocupaciones sobre el mal uso, así como la necesidad de medidas de procedencia como la marca de agua.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:text-to-image·generative-ai·openai·diffusion-models
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial