Lanzamiento de DALL-E 2

Traducido del inglés

DALL-E 2, publicado por OpenAI en abril de 2022, es un modelo de texto a imagen que genera imágenes digitales a partir de indicaciones en lenguaje natural mediante aprendizaje profundo, en particular un modelo de difusión condicionado por incrustaciones de CLIP.

DALL-E 2 es un modelo de texto a imagen desarrollado por OpenAI, anunciado el 6 de abril de 2022 como sucesor del DALL-E original. Utiliza metodologías de aprendizaje profundo para generar imágenes digitales a partir de descripciones en lenguaje natural, conocidas como indicaciones. El modelo fue diseñado para producir imágenes más realistas a mayores resoluciones que su predecesor, con la capacidad de combinar conceptos, atributos y estilos. Su nombre es un acrónimo del personaje robot de Pixar WALL-E y el artista surrealista español Salvador Dalí.

Historia y antecedentes

El DALL-E original fue revelado por OpenAI en una publicación de blog el 5 de enero de 2021, utilizando una versión modificada de GPT-3 para generar imágenes. DALL-E 2 fue anunciado el 6 de abril de 2022, entrando en una fase beta el 20 de julio de 2022 con invitaciones enviadas a 1 millón de personas en lista de espera. Durante esta fase, los usuarios podían generar un cierto número de imágenes gratis cada mes y comprar más. El acceso había sido previamente restringido a usuarios preseleccionados para una vista previa de investigación debido a preocupaciones sobre ética y seguridad. El 28 de septiembre de 2022, DALL-E 2 se abrió a todos, y se eliminó el requisito de lista de espera. A principios de noviembre de 2022, OpenAI lanzó DALL-E 2 como una API, permitiendo a los desarrolladores integrar el modelo en sus propias aplicaciones. Microsoft posteriormente implementó DALL-E 2 en su aplicación Designer y en la herramienta Image Creator incluida en Bing y Microsoft Edge. La API opera sobre una base de costo por imagen, con precios que varían según la resolución de la imagen y descuentos por volumen disponibles para clientes empresariales. En febrero de 2024, OpenAI comenzó a añadir marcas de agua a las imágenes generadas por DALL-E, que contienen metadatos en el estándar C2PA (Coalición para la Procedencia y Autenticidad de Contenidos) promovido por la Iniciativa de Autenticidad de Contenidos.

Tecnología

DALL-E 2 utiliza 3.5 mil millones de parámetros, un número menor que su predecesor. En lugar de un Transformer autorregresivo, emplea un modelo de difusión condicionado en incrustaciones de imagen CLIP. Durante la inferencia, estas incrustaciones de imagen se generan a partir de incrustaciones de texto CLIP mediante un modelo previo. Esta arquitectura es la misma que la de Stable Diffusion, lanzado unos meses después. El modelo se basa en trabajos anteriores en IA generativa y aprendizaje profundo, particularmente en el desarrollo de la arquitectura transformador por OpenAI y otros. El primer modelo generativo preentrenado de transformador (GPT) fue desarrollado por OpenAI en 2018, escalado a GPT-2 en 2019 y GPT-3 en 2020, con 175 mil millones de parámetros. El enfoque de difusión de DALL-E 2 difiere del método autorregresivo del DALL-E original, que utilizaba un VAE discreto y un modelo Transformer solo de decodificador con 12 mil millones de parámetros.

Capacidades

DALL-E 2 puede generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas, pinturas y emojis. Puede manipular y reorganizar objetos en sus imágenes y colocar correctamente elementos de diseño en composiciones novedosas sin instrucción explícita. El modelo exhibe una amplia comprensión de las tendencias visuales y de diseño, y puede producir imágenes para una gran variedad de descripciones arbitrarias desde diversos puntos de vista con solo fallos raros. Su capacidad de razonamiento visual es suficiente para resolver las Matrices de Raven, pruebas visuales a menudo administradas a humanos para medir la inteligencia. DALL-E 2 también admite la modificación de imágenes, incluyendo la generación de variaciones de imágenes existentes y su edición mediante inpainting y outpainting. Estas habilidades utilizan el contexto de una imagen para rellenar áreas faltantes usando un medio consistente con el original, siguiendo una indicación dada. Por ejemplo, el outpainting puede expandir una imagen más allá de sus bordes originales, teniendo en cuenta elementos visuales existentes como sombras, reflejos y texturas.

Impacto y legado

DALL-E 2 marcó un avance significativo en la generación de texto a imagen, llevando la tecnología a un público más amplio a través de su beta abierta y la eventual eliminación de la lista de espera. Su lanzamiento impulsó el interés en IA generativa e influyó en desarrollos posteriores en el campo, incluyendo DALL-E 3, lanzado en octubre de 2023 de forma nativa en ChatGPT para clientes Plus y Enterprise. DALL-E 3 fue posteriormente integrado en Bing Image Creator y Copilot de Microsoft, y en marzo de 2025 fue reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image. La arquitectura basada en difusión del modelo también influyó en otros sistemas, como Stable Diffusion, y contribuyó a la rápida evolución de aplicaciones de aprendizaje automático para tareas creativas. El enfoque de DALL-E 2 hacia la seguridad, incluyendo el acceso restringido durante la vista previa de investigación y el posterior marcado de agua, estableció precedentes para el despliegue responsable de modelos generativos.

Recepción y preocupaciones

El lanzamiento de DALL-E 2 generó una atención pública y académica considerable, destacando tanto el potencial creativo como los desafíos éticos de las imágenes generadas por IA. Las preocupaciones incluían el posible uso indebido para crear contenido engañoso, problemas de derechos de autor y el impacto en artistas y diseñadores. El despliegue gradual de OpenAI, con restricciones iniciales y una lista de espera, reflejó estas preocupaciones. La capacidad del modelo para generar imágenes realistas a partir de indicaciones de texto también planteó preguntas sobre la procedencia y autenticidad, lo que llevó a la adopción de marcas de agua C2PA en 2024. A pesar de estos desafíos, DALL-E 2 fue ampliamente elogiado por sus logros técnicos y su interfaz fácil de usar, ayudando a popularizar la generación de texto a imagen entre no especialistas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·text-to-image·openai·deep-learning
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial