Lanzamiento de OpenAI DALL-E 3

Traducido del inglés

DALL-E 3, lanzado por OpenAI en octubre de 2023, es un modelo de texto a imagen integrado en ChatGPT para usuarios Plus y Enterprise, que ofrece capacidades avanzadas de seguimiento de instrucciones y generación de imágenes.

DALL-E 3 es un modelo de texto a imagen desarrollado por OpenAI, lanzado en octubre de 2023 como la tercera iteración de la serie DALL-E. Se puso a disposición de forma nativa dentro de ChatGPT para los clientes de ChatGPT Plus y ChatGPT Enterprise, con acceso más amplio a través de la API de OpenAI y la plataforma Labs a principios de noviembre de 2023. El modelo se basa en los fundamentos de sus predecesores, DALL-E y DALL-E 2, utilizando aprendizaje profundo para generar imágenes digitales a partir de indicaciones en lenguaje natural.

El nombre DALL-E es un acrónimo del personaje robot de Pixar WALL-E y del artista surrealista español Salvador Dalí. La primera versión se anunció en enero de 2021, seguida de DALL-E 2 en abril de 2022. DALL-E 3 representa un avance significativo en la comprensión de matices y detalles en las indicaciones, y se integró en la herramienta Bing Image Creator de Microsoft, con Microsoft Copilot funcionando sobre el modelo.

Historia y antecedentes

OpenAI reveló por primera vez DALL-E en una publicación de blog el 5 de enero de 2021, utilizando una versión modificada de GPT-3 para generar imágenes. DALL-E 2 se anunció el 6 de abril de 2022, diseñado para generar imágenes más realistas a mayores resoluciones y combinar conceptos, atributos y estilos. Entró en versión beta el 20 de julio de 2022 con invitaciones enviadas a 1 millón de personas en lista de espera, y se abrió a todos el 28 de septiembre de 2022.

En septiembre de 2023, OpenAI anunció DALL-E 3, capaz de comprender significativamente más matices y detalles que las iteraciones anteriores. El modelo se lanzó de forma nativa en ChatGPT para clientes Plus y Enterprise en octubre de 2023. A principios de noviembre de 2023 estuvo disponible a través de la API de OpenAI y la plataforma Labs. Microsoft implementó el modelo en la herramienta Image Creator de Bing y planeó su integración en su aplicación Designer.

En febrero de 2024, OpenAI comenzó a añadir marcas de agua a las imágenes generadas por DALL-E, que contienen metadatos en el estándar C2PA (Coalición para la Procedencia y Autenticidad de Contenidos) promovido por la Iniciativa de Autenticidad de Contenidos. En marzo de 2025, DALL-E 3 fue reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image.

Tecnología

El primer modelo generativo preentrenado de transformador (GPT) fue desarrollado por OpenAI en 2018 utilizando una arquitectura de transformador. GPT-1 se amplió para producir GPT-2 en 2019, y GPT-3 con 175 mil millones de parámetros en 2020. DALL-E 3 utiliza metodologías de aprendizaje profundo, aunque el informe técnico de OpenAI para DALL-E 3 no incluye detalles de entrenamiento o implementación, centrándose en cambio en las capacidades mejoradas de seguimiento de indicaciones.

Arquitectura de DALL-E

El DALL-E original tenía tres componentes: un VAE discreto, un modelo de transformador autorregresivo solo de decodificador con 12 mil millones de parámetros similar a GPT-3, y un par CLIP de codificador de imágenes y codificador de texto. El VAE discreto convierte imágenes en secuencias de tokens y viceversa, necesario porque el transformador no procesa directamente datos de imagen.

La entrada del transformador es una secuencia de leyendas de imágenes tokenizadas seguida de parches de imagen tokenizados. Las leyendas están en inglés, tokenizadas mediante codificación de pares de bytes con un tamaño de vocabulario de 16384, de hasta 256 tokens de longitud. Cada imagen es de 256×256 RGB, dividida en parches de 32×32 de 4×4 cada uno, con cada parche convertido por un autoencoder variacional discreto a un token con un tamaño de vocabulario de 8192.

CLIP (Preentrenamiento Contrastivo de Lenguaje-Imagen) se desarrolló junto con DALL-E, entrenado en 400 millones de pares de imágenes con leyendas de texto. Clasifica la salida de DALL-E prediciendo qué leyenda de una lista de 32,768 leyendas seleccionadas aleatoriamente es la más apropiada para una imagen, filtrando una lista inicial más grande para seleccionar la coincidencia más cercana.

Arquitectura de DALL-E 2 y DALL-E 3

DALL-E 2 utiliza 3.5 mil millones de parámetros, menos que su predecesor, y emplea un modelo de difusión condicionado a incrustaciones de imágenes CLIP, con un modelo previo que genera estas incrustaciones a partir de incrustaciones de texto CLIP durante la inferencia. Esta arquitectura es similar a Stable Diffusion, lanzado unos meses después.

DALL-E 3 continúa este enfoque basado en difusión pero con un seguimiento de indicaciones mejorado. Aunque no hay detalles técnicos públicos disponibles, el modelo demuestra una precisión mejorada en el seguimiento de indicaciones complejas y en la generación de texto coherente dentro de las imágenes.

Capacidades

DALL-E puede generar imágenes en múltiples estilos, incluidos imágenes fotorrealistas, pinturas y emojis. Puede manipular y reorganizar objetos, y colocar correctamente elementos de diseño en composiciones novedosas sin instrucción explícita. Por ejemplo, cuando se le pide dibujar un rábano daikon sonándose la nariz, bebiendo un café con leche o montando en monociclo, DALL-E a menudo dibuja el pañuelo, las manos y los pies en ubicaciones plausibles.

El modelo puede completar espacios en blanco para inferir detalles apropiados sin indicaciones específicas, como añadir imágenes navideñas a indicaciones comúnmente asociadas con la celebración, y colocar sombras apropiadamente en imágenes que no las mencionan. DALL-E muestra una amplia comprensión de las tendencias visuales y de diseño, y puede producir imágenes para una amplia variedad de descripciones arbitrarias desde diversos puntos de vista con solo fallos raros.

Mark Riedl, profesor asociado en la Escuela de Computación Interactiva de Georgia Tech, descubrió que DALL-E podía combinar conceptos, descrito como un elemento clave de la creatividad humana. Su capacidad de razonamiento visual es suficiente para resolver las Matrices de Raven, pruebas visuales a menudo administradas a humanos para medir la inteligencia.

DALL-E 3 sigue indicaciones complejas con más precisión y detalle que sus predecesores, y puede generar texto más coherente y preciso dentro de las imágenes. Está integrado en ChatGPT Plus, lo que permite a los usuarios generar imágenes a través de indicaciones conversacionales.

Modificación de imágenes

Dada una imagen existente, DALL-E 2 y DALL-E 3 pueden producir variaciones de la imagen como salidas individuales basadas en el original, así como editar la imagen para modificarla o expandirla. Las capacidades de inpainting y outpainting utilizan el contexto de una imagen para rellenar áreas faltantes utilizando un medio consistente con el original, siguiendo una indicación dada.

Por ejemplo, esto se puede usar para insertar un nuevo sujeto en una imagen, o expandir una imagen más allá de sus bordes originales. Según OpenAI, el outpainting tiene en cuenta los elementos visuales existentes de la imagen, incluidas sombras, reflejos y texturas, para mantener la consistencia.

Integración y disponibilidad

DALL-E 3 se lanzó de forma nativa en ChatGPT para clientes de ChatGPT Plus y ChatGPT Enterprise en octubre de 2023. La disponibilidad a través de la API de OpenAI y la plataforma Labs siguió a principios de noviembre de 2023. Microsoft implementó el modelo en la herramienta Image Creator de Bing, con Microsoft Copilot funcionando sobre DALL-E 3, y planeó su integración en su aplicación Designer.

La API opera sobre una base de costo por imagen, con precios que varían según la resolución de la imagen. Se ofrecen descuentos por volumen a empresas que trabajan con el equipo empresarial de OpenAI. En marzo de 2025, DALL-E 3 fue reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image.

Seguridad y procedencia

OpenAI ha abordado preocupaciones de seguridad con los modelos DALL-E, incluidas restricciones sobre contenido dañino y la adición de marcas de agua. En febrero de 2024, OpenAI comenzó a añadir marcas de agua a las imágenes generadas por DALL-E, que contienen metadatos en el estándar C2PA promovido por la Iniciativa de Autenticidad de Contenidos. Esto ayuda a verificar la procedencia de las imágenes generadas por IA.

Legado

DALL-E 3 representa un hito en la IA generativa y la tecnología de texto a imagen, basándose en trabajos anteriores en modelos de aprendizaje profundo y redes neuronales. Su integración con sistemas de modelos de lenguaje grandes como ChatGPT demuestra la convergencia de la generación de lenguaje e imágenes. Las capacidades del modelo han influido en desarrollos posteriores en el campo, incluidos GPT Image y otros sistemas de generación de imágenes.

El lanzamiento de DALL-E 3 en octubre de 2023 marcó un cambio hacia una generación de imágenes por IA más accesible y matizada, con implicaciones para las industrias creativas, la creación de contenido y el arte digital. Su uso en Microsoft Copilot y Bing Image Creator amplió su alcance a una audiencia más amplia.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:openai·text-to-image·generative-ai·deep-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial