Traducido del inglés

Una serie de modelos de generación de texto a imagen desarrollados por OpenAI entre 2021 y 2023 que ayudaron a llevar las imágenes generadas por IA al uso público generalizado.

DALL-E es una serie de modelos de generación de texto a imagen desarrollados por OpenAI, nombrados como un acrónimo del artista Salvador Dalí y el personaje robot WALL-E de Pixar. El DALL-E original se anunció en enero de 2021 como un modelo transformador de 12 mil millones de parámetros, basado en la misma familia de arquitectura que GPT-3, entrenado para generar imágenes a partir de descripciones de texto al tratar la generación de imágenes como un problema de predicción de secuencias sobre tokens de imagen discretos, en lugar de utilizar las técnicas de difusión que más tarde dominarían el campo.

Evolución a través de las versiones

DALL-E 2, lanzado en abril de 2022, reemplazó el enfoque original de tokens discretos con una arquitectura basada en difusión guiada por CLIP, el modelo conjunto de incrustación de imagen y texto de OpenAI, produciendo imágenes de resolución sustancialmente mayor y más fotorrealistas, e introduciendo una función de "inpainting" para editar partes de imágenes existentes a partir de una descripción de texto. La versión beta pública de DALL-E 2, seguida de su disponibilidad general más tarde en 2022, atrajo una atención significativa de los medios convencionales y se le atribuye ampliamente, junto con lanzamientos contemporáneos como Midjourney y Stable Diffusion, el haber llevado las imágenes generadas por IA al conocimiento público general por primera vez. DALL-E 3, lanzado en 2023 e integrado directamente en ChatGPT para suscriptores, mejoró la adherencia a las indicaciones y el renderizado de texto dentro de las imágenes, y utilizó el propio ChatGPT para expandir y refinar las indicaciones cortas de los usuarios antes de pasarlas al modelo de imágenes.

Recepción e impacto

Los lanzamientos de DALL-E provocaron un debate público sustancial sobre el futuro del trabajo creativo visual, generando tanto entusiasmo entre los usuarios que experimentaban con arte y diseño asistidos por IA como preocupación entre ilustradores y fotógrafos profesionales sobre el desplazamiento laboral y el uso de imágenes con derechos de autor en los datos de entrenamiento sin consentimiento, una disputa que alimentó un litigio más amplio sobre derechos de autor de IA en toda la industria de la IA generativa. El sistema también atrajo escrutinio por su potencial para generar desinformación e imágenes no consentidas, lo que llevó a OpenAI a implementar filtros de contenido y, durante un período, restricciones sobre la generación de rostros reconocibles de figuras públicas.

Legado

A DALL-E se le atribuye generalmente, junto con trabajos académicos anteriores sobre GANs y competidores abiertos posteriores, el haber establecido la generación de texto a imagen como una tecnología comercial y de consumo generalizada en lugar de una curiosidad de investigación. Su éxito contribuyó directamente a la estrategia multimodal más amplia de OpenAI, informando las capacidades de comprensión y generación de imágenes que luego se integraron en GPT-4 y modelos posteriores, y ayudó a popularizar la escritura de indicaciones como una habilidad relevante para los sistemas de IA generativa visual, no solo textual.

Categorías:generative-ai·image-generation·openai
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial