Traducido del inglés

Imagen es una serie de modelos de texto a imagen desarrollados por Google DeepMind, conocidos por generar imágenes de alta fidelidad a partir de indicaciones en lenguaje natural. Evolucionó a partir de la investigación de Google Brain y está integrado en servicios de Google como Gemini y Vertex AI.

Imagen es una serie de modelos de texto a imagen desarrollados por Google DeepMind, diseñados para generar imágenes de alta fidelidad a partir de indicaciones de texto en lenguaje natural. Los modelos utilizan una combinación de comprensión del lenguaje basada en transformadores y generación de imágenes mediante modelo de difusión, posicionándose entre las herramientas destacadas de IA generativa como DALL-E y Stable Diffusion. Imagen es accesible a través de varios servicios de Google, incluidos Gemini y Vertex AI, y ha experimentado varias versiones principales desde su introducción.

El modelo original de Imagen se presentó por primera vez en un artículo de investigación publicado en mayo de 2022, desarrollado por el equipo de Google Brain antes de su fusión con DeepMind en abril de 2023. Las versiones posteriores, Imagen 2 e Imagen 3, se lanzaron en diciembre de 2023 y agosto de 2024, respectivamente, con cada iteración mejorando la calidad de imagen, el renderizado de texto y el control del usuario. En mayo de 2025, Google anunció Imagen 4 en su conferencia anual Google I/O, avanzando aún más en las capacidades del modelo.

Tecnología

La arquitectura de Imagen se basa en dos tecnologías clave: un modelo de lenguaje grande (LLM) congelado para la codificación de texto y un modelo de difusión en cascada para la generación de imágenes. El codificador de texto, basado en la familia de transformadores T5, convierte las indicaciones de entrada en incrustaciones semánticas que guían el proceso de síntesis de imágenes. El modelo de difusión opera luego en una serie de etapas, comenzando con una imagen de baja resolución (64×64 píxeles) y aumentando progresivamente su resolución, alcanzando finalmente 1024×1024 píxeles en las versiones anteriores. Imagen 4 extiende esta capacidad para generar imágenes de hasta 2K de resolución, mejorando el detalle y la fidelidad visual.

El diseño en cascada permite al modelo refinar las imágenes de forma incremental, mejorando la coherencia y la alineación con la indicación de texto. Este enfoque contrasta con los modelos de una sola etapa, permitiendo un entrenamiento más eficiente y salidas de mayor calidad. El uso de un LLM congelado también aprovecha los avances en el procesamiento del lenguaje natural, lo que permite a Imagen comprender indicaciones complejas, incluidos conceptos abstractos e instrucciones estilísticas.

Capacidades

Imagen destaca en la generación de imágenes fotorrealistas a partir de descripciones de texto, pero también admite una amplia gama de estilos artísticos, incluidos estética cinematográfica, película de 35 mm, ilustración y surrealista. Esta versatilidad lo hace adecuado para aplicaciones creativas, como arte digital, publicidad y diseño conceptual. El modelo puede generar imágenes en múltiples relaciones de aspecto, incluidas 9:16, 3:4, 1:1, 4:3 y 16:9, adaptándose a diversos formatos de visualización y casos de uso.

Más allá de la generación inicial, Imagen ofrece capacidades de edición, permitiendo a los usuarios refinar imágenes existentes proporcionando nuevas indicaciones de texto. Esta característica habilita flujos de trabajo creativos iterativos, donde los usuarios pueden ajustar la composición, el estilo o elementos específicos sin regenerar toda la imagen. Sin embargo, como otros modelos de texto a imagen, Imagen tiene limitaciones, incluida la dificultad para renderizar con precisión dedos humanos, texto, ambigramas y otra tipografía compleja. Estos desafíos son comunes en el campo y son áreas de investigación en curso.

Véase también

Referencias

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·text-to-image·google-deepmind·diffusion-models
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial