Traducido del inglés

Parti es un modelo autorregresivo de texto a imagen desarrollado por Google que genera imágenes de alta fidelidad a partir de descripciones textuales. Utiliza un enfoque de secuencia a secuencia basado en transformadores para producir imágenes como secuencias de tokens visuales.

Parti es un modelo autorregresivo de texto a imagen desarrollado por Google DeepMind. Genera imágenes a partir de descripciones textuales al tratar la generación de imágenes como un problema de secuencia a secuencia, de manera similar a como los grandes modelos de lenguaje generan texto. Parti fue presentado en 2022 y es notable por su capacidad para producir imágenes de alta fidelidad y fotorrealistas a partir de indicaciones complejas, incluyendo escenas con múltiples objetos y atributos específicos.

El modelo opera convirtiendo primero una indicación de texto de entrada en una secuencia de tokens mediante un codificador, y luego prediciendo autorregresivamente una secuencia de tokens de imagen. Estos tokens de imagen se derivan de un codebook visual discreto, que se aprende por separado. Este enfoque permite que Parti escale de manera efectiva con el tamaño del modelo y los datos de entrenamiento, lo que conduce a mejoras en la calidad de la imagen y la alineación semántica.

Arquitectura

La arquitectura de Parti se basa en el modelo Transformer. Utiliza una estructura de codificador-decodificador donde el codificador procesa la indicación de texto y el decodificador genera la secuencia de tokens de imagen. Los tokens visuales se obtienen de un modelo Vision Transformer (ViT) preentrenado, que actúa como tokenizador. El decodificador se entrena para predecir el siguiente token de imagen dado el texto y los tokens generados previamente, un proceso análogo al modelado de secuencias en aprendizaje automático.

El modelo se entrenó en varios tamaños, que van desde 350 millones hasta 20 mil millones de parámetros. La variante más grande, Parti-20B, demostró un rendimiento de última generación en puntos de referencia como MS-COCO y Localized Narratives, logrando puntuaciones FID (Fréchet Inception Distance) altas, que miden la similitud entre las distribuciones de imágenes generadas y reales.

Entrenamiento y Datos

Parti se entrenó en un gran conjunto de datos de pares de imagen-texto, que incluía datos web públicos y conjuntos de datos propietarios. El proceso de entrenamiento implicó dos etapas: primero, aprender el codebook visual utilizando un tokenizador basado en ViT, y segundo, entrenar el transformer autorregresivo para predecir tokens de imagen a partir de texto. El modelo se optimizó utilizando una pérdida de entropía cruzada estándar sobre los tokens de imagen discretos.

Google informó que escalar el tamaño del modelo y los datos de entrenamiento condujo a mejoras consistentes en la calidad de la imagen, particularmente para indicaciones complejas que requieren razonamiento compositivo. El modelo también mostró una capacidad para manejar indicaciones con múltiples objetos, relaciones espaciales y atributos estilísticos.

Capacidades y Limitaciones

Parti sobresale en la generación de imágenes con alta fidelidad y precisión semántica. Puede producir imágenes a partir de indicaciones que describen escenas específicas, como "una foto de un gato con sombrero" o "una pintura de una ciudad futurista al atardecer". El modelo también admite el renderizado de texto, que es una tarea desafiante para muchos modelos de generación de imágenes. Sin embargo, Parti tiene limitaciones, incluidos errores ocasionales en detalles finos, como recuentos incorrectos de objetos o desajustes menores de atributos. También requiere recursos computacionales sustanciales para el entrenamiento y la inferencia.

Comparación con Otros Modelos

Parti se desarrolló simultáneamente con otros modelos de texto a imagen como DALL-E 2 e Imagen. Mientras que Imagen utiliza un enfoque basado en difusión, Parti es autorregresivo, lo que le permite aprovechar los avances en el modelado de secuencias. En las evaluaciones, Parti-20B logró resultados competitivos o superiores en puntos de referencia como MS-COCO en comparación con DALL-E 2 e Imagen, particularmente en términos de puntuaciones FID y evaluaciones humanas. Sin embargo, se señaló que los modelos de difusión como Imagen tenían un rendimiento fuerte en ciertas cualidades estéticas, mientras que Parti sobresalía en la alineación semántica y el razonamiento complejo.

Impacto y Legado

Parti contribuyó al rápido avance de la IA generativa en la síntesis de imágenes. Su enfoque autorregresivo influyó en la investigación posterior en modelos multimodales unificados, donde el texto y las imágenes se procesan en un espacio de tokens compartido. El codebook y las ideas de escalado de Parti se incorporaron posteriormente en otros modelos de Google, como la familia Gemini, que integra la generación de texto, imagen y audio. El modelo también destacó la importancia de las leyes de escalado en tareas de visión-lenguaje, alineándose con los hallazgos en la investigación de aprendizaje profundo.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:text-to-image·google-deepmind·autoregressive-model·generative-ai
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial