Parti é um modelo autoregressivo de texto para imagem desenvolvido pela Google DeepMind. Ele gera imagens a partir de descrições textuais ao tratar a geração de imagens como um problema de sequência para sequência, de forma semelhante a como modelos de linguagem de grande escala geram texto. O Parti foi introduzido em 2022 e é notável por sua capacidade de produzir imagens de alta fidelidade e fotorrealistas a partir de prompts complexos, incluindo cenas com múltiplos objetos e atributos específicos.
O modelo opera primeiro convertendo um prompt de texto de entrada em uma sequência de tokens usando um codificador e, em seguida, prevendo autoregressivamente uma sequência de tokens de imagem. Esses tokens de imagem são derivados de um codebook visual discreto, que é aprendido separadamente. Essa abordagem permite que o Parti escale efetivamente com o tamanho do modelo e os dados de treinamento, levando a melhorias na qualidade da imagem e no alinhamento semântico.
Arquitetura
A arquitetura do Parti é baseada no modelo Transformer. Ele usa uma estrutura de codificador-decodificador, onde o codificador processa o prompt de texto e o decodificador gera a sequência de tokens de imagem. Os tokens visuais são obtidos de um modelo Vision Transformer (ViT) pré-treinado, que atua como um tokenizador. O decodificador é treinado para prever o próximo token de imagem dado o texto e os tokens gerados anteriormente, um processo análogo à modelagem de sequências em aprendizado de máquina.
O modelo foi treinado em vários tamanhos, variando de 350 milhões a 20 bilhões de parâmetros. A maior variante, Parti-20B, demonstrou desempenho de última geração em benchmarks como MS-COCO e Localized Narratives, alcançando altas pontuações de FID (Fréchet Inception Distance), que medem a similaridade entre as distribuições de imagens geradas e reais.
Treinamento e Dados
O Parti foi treinado em um grande conjunto de dados de pares de imagem-texto, que incluía dados da web publicamente disponíveis e conjuntos de dados proprietários. O processo de treinamento envolveu duas etapas: primeiro, aprender o codebook visual usando um tokenizador baseado em ViT e, segundo, treinar o transformer autoregressivo para prever tokens de imagem a partir do texto. O modelo foi otimizado usando uma perda padrão de entropia cruzada sobre os tokens de imagem discretos.
A Google relatou que escalar o tamanho do modelo e os dados de treinamento levou a melhorias consistentes na qualidade da imagem, particularmente para prompts complexos que exigem raciocínio composicional. O modelo também mostrou capacidade de lidar com prompts com múltiplos objetos, relações espaciais e atributos estilísticos.
Capacidades e Limitações
O Parti se destaca na geração de imagens com alta fidelidade e precisão semântica. Ele pode produzir imagens a partir de prompts que descrevem cenas específicas, como "uma foto de um gato usando um chapéu" ou "uma pintura de uma cidade futurista ao pôr do sol". O modelo também suporta renderização de texto, que é uma tarefa desafiadora para muitos modelos de geração de imagens. No entanto, o Parti tem limitações, incluindo erros ocasionais em detalhes finos, como contagens incorretas de objetos ou pequenas incompatibilidades de atributos. Ele também requer recursos computacionais substanciais para treinamento e inferência.
Comparação com Outros Modelos
O Parti foi desenvolvido simultaneamente com outros modelos de texto para imagem, como DALL-E 2 e Imagen. Enquanto o Imagen usa uma abordagem baseada em difusão, o Parti é autoregressivo, o que permite aproveitar os avanços na modelagem de sequências. Em avaliações, o Parti-20B alcançou resultados competitivos ou superiores em benchmarks como MS-COCO em comparação com DALL-E 2 e Imagen, particularmente em termos de pontuações FID e avaliações humanas. No entanto, modelos de difusão como o Imagen foram notados por seu forte desempenho em certas qualidades estéticas, enquanto o Parti se destacou no alinhamento semântico e no raciocínio complexo.
Impacto e Legado
O Parti contribuiu para o rápido avanço da IA generativa na síntese de imagens. Sua abordagem autoregressiva influenciou pesquisas subsequentes em modelos multimodais unificados, onde texto e imagens são processados em um espaço de tokens compartilhado. O codebook e os insights de escalabilidade do Parti foram posteriormente incorporados em outros modelos da Google, como a família Gemini, que integra geração de texto, imagem e áudio. O modelo também destacou a importância das leis de escalabilidade em tarefas de visão-linguagem, alinhando-se com descobertas na pesquisa de aprendizado profundo.