Traduzido do inglês

Parti-20B é um modelo autorregressivo de texto para imagem com 20 bilhões de parâmetros, desenvolvido pelo Google, que gera imagens de alta fidelidade a partir de descrições textuais usando uma arquitetura de transformador sequência a sequência.

Parti-20B é um modelo de 20 bilhões de parâmetros para geração de texto para imagem, baseado em IA, desenvolvido pelo Google Research. Ele pertence à família Parti, que trata a geração de imagens como um problema de sequência para sequência, onde um transformador codificador processa texto e um decodificador prediz tokens visuais. Parti-20B é a maior variante da série, projetada para produzir imagens altamente detalhadas e semanticamente alinhadas a partir de prompts complexos.

O modelo baseia-se no conceito de aprendizado sequência a sequência, utilizando uma arquitetura de rede neural que mapeia a entrada textual para uma grade de tokens de imagem. Diferente de abordagens baseadas em difusão, Parti-20B usa um decodificador autorregressivo, gerando patches de imagem sequencialmente. Esse design permite que ele escale efetivamente com o tamanho do modelo, melhorando a fidelidade e a compreensão composicional.

Arquitetura e Treinamento

Parti-20B emprega um transformer de codificador-decodificador, onde o codificador processa o prompt de texto usando atenção multi-cabeça e codificação posicional. O decodificador então prediz uma sequência de tokens visuais discretos, que são mapeados para pixels via um codebook aprendido. O treinamento envolve um grande conjunto de dados de pares imagem-texto, com otimização usando otimizador Adam e um agendamento de taxa de aprendizado. O modelo usa normalização de camadas e Dropout para estabilidade, e recorte de gradiente para lidar com o treinamento em larga escala.

O processo de geração autorregressiva depende de busca em feixe ou estratégias de amostragem como amostragem top-k e amostragem top-p, com escala de temperatura para controlar a diversidade. A escala do Parti-20B permite capturar detalhes finos, como texturas e relações espaciais, que modelos menores perdem.

Capacidades e Desempenho

Parti-20B se destaca em seguir prompts complexos, incluindo aqueles com múltiplos objetos, atributos e restrições espaciais. Ele pode gerar imagens fotorrealistas, estilos artísticos e composições inovadoras. Comparado a modelos anteriores, mostra melhorias significativas na generalização de zero-shot, ou seja, consegue lidar com prompts não vistos sem ajuste fino. O modelo também suporta aumento de dados durante o treinamento para aumentar a robustez.

Em avaliações de referência, Parti-20B alcançou resultados de última geração em tarefas de texto para imagem, superando muitos modelos contemporâneos em termos de FID (Distância de Fréchet Inception) e pontuações de preferência humana. Seus 20 bilhões de parâmetros permitem representar uma gama mais ampla de conceitos visuais, embora exija recursos computacionais substanciais para inferência.

Relação com Outros Modelos

Parti-20B faz parte de uma tendência mais ampla em IA generativa, ao lado de modelos como DALL-E e Stable Diffusion. Ele difere dos modelos de difusão por usar uma abordagem autorregressiva, que alguns pesquisadores argumentam fornecer melhor controlabilidade. O modelo está relacionado a técnicas de modelos de linguagem de larga escala, pois compartilha a espinha dorsal do transformer e objetivos de treinamento adaptados para imagens. Também se conecta à pesquisa em aprendizado de máquina sobre leis de escala, onde modelos maiores consistentemente melhoram o desempenho.

O Google não lançou o Parti-20B publicamente, limitando o acesso a pesquisas internas e parceiros selecionados. Isso contrasta com esforços de código aberto, mas está alinhado com a estratégia da empresa de desenvolver sistemas de IA proprietários. A arquitetura do modelo influenciou trabalhos subsequentes em geração de texto para imagem, incluindo melhorias na tokenização e eficiência de decodificação.

Limitações e Considerações Éticas

Como muitos modelos de texto para imagem, Parti-20B pode produzir saídas tendenciosas ou prejudiciais se treinado em dados da internet não filtrados. Ele também pode ter dificuldades com conceitos raros ou prompts ambíguos, às vezes gerando resultados sem sentido. O custo computacional de executar um modelo de 20 bilhões de parâmetros é alto, exigindo hardware especializado como TPUs ou GPUs do Google Cloud, o que limita a acessibilidade.

Pesquisadores destacaram a necessidade de medidas de segurança, como filtragem de prompts e moderação de saída. O desenvolvimento do Parti-20B também levanta questões sobre direitos autorais e o potencial de uso indevido na criação de imagens enganosas. Até 2023, essas preocupações permanecem ativas na comunidade de IA, gerando pedidos por implantação responsável.

Legado e Impacto

Parti-20B demonstrou que escalar modelos autorregressivos para dezenas de bilhões de parâmetros é viável para geração de imagens, abrindo caminho para modelos posteriores como Imagen e Gemini. Seu sucesso reforçou a importância do tamanho do modelo em aprendizado profundo e inspirou mais pesquisas sobre transformers eficientes. Embora não esteja disponível publicamente, suas contribuições técnicas foram documentadas em artigos de pesquisa, influenciando esforços acadêmicos e industriais.

A abordagem do modelo de tratar imagens como sequências também foi aplicada a outros domínios, como geração de vídeo e síntese de cenas 3D. Parti-20B permanece um ponto de referência para entender as trocas entre modelos generativos autorregressivos e baseados em difusão, e suas descobertas continuam informando o design de sistemas de próxima geração.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·text-to-image·transformer·google-deepmind
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico