Traduzido do inglês

Gato 1.2B é uma rede neural baseada em transformadores com 1,2 bilhão de parâmetros, desenvolvida pela Google DeepMind para tarefas multimodais envolvendo texto, imagens e controle.

Gato 1.2B é um modelo de rede neural desenvolvido pela Google DeepMind com 1,2 bilhão de parâmetros. É um Transformer (architecture)-baseado em modelo de linguagem projetado para lidar com uma ampla gama de tarefas, incluindo geração de texto, legendagem de imagens e controle robótico, usando um único conjunto de pesos. O modelo foi introduzido em 2022 como parte do esforço da DeepMind para criar um agente de propósito geral capaz de aprender e agir em diversos ambientes.

A arquitetura do Gato 1.2B segue o design Encoder-Decoder Architecture, embora opere principalmente como um modelo sequência-a-sequência. Ele processa entradas como sequências de tokens, onde texto, imagens e ações são convertidos em tokens discretos. Essa representação unificada permite que o modelo alterne entre modalidades sem modificações específicas de tarefa. O modelo emprega mecanismos de atenção de múltiplas cabeças e codificações posicionais para lidar com entradas de comprimento variável.

Treinamento e Dados

O Gato 1.2B foi treinado em um conjunto de dados diversificado, compreendendo texto de livros e páginas da web, imagens de conjuntos de dados públicos e dados de demonstração de ambientes robóticos simulados e do mundo real. O treinamento usou uma função de perda de entropia cruzada para tokens de texto e imagem e uma perda separada para tokens de ação. O modelo foi otimizado com o otimizador Adam e um agendamento de taxa de aprendizado que incluía aquecimento e decaimento de cosseno. O treinamento foi realizado em TPUs do Google Cloud, com um orçamento computacional total de aproximadamente 1,1e21 FLOPs.

Capacidades e Desempenho

O Gato 1.2B demonstra proficiência em mais de 600 tarefas, incluindo jogar jogos de Atari, gerar legendas, responder perguntas e controlar um braço robótico. Em avaliações, alcançou uma pontuação mediana de 50% no conjunto de jogos de Atari, superando modelos generalistas anteriores, mas ainda abaixo de agentes especialistas. Para controle robótico, o modelo foi testado em tarefas do mundo real, como empilhar blocos e colocar objetos, alcançando taxas de sucesso comparáveis às políticas especialistas em alguns casos. A capacidade do modelo de generalizar entre tarefas é atribuída ao seu pré-treinamento em larga escala e ao vocabulário de tokens compartilhado.

Comparação com Outros Modelos

O Gato 1.2B é frequentemente comparado a outros modelos generalistas, como o GPT-3 da OpenAI e o Claude da Anthropic, mas difere em seu foco em tarefas multimodais e incorporadas. Ao contrário de modelos de linguagem puros, o Gato integra dados visuais e de ação, tornando-o um passo em direção à inteligência artificial geral. Sua contagem de parâmetros é menor do que muitos modelos contemporâneos, como os 175 bilhões de parâmetros do GPT-3, mas alcança desempenho competitivo em uma gama mais restrita de tarefas devido ao seu treinamento especializado.

Limitações e Direções Futuras

Apesar de sua versatilidade, o Gato 1.2B tem limitações. Ele enfrenta dificuldades em tarefas de longo horizonte e requer tokenização cuidadosa de imagens e ações. Seu desempenho degrada em tarefas fora de sua distribuição de treinamento. Pesquisadores da DeepMind exploraram a ampliação do modelo e a incorporação de dados mais diversos para melhorar a generalização. O modelo também levanta questões sobre segurança e controle, pois pode ser usado para aplicações benéficas e prejudiciais. Trabalhos futuros incluem a integração de aprendizado por reforço a partir de feedback humano e aprendizado curricular para aprimorar suas capacidades.

Recepção e Impacto

O Gato 1.2B foi bem recebido na comunidade de aprendizado de máquina por seu objetivo ambicioso de um único agente para múltiplos domínios. Ele gerou discussões sobre o caminho para a IA de propósito geral e a importância do treinamento multimodal. O código e os pesos do modelo não foram totalmente disponibilizados como código aberto, mas sua arquitetura e detalhes de treinamento foram publicados em um relatório técnico. Ele influenciou pesquisas subsequentes sobre agentes generalistas, incluindo modelos posteriores da DeepMind, como RT-2 e SIMA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:neural-network·transformer·multimodal-ai·deepmind
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico