Generative Pre-trained Transformer 3 (GPT-3) é um modelo de linguagem de grande escala lançado pela OpenAI em 2020 como parte da série GPT da empresa. É um modelo transformador somente com decodificador, baseado em aprendizado profundo, que supera arquiteturas baseadas em recorrência e convolução com um mecanismo de atenção que permite ao modelo focar seletivamente no texto de entrada relevante. O GPT-3 possui 175 bilhões de parâmetros, cada um com precisão de 16 bits, exigindo 350 GB de armazenamento. Ele tem uma janela de contexto de 2.048 tokens e demonstrou fortes habilidades de aprendizado zero-shot e few-shot em muitas tarefas.
Histórico
De acordo com a The Economist, algoritmos aprimorados, computadores mais potentes e material digitalizado crescente impulsionaram uma revolução no aprendizado de máquina. Novas técnicas na década de 2010 levaram a melhorias rápidas em tarefas de manipulação de linguagem. Os modelos de software são treinados usando milhares ou milhões de exemplos em uma estrutura vagamente baseada na arquitetura neural do cérebro. Uma arquitetura-chave é o transformador, introduzido em 2017, que se tornou central para sistemas de processamento de linguagem natural.
Em 11 de junho de 2018, pesquisadores da OpenAI publicaram um artigo introduzindo o primeiro transformador generativo pré-treinado (GPT), um tipo de modelo de linguagem generativo de grande escala pré-treinado em um corpus de texto diversificado, seguido de ajuste fino discriminativo. O GPT-1 foi seguido pelo GPT-2 em fevereiro de 2019, que ampliou os parâmetros e o tamanho do conjunto de dados por um fator de 10, atingindo 1,5 bilhão de parâmetros treinados em 8 milhões de páginas da web. Em fevereiro de 2020, a Microsoft introduziu o Turing Natural Language Generation (T-NLG) com 17 bilhões de parâmetros, então o maior modelo de linguagem publicado.
Treinamento e capacidades
Em 28 de maio de 2020, um preprint no arXiv de 31 engenheiros e pesquisadores da OpenAI descreveu o GPT-3, um modelo de linguagem de terceira geração de última geração. A equipe aumentou a capacidade em mais de duas ordens de magnitude em relação ao GPT-2, tornando o GPT-3 o maior modelo de linguagem não esparso da época. Sua precisão é atribuída ao aumento de capacidade e parâmetros, sendo dez vezes maior que o Turing NLG da Microsoft. A Lambdalabs estimou um custo hipotético de cerca de 4,6 milhões de dólares e 355 anos para treinar em uma única GPU em 2020, com tempo real menor usando GPUs paralelas.
Sessenta por cento do conjunto de dados de pré-treinamento ponderado veio de uma versão filtrada do Common Crawl com 410 bilhões de tokens codificados por pares de bytes, usando deduplicação difusa com o MinHashLSH do Apache Spark. Outras fontes incluíram WebText2 (19 bilhões de tokens, 22%), Books1 (12 bilhões de tokens, 8%), Books2 (55 bilhões de tokens, 8%) e Wikipedia (3 bilhões de tokens, 3%). O GPT-3 foi treinado em centenas de bilhões de palavras e podia codificar em CSS, JSX e Python.
Como os dados de treinamento eram abrangentes, o GPT-3 não requer treinamento adicional para tarefas distintas. No entanto, ocasionalmente gera linguagem tóxica imitando seus dados de treinamento. Um estudo da Universidade de Washington descobriu que o GPT-3 produzia linguagem tóxica comparável ao GPT-2 e ao CTRL. A OpenAI implementou estratégias para limitar a toxicidade, resultando em saída menos tóxica que o GPT-1, mas mais que o CTRL Wiki.
API e acesso
Em 11 de junho de 2020, a OpenAI anunciou que os usuários poderiam solicitar acesso à sua API GPT-3, um conjunto de ferramentas de aprendizado de máquina com uma interface genérica de texto para texto. Um dos primeiros usuários a descreveu como assustadoramente boa em escrever texto coerente com prompts simples. Em um experimento, 80 participantes dos EUA julgaram artigos curtos como escritos por humanos ou GPT-3, acertando apenas 52% das vezes, ligeiramente melhor que o acaso.
Em 22 de setembro de 2020, a Microsoft anunciou que licenciou o GPT-3 exclusivamente. Outros ainda podiam receber saída da API pública, mas apenas a Microsoft tinha acesso ao modelo subjacente. Em 18 de novembro de 2021, a OpenAI anunciou acesso irrestrito à API com uma ferramenta de moderação de conteúdo. Em 27 de janeiro de 2022, a OpenAI tornou o InstructGPT o modelo padrão, que seguia melhor as instruções e gerava menos fatos inventados.
Impacto e preocupações
O GPT-3 pode gerar artigos de notícias que avaliadores humanos têm dificuldade em distinguir dos escritos por humanos, com potencial para aplicações benéficas e prejudiciais. O artigo de maio de 2020 detalhou danos potenciais, incluindo desinformação, spam, phishing e abuso de processos legais e governamentais. O lançamento do modelo impulsionou mais desenvolvimento em IA generativa e influenciou modelos subsequentes da Anthropic e do Google DeepMind. Sua arquitetura e abordagem de treinamento tornaram-se fundamentais para modelos de linguagem de grande escala posteriores, e seu modelo de API influenciou serviços comerciais de IA no Azure e no Amazon Web Services.
Legado
O GPT-3 marcou um ponto de virada na conscientização pública sobre modelos de linguagem de grande escala, demonstrando que aumentar a escala de modelos transformadores poderia gerar capacidades emergentes. Sua escala de 175 bilhões de parâmetros estabeleceu um marco, embora modelos posteriores o superassem. O licenciamento exclusivo para a Microsoft destacou o valor comercial de tais modelos. As habilidades de aprendizado few-shot do GPT-3 reduziram a necessidade de ajuste fino específico para tarefas, influenciando pesquisas em RLHF e seguimento de instruções. Seu lançamento também levantou discussões sobre segurança de IA, viés e o custo ambiental do treinamento de modelos grandes.