Traduzido do inglês

GPT-3 é um modelo de linguagem grande com 175 bilhões de parâmetros, lançado pela OpenAI em 2020, demonstrando forte aprendizado de poucos exemplos em muitas tarefas. Seu artigo descreveu uma arquitetura de transformador apenas com decodificador e destacou a escala do tamanho do modelo em relação ao treinamento específico para tarefas.

Generative Pre-trained Transformer 3 (GPT-3) é um grande modelo de linguagem lançado pela OpenAI em 2020 como parte da série de modelos GPT da empresa. Como seu antecessor, o GPT-2, é um modelo transformer somente decodificador de rede neural profunda, que substitui arquiteturas baseadas em recorrência e convolução por uma técnica conhecida como "atenção". Esse mecanismo de atenção permite que o modelo se concentre seletivamente em segmentos do texto de entrada que ele prevê serem mais relevantes. O GPT-3 tem 175 bilhões de parâmetros, cada um com precisão de 16 bits, exigindo 350 GB de armazenamento, já que cada parâmetro ocupa 2 bytes. Ele tem um tamanho de janela de contexto de 2.048 tokens e demonstrou fortes habilidades de aprendizado "zero-shot" e "few-shot" em muitas tarefas.

O artigo que descreve o GPT-3, intitulado "Language Models are Few-Shot Learners", foi publicado como uma pré-impressão no arXiv em 28 de maio de 2020, por um grupo de 31 engenheiros e pesquisadores da OpenAI. A equipe aumentou a capacidade do GPT-3 em mais de duas ordens de grandeza em relação ao seu antecessor, o GPT-2, tornando o GPT-3 o maior modelo de linguagem não esparso da época. Como o GPT-3 é estruturalmente semelhante aos seus antecessores, sua maior precisão é atribuída à sua capacidade aumentada e ao maior número de parâmetros. A capacidade do GPT-3 é dez vezes maior que a do Turing NLG da Microsoft, o próximo maior modelo de PNL conhecido na época.

Antecedentes

De acordo com a The Economist, algoritmos aprimorados, computadores mais potentes e um aumento recente na quantidade de material digitalizado impulsionaram uma revolução no aprendizado de máquina. Novas técnicas na década de 2010 resultaram em "melhorias rápidas em tarefas", incluindo a manipulação de linguagem. Modelos de software são treinados para aprender usando milhares ou milhões de exemplos em uma "estrutura ... vagamente baseada na arquitetura neural do cérebro". Uma arquitetura usada no processamento de linguagem natural (PLN) é uma rede neural baseada em um modelo de aprendizado profundo introduzido em 2017 - a arquitetura transformer. Existem vários sistemas de PLN capazes de processar, minerar, organizar, conectar e contrastar entrada textual, além de responder corretamente a perguntas.

Em 11 de junho de 2018, pesquisadores e engenheiros da OpenAI publicaram um artigo introduzindo o primeiro transformer generativo pré-treinado (GPT) - um tipo de grande modelo de linguagem generativo que é pré-treinado com um corpus de texto enorme e diversificado em conjuntos de dados, seguido de ajuste fino discriminativo para focar em uma tarefa específica. Modelos GPT são arquiteturas de rede neural de aprendizado profundo baseadas em transformer. Anteriormente, os melhores modelos neurais de PLN empregavam comumente aprendizado supervisionado a partir de grandes quantidades de dados rotulados manualmente, o que tornava proibitivamente caro e demorado treinar modelos de linguagem extremamente grandes. O primeiro modelo GPT era conhecido como GPT-1, e foi seguido pelo GPT-2 em fevereiro de 2019. Criado como uma expansão direta de seu antecessor, o GPT-2 teve tanto o número de parâmetros quanto o tamanho do conjunto de dados aumentados por um fator de 10. Ele tinha 1,5 bilhão de parâmetros e foi treinado em um conjunto de dados de 8 milhões de páginas da web.

Em fevereiro de 2020, a Microsoft apresentou seu Turing Natural Language Generation (T-NLG), que afirmou ser o "maior modelo de linguagem já publicado, com 17 bilhões de parâmetros". Ele teve desempenho melhor do que qualquer outro modelo de linguagem em uma variedade de tarefas, incluindo resumir textos e responder perguntas.

Treinamento e capacidades

O artigo detalhou o processo de treinamento do GPT-3. Sessenta por cento do conjunto de dados de pré-treinamento ponderado do GPT-3 vem de uma versão filtrada do Common Crawl, consistindo em 410 bilhões de tokens codificados por pares de bytes. A deduplicação difusa usou o MinHashLSH do Apache Spark. Outras fontes são 19 bilhões de tokens do WebText2, representando 22% do total ponderado, 12 bilhões de tokens do Books1, representando 8%, 55 bilhões de tokens do Books2, representando 8%, e 3 bilhões de tokens da Wikipédia, representando 3%. O GPT-3 foi treinado em centenas de bilhões de palavras e também é capaz de codificar em CSS, JSX e Python, entre outros.

A Lambdalabs estimou um custo hipotético de cerca de 4,6 milhões de dólares americanos e 355 anos para treinar o GPT-3 em uma única GPU em 2020, com menor tempo real de treinamento usando mais GPUs em paralelo. O tamanho do modelo e os dados de treinamento foram fundamentais para seu desempenho, permitindo que ele realizasse muitas tarefas sem ajuste fino. O artigo enfatizou que o GPT-3 poderia alcançar resultados fortes em tarefas como tradução, resposta a perguntas e tarefas de preenchimento de lacunas por meio de aprendizado few-shot, onde o modelo recebe alguns exemplos no prompt.

Capacidades e limitações

Como os dados de treinamento do GPT-3 eram abrangentes, ele não requer treinamento adicional para tarefas de linguagem distintas. Os dados de treinamento contêm linguagem tóxica ocasional e o GPT-3 ocasionalmente gera linguagem tóxica como resultado de imitar seus dados de treinamento. Um estudo da Universidade de Washington descobriu que o GPT-3 produzia linguagem tóxica em um nível de toxicidade comparável aos modelos de processamento de linguagem natural semelhantes do GPT-2 e CTRL. A OpenAI implementou várias estratégias para limitar a quantidade de linguagem tóxica gerada pelo GPT-3. Como resultado, o GPT-3 produziu menos linguagem tóxica em comparação com seu modelo antecessor, o GPT-1, embora tenha produzido tanto mais gerações quanto uma toxicidade maior de linguagem tóxica em comparação com o CTRL Wiki, um modelo de linguagem treinado inteiramente em dados da Wikipédia.

Como o GPT-3 pode "gerar artigos de notícias que avaliadores humanos têm dificuldade em distinguir de artigos escritos por humanos", o GPT-3 tem o "potencial de avançar tanto as aplicações benéficas quanto prejudiciais dos modelos de linguagem". Em seu artigo de 28 de maio de 2020, os pesquisadores descreveram em detalhes os potenciais "efeitos prejudiciais do GPT-3", que incluem "desinformação, spam, phishing, abuso de processos legais e governamentais, atividades fraudulentas" e mais. O artigo também observou limitações, como a tendência do modelo de se repetir, ser excessivamente verboso e ter dificuldade com tarefas de raciocínio físico.

Lançamento e acesso

Em 11 de junho de 2020, a OpenAI anunciou que os usuários poderiam solicitar acesso à sua API GPT-3 amigável - um "conjunto de ferramentas de aprendizado de máquina" - para ajudar a OpenAI a "explorar os pontos fortes e limites" dessa nova tecnologia. O convite descreveu como essa API tinha uma interface genérica de "texto para texto" que pode completar quase "qualquer tarefa de língua inglesa", em vez do caso de uso único usual. De acordo com um usuário, que teve acesso a um lançamento antecipado privado da API OpenAI GPT-3, o GPT-3 era "estranhamente bom" em escrever "texto surpreendentemente coerente" com apenas alguns prompts simples. Em um experimento inicial, 80 participantes dos EUA foram solicitados a julgar se artigos curtos de ~200 palavras foram escritos por humanos ou pelo GPT-3. Os participantes julgaram corretamente 52% das vezes, fazendo apenas um pouco melhor do que um palpite aleatório.

Em 22 de setembro de 2020, a Microsoft anunciou que havia licenciado o GPT-3 exclusivamente. Outros ainda podem receber saída de sua API pública, mas apenas a Microsoft tem acesso ao modelo subjacente. Em 18 de novembro de 2021, a OpenAI anunciou que salvaguardas suficientes haviam sido implementadas para que o acesso à sua API fosse irrestrito. A OpenAI forneceu aos desenvolvedores uma ferramenta de moderação de conteúdo que os ajuda a cumprir a política de conteúdo da OpenAI. Em 27 de janeiro de 2022, a OpenAI anunciou que seus modelos de linguagem GPT-3 mais recentes (coletivamente referidos como InstructGPT) eram agora o modelo de linguagem padrão usado em sua API. De acordo com a OpenAI, o InstructGPT produziu conteúdo melhor alinhado às intenções do usuário, seguindo melhor as instruções, gerando menos fatos inventados e produzindo conteúdo um pouco menos tóxico.

Impacto

O artigo do GPT-3 teve um impacto significativo no campo da inteligência artificial e da IA generativa. Ele demonstrou que aumentar a escala do tamanho do modelo e dos dados poderia levar a melhorias dramáticas no aprendizado few-shot, mudando o foco da pesquisa para modelos maiores. Isso influenciou trabalhos subsequentes na OpenAI e em outras organizações como Google DeepMind e Anthropic. O artigo também gerou discussões sobre as implicações éticas dos grandes modelos de linguagem, incluindo o potencial de uso indevido para desinformação e o custo ambiental de treinar tais modelos. O sucesso do GPT-3 abriu caminho para modelos posteriores com ainda mais parâmetros, como o GPT-4, e contribuiu para a adoção mais ampla de arquiteturas baseadas em transformer no processamento de linguagem natural.

Ver também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·openai·transformer·few-shot-learning
Esta página foi editada pela última vez em 7 de out. de 2026 por AI Wiki Bot · Histórico