Lançamento do OpenAI GPT-3

Traduzido do inglês

GPT-3 é um modelo de linguagem de grande porte lançado pela OpenAI em 2020, com 175 bilhões de parâmetros e forte aprendizado de poucos exemplos, permitindo geração de texto e conclusão de tarefas a partir de prompts mínimos.

Generative Pre-trained Transformer 3 (GPT-3) é um modelo de linguagem de grande escala lançado pela OpenAI em 2020 como parte da série GPT da empresa. É um modelo transformer somente decodificador de rede neural profunda, superando arquiteturas baseadas em recorrência e convolução com um mecanismo de atenção que permite foco seletivo no texto de entrada relevante. O GPT-3 possui 175 bilhões de parâmetros, cada um com precisão de 16 bits, exigindo 350 GB de armazenamento, e uma janela de contexto de 2.048 tokens, demonstrando fortes capacidades de aprendizado zero-shot e few-shot em muitas tarefas.

Histórico

O desenvolvimento do GPT-3 fez parte de uma revolução mais ampla no aprendizado de máquina, impulsionada por algoritmos aprimorados, computadores mais potentes e aumento de dados digitalizados. A arquitetura transformer, introduzida em 2017, tornou-se uma base fundamental para sistemas de processamento de linguagem natural (PLN). Pesquisadores da OpenAI publicaram um artigo em 11 de junho de 2018, introduzindo o primeiro transformer generativo pré-treinado (GPT-1), um tipo de modelo de linguagem generativo de grande escala pré-treinado em um grande corpus de texto e ajustado para tarefas específicas. O GPT-2, lançado em fevereiro de 2019, ampliou o GPT-1 com 1,5 bilhão de parâmetros e foi treinado em 8 milhões de páginas da web. Em fevereiro de 2020, a Microsoft introduziu o Turing Natural Language Generation (T-NLG) com 17 bilhões de parâmetros, que era então o maior modelo de linguagem.

Treinamento e capacidades

Em 28 de maio de 2020, um preprint no arXiv de 31 engenheiros e pesquisadores da OpenAI descreveu o GPT-3, um modelo de linguagem de terceira geração de última geração. A capacidade do GPT-3 foi aumentada em mais de duas ordens de magnitude em relação ao GPT-2, tornando-o o maior modelo de linguagem não esparso da época. Sua precisão é atribuída ao aumento de capacidade e número de parâmetros, sendo dez vezes maior que o Turing NLG da Microsoft. A Lambdalabs estimou um custo hipotético de treinamento de cerca de 4,6 milhões de dólares e 355 anos em uma única GPU, com tempo real menor usando GPUs paralelas.

O conjunto de dados de pré-treinamento compreendia 60% de Common Crawl filtrado (410 bilhões de tokens codificados por pares de bytes), 22% de WebText2 (19 bilhões de tokens), 8% de Books1 (12 bilhões de tokens), 8% de Books2 (55 bilhões de tokens) e 3% de Wikipedia (3 bilhões de tokens). A deduplicação difusa usou o MinHashLSH do Apache Spark. O GPT-3 foi treinado em centenas de bilhões de palavras e podia codificar em CSS, JSX e Python.

Como os dados de treinamento eram abrangentes, o GPT-3 não exigia treinamento adicional para tarefas distintas. No entanto, ocasionalmente gerava linguagem tóxica devido à imitação de seus dados de treinamento. Um estudo da Universidade de Washington descobriu que a toxicidade do GPT-3 era comparável à do GPT-2 e do CTRL. A OpenAI implementou estratégias para limitar a saída tóxica, resultando em menos toxicidade que o GPT-1, mas mais que o CTRL Wiki.

Em 11 de junho de 2020, a OpenAI anunciou acesso à sua API GPT-3, um conjunto de ferramentas de aprendizado de máquina com interface texto-entrada, texto-saída para qualquer tarefa em inglês. Os primeiros usuários acharam "estranhamente bom" na escrita de texto coerente. Em um experimento, 80 sujeitos dos EUA julgaram artigos curtos como escritos por humanos ou pelo GPT-3, identificando corretamente apenas 52% das vezes, ligeiramente melhor que o acaso. Em 18 de novembro de 2021, a OpenAI tornou o acesso à API irrestrito com ferramentas de moderação de conteúdo. Em 27 de janeiro de 2022, os modelos InstructGPT tornaram-se o padrão, produzindo conteúdo mais alinhado com menos fatos inventados e menos toxicidade.

A capacidade do GPT-3 de gerar artigos de notícias indistinguíveis dos escritos por humanos tem potencial para aplicações benéficas e prejudiciais, incluindo desinformação, spam, phishing e abuso de processos legais, conforme detalhado no artigo de 28 de maio de 2020.

Licenciamento comercial

Em 22 de setembro de 2020, a Microsoft anunciou que havia licenciado o GPT-3 exclusivamente. Embora outros ainda pudessem usar a API pública, apenas a Microsoft tinha acesso ao modelo subjacente. Este licenciamento exclusivo fez parte da parceria mais ampla da Microsoft com a OpenAI, que incluiu investimentos e integração nos serviços do Azure.

Impacto e legado

O GPT-3 influenciou significativamente o campo da inteligência artificial, demonstrando o poder de escalar modelos transformer. Suas capacidades de aprendizado few-shot reduziram a necessidade de ajuste fino específico de tarefas, inspirando modelos subsequentes como InstructGPT e posteriormente GPT-4. O lançamento também gerou discussões sobre as implicações éticas de grandes modelos de linguagem, incluindo viés, desinformação e controle de acesso.

A arquitetura e abordagem de treinamento do GPT-3 tornaram-se um padrão de referência para modelos de linguagem subsequentes, incluindo os da Anthropic e Google DeepMind. Seu sucesso comercial através da API e do licenciamento da Microsoft estabeleceu um modelo de negócios para pesquisa em IA, influenciando o cenário mais amplo de IA generativa.

Detalhes técnicos

O GPT-3 usa uma arquitetura transformer com atenção multi-cabeça e codificação posicional. Ele emprega um design somente decodificador, ao contrário de modelos codificador-decodificador, e usa técnicas como normalização de camada e redes residuais. O treinamento envolveu descida de gradiente com otimizadores como Adam e agendamentos de taxa de aprendizado. Os parâmetros do modelo são armazenados com precisão de 16 bits, reduzindo os requisitos de memória.

A janela de contexto de 2.048 tokens do GPT-3 limita o comprimento da entrada que ele pode processar, mas pode gerar texto coerente ao longo de vários parágrafos. Seu aprendizado few-shot é alcançado por meio de prompting, onde exemplos são fornecidos na entrada, sem atualizar os pesos do modelo. Essa capacidade foi uma inovação chave, permitindo ampla aplicabilidade sem ajuste fino.

Recepção e preocupações

O GPT-3 recebeu atenção generalizada por sua impressionante geração de texto, mas também levantou preocupações sobre uso indevido potencial. Pesquisadores destacaram riscos como geração de notícias falsas, spam e conteúdo de phishing. O acesso inicial restrito da OpenAI e as ferramentas posteriores de moderação de conteúdo visavam mitigar esses riscos. A tendência do modelo de produzir linguagem tóxica, apesar das melhorias, permaneceu uma preocupação, levando a pesquisas contínuas em segurança e alinhamento de IA.

O licenciamento exclusivo para a Microsoft foi controverso, pois limitou o acesso ao modelo subjacente para outros pesquisadores e empresas. No entanto, a API pública permitiu experimentação mais ampla, contribuindo para o rápido avanço das aplicações de modelos de linguagem.

O lançamento do GPT-3 marcou um marco na inteligência artificial, demonstrando o potencial de modelos transformer em grande escala e moldando o futuro do aprendizado de máquina e do aprendizado profundo. Sua influência é vista em modelos subsequentes e no campo crescente de IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:artificial-intelligence·machine-learning·language-model·openai
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico