Lançamento do GPT-3

Traduzido do inglês

GPT-3 é um modelo de linguagem de grande porte lançado pela OpenAI em 2020, com 175 bilhões de parâmetros e capacidades avançadas de aprendizado de poucos exemplos, o que impactou significativamente o campo da inteligência artificial.

GPT-3, abreviação de Generative Pre-trained Transformer 3, é um modelo de linguagem de grande escala lançado pela OpenAI em 2020 como parte da série GPT da empresa. É um modelo transformer somente decodificador que usa um mecanismo de atenção para focar em partes relevantes do texto de entrada, superando arquiteturas baseadas em recorrência e convolução. Com 175 bilhões de parâmetros, o GPT-3 era o maior modelo de linguagem não esparso em seu lançamento, exigindo 350GB de armazenamento devido à precisão de 16 bits por parâmetro. Ele possui uma janela de contexto de 2.048 tokens e demonstrou fortes capacidades de aprendizado zero-shot e few-shot em muitas tarefas.

O lançamento do GPT-3 marcou um marco na IA generativa, mostrando o potencial de escalar redes neurais baseadas em transformers. Suas capacidades influenciaram desenvolvimentos subsequentes em modelos de linguagem de grande escala e geraram discussões sobre os benefícios e riscos de tais sistemas.

Histórico

O desenvolvimento do GPT-3 teve raízes nos avanços do aprendizado de máquina durante a década de 2010, impulsionados por algoritmos aprimorados, computadores mais potentes e maior quantidade de dados digitalizados. A arquitetura transformer, introduzida em 2017, tornou-se uma base fundamental para o processamento de linguagem natural. O primeiro transformer pré-treinado generativo da OpenAI (GPT-1) foi lançado em junho de 2018, seguido pelo GPT-2 em fevereiro de 2019, que escalou os parâmetros e o tamanho do conjunto de dados por um fator de 10, alcançando 1,5 bilhão de parâmetros. Em fevereiro de 2020, a Microsoft introduziu o Turing Natural Language Generation (T-NLG) com 17 bilhões de parâmetros, que era então o maior modelo de linguagem.

Treinamento e Capacidades

Em 28 de maio de 2020, um preprint no arXiv por 31 pesquisadores da OpenAI descreveu o GPT-3, que aumentou a capacidade em mais de duas ordens de magnitude em comparação ao GPT-2. O conjunto de dados de treinamento compreendia 60% de Common Crawl filtrado (410 bilhões de tokens), 22% de WebText2, 8% de Books1, 8% de Books2 e 3% de Wikipedia. O GPT-3 foi treinado em centenas de bilhões de palavras e também podia codificar em linguagens como CSS, JSX e Python. A Lambda Labs estimou um custo de treinamento de cerca de 4,6 milhões de dólares e 355 anos em uma única GPU, embora a paralelização tenha reduzido o tempo real.

Os dados de treinamento abrangentes do GPT-3 significavam que ele não exigia ajuste fino para tarefas distintas, mas podia gerar linguagem tóxica devido a vieses nos dados. Um estudo da Universidade de Washington descobriu que sua toxicidade era comparável à do GPT-2 e do CTRL. A OpenAI implementou salvaguardas e, em novembro de 2021, o acesso à API tornou-se irrestrito. Em janeiro de 2022, os modelos InstructGPT tornaram-se o padrão, mais alinhados com as intenções dos usuários e produzindo conteúdo menos tóxico.

Impacto e Recepção

A capacidade do GPT-3 de gerar texto coerente que os humanos não conseguiam distinguir facilmente de conteúdo escrito por humanos levantou tanto oportunidades quanto preocupações. Em um experimento, 80 participantes dos EUA julgaram artigos curtos corretamente apenas 52% das vezes, próximo do aleatório. O potencial do modelo para desinformação, spam e phishing foi observado no artigo original. O GPT-3 também influenciou o campo mais amplo da inteligência artificial, levando a mais pesquisas em modelos de linguagem de grande escala e IA generativa.

Comercialização e Licenciamento

Em 22 de setembro de 2020, a Microsoft anunciou uma licença exclusiva para o GPT-3, concedendo acesso ao modelo subjacente enquanto outros ainda podiam usar a API pública. Esse acordo destacou o valor comercial de modelos avançados de IA e estabeleceu um precedente para futuras parcerias na indústria. O acordo de licenciamento fez parte do investimento mais amplo da Microsoft na OpenAI e de sua integração em produtos como o Azure.

Legado

O lançamento do GPT-3 acelerou o progresso no processamento de linguagem natural e inspirou modelos subsequentes de várias organizações, incluindo Anthropic e Google DeepMind. Sua arquitetura e abordagem de treinamento tornaram-se referências para desenvolvimentos posteriores, como o InstructGPT e outros sucessores. O modelo também estimulou discussões sobre ética em IA, segurança e a necessidade de moderação de conteúdo, moldando a trajetória da pesquisa em aprendizado de máquina.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·openai·artificial-intelligence·2020-events
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico