O artigo do GPT-1, intitulado "Improving Language Understanding by Generative Pre-Training," foi publicado por pesquisadores da OpenAI em 11 de junho de 2018. Ele introduziu o primeiro transformador pré-treinado generativo, um modelo que combinava a arquitetura Transformer (architecture) com uma abordagem de treinamento em duas etapas: pré-treinamento não supervisionado em um grande corpus de texto, seguido de ajuste fino supervisionado em tarefas específicas. Este trabalho demonstrou que um único modelo poderia alcançar desempenho forte em vários benchmarks de processamento de linguagem natural, desafiando a dependência predominante de arquiteturas específicas de tarefa e dados rotulados.
Histórico
Durante a década de 2010, avanços em aprendizado de máquina e a disponibilidade de conjuntos de dados em grande escala possibilitaram um boom de IA. O paradigma dominante no processamento de linguagem natural (PLN) envolvia treinar modelos em grandes quantidades de dados rotulados manualmente para cada tarefa específica, o que era caro e demorado. Em 2017, pesquisadores do Google introduziram a arquitetura transformer no artigo "Attention Is All You Need", que dependia de um mecanismo de autoatenção para processar sequências em paralelo, superando as limitações das redes neurais recorrentes (RNNs) que processavam tokens sequencialmente. Essa arquitetura tornou-se a base para trabalhos subsequentes em aprendizado profundo e PLN.
Desenvolvimento
O modelo GPT-1 era um transformer somente decodificador com 117 milhões de parâmetros, treinado no BookCorpus, um conjunto de dados contendo mais de 7.000 livros não publicados de vários gêneros. O objetivo do pré-treinamento era a modelagem de linguagem padrão: prever o próximo token em uma sequência. Após essa fase não supervisionada, o modelo era ajustado em tarefas individuais usando aprendizado supervisionado, com transformações de entrada específicas de tarefa para adaptar o modelo a diferentes formatos. O artigo mostrou que essa abordagem alcançava resultados de ponta em nove das doze tarefas estudadas, incluindo raciocínio de senso comum, resposta a perguntas e implicação textual, muitas vezes superando modelos treinados do zero em dados rotulados.
Impacto
O sucesso do GPT-1 estabeleceu o paradigma de IA generativa de pré-treinamento e ajuste fino, que se tornou o modelo para sistemas subsequentes. Ele levou diretamente ao desenvolvimento do GPT-2 em fevereiro de 2019, que escalou o modelo para 1,5 bilhão de parâmetros e demonstrou a capacidade de gerar texto coerente. Isso foi seguido pelo GPT-3 em maio de 2020, com 175 bilhões de parâmetros, que introduziu o aprendizado de poucos exemplos, permitindo que o modelo executasse tarefas com apenas alguns exemplos no prompt. A linhagem continuou com o InstructGPT, que usou aprendizado por reforço com feedback humano (RLHF) para alinhar saídas com intenções do usuário, e eventualmente o ChatGPT, lançado em novembro de 2022, que trouxe esses modelos para um público amplo.
Legado
O artigo do GPT-1 é amplamente reconhecido como uma contribuição fundamental para o campo dos grandes modelos de linguagem. Ele demonstrou que o pré-treinamento generativo em texto diversificado poderia capturar conhecimento linguístico geral e ser efetivamente transferido para tarefas downstream. Essa abordagem influenciou não apenas os modelos posteriores da OpenAI, mas também o desenvolvimento de sistemas concorrentes, como o Gemini do Google e o Llama da Meta, bem como esforços de código aberto como o DeepSeek. O artigo também destacou o potencial dos transformers para tarefas generativas, abrindo caminho para modelos multimodais que processam e geram texto, imagens e áudio, e para melhorias de eficiência, como mecanismos de atenção esparsa que reduzem custos computacionais para sequências mais longas.