InstructGPT é uma família de modelos de linguagem de grande porte desenvolvida pela OpenAI, introduzida pela primeira vez em janeiro de 2022. Esses modelos são projetados para seguir melhor as instruções do usuário e se alinhar com as intenções humanas em comparação com os modelos GPT-3 anteriores. Eles empregam uma técnica de treinamento chamada aprendizado por reforço com feedback humano (RLHF), na qual avaliadores humanos classificam as saídas do modelo, e o modelo é guiado para produzir respostas mais úteis, verdadeiras e menos prejudiciais.
O InstructGPT se baseia na fundação da arquitetura do transformador generativo pré-treinado (GPT), um tipo de modelo transformador que se originou com a introdução da arquitetura de transformador em 2017. O GPT-3 original, lançado pela OpenAI em 2020, era um transformador somente decodificador com 175 bilhões de parâmetros, mas às vezes podia produzir saídas fora da tarefa ou desalinhadas com a intenção do usuário. O InstructGPT visava corrigir esses problemas refinando o modelo com feedback humano.
Treinamento e metodologia
Os modelos InstructGPT foram criados ajustando o GPT-3 com aprendizado supervisionado e, em seguida, aplicando aprendizado por reforço com feedback humano. Avaliadores humanos foram solicitados a comparar respostas geradas por diferentes modelos, e suas preferências foram usadas para treinar um modelo de recompensa. A política (ou seja, o modelo) foi então atualizada para maximizar essa recompensa, incorporando também uma penalidade por desvios da distribuição original do GPT-3, para evitar deriva excessiva.
A OpenAI relatou que os modelos InstructGPT eram significativamente melhores que o GPT-3 em seguir instruções, gerar menos fatos inventados (um fenômeno conhecido como alucinações) e produzir conteúdo um pouco menos tóxico, além de apresentar melhor desempenho em certas tarefas, como resumo e perguntas e respostas.
Capacidades e limitações
O InstructGPT herdou as capacidades centrais do GPT-3, incluindo a capacidade de gerar texto coerente, responder perguntas, traduzir idiomas e escrever código. Ele também podia lidar com prompts de poucos exemplos e de zero exemplos. No entanto, como seus predecessores, ainda podia gerar conteúdo prejudicial ou tendencioso quando solicitado com entradas tóxicas. A OpenAI implementou ferramentas de moderação de conteúdo para desenvolvedores que usam a API, e, a partir de janeiro de 2022, o InstructGPT se tornou o modelo padrão para os clientes da API da OpenAI.
Comparação com predecessores
Em comparação com os modelos GPT-3 originais, o InstructGPT demonstrou melhorias notáveis no alinhamento com a intenção do usuário, como evidenciado por avaliações humanas. Por exemplo, em estudos de aprendizado de máquina, avaliadores julgaram as saídas do InstructGPT como mais favoráveis do que as do GPT-3 em uma variedade de prompts, incluindo a redução de respostas fora do tópico não intencionais. Apesar disso, o InstructGPT manteve limitações comuns a modelos de linguagem de grande porte, como sensibilidade à formulação das frases e erros factuais ocasionais.
O desenvolvimento do InstructGPT reflete tendências mais amplas em inteligência artificial generativa, em que os modelos são treinados para se alinhar mais com os padrões éticos e de segurança humanos. Essa abordagem influenciou modelos subsequentes, como o ChatGPT, que usam uma metodologia de alinhamento semelhante.
Recepção e impacto
O InstructGPT contribuiu para o ecossistema crescente de modelos de IA focados em IA útil e segura. Pesquisadores de outras organizações, como Anthropic e Google DeepMind, também exploraram técnicas de alinhamento semelhantes. O modelo foi um passo em direção a assistentes de IA mais práticos, mas também levantou discussões sobre os riscos de desinformação gerada por IA e a importância da transparência em sistemas de IA. Em 2025, a OpenAI continuou a iterar em técnicas de alinhamento, com base na fundação estabelecida pelo InstructGPT.
Ver também
Links arbitrários podem ser feitos para tópicos relacionados, como aprendizado de máquina, transformador, OpenAI e inteligência artificial generativa.