Traduzido do inglês

GPT-3.5 é um modelo de linguagem de grande porte desenvolvido pela OpenAI, lançado em 2022 como uma versão aprimorada do GPT-3, e usado como base para o serviço inicial do ChatGPT. Ele melhorou as capacidades de seguir instruções e de conversação.

GPT-3.5 é um modelo de linguagem de grande porte desenvolvido pela OpenAI, lançado em 2022 como um sucessor refinado do GPT-3. É uma arquitetura transformadora apenas com decodificador, baseada nos mesmos princípios de aprendizado profundo de seu predecessor, mas com melhorias no seguimento de instruções, precisão factual e coerência conversacional. O GPT-3.5 serviu como motor para a primeira versão pública do ChatGPT, lançada em novembro de 2022, e tornou-se um dos sistemas de IA generativa mais amplamente utilizados de sua época.

O modelo fazia parte da série GPT da OpenAI, que começou com o GPT-1 em 2018 e continuou com o GPT-2 em 2019 e o GPT-3 em 2020. O GPT-3.5 representou um passo intermediário entre o GPT-3 e o posterior GPT-4, incorporando técnicas da pesquisa InstructGPT da OpenAI para melhor alinhar as saídas com a intenção do usuário. Diferentemente do GPT-3, que frequentemente exigia engenharia cuidadosa de prompts, o GPT-3.5 foi projetado para responder de forma mais natural a instruções diretas, tornando-o adequado para aplicações interativas como chatbots.

Desenvolvimento e Lançamento

A OpenAI introduziu o GPT-3.5 por meio de uma série de versões do modelo no início de 2022, com a primeira disponibilidade pública da API em março de 2022. O nome "GPT-3.5" foi usado para denotar uma família de modelos que incluía code-davinci-002 e text-davinci-003, cada um otimizado para diferentes tarefas. O lançamento mais notável foi a interface ChatGPT, que foi lançada em 30 de novembro de 2022, usando um modelo GPT-3.5 ajustado para diálogo. Este lançamento marcou um ponto de virada na conscientização pública sobre inteligência artificial, pois o ChatGPT alcançou mais de 100 milhões de usuários em dois meses.

O desenvolvimento do GPT-3.5 baseou-se na mesma infraestrutura de treinamento do GPT-3, que tinha 175 bilhões de parâmetros e exigia 350GB de armazenamento em precisão de 16 bits. Embora o número exato de parâmetros do GPT-3.5 não tenha sido divulgado publicamente, era amplamente entendido que era semelhante em escala, com melhorias focadas na curadoria de dados de treinamento, ajuste fino e alinhamento, em vez de tamanho bruto. A OpenAI usou uma combinação de ajuste fino supervisionado e aprendizado por reforço a partir de feedback humano para melhorar o comportamento do modelo, uma técnica detalhada pela primeira vez em seu artigo InstructGPT publicado no início de 2022.

Capacidades e Desempenho

O GPT-3.5 demonstrou fortes capacidades em geração de texto, sumarização, tradução, resposta a perguntas e escrita de código. Ele podia lidar com uma janela de contexto de até 4.096 tokens em algumas versões, o dobro dos 2.048 tokens do GPT-3, permitindo processar entradas mais longas. O modelo destacou-se no aprendizado com poucos exemplos, onde podia realizar novas tarefas com apenas alguns exemplos no prompt, e mostrou melhorias marcantes no seguimento de instruções com zero exemplos em comparação ao GPT-3.

Em benchmarks, o GPT-3.5 superou o GPT-3 em várias tarefas de compreensão e geração de linguagem natural, incluindo o conjunto SuperGLUE e vários desafios de codificação. Ele também era capaz de gerar conversas coerentes de múltiplos turnos, uma característica que o tornava especialmente adequado para aplicações de chatbot. No entanto, ainda apresentava limitações, incluindo erros factuais ocasionais, sensibilidade à formulação de prompts e uma tendência a produzir informações plausíveis, mas incorretas, questões que a OpenAI reconheceu e trabalhou para mitigar em versões posteriores.

Aplicações e Impacto

O lançamento do ChatGPT baseado no GPT-3.5 teve um impacto profundo na indústria de tecnologia e no discurso público em torno do aprendizado de máquina. Ele estimulou uma onda de investimentos em startups de IA generativa e levou grandes empresas como Google DeepMind, Anthropic e outras a acelerarem seus próprios esforços em modelos de linguagem de grande porte. O GPT-3.5 foi integrado a uma ampla gama de produtos, incluindo o Azure OpenAI Service da Microsoft, que oferecia o modelo a clientes empresariais por meio de infraestrutura em nuvem.

Além de chatbots, o GPT-3.5 foi usado para geração de conteúdo, assistência de código, ferramentas educacionais e automação de suporte ao cliente. Sua capacidade de gerar texto semelhante ao humano levantou tanto oportunidades quanto preocupações, levando a discussões sobre desinformação, deslocamento de empregos e uso ético da IA. A OpenAI implementou ferramentas de moderação de conteúdo e políticas de uso para abordar alguns desses riscos, mas a ampla disponibilidade do modelo também gerou pedidos de regulamentação e transparência no desenvolvimento de IA.

Arquitetura Técnica

O GPT-3.5 manteve a arquitetura central do GPT-3, que é uma rede neural baseada em transformadores com uma pilha de decodificadores de múltiplas camadas. Ele usa mecanismos de atenção de múltiplas cabeças para ponderar a relevância de diferentes palavras na entrada, permitindo capturar dependências de longo alcance no texto. O modelo foi pré-treinado em um corpus diversificado de texto da internet, incluindo dados filtrados do Common Crawl, livros e Wikipedia, usando um objetivo de previsão do próximo token. O ajuste fino para seguimento de instruções envolveu treinamento adicional em demonstrações e comparações escritas por humanos, um processo que alinhou as saídas do modelo com as expectativas dos usuários.

Uma melhoria técnica notável no GPT-3.5 foi o uso de filtragem e deduplicação mais refinadas dos dados de treinamento, o que reduziu a presença de texto de baixa qualidade ou repetitivo. Isso contribuiu para saídas mais coerentes e menos tendenciosas em comparação ao GPT-3. O modelo também se beneficiou de avanços em técnicas de agendamento de taxa de aprendizado e recorte de gradiente, embora detalhes específicos de treinamento não tenham sido totalmente divulgados pela OpenAI.

Legado e Sucessores

O GPT-3.5 serviu como uma ponte entre o GPT-3 orientado à pesquisa e o mais avançado GPT-4, que a OpenAI lançou em março de 2023. Embora o GPT-4 oferecesse melhorias significativas em raciocínio e precisão, o GPT-3.5 permaneceu em uso para muitas aplicações devido ao seu menor custo computacional e tempos de resposta mais rápidos. A OpenAI continuou atualizando os modelos GPT-3.5, com versões como gpt-3.5-turbo tornando-se uma escolha popular para desenvolvedores que buscavam um equilíbrio entre desempenho e eficiência.

O sucesso do GPT-3.5 também influenciou o ecossistema mais amplo de IA, incentivando pesquisas sobre alinhamento de modelos, segurança e interpretabilidade. Ele destacou o potencial dos modelos de linguagem de grande porte para realizar uma ampla variedade de tarefas sem treinamento específico para cada tarefa, um conceito que havia sido explorado em modelos anteriores, mas que foi tornado prático em escala. Em 2024, o GPT-3.5 ainda estava disponível através da API da OpenAI, embora estivesse gradualmente sendo substituído por modelos mais novos em muitos casos de uso.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·openai·generative-ai·natural-language-processing
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico