OpenAI o1 é um modelo de raciocínio desenvolvido pela OpenAI e lançado em versão preliminar em setembro de 2024, com lançamento completo em dezembro de 2024. Ele representou uma mudança em relação à linha anterior do GPT-4 ao introduzir uma abordagem de treinamento e inferência explicitamente otimizada para tarefas de raciocínio em múltiplas etapas, como matemática competitiva, programação e resolução de problemas científicos, em vez de buscar apenas maior escala de propósito geral.
Cadeia de pensamento estendida
A principal inovação técnica do o1, conforme descrito pela OpenAI, foi treinar o modelo para gerar uma cadeia de pensamento interna estendida antes de produzir uma resposta final, usando aprendizado por reforço para melhorar a qualidade desse processo de raciocínio intermediário. Diferentemente de técnicas anteriores de prompt que eliciavam raciocínio em cadeia de pensamento por meio de instruções fornecidas pelo usuário, o o1 foi treinado para realizar esse raciocínio automaticamente e para alocar mais computação a problemas mais difíceis, uma abordagem que ficou conhecida como escalonamento de computação em tempo de teste: em vez de apenas aumentar o tamanho do modelo ou dos dados de treinamento, a capacidade poderia ser melhorada permitindo que o modelo "pensasse" por mais tempo na inferência. A OpenAI ocultou deliberadamente os traços brutos de raciocínio interno do modelo dos usuários, mostrando apenas uma versão resumida, citando tanto preocupações competitivas sobre a técnica ser copiada quanto preocupações de segurança sobre a cadeia de pensamento bruta conter conteúdo não filtrado ou manipulativo.
Desempenho e benchmarks
A OpenAI relatou ganhos substanciais do o1 em relação aos modelos da classe GPT-4 em avaliações focadas em raciocínio, incluindo grandes melhorias em problemas de matemática competitiva e no benchmark de engenharia de software SWE-bench, além de forte desempenho em questões científicas de nível de doutorado. Os ganhos do modelo foram mais pronunciados em tarefas que exigiam lógica verificável em múltiplas etapas, enquanto as melhorias em tarefas mais abertas ou de recuperação de conhecimento foram comparativamente modestas, um padrão que reforçou a distinção crescente no campo entre capacidade bruta de conhecimento e capacidade de raciocínio.
Impacto na indústria
O lançamento do o1 provocou respostas rápidas em toda a indústria, com laboratórios concorrentes, incluindo a DeepSeek, lançando seus próprios modelos focados em raciocínio, mais notavelmente o DeepSeek-R1 em janeiro de 2025, que alcançou desempenho comparável em benchmarks de raciocínio com custo de treinamento relatado dramaticamente menor e, ao contrário do o1, publicou seus traços completos de cadeia de pensamento e pesos abertos. Esse contraste intensificou o debate sobre o valor da decisão da OpenAI de ocultar seus traços de raciocínio e contribuiu para uma discussão mais ampla sobre a concorrência de pesos abertos na IA de fronteira. O o1 estabeleceu o escalonamento de computação em tempo de teste como um paradigma distinto e duradouro ao lado do escalonamento de pré-treinamento, com a OpenAI e concorrentes lançando posteriormente novas iterações de modelos de raciocínio construídos sobre a mesma abordagem subjacente.