OpenAI o1 est un modèle de raisonnement développé par OpenAI et publié sous forme d'aperçu en septembre 2024, avec une version complète en décembre 2024. Il représentait une rupture par rapport à la ligne précédente des GPT-4 en introduisant une approche d'entraînement et d'inférence explicitement optimisée pour les tâches de raisonnement multi-étapes, telles que les mathématiques de compétition, le codage et la résolution de problèmes scientifiques, plutôt que de poursuivre uniquement une échelle à usage général.
Chaîne de pensée étendue
L'innovation technique centrale d'o1, telle que décrite par OpenAI, consistait à entraîner le modèle à générer une chaîne de pensée interne étendue avant de produire une réponse finale, en utilisant le apprentissage par renforcement pour améliorer la qualité de ce processus de raisonnement intermédiaire. Contrairement aux techniques de prompt antérieures qui suscitaient un raisonnement en chaîne de pensée via des instructions fournies par l'utilisateur, o1 était entraîné à effectuer ce raisonnement automatiquement et à allouer plus de calcul aux problèmes plus difficiles, une approche connue sous le nom de calcul au moment du test : plutôt que d'augmenter uniquement la taille du modèle ou des données d'entraînement, la capacité pouvait être améliorée en laissant le modèle « penser » plus longtemps lors de l'inférence. OpenAI a délibérément caché les traces brutes de raisonnement interne du modèle aux utilisateurs, ne montrant qu'une version résumée, invoquant à la fois des préoccupations concurrentielles concernant la copie de la technique et des préoccupations de sécurité concernant le contenu non filtré ou manipulateur de la chaîne de pensée brute.
Performance et benchmarks
OpenAI a rapporté des gains substantiels pour o1 par rapport aux modèles de classe GPT-4 sur les évaluations axées sur le raisonnement, y compris de grandes améliorations sur les problèmes de mathématiques de compétition et le benchmark d'ingénierie logicielle SWE-bench, ainsi que de bonnes performances sur les questions scientifiques de niveau doctorat. Les gains du modèle étaient les plus prononcés sur les tâches nécessitant une logique multi-étapes étendue et vérifiable, tandis que les améliorations sur les tâches plus ouvertes ou de rappel de connaissances étaient comparativement modestes, un schéma qui renforçait la distinction croissante dans le domaine entre la capacité de connaissances brutes et la capacité de raisonnement.
Impact sur l'industrie
La sortie d'o1 a suscité des réponses rapides dans toute l'industrie, avec des laboratoires concurrents, y compris DeepSeek, publiant leurs propres modèles axés sur le raisonnement, notamment DeepSeek-R1 en janvier 2025, qui a atteint des performances de benchmark de raisonnement comparables à un coût d'entraînement rapporté nettement inférieur et, contrairement à o1, a publié ses traces complètes de chaîne de pensée et ses poids ouverts. Ce contraste a intensifié le débat sur la valeur de la décision d'OpenAI de cacher ses traces de raisonnement et a contribué à une discussion plus large sur la concurrence poids ouverts dans l'IA de pointe. o1 a établi le calcul au moment du test comme un paradigme distinct et durable aux côtés de l'échelle de pré-entraînement, avec OpenAI et ses concurrents publiant ensuite d'autres itérations de modèles de raisonnement construites sur la même approche sous-jacente.