Un modèle de raisonnement est un grand modèle de langage entraîné, généralement avec apprentissage par renforcement, à générer une séquence interne étendue d'étapes de raisonnement avant de produire une réponse finale, plutôt que de répondre immédiatement comme le faisaient les modèles des générations précédentes. Cette catégorie se distingue du raisonnement en chaîne ordinaire, qui demande à un modèle conventionnellement entraîné de raisonner étape par étape via des instructions dans le prompt, car un modèle de raisonnement est spécifiquement entraîné à produire et améliorer son propre processus de raisonnement, et génère souvent beaucoup plus de texte intermédiaire qu'un modèle sollicité par un prompt.
Origines
OpenAI a introduit le premier modèle de raisonnement largement connu, OpenAI o1, en septembre 2024, le décrivant comme entraîné à « penser » avant de répondre, en utilisant l'apprentissage par renforcement sur des problèmes à réponses vérifiables, tels que les mathématiques et la programmation, où une réponse finale correcte peut être vérifiée automatiquement. OpenAI a largement caché la chaîne de raisonnement interne d'o1 aux utilisateurs, ne montrant qu'une version résumée, une décision que l'entreprise a justifiée comme visant à préserver la capacité du modèle à raisonner librement, y compris en explorant des chemins incorrects, sans que ce raisonnement non poli soit pris pour une réponse finale et approuvée. Cette approche a produit des gains de précision substantiels sur des benchmarks exigeant un raisonnement en plusieurs étapes, notamment les mathématiques de compétition et les tâches de codage telles que SWE-bench.
DeepSeek-R1 et modèles de raisonnement ouverts
En janvier 2025, le laboratoire chinois DeepSeek a publié DeepSeek-R1, un modèle de raisonnement à poids ouverts entraîné avec un apprentissage par renforcement à grande échelle, qui a égalé ou approché les performances des modèles de raisonnement d'OpenAI sur plusieurs benchmarks à une fraction du coût d'entraînement rapporté, et, contrairement à o1, a exposé sa chaîne de raisonnement complète aux utilisateurs. Cette publication a déclenché ce qu'on a appelé le choc de marché DeepSeek, provoquant une vente massive d'actions d'infrastructures d'IA et une réévaluation plus large des hypothèses sur la puissance de calcul nécessaire pour entraîner un modèle de raisonnement de niveau avancé. DeepSeek a également publié des versions distillées plus petites de R1, rendant le comportement de type raisonnement disponible dans des modèles assez économiques pour fonctionner sur du matériel modeste.
Calcul au moment du test
Le compromis définitoire des modèles de raisonnement est qu'ils peuvent convertir un calcul supplémentaire au moment du test, c'est-à-dire plus de calcul dépensé au moment de répondre plutôt que pendant l'entraînement, en une précision accrue sur des problèmes difficiles. Cela diffère de la relation d'échelle traditionnelle décrite par les lois d'échelle, qui se concentraient sur la taille du modèle, les données d'entraînement et le calcul d'entraînement ; les modèles de raisonnement ont ajouté un axe supplémentaire le long duquel la capacité pouvait être améliorée sans entraîner un nouveau modèle plus grand. Des chercheurs, dont Noam Brown, qui a travaillé sur des systèmes de raisonnement et de jeu stratégique avant de rejoindre l'effort sur les modèles de raisonnement d'OpenAI, ont présenté cela comme analogue à la façon dont un expert humain à qui l'on donne plus de temps pour réfléchir produit de meilleures réponses que celui contraint de répondre instantanément.
Évaluation et limites
Les modèles de raisonnement performent particulièrement bien sur des tâches à réponses objectivement vérifiables, ce qui a orienté leur évaluation vers des benchmarks comme ARC-AGI et les mathématiques de compétition plutôt que vers des tâches d'écriture ou de conversation plus subjectives, où le bénéfice d'un raisonnement étendu est moins constant et où le temps d'inférence et le coût supplémentaires sont plus difficiles à justifier. Les modèles de raisonnement restent également soumis au même risque d'Hallucination (AI) que les autres modèles de langage, car un raisonnement plus long ne garantit pas une réponse finale factuellement correcte, et ils peuvent parfois produire des traces de raisonnement qui semblent rigoureuses tout en intégrant une étape incorrecte.