Calcul à l'inférence

Traduit de l'anglais

Le calcul qu'un modèle consacre à la génération d'une réponse, par opposition à celui utilisé pendant l'entraînement ; l'augmenter en laissant un modèle raisonner plus longtemps au moment de l'inférence est devenu un moteur majeur des gains de capacités à partir de 2024.

La puissance de calcul au moment de l'inférence désigne la quantité de calcul qu'un modèle effectue pour produire une réponse, par opposition au calcul dépensé pendant l'entraînement. Pendant la majeure partie de l'ère de l'apprentissage profond, les gains de capacité provenaient presque entièrement de l'augmentation de l'entraînement : plus de paramètres, plus de données, plus de calcul d'entraînement, comme décrit par lois de mise à l'échelle. La puissance de calcul au moment de l'inférence traite l'inférence elle-même comme un second levier. Un modèle peut être amené à réfléchir plus longtemps, à explorer davantage de réponses candidates, ou à vérifier son propre travail avant de renvoyer une réponse, et chacune de ces actions coûte un calcul supplémentaire au moment de l'utilisation plutôt qu'au moment de l'entraînement.

Cette approche est entrée dans l'usage courant avec OpenAI o1, publié par OpenAI en septembre 2024. Contrairement aux chatbots précédents, optimisés pour répondre rapidement en un seul passage, o1 a été entraîné à générer une chaîne de raisonnement interne étendue et largement cachée avant de produire une réponse finale, et sa précision sur les références en mathématiques, en codage et en logique s'est améliorée de manière mesurable à mesure que davantage de jetons de raisonnement étaient autorisés. Cela a établi le modèle de raisonnement comme une catégorie distincte de grand modèle de langage, et des concurrents, notamment DeepSeek-R1 et les variantes « Thinking » de Google Gemini, ont suivi dans l'année.

Mécanismes

La puissance de calcul au moment de l'inférence peut être utilisée de plusieurs manières. La plus simple est la génération plus longue d'un raisonnement en chaîne : le modèle écrit des étapes de raisonnement intermédiaires sous forme de jetons textuels avant de s'engager dans une réponse, et autoriser plus de jetons améliore généralement la performance sur les tâches ayant une réponse claire et correcte, comme l'arithmétique ou la correction de code. Une deuxième famille de techniques échantillonne plusieurs réponses indépendantes et sélectionne la meilleure, soit par vote majoritaire (auto-cohérence), soit en notant les candidats avec un vérificateur ou un modèle de récompense séparé, parfois organisé comme une recherche en arbre sur des solutions partielles. Une troisième approche consiste à réviser : le modèle produit un brouillon, le critique, puis le régénère, dépensant des passes supplémentaires pour détecter les erreurs plutôt que de s'engager dans la première sortie.

Ces méthodes diffèrent des techniques de apprentissage contextuel et de sollicitation qui les ont précédées principalement par qui contrôle le calcul supplémentaire. Les techniques de sollicitation comme les exemples de apprentissage en quelques essais demandent au modèle d'utiliser plus efficacement ses poids existants ; les méthodes de puissance de calcul au moment de l'inférence, en particulier dans les modèles entraînés avec un apprentissage par renforcement sur des récompenses vérifiables, laissent le modèle décider lui-même combien de délibération interne un problème donné nécessite, en principe dépensant peu de calcul sur les questions faciles et beaucoup plus sur les questions difficiles.

Économie et compromis

Étant donné que les modèles de raisonnement peuvent consommer plusieurs fois plus de jetons par réponse qu'un modèle de chat standard, la puissance de calcul au moment de l'inférence réintroduit un compromis entre coût et latence que la mise à l'échelle du pré-entraînement avait largement écarté : les laboratoires et les utilisateurs peuvent désormais acheter directement de la précision, au moment de l'inférence, en payant pour plus de réflexion. Cela a des conséquences pratiques pour la conception de produits, car un agent de codage ou un assistant de recherche construit sur un modèle de raisonnement peut prendre des dizaines de secondes ou des minutes pour répondre à une requête difficile, et la tarification API de ces modèles reflète généralement à la fois la longueur de sortie et une prime par jeton.

Réception et questions ouvertes

Les chercheurs ont débattu de la manière dont la puissance de calcul au moment de l'inférence se rapporte à un véritable raisonnement par rapport à une forme plus coûteuse de correspondance de motifs, et les résultats sur des références telles que ARC-AGI ont été utilisés des deux côtés de cet argument : les modèles de raisonnement ont amélioré considérablement les scores par rapport aux générations précédentes, mais la performance se dégrade toujours sur les problèmes nécessitant des schémas de raisonnement mal représentés dans les données d'entraînement. Certains laboratoires décrivent la mise à l'échelle de la puissance de calcul au moment de l'inférence comme un nouvel axe comparable en importance aux lois de mise à l'échelle originales, avec l'attente que des gains supplémentaires proviendront d'une recherche et d'une vérification plus efficaces plutôt que de chaînes de pensée purement plus longues. D'autres notent que les gains provenant d'un calcul d'inférence supplémentaire montrent des rendements décroissants au-delà d'un certain point, et que la technique est mieux comprise comme un complément, plutôt qu'un remplaçant, de la mise à l'échelle du pré-entraînement et du réglage fin. D'ici 2025, la puissance de calcul au moment de l'inférence était également devenue centrale dans les revendications concurrentielles concernant les délais pour l'Artificial general intelligence, car les gains de précision spécifiques aux problèmes provenant de « réfléchir plus longtemps » donnaient aux laboratoires un nouveau levier de capacité facilement commercialisable, distinct des dénombrements de paramètres en tête d'affiche.

Catégories:reasoning·inference·scaling
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique