Traduit de l'anglais

L'inférence est le processus d'exécution d'un modèle d'IA entraîné sur de nouvelles entrées pour produire une sortie, distinct de l'entraînement, et son coût, sa latence et ses exigences matérielles façonnent la manière dont les produits d'IA sont déployés à grande échelle.

L'inférence, en intelligence artificielle, est le processus d'exécution d'un modèle entraîné sur de nouvelles entrées pour produire une sortie, par opposition à l'entraînement, la phase antérieure au cours de laquelle les paramètres du modèle sont appris à partir de données. Un grand modèle de langage répondant à la question d'un utilisateur, un classificateur d'images étiquetant une photo, et un modèle de diffusion générant une image à partir d'une invite textuelle effectuent tous de l'inférence. Une fois l'entraînement terminé et les poids du modèle fixés, chaque utilisation ultérieure de ce modèle constitue un appel d'inférence.

Coût et matériel

L'inférence a des exigences computationnelles différentes de celles de l'entraînement. Entraîner un grand modèle nécessite de traiter des ensembles de données énormes sur de nombreuses passes et est généralement exécuté sur de grands clusters de GPU ou de TPU sur des semaines ou des mois. L'inférence, quant à elle, s'exécute en continu, servant souvent des millions de demandes individuelles, et sa structure de coûts dépend davantage de la latence, le temps pour produire une réponse unique, et du débit, le nombre de demandes qu'un système peut servir par unité de matériel, que du calcul total consommé par une tâche unique. Parce que les modèles de langage génèrent du texte un jeton à la fois, chaque nouveau jeton dépendant de tous les précédents, l'inférence pour les modèles autorégressifs est comparativement lente et limitée par la mémoire plutôt que par le calcul, ce qui a motivé une vague d'ingénierie spécialisée de l'inférence, distincte de la recherche axée sur l'entraînement. Nvidia et d'autres fabricants de puces ont publié du matériel spécifiquement optimisé pour les charges de travail d'inférence, et les fournisseurs de cloud facturent différemment la capacité d'inférence et celle d'entraînement.

Techniques d'optimisation

Parce que le coût de l'inférence évolue directement avec l'utilisation, il constitue une cible majeure d'optimisation. La quantification réduit la précision numérique des poids d'un modèle, diminuant l'utilisation de la mémoire et souvent accélérant le calcul avec un compromis modeste sur la précision. La distillation des connaissances entraîne un modèle plus petit à imiter un plus grand, produisant un modèle moins coûteux à exécuter à l'inférence. Le décodage spéculatif utilise un petit modèle de brouillon rapide pour proposer plusieurs jetons à la fois, qu'un modèle plus grand vérifie ensuite en parallèle, réduisant le nombre d'étapes séquentielles lentes nécessaires pour générer des sorties longues. Le regroupement des demandes de plusieurs utilisateurs, la mise en cache des résultats intermédiaires précédemment calculés, tels que le cache de clés-valeurs de l'attention, et le routage des requêtes plus simples vers des modèles plus petits sont d'autres techniques courantes pour réduire le coût de service d'un modèle à grande échelle.

Calcul au moment du test

L'inférence a traditionnellement été traitée comme une étape fixe et légère par rapport à l'entraînement, mais l'essor des modèles de raisonnement qui génèrent un raisonnement interne étendu avant de répondre a introduit une nouvelle dimension : dépenser plus de calcul à l'inférence, une approche connue sous le nom de calcul au moment du test, peut considérablement améliorer la qualité des sorties sur des problèmes difficiles. Cela a brouillé l'hypothèse antérieure selon laquelle seul le calcul au moment de l'entraînement importait pour la capacité, puisqu'un modèle peut désormais échanger le coût d'inférence contre la précision sur un problème donné en « réfléchissant plus longtemps », un compromis qui n'existait pas de la même manière pour les générations antérieures de modèles qui produisaient une quantité fixe de sorties, indépendamment de la difficulté de la tâche.

Économie

Parce que les produits d'IA largement utilisés servent des demandes d'inférence en continu, le coût d'inférence, et non celui d'entraînement, domine l'économie à long terme de l'exécution d'un modèle déployé, et le débat industriel sur les dépenses d'infrastructure d'IA se concentre de plus en plus sur la capacité d'inférence à mesure que l'utilisation évolue, parallèlement à l'investissement continu dans le pré-entraînement de modèles toujours plus grands.

Catégories:deep-learning·infrastructure·large-language-models
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique