Traduit de l'anglais

Compute désigne la puissance de traitement, la mémoire et l'infrastructure nécessaires pour entraîner et exécuter des modèles d'IA, en particulier les grands réseaux de neurones. Son augmentation a stimulé les progrès récents en intelligence artificielle, façonnant à la fois la recherche et l'industrie.

Dans le contexte de l'intelligence artificielle, compute désigne la capacité de traitement totale, la bande passante mémoire et l'infrastructure matérielle utilisées pour entraîner, affiner et déployer des modèles d'apprentissage automatique. Le terme a gagné en importance avec l'essor de l'apprentissage profond, où l'échelle de calcul détermine souvent la capacité des modèles. Le compute englobe non seulement la vitesse brute du processeur, mais aussi l'efficacité du transfert de données, la parallélisation et l'énergie requise pour des opérations soutenues.

La demande en compute a connu une croissance exponentielle depuis le début des années 2010, stimulée par la taille croissante des réseaux de neurones et le volume des données d'entraînement. Cette croissance a influencé la conception matérielle, les offres de services cloud et les priorités stratégiques des grandes entreprises technologiques. Par conséquent, le compute est devenu une métrique centrale dans les discussions sur les progrès de l'IA, les coûts et l'impact environnemental.

Contexte historique

Le concept de compute dans l'IA précède l'apprentissage profond moderne. Les premiers ordinateurs d'échecs et systèmes experts reposaient sur une puissance de traitement modeste par rapport aux normes contemporaines. L'ère du Perceptron dans les années 1950 et 1960 utilisait des opérations arithmétiques simples, mais les limitations matérielles ont freiné les progrès. La résurgence des réseaux de neurones dans les années 1980, menée par des chercheurs tels que Geoffrey Hinton et Yann LeCun, a nécessité des ressources informatiques plus substantielles, bien que toujours bien en dessous des niveaux actuels.

Le changement décisif est survenu vers 2012, lorsqu'un réseau convolutif profond entraîné sur des GPU NVIDIA a réalisé une percée dans la reconnaissance d'images. Cela a démontré que le traitement parallèle pouvait accélérer l'entraînement de plusieurs ordres de grandeur. Par la suite, l'adoption des GPU est devenue standard, et le terme « compute » a commencé à être utilisé comme abréviation pour la capacité matérielle agrégée allouée aux tâches d'IA.

Matériel et infrastructure

Le compute est fourni par plusieurs classes de matériel. Les unités centrales de traitement (CPU) gèrent des tâches généralistes mais sont inefficaces pour les opérations matricielles centrales à l'apprentissage profond. Les GPU, initialement conçus pour les graphiques, excellent dans les charges de travail parallèles et sont devenus le choix dominant pour l'entraînement. Des entreprises comme AMD et Intel ont développé des accélérateurs concurrents, tandis que les conceptions basées sur Arm apparaissent dans les appareils de périphérie.

Des puces IA spécialisées ont émergé pour optimiser des charges de travail spécifiques. Google DeepMind et Google Cloud utilisent des unités de traitement tensoriel (TPU), des ASIC personnalisés conçus pour l'inférence et l'entraînement des réseaux de neurones. AWS Trainium joue un rôle similaire dans Amazon Web Services. Des startups comme Groq et SambaNova proposent des architectures alternatives, tandis que Graphcore a développé l'unité de traitement de l'intelligence (IPU) avant son acquisition par SoftBank en 2024.

L'infrastructure comprend également la mémoire, le stockage et la mise en réseau. La mémoire à haute bande passante (HBM) est essentielle pour alimenter les processeurs en données, et des interconnexions rapides telles que NVLink et InfiniBand permettent une mise à l'échelle multi-puces. Les fournisseurs cloud, y compris Microsoft Azure, Oracle Cloud et Alibaba Cloud, proposent des instances de compute à la demande, permettant aux chercheurs d'accéder à de grands clusters sans posséder de matériel.

Mise à l'échelle et entraînement

La relation entre le compute et la performance des modèles est souvent décrite par des lois de mise à l'échelle. Les recherches de OpenAI en 2020 ont montré que la perte diminue de manière prévisible avec l'augmentation du compute, de la taille des ensembles de données et des paramètres du modèle. Cette découverte empirique a encouragé la construction de modèles toujours plus grands, tels que les grands modèles de langage avec des centaines de milliards de paramètres. L'entraînement de tels modèles nécessite des milliers d'accélérateurs fonctionnant pendant des semaines ou des mois.

Par exemple, GPT-4, publié par OpenAI en mars 2023, est estimé avoir utilisé des dizaines de milliers de GPU, bien que les chiffres exacts ne soient pas divulgués. Les modèles Claude d'Anthropic et Gemini de Google reposent également sur des budgets de compute massifs. L'architecture transformer, introduite en 2017, s'est révélée hautement parallélisable, ce qui la rend bien adaptée à l'entraînement distribué sur de nombreux appareils.

Le compute affecte également l'inférence, le processus de génération de sorties à partir d'un modèle entraîné. Alors que l'entraînement est un coût ponctuel, l'inférence est continue et nécessite souvent une faible latence. Des techniques telles que élagage de modèle, la quantification et la distillation réduisent les exigences de compute pour le déploiement, permettant l'IA sur les smartphones et les appareils embarqués d'entreprises comme Apple et Samsung Electronics.

Implications économiques et stratégiques

Le coût du compute est devenu une barrière à l'entrée dans la recherche en IA. L'entraînement d'un modèle de pointe peut coûter des dizaines de millions de dollars, limitant la participation aux grandes entreprises et aux laboratoires bien financés. Cela a suscité des préoccupations concernant la concentration du pouvoir, car seules quelques organisations peuvent se permettre l'infrastructure nécessaire. Les gouvernements ont également pris note, avec des contrôles à l'exportation sur les puces avancées affectant les chaînes d'approvisionnement mondiales.

En réponse, les efforts pour démocratiser le compute incluent des modèles open source, l'apprentissage fédéré et la recherche sur l'efficacité. Michael Jordan et d'autres ont plaidé pour une IA plus accessible, tandis que des initiatives comme l'Open Panel visent à fournir des ressources partagées. L'impact économique s'étend aux fabricants de semi-conducteurs ; TSMC et Broadcom bénéficient d'une demande croissante, et NVIDIA est brièvement devenue l'entreprise la plus précieuse au monde en 2024.

Orientations futures

La croissance du compute fait face à des limites physiques, notamment la consommation d'énergie et la dissipation de chaleur. Les centres de données représentent déjà une part significative de la consommation mondiale d'électricité, ce qui incite à rechercher des algorithmes et du matériel plus efficaces. L'informatique quantique, poursuivie par D-Wave et d'autres, reste expérimentale mais pourrait éventuellement offrir des avantages pour des problèmes spécifiques.

Des paradigmes alternatifs, tels que l'informatique neuromorphique inspirée des cerveaux biologiques, visent à réduire les besoins énergétiques. Les chercheurs de MIT CSAIL et du Stanford AI Lab explorent ces voies. Pendant ce temps, la tendance vers des modèles plus grands se poursuit, certains prédisant que les exigences en compute augmenteront d'un facteur de 10 à 100 dans les années à venir, stimulées par les avancées en IA générative et les systèmes multimodaux.

Le compute reste une ressource fondamentale pour l'IA, façonnant ce qui est techniquement possible et économiquement faisable. Son évolution reflétera probablement la trajectoire plus large de l'informatique, en équilibrant performance, coût et durabilité.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·computing·hardware·machine-learning
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique