Gaudi est une famille de processeurs d'entraînement en IA développée par Habana Labs, une filiale d'Intel, conçue pour accélérer les charges de travail d'apprentissage profond pour les modèles à grande échelle. Les processeurs sont optimisés pour l'entraînement et l'inférence de modèles d'intelligence artificielle, en particulier les grands modèles de langage et d'autres architectures d'apprentissage profond. Habana Labs, fondée en 2016, a été acquise par Intel en 2019, et sa gamme Gaudi est devenue un élément clé de la stratégie matérielle d'IA d'Intel.
La première génération, Gaudi 1, a été annoncée en 2019 et ciblait l'entraînement en centre de données. Elle présentait une architecture spécialisée avec un réseau Ethernet intégré, permettant une mise à l'échelle sur plusieurs nœuds. La deuxième génération, Gaudi 2, lancée en 2022, améliorait les performances et la capacité mémoire, et a été adoptée par les fournisseurs de cloud et les entreprises. En 2024, Intel a introduit Gaudi 3, qui a encore renforcé le débit d'entraînement pour les modèles basés sur transformer, concurrençant les offres de Nvidia et AMD.
Architecture et Conception
Les processeurs Gaudi sont construits autour d'une architecture hétérogène qui combine un moteur de multiplication matricielle, des unités de traitement vectoriel et un cœur CPU à usage général. La conception met l'accent sur une utilisation élevée pour les opérations de réseau neuronal, avec un focus sur la réduction des goulots d'étranglement de mouvement de données. Contrairement à certains concurrents, Gaudi intègre un réseau sur puce via Ethernet, éliminant le besoin d'adaptateurs réseau séparés dans les configurations d'entraînement multi-nœuds.
Les processeurs utilisent une hiérarchie mémoire personnalisée avec une grande mémoire SRAM sur puce et une mémoire HBM2E à haute bande passante. Gaudi 3, par exemple, offre 128 Go de mémoire HBM2E et une bande passante mémoire de 3,7 To/s. L'architecture prend en charge à la fois l'entraînement et l'inférence, avec des optimisations logicielles pour des frameworks populaires comme PyTorch et TensorFlow.
Performances et Benchmarks
Habana a publié des benchmarks de performance montrant que Gaudi 2 et Gaudi 3 atteignent des temps d'entraînement compétitifs pour des modèles comme ResNet et des modèles de langage basés sur Transformer. Dans des tests internes, Gaudi 3 a démontré un entraînement jusqu'à 50 % plus rapide pour les LLM par rapport à Gaudi 2, et une inférence jusqu'à 40 % plus rapide. Cependant, les benchmarks indépendants sont limités, et les performances réelles dépendent de la maturité logicielle et de l'intégration système.
Les processeurs sont conçus pour évoluer jusqu'à des milliers de nœuds, avec une boîte à outils de augmentation de données et de élagage de modèle qui aide à optimiser les modèles pour le déploiement. La pile logicielle de Habana, appelée SynapseAI, fournit un compilateur graphique qui optimise automatiquement les opérations pour le matériel.
Écosystème Logiciel
SynapseAI est le framework logiciel principal pour Gaudi, offrant une interface conviviale qui prend en charge ONNX et les frameworks d'apprentissage profond populaires. Il comprend un compilateur graphique qui fusionne les opérations, optimise l'utilisation de la mémoire et planifie les tâches sur les cœurs du processeur. Le logiciel prend également en charge l'entraînement distribué via Horovod et le module de parallélisme distribué de PyTorch.
Habana a établi un partenariat avec Hugging Face pour optimiser des milliers de modèles pour Gaudi, y compris BERT, GPT et LLaMA. L'intégration permet aux développeurs d'exécuter ces modèles avec des modifications minimales de code. De plus, le logiciel inclut des outils pour la quantification et l'élagage afin d'améliorer l'efficacité de l'inférence.
Position sur le Marché et Concurrence
Gaudi concurrence directement les GPU A100 et H100 de Nvidia, ainsi que la série MI300 d'AMD. Bien que Nvidia domine le marché de l'entraînement en IA, Gaudi offre une alternative à moindre coût avec des performances compétitives, surtout pour les clusters basés sur Ethernet. Habana a également positionné Gaudi comme une option plus économe en énergie, avec un coût total de possession inférieur.
En 2024, Intel a annoncé que Gaudi 3 serait disponible via AWS et Google Cloud, élargissant sa portée. Cependant, l'adoption reste limitée par rapport à Nvidia, en partie en raison de la maturité de CUDA et de l'écosystème étendu qui l'entoure. Habana travaille à combler cet écart en fournissant des couches de compatibilité et des partenariats.
Cas d'Utilisation et Adoption
Les processeurs Gaudi sont utilisés dans diverses applications d'IA, y compris l'IA générative, la vision par ordinateur et le traitement du langage naturel. Ils sont particulièrement adaptés à l'entraînement des grands modèles de langage et des systèmes de recommandation. Les premiers adoptants incluent Hugging Face, qui utilise Gaudi pour l'inférence, et plusieurs fournisseurs de services cloud qui proposent des instances Gaudi.
En 2023, Intel a annoncé une collaboration avec OpenAI pour optimiser Gaudi pour leurs modèles, bien que les détails soient rares. De plus, AWS propose des instances basées sur Gaudi pour l'entraînement, et Oracle Cloud a intégré Gaudi dans son infrastructure d'IA. Les processeurs ont également été utilisés dans la recherche académique, avec le laboratoire d'IA de Stanford et Berkeley AI Research explorant leurs capacités.
Position sur le Marché et Concurrence
Gaudi concurrence directement les GPU A100 et H100 de Nvidia, ainsi que la série MI300 d'AMD. Bien que Nvidia domine le marché de l'entraînement en IA, Gaudi offre une alternative à moindre coût avec des performances compétitives, en particulier pour les clusters basés sur Ethernet. Habana a également positionné Gaudi comme une option plus économe en énergie, avec un coût total de possession inférieur.
En 2024, Intel a annoncé que Gaudi 3 serait disponible via AWS et Google Cloud, élargissant sa portée. Cependant, l'adoption reste limitée par rapport à Nvidia, en partie en raison de la maturité de CUDA et de l'écosystème étendu qui l'entoure. Habana travaille à combler cet écart en fournissant des couches de compatibilité et des partenariats.
Utilisations et Adoption
Les processeurs Gaudi sont utilisés dans diverses applications d'IA, notamment l'IA générative, la vision par ordinateur et le traitement du langage naturel. Ils sont particulièrement adaptés à l'entraînement de grands modèles de langage et de systèmes de recommandation. Les premiers adoptants incluent Hugging Face, qui utilise Gaudi pour l'inférence, et plusieurs fournisseurs de services cloud qui proposent des instances Gaudi.
En 2023, Intel a annoncé une collaboration avec OpenAI pour optimiser Gaudi pour leurs modèles, bien que les détails aient été rares. De plus, AWS propose des instances basées sur Gaudi pour l'entraînement, et Oracle Cloud a intégré Gaudi dans son infrastructure d'IA. Les processeurs ont également été utilisés dans la recherche académique, avec Stanford AI Lab et Berkeley AI Research explorant leurs capacités.
Développements Futurs
Intel s'est engagé à développer la gamme Gaudi, avec des générations futures promises pour offrir des performances plus élevées et une meilleure efficacité énergétique. L'entreprise investit également dans des améliorations logicielles pour faciliter la transition depuis la plateforme Nvidia. En 2025, Gaudi 3 est la dernière génération, mais Intel a laissé entendre qu'un Gaudi 4 était en développement, visant 2026.
Le succès de Gaudi dépendra de l'adoption plus large de l'écosystème IA d'Intel et de sa capacité à concurrencer sur le prix et les performances. Avec l'essor de l'IA générative et des grands modèles de langage, la demande de matériel d'entraînement augmente, et Gaudi est bien positionné pour capturer une part de ce marché.
Conclusion
Gaudi représente l'effort majeur d'Intel dans le marché des accélérateurs IA, offrant une alternative aux GPU de Nvidia. Avec son architecture intégrée et ses performances compétitives, il a trouvé une niche dans les clusters basés sur Ethernet. Bien que des défis subsistent en matière de maturité logicielle et d'intégration système, son développement continu et ses partenariats suggèrent un avenir prometteur dans le paysage du matériel d'IA.