Wormhole est une famille de cartes accélératrices d'IA produites par Tenstorrent, une entreprise de semi-conducteurs sans usine. Ces cartes sont conçues pour accélérer les charges de travail d'intelligence artificielle et de apprentissage automatique, en particulier les modèles de apprentissage profond tels que les grands modèles de langage et les architectures basées sur transformeurs. La série Wormhole cible à la fois les tâches d'inférence et d'entraînement, offrant une architecture évolutive qui peut être reliée pour des déploiements plus étendus. Tenstorrent positionne Wormhole comme une alternative flexible aux GPU, en mettant l'accent sur la programmabilité et une focalisation sur le calcul basé sur les flux de données.
La première génération, Wormhole, a été annoncée en 2020 et a commencé à être expédiée en 2021. Elle a été suivie par Wormhole n150 en 2023, une version à carte unique, et Wormhole n300, une configuration à double carte. Ces cartes ultérieures sont construites sur un processus de 6 nm et disposent d'un processeur de contrôle basé sur RISC-V. L'architecture est conçue pour gérer efficacement les opérations de tenseurs creux et denses, avec un accent sur la réduction des goulots d'étranglement mémoire courants dans les conceptions de GPU traditionnelles.
Architecture et Conception
L'accélérateur Wormhole est construit autour d'une grille de cœurs Tensix, chacun contenant un CPU RISC-V, une unité de multiplication matricielle et un moteur vectoriel. Cette conception hétérogène permet une exécution flexible de diverses opérations de réseaux neuronaux. Les cœurs sont interconnectés via un réseau maillé à haute bande passante et faible latence, permettant un partage efficace des données et une mise à l'échelle sur plusieurs puces. Contrairement aux GPU, qui reposent sur un modèle SIMT (Single Instruction, Multiple Thread), Wormhole utilise une architecture de flux de données qui peut être plus efficace pour certaines charges de travail, en particulier celles avec des schémas d'accès mémoire irréguliers.
Chaque cœur Tensix comprend une mémoire dédiée, réduisant le besoin d'accès mémoire hors puce fréquents. La carte n150 dispose de 72 cœurs Tensix, tandis que la n300 en a 144 répartis sur deux dies. Les cartes prennent en charge une gamme de types de données, y compris FP32, FP16, BF16 et INT8, permettant une flexibilité de précision dans l'entraînement et l'inférence. L'architecture inclut également une interface Ethernet dédiée pour la mise à l'échelle vers des systèmes multi-cartes, utilisant un protocole qui prend en charge l'accès mémoire direct entre les cartes.
Performance et Spécifications
La Wormhole n150 offre jusqu'à 100 téraflops de calcul FP16 et 200 téraops de calcul INT8, avec 16 Go de mémoire GDDR6 fournissant 256 Go/s de bande passante. La n300 double ces chiffres, offrant 200 téraflops de FP16 et 400 téraops d'INT8, avec 32 Go de mémoire. La consommation électrique est évaluée à 150 W pour la n150 et 300 W pour la n300, ce qui les rend relativement économes en énergie par rapport à certains accélérateurs concurrents. Les cartes utilisent une interface PCIe Gen 4 x16 pour la connectivité hôte et peuvent être interconnectées via Ethernet pour des configurations multi-cartes.
Dans les tests de référence, Wormhole a montré des performances compétitives sur les tâches d'inférence de réseaux neuronaux, en particulier pour les modèles basés sur des transformeurs. Tenstorrent a publié des résultats montrant une mise à l'échelle linéaire des performances lors de l'ajout de plusieurs cartes n150, une caractéristique clé pour les déploiements à grande échelle. Les cartes prennent également en charge le parallélisme de modèle et le parallélisme de données, permettant un entraînement efficace de grands modèles sur plusieurs accélérateurs.
Pile Logicielle
Tenstorrent fournit une pile logicielle complète pour Wormhole, comprenant un pilote de bas niveau, une bibliothèque d'exécution et des frameworks de niveau supérieur. Le modèle de programmation principal est basé sur une API C++, mais il existe également un support pour les frameworks d'apprentissage automatique populaires. L'entreprise a développé un compilateur personnalisé qui traduit les modèles de frameworks comme PyTorch et ONNX en code optimisé pour les cœurs Tensix. Ce compilateur effectue des optimisations au niveau du graphe, y compris la fusion d'opérateurs et la planification mémoire, pour maximiser les performances.
Pour les utilisateurs familiers avec la programmation GPU, Tenstorrent offre un modèle de programmation qui abstrait certains détails de bas niveau, tout en permettant aux utilisateurs avancés d'écrire des noyaux personnalisés. La pile logicielle inclut un débogueur et des outils de profilage pour faciliter le développement. Tenstorrent fournit également une bibliothèque d'opérateurs pré-optimisés pour les couches courantes de réseaux neuronaux, telles que attention multi-têtes et les blocs réseaux résiduels, qui peuvent être utilisés directement dans les modèles.
Écosystème et Intégration
Les cartes Wormhole sont disponibles en tant que cartes PCIe autonomes pour les stations de travail et les serveurs, ainsi que dans des systèmes préconfigurés. Tenstorrent a établi des partenariats avec des intégrateurs système pour offrir des solutions clés en main pour la recherche et la production en IA. Les cartes sont également disponibles via des fournisseurs de services cloud, permettant aux utilisateurs d'y accéder en location. Tenstorrent a développé un kit de développement logiciel (SDK) qui comprend des exemples et des tutoriels, visant à réduire la courbe d'apprentissage pour les nouveaux utilisateurs.
L'entreprise a également créé un forum communautaire et un portail de documentation, favorisant un écosystème de développeurs. Wormhole prend en charge la norme panneau ouvert, qui est une spécification pour les systèmes de calcul modulaires, permettant l'intégration dans des environnements de centres de données hétérogènes. Cela permet de combiner les cartes Wormhole avec d'autres accélérateurs, tels que ceux de AMD ou Intel, dans un système unique.
Cas d'Utilisation et Applications
Wormhole est principalement destiné à la recherche et au développement en IA, en particulier pour l'entraînement et le déploiement de grands modèles de langage. Sa bande passante mémoire élevée et son architecture de flux de données efficace le rendent adapté aux modèles basés sur des transformeurs, largement utilisés dans le traitement du langage naturel. Les cartes sont également utilisées pour des tâches de vision par ordinateur, telles que la classification d'images et la détection d'objets, en tirant parti d'architectures comme U-Net et réseaux résiduels.
En plus des charges de travail d'IA traditionnelles, Wormhole est exploré pour des applications de calcul scientifique, telles que les simulations et l'analyse de données. Sa programmabilité permet aux chercheurs d'implémenter des algorithmes personnalisés au-delà des opérations standard de réseaux neuronaux. Tenstorrent a également souligné son utilisation dans des scénarios de calcul en périphérie, où l'efficacité énergétique des cartes est un avantage.
Comparaison avec les Concurrents
Wormhole concurrence les accélérateurs d'IA d'entreprises comme Groq, SambaNova et Graphcore, ainsi que les GPU de NVIDIA et AMD. Par rapport aux GPU, Wormhole offre un modèle de programmation différent et potentiellement une meilleure efficacité pour certaines charges de travail, mais dispose d'un écosystème logiciel plus restreint. Par rapport à d'autres puces spécifiques à l'IA, le principal différenciateur de Wormhole est son accent sur une architecture de flux de données avec un grand nombre de cœurs, qui peut être plus flexible que les conceptions à fonctions fixes de certains concurrents.
En termes de performance brute, les spécifications de Wormhole sont compétitives avec les GPU de milieu de gamme, mais il est en retrait par rapport aux offres haut de gamme. Cependant, son évolutivité et son efficacité énergétique sont des arguments de vente solides. Tenstorrent a également mis l'accent sur la nature ouverte de sa pile logicielle, permettant une plus grande personnalisation par rapport aux alternatives propriétaires.
Développement et Feuille de Route Future
Tenstorrent continue de développer la série Wormhole, avec des mises à jour logicielles et des optimisations en cours. L'entreprise a annoncé des plans pour les générations futures de ses accélérateurs, en s'appuyant sur les leçons apprises de Wormhole. Ces futures puces devraient offrir des performances plus élevées et une efficacité améliorée, potentiellement en utilisant des processus de fabrication plus avancés. Tenstorrent travaille également à l'expansion de son écosystème logiciel, y compris un meilleur support pour les frameworks et outils populaires.
L'entreprise a reçu un financement significatif et a établi des partenariats avec diverses organisations, y compris Samsung Electronics et TSMC, pour la fabrication et la collaboration technologique. Cela positionne Tenstorrent pour continuer à concurrencer sur le marché en évolution rapide des accélérateurs d'IA.
Réception et Impact
Wormhole a été bien accueilli dans la communauté de l'IA pour son architecture innovante et son accent sur la programmabilité. Les premiers adoptants ont salué ses performances sur les modèles de transformeurs et sa facilité de mise à l'échelle. Cependant, certains utilisateurs ont noté que la pile logicielle est moins mature que celle des fournisseurs de GPU établis, nécessitant plus d'efforts pour optimiser les modèles. Malgré cela, la nature open source de certains composants a attiré une communauté de développeurs.
L'impact de Wormhole s'étend au-delà du produit lui-même, car il représente une tendance croissante vers du matériel d'IA spécialisé qui défie la domination des GPU. Son succès a contribué à l'écosystème plus large des accélérateurs d'IA, offrant plus d'options pour les chercheurs et les entreprises.
Conclusion
Wormhole est une entrée significative dans l'espace des accélérateurs d'IA, offrant une architecture unique qui équilibre performance, efficacité et flexibilité. Son accent sur le calcul par flux de données et le contrôle basé sur RISC-V en fait une alternative distincte aux GPU traditionnels. Bien qu'il fasse face à des défis en termes de maturité logicielle, ses fortes capacités de mise à l'échelle et son écosystème croissant en font une option viable pour de nombreuses charges de travail d'IA. Alors que Tenstorrent continue d'itérer sur la conception, Wormhole et ses successeurs joueront probablement un rôle important dans l'avenir du matériel d'IA.
Références
Tenstorrent a publié une documentation technique et des benchmarks de performance pour la série Wormhole, disponibles sur son site Web officiel. L'entreprise a également présenté lors de diverses conférences industrielles, détaillant l'architecture et les choix de conception. Pour plus d'informations, les lecteurs intéressés peuvent consulter ces ressources, ainsi que des critiques et analyses indépendantes de publications technologiques.