La puce Groq est un accélérateur IA spécialisé développé par la société Groq pour effectuer l'inférence de grands modèles de langage et d'autres charges de travail de apprentissage profond à une latence extrêmement faible. Contrairement aux GPU conventionnels utilisés pour l'IA, la puce Groq est construite autour d'une architecture de processeur de streaming tensoriel (LPU), qui est une conception déterministe orientée flux de données, éliminant le besoin d'ordonnancement complexe et réduisant les frais généraux. La puce est conçue pour offrir un débit élevé pour les modèles basés sur transformeur, ce qui la rend particulièrement adaptée aux applications en temps réel telles que l'IA conversationnelle et la génération de code.
La première génération de la puce Groq, connue sous le nom de GroqChip 1, a été annoncée en janvier 2020. Elle a été fabriquée à l'aide d'un processus de 14 nanomètres par TSMC et comportait une seule puce avec 220 Mo de SRAM sur puce. La puce atteint une performance maximale de 750 téra-opérations par seconde (TOPS) en précision entière de 8 bits, ce qui est courant pour les tâches d'inférence. Plus tard, en 2024, Groq a introduit le GroqChip 2, construit sur un processus de 6 nanomètres, offrant une performance et une efficacité améliorées. Le GroqChip 2 est conçu pour prendre en charge des modèles plus grands et des tailles de lots plus élevées, réduisant encore la latence d'inférence.
L'architecture LPU est fondamentalement différente de celle des GPU traditionnels. Au lieu de s'appuyer sur un grand nombre de cœurs avec une logique de contrôle complexe, la puce Groq utilise un modèle de flux de données simple et déterministe où les instructions sont émises dans l'ordre et les données circulent à travers la puce de manière prévisible. Cette conception élimine le besoin de ordonnancement dynamique et réduit les frais généraux associés à la prédiction de branche et à l'exécution hors ordre. En conséquence, la puce Groq atteint une performance constante et à faible latence, ce qui est essentiel pour les applications nécessitant des réponses en temps réel.
Historique et développement
Groq a été fondée en 2016 par une équipe d'anciens ingénieurs de Google, dont Jonathan Ross, qui avait précédemment travaillé sur le projet d'unité de traitement tensoriel (TPU) chez Google. L'entreprise visait à créer un nouveau type de processeur spécifiquement pour l'inférence IA, en abordant les limitations du matériel existant. La première puce Groq a été conçue en 2019 et est devenue publiquement disponible début 2020. Depuis, Groq a itéré sur la conception, publiant le GroqChip 2 en 2024, qui est actuellement déployé dans leurs services cloud.
L'approche de Groq a attiré l'attention de grandes entreprises technologiques. En 2021, la société a levé 300 millions de dollars lors d'un cycle de financement de série C, dirigé par Intel Capital et Samsung Catalyst Fund, entre autres. Ce financement a soutenu le développement de la puce de deuxième génération et l'expansion de leur plateforme cloud.
Architecture et conception
L'architecture LPU de la puce Groq est basée sur une conception à cœur unique qui est répliquée à travers la puce. Chaque cœur contient un ensemble d'unités fonctionnelles, y compris des unités de multiplication vectorielle et matricielle, ainsi qu'une grande quantité de SRAM. La puce utilise une approche définie par logiciel, où le compilateur mappe le modèle entier sur le matériel, planifiant toutes les opérations de manière statique. Cela élimine le besoin d'ordonnancement basé sur le matériel et permet un contrôle précis du mouvement des données.
L'une des caractéristiques clés de la puce Groq est son utilisation d'un modèle de flux de données en streaming. Les données sont diffusées à travers la puce de manière de réseau systolique, chaque élément de traitement effectuant une opération spécifique sur les données au fur et à mesure qu'elles passent. Cette conception minimise le besoin de récupérer les données depuis la mémoire externe, car la SRAM sur puce est utilisée pour stocker les résultats intermédiaires. La puce prend également en charge attention multi-têtes et d'autres opérations de réseau neuronal directement dans le matériel, réduisant encore la latence.
Performance et benchmarks
Dans des benchmarks indépendants, la puce Groq a démontré une performance exceptionnelle pour les tâches d'inférence. Par exemple, sur les modèles de classe GPT-3, le GroqChip 1 peut générer des jetons à un rythme de plus de 300 jetons par seconde par puce, ce qui est significativement plus rapide que de nombreux systèmes basés sur GPU. Le GroqChip 2 améliore cela, atteignant plus de 500 jetons par seconde pour des modèles similaires. Cette performance est obtenue sans nécessiter de traitement par lots ou d'autres optimisations, ce qui le rend idéal pour les applications à faible latence.
Groq a également publié des résultats montrant que leur puce peut exécuter le modèle LLaMA-2 70B avec une latence de moins de 100 millisecondes pour un seul jeton, ce qui est compétitif ou meilleur que d'autres accélérateurs. L'entreprise souligne que l'exécution déterministe du LPU garantit une performance constante, ce qui est crucial pour les environnements de production.
Logiciel et écosystème
Pour prendre en charge la puce Groq, l'entreprise a développé une pile logicielle complète, comprenant un compilateur, un environnement d'exécution et un SDK. Le compilateur, appelé Groq Compiler, prend des modèles de frameworks populaires tels que TensorFlow et PyTorch et les convertit en instructions optimisées pour le LPU. L'environnement d'exécution fournit des API pour déployer des modèles en production, avec prise en charge de recherche en faisceau et d'autres stratégies de décodage.
Groq propose également un service cloud, GroqCloud, qui permet aux développeurs d'accéder au matériel à distance. Ce service a été utilisé par des entreprises comme AI21 Labs et Inflection AI pour alimenter leurs applications IA. La pile logicielle est conçue pour être facile à utiliser, avec un accent sur la réduction de la complexité du déploiement des modèles IA.
Applications et cas d'utilisation
La puce Groq est principalement utilisée pour l'inférence dans les applications d'IA générative, telles que les chatbots, la génération de code et la création de contenu. Sa faible latence la rend adaptée aux interactions en temps réel, où les utilisateurs attendent des réponses immédiates. Par exemple, ChatGPT d'OpenAI et des services similaires pourraient bénéficier de la vitesse de la puce, bien que Groq n'ait pas divulgué de partenariats spécifiques avec de grands laboratoires d'IA.
Au-delà des modèles de langage, la puce Groq est également utilisée pour d'autres charges de travail IA, y compris la vision par ordinateur et la reconnaissance vocale. Sa performance déterministe est avantageuse dans les applications critiques pour la sécurité, telles que les véhicules autonomes et les diagnostics médicaux, où un timing constant est essentiel.
Comparaison avec d'autres accélérateurs
La puce Groq concurrence d'autres accélérateurs IA, tels que AWS Trainium, TPU de Google et la série Instinct d'AMD. Bien que les GPU soient plus flexibles et largement adoptés, la puce Groq offre une latence supérieure pour les tâches d'inférence. Cependant, elle présente des limitations en termes de flexibilité, car elle est optimisée pour des types spécifiques de modèles et peut ne pas être aussi efficace pour l'entraînement. L'entreprise s'est concentrée sur l'inférence, laissant l'entraînement à d'autres matériels.
Comparée à l'architecture de flux de données reconfigurable de SambaNova, la puce Groq est plus rigide mais offre une performance plus élevée pour les modèles de transformeurs standard. Le choix entre ces accélérateurs dépend souvent des exigences spécifiques de l'application, telles que la latence, le débit et le coût.
Orientations futures
Groq continue d'innover dans le domaine du matériel IA. L'entreprise a annoncé des plans pour développer un système multi-puces capable de passer à l'échelle pour prendre en charge des modèles encore plus grands, rivalisant potentiellement avec les capacités des systèmes DGX de NVIDIA. De plus, Groq explore l'utilisation de conceptions de chiplets pour améliorer le rendement et réduire les coûts. Alors que la demande pour l'inférence IA croît, la puce Groq est bien positionnée pour jouer un rôle significatif dans l'infrastructure IA du futur.
Conclusion
La puce Groq représente une avancée significative dans le matériel d'inférence IA, offrant une vitesse et une efficacité sans précédent pour les grands modèles de langage. Son architecture LPU unique, combinée à une pile logicielle robuste, en fait un choix convaincant pour les organisations nécessitant des capacités IA en temps réel. Bien qu'elle fasse face à la concurrence de joueurs établis, son accent sur l'inférence à faible latence la distingue dans le paysage en évolution rapide du matériel IA.