Unité de traitement du langage

Traduit de l'anglais

Groq, Inc. est une entreprise américaine d'IA qui conçoit l'unité de traitement du langage (LPU), un circuit intégré spécifique à une application (ASIC) optimisé pour l'inférence rapide de grands modèles de langage et d'autres charges de travail d'IA. Fondée en 2016, elle a son siège social à Mountain View, en Californie.

Groq, Inc. est une entreprise américaine d'intelligence artificielle (IA) qui fabrique un circuit intégré spécifique à une application (ASIC) d'accélérateur d'IA. L'architecture a été initialement présentée comme un processeur de streaming tensoriel (TSP), mais a ensuite été rebaptisée unité de traitement du langage (LPU) suite à l'adoption généralisée des grands modèles de langage après l'avancée de ChatGPT. L'entreprise développe également du matériel et des logiciels informatiques associés pour accélérer les performances d'inférence de l'IA. Parmi les exemples de types de charges de travail d'IA exécutées sur le LPU de Groq figurent : les grands modèles de langage (LLM), la classification d'images et l'analyse prédictive. Groq a son siège social à Mountain View, en Californie, et possède des bureaux à San Jose, en Californie, à Liberty Lake, dans l'État de Washington, à Toronto, au Canada, à Londres, au Royaume-Uni, ainsi que des employés à distance dans toute l'Amérique du Nord et l'Europe.

En décembre 2025, Nvidia et Groq ont annoncé un accord, évalué à environ 20 milliards de dollars américains, pour concéder sous licence la technologie d'inférence d'IA de Groq et transférer plusieurs cadres supérieurs de Groq à Nvidia. Groq a déclaré qu'elle continuerait à opérer en tant qu'entreprise indépendante.

Historique

Groq a été fondée en 2016 par un groupe d'anciens ingénieurs de Google, dirigé par Jonathan Ross, l'un des concepteurs de l'unité de traitement tensoriel (TPU), un ASIC d'accélérateur d'IA, et Douglas Wightman, entrepreneur et ancien ingénieur chez Google X (connu sous le nom de X Development), qui a été le premier PDG de l'entreprise. L'équipe fondatrice s'est appuyée sur l'expérience de DeepMind et d'autres groupes de recherche en IA, visant à construire du matériel spécifiquement pour les exigences des charges de travail d'IA.

Groq a reçu un financement d'amorçage de Chamath Palihapitiya de Social Capital, avec un investissement de 10 millions de dollars en 2017, et a rapidement obtenu un financement supplémentaire. En avril 2021, Groq a levé 300 millions de dollars lors d'un tour de série C mené par Tiger Global Management et D1 Capital Partners. Les investisseurs actuels comprennent : Infinitum, The Spruce House Partnership, Addition, GCM Grosvenor, Xⁿ, Firebolt Ventures, General Global Capital et Tru Arrow Partners, ainsi que des investissements de suivi d'Infinitum, TDK Ventures et XTX Ventures. Après le tour de financement de série C de Groq, celle-ci a été valorisée à plus d'un milliard de dollars, faisant de la startup une licorne.

Le 1er mars 2022, Groq a acquis Maxeler Technologies, une entreprise connue pour ses technologies de systèmes de flux de données. Il a été décidé que Maxeler conserverait sa marque en raison des réalisations de longue date du Dr Oskar Mencer et de son équipe, qui publient des recherches dans leur domaine d'expertise. Le 16 août 2023, Groq a sélectionné la fonderie de Samsung Electronics à Taylor, au Texas, pour fabriquer ses puces de nouvelle génération, sur le nœud de processus de 4 nanomètres (nm) de Samsung. Il s'agissait de la première commande passée à cette nouvelle usine de puces de Samsung.

Le 19 février 2024, Groq a lancé en douceur une plateforme pour développeurs, GroqCloud™, afin d'attirer les développeurs vers l'utilisation de l'API Groq et de louer l'accès à ses puces. Le 1er mars 2024, Groq a acquis Definitive Intelligence, une startup connue pour offrir une gamme de solutions d'IA orientées vers les entreprises, afin d'aider sa plateforme cloud. Groq a levé 640 millions de dollars lors d'un tour de série D mené par BlackRock Private Equity Partners en août 2024, valorisant l'entreprise à 2,8 milliards de dollars.

Le 10 février 2025, Groq a annoncé avoir obtenu un engagement de 1,5 milliard de dollars américains du Royaume d'Arabie saoudite pour étendre la livraison de son infrastructure d'inférence d'IA basée sur LPU, lié à un nouveau centre de données GroqCloud à Dammam, en Arabie saoudite. En 2025, Groq a établi une douzaine de centres de données à travers les États-Unis, le Canada, le Moyen-Orient et l'Europe, avec sa technologie.

En décembre 2025, Nvidia a accepté d'acheter des actifs de Groq pour environ 20 milliards de dollars américains, un record pour Nvidia. Groq a décrit cela comme un accord de licence non exclusif. Dans le cadre de l'accord, le fondateur de Groq, Ross, et le président de Groq, Sunny Madra, devaient rejoindre Nvidia. En mai 2026, Groq aurait levé 650 millions de dollars auprès d'investisseurs existants pour financer sa transition vers une activité cloud d'inférence d'IA, le tour étant structuré comme une offre au prorata soutenue par les investisseurs Disruptive et Infinitum.

Unité de traitement du langage

Le nom initial de Groq pour son ASIC était le processeur de streaming tensoriel (TSP), nom de code « Alan », mais il a ensuite été rebaptisé par Mark Heaps - VP de la marque, et Jonathan Ross - PDG/fondateur, de TSP à unité de traitement du langage (LPU) pour rendre la nature du processeur plus évidente. Le LPU est conçu spécifiquement pour la phase d'inférence des grands modèles de langage et d'autres modèles d'IA, en se concentrant sur une faible latence et un débit élevé.

Le LPU présente une microarchitecture à tranches fonctionnelles, où les unités de mémoire sont entrelacées avec des unités de calcul vectoriel et matriciel. Cette conception facilite l'exploitation de la localité du flux de données dans les graphes de calcul d'IA, améliorant les performances et l'efficacité d'exécution. Le LPU a été conçu sur la base de deux observations clés : les charges de travail d'IA présentent un parallélisme de données substantiel, qui peut être mappé sur du matériel spécialisé, conduisant à des gains de performance ; et une conception de processeur déterministe, couplée à un modèle de programmation producteur-consommateur, permet un contrôle et un raisonnement précis sur les composants matériels, permettant des performances et une efficacité énergétique optimisées.

En plus de sa microarchitecture à tranches fonctionnelles, le LPU peut également être caractérisé par son architecture monocœur et déterministe. Le LPU peut atteindre une exécution déterministe en évitant l'utilisation de composants matériels réactifs traditionnels (prédicteurs de branchement, arbitres, tampons de réorganisation, caches) et en ayant toute l'exécution explicitement contrôlée par le compilateur, garantissant ainsi le déterminisme dans l'exécution d'un programme LPU. Cette approche déterministe contraste avec l'exécution spéculative utilisée dans de nombreuses conceptions de CPU, qui peut introduire une variabilité dans les performances.

La première génération du LPU (TSP) offre une densité de calcul de plus de 1 TeraOp/s par mm² de silicium pour sa puce 14 nm de 25×29 mm fonctionnant à une fréquence d'horloge nominale de 900 MHz. La deuxième génération du LPU (LPU v2) sera fabriquée sur le nœud de processus 4 nm de Samsung. L'architecture du LPU est particulièrement adaptée aux modèles basés sur transformers, qui dominent les applications modernes de IA générative.

Groq héberge des grands modèles de langage open source fonctionnant sur ses LPU pour un accès public. L'accès à ces démos est disponible via le site Web de Groq et son playground pour développeurs. Les performances du LPU ont été comparées aux GPU Nvidia, montrant des accélérations significatives dans la génération de jetons pour des modèles comme Llama et Mistral, bien que la vérification indépendante soit en cours.

Architecture et conception

La philosophie de conception du LPU se concentre sur l'élimination des frais généraux des processeurs à usage général. En utilisant un seul cœur avec une grande mémoire gérée par logiciel, le LPU évite le besoin de hiérarchies de cache complexes et de protocoles de cohérence. Chaque tranche fonctionnelle comprend sa propre mémoire et ses propres unités de calcul, permettant aux données de circuler directement entre elles sans passer par un bus partagé. Cela s'apparente aux architectures de flux de données explorées par des projets antérieurs comme Xerox PARC et MIT CSAIL, mais appliquées aux charges de travail d'IA modernes.

Le compilateur joue un rôle crucial dans le fonctionnement du LPU. Il planifie toutes les instructions et les mouvements de données à l'avance, garantissant que le matériel ne reste jamais bloqué en attendant des données. Cette planification statique est possible car les graphes d'inférence d'IA sont généralement connus à l'avance, contrairement aux applications interactives. Le résultat est un processeur qui atteint une utilisation élevée et des performances prévisibles, ce qui est essentiel pour les services d'IA en temps réel.

Le LPU prend également en charge une gamme de précisions numériques, notamment FP32, BF16 et INT8, permettant aux développeurs de faire un compromis entre précision et vitesse. Cette flexibilité est importante pour déployer des modèles sur différentes contraintes matérielles, des appareils de périphérie aux centres de données cloud.

Logiciels et écosystème

Groq fournit une pile logicielle comprenant un compilateur, un runtime et des API pour des frameworks populaires comme PyTorch et TensorFlow. La suite GroqWare comprend des outils pour l'optimisation de modèles, le profilage et le déploiement. L'entreprise s'est également associée à Hugging Face pour offrir une large gamme de modèles open source sur sa plateforme, facilitant ainsi l'expérimentation des développeurs avec l'accélération LPU.

GroqCloud, lancé en 2024, permet aux utilisateurs de louer la capacité LPU à la demande, similaire aux services cloud de AWS, Azure et Google Cloud. La plateforme prend en charge à la fois l'inférence interactive et le traitement par lots, avec un modèle de tarification à l'utilisation. En 2025, GroqCloud héberge plus de 100 000 développeurs et a traité des milliards de requêtes.

L'entreprise maintient également une division de recherche qui collabore avec des institutions académiques comme Stanford AI Lab et Berkeley AI Research pour explorer de nouvelles architectures pour l'IA. La technologie de Groq a été utilisée dans des applications allant des moteurs d'échecs aux véhicules autonomes, bien que l'accent principal reste sur l'inférence LLM.

Position sur le marché et concurrence

Groq concurrence d'autres startups de puces d'IA telles que SambaNova et Graphcore, ainsi que des acteurs établis comme AMD et Intel. La conception déterministe du LPU lui donne un avantage dans les applications sensibles à la latence, mais il manque de la flexibilité des GPU pour les tâches d'entraînement. Groq s'est positionnée comme une spécialiste de l'inférence, un marché qui croît rapidement avec la prolifération des applications d'IA.

En 2025, la valorisation de l'entreprise a atteint 2,8 milliards de dollars après son tour de série D, et l'accord avec Nvidia en décembre 2025 a davantage validé sa technologie. L'accord de licence permet à Nvidia d'incorporer la technologie d'inférence de Groq dans ses propres produits, élargissant potentiellement la portée des solutions basées sur LPU.

Orientations futures

À l'avenir, Groq prévoit de lancer le LPU v2, fabriqué sur le processus 4 nm de Samsung, qui devrait offrir des améliorations de performances significatives par rapport à la première génération. L'entreprise explore également de nouvelles technologies de mémoire, telles que HBM, pour augmenter la bande passante et réduire davantage la latence.

La transition de Groq vers une activité cloud d'inférence d'IA, comme l'indique le tour de financement de 2026, suggère un changement stratégique de la vente de matériel vers la fourniture de services. Cela s'aligne sur les tendances de l'industrie où le calcul est de plus en plus fourni comme un service utilitaire, similaire à l'évolution du cloud computing.

Voir aussi

  • Unité centrale de traitement
  • Unité de traitement graphique
  • Unité de traitement tensoriel
  • Accélérateur d'IA

Références

  • Site Web officiel de Groq, Inc.
  • Communiqués de presse et annonces de Groq
  • Rapports de l'industrie sur le matériel d'IA

Liens externes

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:ai-hardware·semiconductor-companies·artificial-intelligence·startups
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique