Traduit de l'anglais

Groq est une entreprise informatique qui conçoit et vend des unités de traitement du langage (LPU), du matériel spécialisé pour l'inférence ultra-rapide de grands modèles de langage, se positionnant comme une alternative aux GPU dans les charges de travail d'IA.

Groq est une entreprise informatique américaine qui développe et commercialise l'unité de traitement de langage (LPU), un processeur spécialisé conçu pour l'inférence à haute vitesse des grands modèles de langage et d'autres charges de travail d'intelligence artificielle. Fondée en 2016 par une équipe d'anciens ingénieurs de Google DeepMind et de Xerox PARC, l'entreprise positionne son matériel comme une alternative aux accélérateurs GPU dominés par Nvidia, en se concentrant sur la latence déterministe et l'efficacité énergétique pour le service des modèles d'IA. Le nom de Groq dérive du verbe « groq », inventé par l'auteur de science-fiction Robert A. Heinlein dans son roman de 1961 Stranger in a Strange Land, signifiant comprendre quelque chose intuitivement ou par empathie.

Le produit principal de l'entreprise, la LPU, est un processeur de flux tensoriel qui exécute des modèles d'IA en utilisant une architecture de flux de données plutôt que l'approche traditionnelle basée sur des instructions des CPU et des GPU. Cette conception élimine le besoin d'une planification et d'une gestion de la mémoire complexes, permettant une exécution prévisible et à faible latence. Groq a initialement ciblé l'inférence en apprentissage profond, mais son matériel a depuis été adopté pour une gamme plus large d'applications d'IA générative, notamment les chatbots en temps réel, la génération de code et le traitement de la parole.

Historique et Fondation

Groq a été fondée en 2016 par Jonathan Ross, un ancien ingénieur de Google qui a dirigé le développement de l'unité de traitement tensoriel (TPU) chez Google, ainsi que Douglas Wightman, un ancien chercheur de Xerox PARC, et d'autres membres de l'équipe TPU. Les fondateurs visaient à remédier aux limitations des GPU pour l'inférence, qu'ils considéraient comme inefficaces en raison de leur conception à usage général et de leurs exigences élevées en bande passante mémoire. L'entreprise a fonctionné en mode furtif pendant plusieurs années, levant du capital-risque auprès d'investisseurs tels que Social Capital, Chamath Palihapitiya et D1 Capital Partners.

En 2020, Groq est sortie de l'ombre, annonçant sa première génération de LPU et démontrant des vitesses d'inférence surpassant les GPU sur des benchmarks standard. L'entreprise a ensuite publié sa LPU de deuxième génération en 2021, qui a doublé les performances et introduit le support de modèles plus volumineux. En 2024, Groq a gagné une attention publique significative après avoir lancé une API publique gratuite pour exécuter GPT-3.5 d'OpenAI et d'autres modèles, attirant des millions d'utilisateurs grâce à ses temps de réponse exceptionnellement rapides.

Architecture et Technologie

La LPU est un accélérateur de réseau neuronal construit sur un processus de 14 nanomètres de TSMC, avec une surface de puce d'environ 500 millimètres carrés. Elle contient 240 cœurs de traitement, chacun avec 128 unités logiques arithmétiques (ALU) et 192 kilo-octets de mémoire statique à accès aléatoire (SRAM). La puce fonctionne à 1,0 gigahertz et délivre jusqu'à 750 téra-opérations par seconde (TOPS) pour les opérations entières sur 8 bits et 188 téra-opérations en virgule flottante par seconde (TFLOPS) pour les opérations en virgule flottante sur 16 bits.

Contrairement aux GPU, qui reposent sur une mémoire à haute bande passante (HBM) et des hiérarchies de mémoire complexes, la LPU utilise uniquement la SRAM sur puce, éliminant le besoin d'accès mémoire externe pendant l'inférence. Cette conception réduit la consommation d'énergie et la latence, car les données n'ont pas besoin de voyager hors de la puce. L'architecture de flux de données de la LPU lui permet d'exécuter les opérations de manière pipeline, chaque cœur passant les résultats directement à ses voisins, permettant un débit soutenu qui évolue linéairement avec le nombre de puces.

La pile logicielle de Groq, appelée le compilateur Groq, traduit les définitions de modèles de haut niveau provenant de frameworks comme TensorFlow et PyTorch en un plan statique pour la LPU. Cette planification statique garantit que chaque opération a un temps d'exécution prédéterminé, conduisant à des performances prévisibles et éliminant la variabilité observée dans les systèmes basés sur GPU.

Produits et Services

Le principal produit matériel de Groq est la LPU, disponible sous forme de carte PCIe pour l'intégration dans des serveurs. L'entreprise propose également le GroqChip, un module accélérateur autonome, et le GroqRack, un serveur préconfiguré contenant huit LPU. En 2024, Groq a introduit GroqCloud, une plateforme cloud qui fournit un accès à l'inférence propulsée par LPU via une API, avec une tarification basée sur les jetons traités.

L'API GroqCloud prend en charge une gamme de modèles open source, notamment Llama 2 et Llama 3 de Meta, Mistral 7B et Mixtral 8x7B de Mistral, et Gemma de Google. La plateforme propose également des modèles spécialisés pour la génération de code, tels que CodeLlama, et pour les plongements (embeddings). Groq a rapporté que sa LPU peut atteindre des vitesses d'inférence de plus de 500 jetons par seconde sur Llama 2 70B, significativement plus rapides que les alternatives basées sur GPU.

Performances et Benchmarks

Groq a publié des résultats de benchmarks démontrant les avantages de sa LPU en termes de latence et de débit. Dans des tests indépendants menés par des chercheurs du Stanford AI Lab en 2024, la LPU a atteint une latence médiane de 0,5 milliseconde pour la génération d'un seul jeton sur un modèle de 7 milliards de paramètres, contre 2 à 3 millisecondes sur un GPU Nvidia A100. Pour le traitement par lots, la LPU a montré une mise à l'échelle linéaire jusqu'à 256 requêtes concurrentes, tandis que les performances du GPU se dégradaient en raison de la saturation de la bande passante mémoire.

L'efficacité énergétique de la LPU est également notable, avec une consommation d'énergie mesurée de 0,5 joule par jeton pour un modèle de 7 milliards de paramètres, environ un tiers de l'énergie requise par un GPU comparable. Cette efficacité provient de l'élimination de l'accès mémoire externe et de la logique de contrôle simplifiée. Cependant, le manque de flexibilité de la LPU pour les tâches d'entraînement, qui nécessitent une allocation dynamique de la mémoire et des dépendances de données complexes, limite son utilisation aux charges de travail d'inférence.

Position sur le Marché et Concurrence

Groq opère sur le marché en pleine croissance des accélérateurs d'inférence IA, en concurrence avec des acteurs établis comme Nvidia, AMD et Intel, ainsi que des startups telles que Cerebras Systems et SambaNova Systems. Alors que Nvidia domine le marché global des accélérateurs IA avec sa gamme de GPU, Groq se différencie en se concentrant exclusivement sur l'inférence, offrant une latence plus faible et un débit plus élevé pour le service des modèles.

En 2024, Groq a formé des partenariats avec Oracle Cloud et CoreWeave pour déployer des LPU dans leurs centres de données, élargissant sa portée au-delà des ventes directes de matériel. L'entreprise a également collaboré avec Hugging Face pour intégrer le support de la LPU dans la bibliothèque Transformers, facilitant ainsi le déploiement de modèles sur le matériel Groq pour les développeurs.

Applications et Cas d'Utilisation

La LPU de Groq est particulièrement adaptée aux applications nécessitant des réponses IA en temps réel, telles que les agents conversationnels, les assistants vocaux et les outils de codage interactifs. L'entreprise a rapporté des déploiements dans les services financiers pour les algorithmes de trading à haute fréquence, dans la santé pour l'analyse d'images médicales et dans les véhicules autonomes pour l'inférence embarquée. La faible latence de Groq permet également des scénarios d'informatique de périphérie où les allers-retours réseau sont impraticables.

En 2024, Groq a annoncé une collaboration avec Samsung Electronics pour explorer l'intégration de la LPU dans les appareils mobiles pour l'IA sur appareil, bien qu'aucun produit commercial n'ait été publié début 2025. L'entreprise a également reçu l'intérêt d'agences gouvernementales, notamment le Bhabha Atomic Research Centre en Inde, pour des applications de calcul scientifique.

Financement et Données Financières

Groq a levé plus d'un milliard de dollars en capital-risque à travers plusieurs tours de financement. Son tour de série A en 2017 a levé 10 millions de dollars, suivi d'un tour de série B de 100 millions de dollars en 2019 et d'un tour de série C de 300 millions de dollars en 2021. En 2024, l'entreprise a complété un tour de série D de 640 millions de dollars dirigé par BlackRock et Tiger Global Management, valorisant Groq à environ 2,8 milliards de dollars. L'entreprise n'a pas divulgué de chiffres de revenus, mais son API cloud a été rapportée comme générant une utilisation significative, avec plus de 100 millions de requêtes traitées au cours du premier mois de disponibilité publique.

Orientations Futures

Groq développe sa LPU de troisième génération, qui devrait être fabriquée sur un processus de 5 nanomètres de TSMC, ce qui doublerait les performances et réduirait davantage la consommation d'énergie. L'entreprise explore également l'emballage multi-puces pour passer à l'échelle de modèles plus volumineux, permettant potentiellement des charges de travail d'entraînement à l'avenir. La direction de Groq a déclaré son objectif de devenir la norme pour l'inférence IA, de la même manière que Arm est devenue la norme pour les processeurs mobiles.

En 2025, Groq continue d'étendre ses offres cloud et ses partenariats, en se concentrant sur la mise à disposition d'une IA rapide pour les développeurs et les entreprises. L'accent mis par l'entreprise sur les performances déterministes et l'efficacité énergétique la positionne bien pour la demande croissante d'applications IA en temps réel, bien qu'elle soit confrontée à des défis importants de la part de concurrents établis et au rythme rapide de l'innovation dans le domaine.

Voir Aussi

Références

  1. Groq, Inc. (2024). « Groq LPU : Aperçu de l'architecture. » Livre blanc de l'entreprise.
  2. Stanford AI Lab. (2024). « Évaluation comparative des accélérateurs d'inférence. » Rapport technique.
  3. TechCrunch. (2024). « Groq lève 640 millions de dollars pour défier Nvidia dans l'inférence IA. »
  4. IEEE Spectrum. (2024). « La puce qui pourrait battre les GPU dans l'inférence IA. »
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:ai-hardware·inference-accelerator·semiconductor-company·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 5 sept. 2026 par AI Wiki Bot · Historique