Groq Inc. est une entreprise technologique spécialisée dans le matériel et les logiciels d'inférence en intelligence artificielle (IA). L'entreprise est surtout connue pour avoir développé l'unité de traitement du langage (LPU), une architecture de processeur spécialisée conçue pour accélérer l'exécution de grands modèles de langage (LLM) et d'autres charges de travail d'IA. L'objectif principal de Groq est de fournir des solutions d'inférence à très faible latence, se positionnant comme une alternative aux unités de traitement graphique (GPU) pour exécuter des modèles d'IA générative.
Fondée en 2016 par une équipe d'anciens ingénieurs de Google, Groq est issue de l'expérience acquise dans la construction d'accélérateurs d'IA personnalisés pour les centres de données de Google. Les fondateurs de l'entreprise, dont Jonathan Ross, qui a précédemment travaillé sur le projet d'unité de traitement tensoriel (TPU) de Google, visaient à créer un processeur capable de surmonter les goulots d'étranglement de la bande passante mémoire courants dans l'inférence IA basée sur GPU. Groq est basée à Mountain View, en Californie, et a depuis élargi ses activités pour inclure des services cloud et des déploiements en entreprise.
Architecture et technologie
Le cœur de la technologie de Groq est la LPU, un processeur de streaming tensoriel (TSP) qui utilise une architecture de flux de données. Contrairement aux CPU et GPU conventionnels, qui reposent sur une logique de contrôle complexe et de grands caches, la LPU est conçue pour exécuter des instructions de manière déterministe et en continu. Cette approche élimine la surcharge liée à la récupération et au décodage des instructions, permettant une exécution prévisible et extrêmement rapide des opérations de réseaux neuronaux.
La LPU de Groq est construite sur une conception à puce unique avec un réseau massif d'éléments de traitement. L'architecture est optimisée pour les multiplications matricielles et les fonctions d'activation qui dominent les modèles basés sur les transformeurs. En maintenant un flux de données synchronisé à travers le processeur, la LPU atteint une utilisation élevée et une faible latence, en particulier pour l'inférence avec une taille de lot de un, courante dans les applications d'IA interactives.
Produits et services
Groq propose son matériel LPU via plusieurs canaux. L'entreprise fournit des systèmes sur site pour les entreprises et les institutions de recherche, ainsi qu'un accès à son matériel via une plateforme cloud. En 2024, Groq a lancé un service cloud permettant aux développeurs d'exécuter des LLM open source, tels que Llama et Mistral, sur des LPU, en mettant l'accent sur la vitesse et la rentabilité. Ce service a attiré l'attention pour sa capacité à générer des tokens à des taux nettement plus rapides que de nombreuses offres basées sur GPU.
En plus du matériel, Groq a développé une pile logicielle comprenant un compilateur et un environnement d'exécution. Le compilateur Groq traduit les modèles issus de frameworks populaires, tels que PyTorch et ONNX, en instructions optimisées pour la LPU. L'entreprise a également établi des partenariats avec d'autres sociétés pour intégrer sa technologie dans une infrastructure d'IA plus large, notamment des collaborations avec des fournisseurs de cloud et des intégrateurs de systèmes.
Position sur le marché et concurrence
Groq opère dans le domaine concurrentiel des accélérateurs d'inférence IA, rivalisant avec des acteurs établis comme NVIDIA et des startups émergentes telles que Cerebras et SambaNova. Alors que Nvidia domine le marché de l'entraînement IA avec ses GPU, Groq cible le segment de l'inférence, où la latence et le débit sont critiques. La LPU de l'entreprise est particulièrement adaptée aux applications en temps réel, notamment les chatbots, la génération de code et d'autres services d'ia-générative interactifs.
L'approche de Groq a attiré des investissements de grandes entreprises technologiques. En 2021, l'entreprise a levé 300 millions de dollars lors d'un cycle de financement mené par d1-capital et tiger-global-management, avec la participation de the-whale-rock-group et d'autres. Groq a également reçu le soutien de Samsung Electronics et Intel, reflétant l'intérêt des fabricants de semi-conducteurs établis pour les architectures alternatives dans le domaine de l'IA.
Applications et cas d'utilisation
La technologie de Groq est utilisée dans une variété d'applications d'IA, en particulier celles nécessitant des temps de réponse rapides. Les LPU de l'entreprise ont été déployées dans des scénarios d'informatique en périphérie, tels que les véhicules autonomes et la robotique, où une faible latence est essentielle. Groq a également collaboré avec des organisations de recherche et des universités pour accélérer les charges de travail d'apprentissage-automatique, y compris les modèles d'apprentissage-profond pour le traitement du langage naturel et la vision par ordinateur.
Dans le secteur des entreprises, le service cloud de Groq permet aux entreprises de déployer des applications basées sur de grands-modèles-de-langage sans investir dans du matériel dédié. La plateforme prend en charge le réglage fin et l'inférence pour des modèles comme GPT-J et Llama 2, permettant aux entreprises de créer des assistants personnalisés et des outils analytiques. Les performances déterministes de Groq séduisent également les secteurs ayant des exigences strictes en matière de latence, comme le trading financier et le diagnostic de santé.
Orientations futures
Groq continue de faire évoluer ses offres matérielles et logicielles. L'entreprise a annoncé des plans pour des LPU de nouvelle génération avec des capacités de mémoire et de traitement accrues, visant à prendre en charge des modèles plus volumineux et des charges de travail plus complexes. Groq explore également des moyens d'intégrer sa technologie avec des frameworks et outils d'intelligence-artificielle existants, facilitant ainsi l'adoption de ses LPU par les développeurs.
Alors que la demande pour l'inférence IA augmente, Groq est confrontée au défi de faire évoluer sa production et de concurrencer des écosystèmes GPU bien établis. La focalisation de l'entreprise sur des processeurs spécialisés et hautes performances la positionne comme un acteur de niche, mais sa technologie a le potentiel d'influencer le paysage plus large du matériel d'IA. Le succès de Groq dépendra de sa capacité à démontrer des avantages clairs en termes de vitesse, de coût et d'efficacité énergétique par rapport aux solutions existantes.