SambaNova Cloud est une plateforme d'inférence basée sur le cloud développée par SambaNova Systems, une entreprise spécialisée dans le matériel et les logiciels d'IA. La plateforme permet aux développeurs et aux entreprises d'exécuter des grands modèles de langage (LLM) open-source à grande vitesse en utilisant les circuits intégrés spécifiques à une application (ASIC) personnalisés de SambaNova, connus sous le nom d'unité de traitement de flux de données SambaNova (DPU). Lancé en 2023, SambaNova Cloud fournit un environnement géré où les utilisateurs peuvent accéder à des modèles tels que Llama 3.1, Llama 3.2, Qwen 2.5 et d'autres modèles open-source populaires sans gérer l'infrastructure sous-jacente. Le service propose à la fois un terrain de jeu gratuit pour l'expérimentation et une API payante pour une utilisation en production, avec un accent sur l'inférence à faible latence et l'efficacité des coûts.
La plateforme est construite sur la puce SN40L de SambaNova, une DPU de deuxième génération qui intègre 104 milliards de transistors et prend en charge jusqu'à 256 Go de mémoire sur puce. Cette architecture matérielle est conçue pour accélérer les modèles basés sur des transformeurs, qui constituent la base de la plupart des LLM modernes. SambaNova Cloud prétend offrir des vitesses d'inférence nettement plus rapides que les alternatives basées sur GPU, certains benchmarks montrant jusqu'à 3 fois d'amélioration du débit pour des modèles comme Llama 3.1 405B. Le service prend en charge à la fois la génération de texte et les tâches multimodales, y compris les modèles de vision-langage, et offre des fonctionnalités telles que le traitement par lots, les réponses en streaming et les capacités de fine-tuning.
Historique et développement
SambaNova Systems a été fondée en 2017 par Kunle Olukotun, professeur à l'université de Stanford, et Chris Ré, également professeur à Stanford, avec une équipe d'ingénieurs et de chercheurs. L'entreprise s'est d'abord concentrée sur la création de solutions d'IA full-stack, comprenant du matériel et des logiciels, pour les clients d'entreprise. En 2023, SambaNova a pivoté vers une stratégie cloud-first, lançant SambaNova Cloud comme plateforme publique pour démocratiser l'accès à l'inférence d'IA haute performance. La première version publique de la plateforme a eu lieu en septembre 2023, offrant un accès à des modèles comme Llama 2 et CodeLlama. Depuis, la plateforme a élargi son catalogue de modèles et introduit des fonctionnalités telles que l'API SambaNova Cloud, compatible avec le format d'API d'OpenAI, facilitant ainsi la migration des développeurs depuis d'autres fournisseurs.
En 2024, SambaNova Cloud a gagné une traction significative, en particulier après la sortie de Llama 3.1, que la plateforme a servi à grande vitesse. L'entreprise a également annoncé des partenariats avec diverses organisations, notamment le département de l'Énergie des États-Unis, pour fournir des capacités d'inférence d'IA pour la recherche scientifique. Début 2025, SambaNova Cloud avait traité des milliards de jetons et était utilisé par des milliers de développeurs et d'entreprises.
Matériel et performances
Le cœur de SambaNova Cloud est la puce SN40L, qui est une architecture de flux de données reconfigurable différente des GPU traditionnels. Contrairement aux GPU, qui utilisent un jeu d'instructions fixe, la SN40L peut être reconfigurée dynamiquement pour optimiser le flux de données pour des architectures de modèles spécifiques. Cela permet une exécution efficace des modèles de transformeurs, réduisant les goulots d'étranglement de mémoire et améliorant le débit. La puce SN40L comprend 104 milliards de transistors et dispose de 256 Go de mémoire à large bande passante (HBM) sur puce, ce qui est crucial pour gérer de grands modèles sans mouvements de données excessifs. SambaNova affirme que cette architecture permet jusqu'à 3 fois d'inférence plus rapide pour des modèles comme Llama 3.1 405B par rapport aux solutions GPU leaders, tout en consommant moins d'énergie.
En pratique, SambaNova Cloud a démontré des performances impressionnantes dans des benchmarks tiers. Par exemple, lors d'une évaluation en 2024 par Artificial Analysis, SambaNova Cloud a atteint le débit le plus élevé pour Llama 3.1 405B, servant plus de 200 jetons par seconde par utilisateur. La plateforme prend également en charge des réponses à faible latence, avec un temps jusqu'au premier jeton souvent inférieur à 1 seconde pour de nombreux modèles. Ces caractéristiques de performance rendent SambaNova Cloud attrayant pour des applications en temps réel telles que les chatbots, la génération de code et la synthèse.
Catalogue de modèles et fonctionnalités
SambaNova Cloud propose un catalogue croissant de modèles open-source, notamment Llama 3.1 (8B, 70B, 405B), Llama 3.2 (1B, 3B, 11B, 90B), Qwen 2.5 (7B, 14B, 72B) et Mistral 7B. La plateforme prend également en charge des modèles spécialisés comme CodeLlama pour la génération de code et des modèles de vision-langage tels que Llama 3.2 Vision. Les utilisateurs peuvent accéder à ces modèles via un terrain de jeu web, une API REST ou un SDK Python. L'API est conçue pour être compatible avec l'API d'OpenAI, permettant aux développeurs de migrer avec des modifications minimales. De plus, SambaNova Cloud offre des fonctionnalités comme le mode JSON, l'appel de fonction et les réponses en streaming, essentielles pour construire des applications de niveau production.
Pour les entreprises, SambaNova Cloud propose des options de capacité dédiée, y compris des clusters privés et des déploiements sur site. La plateforme prend également en charge le fine-tuning de modèles sur des ensembles de données personnalisés, permettant aux organisations d'adapter les modèles open-source à leurs domaines spécifiques. Les fonctionnalités de sécurité incluent le chiffrement des données en transit et au repos, ainsi que la conformité à des normes telles que SOC 2.
Paysage concurrentiel
SambaNova Cloud concurrence d'autres fournisseurs d'inférence d'IA cloud, y compris l'API d'OpenAI, Claude d'Anthropic et Vertex AI de Google Cloud, ainsi que des entreprises spécialisées en matériel d'IA comme Cerebras et Groq. Alors que les clouds basés sur GPU comme AWS Trainium et Microsoft Azure offrent des services d'IA à usage général, SambaNova Cloud se différencie en se concentrant exclusivement sur les modèles open-source et en fournissant une inférence à haute vitesse sur du matériel personnalisé. Comparé à Groq, qui offre également une inférence rapide sur des puces spécialisées, SambaNova Cloud prend en charge des modèles plus grands (par exemple, 405B) et fournit un ensemble de fonctionnalités plus complet. Le prix de la plateforme est généralement inférieur à celui des alternatives basées sur GPU pour les charges de travail à volume élevé, ce qui en fait un choix rentable pour les applications axées sur l'inférence.
Cas d'utilisation et adoption
SambaNova Cloud est utilisé dans divers secteurs, notamment la finance, la santé et la technologie. Par exemple, les institutions financières utilisent la plateforme pour l'analyse de documents en temps réel et l'évaluation des risques, tandis que les organisations de santé l'exploitent pour la synthèse de littérature médicale et le soutien aux décisions cliniques. La plateforme a également été adoptée par des chercheurs académiques et des startups pour le prototypage et le déploiement d'applications d'IA. En 2024, SambaNova Cloud a été sélectionné par le laboratoire national d'Oak Ridge du département de l'Énergie des États-Unis pour alimenter l'inférence d'IA pour la recherche scientifique, soulignant sa fiabilité et ses performances. De plus, la plateforme a été intégrée à des outils comme LangChain et LlamaIndex, facilitant la construction de flux de travail d'IA complexes pour les développeurs.
Orientations futures
SambaNova Systems continue d'investir dans l'amélioration de SambaNova Cloud, avec des plans pour élargir son catalogue de modèles et renforcer ses capacités de fine-tuning. L'entreprise développe également du matériel de nouvelle génération, comme la puce SN50, qui devrait encore augmenter les performances et l'efficacité. Alors que la demande pour l'inférence de LLM open-source croît, SambaNova Cloud vise à se positionner comme une plateforme leader pour un déploiement d'IA à haute vitesse et rentable. Cependant, le paysage concurrentiel reste intense, avec les principaux fournisseurs de cloud et des startups spécialisées qui se disputent tous des parts de marché. Le succès de SambaNova dépendra de sa capacité à maintenir des avantages en termes de performances et à construire un écosystème solide de développeurs et de clients d'entreprise.