Jamba est un grand modèle de langage publié par AI21 Labs en février 2024. Il se distingue par son architecture hybride, combinant un modèle d'espace d'état (SSM) Mamba avec un Transformer traditionnel, et par sa grande fenêtre de contexte pouvant atteindre 256 000 jetons. Le modèle a été publié avec des poids ouverts, permettant aux chercheurs et aux développeurs de le télécharger et de l'utiliser, et il utilise une conception de mélange d'experts (MoE) pour équilibrer les performances et l'efficacité computationnelle.
La publication a positionné Jamba comme une étape importante dans l'exploration d'alternatives à l'architecture Transformer standard, qui sous-tend la plupart des grands modèles de langage contemporains. En intégrant le SSM Mamba, qui offre un traitement en temps linéaire des longues séquences, avec les forces établies des mécanismes d'attention du Transformer, AI21 Labs visait à relever les défis computationnels liés au traitement de contextes très longs.
Contexte et développement
AI21 Labs, fondée en novembre 2017 à Tel Aviv, en Israël, par Yoav Shoham, Ori Goshen et Amnon Shashua, avait auparavant développé la série Jurassic de modèles de langage. Les travaux antérieurs de l'entreprise, notamment Jurassic-1 lancé en août 2021 et Jurassic-2 en mars 2023, ont établi son expertise en traitement du langage naturel. Jamba représentait une rupture avec ces modèles purement basés sur Transformer, intégrant l'architecture Mamba introduite fin 2023 par des chercheurs dont Albert Gu et Tri Dao.
Le développement de Jamba s'inscrivait dans une tendance de recherche plus large explorant les modèles d'espace d'état comme complément ou alternative potentielle aux mécanismes basés sur l'attention. L'architecture Mamba, connue pour ses espaces d'état sélectifs, offrait un moyen de traiter les séquences avec une complexité computationnelle qui évolue linéairement avec la longueur de la séquence, contrairement à l'échelle quadratique de l'attention standard. AI21 Labs cherchait à combiner cette efficacité avec les capacités éprouvées des Transformers dans les tâches nécessitant un raisonnement complexe et une compréhension contextuelle.
Architecture et détails techniques
L'architecture de Jamba est un hybride de couches SSM Mamba et de couches Transformer, disposées selon un motif entrelacé. Le modèle utilise une approche de mélange d'experts (MoE) dans ses couches feedforward, ce qui lui permet d'activer uniquement un sous-ensemble de paramètres pour chaque jeton, améliorant ainsi l'efficacité de l'inférence sans sacrifier la capacité du modèle. Le nombre total de paramètres est substantiel, mais les paramètres actifs par jeton sont nettement inférieurs grâce à la conception MoE.
La fenêtre de contexte de 256 000 jetons était un argument de vente clé, permettant au modèle de traiter de très longs documents, tels que des livres entiers ou des bases de code étendues, en une seule passe. Cette capacité était rendue possible par le traitement efficace des dépendances à longue portée des couches Mamba. Le modèle a été publié en plusieurs tailles, la version la plus grande ayant 52 milliards de paramètres au total, dont 12 milliards sont actifs pour un jeton donné.
Publication et disponibilité
AI21 Labs a annoncé Jamba le 28 février 2024, rendant les poids du modèle publiquement disponibles sous une licence ouverte. Cela a permis à la communauté de recherche d'affiner et de déployer le modèle sur sa propre infrastructure. La publication comprenait des points de contrôle du modèle et de la documentation, et le modèle a été mis à disposition sur des plateformes telles que Hugging Face. L'approche des poids ouverts contrastait avec les modèles fermés proposés par des concurrents comme OpenAI et Anthropic, bien qu'AI21 Labs ait également proposé un accès commercial via sa plateforme AI21 Studio.
Le calendrier de la publication a placé Jamba dans un paysage concurrentiel dominé par des modèles tels que GPT-4 d'OpenAI, Claude d'Anthropic et Gemini de Google DeepMind. Bien que Jamba n'ait pas égalé ces modèles de pointe en termes de performances globales sur les benchmarks, son architecture unique et sa longue fenêtre de contexte en ont fait une contribution notable au domaine, en particulier pour les applications nécessitant un traitement extensif de documents.
Performances et benchmarks
Dans les benchmarks rapportés par AI21 Labs, Jamba a démontré de solides performances sur les tâches impliquant la compréhension de contextes longs, telles que le résumé et la réponse à des questions sur de longs documents. Le modèle s'est montré compétitif avec d'autres modèles à poids ouverts de taille similaire, comme Mixtral 8x7B, tout en offrant une fenêtre de contexte plus longue. Sur des benchmarks standard de traitement du langage naturel comme MMLU et HellaSwag, les performances de Jamba étaient solides mais pas à la pointe, reflétant les compromis de sa conception hybride.
Les gains d'efficacité des couches Mamba ont été mis en évidence dans les tests de débit, où Jamba a montré des vitesses de génération de jetons plus élevées que les modèles Transformer purs de taille équivalente. Cela le rendait attrayant pour un déploiement dans des environnements aux ressources limitées, comme sur des appareils périphériques ou dans des applications nécessitant des réponses en temps réel.
Réception et impact
La publication de Jamba a suscité l'intérêt de la communauté de l'apprentissage automatique, en particulier parmi les chercheurs explorant des alternatives à l'architecture Transformer. Les poids ouverts du modèle ont facilité des recherches supplémentaires sur les conceptions hybrides SSM-Transformer, et plusieurs travaux ultérieurs ont cité Jamba comme source d'inspiration. Le modèle a également démontré que les modèles d'espace d'état pouvaient être mis à l'échelle à des tailles prêtes pour la production, encourageant les investissements dans cette ligne de recherche.
Les critiques ont noté que les performances de Jamba sur certains benchmarks ne correspondaient pas à celles des principaux modèles fermés, et que la complexité de son architecture pouvait poser des défis pour l'affinage et le déploiement. Cependant, la longue fenêtre de contexte et l'efficacité du modèle étaient perçues comme de véritables avantages, et AI21 Labs a continué à itérer sur la conception avec des publications ultérieures.
Développements ultérieurs
Suite à la publication initiale de Jamba, AI21 Labs a continué à développer la famille de modèles. En septembre 2024, l'entreprise s'est associée à Amazon Web Services pour rendre la famille Jamba 1.5 disponible sur Amazon Bedrock, intégrant les modèles dans des applications d'entreprise. En mars 2025, AI21 Labs a publié Jamba 1.6 pour un déploiement privé en entreprise, revendiquant des performances améliorées sur plusieurs benchmarks. La société a également lancé Maestro, un système de planification IA, le même mois.
Ces versions ultérieures ont affiné l'architecture hybride et élargi les capacités du modèle, bien que l'innovation centrale de combiner le SSM Mamba avec des couches Transformer soit restée centrale. La famille Jamba a établi AI21 Labs comme un acteur important dans l'espace des modèles à poids ouverts, aux côtés d'organisations comme Meta et Mistral AI.
Importance dans la recherche en IA
Le lancement de Jamba a contribué à l'exploration continue des innovations architecturales dans l'apprentissage profond. Le succès de l'approche hybride a suggéré que les futurs grands modèles de langage pourraient ne pas reposer uniquement sur les mécanismes d'attention, mais pourraient incorporer d'autres techniques de traitement de séquences. Le modèle a également souligné l'importance de l'efficacité dans le développement de l'IA, alors que les préoccupations concernant le coût computationnel de l'entraînement et du déploiement de grands modèles augmentaient.
La publication des poids ouverts a permis aux institutions académiques et aux chercheurs indépendants d'étudier le comportement du modèle, contribuant à une meilleure compréhension de la manière dont les différents composants architecturaux interagissent. Cette transparence était appréciée dans un domaine où de nombreux modèles de pointe sont fermés, et elle a aidé à démocratiser l'accès à la technologie avancée de l'IA.