Traduit de l'anglais

DBRX est un modèle de langage de grande taille à mélange d'experts open-source développé par Mosaic et publié par Databricks le 27 mars 2024, avec 132 milliards de paramètres au total et 36 milliards actifs par jeton.

DBRX est un grand modèle de langage développé par Mosaic sous sa société mère Databricks, publié le 27 mars 2024 sous la licence Databricks Open Model License. Il s'agit d'un modèle Transformer (architecture) à mélange d'experts comptant 132 milliards de paramètres au total, dont 36 milliards sont actifs pour chaque jeton, en mobilisant 4 des 16 experts. Le modèle publié se décline en deux versions : un modèle de base fondamental et une variante ajustée par instructions.

Au moment de sa publication, DBRX surpassait des modèles notables tels que Llama 2 de Meta, Mixtral de Mistral AI et Grok-1 de xAI sur plusieurs références couvrant la compréhension du langage, les capacités de programmation et les mathématiques. Son architecture et son approche d'entraînement l'ont positionné comme une alternative compétitive à poids ouverts dans le paysage en évolution rapide de la IA générative.

Architecture et conception

DBRX utilise une architecture à mélange d'experts (MoE), une conception qui divise les paramètres du modèle en plusieurs réseaux « experts » spécialisés. Pour chaque jeton d'entrée, un mécanisme de sélection choisit un sous-ensemble d'experts à traiter, permettant au modèle d'augmenter le nombre total de paramètres tout en maintenant un coût de calcul par jeton gérable. Dans DBRX, 16 experts sont disponibles, mais seulement 4 sont activés par jeton, ce qui donne 36 milliards de paramètres actifs sur 132 milliards au total. Cette activation éparse permet une inférence et un entraînement efficaces par rapport aux modèles denses de taille similaire.

Le modèle est construit sur l'architecture Transformer (architecture), qui utilise des mécanismes de attention multi-têtes pour traiter les données séquentielles. DBRX intègre des techniques courantes dans les LLM modernes, telles que la normalisation de couche et le encodage positionnel, pour stabiliser l'entraînement et capturer l'ordre des jetons. L'approche à mélange d'experts est une forme de élagage de modèle inversé - au lieu de supprimer des paramètres, elle utilise sélectivement une fraction d'entre eux, réduisant ainsi la charge de calcul.

Entraînement et développement

DBRX a été entraîné sur une période de 2,5 mois en utilisant 3 072 GPU Nvidia H100 connectés par une bande passante de 3,2 téraoctets par seconde via InfiniBand. Le coût d'entraînement rapporté était de 10 millions de dollars américains, un chiffre relativement modeste par rapport à certains modèles contemporains, reflétant l'efficacité de la conception MoE et l'optimisation du pipeline d'entraînement. Les données d'entraînement consistaient en un corpus diversifié de texte et de code, bien que les détails spécifiques n'aient pas été entièrement divulgués.

Le développement a été dirigé par Mosaic, une société acquise par Databricks en 2023, spécialisée dans l'entraînement efficace de modèles de apprentissage automatique. L'expertise de Mosaic en matière d'entraînement distribué et d'optimisation a contribué au calendrier et au coût d'entraînement relativement courts. Le modèle a été entraîné en utilisant des techniques telles que le écrêtage de gradient et des ajustements de plan de taux d'apprentissage pour garantir la stabilité.

Performance et références

Lors de sa publication, DBRX a démontré de fortes performances sur une gamme de références. Dans les tâches de compréhension du langage, il a surpassé Llama 2 et Mixtral, montrant un raisonnement et une compréhension améliorés. Dans les références de programmation, DBRX a excellé dans la génération de code et le débogage, surpassant Grok-1. Le raisonnement mathématique était un autre domaine où DBRX a montré des résultats compétitifs, égalant ou dépassant souvent des modèles avec des nombres de paramètres actifs plus importants.

Ces résultats ont souligné l'efficacité de l'approche à mélange d'experts, qui permet à DBRX d'atteindre une haute précision sans le coût de calcul complet d'un modèle dense de 132 milliards de paramètres. La variante ajustée par instructions a été optimisée pour les applications conversationnelles et orientées tâches, améliorant encore les performances sur les tâches alignées sur les préférences humaines.

Publication et licence

DBRX a été publié sous la licence Databricks Open Model License, qui permet une utilisation large, y compris des applications commerciales, avec certaines restrictions. La publication ouverte a permis aux chercheurs et aux développeurs d'accéder aux poids du modèle, facilitant ainsi des expérimentations et des ajustements supplémentaires. Cette décision s'est alignée sur une tendance dans la communauté de l'intelligence artificielle vers des modèles à poids ouverts, comme on l'a vu avec d'autres publications d'organisations telles que OpenAI et Anthropic, bien que celles-ci restent souvent propriétaires.

La disponibilité des versions de base et ajustée par instructions a offert une flexibilité pour différents cas d'utilisation, de la recherche au déploiement en production. Databricks a positionné DBRX comme un outil pour les entreprises, l'intégrant à leur plateforme de données et à leurs services cloud, y compris Amazon Web Services et Microsoft Azure.

Impact et héritage

DBRX a contribué au paysage compétitif des LLM open source, démontrant que des architectures MoE efficaces pouvaient rivaliser avec des modèles propriétaires plus grands. Son coût d'entraînement relativement faible et ses hautes performances en ont fait un point de référence pour le développement ultérieur de modèles. Le succès de DBRX a encouragé des investissements supplémentaires dans les conceptions MoE, qui ont depuis été adoptées par d'autres acteurs majeurs.

Dans le contexte plus large du apprentissage profond, DBRX a illustré la tendance à augmenter la capacité des modèles tout en gérant les budgets de calcul. Sa publication a également souligné le rôle du matériel spécialisé, tel que les GPU H100 de Nvidia, et l'importance des interconnexions à haute bande passante dans l'entraînement de grands modèles. Début 2025, DBRX reste un exemple notable de modèles MoE à poids ouverts, bien que des modèles plus récents aient depuis émergé avec des capacités améliorées.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·mixture-of-experts·open-source-ai·databricks
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique