Lancement de Databricks DBRX

Traduit de l'anglais

DBRX est un modèle de langage de grande taille à mélange d'experts open source publié par Databricks en mars 2024, conçu pour offrir des performances compétitives et une inférence efficace par rapport aux modèles établis.

DBRX est un modèle de langage de grande taille open source développé par Databricks, publié en mars 2024. Il utilise une architecture de mélange d'experts (MoE), une conception qui n'active qu'un sous-ensemble de ses paramètres pour chaque entrée, permettant une inférence efficace tout en maintenant des performances élevées. Le modèle a été positionné comme une alternative compétitive aux systèmes propriétaires de OpenAI et Anthropic, Databricks mettant l'accent sur sa disponibilité ouverte et son fonctionnement économique.

La publication de DBRX a marqué une étape importante dans la stratégie de Databricks visant à intégrer des capacités d'IA générative dans sa plateforme de données. Elle a suivi l'introduction antérieure par l'entreprise de Dolly, un modèle open source plus petit, et son acquisition de MosaicML en 2023. DBRX a été construit sur l'infrastructure existante de l'entreprise, qui comprend une plateforme cloud pour l'analyse de données et l'intelligence artificielle, fonctionnant nativement sur Amazon Web Services, Microsoft Azure et Google Cloud.

Architecture et Conception

DBRX utilise une architecture de mélange d'experts, une technique qui a gagné en importance dans les modèles de langage de grande taille pour sa capacité à augmenter les paramètres sans augmenter proportionnellement le coût computationnel. Le modèle contient 132 milliards de paramètres au total, mais seulement 36 milliards sont actifs lors de chaque passage avant. Cette activation éparse est réalisée grâce à un réseau de routage qui sélectionne les experts les plus pertinents pour chaque jeton, un mécanisme lié à attention multi-têtes et à d'autres composants de l'architecture transformer.

La conception MoE permet à DBRX d'atteindre des vitesses d'inférence comparables à celles de modèles beaucoup plus petits tout en conservant la capacité de connaissances d'un réseau plus grand. Databricks a rapporté que DBRX surpassait les modèles open source existants sur plusieurs références, y compris celles mesurant la compréhension du langage, le raisonnement et la génération de code. Le modèle a été entraîné sur un vaste corpus de texte et de code, Databricks mettant l'accent sur l'utilisation de techniques de curation et de filtrage de données de haute qualité.

Entraînement et Développement

DBRX a été développé par Databricks, une entreprise fondée en 2013 par les créateurs originaux d'Apache Spark à l'Université de Californie, Berkeley. Le processus d'entraînement a tiré parti de l'infrastructure propre de Databricks, y compris sa plateforme apprentissage automatique et la boîte à outils d'entraînement MosaicML acquise en 2023. L'entreprise n'a pas divulgué les ressources de calcul exactes utilisées, mais a déclaré que l'entraînement a été achevé dans un délai relativement court par rapport à des modèles similaires.

Le développement de DBRX s'inscrivait dans une tendance plus large de l'IA générative vers des modèles open source qui concurrencent les offres propriétaires. Databricks a positionné DBRX comme un modèle que les organisations pouvaient déployer dans leurs propres environnements, évitant ainsi la nécessité d'envoyer des données à des API externes. Cette approche s'alignait sur la focalisation de l'entreprise sur la fourniture d'infrastructure d'IA gérée dans un périmètre sécurisé, une fonctionnalité qui s'applique également à ses intégrations avec des modèles tiers.

Performances et Références

Databricks a publié des résultats de référence pour DBRX au moment de son lancement, montrant des performances compétitives par rapport aux modèles open source et propriétaires. Sur la référence MMLU, qui teste les connaissances générales dans 57 sujets, DBRX a obtenu un score de 73,7 %, surpassant plusieurs modèles open source existants. Sur la référence HumanEval pour la génération de code, DBRX a atteint un score pass@1 de 70,1 %, un résultat solide pour un modèle open source à l'époque.

Le modèle a également démontré de fortes performances sur des tâches de raisonnement, telles que la référence GSM8K pour les problèmes mathématiques de niveau scolaire, où il a obtenu un score de 72,8 %. Databricks a attribué ces résultats à l'architecture MoE et à la qualité des données d'entraînement. Cependant, l'entreprise n'a pas fourni de comparaison directe avec les modèles propriétaires les plus avancés de Google DeepMind ou OpenAI, et les évaluations indépendantes étaient limitées dans les mois suivant la publication.

Publication Open Source et Disponibilité

DBRX a été publié sous une licence open source, permettant aux chercheurs et aux développeurs de télécharger, modifier et déployer librement le modèle. Les poids ont été rendus disponibles via des plateformes telles que Hugging Face, et Databricks a fourni une documentation et des exemples pour le fine-tuning et l'inférence. Cette publication était notable pour sa taille, car la plupart des modèles open source à l'époque étaient significativement plus petits, et pour ses performances, qui approchaient celles des systèmes propriétaires.

La nature open source de DBRX était un choix délibéré de Databricks, contrastant avec les approches fermées d'OpenAI et d'Anthropic. L'entreprise a fait valoir que les modèles ouverts offrent une plus grande transparence et un meilleur contrôle pour les entreprises, en particulier celles des secteurs réglementés. DBRX a également servi de fondation pour les offres de produits propres de Databricks, y compris sa plateforme d'intelligence de données et ses outils pour construire des agents d'IA.

Intégration avec la Plateforme Databricks

DBRX a été intégré dans la plateforme Databricks, qui fournit un environnement unifié pour l'ingénierie des données, la science des données et l'IA. Les utilisateurs pouvaient accéder à DBRX via les capacités de service de modèles de la plateforme, qui prennent en charge l'inférence par lots et en temps réel. L'intégration permettait aux organisations de combiner DBRX avec leurs propres données stockées dans l'architecture lakehouse, un hybride d'entrepôts de données et de lacs de données que Databricks a pionnier.

La plateforme offrait également des outils pour le fine-tuning de DBRX sur des ensembles de données personnalisés, utilisant des techniques telles que apprentissage par renforcement à partir de retours d'IA et apprentissage par curriculum. Databricks a positionné ces capacités comme un moyen pour les entreprises de construire des modèles spécifiques à un domaine sans le coût d'un entraînement de zéro. La stratégie plus large de l'entreprise impliquait d'offrir une gamme de modèles, y compris des modèles propriétaires de partenaires, en plus de ses propres publications open source.

Contexte du Marché et Réception

Le lancement de DBRX a eu lieu pendant une période de concurrence intense dans le domaine des modèles de langage de grande taille. OpenAI avait publié GPT-4 en mars 2023, et Anthropic avait introduit Claude 3 en mars 2024, quelques semaines seulement avant DBRX. La publication était également notable pour son timing par rapport à la croissance financière de Databricks, l'entreprise rapportant 1,6 milliard de dollars de revenus pour l'exercice fiscal 2023 et levant des cycles de financement significatifs.

La réception de DBRX a été généralement positive, les critiques saluant ses performances par rapport à sa taille et sa licence ouverte. Certains analystes ont noté que l'architecture MoE le rendait particulièrement attrayant pour les déploiements sensibles aux coûts, car l'activation éparse réduisait les exigences de calcul. Cependant, le modèle a rencontré des défis en termes d'adoption dans l'écosystème, car il concurrençait des modèles open source plus établis et la popularité croissante de modèles plus petits et plus efficaces.

Impact et Héritage

DBRX a contribué à la tendance plus large des modèles open source à combler l'écart avec les systèmes propriétaires. Sa publication a démontré que les architectures MoE pouvaient être efficacement entraînées et déployées à grande échelle, influençant les conceptions de modèles ultérieures d'autres organisations. Databricks a continué à développer ses capacités d'IA, introduisant plus tard des modèles et des outils supplémentaires, y compris la suite Agent Bricks pour construire des agents d'IA et Lakebase, une base de données conçue pour les applications d'IA.

Le modèle a également mis en évidence l'importance stratégique de l'IA open source pour les entreprises de logiciels d'entreprise. En publiant DBRX, Databricks s'est positionné comme un fournisseur à la fois d'infrastructure et de modèles, concurrençant les fournisseurs de cloud et les startups d'IA. Les partenariats ultérieurs de l'entreprise avec OpenAI et Anthropic en 2025, qui ont intégré leurs modèles dans la plateforme Databricks, ont montré qu'elle continuait à soutenir une approche multi-modèles en plus de ses propres offres.

Spécifications Techniques

Les détails techniques de DBRX ont été divulgués dans un rapport technique et un article de blog publiés par Databricks. Le modèle utilise une architecture de décodeur transformer standard avec une couche de mélange d'experts remplaçant le réseau feedforward. Il a 132 milliards de paramètres au total, avec 36 milliards actifs pendant l'inférence. Le modèle a été entraîné sur 12 billions de jetons de texte et de code, un ensemble de données substantiel qui a nécessité des ressources de calcul significatives.

Le modèle prend en charge une longueur de contexte de 32 768 jetons, lui permettant de traiter des documents et des conversations longs. Il utilise un tokenizer avec un vocabulaire de 100 000 jetons, permettant un encodage efficace de textes divers. Databricks a également publié une version fine-tunée, DBRX Instruct, optimisée pour suivre des instructions et des interactions de type chat. Le processus de fine-tuning a utilisé l'apprentissage supervisé et apprentissage par renforcement à partir de retours humains, des techniques courantes dans le développement de modèles de langage modernes.

Comparaison avec les Modèles Contemporains

Au moment de sa publication, DBRX a été comparé à plusieurs autres modèles open source, y compris Llama 2 de Meta et Mixtral 8x7B de Mistral. DBRX surpassait généralement ces modèles sur les références standard, en particulier dans la génération de code et les tâches de raisonnement. Les performances du modèle ont également été comparées favorablement à certains modèles propriétaires, bien qu'il n'ait pas égalé les systèmes les plus avancés d'OpenAI ou de Google.

L'architecture MoE a donné à DBRX un avantage distinct en termes d'efficacité d'inférence. Avec seulement 36 milliards de paramètres actifs, il nécessitait moins de calcul par jeton que les modèles denses de taille totale similaire. Cela le rendait adapté au déploiement sur une gamme de matériel, y compris les processeurs AMD et Intel, ainsi que des accélérateurs spécialisés. Databricks n'a pas fourni de mesures de latence spécifiques, mais la conception de l'architecture suggérait des performances compétitives.

Développements Futurs

Après la publication de DBRX, Databricks a continué à investir dans la recherche et le développement en IA. Les acquisitions et partenariats ultérieurs de l'entreprise, y compris son partenariat de 2025 avec OpenAI et son acquisition d'Electric en 2026, ont indiqué une focalisation sur l'expansion de ses capacités d'IA. Bien que Databricks n'ait pas annoncé de successeur direct à DBRX, l'architecture du modèle et sa philosophie open source ont influencé les produits ultérieurs de l'entreprise.

Le paysage plus large de l'IA a évolué rapidement après le lancement de DBRX, avec de nouveaux modèles et techniques émergeant régulièrement. L'accent sur l'efficacité et la disponibilité ouverte que DBRX a illustré est resté un thème clé dans l'industrie, alors que les organisations cherchaient à déployer l'IA de manière économique et transparente. Le rôle de Databricks en tant que développeur de modèles et fournisseur d'infrastructure l'a positionné pour bénéficier de ces tendances.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:databricks·large-language-model·open-source-ai·mixture-of-experts
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique