MPT (MosaicML Pretrained Transformer) est une famille de grands modèles de langage open-source développée par MosaicML, une entreprise ensuite acquise par Databricks. Les modèles sont conçus pour être commercialement utilisables, ce qui signifie qu'ils sont publiés sous des licences permissives permettant une large application dans des contextes commerciaux et de recherche. Les modèles MPT sont basés sur l'architecture transformeur et se distinguent par leurs méthodes d'entraînement efficaces et leurs fenêtres de contexte longues, ce qui en fait une alternative pratique aux modèles propriétaires d'organisations comme OpenAI ou Google DeepMind.
Le premier modèle MPT, MPT-7B, a été publié en mai 2023, suivi de MPT-30B en juin 2023. Ces modèles ont été entraînés à l'aide de la plateforme MosaicML, qui exploite des techniques d'optimisation telles que le clipping de gradient et la normalisation de couche pour atteindre des performances élevées avec moins de ressources computationnelles. Les modèles MPT ont été largement adoptés dans l'écosystème de l'IA générative, en particulier pour des tâches comme la génération de texte, le résumé et la complétion de code.
Architecture et entraînement
Les modèles MPT utilisent une architecture de transformeur à décodeur seul, similaire à d'autres LLM modernes. Cependant, ils intègrent plusieurs innovations pour améliorer l'efficacité et les capacités. Notamment, les modèles MPT utilisent l'attention multi-têtes avec un support pour des séquences plus longues, obtenu grâce à des techniques comme ALiBi (Attention with Linear Biases), qui permet au modèle d'extrapoler à des contextes plus longs que ceux vus pendant l'entraînement. Cela diffère des méthodes traditionnelles de encodage positionnel, permettant à MPT-7B de gérer jusqu'à 84 000 jetons dans certaines configurations.
L'entraînement a été mené sur de grands ensembles de données de texte et de code publiquement disponibles, avec un accent sur la qualité et la diversité des données. MosaicML a rapporté que MPT-7B a été entraîné sur 1 billion de jetons, tandis que MPT-30B a été entraîné sur 1,2 billion de jetons. Le processus d'entraînement a utilisé l'optimiseur Adam avec un plan de taux d'apprentissage comprenant un échauffement et une décroissance cosinusoïdale. De plus, l'initialisation des poids a été soigneusement ajustée pour stabiliser l'entraînement à grande échelle.
Utilisabilité commerciale et licences
Un différenciateur clé des modèles MPT est leur licence. MPT-7B est publié sous la licence Apache 2.0, qui permet une utilisation, une modification et une distribution sans restriction, y compris à des fins commerciales. MPT-30B est publié sous une licence personnalisée également permissive sur le plan commercial, bien qu'elle inclue une restriction sur l'utilisation du modèle pour améliorer d'autres grands modèles de langage. Cette stratégie de licence a été conçue pour encourager l'adoption tout en protégeant les intérêts concurrentiels de MosaicML.
L'utilisabilité commerciale des modèles MPT les a rendus attrayants pour les startups et les entreprises qui souhaitaient éviter les coûts d'API et les préoccupations de confidentialité des données associés aux modèles fermés. Les entreprises pouvaient déployer les modèles MPT sur leur propre infrastructure, en utilisant des services cloud comme Amazon Web Services, Azure ou Google Cloud, ou sur du matériel spécialisé tel que les accélérateurs AWS Trainium ou Groq.
Performances et benchmarks
Les modèles MPT ont démontré des performances compétitives sur des benchmarks standard. MPT-7B, par exemple, a obtenu des résultats solides sur des tâches comme MMLU (Massive Multitask Language Understanding) et HellaSwag, surpassant souvent d'autres modèles open-source de taille similaire au moment de leur publication. MPT-30B a encore amélioré ces scores, se rapprochant des performances de modèles propriétaires plus grands dans certains domaines.
Dans les tâches de génération de code, les modèles MPT ont bien performé sur des benchmarks comme HumanEval, grâce à leur entraînement sur des ensembles de données riches en code. Les modèles ont également montré des capacités robustes en suivi d'instructions, en particulier après un affinage avec des techniques comme l'apprentissage par renforcement à partir de retours d'IA ou un affinage supervisé sur des ensembles de données d'instructions organisés.
Écosystème et impact
Les modèles MPT sont devenus une base pour de nombreux travaux dérivés. Les développeurs ont créé des variantes affinées pour des tâches spécifiques, telles que le chat, le résumé et des applications spécifiques à un domaine. Les modèles ont été intégrés dans des plateformes comme Hugging Face, les rendant facilement accessibles pour l'expérimentation et le déploiement.
La publication de MPT a contribué à la tendance plus large des LLM open-source défiant la domination propriétaire. Elle a démontré que des techniques d'entraînement efficaces pouvaient produire des modèles de haute qualité sans les budgets massifs des géants de la technologie. MPT a également influencé les développements ultérieurs de modèles, comme la série Llama, en soulignant l'importance de l'efficacité d'entraînement et des capacités de contexte long.
Limites et orientations futures
Malgré leurs forces, les modèles MPT présentent des limites. Ils peuvent exhiber des biais présents dans leurs données d'entraînement, et leur exactitude factuelle n'est pas toujours fiable, un problème courant parmi les LLM. Les modèles nécessitent également des ressources computationnelles importantes pour l'inférence, bien que la quantification et d'autres techniques d'optimisation puissent atténuer cela.
Après l'acquisition de MosaicML par Databricks en 2023, le développement de la ligne MPT a finalement été supplanté par d'autres modèles, comme DBRX, qui ont intégré les leçons tirées de MPT. Cependant, MPT reste une étape importante dans l'histoire de l'IA open-source, démontrant que des LLM commercialement viables peuvent être construits et partagés ouvertement.
Voir aussi
Références
Rapports techniques et articles de blog de MosaicML (2023).
Liens externes
(Aucun lien externe fourni.)