Dolly est un grand modèle de langage ajusté par instructions, développé par Databricks et publié pour la première fois en mars 2023. Il a démontré qu'un modèle relativement petit, affiné sur un ensemble de données modeste, pouvait atteindre un comportement compétent de suivi d'instructions, remettant en question l'hypothèse dominante selon laquelle une échelle massive et des données propriétaires étendues étaient nécessaires pour de telles capacités. Le projet visait à rendre la personnalisation des LLM accessible aux entreprises en montrant que l'ajustement fin pouvait être effectué sur une seule machine en peu de temps.
La version initiale, Dolly 1.0, était basée sur le modèle GPT-J 6B d'EleutherAI et affinée sur un ensemble de données d'environ 15 000 paires instruction-réponse générées par les employés de Databricks. Cela a été suivi par Dolly 2.0 en avril 2023, qui utilisait le même modèle de base mais introduisait un ensemble de données open-source plus vaste de 15 000 paires, publié sous une licence permissive. Dolly 2.0 est devenu notable pour être l'un des premiers modèles ajustés par instructions open-source avec un ensemble de données d'entraînement entièrement ouvert, permettant aux chercheurs de reproduire et de développer ce travail.
Approche technique
L'entraînement de Dolly utilisait une technique connue sous le nom d'ajustement par instructions, où un modèle de langage pré-entraîné est affiné sur des exemples d'instructions et de réponses correspondantes. Ce processus aligne le comportement du modèle avec l'intention de l'utilisateur, lui permettant de suivre des invites dans diverses tâches telles que le résumé, la réponse à des questions et la génération de texte. L'ajustement fin utilisait un objectif d'apprentissage supervisé standard, optimisant le modèle pour prédire les jetons de réponse donnés l'instruction. Databricks a utilisé sa propre plateforme d'apprentissage automatique pour gérer le pipeline d'entraînement, mais le modèle lui-même était conçu pour fonctionner sur du matériel standard, y compris un seul GPU Nvidia A10 pour l'inférence.
Le modèle de base, GPT-J, est une architecture basée sur transformateur avec 6 milliards de paramètres, entraînée sur l'ensemble de données Pile. L'ajustement fin de Dolly n'a pas modifié l'architecture de base mais a ajusté les poids pour se spécialiser dans le suivi d'instructions. Cette approche contrastait avec des modèles plus grands comme ceux de OpenAI ou Anthropic, qui nécessitent souvent des ressources computationnelles massives et des données d'entraînement propriétaires.
Publication et impact
Dolly a été publié sous la licence Apache 2.0, le rendant librement disponible pour un usage commercial et de recherche. L'ensemble de données accompagnant, surnommé « databricks-dolly-15k », a également été rendu open-source, une rareté à l'époque. Cette ouverture a permis à la communauté d'apprentissage automatique d'étudier les effets de l'ajustement par instructions et de créer des modèles dérivés. La publication de Dolly a suscité des discussions sur la démocratisation de l'IA, car elle montrait que des organisations sans ressources vastes pouvaient construire des assistants compétents.
Cependant, les performances de Dolly n'étaient pas à la hauteur des modèles de pointe comme GPT-3.5 ou Claude, et il présentait des limitations dans le raisonnement complexe et la précision factuelle. Néanmoins, il a servi de preuve de concept pour un ajustement fin efficace, influençant des efforts open-source ultérieurs tels que Alpaca et Vicuna. Databricks a positionné Dolly comme un outil permettant aux entreprises de créer des assistants IA personnalisés en utilisant leurs propres données, en s'intégrant à leur architecture lakehouse.
Réception et héritage
Dolly a reçu une attention médiatique significative lors de sa publication, avec une couverture dans la presse technologique soulignant son faible coût d'entraînement (rapporté à moins de 30 $ pour le calcul) et son défi au récit selon lequel seuls les géants de la technologie pouvaient développer des LLM. Le modèle a été loué pour sa transparence, mais certains critiques ont noté que ses capacités étaient limitées par rapport aux offres commerciales. Au fil du temps, Dolly a été supplanté par des modèles ouverts plus puissants, mais son ensemble de données et sa méthodologie ont continué à être utilisés dans la recherche.
Databricks a ensuite intégré Dolly dans sa plateforme, permettant aux clients d'affiner et de déployer le modèle pour des cas d'utilisation spécifiques. Le projet a également contribué à la tendance plus large du développement de LLM open-source, encourageant davantage d'expérimentation avec l'ajustement par instructions sur des modèles plus petits. En 2025, Dolly est considéré comme un jalon historique dans l'évolution de l'IA accessible, bien qu'il ne soit plus activement développé.
Voir aussi
- IA générative
- apprentissage profond
- réseau de neurones
- Amazon Web Services (pour le déploiement de LLM basé sur le cloud)
Références
(Note : Cet article est basé sur des informations publiquement disponibles et ne cite pas de sources externes.)