BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) est un modèle de langage de grande taille en accès ouvert publié en 2022. Il a été développé par l'initiative BigScience, un effort de recherche bénévole visant à fournir une alternative créée de manière transparente aux modèles d'IA propriétaires. Avec 176 milliards de paramètres, BLOOM est un modèle autorégressif basé sur l'architecture transformeur, conçu pour générer du texte dans 46 langues naturelles et 13 langages de programmation. Le modèle est distribué sous la licence « Responsible AI License » du projet.
Développement
BLOOM est le principal résultat de l'initiative BigScience, un atelier de recherche d'un an coordonné par Hugging Face avec le financement du gouvernement français. Le projet a impliqué plusieurs centaines de chercheurs et ingénieurs bénévoles issus du monde académique et du secteur privé. Le modèle a été entraîné entre mars et juillet 2022 sur le supercalculateur public Jean Zay en France, géré par GENCI et IDRIS (CNRS). Contrairement aux modèles antérieurs comme GPT-3, BLOOM a été explicitement entraîné pour être multilingue, couvrant des langues de familles diverses, notamment l'anglais, le français, l'espagnol, le chinois, l'arabe, l'hindi et bien d'autres.
Le code source de BLOOM est publié sous licence Apache 2.0, tandis que les paramètres du modèle sont publiés sous la licence BigScience Responsible AI License (RAIL). Cette licence accorde un accès ouvert et des droits de réutilisation, mais inclut des restrictions d'utilisation, comme l'interdiction d'employer le modèle dans des applications nuisibles. La nature ouverte de BLOOM contraste avec les modèles propriétaires d'entreprises comme OpenAI et Google DeepMind, ce qui en fait une ressource significative pour les chercheurs et développeurs recherchant la transparence en IA.
Données d'entraînement et architecture
Le corpus d'entraînement de BLOOM, nommé ROOTS, combine des données extraites de la version alors la plus récente du corpus web OSCAR (38 % de ROOTS) avec des données nouvellement collectées à partir d'une liste de sources de données linguistiques sélectionnée et documentée manuellement. Au total, le modèle a été entraîné sur environ 366 milliards de jetons (1,6 To de texte). L'architecture est basée sur le modèle transformeur, plus précisément une conception autorégressive à décodeur seul, similaire à GPT-3 mais avec des améliorations pour les performances multilingues. L'entraînement a utilisé les bibliothèques open-source DeepSpeed et Megatron, qui permettent un entraînement distribué efficace sur des milliers de GPU.
La capacité de BLOOM à traiter 46 langues naturelles et 13 langages de programmation le rend polyvalent pour des tâches telles que la traduction, le résumé et la génération de code. Son entraînement multilingue est un différenciateur clé par rapport à de nombreux modèles centrés sur l'anglais, lui permettant de servir diverses communautés mondiales.
Variantes et applications
Après la publication de BLOOM, BigScience a introduit xP3, un jeu de données multilingue pour l'apprentissage supervisé, et BLOOMZ, une variante de BLOOM affinée sur xP3 pour suivre des instructions. BLOOMZ améliore la capacité du modèle à effectuer des tâches basées sur des invites en langage naturel, renforçant son utilité dans l'IA conversationnelle et d'autres applications.
BLOOM a été utilisé dans des chatbots tels que BLOOMChat et HuggingChat, exploitant ses capacités multilingues pour fournir des réponses dans plusieurs langues. Sa nature en accès ouvert en a également fait un choix populaire pour la recherche académique et l'expérimentation dans les domaines du apprentissage automatique et de l'intelligence artificielle.
Impact et importance
BLOOM représente une étape marquante dans la démocratisation de l'IA, offrant un modèle de grande capacité librement disponible pour la recherche et l'usage commercial sous sa licence. Il a été l'un des premiers modèles multilingues à grande échelle entièrement open-source, établissant un précédent pour les initiatives futures. L'accent mis par le projet sur la transparence - de la collecte des données aux procédures d'entraînement - fournit une étude de cas précieuse pour la communauté de l'IA.
Comparé aux modèles propriétaires comme ceux de OpenAI ou Anthropic, les poids ouverts de BLOOM permettent aux chercheurs d'inspecter et d'affiner le modèle sans restrictions, favorisant l'innovation dans des domaines tels que le traitement des langues à faibles ressources et la sécurité de l'IA. Le développement du modèle a également mis en évidence le potentiel de la recherche collaborative et bénévole, par opposition aux efforts dirigés par les entreprises.
Liens externes
- Projet BigScience sur HuggingFace (disponible sur huggingface.co/bigscience)
Références
- Projet BigScience sur HuggingFace
- Contributeurs de Wikipédia. « BLOOM (language model). » Wikipédia, l'encyclopédie libre.