Traduit de l'anglais

BigScience est une collaboration de recherche ouverte qui a créé BLOOM, un grand modèle de langage, afin de démocratiser la recherche en IA. Elle a impliqué des centaines de chercheurs dans le monde entier et a mis l'accent sur la transparence et les considérations éthiques.

BigScience est une collaboration de recherche ouverte qui a développé BLOOM, un grand modèle de langage publié en 2022. L'initiative a réuni des centaines de chercheurs de diverses institutions pour construire un modèle accessible au public, contrastant avec les efforts propriétaires. Son objectif était de faire progresser la recherche en intelligence artificielle grâce à l'ouverture, la reproductibilité et l'implication communautaire.

Le projet a été lancé en 2021, coordonné par Hugging Face, et a reçu le soutien d'organisations telles que le gouvernement français et divers partenaires académiques. BigScience visait à répondre aux préoccupations concernant la concentration du développement de l'IA dans quelques grandes entreprises en créant une alternative collaborative et transparente. Le modèle résultant, BLOOM, a été entraîné sur un ensemble de données multilingue et mis à disposition sous une licence ouverte.

Origines et objectifs

BigScience est né de discussions au sein de la communauté de l'IA sur la nécessité d'un développement plus inclusif et éthique des grands modèles de langage. La collaboration a été officiellement annoncée en mai 2021, avec l'intention de mutualiser l'expertise et les ressources computationnelles. Les objectifs clés comprenaient la production d'un modèle de pointe, la documentation de l'ensemble du processus et l'établissement de bonnes pratiques pour une recherche responsable en IA.

L'initiative s'est distinguée par son ampleur et sa diversité, impliquant plus de 1 000 contributeurs de plus de 70 pays. Les participants comprenaient des chercheurs du monde académique, de l'industrie et de la société civile, reflétant un large éventail de perspectives. BigScience cherchait à démontrer que la recherche collaborative et ouverte pouvait rivaliser avec les réalisations des laboratoires d'entreprise bien financés.

Modèle BLOOM

BLOOM (BigScience Large Open-science Open-access Multilingual) est un transformeur-based réseau de neurones avec 176 milliards de paramètres. Il a été entraîné sur un ensemble de données appelé ROOTS, qui comprenait plus de 1,6 téraoctets de texte dans 46 langues naturelles et 13 langages de programmation. L'entraînement a utilisé le supercalculateur Jean Zay en France, fourni grâce à une subvention du gouvernement français.

BLOOM a été conçu pour prendre en charge la génération et la compréhension de texte dans plusieurs langues, y compris celles à faibles ressources. Son architecture intègre attention multi-têtes et d'autres composants standard de transformeur, mais avec des modifications pour l'efficacité et la stabilité. Le modèle a été publié en juillet 2022 sous la licence Responsible AI License, qui comprend des restrictions d'utilisation pour prévenir les applications nuisibles.

Données d'entraînement et méthodologie

L'ensemble de données ROOTS a été assemblé par un processus participatif, avec des bénévoles organisant et filtrant des explorations web, des articles académiques et d'autres sources. L'accent a été mis sur la qualité et la provenance des données, avec une documentation détaillée des étapes de collecte et de prétraitement. Cette transparence contrastait avec de nombreux modèles propriétaires, qui gardent souvent leurs données d'entraînement confidentielles.

L'entraînement de BLOOM a nécessité des ressources computationnelles importantes, utilisant des milliers de GPU pendant plusieurs mois. La collaboration a employé des techniques telles que écrêtage du gradient et normalisation de couche pour assurer un entraînement stable. Le projet a également publié des journaux et des analyses détaillés, permettant à d'autres de reproduire ou de s'appuyer sur ce travail.

Gouvernance et éthique

BigScience a établi une structure de gouvernance comprenant des groupes de travail sur l'éthique, les questions juridiques et l'engagement communautaire. Ces groupes ont élaboré des lignes directrices pour la collecte responsable de données, le déploiement de modèles et les abus potentiels. La collaboration a également mené des examens éthiques et sollicité l'avis des communautés concernées.

Un résultat notable a été la création de la Responsible AI License, qui restreint l'utilisation de BLOOM dans des domaines à haut risque tels que la surveillance ou la discrimination. Cette licence a été conçue pour équilibrer l'ouverture et la responsabilité, une approche novatrice à l'époque. Le projet a également publié une fiche de modèle détaillant les capacités, les limites et les utilisations prévues.

Impact et réception

BLOOM a été largement salué pour son accessibilité et ses capacités multilingues, en particulier pour les langues souvent négligées par les modèles commerciaux. Il a fourni une référence pour la recherche ouverte, montrant que les efforts collaboratifs pouvaient produire des résultats compétitifs. Le projet a également influencé des initiatives ultérieures, telles que la création d'autres modèles ouverts et une attention accrue à la gouvernance des données.

Les critiques ont noté que les performances de BLOOM étaient en retrait par rapport à certains modèles propriétaires sur certaines tâches, et que sa taille rendait son déploiement difficile pour les petites organisations. Néanmoins, la publication de BLOOM a contribué à un mouvement plus large vers l'IA open-source, de nombreux modèles ultérieurs s'inspirant de son approche.

Héritage et orientations futures

BigScience a conclu sa phase principale avec la publication de BLOOM, mais son héritage persiste dans les efforts de recherche ouverte en cours. La collaboration a démontré la valeur d'une participation diversifiée et de méthodologies transparentes. Elle a également souligné l'importance des considérations éthiques dans le développement de l'IA, influençant les discussions politiques et les pratiques industrielles.

En 2025, le modèle et l'ensemble de données BigScience restent disponibles pour la recherche et l'utilisation commerciale sous la licence spécifiée. La documentation et le code du projet continuent de servir de ressources pour ceux qui étudient l'entraînement de modèles à grande échelle. Les futures collaborations ouvertes pourraient s'appuyer sur le cadre de BigScience pour relever les défis émergents de l'IA.

Voir aussi

Références

Cet article est basé sur des informations publiquement disponibles concernant le projet BigScience et ses résultats.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·open-research·large-language-models
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique