Traduit de l'anglais

BLOOM-176B est la version à 176 milliards de paramètres du grand modèle de langage BLOOM, développée par la collaboration BigScience et publiée en 2022. Il s'agit d'un transformateur multilingue et en accès ouvert, conçu pour la génération de texte et la recherche.

BLOOM-176B est la variante la plus grande du modèle de langage BLOOM (BigScience Large Open-science Open-access Multilingual), développé par la collaboration BigScience et publié en juillet 2022. Avec 176 milliards de paramètres, il s'agit d'un Transformer (architecture) dense basé sur un Large language model, conçu pour générer du texte dans des dizaines de langues naturelles et de langages de programmation. Le modèle a été entraîné sur le corpus ROOTS, un ensemble de données organisé de plus de 1,6 téraoctets de texte, et a été mis à disposition sous la licence Responsible AI License, une licence ouverte incluant des restrictions d'utilisation visant à prévenir les applications nuisibles.

BLOOM-176B a été créé pour offrir une alternative multilingue à grande échelle aux modèles propriétaires, en mettant l'accent sur la transparence et la reproductibilité. Son architecture suit un transformer standard décodeur seul avec Multi-Head Attention, Layer Normalization et Positional Encoding, mais intègre plusieurs innovations, notamment un schéma d'encodage positionnel ALiBi (Attention with Linear Biases) qui améliore l'extrapolation à des séquences plus longues. Le modèle prend en charge 46 langues naturelles et 13 langages de programmation, ce qui en fait l'un des grands modèles les plus diversifiés linguistiquement de son époque.

Entraînement et calcul

L'entraînement de BLOOM-176B a nécessité des ressources de calcul importantes. Le modèle a été entraîné sur le supercalculateur Jean Zay en France, utilisant 384 GPU NVIDIA A100 avec 80 Go de mémoire chacun. Le processus d'entraînement a duré environ 3,5 mois, consommant environ 1 082 990 heures de calcul. L'équipe a utilisé un mélange de techniques d'optimisation en Deep learning, notamment l'Adam (Optimizer) avec un Learning Rate Scheduling comprenant une phase d'échauffement et une décroissance cosinusoïdale. Le Gradient Clipping a été appliqué pour stabiliser l'entraînement, et la précision mixte bfloat16 a été utilisée pour réduire l'utilisation de la mémoire.

Les données d'entraînement, ROOTS, ont été assemblées par la communauté BigScience, comprenant 1,6 téraoctets de texte provenant de diverses sources, notamment des livres, des articles de presse et du contenu web. L'ensemble de données a été filtré et dédupliqué pour garantir la qualité et réduire les biais. Le modèle a été entraîné avec une longueur de contexte de 2048 jetons, et le mécanisme ALiBi lui a permis de gérer des séquences plus longues lors de l'inférence sans entraînement supplémentaire.

Capacités et performances

BLOOM-176B excelle dans la génération de texte, la traduction et le résumé dans ses langues prises en charge. Il démontre de fortes capacités d'apprentissage en quelques exemples, similaires à d'autres grands modèles, et peut effectuer des tâches telles que la réponse à des questions et la génération de code. Lors des évaluations, il a obtenu des résultats compétitifs sur des benchmarks comme SuperGLUE et des tâches multilingues, bien qu'il ait parfois accusé un retard par rapport à des modèles comme GPT-3 sur des tâches en anglais uniquement en raison de son orientation multilingue.

Une caractéristique notable est sa capacité à générer du texte dans des langues à faibles ressources, telles que celles des régions d'Afrique et d'Asie du Sud-Est, souvent sous-représentées dans d'autres modèles. Le modèle prend également en charge des langages de programmation comme Python, Java et C++, permettant la complétion et la génération de code. Cependant, comme tous les modèles de Generative AI, il peut produire des sorties biaisées ou factuellement incorrectes, et la licence inclut des restrictions sur l'utilisation dans des domaines à haut risque.

Publication et accès

BLOOM-176B a été publié en juillet 2022 via le Hugging Face Hub, avec des poids disponibles en téléchargement. La publication a été accompagnée d'une fiche de modèle détaillée et d'un rapport technique, documentant le processus d'entraînement et les utilisations prévues. Le modèle peut être exécuté sur du matériel haut de gamme, mais sa taille nécessite plusieurs GPU ou des instances Amazon Web Services avec une grande mémoire. La collaboration BigScience a également publié des versions plus petites, notamment BLOOM-7B et BLOOM-3B, pour faciliter la recherche sur du matériel moins puissant.

La nature en libre accès de BLOOM-176B en a fait une ressource précieuse pour les chercheurs et les développeurs, en particulier ceux du milieu universitaire et des régions ayant un accès limité aux modèles propriétaires. Il a été utilisé dans des études sur les biais, l'interprétabilité et le TAL multilingue, contribuant au domaine plus large de la recherche en Artificial intelligence.

Impact et héritage

BLOOM-176B a démontré que des modèles de langage à grande échelle peuvent être développés de manière collaborative et transparente, sans dépendre de ressources d'entreprise. Sa publication a influencé les efforts open source ultérieurs, tels que les modèles Falcon et Llama, qui ont adopté des principes de licence et de transparence similaires. Le modèle a également souligné l'importance de la représentation multilingue dans le Machine learning, encourageant d'autres projets à prioriser la diversité linguistique.

Malgré son succès, BLOOM-176B a fait face à des défis, notamment le coût élevé de l'inférence et la difficulté de l'ajustement fin pour des tâches spécifiques. En 2025, il reste un point de référence pour les modèles en libre accès, bien que des modèles plus récents l'aient surpassé en performances et en efficacité. Son héritage réside dans la preuve que le développement de l'IA mené par la communauté peut produire des résultats de pointe tout en respectant des directives éthiques.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·multilingual·open-access·transformer
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique