BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) es un modelo de lenguaje de gran escala de acceso abierto lanzado en 2022. Fue desarrollado por la iniciativa BigScience, un esfuerzo de investigación impulsado por voluntarios destinado a proporcionar una alternativa creada de forma transparente a los modelos de IA propietarios. Con 176 mil millones de parámetros, BLOOM es un modelo autorregresivo basado en transformadores diseñado para generar texto en 46 idiomas naturales y 13 lenguajes de programación. El modelo se distribuye bajo la "Licencia de IA Responsable" del proyecto.
Desarrollo
BLOOM es el principal resultado de la iniciativa BigScience, un taller de investigación de un año de duración coordinado por Hugging Face con financiación del gobierno francés. El proyecto involucró a varios cientos de investigadores e ingenieros voluntarios del ámbito académico y del sector privado. El modelo se entrenó entre marzo y julio de 2022 en el supercomputador público Jean Zay en Francia, gestionado por GENCI e IDRIS (CNRS). A diferencia de modelos anteriores como GPT-3, BLOOM fue entrenado explícitamente para ser multilingüe, cubriendo idiomas de diversas familias, incluidos inglés, francés, español, chino, árabe, hindi y muchos otros.
El código fuente de BLOOM se publica bajo la licencia Apache 2.0, mientras que los parámetros del modelo se publican bajo la Licencia de IA Responsable de BigScience (RAIL). Esta licencia otorga acceso abierto y derechos de reutilización, pero incluye restricciones de uso, como la prohibición de su uso en aplicaciones dañinas. La naturaleza abierta de BLOOM contrasta con los modelos propietarios de empresas como OpenAI y Google DeepMind, lo que lo convierte en un recurso significativo para investigadores y desarrolladores que buscan transparencia en la IA.
Datos de Entrenamiento y Arquitectura
El corpus de entrenamiento de BLOOM, denominado ROOTS, combina datos extraídos de la versión más reciente del corpus web OSCAR (38% de ROOTS) con datos recién recopilados de una lista seleccionada y documentada manualmente de fuentes de datos lingüísticos. En total, el modelo se entrenó con aproximadamente 366 mil millones de tokens (1.6 TB de texto). La arquitectura se basa en el modelo transformador, específicamente un diseño autorregresivo solo-decodificador, similar a GPT-3 pero con mejoras para el rendimiento multilingüe. El entrenamiento utilizó las bibliotecas de código abierto DeepSpeed y Megatron, que permiten un entrenamiento distribuido eficiente en miles de GPU.
La capacidad de BLOOM para manejar 46 idiomas naturales y 13 lenguajes de programación lo hace versátil para tareas como traducción, resumen y generación de código. Su entrenamiento multilingüe es un diferenciador clave frente a muchos modelos centrados en inglés, lo que le permite servir a diversas comunidades globales.
Variantes y Aplicaciones
Tras el lanzamiento de BLOOM, BigScience introdujo xP3, un conjunto de datos multilingüe para aprendizaje supervisado, y BLOOMZ, una variante de BLOOM ajustada con xP3 para seguir instrucciones. BLOOMZ mejora la capacidad del modelo para realizar tareas basadas en indicaciones en lenguaje natural, mejorando su usabilidad en IA conversacional y otras aplicaciones.
BLOOM se ha utilizado en chatbots como BLOOMChat y HuggingChat, aprovechando sus capacidades multilingües para proporcionar respuestas en varios idiomas. Su naturaleza de acceso abierto también lo ha convertido en una opción popular para la investigación académica y la experimentación en los campos de aprendizaje automático y inteligencia artificial.
Impacto y Significado
BLOOM representa un hito en la democratización de la IA, ofreciendo un modelo de alta capacidad disponible gratuitamente para investigación y uso comercial bajo su licencia. Fue uno de los primeros modelos multilingües a gran escala completamente de código abierto, estableciendo un precedente para futuras iniciativas. El énfasis del proyecto en la transparencia - desde la recopilación de datos hasta los procedimientos de entrenamiento - proporciona un valioso caso de estudio para la comunidad de IA.
En comparación con modelos propietarios como los de OpenAI o Anthropic, los pesos abiertos de BLOOM permiten a los investigadores inspeccionar y ajustar el modelo sin restricciones, fomentando la innovación en áreas como el procesamiento de idiomas de bajos recursos y la seguridad de la IA. El desarrollo del modelo también destacó el potencial de la investigación colaborativa impulsada por voluntarios, en contraposición a los esfuerzos liderados por empresas.
Enlaces Externos
- Proyecto BigScience en HuggingFace (disponible en huggingface.co/bigscience)
Referencias
- Proyecto BigScience en HuggingFace
- Contribuyentes de Wikipedia. "BLOOM (modelo de lenguaje)." Wikipedia, La Enciclopedia Libre.