BigScience es una colaboración de investigación abierta que desarrolló BLOOM, un modelo de lenguaje de gran tamaño publicado en 2022. La iniciativa reunió a cientos de investigadores de diversas instituciones para construir un modelo de acceso público, en contraste con los esfuerzos propietarios. Su objetivo era avanzar en la investigación de la inteligencia artificial mediante la apertura, la reproducibilidad y la participación comunitaria.
El proyecto se lanzó en 2021, coordinado por Hugging Face, y recibió apoyo de organizaciones como el gobierno francés y diversos socios académicos. BigScience pretendía abordar las preocupaciones sobre la concentración del desarrollo de la IA en unas pocas grandes empresas, creando una alternativa colaborativa y transparente. El modelo resultante, BLOOM, se entrenó con un conjunto de datos multilingüe y se puso a disposición bajo una licencia abierta.
Orígenes y objetivos
BigScience surgió de debates dentro de la comunidad de IA sobre la necesidad de un desarrollo más inclusivo y ético de los modelos de lenguaje de gran tamaño. La colaboración se anunció formalmente en mayo de 2021, con la intención de aunar experiencia y recursos computacionales. Los objetivos clave incluían producir un modelo de última generación, documentar todo el proceso y establecer mejores prácticas para la investigación responsable en IA.
La iniciativa destacó por su escala y diversidad, con más de 1.000 contribuyentes de más de 70 países. Los participantes incluían investigadores del ámbito académico, industrial y de la sociedad civil, lo que reflejaba una amplia gama de perspectivas. BigScience buscaba demostrar que la investigación colaborativa y abierta podía rivalizar con los logros de los laboratorios corporativos bien financiados.
Modelo BLOOM
BLOOM (BigScience Large Open-science Open-access Multilingual) es una red basada en transformadores de tipo red neuronal con 176 mil millones de parámetros. Se entrenó con un conjunto de datos llamado ROOTS, que comprendía más de 1,6 terabytes de texto en 46 lenguas naturales y 13 lenguajes de programación. El entrenamiento utilizó el supercomputador Jean Zay en Francia, proporcionado mediante una subvención del gobierno francés.
BLOOM fue diseñado para admitir la generación y comprensión de texto en múltiples idiomas, incluidos aquellos con pocos recursos. Su arquitectura incorpora atención de múltiples cabezas y otros componentes estándar de los transformadores, pero con modificaciones para lograr eficiencia y estabilidad. El modelo se publicó en julio de 2022 bajo la Licencia de IA Responsable, que incluye restricciones de uso para prevenir aplicaciones dañinas.
Datos de entrenamiento y metodología
El conjunto de datos ROOTS se ensambló mediante un proceso participativo, en el que voluntarios curaron y filtraron rastreos web, artículos académicos y otras fuentes. Se hizo hincapié en la calidad y la procedencia de los datos, con documentación detallada de los pasos de recopilación y preprocesamiento. Esta transparencia supuso una diferencia respecto a muchos modelos propietarios, que a menudo mantienen confidenciales los datos de entrenamiento.
El entrenamiento de BLOOM requirió importantes recursos computacionales, utilizando miles de GPU durante varios meses. El proyecto empleó técnicas como el recorte de gradientes y la normalización de capas para garantizar un entrenamiento estable. El proyecto también publicó registros y análisis detallados, lo que permitió a otros replicar o ampliar el trabajo.
Gobernanza y ética
BigScience estableció una estructura de gobernanza que incluía grupos de trabajo sobre ética, cuestiones legales y participación comunitaria. Estos grupos desarrollaron directrices para la recopilación responsable de datos, el despliegue de modelos y el posible uso indebido. La colaboración también realizó revisiones éticas y buscó aportaciones de las comunidades afectadas.
Un resultado notable fue la creación de la Licencia de IA Responsable, que restringe el uso de BLOOM en ámbitos de alto riesgo, como la vigilancia o la discriminación. Esta licencia se diseñó para equilibrar la apertura con la rendición de cuentas, un enfoque novedoso en ese momento. El proyecto también publicó una ficha del modelo que detallaba capacidades, limitaciones y usos previstos.
Impacto y recepción
BLOOM fue ampliamente elogiado por su accesibilidad y sus capacidades multilingües, especialmente para idiomas a menudo descuidados por los modelos comerciales. Proporcionó un punto de referencia para la investigación abierta, demostrando que los esfuerzos colaborativos podían producir resultados competitivos. El proyecto también influyó en iniciativas posteriores, como la creación de otros modelos abiertos y una mayor atención a la gobernanza de los datos.
Los críticos señalaron que el rendimiento de BLOOM quedaba por detrás de algunos modelos propietarios en ciertas tareas, y que su tamaño dificultaba el despliegue para organizaciones más pequeñas. No obstante, la publicación de BLOOM contribuyó a un movimiento más amplio hacia la IA de código abierto, y muchos modelos posteriores se inspiraron en su enfoque.
Legado y direcciones futuras
BigScience concluyó su fase principal con la publicación de BLOOM, pero su legado persiste en los esfuerzos de investigación abierta en curso. La colaboración demostró el valor de la participación diversa y las metodologías transparentes. También puso de relieve la importancia de las consideraciones éticas en el desarrollo de la IA, influyendo en los debates políticos y en las prácticas del sector.
A partir de 2025, el modelo y el conjunto de datos de BigScience siguen disponibles para investigación y uso comercial bajo la licencia especificada. La documentación y el código del proyecto continúan sirviendo como recursos para quienes estudian el entrenamiento de modelos a gran escala. Futuras colaboraciones abiertas podrían basarse en el marco de BigScience para abordar los desafíos emergentes en IA.
Véase también
Referencias
Este artículo se basa en información disponible públicamente sobre el proyecto BigScience y sus resultados.