译自英文

BigScience是一个开放研究合作项目,创建了大型语言模型BLOOM,旨在使AI研究民主化。该项目汇集了全球数百名研究人员,并强调透明度和伦理考量。

BigScience是一个开放研究合作项目,开发了BLOOM,这是一个于2022年发布的大型语言模型。该倡议汇集了来自不同机构的数百名研究人员,以构建一个公开可访问的模型,与专有项目形成对比。其目标是通过开放性、可重复性和社区参与来推进人工智能研究。

该项目于2021年启动,由Hugging Face协调,并获得了包括法国政府和多个学术合作伙伴在内的组织支持。BigScience旨在通过创建一种协作、透明的替代方案,解决人工智能开发集中在少数大公司的问题。由此产生的模型BLOOM在多语言数据集上训练,并以开放许可发布。

起源与目标

BigScience源于人工智能社区关于更包容和道德地开发大型语言模型的讨论。该合作于2021年5月正式宣布,旨在汇集专业知识和计算资源。关键目标包括生产最先进的模型、记录整个过程,以及为负责任的人工智能研究建立最佳实践。

该倡议以其规模和多样性著称,涉及来自70多个国家的1000多名贡献者。参与者包括来自学术界、工业界和民间社会的研究人员,反映了广泛的观点。BigScience试图证明,协作式开放研究可以与资金充足的企业实验室的成就相媲美。

BLOOM模型

BLOOM(BigScience Large Open-science Open-access Multilingual)是一个基于变换器神经网络,拥有1760亿个参数。它在一个名为ROOTS的数据集上训练,该数据集包含超过1.6太字节的文本,涵盖46种自然语言和13种编程语言。训练使用了法国的Jean Zay超级计算机,该计算机由法国政府拨款提供。

BLOOM旨在支持多种语言的文本生成和理解,包括资源较少的语言。其架构包含多头注意力和其他标准变换器组件,但针对效率和稳定性进行了修改。该模型于2022年7月以负责任人工智能许可发布,其中包括使用限制以防止有害应用。

训练数据与方法

ROOTS数据集通过参与式过程构建,志愿者策划和过滤网络爬取内容、学术论文和其他来源。重点放在数据质量和来源上,并详细记录了收集和预处理步骤。这种透明度与许多专有模型形成对比,后者通常对训练数据保密。

训练BLOOM需要大量计算资源,在数月内使用了数千个GPU。该项目采用了梯度裁剪层归一化等技术以确保稳定训练。项目还发布了详细的日志和分析,使他人能够复制或在此基础上进行构建。

治理与伦理

BigScience建立了一个治理结构,包括关于伦理、法律问题和社区参与的工作组。这些小组制定了负责任的数据收集、模型部署和潜在滥用的指南。该合作还进行了伦理审查,并征求受影响社区的意见。

一个显著成果是创建了负责任人工智能许可,该许可限制BLOOM在高风险领域(如监控或歧视)中的使用。该许可旨在平衡开放性与问责制,这在当时是一种新颖的方法。项目还发布了一张模型卡,详细说明了能力、局限性和预期用途。

影响与反响

BLOOM因其可访问性和多语言能力而广受赞誉,特别是对于商业模型经常忽视的语言。它为开放研究提供了基准,表明协作努力可以产生有竞争力的结果。该项目还影响了后续倡议,如其他开放模型的创建以及对数据治理的更多关注。

批评者指出,BLOOM在某些任务上的性能落后于一些专有模型,并且其规模使较小组织的部署面临挑战。尽管如此,BLOOM的发布促进了更广泛的开放源代码人工智能运动,许多后来的模型从其方法中汲取了灵感。

遗产与未来方向

BigScience在发布BLOOM后结束了其主要阶段,但其遗产在持续的开放研究努力中得以延续。该合作展示了多样参与和透明方法论的价值。它还强调了人工智能开发中伦理考虑的重要性,影响了政策讨论和行业实践。

截至2025年,BigScience模型和数据集在指定许可下仍可用于研究和商业用途。项目的文档和代码继续作为研究大规模模型训练的资源。未来的开放合作可能会基于BigScience的框架来应对新兴挑战。

参见

参考文献

本文基于关于BigScience项目及其成果的公开可用信息。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·open-research·large-language-models
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史