BLOOM(BigScience大型开放科学开放获取多语言语言模型)是一个于2022年发布的开放获取大型语言模型。它由BigScience倡议开发,这是一项由志愿者驱动的研究工作,旨在提供一种透明创建的替代专有AI模型的方案。BLOOM拥有1760亿参数,是一个基于Transformer的自回归模型,设计用于生成46种自然语言和13种编程语言的文本。该模型根据项目的“负责任AI许可证”分发。
开发
BLOOM是BigScience倡议的主要成果,这是一个由Hugging Face协调、法国政府资助的为期一年的研究研讨会。该项目涉及来自学术界和私营部门的数百名志愿者研究人员和工程师。该模型于2022年3月至7月在法国的Jean Zay公共超级计算机上训练,该计算机由GENCI和IDRIS(CNRS)管理。与GPT-3等早期模型不同,BLOOM明确训练为多语言,涵盖包括英语、法语、西班牙语、中文、阿拉伯语、印地语等在内的多种语言家族。
BLOOM的源代码根据Apache 2.0许可证发布,而模型的参数则根据BigScience负责任AI许可证(RAIL)发布。该许可证授予开放访问和重用权利,但包含使用限制,例如禁止在有害应用中使用。BLOOM的开放性与其来自OpenAI和Google DeepMind等公司的专有模型形成对比,使其成为寻求AI透明性的研究人员和开发者的重要资源。
训练数据与架构
BLOOM的训练语料库名为ROOTS,结合了当时最新版本的基于网络的OSCAR语料库(占ROOTS的38%)的数据,以及从手动选择和记录的语言数据源列表中新收集的数据。总体而言,该模型在约3660亿个令牌(1.6 TB文本)上进行了训练。其架构基于Transformer模型,具体为自回归解码器专用设计,类似于GPT-3,但针对多语言性能进行了增强。训练利用了开源库DeepSpeed和Megatron,这些库支持在数千个GPU上进行高效的分布式训练。
BLOOM处理46种自然语言和13种编程语言的能力使其适用于翻译、摘要和代码生成等任务。其多语言训练是许多以英语为中心的模型的关键区别,使其能够服务于多样化的全球社区。
变体与应用
在BLOOM发布后,BigScience推出了xP3,一个用于监督学习的多语言数据集,以及BLOOMZ,一个在xP3上微调以遵循指令的BLOOM变体。BLOOMZ提高了模型基于自然语言提示执行任务的能力,增强了其在对话式AI和其他应用中的可用性。
BLOOM已被用于BLOOMChat和HuggingChat等聊天机器人中,利用其多语言能力提供多种语言的响应。其开放获取性质也使其成为机器学习和人工智能领域学术研究和实验的热门选择。
影响与意义
BLOOM代表了AI民主化的一个里程碑,提供了一个在其许可证下免费用于研究和商业用途的高容量模型。它是首批完全开源的大规模多语言模型之一,为未来的倡议树立了先例。该项目对透明度的强调(从数据收集到训练过程)为AI社区提供了宝贵的案例研究。
与来自OpenAI或Anthropic等公司的专有模型相比,BLOOM的开放权重允许研究人员不受限制地检查和微调模型,促进了低资源语言处理和AI安全等领域的创新。该模型的开发还突显了协作、志愿者驱动研究的潜力,而非企业主导的努力。
外部链接
- HuggingFace上的BigScience项目(可在huggingface.co/bigscience获取)
参考文献
- HuggingFace上的BigScience项目
- Wikipedia贡献者。“BLOOM(语言模型)。”Wikipedia,自由百科全书。