BLOOM-176B是BLOOM(BigScience Large Open-science Open-access Multilingual)语言模型的最大变体,由BigScience协作项目开发,于2022年7月发布。该模型拥有1760亿参数,是一个基于Transformer (architecture)的密集Large language model,旨在生成数十种自然语言和编程语言的文本。模型在ROOTS语料库上训练,该语料库是一个经过整理的、超过1.6 TB文本的数据集,并以负责任AI许可证发布,该开放许可证包含旨在防止有害应用的用途限制。
BLOOM-176B的创建旨在提供一种大规模、多语言的专有模型替代方案,强调透明性和可复现性。其架构遵循标准的仅解码器transformer,包含Multi-Head Attention、Layer Normalization和Positional Encoding,但融合了多项创新,包括ALiBi(带线性偏置的注意力)位置编码方案,该方案改善了对更长序列的外推能力。该模型支持46种自然语言和13种编程语言,使其成为当时语言多样性最强的大型模型之一。
训练与计算
训练BLOOM-176B需要大量计算资源。模型在法国的Jean Zay超级计算机上训练,使用了384块NVIDIA A100 GPU,每块具有80GB内存。训练过程耗时约3.5个月,消耗约1,082,990计算小时。团队使用了多种Deep learning优化技术,包括带有Learning Rate Scheduling的Adam (Optimizer),该调度包含预热阶段和余弦衰减。应用了Gradient Clipping以稳定训练,并使用bfloat16混合精度以减少内存占用。
训练数据ROOTS由BigScience社区组装,包含来自书籍、新闻文章和网页内容等多种来源的1.6 TB文本。数据集经过过滤和去重,以确保质量并减少偏差。模型以2048个token的上下文长度进行训练,ALiBi机制使其在推理时无需额外训练即可处理更长的序列。
能力与性能
BLOOM-176B在其支持的语言中擅长文本生成、翻译和摘要。它表现出强大的少样本学习能力,类似于其他大型模型,并能执行问答和代码生成等任务。在评估中,它在SuperGLUE和多语言任务等基准上取得了有竞争力的结果,尽管由于其多语言重点,在纯英语任务上有时落后于GPT-3等模型。
一个显著特点是其在低资源语言(如非洲和东南亚地区语言)中生成文本的能力,这些语言在其他模型中往往代表性不足。该模型还支持Python、Java和C++等编程语言,实现代码补全和生成。然而,与所有Generative AI模型一样,它可能产生有偏见或事实错误的输出,许可证包含对高风险领域使用的限制。
发布与访问
BLOOM-176B于2022年7月通过Hugging Face Hub发布,权重可供下载。发布附带详细的模型卡和技术报告,记录了训练过程和预期用途。该模型可在高端硬件上运行,但其规模需要多个GPU或具有大内存的Amazon Web Services实例。BigScience协作项目还发布了较小版本,包括BLOOM-7B和BLOOM-3B,以促进在性能较低硬件上的研究。
BLOOM-176B的开放访问性质使其成为研究人员和开发者的宝贵资源,尤其是学术界和访问专有模型受限地区的用户。它已被用于偏见、可解释性和多语言NLP研究,为更广泛的Artificial intelligence研究领域做出贡献。
影响与遗产
BLOOM-176B证明了大规模语言模型可以在不依赖企业资源的情况下协作和透明地开发。其发布影响了后续开源工作,如Falcon和Llama模型,这些模型采用了类似的许可和透明原则。该模型还凸显了Machine learning中多语言代表性的重要性,鼓励其他项目优先考虑语言多样性。
尽管取得了成功,BLOOM-176B仍面临挑战,包括推理成本高和针对特定任务微调困难。截至2025年,它仍是开放访问模型的参考点,尽管更新模型在性能和效率上已超越它。其遗产在于证明了社区驱动的AI开发可以在遵守伦理准则的同时产生最先进的结果。