译自英文

Cerebras-GPT是由Cerebras Systems开发的一系列计算最优大型语言模型,利用Chinchilla缩放定律在CS-2晶圆级系统上训练。该系列于2023年发布,包含从111M到13B参数的模型,旨在实现高效训练和开源可用性。

Cerebras-GPT是一个由Cerebras Systems开发的开源大型语言模型系列,该公司以其晶圆级神经网络加速器而闻名。这些模型旨在实现计算最优性能,即根据Chinchilla缩放定律平衡模型大小和训练数据量,该定律指出,在给定的计算预算下,更大的模型配以成比例更多的数据能带来更好的性能。Cerebras-GPT于2023年3月发布,旨在展示Cerebras的CS-2系统在大规模训练最先进模型方面的效率。

该系列包含参数数量从1.11亿到130亿不等的模型,具体为:111M、256M、590M、1.3B、2.7B、6.7B和13B。所有模型均使用相同的公开数据集Pile进行训练,该数据集包含来自书籍、学术论文和网页内容的多样化文本。训练采用每个模型固定的计算预算,遵循Chinchilla最优比率(约每参数20个令牌),确保每个模型在适当数量的数据上进行训练,以最大化其大小的性能。模型使用Adam优化器配合余弦学习率调度梯度裁剪进行训练,以稳定训练过程。

架构与训练

Cerebras-GPT模型采用标准的Transformer架构,具体为仅解码器变体,这在生成式语言模型中很常见。每个模型使用多头注意力层归一化学习的位置嵌入。模型在CS-2系统上训练,该系统集成了单个硅晶圆,拥有超过85万个核心,无需跨多个GPU进行分布式训练即可实现高吞吐量训练。这种架构使Cerebras能够在比传统GPU集群更短的时间和更低的能耗下训练模型,因为晶圆级设计减少了通信开销。

训练采用bfloat16精度,模型从头开始训练,不使用任何预训练检查点。训练过程使用批量大小为256个序列,每个序列长度为2048个令牌,每个模型的总训练令牌数由Chinchilla公式确定。例如,13B模型在约2600亿个令牌上训练,而111M模型在约22亿个令牌上训练。训练数据经过洗牌和处理以确保多样性,模型在标准基准测试上评估,如语言建模困惑度和下游任务。

性能与基准

Cerebras-GPT模型在多个基准测试上进行了评估,包括LAMBADA、HellaSwag和Winogrande,这些测试考察语言理解和推理能力。结果显示,尽管训练方法更简单,这些模型的性能与OpenAIAnthropic等类似规模的开源模型相比具有竞争力。例如,13B模型在LAMBADA上达到了72.3%的准确率,与当时其他13B模型相当。模型在Pile的保留验证集上也表现出强劲性能,随着模型大小增加,困惑度降低,符合预期。

Cerebras-GPT的一个显著特点是其对计算效率的关注。公司报告称,在CS-2上训练13B模型大约需要10天,而在512个NVIDIA A100 GPU集群上进行类似训练大约需要30天。这种效率归因于晶圆级设计,它消除了对模型并行的需求并减少了芯片间通信。模型在Apache 2.0许可证下发布,允许无限制使用和修改,这是促进开源社区研究和发展的有意之举。

与其他模型的比较

在发布时,Cerebras-GPT在开源模型中因其遵循Chinchilla缩放定律而脱颖而出。许多早期模型,如GPT-3,训练数据量超过计算最优,导致效率低下。Cerebras-GPT是首批明确采用计算最优方法的模型系列之一,这意味着每个模型都根据其参数数量在精确合适的数据量上训练。这种方法通过模型性能达到或优于以次优数据-参数比训练的模型而得到验证。

与后来发布的模型如LLaMA(于2023年晚些时候发布)相比,Cerebras-GPT在最大尺寸上较小,但提供了更系统的缩放研究。这些模型还因其可复现性而著称,因为训练代码和配置已开源,允许研究人员复制结果。然而,这些模型未经过指令微调或聊天微调,因此主要用于研究缩放定律和高效训练,而非应用部署。

影响与遗产

Cerebras-GPT通过提供一系列可在适度硬件上运行的模型,促进了大型语言模型民主化的更广泛趋势。最小的模型(111M)可在单个GPU上微调,而最大的模型(13B)需要多GPU设置,但仍对许多研究实验室可访问。此次发布还突显了替代硬件架构(如晶圆级集成)在降低训练大型模型成本和能源足迹方面的潜力。

这些模型被用于后续关于课程学习数据增强技术的研究,因为其开源性质便于实验。Cerebras Systems继续开发更大的模型,如Cerebras-GPT 7B及后来的Cerebras-GPT 13B变体,但原始系列仍是计算最优训练的参考点。公司还利用这一经验指导其下一代硬件CS-3的开发,该硬件于2024年宣布。

可用性与使用

Cerebras-GPT模型可在Hugging Face和Cerebras Model Zoo上获取,后者提供预训练检查点和推理脚本。模型可与PyTorch等标准机器学习框架一起使用,训练代码可在GitHub上获取。Apache 2.0许可证允许商业使用,使模型对希望部署语言模型而无需许可费用的初创企业和企业具有吸引力。然而,用户应注意,这些模型未与人类偏好对齐,因此可能产生有偏见或有害的输出,部署时建议采取适当的安全措施。

总之,Cerebras-GPT是对人工智能领域的重大贡献,展示了通过专用硬件实现计算最优训练的可能性,并为研究缩放定律和模型效率的研究人员提供了宝贵资源。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·open-source-ai·scaling-laws·wafer-scale-computing
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史