译自英文

Chinchilla是Google DeepMind于2022年3月开发的一系列大型语言模型,以其确立的计算最优训练扩展定律而闻名,该定律建议在模型规模加倍时,训练令牌数也应加倍。

Chinchilla是大型语言模型(LLM)家族,由Google DeepMind的研究团队于2022年3月提出。该家族旨在研究语言模型的缩放定律,基于先前Gopher模型家族的工作。Chinchilla模型基于Transformer架构,并在固定计算预算下训练以实现更优性能,由此产生了被广泛引用的高效训练大型模型的建议。

名称“Chinchilla”体现了其作为先前Gopher模型家族进一步发展的角色。两个家族均被训练以探索模型大小与训练数据量之间的相互作用。Chinchilla声称在显著减少参数数量的情况下超越了GPT-3,从而简化了下游使用,降低了推理和微调所需的计算能力。

缩放定律与训练

Chinchilla研究的核心发现是,在给定计算预算下,模型大小与训练token数量应成比例缩放。具体而言,如果模型大小翻倍,训练token数量也应翻倍。这一原则源自对先前语言模型训练的分析。DeepMind利用这一假设训练了Chinchilla,其拥有700亿参数,并在1.4万亿token上训练,数据量是Gopher的300亿token的四倍,而总体计算成本相似。

这种计算最优的方法与早期常优先增加模型参数的做法形成对比。Chinchilla团队建议,使用更大、更高质量的训练数据集可以在下游任务上取得更好结果,即使模型大小不增加。这些发现已影响后续AI研究领域的训练方法论。

性能与基准

Chinchilla在测量大规模多任务语言理解(MMLU)基准上达到了67.5%的平均准确率,比Gopher的表现高出7%。这一提升尤为显著,因为Gopher拥有2800亿参数,是Chinchilla的四倍。该模型的效率使其适用于更广泛的应用,因为推理和微调所需的计算量更少。

截至2023年1月12日,Chinchilla仍处于测试阶段,表明其全部能力和局限性正在评估中。该模型在MMLU等基准上的成功表明,计算最优训练可以产生与使用较少数据训练的更大模型相比具有竞争力或更优的结果。

架构

Gopher和Chinchilla家族均为Transformer模型家族。它们本质上与GPT-2相同,但大小不同且略有修改。Gopher家族使用RMSNorm而非LayerNorm,并使用相对位置编码而非绝对位置编码。Chinchilla家族与Gopher家族相同,但使用AdamW优化器而非Adam优化器进行训练。

Gopher家族包含六个大小递增的模型,从4400万参数到2800亿参数,其中最大的默认称为“Gopher”。类似的命名约定适用于Chinchilla家族,其包含各种大小的模型,其中700亿参数版本最为突出。原始论文中的表1详述了整个Gopher家族,而表4比较了700亿参数的Chinchilla与Gopher 280B。

应用与影响

Chinchilla已被用作其他模型的基础,包括Flamingo视觉语言模型,该模型整合了视觉和文本理解。Chinchilla确立的缩放定律已成为机器学习领域的标准参考,指导后续LLM开发中关于模型大小和数据集大小的决策。

该研究为在有限计算资源下训练大型自回归语言模型贡献了有效的训练范式。通过证明数据量与模型大小同等重要,Chinchilla将焦点转向数据集质量和策划。这对OpenAIAnthropic等组织处理模型训练的方式产生了持久影响,尽管其内部实践的具体细节并不总是公开。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·google-deepmind·scaling-laws·transformer-models
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史