译自英文

Chinchilla 70B是由Google DeepMind开发的700亿参数大语言模型,于2022年作为Chinchilla系列的一部分推出,旨在展示计算最优训练缩放定律。

Chinchilla 70B是由Google DeepMind开发的大型语言模型,于2022年推出。它是Chinchilla模型家族中拥有700亿参数的变体,该家族模型旨在测试和验证训练计算高效神经网络的缩放定律。该模型是一篇研究论文中的核心产物,该论文主张在模型规模与训练数据之间采用一种与当时主流做法不同的平衡方式,影响了后续在大型语言模型机器学习领域的研究工作。

Chinchilla项目源于一个观察:许多当代大型语言模型,包括OpenAI的GPT-3,其训练所用的token数量远低于其参数规模所对应的最优值。研究人员提出,在固定计算预算下,最佳性能来自模型规模和训练数据的大致同等扩展,而非偏重其中一方。Chinchilla 70B使用了约1.4万亿个token进行训练,相对于其规模而言,数据集比许多前代模型大得多,并且在多项基准测试中超越了规模更大的模型。

架构与训练

Chinchilla 70B采用标准的Transformer架构,与同时代其他大型语言模型类似。它使用多头注意力位置编码,并采用仅解码器结构。该模型使用Adam优化器进行训练,并采用包含预热和余弦衰减的学习率调度。训练过程中应用了梯度裁剪以稳定训练。

训练数据集由经过过滤和去重的公开网络文本、书籍及其他来源组成,总计约1.4万亿个token。这是一个有意为之的选择,旨在检验假设:在给定计算预算下,更多数据而非更多参数可能带来更好的性能。训练使用了大型TPU集群,并借助Google Cloud基础设施。

缩放定律与意义

Chinchilla 70B的主要贡献是为计算最优缩放定律提供了实证证据。研究团队,包括Jordan Hoffmann等人,分析了模型规模、数据集规模和计算预算之间的关系。他们发现,在给定计算预算下,最优模型规模远小于此前假设,而最优训练token数量则远大于此前假设。这一结果通常被称为“Chinchilla缩放定律”,表明许多现有模型存在参数过多而训练不足的问题。

Chinchilla 70B尽管参数数量少于GPT-3(175B)和Gopher(280B)等模型,但在许多人工智能基准测试中取得了更优性能,包括语言建模、阅读理解及推理任务。这表明训练效率可能比原始参数数量更为重要。

性能与基准测试

在一系列标准基准测试中,Chinchilla 70B在大多数任务上超越了Gopher(280B参数)和GPT-3(175B参数)。例如,它在MMLU(大规模多任务语言理解)上取得了更高准确率,并在问答和常识推理数据集上表现更佳。该模型在数学和科学推理任务上也表现出色,但仍存在当时语言模型常见的局限性,如事实错误和对提示措辞的敏感性。

该模型的性能在生成式AI发展背景下尤为突出,因为它表明规模更小但训练更优的模型可能更实用且更具成本效益。这影响了后续在AnthropicOpenAI及其他机构的模型开发,这些机构开始更加重视训练数据量。

影响与遗产

Chinchilla缩放定律对深度学习领域产生了重大影响。它们促使研究人员和公司在计算资源分配上发生转变,强调大规模高质量数据集的重要性。这些发现也为后续模型(如LLaMA等)的架构和训练预算决策提供了参考,这些模型采用了类似的数据与参数比例。

Chinchilla 70B本身并未作为开放权重模型发布,但其研究成果被广泛传播,并影响了后续的开源工作。该模型的架构和训练方法成为学术和工业研究的重要参考点,缩放定律分析至今仍是该领域的基础性参考文献。

反响与批评

尽管Chinchilla的结果广受赞誉,一些研究人员指出,缩放定律分析基于有限的模型规模和计算预算,最优比例可能因不同架构或数据分布而变化。后续工作对这些定律进行了细化,但核心见解,,训练数据量与模型规模同等重要,,已被广泛接受。

还有人指出,计算最优方法不一定能在给定推理预算下带来最佳性能,因为更大模型在推理时可能更高效,即使其训练效率较低。这一细微差别促使模型缩放在不同方向上持续探索,包括混合专家架构及其他效率技术。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·google-deepmind·artificial-intelligence·machine-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史