地鼠,即[[Gopher|地鼠]],是一种生活在北美洲的啮齿动物,属于[[Geomyidae|地鼠科]]。它们以其挖掘地道的习性而闻名,常在草地、农田和花园中活动。以下是对这种动物的详细描述。

译自英文

Gopher是谷歌DeepMind开发的一系列基于Transformer的大型语言模型,其中最大的变体包含2800亿个参数。它旨在研究语言模型的缩放规律,并作为[[chinchilla]]模型家族的前身。

Gopher是Google DeepMind研究团队开发的一系列大型语言模型。该系列包含六个基于Transformer的模型,规模从4400万参数到2800亿参数不等,其中最大的模型默认被称为“Gopher”。Gopher于2021年底发布,其训练目的是研究大型语言模型的缩放规律,为随后于2022年3月推出的Chinchilla模型系列奠定了基础。

Gopher系列是更广泛研究努力的一部分,旨在探究模型性能如何随参数和训练数据规模而变化。这些模型本质上与GPT-2架构相同,但进行了少量修改,包括使用RMSNorm替代LayerNorm,以及采用相对位置编码而非绝对位置编码。最大的Gopher模型拥有2800亿参数,在约3000亿个token上进行了训练。

缩放规律与训练

Gopher的开发源于一个问题:在训练大型语言模型时,如何最优地分配计算资源。在Gopher之前,许多模型(包括OpenAI的GPT-3)都侧重于增加模型规模,同时保持训练数据相对固定。然而,Gopher研究团队通过实证研究发现,在给定的计算预算下,最优的模型规模和训练token数量遵循特定关系:如果模型规模翻倍,训练token数量也应翻倍。这一发现后来在Chinchilla论文中被正式化,表明许多现有模型存在训练不足的问题。

Gopher的训练使用了大规模文本语料库,该模型在多种自然语言处理基准测试中表现出色。然而,其在测量大规模多任务语言理解(MMLU)基准上的平均准确率为60.5%,这一数字后来被其继任者Chinchilla超越。

架构与变体

Gopher系列包含六个模型,参数数量分别为4400万、1.17亿、4.17亿、14亿、71亿和2800亿。所有模型共享相同的核心架构,基于Transformer架构,具体来说类似于GPT-2,但带有上述修改。使用RMSNorm(一种计算效率更高的层归一化变体)和相对位置编码(可改善对更长序列的泛化能力)是与早期Transformer模型的关键区别。

最大的Gopher模型使用分布式训练设置进行训练,利用了数千个加速器。训练过程资源密集,模型在推理和微调方面都需要大量计算能力,这一局限性促使了后来Chinchilla的开发。

性能与评估

Gopher在多种基准上进行了评估,包括语言建模、阅读理解、问答等。它在许多领域展现出强大能力,但其性能并非在所有任务上都统一优于较小模型。例如,在一些推理和知识密集型任务上,Gopher表现良好,但在事实一致性和常识推理等领域也表现出局限性。

与GPT-3相比,Gopher在多个基准上取得了具有竞争力或更好的结果,但差异并不总是显著。研究团队指出,相对于模型规模的大幅增加,Gopher的性能提升往往较为有限,这进一步凸显了训练数据缩放的重要性。

遗产与继任者

Gopher的主要遗产在于其对理解语言模型缩放规律的贡献。从训练Gopher中获得的见解直接指导了Chinchilla的设计,这是一个拥有700亿参数、在1.4万亿token上训练的模型系列。Chinchilla于2022年3月发布,在类似计算预算下实现了比Gopher更高的平均准确率(MMLU上为67.5%),证明了缩放规律建议的有效性。

Chinchilla系列与Gopher共享相同架构,但使用AdamW优化器而非Adam进行训练。Gopher还作为其他模型的基础,例如Flamingo视觉语言模型,该模型利用了Gopher系列的组件。截至2023年1月,Chinchilla仍处于测试阶段,而Gopher已被其更高效的继任者所取代。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·google-deepmind·transformer-models·artificial-intelligence
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史