预训练是训练现代AI模型的第一阶段,通常也是计算成本最高的阶段,在此阶段,模型使用通用训练目标从大规模通用语料库中学习广泛的统计模式,之后才会针对特定下游任务进行适配。对于大型语言模型,预训练几乎总是意味着自监督学习:模型被赋予海量文本,并训练其根据周围上下文预测一个词元,最常见的是序列中的下一个词元,这一目标无需人工提供的标签,因为“答案”就是现有文本中的下一个词。
预训练为何有效
预训练背后的洞见在于,在庞大且多样的语料库上准确预测下一个词元,会迫使模型隐式学习语法、事实、推理模式,甚至一些基础的世界知识,因为这些都有助于降低预测误差。以这种方式训练的模型被称为基础模型或基座模型,在进一步适配之前,其行为主要像一个高度能干的文本补全引擎,而非遵循指令的助手。基础模型这一术语由斯坦福大学研究人员于2021年提出,反映了一个事实:单个预训练模型可以通过微调或上下文学习,作为许多不同下游应用的起点。
规模与成本
预训练主要由缩放定律主导,这些经验关系表明,随着训练计算量、数据和参数一起增加,模型的损失会可预测地下降,这一框架由OpenAI研究人员于2020年建立,并由DeepMind在2022年的Chinchilla论文中加以完善,该论文认为许多早期模型相对于其规模而言训练不足,数据和参数应同步扩展。最大前沿模型的预训练运行需要数千个GPU或TPU持续数周或数月,据报道成本高达数千万或数亿美元,并且需要从Common Crawl等来源以及许可或专有数据集构建训练语料库。
从预训练到可用助手
一个刚完成预训练的基础模型尚不适合作为对话助手:它会以统计上似乎最可能的方式继续一个提示,而不是直接回答问题或拒绝不安全请求。将基础模型转化为像ChatGPT或Claude这样的产品,需要额外的后训练阶段,通常是在精选的指令-响应对上进行监督微调,随后进行偏好对齐步骤,如RLHF或直接偏好优化。尽管如此,预训练提供了模型原始知识和能力的大部分;后训练主要塑造这些能力的表达方式和控制方式。
趋势与开放问题
由于预训练依赖越来越大规模的文本,研究人员对即将到来的“数据墙”表示担忧,即高质量、人类生成的文本供应相对于缩放定律的需求而言将耗尽,这促使人们对模型自身生成的合成数据以及结合图像、音频和视频的多模态预训练兴趣增加。预训练目标也已超越简单的下一个词元预测,一些方法引入了去噪、BERT使用的掩码词元预测,或类似于CLIP的多模态对比目标。尽管存在这些变体,截至2020年代中期,在大多数部署的大型语言模型中,基于网络规模文本的下一个词元预测仍是主导的预训练配方。