译自英文

基础模型是一种大规模机器学习模型,在海量数据上进行训练,可通过微调或提示适配到广泛的下游任务,该术语由斯坦福大学研究人员于2021年提出。

基础模型是一种在广泛(通常是网络规模)的数据上训练的机器学习模型,它可以适应各种下游任务,而不是为单一狭窄目的而构建。该术语由斯坦福大学基础模型研究中心(CRFM)在2021年的一份报告中首创,该中心由包括Percy Liang在内的研究人员领导,他们认为像GPT-3BERT这样的模型代表了一种新范式:一个单一的模型,经过预训练后,通过微调上下文学习提示工程成为许多应用的基础,而不是每个任务都需要从头训练一个模型。

起源与定义

CRFM报告通过参数、数据和计算方面的规模、广泛的训练目标(例如在未标记数据上进行自监督预训练)以及通用性(即单一模型学到的表示通过相对轻量的适应可以迁移到许多下游任务)来区分基础模型。这一框架建立在并扩展了早期的迁移学习思想之上,即在一个任务或数据集上预训练的模型被重用,通常经过微调后用于相关任务。

示例

基础模型涵盖多种模态:以文本为中心的模型,如GPT系列、ClaudeGeminiLlama;基于CLIP风格预训练的视觉-语言系统;图像生成模型,如Stable Diffusion;以及语音模型,如Whisper。大多数大型语言模型在这个意义上都是基础模型,尽管该术语早于并比LLM更广泛,因为它也涵盖非文本和多模态系统。

为何使用该术语

这一标签的出现部分是为了捕捉AI系统构建和部署方式的转变:不再是研究团队为每个任务训练定制模型,而是发布一个开放权重或专有的基础模型,然后由许多下游用户进行适配,从而大幅降低构建新AI应用的成本。这催生了一个生态系统,以Hugging Face等平台为代表,其核心是共享、微调和部署基础模型,而不是从头训练。该术语在政策讨论中也证明有用,因为像欧盟人工智能法案这样的法规为通用或基础模型的提供者设定了具体义务,区别于仅仅在其上构建应用的开发者。

批评与注意事项

CRFM报告本身承认了风险:基础模型将能力和影响力集中在少数能够训练它们的组织手中,将其广泛训练数据中存在的偏见传播到基于它们构建的每个下游应用中,并且可能在训练数据分布之外表现出不可预测的行为。批评者(包括一些原本欢迎这一框架的人)指出,“基础”一词暗示了早期大型模型并不总是具备的稳定性和可靠性,而且该术语可能掩盖模型之间的有意义差异,例如它们是开放还是封闭,或使用不同的对齐技术进行训练。尽管如此,基础模型在其引入后的几年内成为研究论文和法规中的标准词汇。

与其他术语的关系

基础模型与前沿模型高度重叠但不完全相同,后者特指在特定时间能力最强的模型;也与LLM相关但不同,后者特指文本领域。基础模型不一定处于能力前沿,也不是所有基础模型都是语言模型。

分类:deep-learning·ai-governance·industry
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史