贾里德·卡普兰

译自英文

贾里德·卡普兰是一位从理论物理学家转型为人工智能研究者的科学家,他领导了2020年关于语言模型扩展定律的论文,并共同创立了[[anthropic|Anthropic]],在该公司担任首席科学家。

杰瑞德·卡普兰(Jared Kaplan)是理论物理学家和机器学习研究者,以领导建立语言模型经验性缩放定律的研究而闻名,同时他也是Anthropic的联合创始人兼首席科学家。

背景与缩放定律

卡普兰在进入人工智能研究领域之前,曾在约翰斯·霍普金斯大学担任理论物理学教职。他曾表示,正是这一背景塑造了他的研究方式,即将模型行为视为一个经验的、定量的系统来测量,而非仅凭直觉进行工程化设计。2020年,在隶属于OpenAI期间,他领导完成了论文《神经语言模型的缩放定律》,该论文表明语言建模任务的损失与模型规模、数据集规模和训练计算量之间遵循平滑的幂律关系。该论文为各实验室提供了一种预测性框架,用以决定如何分配固定的计算预算,并直接为GPT-3的训练提供了指导。2022年,DeepMind发表了一篇被广泛引用的后续研究,即“Chinchilla”论文,对卡普兰关于参数与训练词元最优比例的原始结论进行了修正,但卡普兰所建立的幂律框架仍然是前沿实验室规划大规模训练运行的基础性理论。

Anthropic

2021年,卡普兰与达里奥·阿莫代丹妮拉·阿莫代汤姆·布朗克里斯·奥尔等曾在OpenAI共事的人共同创立了Anthropic。作为Anthropic的首席科学家,他负责指导预训练、对齐以及模型能力随规模扩展的经验性研究等研究方向,延续了他在OpenAI时期开启的以缩放为核心的研究计划。Anthropic公开的安全框架,包括其“负责任扩展政策”(参见Anthropic原则),部分建立在一个前提之上,即能力增长的可预测性足以通过缩放趋势进行规划和设限,而这一理念直接源自卡普兰的早期研究。

影响

卡普兰的缩放定律研究经常与GPT-3论文并列,被视为两大关键进展之一,使整个领域相信,持续扩展Transformer模型(而非寻找全新的架构)是获得进一步能力提升的最可靠路径。这一结论深刻影响了前沿模型实验室在2020年代中期的战略布局。

卡普兰的理论物理学背景在关于Anthropic领导层的报道中经常被提及,被视为AI实验室创始人中的一个显著特征。他本人也持续将研究物理系统所采用的经验方法,与前沿实验室在大型训练模型部署前后研究其行为的方式进行明确类比。

分类:scaling-laws·industry·deep-learning
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史