译自英文

Percy Liang是斯坦福大学教授,领导基础模型研究中心,并帮助推广了“基础模型”这一术语,同时创建了用于标准化语言模型评估的HELM基准套件。

Percy Liang是斯坦福大学的计算机科学教授,同时担任斯坦福大学以人为本人工智能研究所(HAI)内基础模型研究中心(CRFM)的主任。

Liang的早期研究聚焦于统计和神经方法在自然语言处理中的应用,包括语义解析以及探测NLP系统对对抗性输入鲁棒性的方法。他在2010年代初加入斯坦福大学教职,并组建了一个研究团队,工作涵盖NLP、机器学习理论,以及随着Transformer架构引入后逐渐主导该领域的大规模预训练模型。

基础模型

2021年,Liang是斯坦福论文《基础模型的机遇与风险》的主要组织者和合著者之一,该论文引入并推广了基础模型这一术语,用以描述像GPT-3BERT这样在广泛数据上大规模训练、可通过微调上下文学习适应多种下游任务的大型模型。论文指出,向基础模型的转变代表了AI研究中的一次重大范式变革,并警示了同质化带来的风险,因为少数被广泛重复使用的基础模型中的缺陷或偏见可能传播到众多下游应用中。

HELM与评估

Liang一直是语言模型严谨、透明评估的积极倡导者。他的团队创建了HELM(语言模型整体评估),这是一个基准套件,旨在同时跨多个场景和指标评估模型,包括准确性、校准、鲁棒性、公平性和效率,而非像早期基准(如MMLU)那样倾向于优化单一排行榜数字。HELM的设计部分是为了回应关于基准饱和和刷分的担忧,旨在在共同场景集上对多家提供商的模型给出更全面、更可复现的行为图景。

影响

通过CRFM,Liang持续发表被广泛引用的研究,追踪基础模型生态系统,包括透明度指数,这些指数对主要AI实验室在训练数据、算力和部署方面的披露程度进行评分。他的工作处于实证AI研究与AI政策交汇点,旨在为这一日益由构建模型的实验室自身(包括OpenAIAnthropicGoogle DeepMind)所产生的结果和评估主导的领域,引入更多独立的学术审视。

分类:ai-research·evaluation·academia
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史