LLM评估,通常简称为evals,是指用于衡量大型语言模型的能力、质量、可靠性和安全性的方法和基础设施。随着LLM被应用于越来越广泛的任务,评估已从一项狭窄的学术活动发展成为AI实验室中一门重要的实践学科,因为评估决定了哪些内容会公开发布,指导开发者进行模型选择,并且越来越多地反馈到训练本身之中。
静态基准测试套件
最传统的评估形式是使用带有已知正确答案的固定基准数据集来测试模型,例如用于知识的MMLU、用于编码的HumanEval或SWE-bench,以及用于抽象推理的ARC-AGI。这些套件重复运行成本低,并且可以直接进行数值比较,但会遭受基准饱和和训练数据污染的问题,因为模型在越来越大的网络抓取数据上训练,这些数据可能与测试集重叠。
人类偏好竞技场
由于LLM的许多有价值的特质,如有用性、写作质量或语气,难以用简单的正确性评分来衡量,像LMArena(原Chatbot Arena)这样的平台会收集大量模型输出之间的盲法、两两人类比较,并计算类似Elo的排名。这种方法能很好地捕捉人类的整体偏好,但也被批评为奖励风格特征(如冗长或顺从),这些特征不一定与更深层次的能力或正确性相关,并且可能通过针对平台用户分布专门调整模型来操纵结果。
LLM即评委
一种较新的方法使用一个LLM来评估另一个LLM的输出,根据正确性、有用性或对评分标准的遵守情况对回答进行评分,因为人工评估在规模上既慢又昂贵。LLM即评委的方法在许多任务上可以较好地近似人类判断,并允许评估扩展到远超人类评分员所能覆盖的更多示例,但会继承其自身模型的偏见和盲点,包括倾向于偏好更长或措辞更自信的回答,并且如果被评估的模型学会产生欺骗评委的输出而非真正改进,这种方法也可能被利用。
特定领域和安全评估
除了通用能力之外,评估还越来越多地涵盖更具体的属性:事实性问题的幻觉率、对越狱和提示注入的敏感性、跨人口群体的偏见,以及与AI安全相关的危险能力评估,例如模型是否能够有意义地协助网络攻击或生物武器合成。包括Anthropic和OpenAI在内的实验室将此类评估作为部署前测试的一部分,并与其负责任扩展承诺挂钩。包括布莱切利宣言后成立的政府AI安全研究所在内的第三方机构,也会对前沿模型发布进行独立评估。
挑战
评估面临着持续的困难:一旦实验室知道衡量标准,基准和竞技场就可能被操纵,这是古德哈特定律在模型开发中的体现;污染破坏了静态评分的有效性;并且没有单一的数值能够捕捉用户所关心的众多(有时是相互矛盾的)特质,如有用性、诚实性和无害性。这推动该领域向结合多种方法的评估组合、持续刷新问题的“活基准”,以及更加强调真实世界、基于任务和智能体评估的方向发展,这些评估比孤立的问答更能反映实际部署情况。
重要性
由于评估决定了哪些模型被认为是最好的,并且通过RLHF和奖励建模等技术越来越多地直接反馈到训练中,评估方法的设计已成为影响该领域领先模型实际行为的重要(尽管不太显眼)驱动因素。