Evals(评估,evaluations的简称)是对人工智能模型或智能体行为的系统性评估。在大语言模型和生成式AI应用的语境下,evals作为结构化的测试套件,旨在衡量模型在一系列任务和场景中的性能、安全性和可靠性。它们是开发者用于开发、调试和部署AI系统的核心工具,为对比模型版本、检测性能回退以及验证应用程序是否满足预期要求提供了定量依据。
Evals的实践与机器学习和深度学习的快速发展同步壮大。早期的AI研究通常依赖基准数据集(包含已知答案的固定任务集合)来衡量进展。随着模型能力的增强并融入实际产品,对更细致、更贴近应用场景的评估需求也随之增长。如今,evals不仅涵盖标准基准上的准确性,还包括对推理能力、事实一致性、安全性、偏见、指令遵循以及智能体行为的评估,其中智能体行为指AI系统在环境中采取行动。
历史背景与基准
Evals的沿革可追溯至人工智能领域的经典基准套件。例如,艾伦·图灵于1950年提出的图灵测试,是对机器智能的早期概念性评估,尽管如今已很少在实际中使用。在随后的数十年里,研究人员为棋类、自然语言处理和计算机视觉等领域开发了特定任务的基准。2010年代,神经网络和深度学习的兴起加速了大规模基准的创建,例如用于图像分类的ImageNet,该基准在深度学习革命中起到了关键作用。
在语言模型方面,GLUE(General Language Understanding Evaluation通用语言理解评估)及其后继者SuperGLUE在2018至2019年前后引入,提供了一套涵盖情绪分析、问答、文本蕴含等任务的标准化测试。这些基准使研究人员能够在统一的基础上比较模型。然而,随着大型语言模型规模和能力的增长,这些基准很快出现饱和,促使开发更具挑战性和多样性的评估集。
面向现代大语言模型的Evals
当代的大型语言模型evals通常由OpenAI、Anthropic、Google DeepMind等组织及学术机构构建。它们通常包含一组提示词或任务,每个任务带有评分标准或预期结果,并设有评分机制。评分可以是自动化的,例如检查精确字符串匹配、使用另一个模型作为评判员,或者对生成的代码运行单元测试;也可能会采用人类评分员,从求助性、无害性和诚实性等维度对回答质量进行评估。
一种常见的eval类型是基于现有考试或精选知识库生成的选择题或简答题集。例如,MMLU(Massive Multitask Language Understanding大规模多任务语言理解)包含数千道涵盖数学、历史、法律和医学等学科的问题。另一个广泛使用的eval是HellaSwag基准,通过要求模型选择一段故事最合理的续写来测试常识推理。这些基准提供了模型知识和推理能力的广泛度量。
智能体与行为验证
随着AI智能体的兴起(指能够使用工具、浏览网页或与软件环境交互的系统),evals的范围扩展到智能体行为。这类评估通常将智能体置于模拟环境中,衡量其完成多步骤任务、从错误中恢复以及长期遵循指令的能力。例如,一个eval可能要求智能体预订航班、编写并执行代码,或在虚拟办公室中导航,其成功与否取决于最终结果是否与预期相匹配。
行为验证测试也考察安全性与对齐性。它们包括对抗性测试,旨在诱导模型产出有害输出,例如制造非法活动的方法、恶意偏见的言论或直接传递输入信息。红队攻击(Red-teaming,即由人类测试员尝试强行破坏模型)是一种互补方法,常为自动化eval的设计提供参考。这些测试结果为强化学习(如基于人类反馈的强化学习(RLHF))及宪法AI等技术应用提供了相应依据。
构建与运行Evals
在实践层面,构建一个eval包含若干步骤。首先,实践者须明确其范围,明确某特定应用中的重要能力或行为。然后,他们收集或生成一组能将典型输入与极端边界情况表示的测试用例。针对每个测试用例,都需明确评分度量标准。这可能是精确匹配、语义相似度分数、基于评分标准的人类评级,或是调用裁判模型根据提示评判回应。
运行evals通常自动化集成到开发流中。当训练出的新模型版本或修改了某个提示词时,该eval套件即会被执行,并将结果与基准进行比较。这样团队便能发现回退,即某些改动在提升某些性能时却削弱了其他方面。许多组织维护着内部的eval平台,记录随时间变化的结果,从而对模型在不同类别中的行为进行详细分析。
Evals面临的一个关键挑战是确保它们针对性不足。如果模型在何处使用EVAL数据进行训练,其训练集可直接用作训练目标(tuning/testing)的数据,它未必能反映真实世界最终可能的泛化表现。为了规避此问题,通常将评估集与训练集隔离,并定期更换新版本。此外,基准的饱和现象(即模型在测量上几乎得到完美分数)促进了创建更艰难的基准,以及采用动态或对抗性的评估方法。
人工评估的角色
尽管自动评分取得进展,但人工评估始终是模型171(AI)质量的多方面验证的“金标准”。人工评估者可以评估那些难以算法化以内容诠释的细微特质,如语气、创意及文化适切性。然而,人工评估成本高、周期长,因而经常仅严格用于对少量输出进行验证,或为评估模型提供规范。近年来,设立专门的大规模语言模型作为裁判(judge model)的情况越来越多,某些强大模型被要求按照评估标准给出另一个模型的输出评分,并与人类评估者的评估相对比,以确定结果的一致性,它们在扩展性方面具备优势,但同样引入其自身的其它潜在危害,相关研究仍在持续。
Evals在行业与研究中的应用
主要的AI实验室及云服务提供商已将Evals视为核心运作环节。众多知名机构,如Anthropic,公开过其Claude模型的能力及安全评估细节;OpenAI已发布其GPT模型的评估;Google DeepMind也为研究社区扩充了大量基准。开源社区项目,如EleutherAI Language Model Evaluation Harness,提供了各种工具,能够简便地在任何模型上进行无需预训练的标准基准运行。
在规制与政策层面,Evals起着双重作用。随着政府对AI治理的考虑,衡量与验证模型行为的可靠性变得不可或缺。规范化的评估可成为认证或合规体系的基础,尽管目前尚无全球统一标准。
挑战与未来挑战
Evals领域面临几个可待解决的核心问题。一个痛点是难以度量那些纯粹“分数”不能概括的能力,例如长期的规划或常识推理。另一个风险是古德哈特定律的体现,,被,即若某个指标受到当初设定,优化它可能反而导致优化测试指标,而非提升真实性能。此外,对于持续更新、或与真实世界交互的不可预测的保护,如何保持正确解决,也需我们审慎。
未来的方向包括:开发更具动态和适应性的evals,其测量集能够根据模型行为实时调整,并将evals紧密融入训练循环,使模型能直接针对eval表现进行优化。研究者还在探索利用evals来评估模型与人类价值观的校准以及发现原本训练中没有涉及的意外能力,以获得下一重要的信息。
综上所述,Evals是负责任AI开发的重要组成部分。它提供了推动改进、确保安全以及建立对AI信心的经验性反馈机制。随着技术的不断演进,评估它们的方法和工具也将持续进化,使Evals成为极具活力的、有助于进一步研究和开发的基础领域。
参考相关
- Large language model([[]]格式应保留原文,不得翻译,即显示为 Large language model)
- Generative AI
- Reinforcement Learning from AI Feedback (RLAIF)
- Artificial intelligence
- Machine learning
- Deep learning
- Neural network
- Transformer (architecture)
- OpenAI
- Anthropic
- Google DeepMind
- AI benchmark
- Red teaming (AI)
- Model Pruning
- Data Augmentation
- Curriculum Learning
- Loss Functions
- Multi-Head Attention
- Beam Search
- Temperature Scaling