BIG-bench 2023是“超越模仿游戏基准”的修订版,这是一项于2021年启动的合作项目,旨在评估大型语言模型的能力与局限性。最初的BIG-bench包含204项任务,由来自130个机构的450多名研究人员贡献,设计用于探测标准基准常常遗漏的技能,如因果推理、常识知识和数学问题求解。2023年更新版于2023年初发布,在此基础上增加了新任务、改进了评估指标,并扩大了测试模型的范围,特别关注生成式AI系统快速发展的格局。
该基准的主要目的是为衡量人工智能(尤其是大型语言模型)的进展提供一个严谨、标准化的标尺。与早期聚焦于问答或情感分析等狭窄任务的基准不同,BIG-bench 2023包含需要多步推理、世界知识甚至创意写作的任务。它还强调衡量模型校准(置信度与准确性匹配的程度)以及对对抗性输入的鲁棒性。2023版本引入了一个指定为“BIG-bench Hard”(BBH)的任务子集,包含23项先前模型表现低于或等于平均人类评分者水平的任务,作为未来发展的挑战性障碍。
结构与任务类别
BIG-bench 2023将其任务组织为几个广泛类别,每个类别针对模型能力的不同方面。这些包括:
- 推理:涉及逻辑演绎、因果推断和多步算术的任务。示例包括“causal_judgement”和“logical_deduction”(涉及三到五个对象)。
- 知识:探测事实性世界知识的问题,如“periodic_elements”或“international_phonetic_alphabet_transliterate”。
- 社会偏见与公平性:如“bbq_lite”和“gender_bias”等任务,评估模型是否表现出有害的刻板印象。
- 语言理解:涉及语义、句法和语用学的任务,如“linguistics_puzzles”和“novel_concepts”。
- 数学:需要符号操作和算术的问题,包括“mathematical_induction”和“number_sequence”。
- 常识:如“physical_intuition”和“social_support”等测试日常推理的任务。
每项任务包括一个提示、一组可能答案和一个评分指标(通常是精确匹配或多选准确率)。2023更新版新增了代码生成和多语言理解等领域的一些任务,反映了这些技能在实际应用中的日益重要性。
评估方法与指标
BIG-bench 2023使用标准化评估协议以确保跨模型的可比性。模型被提示每项任务的输入,其输出使用特定任务的指标进行评分。主要汇总指标是所有任务的平均归一化准确率,其中每项任务的分数被归一化,使得随机猜测得0分,完美表现得1分。这允许用一个数字总结整体能力。
2023版本还引入了“针对性”评估,即模型在特别困难或与特定能力相关的任务子集上进行测试。例如,BBH子集用于跟踪先前未解决任务的进展。此外,基准包括“少样本”设置(通常为0样本、1样本和5样本)以衡量上下文学习能力,并报告校准误差,该误差指示模型预测概率与实际正确性的匹配程度。
模型覆盖与结果
BIG-bench 2023包含来自广泛模型的结果,从Google DeepMind和Anthropic等开源努力到OpenAI等专有系统。该基准已用于评估不同规模的模型,从数百万参数的小型Transformer到数千亿参数的大型语言模型。显著发现包括性能通常随模型规模提高,但某些任务即使对最大模型仍具挑战性,例如需要深层逻辑推理或稀有事实知识的任务。
例如,在BBH子集上,2023年的许多模型归一化准确率仍低于50%,表明有显著改进空间。基准还强调模型常常表现出过度自信,校准误差在较难任务上更高。这些结果已为Reinforcement Learning from AI Feedback (RLAIF)(基于AI反馈的强化学习)和更好训练数据整理等技术的研究提供了信息。
影响与反响
2023更新版已被AI研究社区广泛采用作为标准评估套件。它已被数百篇论文引用,并被主要实验室用于比较其模型。BIG-bench的合作性质,得益于MIT CSAIL、Stanford AI Lab和BAIR (Berkeley AI Research)等机构的贡献,培育了开放基准测试的文化。批评者指出,基准的任务是静态的,可能随时间饱和,但2023版本包含新任务和BBH子集缓解了这一担忧。
BIG-bench 2023还影响了类似基准的开发,如HELM和MMLU,并已被用于研究大型语言模型中的涌现能力。其结果在理解GPT-4和Claude (AI model family)等系统的能力与局限性方面发挥了重要作用,并继续作为衡量人工智能进展的参考点。
未来方向
截至2023年,BIG-bench团队已宣布进一步更新的计划,包括动态任务生成和更交互式的评估格式。目标是保持基准在模型演进中的相关性,可能纳入需要工具使用或多轮对话的任务。2023版本仍然是当时AI能力的快照,但其方法论和见解可能会影响未来多年的基准测试工作。