BIG-bench,全称为“超越模仿游戏基准”(Beyond the Imitation Game benchmark),是一个协作式基准,旨在评估大型语言模型在广泛任务中的能力与局限性。该基准于2021年推出,由来自130多个机构的450多名研究人员组成的国际团队创建,以满足对模型性能进行更全面、更具挑战性测试的需求,而不仅仅是简单的扩展指标。该基准由Google Research主办,并得到了包括OpenAI、Anthropic、Google DeepMind和Stanford AI Lab等众多组织的贡献。
该项目名称引用了由Alan Perlis推广的“模仿游戏”概念,但更直接地关联到艾伦·图灵关于机器智能的原始提议。该基准的前提是,当时许多现有的评估方法仅衡量诸如文本分类或问答之类的狭窄任务,而未能深入探究推理、数学问题解决和常识理解等更深层的认知能力。BIG-bench旨在提供一个全面、标准化的测试平台,以追踪跨多个知识和推理领域的进展。
任务多样性与设计
BIG-bench包含超过200个独立任务,每个任务由不同的研究团队创建。任务范围从简单的算术和列表排序到更复杂的问题,如因果推理、代码理解和自然语言推断。值得注意的是,该基准包含了一些挑战模型极限的任务,包括需要多步推理、专业领域知识以及遵循逻辑约束的任务。每个任务遵循标准的JSON格式,便于提交和评分处理。
该基准组织为两个主要子集:BIG-bench(完整套件)和BIG-bench Lite,后者是一个更小、计算成本更低的24个任务集合,用于快速评估。这种设计既允许全面分析,也便于研究社区的实际采用。任务本身采用少样本设置,模型从命令示例中生成预测,无需额外微调,确保不同架构之间的可比性一致。
主要发现与分析
在基准结果的初始发布中,组织者观察到,整体模型性能并不总是与所有任务上的模型规模相关,并且某些任务表现出他们所谓的“涌现能力”,,即当模型规模超过一定阈值时,性能出现突然且显著的提升。这一见解颇具争议,后来Joshua Tenenbaum等人的讨论对涌现现象的本质提出了质疑。研究还强调,一些任务(如自然语言理解)随模型规模呈稳定增长,而其他任务(如某些逻辑或空间推理任务)即使对测试的最大模型(包括来自OpenAI的GPT-3系列)也构成挑战。
基准论文后来修订为第二版,包含了人类表现基线,显示模型在需要世界知识或常识的任务上往往落后于人类,而在晦涩事实查询或句法丰富的推理任务上有时表现优于人类。值得注意的是,BIG-bench允许在低数据或少样本机制下测量准确性,使其成为风险评估和模型选择的有价值工具。
影响与采用
BIG-bench在Machine learning社区中的影响显著。它启发了类似评估套件的创建,如斯坦福大学的HELM框架和更大规模的BIG-bench Hard(或“BBH”),后者用于社区内的深入探测。其发布鼓励了伦理和鲁棒性测试,而不仅仅是任务特定性能。2022年,Google的T5风格任务和OpenAI的私有模型通常旨在使用该套件进行准确性外推,提交到基准的成果已被存档以供纵向研究。
OpenAI、Google DeepMind和Anthropic各自在其已发布的模型评估报告中使用了BIG-bench。作为回应,基准的创建者还强调,这种异构任务的汇集可以揭示幂律关系:错误率往往随计算量和参数的增加呈线性下降,但并非没有一致的例外。
局限性与批评
包括Melanie Mitchell和Brendan Lake在内的研究人员批评者认为,BIG-bench的任务可能过度依赖记忆模式或琐事,缺乏人类在童年获得的基础经验。简单的自然语言改写仍可能被欺骗,且存在逻辑不一致的不确定情况。该基准还因每个任务的平均测试样本数较少(通常少于1000个)而受到批评,这限制了统计功效。
另一个局限性源于以英语为中心的任务,尽管有多国贡献者,但跨语言覆盖不足。虽然BIG-bench Lite减少了计算量,但任务仍呈长尾分布。2023年,一个名为“BIG-bench Hard”(或BBH)的后续项目被引入,增加了任务以测试更近期模型(如GPT-4和Claude)的极限,尽管这超出了原始提交范围。
遗产
BIG-bench是首批为全球提供提交自身任务问题评估平台的项目之一。其人类评分和元分析的框架塑造了后来通用基准(如MMLU或SuperGLUE)的构建方式,并补充了基础模型扩散政策中的论文整理。在伦理层面,它也呼吁在模型评估中进行谨慎的风险设计。在当前人工智能演化的模型时期,BIG-bench继续作为基准如何代表多种思想的参考。
总之,BIG-bench在AI评估中确立了基础性方法,推动开发者对大型模型进行更广泛、更严格的测试,超越文本模仿。其大量自愿贡献的研究人员参与以及可能的大量分隔符,使其成为促进更透明进展的催化剂。
(注:原始基础论文题为“超越模仿游戏:测量和外推大型模型的能力”,在多年时间后于2022年发表。)