译自英文

BBH 2024是BIG-Bench Hard基准的更新版本,于2024年推出,旨在通过修订的提示和评分来评估大型语言模型在具有挑战性的推理任务上的表现。

BBH 2024是一个用于评估大型语言模型(LLM)在一系列具有挑战性的推理任务上表现的基准。它是BIG-Bench Hard(BBH)基准的进一步更新版本,而BBH本身又是更大的BIG-Bench套件中精选的子集。BBH 2024于2024年发布,旨在解决原始BBH的局限性,特别是新模型性能饱和的问题,以及对更稳健评估协议的需求。

该基准包含从BIG-Bench中选出的23项任务,这些任务被认定为对语言模型特别困难。这些任务涵盖了一系列推理能力,包括因果判断、日期理解、消歧和逻辑演绎。BBH 2024引入了修订后的提示、更新的答案格式,以及一种新的评分方法,该方法比原始BBH更严格地惩罚部分正确的答案。更新后的基准旨在为AI研究前沿的模型能力提供更可靠的衡量标准。

任务组成与选择

BBH 2024中的23项任务与原始BBH相同,但进行了重大修改。例如,“因果判断”任务现在包含100个额外的反事实场景,“日期理解”任务已扩展以覆盖更广泛的日历格式。“逻辑演绎”任务现在要求模型输出一系列推理步骤,而不仅仅是最终答案。这些更改旨在降低简单模式匹配的有效性,并鼓励真正的推理。

每项任务都包含一个带有3到5个示例的少样本提示,与原始BBH一致。然而,BBH 2024提供了更新的示例,这些示例反映了更近期的语言使用情况,并包含正确答案的解释。该基准还引入了“思维链”评估模式,其中模型被提示在最终答案之前生成中间推理步骤,以及一种不进行此类提示的“直接”模式。

评分与评估

BBH 2024使用一种评分系统,仅对与真实答案完全匹配的情况给予满分。对于包含正确最终答案但带有额外文本的答案,给予部分分数。该基准报告了任务间的平均准确率和标准差。对于思维链模式,准确率是在推理步骤之后的最终答案上计算的,并引入了一个单独的指标“推理连贯性”来评估生成步骤的逻辑一致性。

在原始BBH中,像GPT-3这样的模型在任务上的平均准确率约为40%。到2024年,像GPT-4和Claude 3这样的最先进模型在原始BBH上已超过80%,这促使需要一个更具挑战性的版本。BBH 2024包含一种新的“困难模式”,其中提示被对抗性扰动,并且基准报告了标准和困难两种模式的结果。

模型性能与饱和

2024年年中发布的BBH 2024初步结果显示,表现最佳的模型,包括GPT-4 Turbo和Claude 3 Opus,在标准模式下的平均准确率约为70%,在困难模式下约为50%。这与它们在原始BBH上的近乎饱和状态相比有显著下降,表明更新后的基准提供了更具区分度的评估。该基准已被多个AI研究实验室采用,包括OpenAIAnthropicGoogle DeepMind,作为其模型的标准评估工具。

BBH 2024还包括一项“人类基线”研究,通过众包平台招募了100名人类参与者。人类在标准模式下的基线准确率为85%,在困难模式下为75%,这表明该基准仍为AI系统留出了改进空间。

与其他基准的关系

BBH 2024是更广泛的AI基准生态系统的一部分。它补充了其他套件,如MMLU(大规模多任务语言理解)和HellaSwag,但特别关注需要多步推理的任务。与涵盖广泛知识领域的MMLU不同,BBH 2024强调那些对人类来说容易但对AI来说困难的任务,正如BIG-Bench最初所定义的那样。更新版本保持了这一理念,同时增加了评估的难度和稳健性。

该基准在GitHub上公开可用,作者提供了一个包含各种模型结果的排行榜。排行榜定期更新,截至2024年末,榜首是来自Google DeepMind的一个模型,在标准模式下的平均准确率为72.3%。

未来方向

BBH 2024的创建者表示,他们计划发布年度更新以跟上模型改进的步伐。他们还在探索纳入需要多模态推理的任务,例如解释图表和图示。预计该基准在可预见的未来仍将是评估大型语言模型推理能力的关键参考点。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:benchmark·large-language-models·reasoning·evaluation
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史