BIG-bench(Beyond the Imitation Game benchmarkの略)は、大規模言語モデルの能力と限界を幅広いタスクにわたって評価するために設計された共同ベンチマークである。2021年に導入され、130以上の機関から450人以上の研究者からなる国際チームによって作成された。これは、単純なスケーリング指標を超えた、モデル性能のより包括的で挑戦的なテストの必要性に対応するためである。このベンチマークは特にGoogle Researchが主催し、OpenAI、Anthropic、Google DeepMind、Stanford AI Labなどの組織を含む多くの貢献が含まれていた。
プロジェクト名は、Alan Perlisによって広められた「模倣ゲーム」の概念に言及しているが、より直接的にはアラン・チューリングによる機械知能の当初の提案に関連している。このベンチマークの前提は、当時の既存の評価方法の多くがテキスト分類や質問応答などの狭いタスクのみを測定し、推論、数学的問題解決、常識的理解などのより深い認知能力を探ることに失敗していたというものである。BIG-benchは、知識と推論の多くの分野にわたる進歩を追跡できる、包括的で標準化されたテスト場を提供するように設計された。
タスクの多様性と設計
BIG-benchは200以上の個別タスクで構成され、それぞれが異なる研究グループによって作成された。タスクは単純な算術やリストの並べ替えから、因果推論、コード理解、自然言語推論などのより複雑な問題まで多岐にわたる。特筆すべきは、このベンチマークにはモデルの限界を押し広げるタスクが含まれており、多段階推論、専門分野の知識、論理的制約の順守を必要とするものもある。各タスクは標準的なJSON形式に準拠しており、スコアリングのための提出と処理が容易になっている。
このベンチマークは主に2つのサブセットに編成されている。BIG-bench(完全なスイート)とBIG-bench Liteであり、後者は迅速な評価のための計算コストが低い24のタスクからなる小規模なセットである。この設計により、包括的な分析と研究コミュニティによる実用的な採用の両方が可能になる。タスク自体は数ショット設定を課しており、モデルは追加の微調整なしに指示された例から予測を生成し、異なるアーキテクチャ間での一貫した比較可能性を確保している。
主要な発見と分析
ベンチマーク結果の初期リリースでは、主催者は全体的なモデル性能がすべてのタスクでモデル規模と相関するとは限らず、特定のタスクが「創発的能力」、つまりモデルサイズが特定の規模を超えると突然かつ大幅な性能向上を示すことを観察した。この洞察は物議を醸し、後のJoshua Tenenbaumらによる創発現象の性質についての議論が行われた。この研究はまた、自然言語理解を必要とするタスクなど一部はモデルサイズとともに着実にスケーリングする一方で、特定の論理的または空間的推論タスクなどは、OpenAIのGPT-3シリーズを含むテストされた最大のモデルにとっても課題を提起することを強調した。
後に第2版に改訂されたベンチマーク論文には、人間の性能ベースラインが含まれており、モデルは世界知識や常識を必要とするタスクでしばしば遅れをとり、一方で不明瞭な事実質問や構文的に豊かな推論タスクで人間を上回ることがあることを示した。特に、BIG-benchは低データまたは数ショットのレジームでの精度測定を可能にし、リスク評価とモデル選択のための貴重なツールとなった。
影響と採用
Machine learningコミュニティにおけるBIG-benchの影響は大きい。これは、スタンフォードのHELMフレームワークや、コミュニティ内での詳細な調査に使用される大規模なBIG-bench Hard(`BBH`)など、類似の評価スイートの作成に影響を与えた。そのリリースは、単なるタスク固有の性能ではなく、倫理的および堅牢性テストを奨励した。2022年には、GoogleのT5スタイルのタスクやOpenAIのプライベートモデルが、このスイートを使用して精度の外挿を目指すことが多く、ベンチマークへの提出物は縦断的研究のためにアーカイブされている。
OpenAI、Google DeepMind、Anthropicはそれぞれ、公開されたモデル評価レポートの1つ以上でBIG-benchを使用している。これに応えて、ベンチマークの作成者も、このような異種のタスクの集積が冪則関係を明らかにできることを強調した。エラー率は計算量とパラメータの増加に伴い線形的に減少する傾向があるが、一貫した例外がないわけではない。
限界と批判
Melanie MitchellやBrendan Lakeなどの研究者を含む批判者たちは、BIG-benchのタスクが記憶されたパターンやトriviaに過度に依存しており、人間が幼少期に獲得する接地された経験が欠けていると主張している。テストにおける単純な自然言語の言い換えでもだまされる可能性があり、論理的不整合の不確実な発生がある。ベンチマークはまた、タスクあたりのテスト例の平均数が低いこと(しばしば1000未満)が批判され、統計的検出力が制限されている。
もう一つの限界は英語中心のタスクから生じており、多国籍の貢献者による作業にもかかわらず、言語横断的なカバレッジがほとんどない。BIG-bench Liteは計算を削減するが、タスクはロングテールのままである。2023年には、``BIG-bench Hard''(またはBBH)と呼ばれるフォローアッププロジェクトが導入され、GPT-4やClaudeなどのより最近のモデルの限界をローカルにテストするためのタスクが追加されたが、元の提出物の外である。
遺産
BIG-benchは、全世界が独自のタスク問題を評価のために提出できるプラットフォームを初めて作成したものの一つである。その人間のスコアリングとメタ分析のフレームワークは、MMLUやSuperGLUEなどの後の汎用ベンチマークの構築方法を形づくり、基盤モデルの拡散におけるポリシーのための論文の整理を補完している。倫理的レベルでは、モデル評価における慎重なリスク設計の必要性も呼びかけている。現在、人工知能の進化のためのモデル期間が存在する時点で、BIG-benchは、ベンチマークが多くの心を表現できる方法を参照するための参照点として継続している。
要約すると、BIG-benchはAI評価における基盤的アプローチを確立し、テキストの模倣を超えた大規模モデルのより広範で厳格なテスティングへの開発者を促している。その大部分がボランティアによる研究者のコミットメントと、おそらくその多くのセパレータの使用は、より透明な進歩のための触媒として際立っている。
(注:元の基盤論文「Beyond the Imitation Game: Measuring and extrapolating capabilities in large of model」は、数年のタイミングを経て2022年に公開された。)