BIG-bench 2023は、Beyond the Imitation Gameベンチマークの改訂版であり、2021年に開始された、大規模言語モデルの能力と限界を評価するための共同作業である。元のBIG-benchは、130の機関に所属する450人以上の研究者によって貢献された204のタスクで構成されており、因果推論、常識知識、数学的問題解決など、標準的なベンチマークが見逃しがちなスキルを探るように設計されていた。2023年のアップデートは、2023年初頭にリリースされ、新しいタスクの追加、評価指標の改良、テストされるモデルの名簿の拡大、特に急速に進化する生成AIシステムの状況に焦点を当てることで、この基盤の上に構築されている。
このベンチマークの主な目的は、人工知能、特に大規模言語モデルの進歩を測定するための厳密で標準化された物差しを提供することである。質問応答や感情分析のような狭いタスクに焦点を当てた初期のベンチマークとは異なり、BIG-bench 2023には、多段階の推論、世界知識、さらには創造的な文章作成を必要とするタスクが含まれている。また、モデルの較正(信頼度が正確さとどの程度一致するか)と敵対的入力に対する堅牢性の測定も重視している。2023年版では、「BIG-bench Hard」(BBH)と指定されたタスクのサブセットを導入した。これは、以前のモデルが平均的な人間の評価者と同等かそれ以下のパフォーマンスを示した23のタスクであり、将来の開発にとって挑戦的なハードルとなっている。
構造とタスクカテゴリ
BIG-bench 2023は、そのタスクをいくつかの広範なカテゴリに編成しており、それぞれがモデルの能力の異なる側面を対象としている。これらには以下が含まれる。
- 推論: 論理的演繹、因果推論、多段階算術を含むタスク。例としては「causal_judgement」や「logical_deduction」(3つから5つのオブジェクトを含む)がある。
- 知識: 「periodic_elements」や「international_phonetic_alphabet_transliterate」などの事実に基づく世界知識を問う質問。
- 社会的バイアスと公平性: 「bbq_lite」や「gender_bias」のような、モデルが有害なステレオタイプを示すかどうかを評価するタスク。
- 言語理解: 意味論、構文論、語用論に関するタスク。例としては「linguistics_puzzles」や「novel_concepts」がある。
- 数学: 記号操作と算術を必要とする問題。例としては「mathematical_induction」や「number_sequence」がある。
- 常識: 「physical_intuition」や「social_support」のような日常的な推論をテストするタスク。
各タスクには、プロンプト、一連の可能な回答、およびスコアリング指標(通常は完全一致または多肢選択の正確さ)が含まれる。2023年のアップデートでは、コード生成や多言語理解などの分野でいくつかの新しいタスクが追加され、現実世界のアプリケーションにおけるこれらのスキルの重要性の高まりを反映している。
評価方法論と指標
BIG-bench 2023は、モデル間の比較可能性を確保するために標準化された評価プロトコルを使用している。モデルは各タスクの入力でプロンプトされ、その出力はタスク固有の指標を使用してスコアリングされる。主要な集計指標は、全タスクにわたる平均正規化精度であり、各タスクのスコアは、ランダムな推測が0、完全なパフォーマンスが1になるように正規化される。これにより、全体的な能力を要約する単一の数値が可能になる。
2023年版では、「対象を絞った」評価も導入され、モデルは特定の能力にとって特に困難または関連性のあるタスクのサブセットでテストされる。例えば、BBHサブセットは、以前は未解決だったタスクの進歩を追跡するために使用される。さらに、このベンチマークには、文脈内学習能力を測定するための「少数ショット」設定(通常は0ショット、1ショット、5ショット)が含まれており、モデルの予測確率が実際の正確さとどの程度一致するかを示す較正誤差も報告される。
モデルのカバレッジと結果
BIG-bench 2023には、Google DeepMindやAnthropicなどのオープンソースの取り組みから、OpenAIやその他の専有システムまで、幅広いモデルの結果が含まれている。このベンチマークは、数百万のパラメータを持つ小さなトランスフォーマーから、数千億のパラメータを持つ大規模言語モデルまで、さまざまなサイズのモデルを評価するために使用されてきた。注目すべき発見としては、パフォーマンスは一般的にモデルの規模とともに向上するが、深い論理的推論や稀な事実知識を必要とするものなど、いくつかのタスクは最大のモデルでも挑戦的であり続けることが挙げられる。
例えば、BBHサブセットでは、2023年の多くのモデルが依然として50%未満の正規化精度をスコアリングしており、改善の余地が大きいことを示している。このベンチマークはまた、モデルがしばしば過信を示すこと、つまり較正誤差がより難しいタスクで高くなることを強調した。これらの結果は、Reinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)やより良いトレーニングデータのキュレーションなどの技術に関する研究に情報を提供してきた。
影響と受け止め方
2023年のアップデートは、標準的な評価スイートとしてAI研究コミュニティによって広く採用されている。それは何百もの論文で引用され、主要な研究所が自社のモデルを比較するために使用している。MIT CSAIL、Stanford AI Lab、BAIR (Berkeley AI Research)などの機関からの貢献によるBIG-benchの協力的な性質は、オープンなベンチマーキングの文化を育んできた。批評家は、このベンチマークのタスクは静的であり、時間の経過とともに飽和する可能性があると指摘しているが、2023年版に新しいタスクとBBHサブセットが含まれていることで、この懸念は軽減されている。
BIG-bench 2023はまた、HELMやMMLUなどの類似のベンチマークの開発に影響を与え、大規模言語モデルにおける創発的能力の研究に使用されてきた。その結果は、GPT-4やClaude (AI model family)などのシステムの能力と限界を理解する上で極めて重要であり、人工知能の進歩を測定するための参照点として機能し続けている。
将来の方向性
2023年の時点で、BIG-benchチームは、動的タスク生成やよりインタラクティブな評価形式を含む、さらなるアップデートの計画を発表している。目標は、モデルが進化するにつれてベンチマークの関連性を維持することであり、ツール使用やマルチターン対話を必要とするタスクを組み込む可能性がある。2023年版は、当時のAI能力のスナップショットであり続けるが、その方法論と洞察は、今後何年にもわたって将来のベンチマーキングの取り組みに影響を与える可能性が高い。