BIG-Bench Hard(BBH)は、より大規模なBIG-Benchベンチマークから選定された23のタスクからなる厳選サブセットであり、2022年にGoogleや他の機関の研究者によって導入されました。このサブセットは、大規模言語モデルにとって特に困難なタスク、具体的には120億パラメータ未満のモデルが低い性能を示すタスクに焦点を当てるために作成されました。BBHは、複雑な推論、多段階の問題解決、そして単純なパターンマッチングを超えた深い理解を必要とするタスクを処理するモデルの能力を測定するように設計されています。
このベンチマークは、130の機関から450人以上の研究者が貢献した200以上のタスクを含む、より広範なBIG-Benchの取り組みから生まれました。BBHの選定プロセスでは、小規模モデルと大規模モデル間の性能差が顕著であり、人間の評価者が実質的な推論を必要とすると評価したタスクを特定することに関わりました。最終的な23のタスクには、ブール式、因果判断、日付理解、曖昧性解消、幾何学的形状などの分野の問題が含まれています。
タスクの選定と特徴
BBHの23のタスクは、2つの主要な基準に基づいて選ばれました。それは、当時の最良のモデルが特定の閾値(具体的には、平均的な人間の評価者の性能を下回る)未満のスコアを達成したタスクであり、かつ単純なヒューリスティックでは容易に解けないタスクであることです。この選定プロセスにより、BBHは完全なBIG-Benchスイートよりも著しく困難なベンチマークとなり、BBH単独で評価した場合、平均的なモデル性能は大幅に低下します。
BBHの各タスクは、特定の認知スキルをテストするように設計されています。例えば、「ブール式」タスクは複雑な論理文の評価を必要とし、「因果判断」は仮説的なシナリオにおける因果関係の決定をモデルに求めます。他のタスクには、「ハイパーバトン」(文法的に正しい文の識別)、「論理演繹」(多段階の論理パズルの解決)、「単語整列」(制約下でのアルファベット順の単語配置)などがあります。
評価方法
BBHは通常、少数ショットプロンプティングアプローチを用いて評価され、モデルは新しい問題を解く前に少数の例(通常3〜5つ)を与えられます。このベンチマークには、テストプロセスを標準化する特定のプロンプトセットと評価スクリプトが含まれています。元の論文では、著者らはGoogleやOpenAIのものを含むいくつかの大規模言語モデルを評価し、最大のモデルでさえ多くのタスクに苦戦することを発見しました。
注目すべき発見の1つは、モデルに推論ステップを示すよう促すチェーン・オブ・ソートプロンプティングを使用することで、BBHタスクの性能が大幅に向上したことです。この技術はBBHと同時期に開発され、モデルが複雑な問題をより小さく管理しやすいステップに分解できるようにしました。BBHとチェーン・オブ・ソートプロンプティングの組み合わせは、後のモデルにおける推論能力を評価する標準的な方法となりました。
影響と使用法
BBHは、Large language model研究コミュニティで広く使用されるベンチマークとなっています。新しいモデルやトレーニング技術を紹介する論文で頻繁に引用され、単純な言語理解を超えたモデルの推論能力の尺度として機能しています。このベンチマークは、モデル開発の進捗を追跡するのに特に有用であり、BBHスコアの改善は他の推論重視タスクの改善と相関することが多いです。
OpenAIやGoogle DeepMindを含むいくつかの主要なAI研究機関は、内部評価スイートの一部としてBBHを使用しています。このベンチマークはまた、HELM(言語モデルの総合評価)プロジェクトなどのより広範な評価フレームワークにも組み込まれており、複数のベンチマークを集約してモデル能力の包括的なビューを提供します。2025年現在、BBHは異なるモデルアーキテクチャとサイズ間の推論性能を比較するための標準的な参照点であり続けています。
限界と批判
その人気にもかかわらず、BBHはいくつかの批判に直面しています。一部の研究者は、タスクがしばしば抽象的で実用的な応用から切り離されているため、このベンチマークが現実世界の推論を完全には捉えていない可能性があると主張しています。また、モデルがトレーニングデータからパターンを記憶することでベンチマークを「攻略」できることがあると指摘する声もありますが、BBHの著者らは、広くオンラインで利用可能でないタスクを使用することでこれを最小限に抑える措置を講じました。
さらに、このベンチマークの英語タスクへの焦点は、多言語モデルへの適用可能性を制限しています。元のBIG-Benchにはいくつかの多言語タスクが含まれていましたが、BBHは完全に英語であり、主に他の言語でトレーニングされたモデルにとって不利になる可能性があります。これらの限界にもかかわらず、BBHは現在のAIシステムの能力と限界を理解するための貴重なツールであり続けています。
関連ベンチマークと将来の方向性
BBHの開発は、MMLU(大規模多タスク言語理解)ベンチマークやARC(AI2推論チャレンジ)などの同様の取り組みに影響を与えました。これらのベンチマークは、BBHとともに、モデルの知識、推論、問題解決能力を集合的に評価する一連のテストを形成しています。モデルが改善を続けるにつれて、最高性能のシステムを区別できる、さらに困難なベンチマークを作成するための継続的な作業が進行中です。
BBHの将来の反復には、記憶を防ぐために問題がその場で生成される、より動的なタスクが組み込まれる可能性があります。また、モデルがテキスト、画像、その他のデータタイプからの情報を統合する必要があるマルチモーダル推論をカバーするようにBBHを拡張することへの関心もあります。これらの開発は、Artificial intelligenceの分野が進化し続ける中で、BBHを関連性のあるものに保つでしょう。