HellaSwag 2024は、人工知能システム、特に大規模言語モデルの常識推論能力を評価するために設計されたベンチマークデータセットである。これは、2019年に導入された元のHellaSwagベンチマークの更新版である。2024年の改訂は、モデルがシナリオを真に理解するのではなく、統計的な規則性を利用する能力など、初期のデータセットの限界に対処することを目的としている。このベンチマークは、モデルが与えられた状況の最も妥当な続きを選択しなければならない多肢選択問題を提示し、正解には物理的および社会的常識の理解が必要である。
元のHellaSwagは、ワシントン大学とアレン人工知能研究所の研究者によって作成された。これは、人間が書いた結末と、機械が生成したもっともらしいが不正確な結末をペアにする敵対的フィルタリングプロセスを使用して構築された。2024年の更新はこの中核構造を維持しつつ、いくつかの改良を導入している。これには、より多くの質問セット、より多様なシナリオ、およびモデルが位置や長さに基づいて推測するのを防ぐための回答選択肢の再バランス分布が含まれる。スコアリング方法論も、最長または最も複雑な回答を選択するなどのヒューリスティックを使用するモデルに対してより堅牢になるように改訂された。
設計と構築
HellaSwag 2024の構築は、前身と同じ敵対的フィルタリングアプローチに従っている。人間の注釈者が一連の活動記述に対して正しい結末を書き、一方で別の一連の不正確な結末は言語モデルによって生成された。不正確な結末は、表面的にはもっともらしいが意味的には間違っており、しばしば物理法則や社会規範の微妙な違反を含むように設計された。最終データセットには、単純な統計的手がかりによって不正確な結末が容易に区別できない質問のみが含まれ、ベンチマークがパターンマッチングではなく真の推論を測定することを保証している。
2024年版は、元のデータセットを約10,000問から15,000問以上に拡張している。シナリオは、料理、スポーツ、家事などの日常活動の幅広い範囲と、社会的相互作用を含むより抽象的な状況をカバーしている。各質問には4つの回答選択肢があり、正解は正確に1つである。データセットはトレーニング、検証、テストセットに分割され、テストセットは公式評価のために保留されている。
評価とスコアリング
モデルは、正しい回答を選択する精度によってHellaSwag 2024で評価される。主要な指標はトップ1精度であり、モデルが正しい選択肢に最高確率を割り当てる質問の割合を測定する。回答長バイアスの影響を減らすために、2024年の更新では正規化されたスコアリング方法が導入された。この方法は、各回答の確率をその長さで調整し、モデルがより長いまたは冗長な応答を好むのを防ぐ。
精度に加えて、ベンチマークはキャリブレーションスコアを報告し、これはモデルの信頼度がその正確性とどの程度一致しているかを測定する。適切にキャリブレーションされたモデルは、正しい回答にはより高い信頼度を持ち、不正確な回答にはより低い信頼度を持つべきである。2024年の改訂には人間のベースラインも含まれており、質問のサブセットで人間のパフォーマンスが測定され、モデル比較の参照点を提供している。
現在のモデルのパフォーマンス
2024年現在、OpenAI、Anthropic、Google DeepMindによって開発されたような最高性能の大規模言語モデルは、HellaSwag 2024で90%台半ばの精度スコアを達成している。これは、元のHellaSwagで約80%をスコアした初期のモデルからの大幅な改善である。しかし、ベンチマークでの人間のパフォーマンスは依然として高く、通常95%以上であり、機械と人間の常識推論の間にはまだギャップがあることを示している。
このベンチマークは、常識推論の進歩を追跡するためのArtificial intelligenceコミュニティの標準ツールとなっている。これは、WinograndeやARCなどの他のベンチマークと並行して使用され、モデルの推論能力の包括的な評価を提供することが多い。2024年の更新は、Amazon Web Services、Microsoft Azure、Google Cloudなどの研究ラボや業界チームによって、モデル評価パイプラインの一部として広く採用されている。
限界と批判
その改善にもかかわらず、HellaSwag 2024はいくつかの批判に直面している。一部の研究者は、ベンチマークが依然として言語の統計的パターンに大きく依存しており、モデルが柔軟な推論に従事するのではなく、常識的な事実を記憶することで高いスコアを達成できると主張している。他の人々は、データセットが英語と西洋の文化的文脈からのシナリオに限定されており、他の言語や文化に一般化できない可能性があると指摘している。
もう一つの限界は、ベンチマークが静的であること、つまり、モデルがテストセットでトレーニングされた(意図的またはデータ汚染を通じて偶発的に)後、そのパフォーマンスが真の一般化を反映しなくなることである。これを軽減するために、2024年版には公開されていない隠れたテストセットが含まれており、研究者は提出システムを通じてこの隠れたセットで評価することが推奨されている。しかし、このアプローチは完全ではなく、汚染のリスクはより広い分野での懸念事項のままである。
将来の方向性
HellaSwag 2024の開発は、より挑戦的で堅牢な評価ベンチマークを作成する方向へのMachine learningコミュニティの広範な傾向を反映している。将来の更新には、記憶を防ぐために新しい質問がその場で作成される動的質問生成が組み込まれる可能性がある。また、モデルがテキストと画像の両方について推論しなければならないマルチモーダルシナリオをカバーするようにベンチマークを拡張し、多段階推論や因果推論を必要とする質問を含めることへの関心もある。
Large language modelが改善し続けるにつれて、HellaSwag 2024のようなベンチマークは、ペースを維持するために進化する必要があるだろう。目標は、現在の能力を測定するだけでなく、AIシステムにおけるより人間らしい推論の開発を促進する評価を作成することである。2024年の更新はその方向への一歩であり、前身よりも常識理解のより厳格なテストを提供している。