HellaSwag 2025は、人工知能システム、特に大規模言語モデルおよびマルチモーダルモデルの常識推論能力を評価するために設計されたベンチマークデータセットである。これは、2019年にトロント大学とアレン人工知能研究所の研究者によって導入されたオリジナルのHellaSwagベンチマークの後継である。2025年版では、より困難な例、視覚的および音声的シナリオの拡大されたカバレッジ、および記憶や統計的近道による水増しスコアを減らすためのより厳格な評価プロトコルでデータセットを更新している。
このベンチマークは、モデルが与えられたシナリオの最も妥当な続きを選択する能力をテストし、物理的ダイナミクス、社会的慣習、時間的因果関係の理解を必要とする。主にテキストに焦点を当てた初期バージョンとは異なり、HellaSwag 2025はテキストと画像または音声クリップを組み合わせたマルチモーダルプロンプトを含み、モデルがモダリティ間で情報を統合することを促す。データセットは、人間が書いたシナリオとAIが生成した敵対的例の組み合わせを使用して構築され、品質と難易度を確保するためにフィルタリングされている。
背景と動機
オリジナルのHellaSwagは、常識を真に理解するモデルと表面的な言語パターンに依存するモデルを区別できないことが多い既存のベンチマークのギャップに対処するために作成された。その名前は「hell」と「swag」(「愚かな知恵」または「常識」への遊び心のある言及)のかばん語である。2025年版は、生成AIの急速な進歩に対応して開発され、これによりモデルが古いベンチマークでほぼ完璧なスコアを達成できるようになり、さらなる進歩を測定することが困難になった。
このベンチマークは、スタンフォードAIラボ、MIT CSAIL、バークレーAIリサーチのメンバーを含む学術および産業研究者のコンソーシアムによって維持されている。プロジェクトは、国立科学財団や民間財団を含む複数の資金源から資金提供を受けている。
データセットの構築
HellaSwag 2025には、約20,000問の多肢選択問題が含まれており、各問題には文脈と4つの可能な結末があり、そのうち1つだけが正解である。文脈は、映画の脚本、教育ビデオ、日常的なシナリオなど、多様なソースから引き出されている。難易度を上げるために、データセットにはAIシステムによって生成された「敵対的」な例が含まれており、人間のアノテーターによって検証され、人間が解けるが機械にとっては困難であることを保証している。
構築プロセスにはいくつかのステップが含まれる:まず、候補シナリオの大規模なプールが収集される;次に、AIモデルが妥当な結末と非妥当な結末を生成する;次に、人間のアノテーターが例をフィルタリングしてラベル付けする;最後に、長さや単語頻度などの些細な手がかりによってベンチマークが偏らないようにするためにキャリブレーションセットが使用される。2025年版では、「反事実」サブセットも導入されており、正解にはシナリオへの仮説的な変更についての推論が必要である。
評価とスコアリング
モデルはテストセットでの精度によって評価され、主要な指標は正しく回答された質問の割合である。過学習を防ぐために、テストセットは公開されていない;代わりに、研究者はOpenAIのevalsなどの他のベンチマークで使用されるアプローチと同様に、制御されたAPIを通じてモデルを提出する。ベンチマークはまた、言い換えられた文脈や変更された画像などの摂動されたバージョンの質問でのパフォーマンスを測定する「ロバストネススコア」も報告する。
HellaSwag 2025は、その前身よりも困難になるように設計されている。初期評価では、GPT-4やClaudeなどの最先端モデルは、オリジナルのHellaSwagでの95%と比較して、約85%の精度を達成している。このギャップは、新しいベンチマークが異なるレベルの推論能力を持つモデルを区別するためのより良いシグナルを提供することを示している。
影響と受け止められ方
HellaSwag 2025のリリースは、AI研究コミュニティから関心を持って迎えられた。多くの研究者が、新しいアーキテクチャやトレーニング方法を開発する際の標準的な評価ツールとしてこれを使用している。このベンチマークはまた、Google DeepMindやAnthropicを含む業界ラボによって、内部評価スイートの一部として採用されている。一部の批評家は、ベンチマークには西洋の文化的文脈への潜在的なバイアスなどの制限がまだあると主張しているが、コンソーシアムは多様なシナリオを含める努力をしている。
このベンチマークはまた、常識推論を改善することを目的としたカリキュラム学習やデータ拡張などの新しいトレーニング技術の開発にも影響を与えている。さらに、HellaSwag 2025は、モデルが真の理解ではなく統計的規則性を利用する「近道学習」の現象を研究するために使用されている。
将来の方向性
HellaSwagの将来のバージョンの計画には、より多くの言語への拡張、インタラクティブまたは身体化されたシナリオの組み込み、および時間的推論コンポーネントの追加が含まれる。コンソーシアムはまた、SuperGLUEベンチマークと同様に、時間の経過に伴う進歩を追跡するリーダーボードをリリースする予定である。AIシステムが進化し続けるにつれて、HellaSwag 2025のようなベンチマークは、進歩が意味のある方法で測定されることを保証する上で重要な役割を果たす。