MMLUベンチマーク(Measuring Massive Multitask Language Understanding)は、大規模言語モデルの能力を評価するために広く使用されている評価ツールです。2020年9月7日にDan Hendrycksと研究者チームによって公開され、モデルがより単純なテストで人間を上回り始めたため、GLUEなどの初期のベンチマークよりも挑戦的となるように設計されました。MMLUは、STEM分野や国際法から栄養学や宗教に至るまで、57の科目にわたる15,908問の多肢選択問題で構成されています。このうち1,540問は、温度、バッチサイズ、学習率などの最適なモデル設定を選択するために確保されています。2024年7月までに、このベンチマークは1億回以上ダウンロードされ、Artificial intelligenceコミュニティにおけるモデル性能比較の最も一般的なツールの一つとなっています。
MMLUが導入された当時、既存のモデルの多くはランダムな偶然のレベル(25%)に近いスコアを記録し、最良のモデルであるGPT-3 175Bで43.9%の精度を達成しました。作成者らは、人間の専門家が約89.8%の精度を達成すると推定していました。2024年半ばまでに、Claude 3.5 Sonnet、GPT-4o、Llama 3.1 405Bなどの主要なモデルは、一貫して約88%の精度に達しました。しかし、2025年時点では、MMLUはより困難な代替手段が優先され、部分的に廃止が進んでいます。これは、モデル能力の急速な進歩を反映しています。
構造と内容
このベンチマークは、抽象代数学、国際法、専門医学など、幅広い科目をカバーしています。各質問は4つの選択肢を持つ多肢選択式で、モデルは全科目にわたる精度で評価されます。トピックの多様性は、事実知識だけでなく、推論や分野横断的な理解もテストすることを目的としています。1,540問の開発セットは、ハイパーパラメータの調整に使用され、モデル間の公平な比較を保証します。
MMLUは、MMLU-Pro、MMMU、MMLU-Reduxなどのスピンオフや派生版を生み出し、これらは元のベンチマークの限界に対処したり、より困難な評価を提供したりすることを目的としています。これらの派生版は、Machine learning研究におけるモデル評価の継続的な発展に貢献しています。
限界と批判
その人気にもかかわらず、MMLUは多大な批判に直面しています。2024年6月5日、専門家は5,700問の手動分析を詳細報告する論文を発表しました。この分析は、多数の基礎的な真実の誤りを明らかにしました。例えば、「ウイル学」サブセットの57%の質問に誤りが含まれており、複数の正解(4%)、不明確な質問(14%)、または完全に不正解(33%)が含まれています。全体として、この分析はMMLU質問の6.5%に誤りが含まれており、達成可能な最大スコアは100%を大幅に下回ると推定しました。
データ汚染も、ベンチマークの妥当性に対する深刻な脅威となりました。企業は、MMLUの質問と回答を偶発的または意図的にモデルのトレーニングデータに含めることがあり、これにより、ベンチマークは汎化の尺度として実質的に無価値になります。この問題は、モデルがベンチマーク質問を含む可能性のある膨大なインターネットのコーパスでトレーニングされることが多いGenerative AI評価の分野で一般的です。
質問例
以下の例は、MMLUの「抽象代数」「国際法」「専門医学」タスクからの質問の種類を示しています。正解は太字で表示されています。
質問1(抽象代数):
\( \mathbb{Z}_3[x]/(x^2 + c) \) が体となるすべての \( c \in \mathbb{Z}_3 \) を求めよ。
(A) 0 (B) 1 (C) 2 (D) 3
質問2(国際法):
国際人権規約(ICCPR)における拷問の定義への留保は、現代の実務において受け入れられるでしょうか?
(A) 留保国の国内法が異なる定義を採用している場合、これは受け入れられる留保です。
(B) これはICCPRの目的と趣旨に反するため、受け入れ不可能な留保です。
(C) ICCPR における拷問の定義は、慣習国際法と一致していると、これは受け入れられる留保です。
(D) 一般的な国際法の下では、国家は条約への留保を付する権利があります。
質問3(専門医学):
33歳の男性が甲状腺がんのために根治的甲状腺切除術を受けます。は術中、左側の頸部の複数の血管の結紮が必要となる中等度の出血ことがあります。術後の血清研究では、カルシウム濃度は7.5 mg/dL、アルブミン濃度は4 g/dL、副甲状腺ホルモン濃度は200 pg/mLを示しています。この患者の所見を引き起こした血管の損傷はどれですか?
(A) 頭肋管の枝。
(B) 外頚動脈の枝。
(C) 頭胸部管の枝。
(D) 内頸静脈の支流。
影響と未来
MMLUは、大規模言語モデルの進捗を追跡する上で重要な役割を果たし、OpenAI、Anthropic、Google DeepMindを含む研究ラボや企業によって広く採用されてきました。その影響は他のベンチマークや評価方法にも広がり、この分野をより堅牢で困難なテストへと押し進めています。しかし、特定された誤りや汚染の問題により、これらの問題に耐性がある新しいベンチマークへの段階的な移行につながっています。2025年時点では、MMLUは歴史的な参照点であり続けますが、最先端のモデル比較における役割は減少しています。