MMLU-Proは、大規模言語モデルの知識と推論能力を評価するためのベンチマークデータセットである。これは、2020年に導入された元のMassive Multitask Language Understanding(MMLU)ベンチマークを拡張したもので、人文科学からSTEM分野まで幅広い科目にわたるモデルの性能を測定することを目的としている。MMLU-Proは、2024年11月にウォータールー大学とトロント大学の研究者チームによって公開され、最先端のAIシステムを比較するための標準的な参照点として急速に定着した。
MMLU-Proの主な動機は、元のMMLUの限界に対処することにあった。モデルが向上するにつれて、MMLUのスコアは飽和し始め、トップクラスのシステム間の差別化が困難になった。MMLU-Proは、いくつかの重要な変更を導入している。各質問の選択肢を増やし(4つから10へ)、単純なパターンマッチングで回答できるような簡単すぎる質問や、そのような質問を除外し、多段階の推論を必要とする質問の割合を増やしている。データセットには、物理学、法律、心理学、コンピュータ科学など、14の分野にわたる12,000以上の質問が含まれており、より複雑で推論に重きを置いたタスクに焦点を当てている。
設計と構築
MMLU-Proの構築には、多段階のパイプラインが関与している。研究者らは、元のMMLUの質問から始め、専門試験や学術的な教科書などの他の情報源からの追加質問で補強した。その後、自動フィルタリングと人間によるアノテーションを組み合わせて、曖昧または些細な質問を除去した。具体的には、大規模言語モデルを使用して候補となる質問を生成し、人間の専門家がそれらを検証および改良した。最終的なデータセットは、各質問が明確で曖昧さのない回答を持ち、難易度が元のMMLUよりも大幅に高いことを保証するようにキュレーションされた。
MMLU-Proの注目すべき特徴は、各質問に10の選択肢を使用していることであり、これによりモデルが偶然に正解する確率が低下する(元の4択形式の25%から10%へ)。この設計上の選択により、ベンチマークはより判別力が高くなり、モデル能力のわずかな違いがスコアの差に反映されやすくなる。データセットには、数学の文章問題や論理的演繹など、明示的な推論ステップを必要とする質問にのみ焦点を当てた「ハード」サブセットであるMMLU-Pro/Reasoningも含まれている。
評価と影響
MMLU-Proは、学術研究者と産業研究所の両方で広く採用されている。主要なAI開発者、例えばOpenAI、Anthropic、Google DeepMindは、主力モデルのMMLU-Proスコアを報告している。例えば、OpenAIのGPT-4oとAnthropicのClaude 3.5 SonnetはどちらもMMLU-Proで評価されており、スコアは通常70〜80%の範囲であり、同じ質問に対する人間の専門家のパフォーマンスは約80〜90%と推定されている。このベンチマークは、Generative AIシステムの進歩を追跡するためにも使用されており、モデルリリースの発表や技術レポートにおける一般的な指標となっている。
MMLU-Proの導入は、Artificial intelligence評価のより広い分野に影響を与えた。これは、モデル能力の急速な向上に追いつくことができる、より堅牢なベンチマークの必要性についての議論を促した。記憶や単純な想起に焦点を当てた初期のベンチマークとは異なり、MMLU-Proは推論と問題解決を強調しており、Machine learning研究の目標であるトレーニングデータを超えて一般化できるモデルの構築と一致している。このベンチマークは、人間のフィードバックからの強化学習などの現象と、その推論性能への影響を研究するためにも使用されている。
他のベンチマークとの比較
MMLU-Proは、AI2 Reasoning Challenge(ARC)、HellaSwag、Big-Bench Hard(BBH)タスクなどの他の評価スイートとしばしば比較される。ARCとHellaSwagは常識推論とテキスト予測に焦点を当てているが、MMLU-Proはより広範な学術科目をカバーしており、一般的な知識を評価する上でより包括的である。BBHはBIG-benchスイートのサブセットであり、23の挑戦的なタスクを含むが、MMLU-Proの構造化された形式と多肢選択式の設計により、管理とスコアリングがより簡単で一貫している。実際には、MMLU-Proのスコアは他の推論重視のベンチマークと強く相関するが、異なる分野にわたるモデルの強みと弱みのより詳細なビューを提供する。
MMLU-Proの限界の1つは、静的ベンチマークであることだ。つまり、モデルが同様の質問でトレーニングされると、そのスコアが真の一般化を反映しない可能性がある。これを軽減するために、研究者らは公開されていない保留質問を含むバージョンをリリースしており、管理された環境でのより信頼性の高い評価を可能にしている。さらに、このベンチマークは、モデルが事前トレーニング中に質問を見た可能性がある汚染の可能性について批判されてきたが、著者らはあまり一般的でない試験や教科書から質問を調達することで、この問題を最小限に抑える措置を講じている。
今後の方向性
MMLU-Proの成功は、さらに挑戦的なベンチマークを作成する取り組みを促進した。研究者らは、新しい質問がその場で生成される動的な質問生成を組み込む方法や、現実世界の問題解決で一般的な図やチャートなどのマルチモーダル要素を含める方法を模索している。また、正しさだけでなく、モデルの推論の効率性と解釈可能性を測定するベンチマークの開発にも関心が集まっている。Deep learningモデルが進化し続けるにつれて、MMLU-Proのようなベンチマークは、進歩を測定し、ニューラルネットワークアーキテクチャとトレーニング方法の将来の研究を導くための不可欠なツールであり続けるだろう。
要約すると、MMLU-Proは、大規模言語モデルの評価における重要な前進を表しており、その能力のより厳格で微妙な尺度を提供している。より難しい質問と推論への強調により、この分野の標準的な参照点となり、その影響はAIシステムがより高度になるにつれて持続する可能性が高い。