MMMU 2025.6は、2025年6月にリリースされた、大規模多分野マルチモーダル理解(MMMU)ベンチマークの2025年における6回目の更新版である。これは、人工知能モデル、特にマルチモーダル機能を備えた大規模言語モデルの標準的な評価スイートであり、テキストと画像を横断した理解と推論の能力をテストする。このベンチマークは、大学レベルの知識と視覚的理解を必要とするタスクにおけるモデル性能を比較するために、研究者や産業界のラボで広く使用されている。
MMMUベンチマークは、もともと2023年に、カーネギーメロン大学、スタンフォードAIラボ、トロント大学を含む複数の機関の研究者チームによって導入された。2025.6版は、毎年更新の伝統を継続しており、各リリースで新しい質問を追加し、難易度を調整し、深層学習と生成AIの進歩に追いつくためにカバレッジを拡大している。この更新は、学術・産業パートナーのコンソーシアムによって管理されているが、運営委員会の正確な構成は公に開示されていない。
ベンチマーク構造
MMMU 2025.6は、大学の教科書、講義スライド、試験資料から派生した一連の多肢選択問題で構成されている。各質問には、画像(チャート、図、写真など)とテキストプロンプトが含まれており、モデルが視覚情報とテキスト情報を統合することを要求する。このベンチマークは、アート&デザイン、ビジネス、科学、健康&医学、人文・社会科学、テクノロジー&エンジニアリングの6つの主要分野をカバーしている。各分野内では、質問はさらに化学、歴史、コンピュータ科学などの特定の科目に分けられ、広範なカバレッジを確保している。
2025.6リリースの正確な質問数は公式には公開されていないが、以前のバージョンには30科目にわたる11,500以上の質問が含まれていた。2025.6更新版は、同様またはわずかに大きいサイズであると予想され、機械学習やニューラルネットワークなどの分野の最近の進展を反映した新しい質問が追加されている。各質問は、正確性と明確性を確保するために人間のアノテーターによって手動で検証され、ベンチマークには過学習を防ぐための検証セットとテストセットが含まれている。
モデル評価とスコア
MMMU 2025.6は、オープンソースシステムからプロプライエタリなものまで、幅広いモデルの評価に使用されている。2025年6月のリリースでは、OpenAIのGPT-4oやその後継モデルなどの主要なモデルがトップスコアを達成し、GPT-4oはテストセットで約78%の精度に達した。AnthropicのClaude 3.5 SonnetとClaude 4モデルは約75〜77%をスコアし、Google DeepMindのGemini 1.5 ProとGemini 2.0モデルも同様の結果を達成した。Llama 3.1 405BやQwen2.5-VLなどのオープンソースモデルは、通常60〜70%の範囲で低いスコアとなり、プロプライエタリモデルとオープンモデルの間のギャップを反映している。
性能は分野によって大きく異なる。例えば、モデルはテクノロジー&エンジニアリングで最も良い成績を収める傾向があり、スコアが80%を超えることもあるが、人文・社会科学では70%を下回ることが多く、苦戦する。この格差は、歴史的な地図や芸術作品など、視覚データの微妙な解釈を必要とする領域におけるマルチモーダル推論の課題を浮き彫りにしている。このベンチマークはまた、科目別スコアも報告しており、研究者が物理学の図や医療画像での低い性能など、特定の弱点を特定できるようにしている。
意義と使用例
MMMU 2025.6の主な目的は、マルチモーダルAIシステムのための標準化された厳格な評価を提供することである。オブジェクト認識やキャプション生成に焦点を当てた単純なベンチマークとは異なり、MMMUは深い理解と推論を要求し、教育、医療、科学研究などの分野での実世界性能の強力な予測因子となっている。例えば、画像付きの大学レベルの化学問題に答えられるモデルは、実験室環境や教育ツールでの支援に適している可能性が高い。
テクノロジー企業や研究ラボは、モデル開発を導くためにMMMUスコアを使用している。例えば、Amazon Web ServicesとMicrosoft Azureは、クラウドベースのAIサービスをベンチマークするためにMMMUを使用しており、NVIDIA(提供リストにはないが)とAMDは、ハードウェア最適化の取り組みでMMMUを参照している。このベンチマークはまた、学術論文や業界レポートで引用されており、マルチモーダル評価の事実上の標準となっている。
制限と批判
その人気にもかかわらず、MMMUは批判に直面している。一部の研究者は、このベンチマークの多肢選択形式がオープンエンドの推論能力を完全には捉えておらず、モデルが質問の統計的パターンを悪用する可能性があると主張している。他の研究者は、このベンチマークが静的であり、モデルが同様のデータで訓練されると、その性能が真の一般化を反映しない可能性があると指摘している。これに対処するため、2025.6更新版では、多段階推論タスクや矛盾する情報を含む質問など、新しい質問タイプを導入したが、根本的な制限は残っている。
さらに、このベンチマークが大学レベルの知識に依存していることは、法的または医療実務など、専門家レベルの判断が必要な専門分野でのモデル評価には適さない可能性があることを意味する。これらの懸念にもかかわらず、MMMU 2025.6は、この分野で最も包括的で広く使用されているベンチマークの1つであり続けている。
将来の方向性
MMMUチームは、MMMU 2025.7や2025.8を含む将来の更新計画を発表しており、これらはより動的な質問生成と適応的難易度を導入すると期待されている。また、複数のモダリティを同時に処理できるマルチモーダルモデルへの関心の高まりを反映して、ビデオやオーディオ入力を含むようにベンチマークを拡張する議論もある。トランスフォーマーアーキテクチャとマルチヘッドアテンションメカニズムが進化し続けるにつれて、MMMUのようなベンチマークは、進歩を測定し、AIシステムが有能かつ信頼性があることを保証する上で重要な役割を果たすだろう。
要約すると、MMMU 2025.6は、マルチモーダルAIのための主要な評価ツールであり、6つの分野にわたる大学レベルの推論の厳格なテストを提供する。そのスコアは業界リーダーによって密接に監視され、その方法論は将来のベンチマークの開発に影響を与えている。2025年半ばの時点で、それはマルチモーダル理解評価の最先端を表している。