MMMU 2025.4は、2025年にリリースされたMassive Multi-discipline Multimodal Understanding(MMMU)ベンチマークの4回目の更新版です。このデータセットは、人工知能システム、特に視覚処理を備えた大規模言語モデルの能力を、複数の学問分野にわたる大学レベルの知識を必要とするタスクで評価するために設計されています。このベンチマークは、画像、図、テキストを組み合わせた質問で構成され、モデルが視覚情報を知覚し、それについて推論し、分野固有の知識を適用して正しく回答する能力をテストします。
MMMUベンチマークシリーズは、単純な物体認識やキャプション生成を超えた、マルチモーダルAIシステムの厳密な評価の必要性に対応するために作成されました。基本的な視覚的質問応答に焦点を当てた初期のベンチマークとは異なり、MMMUの質問は大学の教科書や試験資料から引用されており、物理学、化学、医学、美術史、工学などの科目をカバーしています。各質問では、モデルが視覚的手がかりとテキストの文脈を統合し、多くの場合、複数段階の推論を必要とします。2025.4更新版はこの伝統を継承し、新しい質問を追加し、モデル能力の急速な進歩に追従するために評価方法論を洗練させています。
ベンチマークの構造と内容
MMMU 2025.4は、前身のコア構造を維持し、質問を6つの広範な分野(アートとデザイン、ビジネス、科学、健康と医学、人文科学と社会科学、テクノロジーとエンジニアリング)に整理しています。各分野はさらに、会計、生物学、法律、コンピュータサイエンスなどの特定の科目に細分化されています。質問は多肢選択式で、4つまたは5つの選択肢があり、最も先進的なモデルにとっても挑戦的になるように設計されています。データセットには、開発用の検証セットと最終評価用のテストセットが含まれており、データ汚染を防ぐために回答は公開されていません。
MMMU 2025.4の質問は、チャート、グラフ、医用画像、回路図、歴史的な写真などの複雑な視覚入力への依存が顕著です。例えば、回路図を示して電流の流れを尋ねる質問や、組織学のスライドを示して病理学的状態の識別を要求する質問があります。この設計により、モデルは細かい視覚分析を実行し、特定の領域を拡大したり、微妙な視覚的差異を解釈したりすることが求められます。ベンチマークには、視覚情報が部分的に無関係または誤解を招く質問も含まれており、モデルが関連する詳細に焦点を当てる能力をテストします。
評価とスコアリング
モデルは、多肢選択式の質問への回答精度に基づいて評価されます。主要な指標は全体的な精度ですが、結果は分野別および科目別にも報告され、強みと弱みの詳細なビューを提供します。ベンチマークはゼロショット評価プロトコルを使用しており、モデルはテスト前にMMMUデータで微調整されません。これは、モデルの一般的な推論能力と知識検索能力を測定することを目的としており、ベンチマーク固有のパターンを記憶する能力ではありません。
スコアリングは、モデルの予測回答を正解と比較することによって実行されます。自由形式のテキストを生成するモデルの場合、解析ステップが選択された選択肢を抽出します。公式リーダーボードは、OpenAI、Anthropic、Google DeepMindなどのさまざまな研究グループや企業からの提出を追跡します。2025.4更新版では、モデルが特定の回答選択肢を好む傾向がある位置バイアスなどの潜在的なバイアスを減らすために、より厳格な評価ハーネスが導入されました。これには、質問全体で回答順序をランダム化し、より堅牢な回答抽出方法を使用することが含まれます。
歴史的背景と進化
元のMMMUベンチマークは、カーネギーメロン大学やスタンフォードAIラボを含む複数の大学の研究者チームによって2023年後半に導入されました。これはすぐに、VQAやScienceQAなどの他のベンチマークと並んで、マルチモーダルモデル評価の標準的な参照点になりました。ベンチマークは、AIシステムの複雑さの増大を反映するために定期的に更新されています。2025.4バージョンは、2025.1、2025.2、2025.3に続く2025年以内の一連の更新の一部であり、それぞれが新しい質問を追加し、新興分野をカバーするために科目構成を時折調整しています。
2025年の更新における重要な変更の1つは、時間的または因果的推論を必要とする質問の増加であり、動的プロセスの理解に向けたAI研究のシフトを反映しています。例えば、いくつかの質問は、生物学的プロセスにおけるイベントの順序や機械的故障の進行について尋ねます。これは、改善された推論能力を組み込んだトランスフォーマーアーキテクチャを備えた深層学習モデルの開発と一致しています。更新ではまた、アジアやアフリカの工芸品を特徴とする美術史の質問など、非西洋の文脈のカバレッジを拡大し、評価における文化的バイアスを減らしました。
影響と評価
MMMU 2025.4は、新しいモデルをベンチマークするためにAI研究コミュニティで広く使用されています。ベンチマークの結果は、研究論文や技術レポートで頻繁に引用され、モデルの品質に対する認識に影響を与えています。例えば、MMMUで良好なパフォーマンスを示すモデルは、強力なマルチモーダル推論スキルを持つと見なされることが多く、これは教育、ヘルスケア、自律システムなどのアプリケーションにとって価値があります。ベンチマークはまた、Amazon Web ServicesやGoogle Cloudなどの企業によって、AIサービスの開発を導くために内部的に使用されています。
批評家は、MMMUがすべてのベンチマークと同様に限界があると指摘しています。多肢選択形式は、回答が事前に定義されていない現実世界の推論を完全には捉えていないと主張する人もいます。また、ベンチマークの大学レベルの知識への依存は、日常のユーザーのニーズを反映していない可能性があると指摘する人もいます。これらの懸念にもかかわらず、MMMU 2025.4は、生成AIとマルチモーダル理解の進歩を追跡するための重要なツールであり続けています。その継続的な更新により、モデルが進化するにつれて関連性を維持し、分野を前進させる動的な目標を提供しています。
今後の方向性
MMMUの作成者は、さらなる更新の計画を示しており、潜在的にはより自由形式の質問やインタラクティブなタスクが含まれる可能性があります。また、フレーム間で時間情報を処理するモデルを必要とするビデオ入力を組み込むことについての議論もあります。2026年初頭の時点で、次のバージョンについての公式発表はありませんが、四半期ごとの更新パターンは、MMMU 2025.5または2026バージョンが今後登場する可能性を示唆しています。ベンチマークの進化は、単純なパターン認識から、人間の専門家のパフォーマンスを模倣する複雑な多段階推論へのAI評価の広範な軌跡を反映しています。