MMMU-Proは、マルチモーダル人工知能システム、特に視覚情報とテキスト情報の両方を処理する大規模マルチモーダルモデルの能力を評価するために設計されたベンチマークデータセットである。これは、元のMMMU(Massive Multi-discipline Multimodal Understanding)ベンチマークの拡張版であり、より挑戦的な後継として、さまざまな学術・技術分野における専門家レベルの知識を対象としている。このベンチマークは、画像、図、グラフ、および関連するテキストを統合し、それらについて推論するモデルの能力を、単なるパターン認識ではなく深いドメイン知識を必要とする方法でテストするように構成されている。
元のMMMUベンチマークは2023年末に公開され、芸術、ビジネス、科学、人文科学、社会科学、技術の6つの分野にわたる大学レベルの教科書や試験から抽出された質問で構成されていた。MMMU-Proは2024年に導入され、元のベンチマークの限界、特に一部のモデルが統計的な規則性や記憶された回答を利用して高いスコアを達成する傾向に対処するために開発された。MMMU-Proは質問の難易度を高め、より複雑な視覚要素を導入し、より厳格な評価プロトコルを実装している。これには、より多くの選択肢を持つ多肢選択問題と、より厳密な採点方法が含まれ、ランダムな推測の影響を軽減している。
設計と構築
MMMU-Proは、複数の機関の研究者チームによって構築され、学術ラボや産業研究グループからの貢献が含まれている。このデータセットは元のMMMUに基づいているが、専門家レベルの精査の層を追加している。質問は、高度な教科書、専門資格試験、研究論文など、より広範な資料から収集されている。各質問には、問題を解くために不可欠な画像または画像のセットがペアになっており、テキストは多段階の推論を必要とするように作成されている。
MMMU-Proの重要な設計上の選択は、回答選択肢の拡大である。元のMMMUが各質問に4つの選択肢を使用していたのに対し、MMMU-Proは通常10の選択肢を使用する。この変更により、モデルが偶然に正しく推測する確率が大幅に低下し、ベンチマークが真の理解のより信頼性の高い尺度となる。さらに、このベンチマークには、視覚情報が意図的に誤解を招くように設計されているか、関連する詳細を抽出するために注意深い検査を必要とする質問のサブセットが含まれており、モデルが妨害要素よりも関連情報に焦点を当てる能力をテストしている。
評価プロトコル
MMMU-Proの評価は、公平性と再現性を確保するために厳格なプロトコルに従っている。モデルには質問テキストと関連する画像が提供され、10の回答選択肢のうちの1つを出力する必要がある。主要な指標は精度であるが、ベンチマークは分野別および質問タイプ(例:図の解釈、グラフの読み取り、視覚的推論)ごとのパフォーマンスも報告している。
推測の影響をさらに軽減するために、MMMU-Proには「画像なし」条件が含まれている。この条件では、モデルは同じ質問を、付随する画像なしで評価される。これは、モデルが視覚情報にどの程度依存しているか、テキストの事前知識にどの程度依存しているかを測定するための対照として機能する。画像なし条件で良好なパフォーマンスを示すが完全な条件では低いパフォーマンスを示すモデルは、言語パターンに過適合している可能性があり、両方で良好なパフォーマンスを示すモデルは、堅牢なマルチモーダル統合を示している。
主要モデルのパフォーマンス
2024年末時点で、MMMU-Proで人間レベルのパフォーマンスを達成したモデルはない。主要なAI企業(OpenAI、Google DeepMind、Anthropicなど)のプロプライエタリモデルを含む最良のシステムは、完全なベンチマークで通常50〜60%の精度範囲をスコアリングしている。これは、これらの同じモデルが元のMMMUで達成する70〜80%の精度からの大幅な低下であり、難易度の増加を浮き彫りにしている。
学術グループや小規模企業によって開発されたオープンソースモデルは、一般的に低いスコアを達成し、多くの場合30〜45%の範囲である。プロプライエタリモデルとオープンソースモデルの間のギャップは、より単純なベンチマークよりもMMMU-Proで顕著であり、専門家レベルの推論が多くのニューラルネットワークアーキテクチャにとって現在のボトルネックであることを示唆している。このベンチマークは、人工知能コミュニティにおけるマルチモーダル理解の進歩を追跡するための標準的な参照点となっており、研究者は論文や技術レポートで定期的にその結果を報告している。
影響と限界
MMMU-Proは、特定の弱点を浮き彫りにすることで、マルチモーダルモデルの開発に影響を与えてきた。例えば、多くのモデルは、深層学習研究論文に見られるような、空間推論や複雑な科学図の解釈を必要とする質問に苦労している。これにより、視覚エンコーダの改善や、記憶よりも推論を強調するトレーニング技術に関する研究が促進されている。
しかし、このベンチマークには限界がないわけではない。批評家は、質問が難しいとはいえ、依然として多肢選択式であり、モデルが消去法戦略を使用できる可能性があると指摘している。さらに、データセットは静的であり、モデルがそれ(または類似のデータ)でトレーニングされた後は、結果が水増しされる可能性がある。MMMU-Proの作成者はこれを認識しており、新しい質問を含む更新バージョンを定期的にリリースしている。
もう一つの限界は、データ汚染の可能性である。ベンチマークは公開されているため、大規模モデルの一部のトレーニングデータセットにMMMU-Proの質問が含まれている可能性があり、スコアが人為的に上昇する可能性がある。研究者は、この問題を軽減するために、トレーニングデータに関するより透明な報告を求めている。これらの懸念にもかかわらず、MMMU-Proは、生成AIシステムにおける専門家レベルのマルチモーダル理解を評価するための、最も厳格な公開ベンチマークの1つであり続けている。
将来の方向性
MMMU-Proの開発は、より挑戦的で生態学的に有効なベンチマークへのAI評価の広範なトレンドの一部である。将来のイテレーションには、多肢選択形式を超えた自由回答形式の質問、インタラクティブなタスク、または現実世界の問題解決シナリオが含まれる可能性がある。このベンチマークの専門家レベルの知識への焦点は、エラーが重大な結果をもたらす可能性がある医学、法律、工学などの分野でのAIの展開の増加と一致している。
モデルが改善し続けるにつれて、MMMU-Proのようなベンチマークは関連性を維持するために進化する必要がある。研究コミュニティはまた、モデル能力のより完全な全体像を提供するために、人間による評価や敵対的テストなどの補完的な評価方法を模索している。MMMU-Proは、その深さと厳密さへの焦点により、マルチモーダルAIの最先端を理解し、前進させるための継続的な取り組みにおいて貴重なツールとして機能している。