MMMU 2025は、マルチモーダル人工知能システム、特に視覚理解を備えた大規模言語モデルの能力を評価するために設計されたベンチマークである。これは、2023年末にアルバータ大学やカールトン大学などの機関の研究者コンソーシアムによって公開された元のMMMU(Massive Multi-discipline Multimodal Understanding)ベンチマークを拡張したものである。2025年版は、Generative AIとLarge language model研究の急速な進歩を反映してベンチマークを更新し、複数の分野にわたる深い推論を必要とする新しいタスクとより困難な質問を導入している。
このベンチマークは、画像、図、チャートなどの視覚情報とテキストの質問を組み合わせて、モデルが視覚情報を知覚し推論する能力を評価する。人文科学、社会科学、STEM分野、医学や法律などの専門領域を含む幅広い科目をカバーしている。MMMU 2025は、大学レベルの理解を厳密にテストするように設計されており、モデルは視覚要素を認識するだけでなく、分野固有の知識と多段階の推論を適用する必要がある。このベンチマークは、OpenAI、Anthropic、Google DeepMindなどの組織からの主要なAIシステムの性能を比較するための標準的な参照点となっている。
タスク設計と評価
MMMU 2025は、それぞれが画像または画像のセットとペアになった多肢選択問題で構成されている。質問は、視覚的手がかりとテキストの文脈の統合を必要とするように作成されており、単純なパターン認識を超えた知識を要求することが多い。例えば、回路図を示して部品の変更の効果を尋ねたり、歴史的な絵画を示してその文化的意義を問うたりする場合がある。このベンチマークには、30の分野にわたる30,000以上の質問が含まれており、現在のモデルにとって困難な質問に焦点を当てている。
評価は、正確性を主要な指標として実行され、モデルは選択肢のセットから単一の正解を出力する必要がある。ベンチマークはまた、分野別および質問タイプ別の性能を追跡し、研究者が特定の強みと弱みを特定できるようにしている。2025年版では、モデルが複数の画像を同時に推論することを必要とする新しい質問のサブセットが追加され、視覚情報を比較対照する能力をテストしている。この設計は、モデルを単純な画像キャプションを超えて、視覚的推論と問題解決の領域へと押し上げる。
主要な発見とモデル性能
2025年初頭の時点で、MMMU 2025で最高の性能を発揮するモデルは、80%台半ばの正確性スコアを達成しており、トップモデルが約50〜60%を獲得した元のMMMUからの大幅な改善である。この進歩は、Transformer (architecture)アーキテクチャの進歩、より大規模なトレーニングデータセット、およびReinforcement Learning from AI Feedback (RLAIF)やCurriculum Learningなどの改善されたトレーニング技術に起因している。特に、OpenAIとGoogle DeepMindのモデルが一貫してリーダーボードのトップに立ち、最新のリリースは物理学や生物学などの特定の分野で人間に近い性能を示している。
しかし、ベンチマークは持続的なギャップを明らかにしている。モデルは、抽象的な推論、常識的な知識、または複雑な空間関係の理解を必要とする質問に依然として苦労している。性能は分野によっても大きく異なり、人文科学や社会科学は純粋なSTEM分野よりも困難であることが多い。ベンチマークの作成者は、MMMU 2025は解決された問題ではなく、視覚情報とテキスト情報をより良く統合できるMulti-Head AttentionやCross-Attentionメカニズムなどの分野の研究を動機付ける役割を果たし続けていると強調している。
他のベンチマークとの比較
MMMU 2025は、AI評価ベンチマークのより広いエコシステムの一部である。これは、Visual Question Answering(VQA)ベンチマークやGeneral Language Understanding Evaluation(GLUE)スイートなどの他のよく知られたテストを補完する。日常的なシーンに関する単純な質問に焦点を当てたVQAとは異なり、MMMU 2025は大学レベルの学術コンテンツを対象としており、教育や専門業務を支援できるAIの開発という目標により沿っている。GLUEのようなテキストのみのベンチマークと比較して、MMMU 2025は、自動運転、医療画像、ロボティクスなどのアプリケーションに不可欠な視覚理解の重要な次元を追加している。
このベンチマークは、Massive Multitask Language Understanding(MMLU)のような新しいマルチモーダルベンチマークとも異なり、すべての質問に視覚入力が必要であるのに対し、MMLUはテキストのみである。これにより、MMMU 2025は、しばしばマルチモーダルである実世界データを処理するモデルの能力のより直接的なテストとなる。研究者は、単一のベンチマークが知能のすべての側面を捉えることはできないため、モデルの能力の包括的なビューを得るために、MMMU 2025を他のベンチマークと組み合わせて使用することが多い。
影響と将来の方向性
MMMU 2025の導入は、Artificial intelligenceの分野に大きな影響を与えている。これは、より堅牢な視覚エンコーダ、視覚特徴とテキスト特徴のより良い融合、およびより効率的なトレーニング方法の研究を促進している。AMD、Intel、TSMCなどの企業も注目しており、ベンチマークの計算需要は、これらのモデルを効率的に実行するためにAWS TrainiumやGroqアクセラレータなどの専用ハードウェアの必要性を浮き彫りにしている。
今後、MMMU 2025の作成者は、回答を選択するだけでなく説明を生成することをモデルに要求するオープンエンドタスクを含む、さらに困難な質問を備えた更新版をリリースする計画を立てている。ビデオとオーディオのモダリティを組み込むことも議論されており、これによりマルチモーダル理解の限界がさらに押し広げられるだろう。AIモデルが改善を続けるにつれて、MMMU 2025のようなベンチマークは、進歩を測定し、人間レベルの知能が依然として手の届かない領域を特定する上で重要な役割を果たすだろう。