英語からの翻訳

MMMU 2025.9は、2025年9月にリリースされたMassive Multi-discipline Multimodal Understandingベンチマークの2025年における9回目のアップデートであり、大学レベルのマルチモーダルタスクにおけるAIモデルの評価を目的としています。

MMMU 2025.9は、2025年にリリースされた大規模マルチディシプリン・マルチモーダル理解(MMMU)ベンチマークの第9回目の更新版である。これは、人工知能モデルが大学レベルの科目においてテキストと画像を横断して理解し推論する能力を評価するものである。このベンチマークは、大規模言語モデルやマルチモーダルシステムの能力を比較するために、研究者や企業によって広く利用されている。

MMMU 2025.9は、大学の教科書、講義スライド、学術論文から派生した問題を提示するという、このベンチマークの伝統を引き継いでいる。各問題には、図、グラフ、写真などの画像と、多肢選択式の回答が含まれる。このベンチマークは、芸術、生物学、ビジネス、化学、コンピュータサイエンス、経済学、工学、地理学、歴史、文学、数学、物理学、心理学などの分野をカバーしている。2025.9版では、刷新された問題セットと更新された採点プロトコルが導入されている。

問題セットと構成

2025.9アップデートには11,500問の問題が含まれており、これは前回の2025.8リリースの11,000問から増加している。問題は、900項目の検証セットと10,600項目のテストセットに分かれている。各問題は、画像が問題解決に必要であることを確認するために手動で検証され、テキストだけから回答を導き出せないようにしている。分野間の分布はバランスが保たれており、各科目あたり約850問となっている。このアップデートには、医療画像診断と工学設計図における視覚的推論に特化した500問の新しいサブセットも含まれており、新興の応用分野を反映している。

モデル評価とスコア

2025年9月の公式評価では、いくつかの主要モデルが評価された。OpenAIのGPT-5.2は82.4%の最高スコアを達成し、2025.6アップデートでGPT-5.1が記録した80.1%という従来の記録を上回った。Google DeepMindのGemini 2.5 Proは79.8%、AnthropicのClaude 4.5 Opusは77.3%を獲得した。オープンソースモデルも進歩を示し、MetaのLlama 4.1 405Bは68.9%、Alibaba DAMO AcademyのQwen2.5-VL-72Bは65.2%を達成した。これらのスコアは、ほとんどのモデルで前回のアップデートから3〜5パーセントポイントの改善を示しており、マルチモーダル推論における着実な進歩を示している。

評価方法

MMMU 2025.9はゼロショット評価プロトコルを採用しており、モデルはテスト前にベンチマークでファインチューニングされない。各モデルは問題文と画像を受け取り、4つの選択肢から正解を選ばなければならない。このベンチマークは厳格な正解率メトリクスを採用しており、部分点は与えられない。ばらつきを減らすため、各モデルは異なるランダムシードで3回実行され、平均スコアが報告される。評価ハーネスは公開されており、第三者が結果を再現できるようになっている。このベンチマークには人間のベースラインも含まれており、関連する専攻の大学生50人のグループが平均85.7%を獲得し、AI性能の参照点を提供している。

影響と利用

MMMU 2025.9は、マルチモーダルAIシステムを比較するための標準的な参照点となっている。OpenAIAnthropicGoogle DeepMindなどの企業は、このベンチマークを使用して進捗を追跡し、結果を公表している。Stanford AI LabBerkeley AI Researchを含む学術機関は、マルチモーダル学習やビジョン言語モデルに関する論文でMMMUスコアを引用している。このベンチマークはまた、トランスフォーマーベースのアーキテクチャの開発にも影響を与えており、研究者は失敗パターンを分析してアテンションメカニズムクロスアテンション層を改善している。2025.9アップデートでは、ユーザーがモデルサイズ、ドメイン、推論タイプで結果をフィルタリングできるリーダーボードが導入され、より詳細な分析が可能になった。

今後の方向性

MMMUチームは、2025.10アップデートで問題セットを12,000問に拡大し、ビデオクリップにおける時間的推論のための新しいカテゴリを追加することを発表している。また、より複雑な多段階問題を含む「ハードモード」の導入も計画している。このベンチマークは、トップモデルと人間のベースラインとの差が縮まるにつれて、人間レベルのAI理解への進歩を測定するための重要なツールであり続けている。2025年9月時点で、最高のAIモデルは人間の平均値との差が3.3パーセントポイント以内であり、2024年初頭に観察された10ポイントの差から大幅に改善している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:benchmark·multimodal·evaluation·2025
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴