英語からの翻訳

MMMU 2025.1は、大規模マルチディシプリンマルチモーダル理解ベンチマークの2025年最初のアップデートであり、マルチモーダルAIシステム向けの新しいタスクと改訂された評価プロトコルを導入しています。

MMMU 2025.1は、2025年における大規模マルチディシプリン・マルチモーダル理解ベンチマークの最初のアップデートです。これは、視覚認識とドメイン固有の推論の両方を必要とするタスクでArtificial intelligenceシステムを評価するために設計された、元のMMMUフレームワークを拡張したものです。このアップデートでは、新しい問題形式、追加の分野、改訂された採点プロトコルが導入され、現代のLarge language modelやマルチモーダルモデルの能力をより適切に反映しています。

このベンチマークは、視覚と言語を組み合わせたDeep learningシステムに取り組む研究者や開発者にとって、重要な参照点であり続けています。標準化された一連の課題を提供することで、MMMU 2025.1は、Transformer (architecture)アーキテクチャやNeural network設計に基づくものを含む、さまざまなモデルの性能比較を支援します。

ベンチマーク構造

MMMU 2025.1は、大学レベルの教科書や講義ノートから引用された多肢選択問題を含む、元のベンチマークのコア構造を維持しています。このアップデートでは、画像とテキストにまたがる多段階の推論を必要とする新しいカテゴリの問題が追加され、Generative AI技術のみに依存するモデルにとって難易度が高まっています。このベンチマークは、物理学、化学、医学、工学などの分野をカバーし、各問題には正しく答えるために不可欠な1つ以上の画像がペアになっています。

2025.1バージョンでは、自信過剰だが不正確な回答をより重く罰する改訂された採点システムも導入され、モデルが不確実性を調整することを促しています。この変更は、較正が単なる正確さと同じくらい重要と見なされるMachine learning評価の最近の傾向と一致しています。

評価プロトコル

モデルはゼロショットベースで評価され、テスト前にMMMUデータで微調整されないことを意味します。このプロトコルにより、性能が記憶ではなくモデルの一般的な推論能力を反映することが保証されます。このベンチマークには、開発用の検証セットと最終採点用のテストセットが含まれ、結果は正確率のパーセンテージとして報告されます。

2025.1アップデートでは、評価パイプラインが自動化され、OpenAIのGPT-4oやAnthropicのClaude 3.5 Sonnetなど、最初にテストされたモデルを含む、より大きなモデル出力を処理できるようになりました。このプロトコルは、Google DeepMindや他の主要ラボのモデルもサポートし、広範な適用性を確保しています。

以前のバージョンからの主な変更点

MMMU 2025.1の大きな変更点の1つは、画像シーケンス内のイベントの順序が重要となる時間的推論を必要とする問題の追加です。この追加は、Waymoの自動運転やTeslaなどのアプリケーションにとって重要である、動的なシーンを理解するモデルの能力をテストします。

もう1つの変更点は、視覚入力タイプの拡張です。静的な写真や図に加えて、このベンチマークには、チャート、グラフ、ソフトウェアインターフェースのスクリーンショットが含まれるようになりました。この多様性は、多くのDeep learningシステムにとって依然として難しいタスクである、多様な視覚形式から情報を抽出するモデルに挑戦を課します。

このアップデートでは、回答が画像と付随するテキストの両方からの情報を組み合わせることに依存する、クロスモーダル推論を必要とする新しいサブセットの問題も導入されています。このサブセットは、現代のトランスフォーマーにおけるMulti-Head Attentionメカニズムのコア目標である、視覚的および言語的理解の統合をテストするように設計されています。

性能トレンド

MMMU 2025.1の初期結果では、主要モデルが70%以上の正確率を達成していますが、人間の性能(約90%)と最良のAIシステムの間には依然として大きなギャップがあります。Chain-of-thoughtプロンプティングや類似の推論技術を使用するモデルは、より良い性能を発揮する傾向があり、明示的な推論ステップが複雑なマルチモーダルタスクに役立つことを示唆しています。

しかし、このベンチマークは、特に正確な空間推論や微妙な視覚詳細の理解を必要とするタスクにおいて、現在のモデルの持続的な弱点も明らかにしています。例えば、医用画像や工学図を含む問題は、最も先進的なシステムでさえもつまずくことが多く、Computer visionとマルチモーダル学習におけるさらなる研究の必要性を浮き彫りにしています。

AI開発への影響

MMMU 2025.1のリリースは、より広範なAIコミュニティに影響を与えます。これは、実世界環境で動作できるAIシステムの開発に不可欠な、マルチモーダル理解の進歩を評価するための厳密なテストベッドを提供します。Amazon Web ServicesGoogle Cloudなどの企業は、このベンチマークを使用して自社のモデルを評価し、AIサービスの改善を導いています。

Stanford AI LabBAIR (Berkeley AI Research)などの機関の研究者は、現在のモデルの限界を研究するための貴重なリソースとしてMMMU 2025.1を引用しています。このベンチマークはまた、開発者が正確さを犠牲にせずに効率を向上させようとする中で、Model PruningData Augmentationの新しい技術の基準としても機能します。

全体として、MMMU 2025.1は、マルチモーダルAIの評価における前進を表し、この分野をより堅牢で有能なシステムへと押し進めています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:benchmark·multimodal·evaluation·artificial-intelligence
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴