英語からの翻訳

MMMU 2025.5は、Massive Multi-discipline Multimodal Understandingベンチマークの2025年における5回目の更新版であり、大学レベルのマルチモーダルタスクでAIモデルを評価するための一連のスイートです。この更新では、新しい問題が追加され、視覚言語推論の進歩を追跡するために採点方法が調整されています。

MMMU 2025.5は、人工知能システム向けの広く使用される評価スイートであるMassive Multi-discipline Multimodal Understanding(MMMU)ベンチマークの、2025年にリリースされた5番目のアップデートである。このベンチマークは、大規模言語モデルおよび関連モデルが、視覚とテキストの両方の理解を必要とする学問分野にわたって大学レベルの推論を実行する能力を評価する。MMMU 2025.5は、ベンチマークの定期的なリフレッシュの伝統を継続し、新しい問題セットと改訂された採点手順を導入して、飽和効果を緩和し、最先端システム間の差別化を向上させる。

元のMMMUベンチマークは、スタンフォードAIラボカーネギーメロン大学トロント大学のチームを含む学術および産業研究者のコンソーシアムによって2023年に導入された。これは、芸術、工学、医学を含む30の科目にわたる教科書、講義スライド、試験問題から引き出された質問で構成される。各質問は、画像(図、チャート、写真など)を多肢選択または自由記述のプロンプトと統合し、モデルが両方のモダリティに対してマルチヘッドアテンションベースの推論を実行することを要求する。このベンチマークの難しさは、ドメイン固有の知識と正確な視覚的解釈への要求にあり、より単純な機械学習ベンチマークとは一線を画している。

MMMU 2025.5は、特に2025年の急速な進歩に対処しており、初期の2025年版(MMMU 2025.1から2025.4)は主要モデルにとってますます簡単になっていた。このアップデートは、オックスフォード大学MIT CSAILなどの機関から50人の専門アノテーターのパネルによってキュレーションされた約1,200の新しい質問を追加する。これらの質問は、多段階推論、反事実的シナリオ、および類似の解剖学的構造の区別や複雑な回路図の解釈などの微細な視覚的差異を強調する。このアップデートはまた、過信した誤答にペナルティを課す新しい採点ルーブリックを導入し、モデル出力におけるキャリブレーションされた温度スケーリングを促進する。

ベンチマークの設計とアップデート

MMMUスイートは、芸術とデザイン、ビジネス、科学、健康と医学、人文科学と社会科学、技術と工学の6つの広い分野に構造化されている。各分野には複数の科目が含まれ、質問は人間のパフォーマンスに基づいて難易度レベル(易、中、難)でタグ付けされている。MMMU 2025.5はこの構造を維持するが、分布を再調整する:難しい質問の割合を35%から45%に増やし、より簡単な項目を習得したモデルに挑戦する必要性を反映している。このアップデートはまた、画像がわずかに回転、クロップ、または色シフトされる新しい「視覚的摂動」サブセットを導入し、入力変動に対するロバスト性をテストする。

MMMU 2025.5の重要な革新は、Google DeepMindOpenAIの研究者からの入力で開発された「敵対的協力」質問の包含である。これらの質問は、曖昧であるか、画像に存在しない外部知識を必要とするように設計されており、モデルに明確化を求めるか、不確実性を述べることを強制する。これは、ベンチマークが精度だけでなく推論の透明性と失敗モードもますます測定する生成AI評価の広範なトレンドと一致する。

評価方法論

モデルはゼロショット設定で評価され、MMMU質問の事前例を受け取らない。ベンチマークは、画像とテキスト命令を含む標準化されたプロンプト形式を使用し、モデルは最終回答のために解析される応答を生成する必要がある。多肢選択質問の場合、モデルの出力は正しいオプションと照合される;自由記述質問の場合、正確な一致と(トランスフォーマーベースの埋め込みを使用した)意味的類似性の組み合わせが採用される。MMMU 2025.5はまた、Amazon Web ServicesGoogle Cloud APIなどの外部ツールを使用するモデルのパフォーマンスを別途報告するが、比較可能性を維持するためにそのような使用は推奨されない。

MMMU 2025.5の採点は、「信頼度加重精度」メトリックを導入する。各質問について、モデルは信頼度スコア(0から1)を出力する必要がある。最終スコアは、信頼度で重み付けされた正解の平均であり、高信頼度の誤りにはペナルティが課される。このメトリックは、Intuitive SurgicalロボティクスやWaymo自動運転などの分野での実世界展開に重要であり、過信したミスがコスト高になる可能性があるキャリブレーションを捉えることを目的としている。

パフォーマンスのトレンド

MMMU 2025.5のリリース時点で、AnthropicOpenAIGoogle DeepMindからの主要モデルは、MMMU 2025.1の約70%から78-82%の範囲の精度を達成している。しかし、新しい信頼度加重メトリックはこれらのスコアを65-70%に低下させ、多くのモデルが依然としてキャリブレーションが不十分であることを強調している。QualcommArm Holdingsによってエッジデバイス向けに最適化されたものなどの小型モデルは、通常20-30ポイント低いスコアを獲得し、フロンティアと展開システムの間のギャップを浮き彫りにしている。

ベンチマークはまた、空間推論とドメイン固有の用語における持続的な弱点を明らかにしている。例えば、モデルは医療画像で左右の向きを混同し、有機化学の質問で化学構造を誤認することがよくある。これらの発見は、これらの欠陥を特にターゲットとするカリキュラム学習データ拡張技術への研究を動機付けている。

影響と受け止め方

MMMU 2025.5は、主要なAIラボによって内部評価チェックポイントとして採用されている。OpenAIAnthropicはモデルリリースノートでMMMUスコアを公に引用しており、Google DeepMindは視覚タスクのための残差ネットワークU-Netアーキテクチャのトレーニングをガイドするためにこのベンチマークを使用している。ベンチマークのアップデートはまた、バークレーAIリサーチバーバ原子力研究センターからの論文がエラーパターンを分析し、深層学習モデルの一般化を研究するために学術研究者によって使用されている。

批評家は、MMMUの英語ベースの西洋中心の教育資料への依存が文化的バイアスを導入する可能性があると指摘しており、この懸念はアリババ・ダミャオ・アカデミーNECの研究者によっても共有されている。これに応えて、MMMUチームは2025年後半に多言語拡張の計画を発表しているが、詳細は未確認のままである。これらの制限にもかかわらず、MMMU 2025.5は、戦略的思考のためのチェスコンピュータ評価などの他のベンチマークを補完し、マルチモーダル推論の標準的な参照として残っている。

将来の方向性

スタンフォードAIラボトロント大学の主任研究者が率いるMMMUチームは、2026年のロードマップを概説している。計画されたアップデートには、生成AIモデルを使用した動的問題生成が含まれ、評価実行ごとに固有の質問を作成し、ビデオベースのタスクの統合も含まれる。チームはまた、品質管理やリモートセンシングなどの産業設定でのマルチモーダルシステムのベンチマークを開発するために、ノキア・ベル研究所Xerox PARCとのパートナーシップを模索している。

人工知能システムがより能力を高めるにつれて、MMMU 2025.5のようなベンチマークは、進歩が測定可能で意味のあるものであることを保証する上で重要な役割を果たす。このアップデートのキャリブレーションとロバスト性への強調は、生の精度を超えてモデル動作のより微妙な評価へと移行する分野の成熟を反映している。実務者にとって、MMMU 2025.5はモデルを比較し、開発優先順位を導くための厳格なテストベッドを提供する。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:benchmark·multimodal·evaluation·artificial-intelligence
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴