英語からの翻訳

MMMU 2025.10は、マルチモーダルAI評価スイートであるMMMUベンチマークへの2025年における10回目の更新です。視覚言語モデルをテストするための新しいタスクとデータを追加します。

MMMU 2025.10は、2025年にリリースされたMMMU(Massive Multi-discipline Multimodal Understanding)ベンチマークの第10回目の定期更新版です。MMMUは、視覚情報とテキスト情報の両方を処理するArtificial intelligenceシステム、例えば視覚能力を持つLarge language modelを評価するために広く使用されている評価スイートです。2025.10版は、Machine learningおよびDeep learningモデルの進歩を追跡するために新しい質問とタスクを追加するというベンチマークの伝統を継続しています。

この更新は2025年10月に導入され、同年前半に開始された毎月のリリースパターンに従っています。2025年シリーズの各更新は、OpenAIAnthropicGoogle DeepMindなどの組織からのマルチモーダルモデルの急速な進化にベンチマークを最新の状態に保つことを目的としています。2025.10版は特に、チャートや図を用いた複雑な推論、およびビデオフレームの理解など、2025年の初期バージョンでギャップが見られた領域のカバレッジ拡大に焦点を当てています。

ベンチマーク構造

MMMU 2025.10は、元のMMMUベンチマークのコア構造を維持しており、複数の学術分野にわたって質問を整理しています。これには、芸術、ビジネス、科学、工学、人文科学が含まれます。各質問は、写真、チャート、回路図などの画像と、多肢選択式の質問を組み合わせています。2025.10更新では、約1,500の新しい質問が追加され、合計で12,000を超えています。新しい項目は、モデルが視覚的手がかりとドメイン知識を組み合わせて正しい答えに到達する必要がある多段階推論を強調しています。

このベンチマークは、最も高度なNeural networkシステムにとっても挑戦的であるように設計されています。より単純な視覚質問応答タスクとは異なり、MMMUの質問は多くの場合、大学レベルの専門知識を必要とします。例えば、回路図を示してその電気的特性について尋ねる質問や、歴史的な絵画を表示してその文化的背景について尋ねる質問があるかもしれません。

スコアリングと評価

モデルは、正しく回答された質問の割合として測定される精度で評価されます。2025.10更新では、正しい答えを提供しても推論が不正確なモデルにペナルティを課す、より厳格な評価プロトコルが導入されました。この変更は、一部のモデルが真の理解なしに正しく推測しているという懸念への対応として行われました。評価には、単一の正解がない質問のサブセットも含まれており、モデルが不確実性を認識する能力をテストするように設計されています。

2025.10の結果では、OpenAIAnthropicGoogle DeepMindからの主要モデルが、2025年初頭の60年代半ばから、70年代後半から80年代前半のパーセント範囲の精度スコアを達成しました。Alibaba DAMO Academyなどの小規模なオープンソースモデルは、通常50年代から60年代のスコアを記録し、フロンティアモデルとアクセス可能なモデルの間のギャップを浮き彫りにしました。

モデル開発への影響

2025.10更新は、開発者がマルチモーダルシステムをトレーニングおよび改良する方法に影響を与えています。多くのチームは、Artificial intelligence推論テストなどの他の評価と並行して、開発中にMMMUを主要なベンチマークとして使用しています。新しい推論重視の質問は、研究者にChain-of-thoughtプロンプティングやReinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)などの技術を改善するよう促しました。

いくつかのTransformer (architecture)ベースのアーキテクチャは、MMMUで良好なパフォーマンスを発揮するように特別に調整されています。例えば、OpenAIのGPT-5ビジョンモデルとAnthropicのClaude 4.5は、どちらもMMMU 2025.10の結果を使用してポストトレーニング調整をガイドしたと報告しています。このベンチマークは、MIT CSAILStanford AI Labなどの学術研究所でも、Curriculum LearningData Augmentation戦略を含む新しいトレーニング方法を比較するために使用されています。

批判と限界

その人気にもかかわらず、MMMU 2025.10は批判に直面しています。一部の研究者は、ベンチマークの多肢選択形式が、モデルがオープンエンドの応答を生成する必要がある実際の使用状況を反映していないと主張しています。他の研究者は、質問バンクが時間の経過とともに記憶され、スコアが過大評価される可能性があると指摘しています。2025.10更新では、古い質問をローテーションで除外し、動的評価モードを導入することでこれを緩和しようとしましたが、懸念は残っています。

さらに、ベンチマークが英語コンテンツと西洋の学術カリキュラムに大きく依存していることは、限界として指摘されています。多言語および文化的に多様な質問を追加する取り組みは遅く、2025.10版では少数の非英語項目のみが追加されました。これにより、Bhabha Atomic Research CentreSamsung Researchを含む一部の組織は、地域のニーズに合わせた独自の内部評価を開発するようになりました。

将来の方向性

MMMUチームは、2025.11更新の計画を発表しており、インタラクティブおよびマルチターン推論タスクに焦点を当てる予定です。これには、モデルが明確化の質問をしたり、追加の画像を要求したりすることが必要となり、静的な質問と回答のペアを超えて進化します。チームはまた、AMDQualcommなどの業界グループとのパートナーシップを模索しており、計算制約がより厳しいエッジデバイス向けにベンチマークを最適化することを目指しています。

2025年後半の時点で、MMMUはマルチモーダルMachine learningの分野で最も引用されているベンチマークの1つであり続けています。その継続的な進化は、Generative AIシステムのより厳格で現実的な評価への広範なトレンドを反映しています。それが標準であり続けるかどうかはまだわかりませんが、モデル開発への影響は否定できません。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:benchmark·multimodal·evaluation·machine-learning
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴