MMMU 2025는 다중 모드 인공지능 시스템, 특히 시각적 이해 능력을 갖춘 대형 언어 모델의 성능을 평가하기 위해 설계된 벤치마크입니다. 이는 앨버타 대학교와 칼턴 대학교를 포함한 기관의 연구자 컨소시엄이 2023년 말에 출시한 원래 MMMU(대규모 다분야 다중 모드 이해) 벤치마크를 확장한 것입니다. 2025년 버전은 Generative AI 및 Large language model 연구의 급속한 발전을 반영하여 벤치마크를 업데이트하고, 여러 분야에 걸친 심층 추론을 요구하는 새로운 작업과 더 어려운 질문을 도입합니다.
이 벤치마크는 모델이 이미지, 다이어그램, 차트와 같은 시각적 정보를 텍스트 질문과 결합하여 인식하고 추론하는 능력을 평가합니다. 인문학, 사회 과학, STEM 분야, 의학 및 법률과 같은 전문 영역을 포함한 광범위한 주제를 다룹니다. MMMU 2025는 대학 수준의 이해를 엄격하게 테스트하도록 설계되어, 모델이 시각적 요소를 인식할 뿐만 아니라 도메인별 지식과 다단계 추론을 적용해야 합니다. 이 벤치마크는 OpenAI, Anthropic, Google DeepMind와 같은 조직의 주요 AI 시스템 성능을 비교하는 표준 참조 지점이 되었습니다.
작업 설계 및 평가
MMMU 2025는 각각 이미지 또는 이미지 세트와 짝을 이루는 객관식 질문으로 구성됩니다. 질문은 시각적 단서와 텍스트 맥락의 종합을 요구하도록 설계되었으며, 종종 단순한 패턴 인식을 넘어서는 지식을 요구합니다. 예를 들어, 질문은 회로도를 제시하고 부품 변경의 효과를 묻거나, 역사적 그림을 보여주고 문화적 중요성을 질문할 수 있습니다. 이 벤치마크는 30개 분야에 걸쳐 30,000개 이상의 질문을 포함하며, 현재 모델에 도전적인 질문에 중점을 둡니다.
평가는 정확도를 주요 지표로 사용하여 수행되며, 모델은 옵션 세트에서 단일 정답을 출력해야 합니다. 벤치마크는 또한 분야 및 질문 유형별 성능을 추적하여 연구자가 특정 강점과 약점을 식별할 수 있게 합니다. 2025년 버전에서는 모델이 여러 이미지를 동시에 추론하여 시각적 정보를 비교하고 대조하는 능력을 테스트하는 새로운 질문 하위 집합이 추가되었습니다. 이 설계는 모델을 단순한 이미지 캡셔닝을 넘어 시각적 추론 및 문제 해결 영역으로 밀어붙입니다.
주요 발견 및 모델 성능
2025년 초 기준, MMMU 2025에서 가장 우수한 성능을 보이는 모델은 중반 80%대의 정확도 점수를 달성하며, 상위 모델이 약 50-60%를 기록한 원래 MMMU에 비해 상당한 개선을 보여줍니다. 이러한 진전은 Transformer (architecture) 아키텍처의 발전, 더 큰 훈련 데이터 세트, 그리고 Reinforcement Learning from AI Feedback (RLAIF) 및 Curriculum Learning과 같은 개선된 훈련 기술에 기인합니다. 특히 OpenAI와 Google DeepMind의 모델이 리더보드에서 지속적으로 최상위를 차지하며, 최신 릴리스는 물리학 및 생물학과 같은 특정 분야에서 인간에 가까운 성능을 입증합니다.
그러나 벤치마크는 지속적인 격차를 드러냅니다. 모델은 여전히 추상적 추론, 상식 지식 또는 복잡한 공간 관계 이해를 요구하는 질문에 어려움을 겪습니다. 성능은 또한 분야에 따라 크게 다르며, 인문학과 사회 과학은 종종 순수 STEM 분야보다 더 어려운 경우가 많습니다. 벤치마크 제작자는 MMMU 2025가 해결된 문제가 아니며, 시각적 및 텍스트 정보를 더 잘 통합할 수 있는 Multi-Head Attention 및 Cross-Attention 메커니즘과 같은 영역의 연구 동기로 계속 작용한다고 강조합니다.
다른 벤치마크와의 비교
MMMU 2025는 AI 평가 벤치마크의 광범위한 생태계의 일부입니다. 이는 Visual Question Answering(VQA) 벤치마크 및 General Language Understanding Evaluation(GLUE) 제품군과 같은 다른 잘 알려진 테스트를 보완합니다. 일상적인 장면에 대한 간단한 질문에 초점을 맞춘 VQA와 달리, MMMU 2025는 대학 수준의 학술 콘텐츠를 대상으로 하여 교육 및 전문 작업에서 AI를 지원하는 목표와 더 잘 일치합니다. GLUE와 같은 텍스트 전용 벤치마크와 비교할 때, MMMU 2025는 자율 주행, 의료 영상 및 로봇 공학과 같은 응용 분야에 필수적인 시각적 이해의 중요한 차원을 추가합니다.
이 벤치마크는 또한 Massive Multitask Language Understanding(MMLU)과 같은 최신 다중 모드 벤치마크와 다릅니다. MMMU 2025는 모든 질문에 시각적 입력을 요구하는 반면, MMLU는 텍스트 전용입니다. 이는 MMMU 2025를 종종 다중 모드인 실제 세계 데이터를 처리하는 모델의 능력에 대한 더 직접적인 테스트로 만듭니다. 연구자들은 종종 MMMU 2025를 다른 벤치마크와 함께 사용하여 모델의 능력에 대한 포괄적인 관점을 얻습니다. 단일 벤치마크로 지능의 모든 측면을 포착할 수 없기 때문입니다.
영향 및 향후 방향
MMMU 2025의 도입은 Artificial intelligence 분야에 상당한 영향을 미쳤습니다. 이는 더 강력한 시각적 인코더, 시각적 및 텍스트 특징의 더 나은 융합, 더 효율적인 훈련 방법에 대한 연구를 촉진했습니다. AMD, Intel, TSMC와 같은 회사도 주목했으며, 벤치마크의 계산 요구 사항은 이러한 모델을 효율적으로 실행하기 위해 AWS Trainium 및 Groq 가속기와 같은 특수 하드웨어의 필요성을 강조합니다.
앞으로 MMMU 2025의 제작자는 답변을 선택하는 대신 설명을 생성해야 하는 개방형 작업을 포함하여 더 도전적인 질문이 포함된 업데이트 버전을 출시할 계획입니다. 비디오 및 오디오 모달리티를 통합하는 것에 대한 논의도 있으며, 이는 다중 모드 이해의 경계를 더욱 확장할 것입니다. AI 모델이 계속 개선됨에 따라 MMMU 2025와 같은 벤치마크는 진행 상황을 측정하고 인간 수준의 지능이 여전히 도달할 수 없는 영역을 식별하는 데 중요한 역할을 할 것입니다.