영어에서 번역됨

MMMU 2025.9는 2025년 9월에 출시된 대규모 다학제 다중 모드 이해 벤치마크의 아홉 번째 2025년 업데이트로, 대학 수준의 다중 모드 작업에서 AI 모델을 평가하기 위해 설계되었습니다.

MMMU 2025.9는 2025년에 출시된 Massive Multi-discipline Multimodal Understanding(MMMU) 벤치마크의 아홉 번째 업데이트입니다. 이 벤치마크는 인공지능 모델이 대학 수준의 과목에서 텍스트와 이미지를 이해하고 추론하는 능력을 평가합니다. 이 벤치마크는 연구자와 기업이 대규모 언어 모델 및 멀티모달 시스템의 성능을 비교하는 데 널리 사용됩니다.

MMMU 2025.9는 대학 교과서, 강의 슬라이드, 학술 논문에서 파생된 질문을 제시하는 벤치마크의 전통을 이어갑니다. 각 질문에는 다이어그램, 차트, 사진과 같은 이미지와 객관식 답변이 포함됩니다. 벤치마크는 예술, 생물학, 비즈니스, 화학, 컴퓨터 과학, 경제학, 공학, 지리학, 역사, 문학, 수학, 물리학, 심리학 분야를 다룹니다. 2025.9 버전은 새로워진 질문 세트와 업데이트된 채점 프로토콜을 도입합니다.

질문 세트 및 구성

2025.9 업데이트에는 이전 2025.8 릴리스의 11,000개 질문에서 증가한 11,500개의 질문이 포함되어 있습니다. 질문은 900개 항목의 검증 세트와 10,600개 항목의 테스트 세트로 나뉩니다. 각 질문은 이미지가 문제 해결에 필수적인지 수동으로 검증되어 텍스트만으로 답을 도출할 수 없도록 합니다. 분야별 분포는 균형을 유지하며, 각 주제 영역당 약 850개의 질문이 있습니다. 이 업데이트에는 의료 영상 및 엔지니어링 청사진의 시각적 추론을 특별히 대상으로 하는 500개의 새로운 하위 세트도 포함되어 있으며, 이는 새로운 응용 분야를 반영합니다.

모델 평가 및 점수

2025년 9월 공식 평가에서 여러 주요 모델이 평가되었습니다. OpenAI의 GPT-5.2는 82.4%의 최고 점수를 달성하여 2025.6 업데이트에서 GPT-5.1이 세운 이전 기록인 80.1%를 넘어섰습니다. Google DeepMind의 Gemini 2.5 Pro는 79.8%를 기록했으며, Anthropic의 Claude 4.5 Opus는 77.3%에 도달했습니다. 오픈소스 모델도 진전을 보였습니다: Meta의 Llama 4.1 405B는 68.9%를, Alibaba DAMO Academy의 Qwen2.5-VL-72B는 65.2%를 달성했습니다. 이러한 점수는 대부분의 모델에서 이전 업데이트보다 3-5퍼센트 포인트 개선된 것으로, 멀티모달 추론의 꾸준한 진전을 나타냅니다.

평가 방법론

MMMU 2025.9는 제로샷 평가 프로토콜을 사용하며, 이는 모델이 테스트 전에 벤치마크에 미세 조정되지 않음을 의미합니다. 각 모델은 질문 텍스트와 이미지를 받고 네 가지 옵션 중 정답을 선택해야 합니다. 벤치마크는 부분 점수 없이 엄격한 정확도 지표를 사용합니다. 변동성을 줄이기 위해 각 모델은 서로 다른 무작위 시드로 세 번 실행되며 평균 점수가 보고됩니다. 평가 하네스는 공개적으로 제공되어 제3자가 결과를 재현할 수 있습니다. 벤치마크에는 인간 기준선도 포함됩니다: 관련 전공을 가진 50명의 대학생 그룹이 평균 85.7%를 기록하여 AI 성능의 참조점을 제공합니다.

영향 및 사용

MMMU 2025.9는 멀티모달 AI 시스템을 비교하는 표준 참조가 되었습니다. OpenAI, Anthropic, Google DeepMind와 같은 기업은 벤치마크를 사용하여 진행 상황을 추적하고 결과를 공개합니다. Stanford AI LabBerkeley AI Research를 포함한 학술 기관은 멀티모달 학습 및 비전-언어 모델에 관한 논문에서 MMMU 점수를 인용합니다. 벤치마크는 또한 연구자가 실패 패턴을 분석하여 어텐션 메커니즘크로스 어텐션 레이어를 개선함에 따라 트랜스포머 기반 아키텍처 개발에 영향을 미칩니다. 2025.9 업데이트는 사용자가 모델 크기, 도메인, 추론 유형별로 결과를 필터링할 수 있는 리더보드를 도입하여 더 세분화된 분석을 가능하게 합니다.

향후 방향

MMMU 팀은 2025.10 업데이트가 질문 세트를 12,000개 항목으로 확장하고 비디오 클립의 시간적 추론을 위한 새 범주를 추가할 것이라고 발표했습니다. 또한 더 복잡한 다단계 문제를 포함하는 "하드 모드"를 도입할 계획입니다. 최고 모델과 인간 기준선 간의 격차가 좁혀짐에 따라 벤치마크는 인간 수준의 AI 이해를 향한 진전을 측정하는 핵심 도구로 남아 있습니다. 2025년 9월 기준으로 최고 AI 모델은 인간 평균과 3.3퍼센트 포인트 이내에 있으며, 이는 2024년 초에 관찰된 10포인트 격차에서 크게 개선된 것입니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:benchmark·multimodal·evaluation·2025
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사