MMMU 2025.7은 2025년에 출시된 일곱 번째 업데이트로, 인공지능 시스템을 위한 널리 사용되는 평가 도구 모음인 대규모 다분야 멀티모달 이해(MMMU) 벤치마크의 일부이다. 이 벤치마크는 대규모 언어 모델 및 기타 멀티모달 모델이 대학 수준의 학술적 맥락에서 이미지와 텍스트에 대해 추론하는 능력을 테스트하도록 설계되었다. 2025년 시리즈의 각 업데이트는 생성형 AI 시스템의 급속한 발전에 맞춰 새로운 질문, 수정된 채점 프로토콜 또는 갱신된 참조 답변을 도입한다.
MMMU 벤치마크는 원래 평가의 공백을 해소하기 위해 만들어졌다. 기존의 많은 테스트는 텍스트 전용 추론이나 단순한 이미지 분류에 초점을 맞추었다. MMMU는 모델이 시각 정보와 복잡한 도메인 특화 지식을 통합하도록 요구하며, 예술, 공학, 의학, 사회 과학과 같은 과목을 다룬다. 2025.7 업데이트는 이러한 전통을 이어가며, 특히 다단계 추론과 여러 시각 요소에서 정보를 종합하는 것을 요구하는 질문에 중점을 둔다.
벤치마크 구조
MMMU 2025.7은 이전 버전의 핵심 구조를 유지한다. 대학 수준의 교과서와 강의 자료에서 가져온 객관식 질문으로 구성된다. 각 질문에는 정답에 도달하는 데 필수적인 이미지 또는 다이어그램이 포함된다. 질문은 학문 분야와 요구되는 추론 유형(예: 기본 인식, 논리적 추론, 정량적 분석)에 따라 분류된다.
2025.7 업데이트는 이전 버전에서 모호성을 식별한 검토 과정을 거쳐 수정된 참조 답변 세트를 도입했다. 이 수정은 벤치마크가 모델 능력의 신뢰할 수 있는 척도로 유지되도록 하는 지속적인 노력의 일부였다. 또한 이 업데이트는 멀티모달 연구에서 이러한 분야의 중요성이 커지고 있음을 반영하여 공학 및 컴퓨터 과학 범주의 질문 풀을 확장했다.
평가 방법론
모델은 표준화된 프로토콜을 사용하여 MMMU 2025.7에서 평가된다. 각 모델은 전체 질문 세트를 제시받으며, 응답은 참조 답변과 비교된다. 성능은 일반적으로 전체 정확도 점수와 학문 분야 및 추론 유형별 세부 점수로 보고된다. 이러한 세부 보고를 통해 연구자는 모델의 멀티모달 이해에서 특정 강점과 약점을 식별할 수 있다.
2025.7 업데이트에서는 체인 오브 사고 추론을 사용하는 모델을 고려하도록 평가 프로토콜이 조정되었다. 채점은 이제 모델의 최종 답변과 중간 추론 단계를 구분하지만, 정확도 점수는 최종 답변만으로 결정된다. 이 변경은 추론을 설명할 수 있는 모델의 개발을 장려하면서도 그렇지 않은 모델을 불이익하지 않기 위해 이루어졌다.
성능 추세
원래 MMMU 벤치마크가 출시된 이후, 선도적인 모델의 성능은 크게 향상되었다. 2025.7 업데이트는 트랜스포머 아키텍처와 멀티 헤드 어텐션 메커니즘을 기반으로 구축된 최고 성능 시스템이 몇 년 전에는 달성할 수 없다고 여겨졌던 정확도 수준을 달성하는 환경을 반영한다. 그러나 벤치마크는 특히 세밀한 시각적 세부 사항이나 전문 도메인 지식을 요구하는 질문에서 상당한 격차를 계속 드러내고 있다.
MMMU 2025.7에서 주목할 만한 결과는 오픈AI, 앤트로픽, 구글 딥마인드와 같은 조직에서 개발한 모델에서 나왔다. 이러한 시스템은 일반적으로 잔차 네트워크 구성 요소와 고급 손실 함수를 포함한 대규모 딥러닝 기술을 사용한다. 벤치마크는 또한 오픈 가중치 모델을 평가하는 데 사용되어 생태계의 비교 관점을 제공한다.
영향 및 비판
MMMU 2025.7은 머신러닝 분야의 연구자와 개발자에게 기준점이 되었다. 그 결과는 기술 보고서와 학술 논문에서 자주 인용되며, 여러 벤치마크에서 진행 상황을 추적하는 리더보드에 자주 포함된다. 이 업데이트의 대학 수준 콘텐츠에 대한 초점은 더 단순한 크라우드 소싱 질문에 의존하는 벤치마크와 구별된다.
비평가들은 벤치마크 포화가 우려 사항이라고 지적한다. 모델이 개선됨에 따라 고정된 질문 세트의 한계 가치는 감소한다. 2025.7 업데이트는 새로운 질문을 도입하고 기존 질문을 수정하여 이를 해결하지만, 일부 연구자는 벤치마크가 동적으로 생성되거나 적대적인 예제도 통합해야 한다고 주장한다. 다른 사람들은 MMMU에서 높은 정확도가 반드시 강력한 실제 성능으로 이어지지 않는다고 지적하며, 이는 대부분의 정적 평가 도구 모음이 공유하는 한계이다.
향후 방향
MMMU 벤치마크 시리즈는 계속 진화할 것으로 예상된다. 향후 업데이트는 비디오 기반 질문, 대화형 작업 또는 추론 과정의 더 미묘한 평가를 통합할 수 있다. 벤치마크 관리자는 모델이 공개 데이터 세트로 유출되는 벤치마크 질문에 대해 훈련되는 데이터 오염의 위험을 줄이는 방법을 모색하고 있다고 밝혔다. 2025.7 업데이트에는 공개적으로 출시되지 않은 소수의 보류 질문 세트가 포함되어 오염 검사 역할을 하도록 의도되었다.
신경망 아키텍처와 훈련 방법이 발전함에 따라 MMMU 2025.7과 같은 벤치마크는 진행 상황을 측정하는 필수 도구로 남을 것이다. 이들은 시스템을 비교하고 분야가 해결해야 할 다음 과제를 식별하기 위한 공통 언어를 제공한다.