MMMU 2024.3은 2024년에 출시된 세 번째 업데이트로, 대학 수준의 다중 모드 이해 작업에서 Artificial intelligence 시스템의 능력을 측정하는 데 널리 사용되는 평가 스위트인 Massive Multi-discipline Multimodal Understanding(MMMU) 벤치마크의 일부이다. 이 벤치마크는 예술, 비즈니스, 과학, 인문학을 포함한 다양한 분야에 걸쳐 모델을 테스트하도록 설계되었으며, 텍스트와 이미지 모두에 대한 추론을 요구하는 질문을 사용한다. MMMU 2024.3을 포함한 각 업데이트는 Large language model 및 다중 모드 시스템의 급속한 발전에 맞춰 새로운 질문이나 수정된 질문을 도입하여 벤치마크가 계속해서 도전적이고 관련성을 유지하도록 보장한다.
MMMU 벤치마크는 원래 시각적 및 텍스트 정보를 처리하기 위한 Neural network 아키텍처를 결합하는 다중 모드 AI 시스템의 엄격한 평가 필요성을 해결하기 위해 도입되었다. 2024.3 업데이트는 특히 질문 난이도 개선, 데이터 누출 감소, 그리고 Generative AI 및 추론에서 새로운 능력을 테스트하는 새로운 예제 추가에 초점을 맞춘다. 출시 시점 기준으로 MMMU 2024.3은 OpenAI, Anthropic, Google DeepMind와 같은 조직 및 Stanford AI Lab과 BAIR (Berkeley AI Research) 같은 학술 기관의 모델 성능을 비교하는 연구자와 개발자에게 표준 참조 자료로 사용된다.
벤치마크 구조
MMMU 2024.3은 예술 및 디자인, 비즈니스, 인문학, 과학, 건강 및 의학, 사회 과학의 여섯 가지 핵심 분야에서 추출된 객관식 질문으로 구성된다. 각 질문에는 이미지(예: 차트, 다이어그램, 사진)와 텍스트 프롬프트가 포함되어 있으며, 모델이 시각적 및 텍스트 정보를 통합하여 네 가지 옵션 중 정답을 선택해야 한다. 질문은 대학 수준으로 설계되었으며, 종종 다단계 추론과 도메인별 지식을 요구한다. 이 업데이트는 모든 분야에 걸쳐 약 11,500개의 질문을 포함하며, 이전 버전과 유사한 분포를 가지지만 이전 반복에서 식별된 문제를 해결하기 위해 수정된 내용을 포함한다.
평가 방법론
모델은 MMMU 2024.3에서 정확도를 주요 지표로 평가되며, 결과는 전체 데이터셋과 분야별 하위 집합 모두에 대해 보고된다. 이 벤치마크는 제로샷 설정에서 사용되도록 설계되었으며, 모델은 데이터셋에 대한 추가 훈련이나 미세 조정 없이 질문과 이미지를 제공받는다. 이 접근 방식은 성능이 모델의 고유한 다중 모드 이해 및 추론 능력을 반영하도록 보장한다. 실제로 연구자들은 종종 이 벤치마크를 사용하여 Transformer (architecture) 아키텍처나 훈련 방식이 다른 모델 변형을 비교하고 시간 경과에 따른 진행 상황을 추적한다. 2024.3 업데이트에는 하이퍼파라미터 튜닝을 위한 검증 세트와 최종 평가를 위한 테스트 세트도 포함되며, 테스트 세트 답변은 과적합을 방지하기 위해 비공개로 유지된다.
2024.3 변경 사항
2024.3 업데이트는 몇 가지 주요 변경 사항을 도입했다. 첫째, 공개적으로 이용 가능해졌거나 모호한 답변이 있는 것으로 발견된 질문을 제거하고 더 엄격한 새 질문으로 대체했다. 둘째, 시계열 데이터 해석이나 사건 순서 이해와 같은 시간적 추론을 요구하는 새로운 질문 범주를 추가했다. 셋째, 과학적 도형과 건축 설계도와 같은 복잡한 다이어그램을 포함하는 질문의 비율을 늘려 공간 이해를 더 잘 테스트했다. 마지막으로, 검증 세트에 제공되는 답변 설명의 품질을 개선하여 오류 분석을 지원했다. 이러한 변경은 연구 커뮤니티의 피드백에 대응하고 벤치마크가 최첨단 성능의 신뢰할 수 있는 측정 도구로 유지되도록 하기 위해 이루어졌다.
영향 및 수용
MMMU 2024.3은 AI 연구 커뮤니티에서 다중 모드 이해를 위한 표준 벤치마크로 널리 채택되었다. GPT-4V, Claude 3, Gemini와 같은 모델을 평가하기 위해 수많은 연구 논문과 기술 보고서에서 사용되었으며, 결과는 종종 미디어 보도에서 인용된다. 벤치마크의 난이도와 폭은 Deep learning 및 Machine learning의 진행 상황을 나타내는 핵심 지표가 되었다. 그러나 일부 연구자들은 벤치마크가 객관식 질문과 정적 이미지에 의존하기 때문에 실제 세계의 다중 모드 추론을 완전히 포착하지 못할 수 있다고 지적한다. 그럼에도 불구하고 MMMU 2024.3은 가장 포괄적이고 도전적인 벤치마크 중 하나로 남아 있으며, 그 업데이트는 다중 모드 AI 시스템을 작업하는 사람들이 면밀히 주시하고 있다.
향후 방향
AI 모델이 계속 개선됨에 따라 MMMU 벤치마크는 더욱 진화할 것으로 예상된다. 향후 업데이트는 비디오나 상호작용 요소를 통합하거나 더 많은 분야 또는 더 세밀한 추론 작업을 포함하도록 확장될 수 있다. University of Toronto 및 Carnegie Mellon University와 같은 기관에 소속된 벤치마크 유지 관리자들은 기술 발전에 맞춰 정기적인 업데이트를 제공하겠다는 의지를 밝혔다. 2024.3 업데이트는 이러한 지속적인 노력의 증거로, AI 커뮤니티에 엄격하고 최신의 평가 도구를 제공한다.