MMMU-Pro는 시각적 및 텍스트 정보를 모두 처리하는 다중 모드 인공지능 시스템, 특히 대규모 다중 모드 모델의 능력을 평가하기 위해 설계된 벤치마크 데이터셋이다. 이는 원래 MMMU(대규모 다학제 다중 모드 이해) 벤치마크의 향상되고 더 도전적인 후속 버전으로, 다양한 학문 및 기술 분야에서 전문가 수준의 전문성을 목표로 한다. 이 벤치마크는 모델이 이미지, 다이어그램, 차트 및 관련 텍스트를 통합하고 추론하는 능력을 테스트하도록 구성되어 있으며, 단순한 패턴 인식이 아닌 깊은 도메인 지식을 요구한다.
원래 MMMU 벤치마크는 2023년 말에 출시되었으며, 예술, 비즈니스, 과학, 인문학, 사회 과학, 기술의 여섯 분야에 걸쳐 대학 수준의 교과서와 시험에서 추출한 질문으로 구성되었다. MMMU-Pro는 2024년에 원래 벤치마크의 한계, 특히 일부 모델이 통계적 규칙성이나 암기된 답변을 활용하여 높은 점수를 얻는 경향을 해결하기 위해 도입되었다. MMMU-Pro는 질문 난이도를 높이고, 더 복잡한 시각적 요소를 도입하며, 더 큰 선택지 세트를 가진 객관식 질문과 더 엄격한 채점 방식을 포함하는 더 엄격한 평가 프로토콜을 구현하여 무작위 추측의 영향을 줄인다.
설계 및 구축
MMMU-Pro는 여러 기관의 연구자 팀에 의해 구축되었으며, 학술 연구실과 산업 연구 그룹의 기여를 포함한다. 이 데이터셋은 원래 MMMU를 기반으로 하지만 전문가 수준의 정밀 검토 계층을 추가한다. 질문은 고급 교과서, 전문 자격 시험 및 연구 논문을 포함한 더 넓은 범위의 자료에서 출처를 얻는다. 각 질문은 문제 해결에 필수적인 이미지 또는 이미지 세트와 짝을 이루며, 텍스트는 다단계 추론을 요구하도록 제작된다.
MMMU-Pro의 주요 설계 선택은 답변 선택지의 확장이다. 원래 MMMU는 질문당 네 가지 선택지를 사용했지만, MMMU-Pro는 일반적으로 열 가지 선택지를 사용한다. 이 변경은 모델이 우연히 올바르게 추측할 확률을 크게 낮추어, 벤치마크를 진정한 이해의 더 신뢰할 수 있는 척도로 만든다. 또한, 이 벤치마크는 시각적 정보가 의도적으로 오해를 유도하거나 관련 세부 사항을 추출하기 위해 주의 깊은 검사가 필요한 질문의 하위 집합을 포함하여, 모델이 방해 요소보다 관련 정보에 집중하는 능력을 테스트한다.
평가 프로토콜
MMMU-Pro의 평가는 공정성과 재현성을 보장하기 위해 엄격한 프로토콜을 따른다. 모델에는 질문 텍스트와 관련 이미지가 제공되며, 열 가지 답변 선택지 중 하나를 출력해야 한다. 주요 지표는 정확도이지만, 벤치마크는 분야별 및 질문 유형(예: 다이어그램 해석, 차트 읽기 또는 시각적 추론)별로 성능을 세분화하여 보고한다.
추측의 영향을 더 줄이기 위해, MMMU-Pro는 "이미지 없음" 조건을 포함한다. 이 조건에서 모델은 동일한 질문에 대해 이미지 없이 평가된다. 이는 모델이 시각적 정보에 얼마나 의존하는지 텍스트 사전 지식에 얼마나 의존하는지 측정하는 대조군 역할을 한다. 이미지 없음 조건에서 잘 수행하지만 전체 조건에서 잘 수행하지 못하는 모델은 언어 패턴에 과적합될 수 있으며, 둘 다 잘 수행하는 모델은 강력한 다중 모드 통합을 입증한다.
주요 모델의 성능
2024년 말 기준으로, 어떤 모델도 MMMU-Pro에서 인간 수준의 성능을 달성하지 못했다. OpenAI, Google DeepMind 및 Anthropic과 같은 주요 AI 기업의 독점 모델을 포함한 최고 성능 시스템은 일반적으로 전체 벤치마크에서 50-60% 정확도 범위를 기록한다. 이는 동일한 모델이 원래 MMMU에서 달성하는 70-80% 정확도에서 크게 하락한 수치로, 증가된 난이도를 강조한다.
학술 그룹과 소규모 기업이 개발한 오픈 소스 모델은 일반적으로 더 낮은 점수를 기록하며, 종종 30-45% 범위에 있다. 독점 모델과 오픈 소스 모델 간의 격차는 더 단순한 벤치마크보다 MMMU-Pro에서 더 두드러지며, 이는 요구되는 전문가 수준의 추론이 많은 신경망 아키텍처의 현재 병목 현상임을 시사한다. 이 벤치마크는 다중 모드 이해의 진행 상황을 추적하기 위한 인공지능 커뮤니티의 표준 참조 지점이 되었으며, 연구자들은 논문과 기술 보고서에서 정기적으로 결과를 보고한다.
영향 및 한계
MMMU-Pro는 특정 약점을 강조함으로써 다중 모드 모델의 개발에 영향을 미쳤다. 예를 들어, 많은 모델은 딥러닝 연구 논문에서 발견되는 것과 같은 공간 추론이나 복잡한 과학 다이어그램 해석을 요구하는 질문에서 어려움을 겪는다. 이는 시각적 인코더 개선과 암기보다 추론을 강조하는 훈련 기술에 대한 작업을 촉진했다.
그러나 이 벤치마크는 한계가 없는 것은 아니다. 비평가들은 질문이 어렵지만 여전히 객관식이므로 모델이 제거 전략을 사용할 수 있다고 지적한다. 또한, 데이터셋은 정적이므로 모델이 데이터셋(또는 유사한 데이터)에 대해 훈련된 후에는 결과가 부풀려질 수 있다. MMMU-Pro의 제작자는 이를 인정하고 주기적으로 새로운 질문이 포함된 업데이트 버전을 출시했다.
또 다른 한계는 데이터 오염의 가능성이다. 벤치마크가 공개적으로 제공되므로 대규모 모델의 일부 훈련 데이터셋에 MMMU-Pro 질문이 포함될 수 있으며, 이는 점수를 인위적으로 높일 수 있다. 연구자들은 이 문제를 완화하기 위해 훈련 데이터에 대한 더 투명한 보고를 요구해 왔다. 이러한 우려에도 불구하고, MMMU-Pro는 생성형 AI 시스템에서 전문가 수준의 다중 모드 이해를 평가하기 위한 가장 엄격한 공개 벤치마크 중 하나로 남아 있다.
향후 방향
MMMU-Pro의 개발은 더 도전적이고 생태학적으로 타당한 벤치마크를 향한 AI 평가의 더 넓은 추세의 일부이다. 향후 버전은 객관식 형식을 넘어서는 개방형 질문, 대화형 작업 또는 실제 문제 해결 시나리오를 포함할 수 있다. 전문적 전문성에 대한 벤치마크의 강조는 오류가 심각한 결과를 초래할 수 있는 의학, 법률 및 공학과 같은 분야에서 AI의 증가하는 배치와 일치한다.
모델이 계속 개선됨에 따라 MMMU-Pro와 같은 벤치마크는 관련성을 유지하기 위해 진화해야 할 것이다. 연구 커뮤니티는 또한 모델 능력의 더 완전한 그림을 제공하기 위해 인간 평가 및 적대적 테스트와 같은 보완 평가 방법을 탐구하고 있다. MMMU-Pro는 깊이와 엄격성에 초점을 맞춘, 다중 모드 AI의 최첨단을 이해하고 발전시키기 위한 지속적인 노력에서 귀중한 도구 역할을 한다.