영어에서 번역됨

MMMU 2025.5는 대학 수준의 멀티모달 작업에서 AI 모델을 평가하기 위한 스위트인 Massive Multi-discipline Multimodal Understanding 벤치마크의 2025년 다섯 번째 업데이트입니다. 이 업데이트는 새로운 질문을 추가하고 점수 산정 방식을 조정하여 비전-언어 추론의 발전을 추적합니다.

MMMU 2025.5는 2025년에 출시된 다섯 번째 업데이트로, 인공지능 시스템을 위한 널리 사용되는 평가 제품군인 MMMU(Massive Multi-discipline Multimodal Understanding) 벤치마크의 일부입니다. 이 벤치마크는 대규모 언어 모델 및 관련 모델이 시각적 및 텍스트 이해를 모두 요구하는 다양한 학문 분야에서 대학 수준의 추론을 수행하는 능력을 평가합니다. MMMU 2025.5는 주기적인 갱신이라는 벤치마크의 전통을 이어가며, 새로운 문제 세트와 수정된 채점 절차를 도입하여 포화 효과를 완화하고 최첨단 시스템 간의 차별화를 개선합니다.

원래 MMMU 벤치마크는 2023년에 스탠퍼드 AI 연구소, 카네기 멜론 대학교, 토론토 대학교 팀을 포함한 학계 및 산업계 연구자 컨소시엄에 의해 도입되었습니다. 이 벤치마크는 예술, 공학, 의학을 포함한 30개 과목의 교과서, 강의 슬라이드, 시험지에서 추출한 질문으로 구성됩니다. 각 질문은 다이어그램, 차트, 사진과 같은 이미지를 객관식 또는 주관식 프롬프트와 통합하여 모델이 두 양식 모두에 대해 멀티 헤드 어텐션 기반 추론을 수행하도록 요구합니다. 이 벤치마크의 난이도는 도메인별 지식과 정밀한 시각적 해석을 요구한다는 점에 있으며, 이는 더 단순한 머신 러닝 벤치마크와 구별됩니다.

MMMU 2025.5는 특히 2025년에 목격된 급속한 진전을 해결합니다. 초기 2025년 버전(MMMU 2025.1~2025.4)은 선도적인 모델에게 점점 더 쉬워졌습니다. 이 업데이트는 옥스퍼드 대학교MIT CSAIL과 같은 기관의 50명의 전문 주석가 패널이 선별한 약 1,200개의 새로운 질문을 추가합니다. 이러한 질문은 다단계 추론, 반사실적 시나리오, 미세한 시각적 차이(예: 유사한 해부학적 구조 구별 또는 복잡한 회로도 해석)를 강조합니다. 이 업데이트는 또한 과신한 오답에 페널티를 부과하는 새로운 채점 기준을 도입하여 모델 출력에서 온도 스케일링의 보정을 장려합니다.

벤치마크 설계 및 업데이트

MMMU 제품군은 예술 및 디자인, 비즈니스, 과학, 건강 및 의학, 인문 및 사회 과학, 기술 및 공학의 여섯 가지 광범위한 학문 분야로 구성됩니다. 각 분야에는 여러 과목이 포함되며, 질문은 인간의 수행 능력에 따라 난이도(쉬움, 보통, 어려움)로 태그가 지정됩니다. MMMU 2025.5는 이 구조를 유지하지만 분포를 재조정합니다. 어려운 질문의 비율을 35%에서 45%로 늘려 더 쉬운 항목을 마스터한 모델에 도전할 필요성을 반영합니다. 이 업데이트는 또한 이미지가 약간 회전, 잘리거나 색상이 이동되는 새로운 "시각적 교란" 하위 집합을 도입하여 입력 변동에 대한 견고성을 테스트합니다.

MMMU 2025.5의 주요 혁신은 구글 딥마인드오픈AI 연구자들의 기여로 개발된 "적대적 협업" 질문의 포함입니다. 이러한 질문은 모호하거나 이미지에 없는 외부 지식을 요구하도록 설계되어 모델이 명확화를 요청하거나 불확실성을 명시하도록 강제합니다. 이는 생성형 AI 평가의 광범위한 추세와 일치하며, 벤치마크가 정확도뿐만 아니라 추론 투명성과 실패 모드도 점점 더 측정합니다.

평가 방법론

모델은 제로 샷 설정에서 평가되며, 이는 MMMU 질문의 사전 예시를 받지 않음을 의미합니다. 벤치마크는 이미지와 텍스트 지침을 포함하는 표준화된 프롬프트 형식을 사용하며, 모델은 최종 답변을 위해 구문 분석되는 응답을 생성해야 합니다. 객관식 질문의 경우 모델 출력이 올바른 옵션과 일치하는지 확인하고, 주관식 질문의 경우 트랜스포머 기반 임베딩을 사용한 정확한 일치와 의미적 유사성의 조합을 사용합니다. MMMU 2025.5는 또한 아마존 웹 서비스 또는 구글 클라우드 API와 같은 외부 도구를 사용하는 모델의 성능을 별도로 보고하지만, 비교 가능성을 유지하기 위해 이러한 사용은 권장되지 않습니다.

MMMU 2025.5의 채점은 "신뢰도 가중 정확도" 지표를 도입합니다. 각 질문에 대해 모델은 신뢰도 점수(0~1)를 출력해야 합니다. 최종 점수는 신뢰도로 가중된 정답의 평균이며, 높은 신뢰도의 오답에 대한 페널티가 있습니다. 이 지표는 인튜이티브 서지컬 로봇 공학 또는 웨이모 자율 주행과 같은 영역에서 실제 배포에 중요한 속성인 보정을 포착하는 것을 목표로 합니다. 과신한 실수는 비용이 많이 들 수 있기 때문입니다.

성능 추세

MMMU 2025.5 출시 시점에 앤트로픽, 오픈AI, 구글 딥마인드의 선도 모델은 MMMU 2025.1에서 약 70%에서 78-82% 범위의 정확도를 달성합니다. 그러나 새로운 신뢰도 가중 지표는 이러한 점수를 65-70%로 낮추어 많은 모델이 여전히 보정이 제대로 되지 않음을 강조합니다. 퀄컴 또는 ARM 홀딩스가 엣지 디바이스용으로 최적화한 소형 모델은 일반적으로 20-30포인트 낮은 점수를 기록하여 프런티어 시스템과 배포된 시스템 간의 격차를 강조합니다.

벤치마크는 또한 공간 추론과 도메인별 용어의 지속적인 약점을 드러냈습니다. 예를 들어, 모델은 의료 영상에서 좌우 방향을 혼동하고 유기 화학 질문에서 화학 구조를 잘못 식별하는 경우가 많습니다. 이러한 발견은 이러한 결함을 구체적으로 대상으로 하는 커리큘럼 러닝데이터 증강 기술에 대한 연구를 촉진했습니다.

영향 및 평가

MMMU 2025.5는 주요 AI 연구소에서 내부 평가 체크포인트로 채택되었습니다. 오픈AI앤트로픽은 모델 릴리스 노트에서 MMMU 점수를 공개적으로 인용했으며, 구글 딥마인드는 비전 작업을 위한 잔차 네트워크U-Net 아키텍처에 대한 훈련을 안내하는 데 벤치마크를 사용합니다. 벤치마크 업데이트는 또한 버클리 AI 연구소바바 원자력 연구소의 논문이 오류 패턴을 분석하면서 딥 러닝 모델의 일반화를 연구하는 학술 연구자들에 의해 사용됩니다.

비평가들은 MMMU가 영어 중심의 서구 중심 교육 자료에 의존하여 문화적 편향을 도입할 수 있다고 지적했으며, 이는 알리바바 다먀오 아카데미NEC 연구자들이 제기한 우려입니다. 이에 대응하여 MMMU 팀은 2025년 말에 다국어 확장 계획을 발표했지만 세부 사항은 아직 확인되지 않았습니다. 이러한 한계에도 불구하고 MMMU 2025.5는 전략적 사고를 위한 체스 컴퓨터 평가와 같은 다른 벤치마크를 보완하는 다중 양식 추론의 표준 참고 자료로 남아 있습니다.

향후 방향

스탠퍼드 AI 연구소토론토 대학교의 수석 연구원이 이끄는 MMMU 팀은 2026년을 위한 로드맵을 제시했습니다. 계획된 업데이트에는 생성형 AI 모델을 사용한 동적 질문 생성(평가 실행마다 고유한 질문 생성)과 비디오 기반 작업 통합이 포함됩니다. 팀은 또한 노키아 벨 연구소제록스 팔로알토 연구소와의 파트너십을 탐색하여 품질 관리 및 원격 감지와 같은 산업 환경에서 다중 양식 시스템을 위한 벤치마크를 개발하고 있습니다.

인공지능 시스템이 더욱 강력해짐에 따라 MMMU 2025.5와 같은 벤치마크는 진전이 측정 가능하고 의미 있도록 보장하는 데 중요한 역할을 합니다. 업데이트의 보정 및 견고성 강조는 원시 정확도를 넘어 모델 동작에 대한 더 미묘한 평가로 이동하는 분야의 성숙을 반영합니다. 실무자에게 MMMU 2025.5는 모델 비교 및 개발 우선 순위를 안내하기 위한 엄격한 테스트베드를 제공합니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:benchmark·multimodal·evaluation·artificial-intelligence
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사