영어에서 번역됨

MMMU 2025.10은 다중 모드 AI 평가 제품군인 MMMU 벤치마크의 2025년 10번째 업데이트입니다. 이 업데이트는 비전-언어 모델을 테스트하기 위한 새로운 작업과 데이터를 추가합니다.

MMMU 2025.10은 2025년에 출시된 MMMU(대규모 다분야 멀티모달 이해) 벤치마크의 열 번째 정기 업데이트입니다. MMMU는 시각 및 텍스트 정보를 모두 처리하는 Artificial intelligence 시스템, 예를 들어 비전 기능을 갖춘 Large language model을 평가하는 데 널리 사용되는 평가 도구입니다. 2025.10 버전은 Machine learningDeep learning 모델의 발전을 추적하기 위해 새로운 질문과 과제를 추가하는 벤치마크의 전통을 이어갑니다.

이 업데이트는 2025년 초에 시작된 월간 릴리스 패턴에 따라 2025년 10월에 도입되었습니다. 2025년 시리즈의 각 업데이트는 OpenAI, Anthropic, Google DeepMind와 같은 조직의 멀티모달 모델의 급속한 진화에 맞춰 벤치마크를 최신 상태로 유지하는 것을 목표로 했습니다. 2025.10 판은 특히 차트와 다이어그램을 사용한 복잡한 추론 및 비디오 프레임 이해와 같이 초기 2025 버전에서 공백을 보였던 영역의 범위를 확장하는 데 중점을 둡니다.

벤치마크 구조

MMMU 2025.10은 원래 MMMU 벤치마크의 핵심 구조를 유지하며, 여러 학문 분야에 걸쳐 질문을 구성합니다. 여기에는 예술, 비즈니스, 과학, 공학 및 인문학이 포함됩니다. 각 질문은 사진, 차트 또는 회로도와 같은 이미지를 객관식 질문과 짝지어 제시합니다. 2025.10 업데이트는 약 1,500개의 새로운 질문을 추가하여 총 12,000개 이상으로 늘렸습니다. 새로운 항목은 모델이 시각적 단서와 도메인 지식을 결합하여 정답에 도달해야 하는 다단계 추론을 강조합니다.

이 벤치마크는 가장 고급 Neural network 시스템에도 도전적이도록 설계되었습니다. 더 단순한 시각 질문 응답 과제와 달리 MMMU 질문은 종종 대학 수준의 전문 지식을 요구합니다. 예를 들어, 회로도를 보여주고 전기적 특성에 대해 묻거나, 역사적 그림을 표시하고 문화적 맥락에 대해 질문할 수 있습니다.

채점 및 평가

모델은 정확히 답변한 질문의 백분율로 측정되는 정확도로 평가됩니다. 2025.10 업데이트는 올바른 답변을 제공하지만 잘못된 추론을 제공하는 모델에 패널티를 부과하는 더 엄격한 평가 프로토콜을 도입했습니다. 이 변경은 일부 모델이 진정한 이해 없이 정확히 추측하고 있다는 우려에 대응하여 이루어졌습니다. 평가에는 단일 정답이 없는 질문의 하위 집합도 포함되어 모델의 불확실성 인정 능력을 테스트합니다.

2025.10 결과에 따르면 OpenAI, Anthropic, Google DeepMind의 주요 모델은 2025년 초의 중반 60%대에서 상승하여 높은 70%대에서 낮은 80%대의 정확도 점수를 달성했습니다. Alibaba DAMO Academy와 같은 더 작은 오픈 소스 모델은 일반적으로 50%대에서 60%대를 기록하여 최첨단 모델과 접근 가능한 모델 간의 격차를 강조했습니다.

모델 개발에 미치는 영향

2025.10 업데이트는 개발자가 멀티모달 시스템을 훈련하고 개선하는 방식에 영향을 미쳤습니다. 많은 팀이 Artificial intelligence 추론 테스트와 같은 다른 평가와 함께 개발 중에 MMMU를 핵심 벤치마크로 사용합니다. 새로운 추론 중심 질문은 연구자들이 Chain-of-thought 프롬프팅 및 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습)와 같은 기술을 개선하도록 추진했습니다.

여러 Transformer (architecture) 기반 아키텍처가 MMMU에서 좋은 성능을 내도록 특별히 조정되었습니다. 예를 들어, OpenAI의 GPT-5 비전 모델과 Anthropic의 Claude 4.5는 모두 MMMU 2025.10 결과를 사용하여 사후 훈련 조정을 안내했다고 보고했습니다. 이 벤치마크는 또한 MIT CSAILStanford AI Lab과 같은 학술 연구소에서 Curriculum LearningData Augmentation 전략을 포함한 새로운 훈련 방법을 비교하는 데 사용되었습니다.

비판 및 한계

인기에도 불구하고 MMMU 2025.10은 비판에 직면했습니다. 일부 연구자는 벤치마크의 객관식 형식이 모델이 개방형 응답을 생성해야 하는 실제 사용을 반영하지 않는다고 주장합니다. 다른 사람들은 질문 은행이 시간이 지남에 따라 암기되어 점수가 부풀려질 수 있다고 지적합니다. 2025.10 업데이트는 오래된 질문을 교체하고 동적 평가 모드를 도입하여 이를 완화하려고 시도했지만 우려는 지속됩니다.

또한 벤치마크가 영어 콘텐츠와 서양 학술 커리큘럼에 크게 의존하는 것은 한계로 지적되었습니다. 다국어 및 문화적으로 다양한 질문을 추가하려는 노력은 느리게 진행되어 2025.10 버전은 소수의 비영어 항목만 추가했습니다. 이로 인해 Bhabha Atomic Research CentreSamsung Research를 포함한 일부 조직은 지역적 요구에 맞춘 자체 내부 평가를 개발하게 되었습니다.

향후 방향

MMMU 팀은 2025.11 업데이트 계획을 발표했으며, 이는 대화형 및 다중 턴 추론 과제에 초점을 맞출 것입니다. 이를 위해서는 모델이 명확한 질문을 하거나 추가 이미지를 요청해야 하며, 정적 질문-답변 쌍을 넘어서야 합니다. 팀은 또한 AMDQualcomm과 같은 산업 그룹과의 파트너십을 탐색하여 계산 제약이 더 엄격한 엣지 장치에 맞게 벤치마크를 최적화하고 있습니다.

2025년 말 현재 MMMU는 멀티모달 Machine learning 분야에서 가장 많이 인용된 벤치마크 중 하나로 남아 있습니다. 지속적인 진화는 Generative AI 시스템의 더 엄격하고 현실적인 평가를 향한 광범위한 추세를 반영합니다. 표준으로 남을지 여부는 두고 봐야 하지만 모델 개발에 미치는 영향은 부인할 수 없습니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:benchmark·multimodal·evaluation·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사