MMLU 벤치마크(Massive Multitask Language Understanding)는 대규모 언어 모델의 능력을 평가하기 위해 널리 사용되는 평가 도구이다. 2020년 9월 7일 Dan Hendrycks와 연구팀이 공개했으며, 모델들이 더 간단한 테스트에서 인간을 능가하기 시작하면서 GLUE와 같은 초기 벤치마크보다 더 어려운 평가 도구로 설계되었다. MMLU는 STEM 분야, 국제법, 영양학, 종교에 이르기까지 57개 과목에 걸친 15,908개의 객관식 질문으로 구성된다. 이 중 1,540개의 질문은 온도, 배치 크기, 학습률과 같은 최적의 모델 설정을 선택하기 위해 예약되어 있다. 2024년 7월까지 이 벤치마크는 1억 회 이상 다운로드되어 인공지능 커뮤니티에서 모델 성능을 비교하는 가장 일반적인 도구 중 하나가 되었다.
MMLU가 도입되었을 당시, 대부분의 기존 모델은 무작위 추측 수준(25%)에 가까운 점수를 기록했으며, 최고 성능 모델인 GPT-3 175B는 43.9%의 정확도를 달성했다. 제작자들은 인간 전문가가 약 89.8%의 정확도를 달성할 것으로 추정했다. 2024년 중반까지 Claude 3.5 Sonnet, GPT-4o, Llama 3.1 405B와 같은 선도 모델들은 일관되게 약 88%의 정확도에 도달했다. 그러나 2025년 현재, MMLU는 모델 능력의 급속한 발전을 반영하여 더 어려운 대안들로 부분적으로 대체되고 있다.
구조 및 내용
이 벤치마크는 추상 대수학, 국제법, 전문 의학 등 다양한 과목을 포함한다. 각 질문은 네 가지 선택지가 있는 객관식 문항이며, 모델은 모든 과목에 걸친 정확도로 평가된다. 주제의 다양성은 사실적 지식뿐만 아니라 추론 능력과 교차 도메인 이해력을 테스트하기 위한 것이다. 1,540개 질문으로 구성된 개발 세트는 하이퍼파라미터를 조정하는 데 사용되어 모델 간 공정한 비교를 보장한다.
MMLU는 원래 벤치마크의 일부 한계를 해결하거나 더 도전적인 평가를 제공하는 것을 목표로 하는 MMLU-Pro, MMMLU, MMLU-Redux와 같은 여러 파생 벤치마크와 변형을 탄생시켰다. 이러한 파생물들은 머신러닝 연구에서 모델 평가의 지속적인 발전에 기여했다.
한계 및 비판
널리 사용됨에도 불구하고 MMLU는 상당한 비판에 직면했다. 2024년 6월 5일, 전문가들은 5,700개 질문에 대한 수동 분석을 상세히 설명하는 논문을 발표하여 상당수의 정답 오류를 밝혀냈다. 예를 들어, "바이러스학" 하위 집합의 질문 중 57%에서 오류가 발견되었으며, 여기에는 복수의 정답(4%), 불명확한 질문(14%), 또는 완전히 틀린 답변(33%)이 포함되었다. 전반적으로 이 분석은 MMLU 질문의 6.5%에 오류가 포함되어 있어 달성 가능한 최대 점수가 100%보다 훨씬 낮을 것이라고 추정했다.
데이터 오염 또한 벤치마크의 타당성에 심각한 위협이 되었다. 기업들은 의도치 않게 또는 의도적으로 MMLU 질문과 답변을 모델의 훈련 데이터에 포함시킬 수 있으며, 이는 벤치마크를 일반화 능력의 척도로서 사실상 무용지물로 만들 수 있다. 이 문제는 모델이 벤치마크 질문을 포함할 수 있는 방대한 인터넷 말뭉치로 훈련되는 경우가 많은 생성형 AI 평가 분야에서 흔한 문제이다.
예시 질문
다음 예시는 "추상 대수학", "국제법", "전문 의학" 작업에서 가져온 MMLU의 질문 유형을 보여준다. 정답은 굵은 글씨로 표시되어 있다.
질문 1 (추상 대수학):
\( \mathbb{Z}_3[x]/(x^2 + c) \)가 체(field)가 되도록 하는 모든 \( c \)를 \( \mathbb{Z}_3 \)에서 찾으시오.
(A) 0 (B) 1 (C) 2 (D) 3
질문 2 (국제법):
시민적 및 정치적 권리에 관한 국제규약(ICCPR)의 고문 정의에 대한 유보가 현대 관행에서 허용 가능한가?
(A) 유보국 법률이 다른 정의를 사용하는 경우 이는 허용 가능한 유보이다.
(B) 이는 ICCPR의 목적과 취지에 위배되므로 허용 불가능한 유보이다.
(C) ICCPR의 고문 정의가 국제관습법과 일치하므로 이는 허용 불가능한 유보이다.
(D) 일반 국제법상 국가는 조약에 유보를 할 권리가 있으므로 이는 허용 가능한 유보이다.
질문 3 (전문 의학):
33세 남성이 갑상선암으로 근치적 갑상선 절제술을 받는다. 수술 중 중등도의 출혈로 목 왼쪽의 여러 혈관 결찰이 필요하다. 수술 후 혈청 검사에서 칼슘 농도 7.5 mg/dL, 알부민 농도 4 g/dL, 부갑상선 호르몬 농도 200 pg/mL를 보인다. 이 환자의 소견을 유발한 혈관 손상은 다음 중 어느 것인가?
(A) 늑경동맥간(costocervical trunk)의 가지.
(B) 외경동맥의 가지.
(C) 갑상경동맥간(thyrocervical trunk)의 가지.
(D) 내경정맥의 지류.
영향 및 미래
MMLU는 대규모 언어 모델의 발전을 추적하는 데 중요한 역할을 했으며, OpenAI, Anthropic, Google DeepMind를 포함한 연구소와 기업에서 널리 채택되었다. 그 영향력은 다른 벤치마크와 평가 방법론으로 확장되어, 해당 분야를 더욱 견고하고 도전적인 테스트로 이끌었다. 그러나 확인된 오류와 오염 문제로 인해 이러한 문제에 더 강한 새로운 벤치마크로 점진적으로 전환되고 있다. 2025년 현재, MMLU는 역사적 참고 자료로 남아 있지만 최첨단 모델 비교에서의 역할은 줄어들고 있다.