영어에서 번역됨

MATH 2025는 2025년에 도입된 5,000개의 경쟁 수준 수학 문제로 구성된 벤치마크 데이터셋으로, 대규모 언어 모델의 추론 능력을 평가하기 위해 설계되었으며, 비공개 테스트 세트와 분기별 리더보드를 포함합니다.

MATH 2025는 대규모 언어 모델(LLM)의 수학적 추론 능력을 평가하기 위해 설계된 벤치마크 데이터셋이다. 2025년에 공개되었으며, 대수학, 기하학, 정수론, 조합론, 미적분학을 아우르는 5,000개의 경쟁형 문제로 구성된다. 초기 벤치마크와 달리 MATH 2025는 공개적으로 접근할 수 없는 숨겨진 테스트 세트를 포함하여 과적합을 줄이고 일반화에 대한 더 견고한 측정을 제공하는 것을 목표로 한다. 이 벤치마크는 학계 및 산업계 연구자 컨소시엄이 유지 관리하며, AI 추론의 진행 상황을 추적하기 위해 분기별로 업데이트되는 리더보드를 제공한다.

이 데이터셋은 12,500개의 문제를 가진 원래 MATH 벤치마크(2021)의 후속 버전으로 2025년 초에 도입되었다. MATH 2025는 더 작지만 더 도전적인 문제 세트에 초점을 맞추며, 최근 올림피아드 스타일 대회와 참여 기관의 새로운 기여에서 문제를 가져온다. 각 문제는 단계별 해결책과 함께 제공되어 상세한 오류 분석을 가능하게 한다. 숨겨진 테스트 세트는 API를 통해 제어되어 직접 접근을 방지하고 공정한 평가를 장려한다. 모델은 정확한 일치 정확도로 점수가 매겨지며, 올바른 중간 단계에 대해 부분 점수가 부여된다.

문제 구성 및 난이도

MATH 2025는 대수학, 기하학, 정수론, 조합론, 미적분학의 각 주제 영역당 1,000개의 문제를 포함한다. 난이도는 고등학교 올림피아드 수준부터 학부 수준까지 다양하며, 평균 문제는 여러 추론 단계를 요구한다. 예를 들어, 샘플 대수학 문제는 "방정식 x^5 - 5x^3 + 4x = 0의 모든 실근의 합을 구하시오"라고 묻는다. 기하학 문제는 순환 사변형 속성을 증명하는 것을 포함한다. 문제는 모호함이 없도록 설계되었으며, 고유한 숫자 또는 짧은 형식의 답을 가진다.

평가 방법론

모델은 API를 통해 평가되며, 정확한 답 일치에 기반한 점수를 반환한다. 리더보드는 분기별(3월, 6월, 9월, 12월)로 업데이트되며, 전체 정확도로 제출물을 순위를 매긴다. 첫 분기 기준으로 최고 성능 모델은 72% 정확도를 달성했으며, 인간 전문가 기준선은 약 85%를 기록했다. 이 벤치마크는 또한 주제별 세부 분석을 보고하며, 기하학이 가장 어려운 범주로 남아 평균 정확도가 대수학보다 15% 낮다는 것을 밝혀낸다. 데이터 오염을 방지하기 위해 테스트 세트는 6개월마다 회전되며, 진행 중인 대회에서 새로운 문제가 추가된다.

AI 연구에 미치는 영향

MATH 2025는 대규모 언어 모델의 추론을 평가하기 위한 표준 참조가 되었다. 이는 현재 접근 방식의 한계, 특히 다단계 추론과 기호 조작에서의 한계를 강조했다. 여러 OpenAIGoogle DeepMind 모델은 이 벤치마크를 사용하여 훈련을 안내했으며, 커리큘럼 학습RLHF와 같은 기술을 통합하여 성능을 개선했다. 이 벤치마크는 또한 복잡한 문제에서 정확도를 크게 향상시키는 사고 사슬 프롬프팅 연구를 촉진했다.

관련 벤치마크 및 향후 방향

원래 MATH 2021 벤치마크는 여전히 널리 사용되지만, MATH 2025는 더 엄격한 테스트를 제공한다. 다른 관련 평가에는 초등학교 수학을 위한 GSM8K와 경쟁 문제를 위한 Hendrycks Math가 포함된다. MATH 2025의 향후 버전은 더 개방형 문제와 자동 증명 검증을 포함할 계획이다. 이 벤치마크 뒤에 있는 컨소시엄은 MIT CSAILStanford AI Lab의 연구자를 포함하며, 2026년까지 데이터셋을 10,000개의 문제로 확장하고 학제 간 추론에 더 중점을 두는 것을 목표로 한다.

논란 및 한계

일부 연구자들은 숨겨진 테스트 세트가 불투명하여 모델 오류를 진단하기 어렵다고 비판했다. 다른 이들은 이 벤치마크가 간접 노출을 통한 데이터 누출에 여전히 취약할 수 있다고 지적한다. API 제어 접근은 또한 모든 연구자가 반복 평가를 감당할 수 없기 때문에 재현성에 대한 우려를 제기한다. 이러한 문제에도 불구하고 MATH 2025는 AI 평가에서 중요한 진전으로 널리 간주되며, 수학적 지능에 대한 도전적이고 역동적인 테스트를 제공한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·machine-learning·benchmark·mathematics
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사