인류의 마지막 시험

영어에서 번역됨

휴먼리티의 마지막 시험(Humanity's Last Exam)은 최첨단 AI 시스템을 평가하기 위한 벤치마크로, 현재 모델의 능력을 넘어서는 지식과 추론을 테스트하도록 설계된 전문가 수준의 질문들을 포함한다. 이는 전문가 수준의 인공지능으로의 진전을 측정하는 것을 목표로 한다.

Humanity's Last Exam은 고급 인공지능 시스템의 능력을 평가하기 위해 설계된 벤치마크 데이터셋이다. 이 데이터셋은 다양한 학문 분야의 전문가들이 작성한, 매우 도전적인 질문들로 구성된 선별된 집합으로, 현재의 대규모 언어 모델 및 관련 기술의 한계를 탐구하기 위한 것이다. 이 벤치마크는 특히 모델이 기존 평가 스위트에서 인간의 성능에 근접하거나 이를 능가함에 따라, AI 발전에 대한 엄격하고 미래 지향적인 척도를 제공하기 위해 만들어졌다.

이 프로젝트는 OpenAI 및 기타 주요 기관을 포함한 선도적인 AI 조직의 연구자와 실무자들이 참여한 협력적 노력으로 구상되었다. 2025년 초에 공개적으로 출시되었으며, AI 시스템의 전문가 수준 지식과 추론을 평가하는 새로운 표준을 확립하는 것을 목표로 했다. 벤치마크의 이름은 적어도 현재 세대의 모델에 대해 AI의 지적 능력에 대한 최종적이고 포괄적인 시험을 대표하려는 야망을 반영한다.

설계 및 구조

이 벤치마크는 각각 주제 전문가가 작성한 수천 개의 객관식 및 단답형 질문으로 구성된다. 질문은 수학, 물리학, 화학, 생물학, 컴퓨터 과학, 역사, 법학, 인문학을 포함한 광범위한 분야에 걸쳐 있다. 핵심 설계 원칙은 질문이 매우 유능한 AI 시스템에게도 어려워야 하지만, 정답이 검증 가능하고 모호하지 않아야 한다는 것이다. 품질을 보장하기 위해 제출된 각 질문은 엄격한 검토 과정을 거치며, 기존 모델이 풀 수 있는 질문은 일반적으로 거부된다.

데이터셋은 공개 테스트 세트와 비공개 유지 세트로 나뉜다. 비공개 세트는 과적합과 데이터 오염을 방지하기 위해 공식 평가에 사용된다. 공개 세트는 연구자와 개발자가 자체 시스템을 벤치마킹할 수 있게 하며, 비공개 세트는 일반화 가능한 능력에 대한 더 신뢰할 수 있는 척도를 제공한다. 벤치마크 제작자들은 또한 모델이 테스트 데이터에 대해 훈련되는 것을 방지하기 위한 엄격한 프로토콜을 구현했는데, 여기에는 암기 모니터링과 모든 질문이 출시 전에 공개적으로 이용 가능하지 않은 새로운 것이어야 한다는 요구 사항이 포함된다.

주요 참여자 및 기여자

이 이니셔티브는 AI 안전 및 평가 작업으로 알려진 Jacob Steinhardt와 David Kaplan을 포함한 연구자 팀이 주도했다. 그들은 Anthropic, Google DeepMind 및 기타 주요 AI 연구소의 기여자들과 MIT CSAIL, Stanford AI Lab, BAIR (Berkeley AI Research)와 같은 기관의 학자들이 합류했다. 이 노력은 또한 전 세계의 독립 연구자와 도메인 전문가들의 전문성을 활용했으며, 이들은 각자의 분야에서 질문을 제출했다.

프로젝트의 협력적 성격은 질문 유형과 주제 범위의 다양성을 보장하기 위한 의도적인 선택이었다. 조직자들은 공개적인 질문 요청을 통해 기여를 모집했으며, 수천 명의 전문가로부터 제출을 받았다. 각 제출물은 정확성, 난이도, 적합성을 검증하기 위해 여러 독립 평가자에 의해 검토되었다. 이 과정은 범위가 넓고 품질이 높은 최종 데이터셋을 만들어냈다.

현재 AI 시스템의 성능

벤치마크의 초기 결과는 Large language model 아키텍처를 기반으로 한 것을 포함한 가장 고급 AI 시스템조차도 인간 전문가 수준보다 훨씬 낮은 점수를 기록했음을 드러냈다. OpenAI와 Google DeepMind가 개발한 것과 같은 최고 성능 모델은 테스트 세트에서 한 자릿수에서 낮은 십 대의 정확도 비율을 달성했다. 이는 이전 벤치마크에서 종종 90% 이상의 정확도를 초과했던 성능과 극명한 대조를 이루었다.

낮은 점수는 추론, 다단계 문제 해결, 깊은 도메인 지식을 구체적으로 겨냥하는 벤치마크의 설계에 기인했다. 많은 질문은 여러 출처의 정보를 결합하거나 추상적 개념을 새로운 방식으로 적용해야 하며, 이는 현재 Machine learning 접근 방식에 여전히 도전적인 작업이다. 결과는 특히 미묘한 판단이나 창의적 종합이 필요한 영역에서 AI 능력과 전문가 인간 성능 사이의 상당한 격차를 강조했다.

영향 및 반응

Humanity's Last Exam의 출시는 AI 연구 커뮤니티와 그 너머에서 상당한 논의를 불러일으켰다. 지지자들은 이 벤치마크가 쉽게 게임화되지 않는 높은 기준을 설정함으로써 인공 일반 지능으로의 진전을 추적하는 귀중한 도구를 제공한다고 주장했다. 그러나 비판자들은 벤치마크가 아무리 잘 설계되었더라도 모델이 개선됨에 따라 구식이 될 수 있으며, 그러한 테스트에서의 성능이 반드시 실제 세계의 능력으로 이어지지는 않는다고 지적했다.

이러한 논쟁에도 불구하고, 이 벤치마크는 프론티어 모델을 평가하기 위한 기준점으로 널리 채택되었다. 여러 AI 회사가 공개 테스트 세트에서의 점수를 보고했으며, 벤치마크는 수많은 연구 논문에서 인용되었다. 또한 AI가 달성할 수 있는 경계를 계속 넓히면서 더 도전적인 유사한 평가 스위트의 개발을 촉진했다. 2025년 초 현재, 어떤 모델도 벤치마크 통과에 근접하지 못했으며, 그 이름은 진정으로 지능적인 기계를 만드는 지속적인 도전에 대한 증거로 남아 있다.

향후 방향

Humanity's Last Exam의 제작자들은 벤치마크를 주기적으로 업데이트하고, 새로운 질문을 추가하며, 너무 쉬워진 질문을 폐기할 계획을 밝혔다. 이 반복적 접근 방식은 AI 능력이 진화함에 따라 관련성을 유지하기 위한 것이다. 또한 벤치마크를 더 큰 규모로 확장하는 데 도움이 될 수 있는 자동 질문 생성에 대한 연구도 진행 중이다. 궁극적인 목표는 전문가 수준의 이해를 향한 AI의 진전에 대한 지속적이고 엄격한 척도를 제공하는 것이며, 이 목표는 Generative AI 및 관련 분야의 발전을 계속 형성하고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:ai-benchmark·evaluation·artificial-intelligence·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사