BBH 2025는 대규모 언어 모델(LLM)의 추론 능력을 평가하도록 설계된 벤치마크 모음인 BIG-Bench Hard(BBH)의 최신 버전이다. 이 벤치마크는 모델에게는 어렵지만 인간에게는 비교적 쉬운 작업에 초점을 맞춘다. 2022년에 더 광범위한 BIG-Bench 노력의 하위 집합으로 처음 소개된 BBH는 표준 언어 모델이 평균 인간 평가자 수준 이하로 수행했기 때문에 선택된 23개의 작업으로 구성된다. 2025년 판은 업데이트된 지침, 답변 형식 및 평가 절차로 원래 벤치마크를 개선하여 대규모 언어 모델의 현재 상태를 더 잘 반영하고 채점의 잠재적 편향을 줄인다.
이 벤치마크는 단순한 사실 회상이 아닌 다단계 추론, 상식 이해 및 기호 조작이 필요한 작업에 중점을 둔다. 예로는 "navigate"(공간 지침 따르기), "word sorting"(주어진 기준에 따라 단어 정렬), "causal judgment"(인과 관계 식별)와 같은 작업이 포함된다. BBH 2025는 원래와 동일한 핵심 작업 세트를 유지하지만 더 명확한 프롬프트와 더 강력한 채점 방법을 도입하여 다양한 아키텍처와 훈련 체계에서 모델 성능을 비교하는 더 신뢰할 수 있는 도구가 된다.
목적 및 설계
BBH 2025는 현재 AI 시스템, 특히 현대 LLM에 사용되는 트랜스포머 및 기타 신경망 아키텍처의 한계를 탐구하도록 설계되었다. 작업은 단순한 패턴 매칭의 범위를 넘어서도록 의도적으로 선택되었으며, 모델이 새로운 맥락에서 논리적 추론, 산술 연산 및 언어 이해를 수행하도록 요구한다. 벤치마크의 난이도는 최첨단 모델조차도 측정 가능한 격차를 보여주도록 보장하여 새로운 훈련 기술이나 모델 아키텍처를 개발하는 연구자에게 유용한 신호를 제공한다.
수백 개의 작업을 포함한 원래 BIG-Bench 프로젝트는 여러 기관의 연구자들이 참여한 협력적 노력이었다. BBH는 당시 최고 모델의 성능을 인간 성능이 능가하는 작업을 선택하여 만들어졌으며, 벤치마크가 수년 동안 도전적으로 유지되도록 보장했다. 2025년 업데이트는 연구 커뮤니티의 피드백을 반영하고 2022년 이후 크게 개선된 GPT-4 및 Claude와 같은 모델 평가에서 얻은 교훈을 통합한다.
평가 방법론
BBH 2025는 표준화된 평가 프로토콜을 사용한다. 각 작업에는 객관식 또는 자유 형식 질문 세트가 포함되며, 모델은 정확한 일치 또는 추론 단계에 대한 부분 점수로 채점된다. 2025년 버전은 각 작업에 대한 더 자세한 지침을 도입하여 잘못된 실패로 이어질 수 있는 모호성을 줄인다. 또한 채점은 이제 모델 신뢰도를 고려하고 작업별 분석을 제공하여 연구자가 특정 강점과 약점을 식별할 수 있게 한다.
공정성을 보장하기 위해 벤치마크는 모델에 구애받지 않도록 설계되어 특정 아키텍처나 훈련 접근 방식을 선호하지 않는다. 이는 주요 개발자의 모델(OpenAI, Anthropic, Google DeepMind)과 오픈 소스 모델을 평가하는 데 사용되었다. BBH 2025의 결과는 종종 MMLU 및 GSM8K와 같은 다른 벤치마크와 함께 보고되어 모델 능력에 대한 포괄적인 관점을 제공한다.
다른 벤치마크와의 관계
BBH 2025는 인공 지능 분야의 다른 평가 모음을 보완한다. MMLU와 같은 벤치마크가 여러 주제에 걸친 광범위한 지식에 초점을 맞추는 반면, BBH는 제약 조건 하의 추론과 문제 해결을 강조한다. 이는 특히 복잡한 작업에서의 성능이 규모에 따라 불균형적으로 향상되는 대규모 모델의 "창발적 능력"을 평가하는 데 유용하다. 이 벤치마크는 또한 추론을 강화하도록 설계된 사고 사슬 프롬프팅 및 AI 피드백 기반 강화 학습과 같은 기술에 대한 스트레스 테스트 역할을 한다.
이전 버전과 비교하여 BBH 2025는 업데이트된 답안 키를 포함하고 경계 사례를 명확히 하여 모델이 평가를 이용할 위험을 줄인다. 또한 개발자가 결과를 제출할 수 있는 공개 리더보드를 제공하여 투명성과 경쟁을 촉진한다. 이는 컴퓨터 비전에서 ImageNet이 했던 것과 유사하게 학술 연구와 산업 개발의 표준 참조 지점이 된다.
한계 및 비판
유용성에도 불구하고 BBH 2025에는 한계가 있다. 일부 비평가들은 작업이 도전적이지만 개방형 질문과 불완전한 정보를 포함하는 경우가 많은 실제 세계 추론을 완전히 포착하지 못할 수 있다고 주장한다. 벤치마크의 객관식 형식은 답변 옵션의 통계적 규칙성을 이용하는 모델에 의해 이용될 수도 있다. 또한 모델이 개선됨에 따라 벤치마크가 포화 상태에 도달할 수 있어 주기적인 업데이트나 새로운 작업 생성이 필요할 수 있다.
또 다른 우려는 BBH 2025가 많은 벤치마크와 마찬가지로 언어 작업의 문화적 가정과 같은 구성의 편향을 의도치 않게 반영할 수 있다는 점이다. 연구자들은 더 다양한 작업 세트와 모델 점수를 맥락화하기 위한 인간 성능 기준선 포함을 요구해 왔다. 2025년 업데이트는 더 자세한 작업 설명을 제공하고 인간 평가를 장려하여 이러한 문제 중 일부를 해결하려고 시도하지만 이러한 노력은 진행 중이다.
향후 방향
BBH 2025의 개발은 AI에서 더 엄격하고 역동적인 평가를 향한 더 넓은 추세의 일부이다. 향후 버전은 모델 성능에 따라 작업이 생성되는 적응형 테스트를 통합하거나 외부 도구와의 상호 작용이 필요한 작업을 포함할 수 있다. 벤치마크 유지 관리자는 또한 생성형 AI 시스템의 성장하는 능력을 반영하여 텍스트와 이미지를 모두 포함하는 다중 모드 작업으로 범위를 확장하는 데 관심을 표명했다.
기계 학습이 계속 발전함에 따라 BBH 2025와 같은 벤치마크는 관련성을 유지하기 위해 진화해야 할 것이다. 2025년 판은 평가가 도전적이고 공정하도록 보장하는 진전을 나타내며, 더 일반적인 인공 지능으로의 진전을 측정하기 위한 기반을 제공한다. 연구자와 개발자는 커뮤니티 피드백과 새로운 작업 제안을 통해 개선에 기여하면서 BBH 2025를 표준 도구로 사용하는 것이 좋다.