BIG-Bench Hard (BBH)는 2022년 Google 및 다른 기관의 연구자들이 도입한 더 큰 BIG-Bench 벤치마크에서 선별된 23개 작업의 하위 집합입니다. 이 하위 집합은 대규모 언어 모델에게 특히 도전적인 작업, 특히 120억 개 미만의 매개변수를 가진 모델이 성능이 낮은 작업에 초점을 맞추기 위해 만들어졌습니다. BBH는 복잡한 추론, 다단계 문제 해결, 그리고 단순한 패턴 매칭을 넘어선 더 깊은 이해를 요구하는 작업을 처리하는 모델의 능력을 측정하도록 설계되었습니다.
이 벤치마크는 130개 기관의 450명 이상의 연구자가 기여한 200개 이상의 작업을 포함한 더 광범위한 BIG-Bench 노력에서 비롯되었습니다. BBH의 선택 과정은 작은 모델과 큰 모델 간의 성능 격차가 크고, 인간 평가자가 상당한 추론을 요구한다고 평가한 작업을 식별하는 것을 포함했습니다. 최종 23개 작업 세트에는 불리언 표현, 인과 판단, 날짜 이해, 모호성 해소, 기하학적 모양 등의 영역의 문제가 포함됩니다.
작업 선택 및 특성
BBH의 23개 작업은 두 가지 주요 기준에 따라 선택되었습니다: 당시 최고의 모델이 특정 임계값(특히 평균 인간 평가자 성능 미만) 아래로 점수를 받은 작업이어야 했고, 단순한 휴리스틱으로 쉽게 해결할 수 없는 작업이어야 했습니다. 이 선택 과정은 BBH만으로 평가할 때 평균 모델 성능이 크게 떨어지는, 전체 BIG-Bench 제품군보다 현저히 더 어려운 벤치마크를 만들었습니다.
BBH의 각 작업은 특정 인지 능력을 테스트하도록 설계되었습니다. 예를 들어, '불리언 표현' 작업은 복잡한 논리적 진술을 평가하는 것을 요구하며, '인과 판단'은 가상 시나리오에서 원인과 결과 관계를 결정하도록 모델에 요청합니다. 다른 작업에는 '하이퍼바톤'(문법적으로 올바른 문장 식별), '논리적 추론'(다단계 논리 퍼즐 해결), '단어 정렬'(제약 조건 하에서 알파벳순으로 단어 배열)이 포함됩니다.
평가 방법론
BBH는 일반적으로 모델이 새 문제를 해결하도록 요청받기 전에 소수의 예제(보통 3~5개)가 제공되는 few-shot 프롬프팅 접근 방식을 사용하여 평가됩니다. 벤치마크에는 테스트 과정을 표준화하는 특정 프롬프트 세트와 평가 스크립트가 포함됩니다. 원래 논문에서 저자들은 Google 및 OpenAI의 모델을 포함한 여러 대규모 언어 모델을 평가했으며, 가장 큰 모델조차도 많은 작업에서 어려움을 겪는다는 것을 발견했습니다.
주목할 만한 발견 중 하나는 모델이 추론 단계를 보여주도록 장려하는 chain-of-thought 프롬프팅을 사용하면 BBH 작업에서 성능이 크게 향상된다는 것이었습니다. BBH와 동시에 개발된 이 기술은 모델이 복잡한 문제를 더 작고 관리 가능한 단계로 분해할 수 있게 했습니다. BBH와 chain-of-thought 프롬프팅의 조합은 이후 모델의 추론 능력을 평가하는 표준 평가 방법이 되었습니다.
영향 및 사용
BBH는 Large language model 연구 커뮤니티에서 널리 사용되는 벤치마크가 되었습니다. 이는 새로운 모델이나 훈련 기술을 소개하는 논문에서 자주 인용되며, 단순한 언어 이해를 넘어선 모델의 추론 능력을 측정하는 지표로 사용됩니다. 이 벤치마크는 모델 개발 진행 상황을 추적하는 데 특히 유용했으며, BBH 점수의 개선은 종종 다른 추론 중심 작업의 개선과 상관관계가 있습니다.
OpenAI 및 Google DeepMind를 포함한 여러 주요 AI 연구 기관은 내부 평가 제품군의 일부로 BBH를 사용했습니다. 이 벤치마크는 또한 모델 능력의 포괄적인 관점을 제공하기 위해 여러 벤치마크를 집계하는 HELM(언어 모델의 전체적 평가) 프로젝트와 같은 더 넓은 평가 프레임워크에 통합되었습니다. 2025년 현재 BBH는 다양한 모델 아키텍처와 크기 간의 추론 성능을 비교하는 표준 참조 지점으로 남아 있습니다.
한계 및 비판
인기에도 불구하고 BBH는 일부 비판에 직면했습니다. 일부 연구자들은 작업이 종종 추상적이고 실제 응용과 단절되어 있어 벤치마크가 실제 세계 추론을 완전히 포착하지 못할 수 있다고 주장합니다. 다른 사람들은 모델이 훈련 데이터에서 패턴을 암기하여 벤치마크를 '속일' 수 있다고 지적했지만, BBH 저자들은 온라인에서 널리 사용할 수 없는 작업을 사용하여 이를 최소화하기 위한 조치를 취했습니다.
또한 벤치마크의 영어 중심 작업은 다국어 모델에 대한 적용 가능성을 제한합니다. 원래 BIG-Bench에는 일부 다국어 작업이 포함되었지만 BBH는 전적으로 영어로만 되어 있어 주로 다른 언어로 훈련된 모델에게 불리할 수 있습니다. 이러한 한계에도 불구하고 BBH는 현재 AI 시스템의 능력과 한계를 이해하는 데 계속해서 귀중한 도구입니다.
관련 벤치마크 및 향후 방향
BBH의 개발은 MMLU(대규모 다중 작업 언어 이해) 벤치마크 및 ARC(AI2 추론 도전)와 같은 유사한 노력을 영감을 주었습니다. 이러한 벤치마크는 BBH와 함께 모델의 지식, 추론 및 문제 해결 능력을 집합적으로 평가하는 테스트 제품군을 형성합니다. 모델이 계속 개선됨에 따라 최고 성능 시스템을 구별할 수 있는 더 도전적인 벤치마크를 만들기 위한 지속적인 작업이 있습니다.
BBH의 향후 반복은 암기를 방지하기 위해 문제가 즉석에서 생성되는 더 동적인 작업을 통합할 수 있습니다. 또한 모델이 텍스트, 이미지 및 기타 데이터 유형의 정보를 통합해야 하는 다중 모드 추론을 다루도록 BBH를 확장하는 데 관심이 있습니다. 이러한 개발은 Artificial intelligence 분야가 계속 진화함에 따라 BBH를 관련성 있게 유지할 것입니다.