BIG-bench 2023은 2021년에 시작된 공동 노력인 Beyond the Imitation Game 벤치마크의 개정판으로, 대규모 언어 모델의 능력과 한계를 평가하기 위해 설계되었다. 원래의 BIG-bench는 130개 기관의 450명 이상의 연구자들이 기여한 204개의 작업으로 구성되었으며, 인과 추론, 상식 지식, 수학적 문제 해결과 같이 표준 벤치마크가 종종 놓치는 기술을 탐구하도록 설계되었다. 2023년 업데이트는 2023년 초에 출시되었으며, 새로운 작업을 추가하고 평가 지표를 개선하며 테스트된 모델 목록을 확장하여 특히 빠르게 진화하는 생성형 AI 시스템의 환경에 초점을 맞추었다.
이 벤치마크의 주요 목적은 특히 대규모 언어 모델을 위한 인공지능의 진전을 측정하는 엄격하고 표준화된 기준을 제공하는 것이다. 질문 응답이나 감정 분석과 같은 좁은 작업에 초점을 맞춘 초기 벤치마크와 달리, BIG-bench 2023은 다단계 추론, 세계 지식, 심지어 창의적 글쓰기를 요구하는 작업을 포함한다. 또한 모델 보정(신뢰도가 정확도와 얼마나 잘 일치하는지)과 적대적 입력에 대한 견고성을 측정하는 것을 강조한다. 2023년 버전은 "BIG-bench Hard"(BBH)로 지정된 작업 하위 집합을 도입했는데, 이는 이전 모델이 평균 인간 평가자 수준 이하로 수행한 23개의 작업으로, 향후 개발에 도전적인 장애물 역할을 한다.
구조 및 작업 범주
BIG-bench 2023은 작업을 여러 광범위한 범주로 구성하며, 각 범주는 모델 능력의 다른 측면을 대상으로 한다. 여기에는 다음이 포함된다:
- 추론: 논리적 연역, 인과 추론, 다단계 산술을 포함하는 작업. 예로는 "causal_judgement" 및 "logical_deduction"(3~5개 객체 포함)이 있다.
- 지식: "periodic_elements" 또는 "international_phonetic_alphabet_transliterate"와 같은 사실적 세계 지식을 탐구하는 질문.
- 사회적 편향 및 공정성: "bbq_lite" 및 "gender_bias"와 같은 작업으로, 모델이 유해한 고정관념을 나타내는지 평가한다.
- 언어 이해: 의미론, 통사론, 화용론에 관한 작업으로, "linguistics_puzzles" 및 "novel_concepts"를 포함한다.
- 수학: 기호 조작과 산술을 요구하는 문제로, "mathematical_induction" 및 "number_sequence"를 포함한다.
- 상식: "physical_intuition" 및 "social_support"와 같은 일상적 추론을 테스트하는 작업.
각 작업에는 프롬프트, 가능한 답변 세트, 점수 측정 기준(일반적으로 정확한 일치 또는 객관식 정확도)이 포함된다. 2023년 업데이트는 코드 생성 및 다국어 이해와 같은 영역에 여러 새로운 작업을 추가하여 실제 응용 프로그램에서 이러한 기술의 중요성이 커지고 있음을 반영한다.
평가 방법론 및 지표
BIG-bench 2023은 모델 간 비교 가능성을 보장하기 위해 표준화된 평가 프로토콜을 사용한다. 모델은 각 작업의 입력으로 프롬프트되고, 출력은 작업별 지표로 점수가 매겨진다. 주요 종합 지표는 모든 작업에 걸친 평균 정규화 정확도이며, 각 작업의 점수는 무작위 추측이 0을 산출하고 완벽한 성능이 1을 산출하도록 정규화된다. 이를 통해 전체 능력을 요약하는 단일 숫자가 제공된다.
2023년 버전은 또한 "표적" 평가를 도입했는데, 여기서 모델은 특정 능력에 특히 어렵거나 관련된 작업 하위 집합에서 테스트된다. 예를 들어, BBH 하위 집합은 이전에 해결되지 않은 작업에 대한 진전을 추적하는 데 사용된다. 또한 벤치마크는 "few-shot" 설정(일반적으로 0-shot, 1-shot, 5-shot)을 포함하여 문맥 내 학습 능력을 측정하고, 모델의 예측 확률이 실제 정확성과 얼마나 잘 일치하는지를 나타내는 보정 오류를 보고한다.
모델 범위 및 결과
BIG-bench 2023은 Google DeepMind 및 Anthropic과 같은 오픈 소스 노력부터 OpenAI 및 기타 기관의 독점 시스템에 이르기까지 다양한 모델의 결과를 포함한다. 이 벤치마크는 수백만 개의 매개변수를 가진 소형 트랜스포머부터 수천억 개의 매개변수를 가진 대규모 언어 모델에 이르기까지 다양한 크기의 모델을 평가하는 데 사용되었다. 주목할 만한 발견으로는 성능이 일반적으로 모델 규모에 따라 향상되지만, 깊은 논리적 추론이나 희귀한 사실적 지식을 요구하는 작업과 같은 일부 작업은 가장 큰 모델에도 여전히 도전적이라는 점이 있다.
예를 들어, BBH 하위 집합에서 2023년의 많은 모델은 여전히 50% 미만의 정규화 정확도를 기록하여 상당한 개선 여지가 있음을 나타낸다. 벤치마크는 또한 모델이 종종 과신을 나타내며, 더 어려운 작업에서 보정 오류가 더 높다는 점을 강조했다. 이러한 결과는 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습) 및 더 나은 훈련 데이터 큐레이션과 같은 기술에 대한 연구에 정보를 제공했다.
영향 및 수용
2023년 업데이트는 AI 연구 커뮤니티에서 표준 평가 제품군으로 널리 채택되었다. 수백 편의 논문에서 인용되었으며 주요 연구소에서 모델을 비교하는 데 사용되었다. MIT CSAIL, Stanford AI Lab, BAIR (Berkeley AI Research)와 같은 기관의 기여를 포함한 BIG-bench의 협력적 특성은 공개 벤치마킹 문화를 조성했다. 비평가들은 벤치마크의 작업이 정적이며 시간이 지남에 따라 포화될 수 있다고 지적했지만, 2023년 버전의 새로운 작업 포함과 BBH 하위 집합은 이러한 우려를 완화한다.
BIG-bench 2023은 또한 HELM 및 MMLU와 같은 유사한 벤치마크의 개발에 영향을 미쳤으며, 대규모 언어 모델의 창발적 능력을 연구하는 데 사용되었다. 그 결과는 GPT-4 및 Claude (AI model family)와 같은 시스템의 능력과 한계를 이해하는 데 중요한 역할을 했으며, 인공지능의 진전을 측정하는 기준점으로 계속 사용되고 있다.
향후 방향
2023년 현재, BIG-bench 팀은 동적 작업 생성과 더 상호작용적인 평가 형식을 포함한 추가 업데이트 계획을 발표했다. 목표는 모델이 진화함에 따라 벤치마크의 관련성을 유지하는 것이며, 잠재적으로 도구 사용이나 다중 턴 대화를 요구하는 작업을 통합하는 것이다. 2023년 버전은 그 당시 AI 능력의 스냅샷으로 남아 있지만, 그 방법론과 통찰력은 앞으로 수년간 미래의 벤치마킹 노력에 영향을 미칠 가능성이 높다.