BIG-bench Lite는 2022년에 도입된 BIG-bench(모방 게임 너머의 벤치마크) 제품군의 선별된 하위 집합으로, 대규모 언어 모델을 위한 계산 효율적이면서도 도전적인 평가를 제공하기 위해 설계되었습니다. 이는 총 204개 작업으로 구성된 전체 BIG-bench 컬렉션에서 선택된 24개 작업으로 구성되며, 추론, 지식, 언어 이해 전반에 걸친 범위를 균형 있게 유지하면서 평가의 계산 비용을 줄입니다. 이 하위 집합은 특히 제한된 컴퓨팅 자원을 가진 연구자와 조직을 위해 모델 개발에서 빠른 반복을 가능하게 하기 위해 만들어졌습니다.
이 벤치마크는 Google DeepMind, OpenAI, Anthropic을 포함한 130개 이상의 기관에서 450명 이상의 연구자가 참여한 협력적 노력으로 개발되었습니다. BIG-bench Lite의 선택 과정은 높은 변별력, 다양한 기술 요구 사항, 관리 가능한 평가 비용을 가진 작업을 우선시했습니다. 단순 산술부터 복잡한 Chess computer 분석까지 다양한 작업을 포함하는 전체 BIG-bench와 달리, BIG-bench Lite는 현재 모델에 실행 가능하면서도 더 넓은 능력을 나타내는 작업에 초점을 맞춥니다.
작업 구성
BIG-bench Lite에는 논리적 추론, 수학적 추론, 상식 이해, 언어 모델링과 같은 작업이 포함됩니다. 주목할 만한 예로는 "인과 판단", "기하학적 모양", "단어 정렬"이 있으며, 각각 Artificial intelligence 능력의 특정 측면을 테스트하도록 설계되었습니다. 작업은 객관식 또는 단답형 질문으로 형식화되어 자동 채점과 다양한 Large language model 아키텍처 간의 일관된 평가를 가능하게 합니다.
이 하위 집합은 기존 모델에 의해 포화된 너무 쉬운 작업이나 광범위한 외부 도구 사용을 요구하는 과도하게 비용이 드는 작업을 의도적으로 제외합니다. 이러한 설계는 모델이 개선됨에 따라 BIG-bench Lite가 계속해서 이동 목표로 유지되도록 하면서도 일상적인 벤치마킹에 실용적이도록 보장합니다.
평가 방법론
모델은 표준화된 프롬프트 형식을 사용하여 BIG-bench Lite에서 평가되며, 각 작업은 고정된 수의 예제를 제공합니다. 주요 지표는 정확도이지만, 일부 작업은 보정 및 견고성 측정도 보고합니다. 이 벤치마크는 제로샷 및 퓨샷 평가를 모두 지원하며, 후자는 일반적으로 작업당 1-5개의 예제를 사용합니다. 이러한 유연성은 연구자가 일반화 및 맥락 내 학습 능력을 평가할 수 있게 합니다.
공정성을 보장하기 위해 벤치마크에는 답변 추출 및 정규화를 처리하는 채점 스크립트가 포함된 참조 구현이 포함됩니다. 이는 다양한 평가 파이프라인 간의 변동성을 줄여 연구 간 결과를 더 비교 가능하게 만듭니다. 2024년 현재, BIG-bench Lite는 학계 및 산업계에서 널리 채택되었으며, 수많은 Machine learning 논문에서 결과가 보고되었습니다.
다른 벤치마크와의 관계
BIG-bench Lite는 MMLU(대규모 다중 작업 언어 이해) 및 HELM(언어 모델의 전체론적 평가)과 같은 다른 평가 제품군과 함께 자주 사용됩니다. MMLU가 57개 과목에 걸친 광범위한 지식에 초점을 맞추는 반면, BIG-bench Lite는 암기된 사실에 덜 의존하는 추론 및 문제 해결 작업을 강조합니다. 이러한 상호 보완적 특성은 모델 약점을 진단하는 데 유용한 도구로 만듭니다.
이 벤치마크는 또한 상당한 컴퓨팅과 시간을 요구하는 전체 BIG-bench에 대한 경량 대안으로 사용됩니다. Google Cloud 또는 Amazon Web Services와 같은 조직의 경우, 클라우드 인프라에서 BIG-bench Lite를 실행하는 것은 몇 시간 내에 가능하지만, 전체 제품군은 며칠이 걸릴 수 있습니다. 이러한 실용성은 모델 개발 주기에서의 인기에 기여했습니다.
한계 및 비판
비평가들은 BIG-bench Lite가 많은 정적 벤치마크와 마찬가지로 훈련 말뭉치에 포함될 때 데이터 오염 문제를 겪을 수 있다고 지적했습니다. 이를 완화하기 위해 벤치마크는 데이터를 평가 전용으로 표시하는 "카나리" 문자열을 포함하여 훈련 데이터 세트에 포함되는 것을 방지합니다. 그러나 집행은 자발적이며, 일부 모델은 사전 훈련 중에 이러한 작업을 여전히 접할 수 있습니다.
또 다른 한계는 작업 범위가 좁아 안전, 편향 또는 장문 맥락 추론과 같은 실제 배포 문제를 포착하지 못할 수 있다는 점입니다. 결과적으로 BIG-bench Lite는 인간 선호도 연구 및 적대적 테스트를 포함한 다른 평가로 자주 보완됩니다. 이러한 단점에도 불구하고, Generative AI 환경에서 모델 능력을 비교하기 위한 표준 참조 지점으로 남아 있습니다.
향후 방향
BIG-bench Lite의 성공은 HELM Lite 및 Open LLM Leaderboard 하위 집합과 같은 유사한 경량 벤치마크에 영감을 주었습니다. 이러한 노력은 신뢰성을 유지하면서 더 효율적인 평가를 제공하는 것을 목표로 합니다. 또한, 원래 BIG-bench 팀은 다단계 추론을 요구하는 특히 도전적인 작업의 하위 집합인 BIG-bench Hard를 출시하여 모델 평가의 경계를 더욱 확장했습니다.
Deep learning 모델이 계속 진화함에 따라, BIG-bench Lite와 같은 벤치마크는 관련성을 유지하기 위해 주기적인 업데이트가 필요할 것입니다. 커뮤니티는 자동 생성 또는 인간 참여 큐레이션을 잠재적으로 사용하여 모델 개선에 적응하는 동적 벤치마크를 요구해 왔습니다. 그때까지 BIG-bench Lite는 Neural network 연구에서 진행 상황을 측정하는 안정적인 기준으로 사용됩니다.