BBH 2024는 대규모 언어 모델(LLM)을 일련의 도전적인 추론 과제에서 평가하기 위한 벤치마크이다. 이는 더 큰 BIG-Bench 제품군에서 선별된 하위 집합이었던 BIG-Bench Hard(BBH) 벤치마크의 추가 업데이트 버전이다. BBH 2024는 2024년에 출시되었으며, 원래 BBH의 한계, 특히 최신 모델에 의한 성능 포화와 더 견고한 평가 프로토콜의 필요성을 해결하기 위해 만들어졌다.
이 벤치마크는 BIG-Bench에서 언어 모델에 특히 어려운 것으로 확인된 23개의 과제로 구성된다. 이러한 과제는 인과 판단, 날짜 이해, 의미 해소, 논리적 추론을 포함한 다양한 추론 능력을 다룬다. BBH 2024는 수정된 프롬프트, 업데이트된 답변 형식, 그리고 원래 BBH보다 부분적으로 정확한 답변에 더 엄격하게 불이익을 주는 새로운 채점 방법론을 도입한다. 업데이트된 벤치마크는 AI 연구의 최전선에서 모델 능력에 대한 더 신뢰할 수 있는 측정을 제공하는 것을 목표로 한다.
과제 구성 및 선정
BBH 2024의 23개 과제는 원래 BBH와 동일하지만, 상당한 수정이 이루어졌다. 예를 들어, '인과 판단' 과제는 이제 100개의 추가 반사실적 시나리오를 포함하며, '날짜 이해' 과제는 더 넓은 범위의 달력 형식을 다루도록 확장되었다. '논리적 추론' 과제는 이제 모델이 최종 답변만 출력하는 대신 일련의 추론 단계를 출력하도록 요구한다. 이러한 변경은 단순한 패턴 매칭의 효과를 줄이고 진정한 추론을 장려하기 위해 이루어졌다.
각 과제는 원래 BBH와 마찬가지로 3~5개의 예시가 포함된 few-shot 프롬프트를 포함한다. 그러나 BBH 2024는 더 최근의 언어 사용을 반영하고 정답에 대한 설명을 포함하는 업데이트된 예시를 제공한다. 벤치마크는 또한 모델이 최종 답변 전에 중간 추론 단계를 생성하도록 유도하는 'chain-of-thought' 평가 모드와 그러한 유도가 없는 '직접' 모드를 도입한다.
채점 및 평가
BBH 2024는 정답과 정확히 일치하는 경우에만 전체 점수를 부여하는 채점 시스템을 사용한다. 정답을 포함하지만 불필요한 텍스트가 있는 답변에는 부분 점수가 주어진다. 벤치마크는 과제 전반의 평균 정확도와 표준 편차를 모두 보고한다. chain-of-thought 모드의 경우, 추론 단계 이후의 최종 답변에 대해 정확도가 계산되며, 생성된 단계의 논리적 일관성을 평가하기 위해 별도의 지표인 '추론 일관성'이 도입된다.
원래 BBH에서 GPT-3와 같은 모델은 과제에서 평균 정확도 약 40%를 달성했다. 2024년까지 GPT-4 및 Claude 3와 같은 최첨단 모델은 원래 BBH에서 80%를 넘어섰으며, 이는 더 도전적인 버전의 필요성을 촉발했다. BBH 2024는 프롬프트가 적대적으로 변형된 새로운 '하드 모드'를 포함하며, 벤치마크는 표준 및 하드 모드 모두에 대한 결과를 보고한다.
모델 성능 및 포화
2024년 중반에 출시된 BBH 2024의 초기 결과에 따르면, GPT-4 Turbo 및 Claude 3 Opus를 포함한 최고 성능 모델은 표준 모드에서 평균 정확도 약 70%, 하드 모드에서 약 50%를 달성한다. 이는 원래 BBH에서의 거의 포화 상태에서 상당한 하락으로, 업데이트된 벤치마크가 더 변별력 있는 평가를 제공함을 나타낸다. 이 벤치마크는 OpenAI, Anthropic, Google DeepMind를 포함한 여러 AI 연구소에서 모델의 표준 평가 도구로 채택되었다.
BBH 2024는 또한 크라우드소싱 플랫폼을 통해 모집된 100명의 인간 참가자를 대상으로 한 '인간 기준선' 연구를 포함한다. 표준 모드에서 인간 기준선 정확도는 85%, 하드 모드에서는 75%로, 벤치마크가 여전히 AI 시스템의 개선 여지를 남겨두고 있음을 보여준다.
다른 벤치마크와의 관계
BBH 2024는 AI 벤치마크의 더 넓은 생태계의 일부이다. 이는 MMLU(Massive Multitask Language Understanding) 및 HellaSwag와 같은 다른 제품군을 보완하지만, 특히 다단계 추론이 필요한 과제에 초점을 맞춘다. 광범위한 지식 영역을 다루는 MMLU와 달리, BBH 2024는 BIG-Bench에서 원래 정의된 대로 인간에게는 쉽지만 AI에게는 어려운 과제를 강조한다. 업데이트된 버전은 이러한 철학을 유지하면서 평가의 난이도와 견고성을 높인다.
벤치마크는 GitHub에서 공개적으로 제공되며, 저자는 다양한 모델의 결과가 포함된 리더보드를 제공한다. 리더보드는 정기적으로 업데이트되며, 2024년 말 기준 최상위 항목은 Google DeepMind의 모델로 표준 모드에서 평균 정확도 72.3%를 기록했다.
향후 방향
BBH 2024의 창작자들은 모델 개선에 맞춰 연간 업데이트를 출시할 계획임을 밝혔다. 또한 차트와 다이어그램 해석과 같은 다중 모드 추론이 필요한 과제의 포함을 탐구하고 있다. 이 벤치마크는 가까운 미래에 대규모 언어 모델의 추론 능력을 평가하는 핵심 참조 지점으로 남을 것으로 기대된다.
같이 보기
- BIG-Bench
- MMLU
- Chain-of-thought
- AI 시스템 평가