BIG-Bench Hard (BBH)

영어에서 번역됨

BIG-Bench Hard (BBH)는 BIG-bench 벤치마크에서 선별된 23개의 어려운 작업으로 구성된 하위 집합으로, 대규모 언어 모델이 인간보다 성능이 떨어지는 추론 작업에서 이를 평가하도록 설계되었습니다.

BIG-Bench Hard(BBH)는 복잡한 추론 작업에서 대규모 언어 모델을 평가하기 위한 벤치마크입니다. 2022년에 Google DeepMind, OpenAI 및 기타 기관의 연구자들이 더 광범위한 BIG-bench 벤치마크의 하위 집합으로 도입했습니다. BBH는 당시 최고 모델의 성능을 인간의 성능이 크게 능가하는 23개 작업에 초점을 맞추며, 단순한 패턴 인식을 넘어선 모델 능력에 대한 보다 목표 지향적인 평가를 제공합니다.

이 벤치마크는 인공 지능 연구에서 더 도전적인 평가 세트의 필요성을 해결하기 위해 만들어졌습니다. BIG-bench에는 200개 이상의 작업이 포함되었지만, 많은 작업이 최첨단 모델에게 너무 쉬워 포화 상태에 이르렀습니다. BBH는 다단계 추론, 상식 이해 및 도메인별 지식을 요구하는 작업을 선택하여 머신 러닝의 진전을 측정하는 데 유용한 도구가 되었습니다.

작업 선택 및 구성

BBH의 23개 작업은 평균 인간 성능이 최고 모델 성능을 상당한 차이로 초과하는 특정 기준에 따라 원래 BIG-bench 제품군에서 선택되었습니다. 이러한 작업은 논리 퍼즐, 수학적 추론, 인과 판단 및 언어 이해를 포함한 다양한 영역에 걸쳐 있습니다. 예로는 부울 표현, 인과 판단, 날짜 이해, 의미 해소 및 기하학적 모양이 있습니다.

각 작업은 객관식 또는 자유 형식 질문으로 형식화되며, 모델 간 일관성을 보장하기 위해 표준 프롬프트 템플릿이 사용됩니다. 작업은 특별한 훈련 없이 인간이 해결할 수 있도록 설계되었지만, 신중한 추론이 필요하고 종종 여러 단계를 포함합니다. 이는 BBH를 트랜스포머 기반 모델의 추론 능력을 평가하는 데 특히 유용하게 만듭니다.

평가 방법론

BBH는 일반적으로 작업 지침과 몇 가지 예제(퓨샷 학습)를 모델에 프롬프트하여 평가하는 데 사용됩니다. 표준 평가는 모델이 최종 답변을 제공하기 전에 중간 추론 단계를 생성하도록 장려하는 체인 오브 사고 프롬프트 기법을 사용합니다. 이 접근 방식은 특히 더 큰 모델에서 BBH 작업 성능을 크게 향상시키는 것으로 나타났습니다.

결과는 정확도 백분율로 보고되며, 인간 성능이 기준선 역할을 합니다. 원래 논문에서 최고 모델(PaLM 540B)은 체인 오브 사고 프롬프트로 65.2% 정확도를 달성했으며, 인간 평가자는 71.2%를 기록했습니다. 이 격차는 현대 모델의 한계를 강조하고 추론 능력에 대한 추가 연구를 촉진했습니다.

영향 및 사용

BBH는 생성형 AI 커뮤니티에서 표준 벤치마크가 되었으며, 학계 및 산업 연구 그룹 모두에서 사용됩니다. MMLU 및 HellaSwag와 같은 다른 벤치마크와 함께 모델 평가 제품군에 자주 포함됩니다. 신경망 아키텍처를 포함한 많은 딥 러닝 모델이 추론 능력을 평가하기 위해 BBH로 테스트됩니다.

이 벤치마크는 복잡한 추론 작업에서 성능을 향상시키는 것을 목표로 하는 AI 피드백 기반 강화 학습커리큘럼 학습과 같은 새로운 기술 개발에도 영향을 미쳤습니다. BBH는 연구 논문에서 자주 인용되며 BIG-bench 저장소의 일부로 제공되어 연구 커뮤니티가 쉽게 접근할 수 있습니다.

한계 및 비판

널리 사용됨에도 불구하고 BBH는 몇 가지 비판에 직면했습니다. 작업이 정적이므로 모델이 개선됨에 따라 포화 상태가 되어 시간이 지남에 따라 판별력이 감소할 수 있습니다. 또한 벤치마크는 주로 영어 추론을 테스트하므로 다른 언어나 문화적 맥락으로 일반화되지 않을 수 있습니다. 일부 연구자들은 BBH 작업이 종종 추상적이고 실제 적용이 부족하여 실제 문제를 대표하지 않는다고 주장합니다.

또 다른 한계는 BBH가 모델 보정이나 불확실성을 고려하지 않고 정확도에만 초점을 맞춘다는 점입니다. 이는 모델이 진정한 이해 없이 추측으로 정답을 맞출 수 있으므로 오해를 불러일으킬 수 있습니다. 그럼에도 불구하고 BBH는 AI 추론의 진전을 추적하는 데 유용한 도구로 남아 있으며, 그 작업은 BIG-bench Lite와 같은 더 포괄적인 벤치마크에 통합되었습니다.

향후 방향

대규모 언어 모델이 계속 진화함에 따라 BBH와 같은 벤치마크는 관련성을 유지하기 위해 적응되고 있습니다. 연구자들은 시간이 지남에 따라 작업을 업데이트하는 동적 벤치마크와 다국어 및 다중 모드 변형을 탐구하고 있습니다. BBH는 또한 의료 추론 및 법적 추론과 같은 특정 영역을 위한 전문 벤치마크 생성에 영감을 주었으며, 이는 그 방법론을 기반으로 합니다.

BBH 및 유사한 벤치마크의 지속적인 개발은 AI 시스템이 엄격하게 평가되고 진전이 정확하게 측정되도록 하는 데 중요합니다. 도전적인 작업에 초점을 맞춤으로써 BBH는 모델이 달성할 수 있는 경계를 넓히는 데 도움을 주며 인공 지능 연구의 혁신을 주도합니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:benchmark·reasoning·large-language-models
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사