HellaSwag 2025는 인공지능 시스템, 특히 대규모 언어 모델과 멀티모달 모델의 상식 추론 능력을 평가하기 위해 설계된 벤치마크 데이터셋이다. 이는 2019년 토론토 대학교와 Allen Institute for AI의 연구자들이 도입한 원래 HellaSwag 벤치마크의 후속 버전이다. 2025 버전은 더 도전적인 예시, 시각 및 청각 시나리오의 확장된 범위, 그리고 암기나 통계적 지름길로 인한 부풀려진 점수를 줄이기 위한 더 엄격한 평가 프로토콜로 데이터셋을 업데이트한다.
이 벤치마크는 주어진 시나리오의 가장 그럴듯한 연속을 선택하는 모델의 능력을 테스트하며, 물리적 역학, 사회적 관습, 시간적 인과 관계에 대한 이해를 요구한다. 주로 텍스트에 초점을 맞춘 초기 버전과 달리, HellaSwag 2025는 텍스트와 이미지 또는 오디오 클립을 결합한 멀티모달 프롬프트를 포함하여 모델이 여러 양식에 걸쳐 정보를 통합하도록 유도한다. 데이터셋은 인간이 작성한 시나리오와 AI가 생성한 적대적 예시의 조합으로 구성되며, 품질과 난이도를 보장하기 위해 필터링된다.
배경 및 동기
원래 HellaSwag는 기존 벤치마크의 공백을 해결하기 위해 만들어졌는데, 기존 벤치마크는 진정으로 상식을 이해하는 모델과 피상적인 언어 패턴에 의존하는 모델을 구별하지 못하는 경우가 많았다. 이름은 "hell"과 "swag"의 합성어로, "어리석은 지혜" 또는 "상식"을 장난스럽게 가리킨다. 2025년 판은 생성형 AI의 급속한 발전에 대응하여 개발되었는데, 이로 인해 모델이 오래된 벤치마크에서 거의 완벽한 점수를 달성할 수 있게 되어 추가 진행 상황을 측정하기 어려워졌다.
이 벤치마크는 스탠포드 AI 랩, MIT CSAIL, 버클리 AI 연구의 구성원을 포함한 학계 및 산업계 연구자 컨소시엄이 유지 관리한다. 프로젝트는 국립과학재단과 민간 재단을 포함한 여러 출처로부터 자금을 지원받는다.
데이터셋 구성
HellaSwag 2025는 각각 맥락과 네 개의 가능한 결말(그중 하나만 정답)이 있는 약 20,000개의 객관식 질문을 포함한다. 맥락은 영화 대본, 교육 비디오, 일상 시나리오를 포함한 다양한 출처에서 가져온다. 난이도를 높이기 위해 데이터셋에는 AI 시스템이 생성한 "적대적" 예시가 포함되며, 이는 인간 주석자가 검증하여 인간이 풀 수 있지만 기계에게는 도전적임을 보장한다.
구성 과정은 여러 단계를 포함한다: 첫째, 대규모 후보 시나리오 풀을 수집하고; 둘째, AI 모델이 그럴듯한 결말과 그럴듯하지 않은 결말을 생성하며; 셋째, 인간 주석자가 예시를 필터링하고 레이블을 지정하고; 마지막으로, 길이나 단어 빈도와 같은 사소한 단서에 의해 벤치마크가 편향되지 않도록 보정 세트를 사용한다. 2025 버전은 또한 정답이 시나리오에 대한 가상적 변경에 대한 추론을 요구하는 "반사실적" 하위 집합을 도입한다.
평가 및 채점
모델은 테스트 세트에서의 정확도로 평가되며, 주요 지표는 정답 질문의 백분율이다. 과적합을 방지하기 위해 테스트 세트는 공개적으로 공개되지 않으며, 대신 연구자들은 OpenAI의 평가와 같은 다른 벤치마크에서 사용되는 접근 방식과 유사하게 통제된 API를 통해 모델을 제출하여 평가한다. 벤치마크는 또한 의역된 맥락이나 변경된 이미지와 같은 변형된 질문에 대한 성능을 측정하는 "견고성 점수"를 보고한다.
HellaSwag 2025는 전작보다 더 어렵도록 설계되었다. 초기 평가에서 GPT-4 및 Claude와 같은 최첨단 모델은 원래 HellaSwag에서 95%에 비해 약 85%의 정확도를 달성한다. 이러한 격차는 새로운 벤치마크가 서로 다른 추론 능력 수준을 가진 모델을 구별하는 더 나은 신호를 제공함을 나타낸다.
영향 및 반응
HellaSwag 2025의 출시는 AI 연구 커뮤니티에서 관심을 받았다. 많은 연구자들이 새로운 아키텍처나 훈련 방법을 개발할 때 표준 평가 도구로 사용한다. 이 벤치마크는 또한 구글 딥마인드 및 앤트로픽을 포함한 산업 연구소에서 내부 평가 제품군의 일부로 채택되었다. 일부 비평가들은 벤치마크가 여전히 서양 문화적 맥락에 대한 잠재적 편향과 같은 한계를 가지고 있다고 주장하지만, 컨소시엄은 다양한 시나리오를 포함하기 위해 노력해 왔다.
이 벤치마크는 또한 커리큘럼 학습 및 데이터 증강과 같은 상식 추론을 개선하는 것을 목표로 하는 새로운 훈련 기술의 개발에 영향을 미쳤다. 또한 HellaSwag 2025는 모델이 진정한 이해보다 통계적 규칙성을 활용하는 "지름길 학습" 현상을 연구하는 데 사용되었다.
향후 방향
HellaSwag의 향후 버전 계획에는 더 많은 언어로의 확장, 상호작용적 또는 구현된 시나리오 통합, 시간적 추론 구성 요소 추가가 포함된다. 컨소시엄은 또한 SuperGLUE 벤치마크와 유사하게 시간 경과에 따른 진행 상황을 추적하는 리더보드를 출시할 의도가 있다. AI 시스템이 계속 진화함에 따라 HellaSwag 2025와 같은 벤치마크는 진행 상황이 의미 있는 방식으로 측정되도록 보장하는 데 중요한 역할을 한다.