HellaSwag 2024는 인공지능 시스템, 특히 대규모 언어 모델의 상식 추론 능력을 평가하기 위해 설계된 벤치마크 데이터셋이다. 이는 2019년에 도입된 원래 HellaSwag 벤치마크의 업데이트 버전이다. 2024년 개정판은 모델이 시나리오를 진정으로 이해하기보다 통계적 규칙성을 활용하는 능력과 같은 초기 데이터셋의 한계를 해결하는 것을 목표로 한다. 이 벤치마크는 모델이 주어진 상황의 가장 그럴듯한 연속을 선택해야 하는 객관식 질문을 제시하며, 정답을 맞히려면 물리적 및 사회적 상식에 대한 이해가 필요하다.
원래 HellaSwag는 워싱턴 대학교와 Allen Institute for AI의 연구자들이 만들었다. 이는 인간이 작성한 결말과 기계가 생성한 그럴듯하지만 틀린 결말을 짝지은 적대적 필터링 과정을 통해 구축되었다. 2024년 업데이트는 이 핵심 구조를 유지하면서 몇 가지 개선 사항을 도입한다. 여기에는 더 많은 질문 세트, 더 다양한 시나리오, 그리고 모델이 위치나 길이에 따라 추측하는 것을 방지하기 위한 답변 선택지의 재균형 분포가 포함된다. 점수 산정 방법론도 가장 길거나 가장 복잡한 답변을 선택하는 것과 같은 휴리스틱을 사용하는 모델에 더 강건하도록 개정되었다.
설계 및 구축
HellaSwag 2024의 구축은 전작과 동일한 적대적 필터링 접근 방식을 따른다. 인간 주석자는 일련의 활동 설명에 대한 올바른 결말을 작성했고, 별도의 틀린 결말 세트는 언어 모델에 의해 생성되었다. 틀린 결말은 표면적으로는 그럴듯하지만 의미상 틀리도록 설계되었으며, 종종 물리 법칙이나 사회적 규범의 미묘한 위반을 포함한다. 최종 데이터셋에는 단순한 통계적 단서로 틀린 결말을 쉽게 구별할 수 없는 질문만 포함되어, 벤치마크가 패턴 매칭이 아닌 진정한 추론을 측정하도록 보장한다.
2024년 버전은 원래 데이터셋을 약 10,000개 질문에서 15,000개 이상으로 확장한다. 시나리오는 요리, 스포츠, 가사 일과 같은 일상 활동뿐만 아니라 사회적 상호작용을 포함한 더 추상적인 상황을 폭넓게 다룬다. 각 질문에는 네 개의 답변 선택지가 있으며, 정확히 하나의 정답이 있다. 데이터셋은 훈련, 검증, 테스트 세트로 분할되며, 테스트 세트는 공식 평가를 위해 보류된다.
평가 및 점수 산정
모델은 HellaSwag 2024에서 정답을 선택하는 정확도로 평가된다. 주요 지표는 top-1 정확도로, 모델이 올바른 선택지에 가장 높은 확률을 할당하는 질문의 백분율을 측정한다. 답변 길이 편향의 영향을 줄이기 위해 2024년 업데이트는 정규화된 점수 산정 방법을 도입한다. 이 방법은 각 답변의 확률을 길이로 조정하여 모델이 더 길거나 장황한 응답을 선호하는 것을 방지한다.
정확도 외에도 벤치마크는 모델의 신뢰도가 정확성과 얼마나 잘 일치하는지 측정하는 보정 점수를 보고한다. 잘 보정된 모델은 정답에 대해 더 높은 신뢰도를, 오답에 대해 더 낮은 신뢰도를 가져야 한다. 2024년 개정판은 또한 인간 기준선을 포함하여, 질문의 하위 집합에서 인간 성능을 측정하고 모델 비교를 위한 참조점을 제공한다.
현재 모델의 성능
2024년 현재, OpenAI, Anthropic, Google DeepMind에서 개발된 것과 같은 최고 성능의 대규모 언어 모델은 HellaSwag 2024에서 중반 90%대의 정확도 점수를 달성한다. 이는 원래 HellaSwag에서 약 80%를 기록한 초기 모델에 비해 상당한 개선이다. 그러나 벤치마크에서 인간 성능은 여전히 더 높으며, 일반적으로 95% 이상으로 기계와 인간의 상식 추론 사이에 여전히 격차가 있음을 나타낸다.
이 벤치마크는 상식 추론의 진전을 추적하기 위한 Artificial intelligence 커뮤니티의 표준 도구가 되었다. 이는 Winogrande 및 ARC와 같은 다른 벤치마크와 함께 자주 사용되어 모델의 추론 능력에 대한 포괄적인 평가를 제공한다. 2024년 업데이트는 Amazon Web Services, Microsoft Azure, Google Cloud의 팀을 포함한 연구 실험실과 산업 팀에서 모델 평가 파이프라인의 일부로 널리 채택되었다.
한계 및 비판
개선에도 불구하고 HellaSwag 2024는 몇 가지 비판에 직면했다. 일부 연구자들은 벤치마크가 여전히 언어의 통계적 패턴에 크게 의존하며, 모델이 유연한 추론에 참여하기보다 일반적인 상식 사실을 암기하여 높은 점수를 얻을 수 있다고 주장한다. 다른 사람들은 데이터셋이 영어와 서양 문화적 맥락의 시나리오로 제한되어 있어 다른 언어나 문화로 일반화되지 않을 수 있다고 지적한다.
또 다른 한계는 벤치마크가 정적이라는 점으로, 모델이 테스트 세트에 대해 훈련된 후에는(의도적으로든 데이터 오염을 통해 우연히든) 성능이 더 이상 진정한 일반화를 반영하지 않는다는 것이다. 이를 완화하기 위해 2024년 버전은 공개적으로 공개되지 않은 숨겨진 테스트 세트를 포함하며, 연구자들은 제출 시스템을 통해 이 숨겨진 세트에서 평가하도록 권장된다. 그러나 이 접근 방식은 완벽하지 않으며, 오염 위험은 더 넓은 분야에서 여전히 우려 사항으로 남아 있다.
향후 방향
HellaSwag 2024의 개발은 더 도전적이고 강건한 평가 벤치마크를 만드는 방향으로의 Machine learning 커뮤니티의 더 넓은 추세를 반영한다. 향후 업데이트는 암기를 방지하기 위해 새로운 질문이 즉석에서 생성되는 동적 질문 생성을 통합할 수 있다. 또한 벤치마크를 텍스트와 이미지 모두에 대해 추론해야 하는 다중 모드 시나리오로 확장하고, 다단계 추론이나 인과 추론이 필요한 질문을 포함하는 데 대한 관심도 있다.
Large language model이 계속 개선됨에 따라 HellaSwag 2024와 같은 벤치마크도 보조를 맞추기 위해 진화해야 할 가능성이 높다. 목표는 현재 능력을 측정할 뿐만 아니라 AI 시스템에서 더 인간다운 추론의 개발을 촉진하는 평가를 만드는 것이다. 2024년 업데이트는 전작보다 상식 이해에 대한 더 엄격한 테스트를 제공하는 그 방향으로의 한 단계이다.