에발(Evals)은 평가(evaluations)의 줄임말로, 인공지능 모델 또는 에이전트의 행동을 체계적으로 평가하는 절차를 의미한다. 대규모 언어 모델과 생성형 AI 애플리케이션의 맥락에서 에발은 다양한 작업과 시나리오에 걸쳐 성능, 안전성, 신뢰성을 측정하도록 설계된 구조화된 테스트 스위트로 기능한다. 이는 AI 시스템을 개발, 디버깅, 배포하는 핵심 실무자 도구로, 모델 버전 비교, 회귀(regression) 감지, 애플리케이션이 의도된 요구 사항을 충족하는지 검증하기 위한 정량적 기반을 제공한다.
에발의 관행은 머신러닝과 딥러닝의 급속한 발전과 함께 성장해 왔다. 초기 AI 연구는 알려진 답이 있는 고정된 작업 모음인 벤치마크 데이터셋에 의존하여 진전을 측정하는 경우가 많았다. 모델이 더 강력해지고 실제 제품에 통합되면서 더 미묘하고 애플리케이션 특화된 평가의 필요성이 커졌다. 에발은 이제 표준 벤치마크의 정확성뿐만 아니라 추론, 사실적 일관성, 안전성, 편향성, 지시 수행, 그리고 AI 시스템이 환경에서 행동을 취하는 에이전트적 행동에 대한 평가도 포함한다.
역사적 배경과 벤치마크
에발의 계보는 인공지능의 고전적 벤치마크 스위트로 거슬러 올라갈 수 있다. 예를 들어, 1950년 앨런 튜링이 제안한 튜링 테스트는 기계 지능에 대한 초기 개념적 평가였지만, 현대 실무에서는 거의 사용되지 않는다. 그 후 수십 년 동안 연구자들은 체스, 자연어 처리, 컴퓨터 비전과 같은 분야를 위한 작업 특화 벤치마크를 개발했다. 2010년대 신경망과 딥러닝의 출현은 이미지 분류를 위한 ImageNet과 같은 대규모 벤치마크의 생성을 가속화했으며, 이는 딥러닝 혁명에서 중추적인 역할을 했다.
언어 모델의 경우, 2018-2019년경에 도입된 GLUE(General Language Understanding Evaluation)와 그 후속작인 SuperGLUE와 같은 벤치마크는 감정 분석, 질문 응답, 텍스트 함의 등을 포괄하는 표준화된 작업 세트를 제공했다. 이러한 벤치마크는 연구자들이 공통된 기준에서 모델을 비교할 수 있게 했다. 그러나 대규모 언어 모델의 규모와 능력이 성장하면서 이러한 벤치마크는 빠르게 포화 상태에 이르렀고, 더 도전적이고 다양한 평가 세트의 개발을 촉구했다.
대규모 언어 모델을 위한 현대 에발
대규모 언어 모델을 위한 현대적 에발은 종종 OpenAI, Anthropic, Google DeepMind, 그리고 학계 기관과 같은 조직에 의해 구축된다. 이는 일반적으로 각각 채점 기준 또는 예상 결과가 있는 프롬프트 또는 작업 세트와 채점 메커니즘으로 구성된다. 채점은 자동화될 수 있는데, 예를 들어 정확한 문자열 일치 확인, 별도 모델을 심판관으로 사용, 생성된 코드에 대한 단위 테스트 실행 등이 있으며, 또는 유용성, 무해성, 정직성과 같은 차원에서 응답 품질을 평가하는 인간 평가자가 포함될 수 있다.
일반적인 에발 유형은 기존 시험 또는 큐레이션된 지식 베이스에서 파생된 객관식 또는 단답형 질문 세트이다. 예를 들어, MMLU(Massive Multitask Language Understanding)는 수학, 역사, 법학, 의학과 같은 과목에 걸친 수천 개의 질문을 포함한다. 널리 사용되는 또 다른 에발은 HellaSwag 벤치마크로, 모델에게 이야기의 가장 그럴듯한 연속을 선택하도록 요청하여 상식 추론을 테스트한다. 이러한 벤치마크는 모델의 지식과 추론 능력에 대한 광범위한 측정을 제공한다.
에이전트적 및 행동적 에발
도구를 사용하거나, 웹을 탐색하거나, 소프트웨어 환경과 상호작용할 수 있는 AI 에이전트의 부상과 함께 에발은 에이전트적 행동을 포괄하도록 확장되었다. 이러한 평가는 종종 에이전트를 시뮬레이션 환경에 배치하고 다단계 작업을 완료하고, 오류에서 복구하며, 긴 시간 범위에 걸쳐 지시를 따르는 능력을 측정한다. 예를 들어, 에발은 에이전트에게 항공편을 예약하거나, 코드를 작성하고 실행하거나, 가상 사무실을 탐색하도록 요청할 수 있으며, 성공 여부는 최종 결과가 예상 결과와 일치하는지에 따라 결정된다.
행동적 에발은 또한 안전성과 정렬(alignment)을 조사한다. 여기에는 불법 활동 지침, 편향된 진술, 개인 정보 유출과 같은 유해한 출력을 유도하도록 설계된 적대적 테스트가 포함된다. 인간 테스터가 의도적으로 모델을 깨뜨리려는 레드-팀링(red-teaming)은 자동화된 에발 설계에 정보를 제공하는 보완적 접근 방식이다. 이러한 에발의 결과는 인간 피드백 기반 강화 학습(RLHF) 및 헌법적 AI와 같은 기술을 사용하여 모델 행동을 유도하는 데 지침을 제공한다.
에발 구축 및 실행
실무에서 에발을 구축하는 데는 여러 단계가 포함된다. 먼저 실무자는 범위를 정의한다: 애플리케이션에 중요한 능력 또는 행동은 무엇인가? 다음으로, 일반적 및 경계 사례 입력을 나타내는 테스트 케이스 세트를 큐레이션하거나 생성한다. 각 테스트 케이스에 대해 채점 함수를 지정한다. 이는 단순한 정확한 일치, 의미적 유사성 점수, 루브릭 기반 인간 평가, 또는 프롬프트에 따라 응답을 평가하는 심판 모델 호출이 될 수 있다.
에발 실행은 일반적으로 자동화되어 개발 워크플로우에 통합된다. 새 모델 버전이 훈련되거나 프롬프트가 수정될 때 에발 스위트가 실행되고 결과가 기준선과 비교된다. 이를 통해 팀은 회귀를 포착할 수 있다 - 즉, 변경이 일부 지표를 개선하지만 다른 지표를 저하시키는 경우. 많은 조직이 시간 경과에 따른 결과를 기록하는 내부 에발 플랫폼을 유지하여 다양한 범주에 걸친 모델 행동의 상세한 분석을 가능하게 한다.
에발의 핵심 과제는 과적합(overfitting)을 방지하는 것이다. 모델이 에발 데이터에 직접 훈련되면 그 성능이 실제 세계 일반화를 반영하지 못할 수 있다. 이를 완화하기 위해 에발 세트는 종종 훈련에서 제외되고 새 버전이 주기적으로 출시된다. 또한, 벤치마크 포화 현상 - 모델이 거의 완벽한 점수를 달성하는 경우 - 은 더 어려운 벤치마크의 생성과 동적 또는 적대적 평가 방법의 사용으로 이어졌다.
인간 평가의 역할
자동화된 채점의 발전에도 불구하고 인간 평가는 많은 AI 품질 측면에서 여전히 금본위(gold standard)로 남아 있다. 인간 평가자는 알고리즘적으로 포착하기 어려운 어조, 창의성, 문화적 적절성과 같은 미묘한 특성을 판단할 수 있다. 그러나 인간 평가는 비용이 많이 들고 느리기 때문에, 예를 들어 출력의 하위 집합을 검증하거나 심판 모델을 위한 훈련 데이터를 생성하는 데 드물게 사용된다.
최근 몇 년 동안 대규모 언어 모델을 심판관으로 사용하는 것이 일반화되었다. 강력한 모델이 루브릭에 따라 다른 모델의 출력을 평가하도록 프롬프트되고, 그 판정은 신뢰성을 보장하기 위해 인간 판단과 비교된다. 이 접근 방식은 확장성이 좋지만 자체적인 편향을 도입하며, 연구자들은 이를 계속 연구하고 있다.
산업 및 연구에서의 에발
주요 AI 연구소와 클라우드 제공업체는 에발을 운영의 핵심 부분으로 만들었다. 예를 들어, Anthropic은 안전성 및 능력 평가를 포함한 Claude 모델에 대한 상세한 평가를 발표했다. OpenAI는 GPT 모델에 대한 에발을 공개했으며, Google DeepMind는 연구 커뮤니티에 수많은 벤치마크를 기여했다. EleutherAI Language Model Evaluation Harness와 같은 오픈소스 노력은 모든 모델에 대해 광범위한 표준 벤치마크를 실행할 수 있는 도구를 제공한다.
에발은 또한 규제 및 정책 논의에서 역할을 한다. 정부가 인공지능을 규제하는 방법을 고려함에 따라 모델 행동을 측정하고 검증하는 능력이 중요해진다. 표준화된 에발은 인증 또는 규정 준수의 기초가 될 수 있지만, 아직 보편적인 표준은 채택되지 않았다.
과제와 미래 방향
에발 분야는 몇 가지 공개된 문제에 직면해 있다. 하나는 점수로 쉽게 환원되지 않는 능력, 예를 들어 장기 계획 또는 상식과 같은 것을 측정하는 어려움이다. 또 다른 하나는 지표 최적화가 실제 성능 개선보다 지표 게임으로 이어지는 구드하트 법칙(Goodhart's law)의 위험이다. 또한 지속적으로 업데이트되거나 예측할 수 없는 방식으로 세계와 상호작용하는 모델을 평가하는 방법에 대한 질문도 있다.
미래 방향에는 모델의 행동에 따라 테스트 세트가 변경되는 더 동적이고 적응적인 에발의 개발과 에발을 훈련 루프 자체에 통합하여 모델이 에발 성능에 직접 최적화될 수 있게 하는 것이 포함된다. 연구자들은 또한 인간 가치와의 정렬을 측정하고 명시적으로 훈련되지 않은 창발적 능력을 감지하기 위해 에발을 사용하는 것을 탐구하고 있다.
요약하자면, 에발은 AI의 책임 있는 개발을 위한 필수 인프라이다. 이는 개선을 주도하고 안전성을 보장하며 AI 시스템에 대한 신뢰를 구축하는 경험적 피드백 루프를 제공한다. 기술이 진화함에 따라 이를 평가하는 방법과 도구도 진화할 것이며, 에발은 활기차고 중요한 연구 및 실무 분야로 남을 것이다.