LLM 평가(일반적으로 evals라고도 함)는 대규모 언어 모델의 능력, 품질, 신뢰성 및 안전성을 측정하는 데 사용되는 방법과 인프라를 말합니다. LLM이 점점 더 광범위한 작업에 적용됨에 따라 평가는 좁은 학문적 활동에서 AI 연구소 내 주요 실무 분야로 성장했으며, 이는 평가가 공개적으로 보고되는 내용, 개발자가 모델을 선택하는 기준, 그리고 점점 더 훈련 과정 자체에 피드백을 제공하기 때문입니다.
정적 벤치마크 제품군
가장 전통적인 평가 형태는 알려진 정답이 있는 고정된 벤치마크 데이터 세트에 대해 모델을 실행하는 것입니다. 예를 들어 MMLU는 지식 테스트, HumanEval 또는 SWE-bench는 코딩 능력, ARC-AGI는 추상적 추론을 테스트합니다. 이러한 제품군은 반복 실행 비용이 저렴하고 직접적인 수치 비교가 가능하지만, 모델이 점점 더 많은 웹 스크랩 데이터로 훈련되면서 테스트 세트와 겹칠 수 있어 벤치마크 포화 및 훈련 데이터 오염 문제를 겪습니다.
인간 선호 아레나
유용성, 작성 품질 또는 어조와 같은 많은 중요한 LLM 특성은 단순한 정답 채점으로는 측정하기 어렵습니다. 이를 위해 LMArena(이전의 Chatbot Arena)와 같은 플랫폼은 모델 출력 간의 블라인드 일대일 인간 비교를 대규모로 수집하고 Elo 스타일 순위를 계산합니다. 이 접근 방식은 집단적 인간 선호도를 잘 포착하지만, 장황함이나 동조성과 같이 더 깊은 능력이나 정확성을 반드시 추적하지 않는 특성을 보상할 수 있고, 플랫폼의 사용자 분포에 맞춰 모델을 조정함으로써 게임될 수 있다는 비판을 받습니다.
LLM-as-judge
더 새로운 접근 방식은 하나의 LLM을 사용하여 다른 LLM의 출력을 평가하는 것입니다. 이 방법은 채점 루브릭에 따라 응답의 정확성, 유용성 또는 지침 준수 여부를 평가할 수 있습니다. 인간 평가는 느리고 비용이 많이 들기 때문에, LLM 판사는 훨씬 더 많은 예제로 평가를 확장할 수 있게 하며 많은 작업에서 인간의 판단과 합리적으로 잘 일치합니다. 그러나 이 방법은 판사 모델의 편향과 맹점을 물려받으며, 특히 더 길거나 더 자신 있게 표현된 답변을 선호하는 경향이 있고, 평가 대상 모델이 판사를 속이는 출력을 생성하도록 학습될 경우 악용될 수 있습니다.
도메인별 및 안전 평가
일반 능력을 넘어, 평가는 점점 더 특정 속성에 초점을 맞추고 있습니다. 여기에는 사실적 질문에 대한 환각 비율, 탈옥 및 프롬프트 주입 공격에 대한 취약성, 다양한 인구 집단에 걸친 편향, 그리고 AI 안전과 관련된 위험한 능력 평가가 포함됩니다. 예를 들어 모델이 사이버 공격이나 생물 무기 합성에 실질적으로 기여할 수 있는지 여부를 테스트합니다. Anthropic 및 OpenAI와 같은 연구소는 책임 있는 확장 약속의 일환으로 사전 배포 테스트의 일부로 이러한 평가를 실행하며, 블레츨리 선언 이후 설립된 정부 AI 안전 연구소를 포함한 제3자 기관도 최첨단 모델에 대한 독립적 평가를 수행합니다.
과제
평가 분야는 지속적인 어려움에 직면해 있습니다. 연구소가 무엇을 측정하는지 알게 되면 벤치마크는 게임될 수 있습니다. 이는 모델 개발에 적용된 굿하트의 법칙의 한 형태입니다. 데이터 오염은 정적 점수의 타당성을 훼손합니다. 그리고 유용성, 정직성, 무해성과 같이 사용자가 신경 쓰는 특성은 때로 충돌하기 때문에 단일 지표로는 포착할 수 없습니다. 이러한 이유로 이 분야는 여러 방법을 결합한 평가 포트폴리오, 지속적으로 갱신되는 "살아있는 벤치마크", 그리고 고립된 질문-답변보다 실제 배포된 사용을 더 잘 반영하는 작업 기반 및 에이전트 평가로 점점 더 나아가고 있습니다.
중요성
평가는 어떤 모델이 최고로 인식되는지를 형성하고 RLHF 및 보상 모델링과 같은 기술을 통해 훈련 과정에 점점 더 직접적으로 피드백을 제공하기 때문에, 평가 방법론의 설계는 덜 알려졌지만 이 분야의 주요 모델이 실제로 어떻게 행동하는지를 이끄는 중요한 요소가 되었습니다.