AI 모델의 평가 지표는 인공지능 시스템의 성능, 품질, 신뢰성을 평가하기 위해 사용되는 표준화된 정량적 측정 기준이다. 이러한 지표는 서로 다른 모델을 비교하고, 훈련 중 진행 상황을 추적하며, 모델이 실제 응용 프로그램에 배포하기에 적합한지 판단하는 데 공통된 언어를 제공한다. 분류와 회귀에서 자연어 생성과 확률적 예측에 이르기까지 다양한 작업을 포괄하며, 각 작업에는 적절한 측정 기준이 별도로 존재한다.
평가 지표의 선택은 AI 모델이 개발되고 개선되는 방식을 근본적으로 결정한다. 지표는 모델 아키텍처, 훈련 목표, 하이퍼파라미터 튜닝에 대한 결정에 영향을 미친다. 잘못 선택된 지표는 모델이 잘못된 결과를 최적화하도록 이끌 수 있는 반면, 잘 설계된 지표 세트는 미묘한 강점과 약점을 드러낼 수 있다. 인공지능이 규칙 기반 시스템에서 머신러닝과 딥러닝 접근 방식으로 진화함에 따라, 평가 지표의 도구 모음은 생성 출력 품질과 모델 보정과 같은 새로운 과제를 해결하기 위해 확장되었다.
분류 지표
모델이 입력을 이산 범주에 할당하는 분류 작업은 혼동 행렬에서 파생된 여러 기본 지표에 의존한다. 이 행렬은 실제 양성, 실제 음성, 위양성, 위음성을 기록하며, 여기서 다른 모든 분류 지표가 계산된다.
정확도는 모든 예측 중 올바른 예측의 비율로 정의되는 가장 단순한 지표이다. 직관적이지만, 한 클래스가 지배하는 불균형 데이터 세트에서는 정확도가 오해를 불러일으킬 수 있다. 예를 들어, 매번 다수 클래스를 예측하는 모델은 높은 정확도를 달성하면서도 실질적으로는 쓸모없을 수 있다.
정밀도는 양성으로 식별된 것 중 실제로 올바른 것의 비율을 측정하며, 실제 양성을 실제 양성과 위양성의 합으로 나눈 값으로 계산된다. 높은 정밀도는 모델이 양성 클래스를 예측할 때 일반적으로 정확함을 나타내며, 이는 위양성 비용이 큰 스팸 탐지와 같은 응용 분야에서 중요하다.
재현율은 민감도 또는 실제 양성 비율이라고도 하며, 실제 양성 중 올바르게 식별된 비율을 측정하고, 실제 양성을 실제 양성과 위음성의 합으로 나눈 값으로 계산된다. 높은 재현율은 양성 사례를 놓치는 것이 심각한 결과를 초래하는 의료 검진이나 사기 탐지에서 필수적이다.
F1 점수는 정밀도와 재현율의 조화 평균으로, 두 가지 우려 사항을 균형 있게 반영하는 단일 점수를 제공한다. 범위는 0에서 1까지이며, 1은 완벽한 정밀도와 재현율을 의미한다. F1 점수는 클래스가 불균형하고 위양성과 위음성 모두 의미 있는 비용을 수반할 때 특히 유용하다.
회귀 지표
모델이 연속 값을 예측하는 회귀 작업의 경우, 지표는 예측 오류의 크기와 방향에 초점을 맞춘다.
평균 제곱 오차(MSE)는 예측 값과 실제 값 사이의 제곱 차이를 평균한 것이다. 오류가 제곱되므로 큰 오류는 불균형적으로 벌점을 받아 MSE는 이상치에 민감하다. 평균 제곱근 오차(RMSE)는 MSE의 제곱근으로, 지표를 대상 변수의 원래 단위로 되돌려 해석을 용이하게 한다.
평균 절대 오차(MAE)는 예측 값과 실제 값 사이의 절대 차이를 평균한 것이다. MSE와 달리 MAE는 모든 오류를 동등하게 취급하며 이상치에 더 강건하다. MSE와 MAE 사이의 선택은 응용 프로그램 맥락에서 큰 오류가 특히 바람직하지 않은지 여부에 달려 있다.
결정 계수(R²)는 종속 변수의 분산 중 독립 변수로부터 예측 가능한 비율을 측정한다. 범위는 음의 무한대에서 1까지이며, 1은 완벽한 적합을 나타낸다. R²는 모델 품질에 대한 직관적인 감각을 제공하지만, 비선형 모델에 적용하거나 훈련 데이터 범위를 벗어나 외삽할 때 오해를 불러일으킬 수 있다.
생성 모델 지표
대규모 언어 모델과 생성형 AI의 부상으로 생성된 텍스트, 이미지 및 기타 콘텐츠의 품질을 평가하기 위한 새로운 지표가 등장했다.
BLEU(이중 언어 평가 대용)는 원래 기계 번역을 위해 개발되었으며 생성된 텍스트와 참조 번역 사이의 n-그램 중복을 측정한다. 과도하게 짧은 출력을 억제하기 위해 간결성 벌점으로 수정된 정밀도 점수를 계산한다. BLEU는 번역 작업에서 인간의 판단과 상당히 잘 상관관계가 있지만, 의미적 민감성 부족과 창의적 텍스트 생성에 대한 성능 저하를 포함한 알려진 한계가 있다.
ROUGE(요약 평가를 위한 재현율 지향 대용)는 주로 요약에 사용되는 지표 계열이다. ROUGE-N은 생성된 요약과 참조 요약 사이의 n-그램 중복을 측정하는 반면, ROUGE-L은 최장 공통 부분 수열을 사용하여 문장 수준 구조를 포착한다. BLEU와 달리 ROUGE는 재현율을 강조하여 생성된 출력에 참조 콘텐츠가 얼마나 많이 포함되어 있는지 측정한다.
혼란도는 언어 모델에 일반적으로 사용되는 지표로, 확률 분포가 샘플을 얼마나 잘 예측하는지 측정한다. 혼란도가 낮을수록 모델이 예측에 더 확신을 가지며, 이는 시퀀스의 실제 다음 토큰에 더 높은 확률을 할당함을 의미한다. 혼란도는 토큰당 평균 음의 로그 우도의 지수와 수학적으로 동일하다. 동일한 말뭉치에서 언어 모델을 비교하는 데 유용하지만, 혼란도는 생성된 텍스트의 품질이나 일관성을 직접 측정하지는 않는다.
보정 지표
보정은 모델의 예측 확률이 실제 결과와 얼마나 잘 일치하는지 측정한다. 잘 보정된 모델이 사건에 대해 70% 확률을 예측한다면, 약 70%의 경우에 정확해야 한다.
예상 보정 오류(ECE)는 예측을 신뢰 수준별로 구간으로 나누고 각 구간 내에서 정확도와 신뢰도 사이의 절대 차이의 가중 평균을 계산한다. ECE가 낮을수록 보정이 더 우수함을 나타낸다. 브라이어 점수는 보정과 예리함을 결합한 또 다른 보정 지표로, 예측 확률과 실제 결과 사이의 평균 제곱 차이를 측정한다.
보정은 과신적인 예측이 위험한 결정으로 이어질 수 있는 의료 진단이나 자율 주행과 같은 고위험 응용 분야에서 특히 중요하다. 현대 신경망은 종종 보정이 좋지 않으며, 온도 스케일링과 같은 기술이 훈련 후 보정을 개선하는 데 사용된다.
작업별 지표
다양한 AI 응용 분야는 고유한 요구 사항에 맞춰 특수화된 지표를 개발했다.
정보 검색 및 검색에서 평균 평균 정밀도(MAP)와 정규화 할인 누적 이득(NDCG)은 시스템이 관련 결과를 얼마나 잘 순위화하는지 평가한다. NDCG는 관련 항목의 위치를 고려하여 관련 결과가 순위에서 더 일찍 나타날 때 더 높은 점수를 부여한다.
컴퓨터 비전의 객체 탐지에서 교집합 대 합집합 비율(IoU)은 예측 경계 상자와 실제 경계 상자 사이의 중복을 측정한다. 평균 평균 정밀도(mAP)는 다양한 IoU 임계값과 객체 클래스에 걸쳐 정밀도-재현율 곡선을 집계하여 COCO와 같은 데이터 세트의 표준 벤치마크 지표 역할을 한다.
강화 학습에서 지표는 누적 보상, 샘플 효율성 및 안전성에 초점을 맞춘다. 반환은 에피소드 동안 누적된 총 할인 보상을 측정하는 반면, 성공률은 에이전트가 목표를 달성하는 에피소드의 비율을 추적한다.
실용적 고려 사항
적절한 평가 지표를 선택하려면 작업, 데이터 분포 및 배포 맥락을 신중히 고려해야 한다. 여러 실용적 문제가 지표 사용을 복잡하게 만든다.
데이터 누출은 테스트 세트의 정보가 모델 훈련에 영향을 미칠 때 발생하여 지표 값이 부풀려진다. 신뢰할 수 있는 추정치를 얻으려면 적절한 데이터 세트 분할과 교차 검증 절차가 필수적이다. 다중 비교는 많은 모델이나 하이퍼파라미터 구성을 평가할 때 발생하며, 우연히 우수한 결과를 발견할 가능성을 높인다.
지표는 또한 조작될 수 있다. 모델은 실제 개선 없이 높은 점수를 달성하기 위해 지표 정의를 악용할 수 있다. 예를 들어, BLEU는 참조 n-그램과 밀접하게 일치하지만 유창성이나 의미가 부족한 텍스트를 생성하여 부풀려질 수 있다. 이는 AI 연구에서 지표 주도 개발에 대한 비판으로 이어졌으며, 일부는 보다 전체론적 평가 접근 방식을 주장한다.
인간 평가는 창의성, 유용성 또는 안전성과 같은 주관적 특성을 포함하는 많은 작업에서 여전히 금본위제로 남아 있다. 그러나 인간 평가는 비용이 많이 들고 느리며 일관성이 없을 수 있다. 자동화된 지표와 표적 인간 검토를 결합한 하이브리드 접근 방식은 산업 환경에서 점점 더 일반화되고 있다.
향후 방향
AI 평가 분야는 현재 지표의 한계를 해결하기 위해 활발히 진화하고 있다. 스탠포드 AI 연구소, 버클리 AI 연구, MIT CSAIL과 같은 기관의 연구자들은 모델 역량과 위험을 더 잘 포착하는 새로운 평가 프레임워크를 개발하고 있다.
벤치마크 스위트인 MMLU, HELM, BIG-bench는 다양한 영역에 걸쳐 대규모 언어 모델을 평가하기 위한 표준화된 작업 모음을 제공한다. 이러한 벤치마크는 일반 지식, 추론 및 지시 수행을 측정하는 것을 목표로 하지만, 벤치마크 데이터가 훈련 말뭉치에 나타날 때 잠재적 오염을 포함한 자체 한계가 있다.
적대적 평가는 모델 약점을 탐색하기 위해 의도적으로 도전적인 예제를 구성하는 것을 포함한다. 이 접근 방식은 모델이 약간 교란되거나 분포 외 입력에서 실패하는 강건성의 중요한 격차를 드러냈다.
프로세스 기반 평가는 출력뿐만 아니라 AI 시스템의 추론 및 의사 결정 과정을 검토한다. 이는 모델이 특정 결정을 내린 이유를 이해하는 것이 결정 자체만큼 중요한 안전 필수 응용 분야에서 특히 관련이 있다.
AI 시스템이 더 강력해지고 점점 더 중요한 영역에 배포됨에 따라 엄격하고 포괄적인 평가 지표의 개발은 중요한 연구 우선 순위로 남아 있다. 이 분야는 좋은 성능이 무엇을 구성하는지, 이를 어떻게 신뢰할 수 있게 측정할지, 그리고 지표가 진정으로 유익한 AI 시스템을 향한 진전을 어떻게 보장할 수 있는지에 대한 근본적인 질문과 계속 씨름하고 있다.