정밀도와 재현율

영어에서 번역됨

정밀도와 재현율은 각각 검색된 관련 인스턴스의 비율과 관련 인스턴스 중 검색된 비율을 측정하는 분류 지표로, 특히 불균형한 작업에 사용됩니다.

정밀도와 재현율은 분류 및 정보 검색에서 모델 예측의 품질을 평가하는 데 사용되는 두 가지 기본 성능 지표입니다. 정밀도는 양성 예측도라고도 하며, 검색된 모든 항목 중 관련 항목의 비율을 측정합니다. 재현율은 민감도라고도 하며, 성공적으로 검색된 관련 항목의 비율을 측정합니다. 두 지표 모두 관련성 개념에 기반하며, 이는 일반적으로 데이터 세트에서 특정 클래스를 식별하는 것과 같은 특정 작업에 의해 정의됩니다.

분류 작업에서 특정 클래스에 대한 정밀도는 해당 클래스에 속하는 것으로 올바르게 레이블이 지정된 항목(참양성)의 수를 해당 클래스에 속하는 것으로 레이블이 지정된 전체 항목 수(참양성과 거짓양성의 합)로 나눈 값입니다. 재현율은 참양성의 수를 실제로 해당 클래스에 속하는 전체 항목 수(참양성과 거짓음성의 합)로 나눈 값입니다. 이러한 정의는 일반 공식과 일치합니다. 정밀도는 검색된 관련 항목을 검색된 모든 항목으로 나눈 값이고, 재현율은 검색된 관련 항목을 모든 관련 항목으로 나눈 값입니다.

디지털 사진에서 개를 인식하도록 설계된 컴퓨터 프로그램을 고려해 보겠습니다. 사진에 고양이 10마리와 개 12마리가 있고, 프로그램이 8개의 요소를 개로 식별했으며, 그중 5개는 실제로 개(참양성)이고 3개는 고양이(거짓양성)라면, 개 7마리는 놓치고(거짓음성) 고양이 7마리는 올바르게 제외됩니다(참음성). 프로그램의 정밀도는 5/8입니다. 선택된 8개 요소 중 5개만 관련이 있기 때문입니다. 재현율은 5/12입니다. 관련 개 12마리 중 5마리만 검색되었기 때문입니다. 이 예는 정밀도와 재현율이 성능의 서로 다른 측면을 포착하는 방식을 보여줍니다.

가설 검정과의 관계

정밀도와 재현율은 가설 검정의 관점에서 이해할 수 있습니다. 일반적인 설정에서 귀무 가설은 주어진 항목이 관련이 없다는 것입니다(예: 개가 아님). 제1종 오류는 관련 항목이 잘못 기각될 때 발생하며, 이는 거짓양성에 해당합니다. 제2종 오류는 관련 없는 항목이 잘못 수용될 때 발생하며, 이는 거짓음성에 해당합니다. 완벽한 정밀도(거짓양성 없음)는 제1종 오류가 없음과 동일하고, 완벽한 재현율(거짓음성 없음)은 제2종 오류가 없음과 동일합니다.

더 일반적으로, 재현율은 제2종 오류율의 보완 개념입니다. 즉, 재현율은 1에서 거짓음성율을 뺀 값입니다. 정밀도는 제1종 오류율과 관련이 있지만 더 복잡한 방식으로, 모집단에서 관련 항목 대 관련 없는 항목의 사전 분포에도 의존합니다. 개 예에서 고양이 10마리 중 거짓양성(제1종 오류)이 3개 있어 제1종 오류율은 3/10입니다. 개 12마리 중 거짓음성(제2종 오류)이 7개 있어 제2종 오류율은 7/12입니다.

정밀도는 품질, 재현율은 양

정밀도는 종종 품질의 척도로 간주되며, 검색된 항목 중 실제로 관련이 있는 항목이 얼마나 되는지를 나타냅니다. 높은 정밀도는 알고리즘이 관련 없는 결과보다 관련 있는 결과를 더 많이 반환한다는 것을 의미합니다. 반면 재현율은 양의 척도로, 관련 항목 중 얼마나 많은 항목이 검색되었는지를 나타냅니다. 높은 재현율은 알고리즘이 관련 없는 결과도 함께 반환하더라도 대부분의 관련 결과를 반환한다는 것을 의미합니다.

이러한 지표는 단독으로는 그다지 유용하지 않습니다. 예를 들어, 데이터 세트의 모든 항목을 검색하면 완벽한 재현율을 달성할 수 있습니다. 반대로, 가능성이 매우 높은 소수의 항목만 선택하면 많은 관련 항목을 놓치더라도 완벽한 정밀도를 달성할 수 있습니다. 따라서 정밀도와 재현율은 일반적으로 함께 평가됩니다.

분류 작업에서 클래스 C에 대한 정밀도 점수 1.0은 클래스 C에 속하는 것으로 레이블이 지정된 모든 항목이 실제로 해당 클래스에 속한다는 것을 의미하지만, 클래스 C의 항목 중 얼마나 많은 항목이 올바르게 레이블되지 않았는지에 대해서는 아무것도 말하지 않습니다. 재현율 1.0은 클래스 C의 모든 항목이 클래스 C에 속하는 것으로 레이블이 지정되었음을 의미하지만, 다른 클래스의 항목 중 얼마나 많은 항목이 클래스 C로 잘못 레이블되었는지에 대해서는 아무것도 말하지 않습니다.

정밀도-재현율 트레이드오프

종종 정밀도와 재현율 사이에는 역의 관계가 있습니다. 하나를 증가시키면 일반적으로 다른 하나가 감소하지만, 응용 분야의 맥락에 따라 어떤 지표가 더 중요하게 여겨질 수 있습니다. 예를 들어, 연기 감지기는 일반적으로 위험이 없는 상황에서도 경보를 울리는 많은 제1종 오류를 범하도록 설계됩니다. 대형 화재 중 경보가 울리지 않는 제2종 오류의 비용이 엄청나게 높기 때문입니다. 따라서 연기 감지기는 많은 오경보를 감수하더라도 모든 실제 위험을 포착하도록 재현율에 중점을 두고 설계됩니다.

반대로, 형사 사법 제도는 종종 정밀도를 강조합니다. 블랙스톤의 비율에 반영된 것처럼 "무고한 한 사람이 고통받는 것보다 유죄인 열 명이 풀려나는 것이 낫다"는 원칙이 이를 보여줍니다. 이 원칙은 제1종 오류(무고한 사람을 유죄 판결)의 비용을 강조합니다. 따라서 시스템은 정밀도에 중점을 두어 잘못된 유죄 판결을 피하고, 더 많은 유죄인 사람이 풀려나 재현율이 감소하는 비용을 감수합니다.

암 종양을 제거하는 뇌 외과 의사도 이러한 트레이드오프를 보여줍니다. 외과 의사는 재발을 방지하기 위해 모든 종양 세포를 제거해야 하지만, 뇌 기능을 보존하기 위해 건강한 뇌 세포를 제거하는 것도 피해야 합니다. 외과 의사가 제거하는 뇌 영역을 더 넓히면 재현율(모든 암 세포 제거)은 높아지지만 정밀도(건강한 세포 제거)는 낮아집니다. 외과 의사가 더 보수적이면 정밀도는 높아지지만 재현율은 낮아집니다. 재현율이 높을수록 모든 암 세포를 제거할 가능성이 높아지지만 건강한 세포를 제거할 위험도 커집니다. 정밀도가 높을수록 건강한 세포를 제거할 위험은 줄어들지만 모든 암 세포를 제거할 가능성도 줄어듭니다.

정밀도-재현율 곡선 및 결합 지표

실제로 정밀도와 재현율 점수는 단독으로 논의되지 않습니다. 정밀도-재현율 곡선은 재현율의 함수로 정밀도를 표시하며, 일반적으로 재현율이 증가함에 따라 정밀도가 감소함을 보여줍니다. 이 곡선은 다양한 임계값에서 모델 성능의 포괄적인 관점을 제공합니다. 또는 한 측정값의 값을 다른 측정값의 고정 수준에서 비교할 수 있습니다(예: 재현율 0.75 수준에서의 정밀도).

정밀도와 재현율을 모두 통합하는 여러 결합 지표가 있습니다. 정밀도와 재현율의 조화 평균인 F1 점수는 모델 성능을 단일 숫자로 요약하는 데 널리 사용됩니다. F1 점수는 클래스 분포가 불균형할 때 특히 유용하며, 정밀도와 재현율 사이의 트레이드오프를 균형 있게 조정합니다. 정밀도-재현율 곡선 아래 면적과 같은 다른 지표도 특히 양성 클래스가 드문 Machine learning 작업에서 모델을 평가하는 데 사용됩니다.

머신 러닝에서의 응용

정밀도와 재현율은 분류 오류가 서로 다른 결과를 초래하는 많은 Machine learning 응용, 특히 Artificial intelligence 시스템에서 필수적입니다. 예를 들어, Large language model 평가에서 정밀도와 재현율은 생성된 응답이나 검색된 문서의 관련성을 평가하는 데 사용될 수 있습니다. Neural network 기반 분류기에서 이러한 지표는 결정 임계값 선택과 모델 매개변수 튜닝을 안내합니다.

사기 탐지나 의료 진단과 같은 불균형 분류 문제에서 정확도는 다수 클래스가 지배하기 때문에 종종 오해를 불러일으킵니다. 정밀도와 재현율은 더 세밀한 관점을 제공하여 실무자가 거짓양성과 거짓음성의 특정 비용에 맞춰 최적화할 수 있게 합니다. Data AugmentationLoss Functions과 같은 기법은 이러한 시나리오에서 정밀도와 재현율을 개선하기 위해 자주 사용됩니다.

한계 및 고려 사항

정밀도와 재현율은 강력하지만 한계가 있습니다. 이들은 일부 맥락에서 중요할 수 있는 참음성을 고려하지 않습니다. 예를 들어, 음성 인스턴스가 많은 이진 분류 문제에서 정밀도와 재현율이 높은 모델도 여전히 많은 거짓양성을 가질 수 있으며, 이는 문제가 될 수 있습니다. 또한 정밀도와 재현율은 양성 클래스 선택에 민감하며, 다중 클래스 설정에서 정의가 모호할 수 있습니다.

더 나아가, 정밀도와 재현율은 양성 클래스의 기본 비율에 의존하므로 서로 다른 데이터 세트나 작업 간에 직접 비교할 수 없습니다. 희귀 질병 데이터 세트에서 높은 재현율을 가진 모델이 일반적인 질병에서는 잘 수행되지 않을 수 있습니다. 따라서 이러한 지표를 해석할 때는 맥락과 다양한 유형의 오류와 관련된 비용을 고려하는 것이 중요합니다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:classification·evaluation-metrics·machine-learning·information-retrieval
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사