정밀도와 재현율

영어에서 번역됨

정밀도와 재현율은 분류 성능 지표로, 각각 검색된 사례 중 관련성이 있는 비율과 관련성 있는 사례 중 검색된 비율을 측정한다. 이는 거짓 양성과 거짓 음성 사이의 상충 관계를 정량화한다.

정밀도와 재현율은 분류 또는 정보 검색 시스템의 품질을 평가하는 데 사용되는 두 가지 기본적인 성능 지표이다. 이들은 모델이 데이터 집합에서 관련 항목을 얼마나 잘 식별하는지 정량화하며, 거짓 양성과 거짓 음성의 비용을 균형 있게 조정한다. 정밀도는 양성 예측값이라고도 불리며, 검색된 항목 중 실제로 관련이 있는 항목의 비율을 측정한다. 재현율은 민감도라고도 알려져 있으며, 전체 관련 항목 중 성공적으로 검색된 항목의 비율을 측정한다. 이 둘을 함께 사용하면 정확도 단독으로 제공하는 것보다 모델의 동작에 대한 더 세밀한 관점을 제공하며, 특히 불균형한 크기이거나 다양한 오류의 비용이 다를 때 유용하다.

공식적으로, 정밀도는 참 양성 수를 시스템이 양성으로 분류한 전체 항목 수(참 양성 + 거짓 양성)로 나눈 값으로 계산된다. 재현율은 참 양성 수를 실제로 양성 크래스에 속하는 전체 항목 수(참 양성 + 거짓 음성)로 나눈 값으로 계산된다. 예를 들어, 디지털 사진에서 개를 인식하도록 설계된 컴퓨터 프로그램을 고려해 보자. 사진에 고양이 10마리와 개 12마리가 있고 프로그램이 요소 8개를 개로 식별했는데, 그중 5개가 실제 개(참 양성)이고 3개가 고양이(거짓 양성)라면, 개 7마리를 놓치고(거짓 음성) 고양이 7마리를 올바르게 제외했으며(참 음성), 정밀도는 5/8이며, 선택된 8개 요소 중 5개만 관련이 있기 때문이다. 재현율은 5/12이며, 관련 있는 개 12마리 중 5마리만 발견되었기 때문이다.

통계적 오류와의 관계

정밀도와 재현율은 통계적 가설 검정의 개념과 직접적으로 매핑된다. 귀무 가설이 주어진 항목이 관련이 없다는 경우, 관련 없는 항목이 잘못 선택되면 거짓 양성(제1종 오류)이 발생하고, 관련 있는 항목을 놓치면 거짓 음성(제2종 오류)이 발생한다. 완벽한 정밀도는 거짓 양성이 없음을 의미하며, 검색된 모든 항목이 관련이 있다는 뜻이다. 완벽한 재현율은 거짓 음성이 없음을 의미하며, 모든 관련 항목이 검색된다는 뜻이다. 재현율은 단순히 제2종 오류의 보완으로, 1에서 그 비율을 뺀 값이다. 정밀도는 제1종 오류 비율과 관련이 있지만 더 복잡한 방식으로, 이는 또한 모집단에서 관련 항목 대 비관련 항목의 사전 분포에 의존한다. 개 인식 예에서, 고양이 10마리 중 3개의 제1종 오류가 있어 제1종 오류 비율은 3/10이고, 개 12마리 중 7개의 제2종 오류가 있어 제2종 오류 비율은 7/12이다.

해석과 활용성

정밀도는 종종 품질의 척도로 설명되며, 양성 소을 얼마나 신뢰할 수 있는지 나타낸다. 재현율은 양의 척도로, 시스템의 양수 클래스에 대한 보망 범위가 얼마나 완전한지 나타낸다. 높은 정밀도는 알고리즘이 대부분 관련 결과를 반환한다는 것을 의미하고, 높은 재현율은 일부 비관련 결과를 포함하더라도 대부분 관련 결과를 반환한다는 것을 의미한다. 이 지표는 단독으로는별로 유용하지 않다. 시스템은 단순히 수집된 모든 항목을 검색함으로써 완벽한 재현율을 달성할 수 있지만, 그러한 시스템은 정밀도가 매우 낮다. 반대로, 시스템은 거의 확실하게 관련된 단일 항목만 선택하면 정밀도를 완벽하게 달성할 수 있지만, 이는 재현율을 희생하게 된다. 실제로 정밀도와 재현율은 일반적으로 함께 보고되며, 종종 재현율의 함수로서 정밀도를 플롯하는 정밀도-재현율 곡선을 통해 보고한다. 일반적으로 정밀도는 재현율이 증가하면 감소하며, 이는 둘 사이의 내재된 우입니다.

정밀도-재현율의 우위

정밀도와 재현율 사이에는 종종 역의 관계가 있으며, 하나를 높이는 것은 다른 것을 줄이기 때문에 올 때가 있으며한다. 최적의 균형은 특정 애플리케이션과 다양한 유형의 오류에서 비용의 상대적 가중치 암식 마다 달라진다. 연기 감지기는 재현율에 중점을 두고 설계된 시스템의 전형적인 예이다. 실제 화재 중에 경고를 실패하는 비용이 지나치게 높기 때문에, 의도적으로 거짓 경보(제1종 오류)에 취약하다. 감지기는 모든 진짜 위험을 포착하기 위해 정밀도를 희생한다. 반대로, 형사 사법 시스템는 "열 명의 유죄인이 풀려나더라도 한 명의 무고자가 고통받는 것보다 낫다"는는 브랙스턴의 원칙에 따라 정밀도를 강조한다. 시스템은 심지어 더 많은 유죄 개인이 자유유지하더라도 무고한 사람을 유죄 판결하는 것을 피하도록 설계되며, 재현율을 희생한다.

악성 종양을 제거하는 뇌 외과 의사는 개인적 수준과 그 트레이드오프를 보여준다. 외과 의사는 재발을 방지하기 위해 모든 종양 세포를 제거해야 하지만, 기능을 보존하려면 건강한 뇌 세포를 제거하는 것을 피해야 한다. 더 관용적인 접근 방식은 종양 주변의 더 넓은 영역을 제거하여 재현율을 높이며 모든 암세포가 추출되도록 하지만, 건강한 조직을 제거할 가능성도 높다. 더 보수적인 접근 방식은 확인된 암세포만 대상으로 하는 정밀도를 높이지만, 일부 종양 세포가 남는 위험이 있다. 두 결과 모두 심각한 결과를 초리하고출하며, 외과 의사의 선택은 정밀도와 재현율에 대한 상대적 가중치를 반영한다.

기계학습에서의 용례

Machine learning에서 정밀도와 재현율은 불균형 데이터가 있는 분야에서 특히 분류 모델의 표준 평가 지표이다. 예를 들어, 의료 진단에서 드물리지를 감지하는 모델은 다중 분류를 예측함으로써 높은 정확도를 가질 수 있지만, 정밀도와 재현율은 실제 유용성을 드러낸다. Artificial intelligence 연구에서 이러한 지표는 객체 탐지, 스팸 필터링 및 문서 검색과 같은 작업에서 모델을 비교하는 데 사용된다. 또한 F1 점수와 같은 파생 지표(TMI)의 기초가 되며, 이는 정밀도와 재현율의 조화 평균으로, 둘 모두를 균형 있게하는 단일 숫자를 제공한다. 이 개념은 이진 분류를 넘어 다중 클래스 설정으로 확장되며, 여기서 정밀도와 재현율은 클래스별로 계산된 후 집계된다.

정보 검색에서의 응용

정밀도와 재현율은 정보 검색 분야에서 생겨났으며, 여기서 검색 엔진과 데이터베이스 쿼리 시스템을 평가한다. 이 상황에서 정밀도는 사용자의 쿼리와 관련된 검퓨된 문서의 비율을 측정하고, 재현율은 검색된 모든 관련 문서에서 검색된 것을 측정한다. 검색 엔진은 종종 우위에 직면한다. 더 많은 데이터를 결과로 제공하면 재현울이 증가할 수 있지만 관련 없는 페이지로 인해 정밀도가 희석될 수 있다. 순위 시스템은 10개의 결과에 대한 정밀도(정밀도@10)와 같은 고정된 수의 결과 사에서 정밀도를 사용하여 상위 결과의 품질을 평가한다. 이러한 지표는 Large language modelGenerative AI에 기반한 최신 시스템을 포함하여 모런 검색 시스템을 평가하는 데 여전히 중심적인이다.

한계와 확장

정밀도와 재현율에는 한계가 있다. 이들은 일부 응용에서 중요할 수 있는 참음성을 고려하지 않는다. 또한 양수 클래스의 선택에 민감하며, 그 해석은 양수 클래스의 사전 확률에 따라 달라진다. 양수가 드물 경우, 재현율은 많은 거짓 양성을 도입되지 않고 개선하기 어려울 수 있다. 이러한 문제를 해결하기 위해 연구자들은 F1 점수, 정밀도-재현율 곡선 아래 면적, 매튜 상관 계수와 관련 지표를 개발했다. 실제로 지표의 선택은 응용의 목표에 달려 있으며, 정밀도와 재현율은 종종 모델 성능을 완전히 파악하기 위해 다른 통계량과 함께 보고된다.

참조 항목

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:classification·information-retrieval·machine-learning·evaluation-metrics
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사