공정성 지표는 머신러닝 모델의 예측이나 결정이 개인 또는 집단을 공평하게 대우하는지 평가하는 데 사용되는 정량적 측정 기준이다. 이러한 지표는 자동화된 의사 결정 과정에서 알고리즘 편향을 교정하는 것을 목표로 하는 머신러닝 공정성 분야의 핵심이다. 이러한 모델의 결정은 성별, 민족, 성적 지향성 또는 장애와 같은 민감한 변수에 기반한 경우 불공정한 것으로 간주될 수 있다. 많은 윤리적 개념과 마찬가지로 공정성과 편향에 대한 정의는 논란의 여지가 있을 수 있으며, 공정성 지표는 채용, 대출, 형사 사법 및 콘텐츠 전달과 같이 사람들의 삶에 영향을 미치는 시스템에서 경쟁하는 형평성 개념을 평가하는 공식적이고 운영적인 방법을 제공한다.
공정성 지표의 개발은 머신러닝에서 비교적 최근의 관심사이며, 2016년 이후 연구가 급격히 증가했다. 이러한 급증은 부분적으로 미국 법원에서 재범을 예측하는 데 널리 사용되는 소프트웨어인 COMPAS가 인종적으로 편향되었다고 주장한 2016년 ProPublica의 영향력 있는 보고서에 의해 촉발되었다. 이 보고서는 흑인 피고인이 백인 피고인보다 고위험으로 잘못 분류될 가능성이 거의 두 배 높은 반면, 백인 피고인의 경우 반대 오류가 발생한다고 강조했다. COMPAS의 제작사인 Northepointe Inc.는 이 findings에 이의를 제기했지만, 이 논란은 공정성에 대한 명시적이고 측정 가능한 정의의 필요성을 강조했다. 의사 결정에서 공정성에 대한 정량적 논의는 머신러닝 시대 이전에 존재했으며, 1964년 미국 민권법 이후 1960년대 중반과 1970년대에 번성했지만, 공정성에 대한 경쟁적 개념으로 인해 1970년대 후반에 논쟁이 크게 사라졌다.
통계적 공정성 기준
공정성 지표는 종종 그들이 인코딩하는 통계적 공정성 개념에 따라 분류된다. 일반적인 그룹 중 하나는 보호된 그룹 간에 결과가 유사해야 한다는 그룹 공정성이다. 통계적 패리티라고도 알려진 인구 통계적 패리티는 긍정적 예측의 확률이 그룹 간에 동일해야 한다고 요구한다. 동등한 확률(Equalized odds)은 진양성률과 위양성률이 그룹 간에 동일해야 하며, 이는 모델이 모든 그룹에 대해 동등하게 잘 수행됨을 의미한다. 동등한 기회(Equal opportunity)는 동일한 진양성률에만 초점을 맞춘 완화된 버전이다. 그룹별 보정과 같은 보정 기반 지표는 특정 결과 확률로 예측된 개인의 경우 실제 결과 빈도가 그룹 간에 동일해야 한다고 요구한다. 이러한 기준은 종종 상호 양립할 수 없으며, 하나를 충족하면 다른 하나를 위반할 수 있어 대부분의 실제 환경에서 모든 것을 동시에 달성하는 것이 불가능하다.
개인 및 반사실적 공정성
그룹 수준 지표를 넘어, 공정성은 개인 수준에서 평가될 수 있다. 카네기 멜론 대학교 연구자들을 포함한 연구자들이 제안한 개인 공정성은 유사한 개인이 유사한 예측을 받아야 한다는 것을 요구한다. 이는 일반적으로 관련 특징을 포착하는 거리 측정 기준을 사용하여 공식화되며, 민감하지 않은 모든 측면에서 유사한 두 사람이 동일하게 대우받도록 보장한다. 반사실적 공정성은 인종이나 성별과 같은 민감한 속성이 다른 모든 것을 동일하게 유지하면서 달라진다면 예측이 변경될지 묻는 방식으로 이 아이디어를 확장한다. 결과가 다르다면 모델은 불공정한 것으로 간주된다. 이러한 접근 방식은 더 세분화되어 있지만 유사성과 인과 관계의 신중한 지정이 필요하며, 이는 실제로 어려울 수 있다.
모델의 편향 원인
공정성 지표는 다양한 원인에서 발생하는 편향을 감지하는 데 사용된다. 언어 편향은 쿼리 언어와 관련된 통계적 샘플링 편향의 한 유형으로, 저장소에서 주제와 관점을 정확하게 대표하지 못하게 하는 정보 샘플링의 체계적 편차를 초래한다. Luo 등의 연구에 따르면 주로 영어 데이터로 훈련된 현재의 대규모 언어 모델은 종종 앵글로-아메리칸 관점을 진실로 제시하면서 비영어권 관점을 경시한다. 예를 들어, 자유주의와 같은 정치 이념에 대해 질문할 때 모델은 인권과 평등을 앵글로-아메리칸 관점에서 강조할 수 있지만, 베트남 관점의 "국가의 개인 및 경제 생활 개입 반대" 또는 중국 관점의 "정부 권력 제한"과 같은 측면은 생략할 수 있다. 성별 편향은 또 다른 일반적인 문제로, 모델이 간호사나 비서를 여성과, 엔지니어나 CEO를 남성과 연관시키는 등 전통적인 성 역할에 따라 역할과 특성을 할당한다. 정치적 편향은 훈련 데이터에 다양한 의견이 포함되어 모델이 유행에 따라 특정 이데올로기로 기울어질 때도 발생한다.
실제 편향 측정
공정성 지표를 적용하기 위해 실무자는 일반적으로 보호 속성(예: 인종, 성별, 연령)을 정의하고 적절한 지표(예: 동등한 확률)를 선택한 다음 검증 데이터 세트에서 지표를 계산한다. 이진 분류의 경우 혼동 행렬을 사용하여 각 그룹의 위양성 및 위음성 비율을 도출한다. 일반적인 지표인 불균형 영향(Disparate impact)은 불리한 그룹과 유리한 그룹 간의 긍정적 예측 비율의 비율로 계산되며, 미국 평등 고용 기회 위원회 지침에 따라 0.8 미만의 비율은 종종 위험 신호로 간주된다. 이 프로세스를 용이하게 하기 위한 도구가 개발되었다. IBM은 편향을 줄이고 공정성을 높이는 알고리즘을 포함한 Python 및 R용 오픈 소스 툴킷을 출시했다. Google은 머신러닝 편향을 연구하고 대응하기 위한 지침과 도구를 발표했다. Facebook은 AI에서 편향을 감지하기 위해 Fairness Flow라는 도구를 사용한다고 보고했지만, 비평가들은 모든 프로그램에 적용할 수 없고 사용이 선택적이기 때문에 직원들이 거의 사용하지 않아 회사의 노력이 충분하지 않다고 주장한다.
사례 연구 및 논란
법률 시스템에서 알고리즘 의사 결정의 사용은 주목할 만한 조사 영역이었다. 2014년 미국 법무장관 Eric Holder는 위험 평가 방법이 교육 수준이나 사회경제적 배경과 같은 피고인의 통제 밖에 있는 요소에 과도한 초점을 둘 수 있다는 우려를 제기했다. COMPAS에 대한 2016년 ProPublica 보고서는 어떤 공정성 지표가 적절한지에 대한 광범위한 논쟁을 불러일으켰다. ProPublica는 위양성률과 관련된 지표를 사용한 반면, Northepointe는 보정 기반 공정성을 주장했다. 이 사례는 서로 다른 공정성 정의 사이의 근본적인 긴장을 보여준다. 형사 사법을 넘어 이미지 인식에서도 편향이 문서화되었다. 2015년 Google은 Google Photos가 흑인 커플을 고릴라로 잘못 분류한 후 사과했다. Flickr의 자동 태그 기능은 일부 흑인을 "유인원"과 "동물"로 분류했다. AI 알고리즘이 심사한 2016년 국제 미인 대회는 훈련 데이터 편향으로 인해 피부가 밝은 개인을 선호했다. 2018년 상업용 성별 분류 알고리즘 3개에 대한 연구에 따르면 밝은 피부의 남성에게 가장 정확하고 어두운 피부의 여성에게 가장 부정확했다. 2020년 Twitter 이미지 크롭 도구는 밝은 피부의 얼굴을 선호하는 것으로 나타났다. 2022년 텍스트-이미지 모델 DALL-E 2의 제작자는 생성된 이미지가 상당히 고정관념적임을 인정했다.
한계 및 진행 중인 연구
공정성 지표는 만병통치약이 아니다. 공정성에 대한 보편적인 정의는 없으며, 서로 다른 지표가 모순될 수 있어 모델을 판단하기 어렵다. 지표를 선택하는 것은 주어진 맥락에서 공정성이 무엇을 구성하는지에 대한 가치 판단을 본질적으로 수반한다. 또한 지표는 통계적 패턴만 측정할 뿐 편향된 데이터 수집이나 사회적 불평등과 같은 편향의 근본 원인을 해결하지 않는다. 편향의 기원, 편향 유형 및 이를 줄이는 방법에 대한 연구가 계속되고 있다. 데이터 증강, 재가중치 부여 및 적대적 디바이어싱과 같은 기술이 공정성 점수를 개선하는 데 사용되지만 모델 정확도와 상충될 수 있다. 2020년대 중반 현재 이 분야는 여전히 활발하며, 여러 보호 속성을 동시에 고려하는 인과적 공정성 및 교차적 공정성과 같은 영역에서 지속적인 작업이 이루어지고 있다. 스탠포드 AI 연구소 및 버클리 AI 연구를 포함한 기술 기업과 학술 기관은 이 진화하는 학문에 계속 기여하고 있다.
배포를 위한 실용적 고려 사항
고위험 영역에서 머신러닝 시스템을 배포할 때 조직은 법적 및 윤리적 요구 사항에 부합하는 공정성 지표를 신중하게 선택해야 한다. 예를 들어, 채용에서는 모든 그룹의 자격 있는 후보자가 간과되지 않도록 동등한 기회를 우선시할 수 있다. 신용 대출에서는 모든 인구 통계에 대해 위험 점수가 정확하도록 보정을 강조할 수 있다. 모델이 드리프트하고 새로운 편향이 나타날 수 있으므로 시간이 지남에 따라 공정성을 모니터링하는 것도 중요하다. 문서화와 투명성은 중요하며, 많은 조직이 이제 그룹 간 공정성 지표를 보고하는 모델 카드를 게시한다. 그러나 COMPAS 사례에서 볼 수 있듯이 잘 문서화된 모델조차도 어떤 지표가 올바른지에 대한 분쟁에 직면할 수 있다. 궁극적으로 공정성 지표는 책임성을 위한 도구이지만 해석하고 행동하기 위해서는 인간의 판단이 필요하다. 더 넓은 목표는 집계 지표에서 잘 수행될 뿐만 아니라 개인의 존엄성을 존중하고 사회적 형평성을 촉진하는 시스템을 구축하는 것이다.
향후 방향
공정성 지표의 미래 연구는 여러 과제를 해결할 가능성이 높다. 하나는 통계적 추정이 노이즈가 많은 소수 그룹의 작은 표본 크기에 강건한 지표를 개발하는 것이다. 또 다른 하나는 전통적인 분류 지표가 적용되지 않는 텍스트나 이미지를 생성하는 생성 모델과 같은 복잡한 출력을 위한 지표를 만드는 것이다. 예를 들어, 생성 AI에서 공정성을 평가하려면 고정관념적이거나 편향된 콘텐츠를 감지하는 새로운 접근 방식이 필요하다. 또한 영향을 받는 커뮤니티가 자신의 맥락에서 공정성이 무엇을 의미하는지 정의하는 데 도움을 주는 참여적 접근 방식에 대한 관심도 증가하고 있다. 머신러닝이 AI 시스템의 의료부터 자율 주행 차량까지 더욱 보편화됨에 따라 엄격하고 맥락에 민감한 공정성 지표에 대한 수요는 더욱 증가할 것이다. 이 분야는 컴퓨터 과학, 통계학, 법학 및 철학을 활용하는 학제 간 분야이며 학술 연구와 산업 실무 모두에서 활발한 영역으로 남아 있다.