샤플리 값은 협동 게임 이론에서의 해법 개념으로, 협력한 플레이어들 간에 총 이득 또는 비용을 공정하게 분배하는 방법을 제공한다. 1951년 로이드 샤플리가 도입했으며, 이후 경제학, 정치학, 그리고 최근에는 모델 예측을 해석하기 위한 머신러닝 분야에서 기본적인 도구가 되었다. 이 값은 다른 플레이어들의 가능한 모든 연합에 대한 평균 한계 기여도를 기준으로 각 플레이어에게 총 보상의 몫을 할당한다. 이는 효율성, 대칭성, 가산성, 그리고 더미 플레이어 속성이라는 네 가지 핵심 속성을 충족하는 유일한 분배 방식으로, 공정한 할당을 위한 널리 인정받는 표준이 되었다.
머신러닝의 맥락에서 샤플리 값은 각 특성이 모델 출력에 기여한 정도를 귀속시켜 개별 예측을 설명하는 데 사용된다. 이 접근 방식은 종종 SHAP(SHapley Additive exPlanations)으로 불리며, 이론적으로 근거가 있고 실질적으로 적용 가능한 특성 중요도의 통합 프레임워크를 제공한다. 정확한 샤플리 값을 계산하는 계산 복잡도는 특성 수에 따라 기하급수적으로 증가하므로, 다양한 근사 방법의 개발로 이어졌다.
정의 및 공식
공식적으로, 플레이어 집합 \( N \)과 각 부분 집합(연합) \( S \subseteq N \)에 실수를 할당하는 가치 함수 \( v \)를 가진 협동 게임을 고려하자. 플레이어 \( i \)에 대한 샤플리 값은 다음과 같이 정의된다:
\[ \phi_i(v) = \sum_{S \subseteq N \setminus \{i\}} \frac{|S|! (n - |S| - 1)!}{n!} (v(S \cup \{i\}) - v(S)) \]
여기서 \( n = |N| \)이다. 이 공식은 연합이 형성될 수 있는 모든 가능한 순서에 대한 플레이어 \( i \)의 평균 한계 기여도로 해석될 수 있다. 동등한 공식은 모든 \( n! \) 플레이어 순열에 대한 합으로, \( P_i^R \)는 순서 \( R \)에서 \( i \) 앞에 있는 플레이어 집합이다:
\[ \phi_i(v) = \frac{1}{n!} \sum_R \left[ v(P_i^R \cup \{i\}) - v(P_i^R) \right] \]
가치 함수 \( v(S) \)는 연합 \( S \)가 협력을 통해 달성할 수 있는 총 보상을 나타낸다. 샤플리 값은 총 가치 \( v(N) \)를 모든 플레이어에게 분배하여, 각 플레이어가 전체 결과에 대한 평균 기여도를 받도록 보장한다.
속성
샤플리 값은 공정한 분배에 필수적인 것으로 간주되는 다음 네 가지 공리를 충족하는 유일한 해법 개념이다:
- 효율성: 모든 샤플리 값의 합은 대연합의 총 가치와 같다, \( \sum_{i \in N} \phi_i(v) = v(N) \). 이는 전체 보상이 분배되도록 보장한다.
- 대칭성: 두 플레이어 \( i \)와 \( j \)가 모든 연합에 동일하게 기여한다면(즉, 모든 \( S \subseteq N \setminus \{i,j\} \)에 대해 \( v(S \cup \{i\}) = v(S \cup \{j\}) \)), 그들은 동일한 샤플리 값을 받는다. 이는 동일한 기여자 간의 공정성을 보장한다.
- 가산성: 두 게임 \( v \)와 \( w \)에 대해, 결합된 게임 \( v + w \)의 샤플리 값은 개별 게임의 샤플리 값의 합이다, \( \phi_i(v + w) = \phi_i(v) + \phi_i(w) \). 이 속성은 복잡한 게임의 분해를 가능하게 한다.
- 더미 플레이어 속성: 플레이어 \( i \)가 어떤 연합에도 가치를 더하지 않는다면(즉, 모든 \( S \subseteq N \setminus \{i\} \)에 대해 \( v(S \cup \{i\}) = v(S) \)), \( \phi_i(v) = 0 \)이다. 이는 기여하지 않는 플레이어가 아무것도 받지 않도록 보장한다.
이러한 속성은 샤플리 값을 참여자 간의 신용 또는 비용을 할당하는 독특하고 원칙적인 방법으로 만든다.
머신러닝에서의 응용
머신러닝에서 샤플리 값은 각 특성을 플레이어로, 모델의 출력을 가치 함수로 취급하여 모델 예측을 해석하는 데 적용된다. 주어진 예측에 대해, 특성의 샤플리 값은 모델 출력과 평균 예측 간의 차이에 대한 기여도를 정량화한다. 이 접근 방식은 SHAP으로 알려져 있으며, 2017년 스콧 런드버그와 수인 리에 의해 대중화되었다. SHAP 값은 샤플리 값의 공리와 일치하는 특성 중요도의 통합 측정을 제공하여, 모델 해석 가능성을 위한 신뢰할 수 있는 도구가 된다.
머신러닝에서 샤플리 값의 사용은 특히 금융, 의료, 자율 시스템과 같이 모델 결정을 이해하는 것이 중요한 분야에서 크게 증가했다. 예를 들어, 신용 점수 평가에서 SHAP 값은 대출 승인 결정에 가장 큰 영향을 미치는 요소를 밝혀내어 규제 준수 및 공정성 감사에 도움을 준다. 의료 진단에서는 임상의가 모델이 특정 상태를 예측하는 이유를 이해하도록 도와 AI 지원 결정에 대한 신뢰를 높인다.
계산 과제
정확한 샤플리 값을 계산하려면 가능한 모든 \( 2^n \) 연합에 대해 가치 함수를 평가해야 하므로, 특성이 많은 모델에는 계산적으로 불가능하다. \( n \)개의 특성을 가진 모델의 경우 복잡도는 \( O(2^n) \)이며, 수십 개 이상의 특성에는 정확한 계산이 비현실적이다. 이를 해결하기 위해 여러 근사 방법이 개발되었다:
- 몬테카를로 샘플링: 특성의 순열을 무작위로 샘플링하고 한계 기여도를 평균화하여, 제어 가능한 분산을 가진 편향되지 않은 추정치를 제공한다.
- TreeSHAP: 트리 기반 모델(예: 랜덤 포레스트, 그래디언트 부스팅)을 위해 특별히 설계된 알고리즘으로, 결정 트리의 구조를 활용하여 다항 시간 내에 정확한 샤플리 값을 계산한다.
- KernelSHAP: 가중 선형 회귀를 사용하여 샤플리 값을 근사하는 모델 불가지론적 방법으로, 모든 블랙박스 모델에 적합하다.
- 그래디언트 기반 방법: 신경망의 경우, 그래디언트 또는 어텐션 메커니즘을 사용한 근사가 빠른 추정치를 제공할 수 있지만, 모든 샤플리 공리를 충족하지 않을 수 있다.
이러한 근사 방법 덕분에 해석 가능성이 점점 더 중요한 딥 뉴럴 네트워크 및 대규모 언어 모델을 포함한 대규모 머신러닝 모델에 샤플리 값을 적용하는 것이 실현 가능해졌다.
관련 개념 및 확장
샤플리 값은 다양한 요구를 충족시키기 위해 여러 방식으로 확장되고 적응되었다. 협동 게임 이론에서 샤플리-슈빅 권력 지수와 반즈하프 권력 지수는 투표 게임을 위한 특수 응용이다. 머신러닝에서 SHAP은 특성 간의 상호 작용을 처리하도록 확장되어, 시너지 효과를 포착하는 2차 귀속을 제공한다. 또한 이 개념은 대규모 언어 모델의 동작을 설명하는 데 적용되어, 입력 텍스트의 어떤 부분이 생성된 출력에 가장 큰 영향을 미치는지 식별하는 데 도움을 준다.
샤플리 값은 LIME(로컬 해석 가능 모델 불가지론적 설명)과 같은 다른 귀속 방법과도 관련이 있지만, 공리적 기반으로 인해 더 강력한 이론적 보장을 제공한다. LIME은 로컬 충실도에 초점을 맞추는 반면, SHAP은 일관성과 로컬 정확성을 보장하여 많은 실용 응용에서 선호되는 선택이 된다.
역사적 배경
로이드 샤플리는 1951년 논문 "n인 게임의 가치"에서 이 개념을 도입하여 협동 게임 이론의 기초를 마련했다. 그의 연구는 2012년 알빈 로스와 함께 안정적 할당 이론 및 시장 설계 실천에 대한 기여로 노벨 경제학상을 수상했다. 샤플리 값은 이후 경제 이론의 초석이 되어 비용 할당, 이익 공유, 네트워크 분석과 같은 분야에 영향을 미쳤다.
2010년대에는 머신러닝의 부상과 모델 해석 가능성의 필요성으로 샤플리 값이 주목받게 되었다. 연구자들은 협동 게임의 공정성 공리가 모델 예측 설명 요구 사항과 일치한다는 것을 인식하고, SHAP의 개발과 광범위한 채택으로 이어졌다. 오늘날 샤플리 값은 데이터 과학자와 AI 연구자의 도구 상자에서 표준 도구가 되어, 게임 이론과 현대 인공지능 사이의 간극을 메우고 있다.
같이 보기
참고 문헌
- Shapley, L. S. (1951). "A Value for n-Person Games." In Contributions to the Theory of Games, volume II.
- Lundberg, S. M., & Lee, S.-I. (2017). "A Unified Approach to Interpreting Model Predictions." Advances in Neural Information Processing Systems.
- Strumbelj, E., & Kononenko, I. (2014). "Explaining Prediction Models and Individual Predictions with Feature Contributions." Knowledge and Information Systems.