설명 가능한 머신러닝(IML)은 인공지능 및 머신러닝의 하위 분야로, AI 모델의 행동과 예측을 인간이 이해할 수 있도록 투명하게 만드는 것을 목표로 한다. 머신러닝 모델, 특히 딥러닝 시스템이 복잡해짐에 따라 내부 의사 결정 과정이 불투명해지는 경우가 많아 '블랙박스' 문제가 발생한다. IML 기법은 이러한 모델을 설명, 시각화, 감사할 수 있는 도구와 방법을 제공하여 이해관계자가 모델이 특정 예측을 하는 이유를 이해하고, 잠재적 편향을 식별하며, AI 시스템에 대한 신뢰를 구축할 수 있도록 한다. 이 분야는 규제 압력, 윤리적 우려, 그리고 의료, 금융, 자율 주행과 같은 고위험 영역에서 모델을 디버깅하고 개선해야 하는 실질적 필요로 인해 중요성이 커지고 있다.
해석 가능성은 단일한 속성이 아니라 스펙트럼으로 존재한다. 선형 회귀나 의사 결정 트리와 같은 일부 모델은 구조가 직접적인 인간 검토를 허용하기 때문에 본질적으로 해석 가능하다. 반면, 신경망이나 대규모 트랜스포머 기반 모델과 같은 다른 모델은 사후 설명 방법이 필요하다. IML은 본질적으로 해석 가능한 모델을 설계하는 것과 이미 훈련된 복잡한 모델을 설명하는 기법을 개발하는 것을 모두 포함한다. 해석 가능성 접근 방식의 선택은 모델 유형, 대상 사용자(예: 데이터 과학자, 규제 기관, 최종 사용자), 그리고 제기되는 특정 질문(예: 전체 행동 대 개별 예측)에 따라 달라진다.
전체적 대 국지적 해석 가능성
해석 가능성 방법은 종종 전체적(global)과 국지적(local)의 두 가지 주요 유형으로 분류된다. 전체적 해석 가능성은 전체 모델 행동을 설명하는 것을 목표로 하며, 모델이 가능한 모든 입력에 대해 어떻게 결정을 내리는지에 대한 이해를 제공한다. 특성 중요도 점수(예: 순열 중요도) 및 부분 의존성 도표(PDP)와 같은 기법은 특성이 예측에 미치는 평균 효과를 요약한다. 전체적 방법은 모델 감사와 학습된 패턴에 대한 높은 수준의 통찰력을 얻는 데 유용하다.
국지적 해석 가능성은 개별 예측을 설명하는 데 초점을 맞춘다. 특정 입력에 대해 국지적 방법은 출력을 생성하는 데 가장 영향력이 큰 특성을 식별한다. 일반적인 국지적 기법에는 LIME(국지적 해석 가능한 모델 비의존적 설명) 및 SHAP(SHapley Additive exPlanations)이 포함된다. 협동 게임 이론에 기반한 SHAP는 특정 예측에 대해 각 특성에 중요도 값을 할당하여 일관성과 국지적 정확성을 보장한다. 국지적 설명은 대출 거절이나 의료 진단과 같은 특정 결정을 신뢰해야 하는 최종 사용자에게 중요하다.
모델 비의존적 대 모델 특정 방법
해석 가능성 기법은 또한 모델 비의존적(model-agnostic) 접근 방식과 모델 특정(model-specific) 접근 방식으로 나눌 수 있다. LIME, SHAP, 순열 중요도와 같은 모델 비의존적 방법은 모델을 블랙박스로 취급하고 예측에 대한 접근만 필요로 한다. 이들은 모든 머신러닝 모델에 적용할 수 있어 매우 다재다능하다. 이러한 방법은 종종 입력을 교란하고 출력 변화를 관찰하여 특성 중요도를 추론하는 방식으로 작동한다.
모델 특정 방법은 특정 모델 아키텍처에 맞춰진다. 예를 들어, 랜덤 포레스트나 그래디언트 부스팅 머신과 같은 트리 기반 모델의 경우 특성 중요도를 트리 구조에서 직접 계산할 수 있다. 딥러닝 모델의 경우, 살리언시 맵(합성곱 네트워크용) 및 주의 가중치(트랜스포머용)와 같은 기법이 모델이 입력의 어떤 부분에 집중하는지에 대한 통찰력을 제공한다. 모델 특정 방법은 더 효율적이고 정확할 수 있지만, 모델 비의존적 접근 방식의 일반성은 부족하다.
본질적으로 해석 가능한 모델
블랙박스를 설명하는 대안은 처음부터 해석 가능한 모델을 구축하는 것이다. 본질적으로 해석 가능한 모델에는 선형 회귀, 로지스틱 회귀, 의사 결정 트리, 규칙 기반 시스템이 포함된다. 이러한 모델은 투명한 구조로 인해 인간이 모든 예측을 입력 특성까지 추적할 수 있다. 예를 들어, 의사 결정 트리는 일련의 if-then 규칙으로 시각화될 수 있어 결정 경로를 이해하기 쉽다.
최근 연구는 복잡한 모델의 정확성과 단순한 모델의 투명성을 결합한 하이브리드 접근 방식을 탐구하고 있다. 예를 들어, '글라스박스' 모델인 설명 가능한 부스팅 머신(EBM)은 쌍별 상호 작용을 포함한 가산 모델을 사용하여 블랙박스 모델에 필적하는 정확성을 달성하면서도 완전히 해석 가능한 상태를 유지한다. 이러한 모델은 설명 가능성이 필수인 규제 산업에서 특히 매력적이다.
사후 설명 기법
이미 훈련된 복잡한 모델의 경우 사후 설명 기법이 필수적이다. 이러한 방법은 여러 범주로 나눌 수 있다:
- 특성 기여도: SHAP와 LIME과 같은 방법은 개별 예측에 대해 입력 특성에 중요도 점수를 할당한다. SHAP 값은 게임 이론의 Shapley 값에 기반하여 특성 간 공정한 기여 분배를 보장한다.
- 살리언시 맵: 주로 컴퓨터 비전에서 사용되며, 모델 출력에 가장 큰 영향을 미치는 이미지 영역을 강조한다. Grad-CAM(그래디언트 가중 클래스 활성화 매핑)과 같은 기법은 그래디언트를 사용하여 시각적 설명을 생성한다.
- 대리 모델: 더 단순하고 해석 가능한 모델(예: 의사 결정 트리)이 복잡한 모델의 예측을 국지적 또는 전체적으로 근사하도록 훈련된다. LIME은 국지적 대리 모델의 대표적인 예이다.
- 반사실적 설명: 이는 모델 예측을 변경할 입력의 최소 변경 사항을 설명한다. 예를 들어, '수입이 5,000달러 더 높았다면 대출이 승인되었을 것입니다'와 같은 형태이다. 반사실적 설명은 최종 사용자에게 직관적이고 실행 가능하다.
- 개념 활성화 벡터: 딥 모델의 경우, 이 기법은 특정 예측과 관련된 인간이 이해할 수 있는 개념(예: 이미지의 '줄무늬')을 식별한다.
도전 과제와 한계
진전에도 불구하고 해석 가능성은 상당한 도전에 직면한다. 주요 문제 중 하나는 정확성과 해석 가능성 간의 균형이다. 더 단순한 모델은 종종 덜 정확한 반면, 복잡한 모델은 설명하기 더 어렵다. 그러나 최근 연구는 높은 정확성을 가진 모델이 충분한 노력으로 해석 가능해질 수 있으므로 이 균형이 본질적이지 않을 수 있음을 시사한다.
또 다른 도전은 설명의 신뢰성이다. 일부 사후 방법은 오해를 불러일으키거나 불안정한 설명을 생성할 수 있다. 예를 들어, 살리언시 맵은 무관한 특성을 강조할 수 있고, SHAP 값은 대규모 모델에 대해 계산 비용이 높을 수 있다. 또한 설명이 실제 모델 행동에 충실하지 않아 잘못된 이해를 유발할 수 있다.
인간 평가의 문제도 있다. '좋은' 설명이 무엇인지는 주관적이고 맥락에 따라 달라진다. 연구자 Carlos Guestrin 및 Aleksander Madry는 사용자 연구와 형식적 보장을 포함한 해석 가능성 방법의 엄격한 평가 필요성을 강조해 왔다.
응용 및 중요성
설명 가능한 머신러닝은 결정이 중요한 결과를 가져오는 영역에서 중요하다. 의료에서 환자 결과를 예측하는 모델은 임상의의 신뢰와 '설명을 받을 권리'를 포함하는 EU의 일반 데이터 보호 규정(GDPR)과 같은 규정 준수를 보장하기 위해 설명 가능해야 한다. 금융에서 신용 점수 모델은 차별을 방지하고 규제 요구 사항을 충족하기 위해 투명해야 한다. 자율 주행에서 설명 가능성은 엔지니어가 인식 시스템을 디버깅하고 안전 사례를 구축하는 데 도움이 된다.
해석 가능성은 또한 모델 디버깅 및 개선에 역할을 한다. 모델이 특정 입력에서 실패하는 이유를 이해함으로써 개발자는 데이터 편향, 과적합 또는 아키텍처 결함을 식별할 수 있다. 이는 OpenAI 및 Anthropic과 같은 기관에서 개발한 대규모 언어 모델(LLM)에 특히 관련이 있으며, 해석 가능성 연구는 이러한 복잡한 시스템의 내부 메커니즘을 밝히는 것을 목표로 한다.
미래 방향
설명 가능한 머신러닝 분야는 빠르게 진화하고 있다. 유망한 방향 중 하나는 신경망, 특히 트랜스포머의 내부 계산을 역설계하려는 기계적 해석 가능성이다. Anthropic 및 Google DeepMind과 같은 기관의 연구자들은 인간이 이해할 수 있는 개념에 해당하는 모델 내의 회로와 특성을 식별하는 작업을 하고 있다. 이러한 접근 방식은 더 충실하고 세분화된 설명으로 이어질 수 있다.
또 다른 추세는 해석 가능성을 사후 고려 사항이 아닌 모델 개발 수명 주기에 통합하는 것이다. SHAP와 LIME과 같은 도구는 머신러닝 워크플로우에서 표준이 되고 있으며, 모델 행동의 상호 작용 탐색을 지원하는 새로운 라이브러리가 등장하고 있다. 또한 인과적 해석 가능성에 대한 관심이 증가하고 있으며, 이는 단순한 상관 관계가 아닌 인과 관계를 모델링하여 '만약에' 질문에 답하는 것을 목표로 한다.
AI 시스템이 더욱 보편화됨에 따라 해석 가능성에 대한 수요는 더욱 증가할 것이다. EU AI법과 같은 규제 프레임워크는 고위험 응용 분야에 설명 가능성을 의무화할 가능성이 높다. 이는 AI를 강력할 뿐만 아니라 이해 가능하고 책임 있게 만드는 추가 연구와 혁신을 추진할 것이다.