설명 가능한 AI(Explainable AI, XAI)는 모델의 내부 작동 방식이나 출력을 인간 사용자가 이해할 수 있게 하는 것을 다루는 인공지능의 하위 분야이다. 설명 가능성에 대한 필요성은 선형 회귀나 의사결정 트리와 같은 단순하고 본질적으로 해석 가능한 모델에서, 수백만~수십억 개의 학습된 파라미터가 상호작용하여 예측을 생성하지만 인간 독자가 직접 추적할 수 없는 복잡한 신경망 아키텍처로 전환되면서 대두되었다. 이러한 한계는 블랙박스 문제로 널리 알려져 있다. XAI 방법은 모델 설계에 내장되거나 사후에 생성된 설명을 제공함으로써 이러한 격차를 해소하는 것을 목표로 하며, 반드시 모델 내부 계산에 대한 완전한 기계론적 설명을 요구하지는 않는다.
동기
설명 가능성에 대한 수요는 여러 측면에서 제기된다. 신용, 의료, 형사 사법 분야의 규제 기관은 개인에게 영향을 미치는 자동화된 결정이 설명 가능해야 한다고 점점 더 요구하고 있으며, 이는 EU 일반 개인정보보호법과 EU AI법에 반영된 원칙이다. 개발자는 설명을 활용하여 모델을 디버깅하고, 예를 들어 동물 자체가 아닌 배경 지형에서 동물을 인식하도록 학습하는 모델과 같은 허위 상관관계를 포착한다. 설명은 또한 알고리즘 편향을 탐지하고 교정하며, 중대한 결정에 사용되는 시스템에 대한 사용자 신뢰를 구축하는 노력도 지원한다.
기법
XAI 방법은 일반적으로 두 가지 계열로 구분된다. 의사결정 트리, 규칙 목록, 선형 모델과 같은 본질적으로 해석 가능한 모델은 구성상 투명하지만 복잡한 작업에서는 딥러닝보다 정확도가 떨어지는 경향이 있다. 사후 설명 방법은 학습된 모델을 고정된 것으로 간주하고 개별 예측이나 주변의 일반적인 동작을 설명하려고 시도한다. 널리 사용되는 사후 설명 기법으로는 합성곱 신경망의 출력에 가장 큰 영향을 미친 입력 영역(예: 이미지의 픽셀)을 강조하는 살리언시 맵, 복잡한 모델의 로컬 동작을 더 간단한 대리 모델로 근사화하는 LIME(로컬 해석 가능 모델 비의존적 설명), 게임 이론적 프레임워크를 차용하여 특정 공정성 속성을 충족하는 방식으로 예측을 입력 특성에 귀속시키는 SHAP(셰이플리 가산 설명) 등이 있다. 이러한 방법은 내부 가중치에 접근할 필요 없이 다양한 유형의 기계 학습 시스템에 적용할 수 있다는 점에서 모델 비의존적이다.
한계와 해석 가능성과의 관계
사후 설명 방법은 관련된 계산을 직접 노출하기보다 근사화하기 때문에 때로는 그럴듯해 보이지만 모델의 실제 추론을 충실히 반영하지 못하는 설명을 생성한다는 비판을 받아 왔다. 이러한 한계는 신경망이 학습한 실제 회로와 특징을 외부에서 근사화하는 대신 역설계하려는 보다 야심 찬 연구 방향인 기계론적 해석 가능성 연구를 촉진했다. 두 분야는 밀접하게 관련되어 있지만 서로 다른 증거 기준을 추구한다. 고전적인 컴퓨터 비전 및 표 형식 모델을 위해 설계된 XAI 방법은 출력이 고정된 클래스 집합이 아닌 자유 형식 텍스트인 대규모 언어 모델 시스템에는 적용하기가 더 어려운 것으로 입증되었으며, 이로 인해 최전선 설명 연구의 상당 부분이 해석 가능성 스타일의 회로 분석과 모델에 사고 사슬을 생성하도록 요청하는 방식으로 전환되었다. 다만 후자의 경우 항상 기본 계산을 충실히 반영하지는 않는다.