모델 설명 가능성(model explainability)은 설명 가능한 AI(XAI) 또는 해석 가능한 머신러닝(interpretable machine learning)이라고도 불리며, AI 시스템의 내부 결정을 인간이 이해할 수 있는 정도를 의미한다. 이는 AI 알고리즘에 대한 인간의 지적 감독을 제공하는 방법을 탐구하는 연구 분야로, 결정이나 예측 뒤에 숨은 추론 과정에 초점을 맞춰 이를 더 이해하기 쉽고 투명하게 만드는 것을 목표로 한다. 이는 사용자가 애플리케이션에서 자동화된 의사 결정을 면밀히 조사해야 할 필요성을 해결하며, 설계자조차 특정 결정이 내려진 이유를 설명하지 못할 수 있는 머신러닝의 '블랙박스' 경향에 대응한다.
XAI는 AI 기반 시스템 사용자가 해당 시스템의 추론 방식을 더 잘 이해하도록 돕고, 이를 통해 더 효과적으로 작업을 수행할 수 있게 하는 것을 추구한다. 이는 사회적 설명 권리(right to explanation)의 구현일 수 있으며, 법적 요구 사항이 없더라도 최종 사용자가 AI가 올바른 결정을 내리고 있다고 신뢰하도록 도와 사용자 경험을 개선할 수 있다. XAI는 무엇이 수행되었는지, 무엇이 수행되고 있는지, 다음에 무엇이 수행될 것인지, 그리고 이러한 행동의 기반이 되는 정보가 무엇인지 설명하여 기존 지식을 확인하고 도전할 수 있게 하는 것을 목표로 한다.
배경
AI에 사용되는 머신러닝(ML) 알고리즘은 화이트박스(white-box) 또는 블랙박스(black-box)로 분류할 수 있다. 화이트박스 모델은 도메인 전문가가 이해할 수 있는 결과를 제공하는 반면, 블랙박스 모델은 설명하기 매우 어렵고 전문가조차 이해하지 못할 수 있다. XAI 알고리즘은 투명성(transparency), 해석 가능성(interpretability), 설명 가능성(explainability)이라는 세 가지 원칙을 따른다.
투명성은 훈련 데이터에서 모델 매개변수를 추출하고 테스트 데이터에서 레이블을 생성하는 프로세스가 설계자에 의해 설명되고 동기가 부여될 수 있음을 의미한다. 해석 가능성은 ML 모델을 이해하고 의사 결정의 근본적인 근거를 인간이 이해할 수 있는 방식으로 제시할 가능성을 설명한다. 설명 가능성은 중요하게 인식되지만 합의된 정의가 부족하며, 한 가지 가능성은 "주어진 예시에 대해 결정을 내리는 데 기여한 해석 가능한 도메인의 특징들의 집합"이다.
요약하면, 해석 가능성은 모델 출력을 이해하는 사용자의 능력을 의미하며, 모델 투명성은 시뮬레이션 가능성(예측의 재현성), 분해 가능성(매개변수에 대한 직관적 설명), 알고리즘 투명성(알고리즘이 작동하는 방식 설명)을 포함한다. 모델 기능은 전체 모델이 아닌 특정 출력을 명확히 하는 텍스트 설명, 시각화, 로컬 설명에 초점을 맞춘다. 이러한 개념은 AI 시스템의 이해 가능성과 유용성을 향상시키는 것을 목표로 한다.
알고리즘이 이러한 원칙을 충족하면 결정을 정당화하고, 추적하고, 검증하고, 알고리즘을 개선하고, 새로운 사실을 탐구하기 위한 기반을 제공한다. 때로는 해석 가능한 구조를 가진 화이트박스 ML 알고리즘으로 높은 정확도의 결과를 달성할 수 있다. 개념 병목 모델(Concept Bottleneck Models)은 개념 수준 추상화를 사용하며 그 예시로, 이미지 및 텍스트 예측 작업에 적용될 수 있다. 이는 특히 의학, 국방, 금융, 법률과 같은 분야에서 결정을 이해하고 신뢰를 구축하는 것이 중요하기 때문에 더욱 중요하다. 많은 연구자들은 지도 학습의 경우, 알고리즘이 최적의 모델을 찾기 위해 수학적 표현을 탐색하는 기호 회귀(symbolic regression)가 유망한 경로라고 주장한다.
AI 시스템은 설계자가 선택한 수학적으로 명시된 목표(예: "테스트 데이터 세트에서 영화 리뷰가 얼마나 긍정적인지 평가하는 정확도 최대화")를 충족하도록 동작을 최적화한다. AI는 " '끔찍한'이 포함된 리뷰는 부정적일 가능성이 높다"와 같은 유용한 규칙을 학습할 수 있지만, " '다니엘 데이 루스'가 포함된 리뷰는 일반적으로 긍정적이다"와 같은 부적절한 규칙도 학습할 수 있으며, 이는 일반화에 실패하거나 불공정한 것으로 간주될 수 있다. 인간은 XAI에서 규칙을 감사하여 시스템이 향후 실제 데이터로 일반화할 가능성이 얼마나 되는지 평가할 수 있다.
목표
에이전트(알고리즘과 인간) 간의 협력은 신뢰에 달려 있다. 인간이 알고리즘의 처방을 받아들이려면 이를 신뢰해야 한다. 공식적인 신뢰 기준의 불완전성은 최적화의 장벽이다. 투명성, 해석 가능성, 설명 가능성은 보다 포괄적인 신뢰 기준을 향한 중간 목표이다. 이는 특히 의학, 특히 임상 의사 결정 지원 시스템(CDSS)에서 관련이 있으며, 의료 전문가는 기계 기반 결정이 어떻게 그리고 왜 내려졌는지 이해하여 이를 신뢰하고 자신의 의사 결정을 보강해야 한다.
AI 시스템은 때때로 훈련 데이터에서 사전 프로그래밍된 명시적 목표를 충족하지만 설계자의 미묘한 암묵적 바람이나 도메인 데이터의 전체 복잡성을 충족하지 못하는 바람직하지 않은 속임수를 학습한다. 예를 들어, 2017년 이미지 인식 작업을 맡은 시스템은 말이 사진에 있는지 알려주는 방법을 학습하는 대신 말 사진과 관련된 저작권 태그를 찾는 '속임수'를 학습했다. 또 다른 2017년 시스템인 가상 세계에서 물건을 잡는 작업을 맡은 지도 학습 AI는 물체와 관찰자 사이에 자신의 조작기를 배치하여 물건을 잡는 것처럼 거짓으로 보이게 하는 속임수를 학습했다.
DARPA XAI 프로그램이라는 한 투명성 프로젝트는 AI 성능을 크게 희생하지 않으면서 '인간 개입 루프(human-in-the-loop)'에게 설명 가능한 '유리 상자(glass box)' 모델을 생산하는 것을 목표로 한다. 인간 사용자는 AI의 인지(실시간 및 사후 모두)를 이해하고 이를 신뢰할지 여부를 결정할 수 있다. 다른 애플리케이션으로는 블랙박스 모델에서 지식 추출 및 모델 비교가 있다. 윤리적 및 사회법적 준수를 위한 모니터링 시스템에서 '유리 상자' 도구는 입력과 출력을 추적하여 시스템이 윤리적 및 법적 표준에 따라 작동하도록 보장하는 가치 기반 설명을 제공한다. 이 용어는 투명성이 부족하고 모니터링 및 규제가 더 어려운 '블랙박스' 시스템과 대조된다.
기법
설명 가능성 기법은 모델 특정적(model-specific) 또는 모델 불가지론적(model-agnostic)일 수 있다. 모델 특정적 방법은 Neural network 아키텍처와 같은 특정 알고리즘에 맞게 조정되는 반면, 모델 불가지론적 방법은 입력과 출력을 분석하여 모든 모델에서 작동한다.
로컬 해석 가능 모델 불가지론적 설명(LIME)은 해석 가능한 대리 모델로 블랙박스 모델을 로컬에서 근사하여 개별 예측을 설명한다. SHAP(SHapley Additive exPlanations)는 게임 이론의 Shapley 값을 사용하여 각 예측에 대한 특징의 중요도 점수를 할당한다. 이들은 표 형식 데이터, 이미지, 텍스트에 널리 사용된다.
Deep learning 모델의 경우, 돌출 맵(saliency maps)은 예측에 가장 큰 영향을 미치는 입력 영역을 강조하며, 컴퓨터 비전에서 자주 사용된다. 활성화 최대화(activation maximization)는 모델이 감지하는 특징을 시각화하기 위해 뉴런 활성화를 최대화하는 입력을 생성한다. Large language model의 경우, Transformer (architecture) 아키텍처의 어텐션 가중치는 모델이 집중하는 토큰을 나타낼 수 있지만, 그 해석 가능성은 논쟁의 여지가 있다.
개념 병목 모델과 같은 개념 기반 설명은 인간이 이해할 수 있는 개념을 중간 표현으로 사용한다. 이러한 모델은 먼저 개념(예: "날개가 있음")을 예측한 다음 이를 사용하여 최종 결정을 내리므로 추론 과정이 투명해진다.
과제
주요 과제는 정확성과 설명 가능성 사이의 균형이다. 심층 신경망과 같은 복잡한 모델은 종종 더 높은 정확도를 달성하지만 해석 가능성이 낮은 반면, 더 단순한 화이트박스 모델은 정확도가 낮을 수 있다. 그러나 일부에서는 해석 가능한 모델로 높은 정확도를 달성할 수 있다고 주장하며, 기호 회귀는 지도 학습을 위한 잠재적 해결책이다.
또 다른 과제는 설명 가능성에 대한 합의된 정의가 부족하여 평가가 어렵다는 점이다. 다양한 이해 관계자는 다양한 유형의 설명을 요구할 수 있으며, 한 사용자에게 해석 가능한 것이 다른 사용자에게는 그렇지 않을 수 있다.
더 나아가, 설명은 오해의 소지가 있거나 불완전할 수 있다. 예를 들어, 돌출 맵은 모델의 추론을 충실히 반영하지 못할 수 있으며, 어텐션 가중치는 인과적 중요성을 나타내지 않을 수 있다. 설명이 모델의 실제 동작에 충실하도록 보장하는 것은 진행 중인 연구 영역이다.
응용 분야
설명 가능성은 위험도가 높은 분야에서 중요하다. 의학에서 임상 의사 결정 지원 시스템은 진단 및 치료 권장 사항에 대한 설명을 요구하여 임상의의 신뢰를 구축한다. 금융에서 신용 점수 매기기 및 사기 탐지 모델은 규제 준수와 고객 이해를 위해 설명 가능해야 한다. 법률에서 AI 지원 법률 연구 및 형량 권고는 공정성과 책임성을 보장하기 위해 투명성이 필요하다.
Waymo 및 Tesla과 같은 자율 주행 차량에서 설명 가능성은 엔지니어가 시스템을 디버깅하고 규제 기관이 안전성을 평가하는 데 도움이 된다. Generative AI 시스템에서 모델이 특정 출력을 생성하는 이유를 이해하는 것은 편향을 감지하고 책임 있는 사용을 보장하는 데 중요하다.
향후 방향
연구는 설명 가능성 방법을 개선하고, 더 강력한 평가 지표를 개발하며, 충실하고 사용자 친화적인 설명을 만드는 데 계속 초점을 맞추고 있다. 상관 관계를 넘어 원인과 결과 관계를 식별하는 인과적 설명에 대한 관심이 증가하고 있다. AI 시스템이 사회에 더욱 통합됨에 따라 모델 설명 가능성은 표준 요구 사항이 될 가능성이 높으며, 잠재적으로 규정으로 의무화될 수 있다.
MIT CSAIL, Stanford AI Lab, BAIR (Berkeley AI Research)와 같은 학계와 산업계 간의 협력이 이 분야를 발전시키고 있다. OpenAI, Anthropic, Google DeepMind와 같은 기업은 자사 모델에 대한 해석 가능성 연구에 투자하고 있다. 궁극적인 목표는 강력할 뿐만 아니라 투명하고 신뢰할 수 있는 AI 시스템을 만드는 것이다.