반사실적 설명은 주어진 입력의 특징에 대한 가장 작은 변경을 식별하여 모델의 출력을 원하는 대안으로 전환하는 머신 러닝 예측 해석 기법이다. 특정 인스턴스에 대해 반사실적 설명은 "예측이 목표 결과가 되기 위해 필요한 최소 수정은 무엇인가?"라는 질문에 답한다. 예를 들어, 대출 신청이 거절된 경우 반사실적 설명은 "연간 소득이 $5,000 더 높았다면 AI 워크로드를 가속화하고 딥 러닝 모델의 훈련 시간을 줄일 수 있었을 것입니다."라고 말할 수 있다.
이러한 설명은 반사실적 조건 - 다른 조건에서 일어났을 상황에 대한 진술 - 이라는 철학적 개념에 기반을 둔다. AI에서 이는 전역 모델이 아닌 단일 예측에 초점을 맞춘 국소적 해석 가능성의 한 형태를 제공한다. 이는 유리한 결과를 얻기 위해 무엇을 변경할 수 있는지 이해하려는 최종 사용자에게 특히 유용하다. 변수를 전역적으로 순위를 매기는 특징 중요도 방법과 달리 반사실적 설명은 구체적이고 개별화된 제안을 제공한다.
이 용어는 2010년대 후반에 두각을 나타냈으며, Ruth Fong과 Andrea Vedaldi(2017)의 선구적 연구와 이후 알고리즘 의사 결정을 위해 이 개념을 공식화한 Sandra Wachter, Brent Mittelstadt, Chris Russell(2017)의 연구가 있다. 그 이후로 반사실적 설명은 설명 가능한 AI(XAI)의 핵심 기둥이 되었으며, 자동화된 결정에 대한 설명을 얻을 권리를 개인에게 부여하는 EU의 일반 데이터 보호 규정(GDPR)과 같은 법적 체계와 교차한다.
개념 및 공식화
주어진 입력 x와 예측 f(x)에 대한 반사실적 설명은 f(x')이 원하는 결과(예: 거절 대신 승인)와 같아지는 새로운 입력 x'이다. x에서 x'로의 변경은 일반적으로 최소성을 보장하기 위해 거리 메트릭(예: L1, L2 또는 L0 노름)으로 측정된다. 공식적으로, 목표 레이블 y'에 대해 f(x') = y'라는 제약 조건 하에 거리 d(x, x')를 최소화하는 것을 추구한다.
최소성의 개념은 주관적이며, 서로 다른 거리 함수는 서로 다른 반사실적 설명을 생성한다. 표 형식 데이터의 경우 L1 거리를 사용하여 희소성(적은 특징 변경)을 촉진할 수 있고, 이미지의 경우 지각적 유사성을 사용할 수 있다. 제약 조건을 추가할 수 있다: 특징은 불변 값(예: 나이)을 가지거나 범주형일 수 있다. 또한 반사실적 설명은 실현 가능하고 그럴듯해야 한다 - 즉, 제안된 변경이 사용자에 의해 현실적으로 달성 가능해야 한다(예: 소득 증가는 그럴듯하지만 결혼 상태 변경은 그렇지 않을 수 있음).
반사실적 설명은 인스턴스별로 특정되며, 이는 특징 중요도와 같은 전역 설명과 대조된다. 이는 모델의 전반적인 행동을 설명하는 것이 아니라 단일 사례에 대한 다른 결과로의 경로를 설명한다. 이는 직관적이지만 목표 결과와 거리 메트릭의 선택에 민감하게 만든다.
알고리즘 및 접근법
여러 알고리즘이 반사실적 설명을 생성한다. 초기 방법은 경사 기반 최적화를 사용했다: 미분 가능한 모델(예: 신경망)의 경우 목표 예측과 거리 항을 균형 있게 조정하는 손실을 최소화할 수 있다. 구체적인 구현은 다음과 같다:
- Wachter et al. (2017): 예측 손실과 거리의 두 항으로 비용 함수를 최적화하여 미분 가능한 모델에 대한 반사실적 설명을 찾는 경사 하강법 접근법.
- Growing Spheres (Laugel et al., 2017): 미분 불가능한 모델의 경우, 예측이 뒤집힐 때까지 입력 주위의 구를 반복적으로 확장하여 가장 가까운 경계 지점을 검색하는 방법.
- DiCE (Mothilal et al., 2020): 학습된 오토인코더 또는 모델 불가지론적 검색을 사용하여 사용자에게 선택권을 주기 위해 다양한 반사실적 설명 집합을 생성.
- 트리 기반 방법: 랜덤 포레스트 또는 그래디언트 부스팅의 경우 결정 경로를 탐색하여 리프 공간에서 최근접 이웃을 찾을 수 있음.
모델 불가지론적 방법은 모델을 블랙 박스로 취급하고 샘플링 또는 최적화 기술에 의존하므로 모든 분류기에 적용할 수 있다. 그러나 이미지와 같은 고차원 입력의 경우 계산 비용이 많이 들 수 있다.
신용 및 금융 분야의 응용
금융 부문은 반사실적 설명의 주요 영역이다. 대출 또는 신용카드 신청이 자동화 시스템에 의해 거절될 때, 미국의 동등 신용 기회법(ECOA)과 같은 규정은 대출 기관에 이유를 제공하도록 요구한다. 반사실적 설명은 신청자가 무엇을 변경할 수 있는지 제안함으로써 더 나아간다: "기존 부채를 $2,000 줄이면 신청이 승인될 것입니다." 이는 소비자에게 실행 가능한 구제 수단을 제공한다.
은행과 핀테크 기업은 의사 결정 파이프라인에 반사실적 도구를 통합하기 시작했다. 예를 들어, 그래디언트 부스티드 트리로 훈련된 모델은 각 거절에 대한 설명을 생성하기 위해 반사실적 생성기와 짝을 이룰 수 있다. 과제는 실현 가능성의 균형을 맞추는 것이다: 소득 증가를 제안하는 것은 실행 가능하지 않으므로 시스템은 사용자 통제 하에 있는 특징(예: 지출 패턴, 계좌 기록)을 강조하는 방법을 학습해야 한다.
의료 및 의학
의료 분야에서 반사실적 설명은 임상의가 진단 모델이 특정 예측을 한 이유를 이해하는 데 도움을 준다. 예를 들어, 환자 재입원을 예측하는 신경망은 "환자의 혈압이 10mmHg 낮았다면 재입원 위험이 높음에서 낮음으로 떨어졌을 것입니다."라고 제안할 수 있다. 이는 2020년 Artificial Intelligence in Medicine 저널의 논문에 자세히 설명된 대로 치료 계획에 도움이 된다.
그러나 의료 반사실적 설명은 인과 관계를 신중하게 처리해야 한다. 혈압과 같은 바이오마커를 변경하는 것은 관찰되지 않은 다른 요인과 상관관계가 있을 수 있다. Stanford AI Lab 및 MIT CSAIL의 연구자들은 불가능한 시나리오를 제안하지 않도록 알려진 의학 지식을 통합하는 인과 반사실적 설명을 탐구했다.
이미지 및 텍스트 모델의 반사실적 설명
Deep learning 이미지 모델의 경우 반사실적 설명은 예측을 변경하기 위해 픽셀을 교란하는 것을 포함한다. 예를 들어, 개 이미지는 모델이 고양이로 분류하도록 작은 패턴을 추가하여 변경될 수 있으며, 이는 적대적 예제 연구에서 철저히 보여진다. 적대적 예제와 달리 반사실적 설명은 인간이 그럴듯하다고 인식할 수 있는 의미 있는 변경을 목표로 한다. GAN(생성적 적대 신경망) 또는 오토인코더와 같은 기술은 잠재 코드를 조작하여 이미지 반사실적 설명을 생성할 수 있다.
자연어 처리에서 감정 분석에 대한 반사실적 설명은 "영화가 지루했다"를 "영화가 흥미진진했다"로 변경하여 부정적 감정을 긍정적으로 뒤집을 수 있다. 이는 문법성을 유지하면서 단어나 구문을 편집하여 달성된다. Large language model과 같은 트랜스포머 기반 모델은 반사실적 텍스트를 생성하도록 조사될 수 있지만, 최소성과 유창성을 보장하는 것은 여전히 어려운 과제이다.
인과성 및 공정성과의 연관성
반사실적 설명은 인과 추론과 밀접하게 관련된다. 진정한 반사실적 설명은 데이터의 인과 구조를 반영해야 한다: 특징을 변경하면 연쇄 효과가 있을 수 있다(예: 교육 수준을 높이면 소득이 변경될 수 있음). Pearl의 구조적 인과 모델은 공식적인 프레임워크를 제공하지만 실제로는 종종 사용할 수 없다. 대부분의 방법은 독립성을 가정하며, 이는 현실에서 실현 불가능하거나 일관성이 없는 제안으로 이어질 수 있다.
공정성 연구에서 반사실적 공정성은 민감한 속성(예: 인종, 성별)이 변경된 실제 세계와 반사실적 세계 모두에서 예측이 동일해야 한다는 기준이다. Kusner et al. (2017)이 제안한 이 개념은 설명이 아닌 편향 감사를 위해 반사실적 설명을 사용한다. 예를 들어, 사람의 성별을 변경하면 신용 결정이 바뀌는 경우 모델은 이 정의에 따라 불공정한 것으로 간주된다.
다른 설명 가능성 방법과의 관계
반사실적 설명은 다른 XAI 기술을 보완한다. SHAP 및 LIME은 국소 특징 속성을 제공하여 예측에 가장 중요한 특징을 나타내지만 사용자에게 결과를 변경하는 방법을 알려주지 않는다. 반사실적 설명은 직접적인 제안을 제공한다. 또한 적대적 예제와 유사점을 공유한다 - 둘 다 최소 입력 교란을 추구하지만, 반사실적 설명은 특정 목표 클래스를 목표로 하는 반면 적대적 교란은 종종 인식할 수 없는 잘못된 분류를 목표로 한다.
인과성의 맥락에서 반사실적 설명은 개입과 다르다: 개입은 다른 변수를 고정하면서 특징을 변경하는 반면(무작위 실험과 유사), 반사실적 설명은 동일한 인과 구조 하에서 가상 상태를 상상한다. 이 구분은 사회적 응용에 중요하며, MIT에서 직관적 물리학과 인과 추론을 연구하는 Joshua Tenenbaum 및 Brendan Lake와 같은 연구자들이 지적했다.
과제 및 한계
주요 과제는 반사실적 설명이 현실적이고 실행 가능하도록 보장하는 것이다. 표 형식 데이터의 경우 특징은 불변 값(예: 나이, 민족)을 가질 수 있지만 많은 방법이 이를 무시한다. 직업 범주와 같은 이산적 특징은 거리가 연속적이지 않기 때문에 특별한 처리가 필요하다. 또한 반사실적 설명은 불안정할 수 있다: 입력 또는 모델의 작은 변경이 크게 다른 제안으로 이어져 사용자 신뢰를 감소시킬 수 있다.
최적의 반사실적 설명을 찾는 복잡성은 특징 차원에 따라 증가한다. 이미지와 같은 고차원 데이터의 경우 검색 공간이 방대하며, 순진한 최적화는 인식할 수 없지만 비현실적인 교란을 생성할 수 있다. 또한 많은 방법이 모델이 미분 가능하다고 가정하지만, 트리 앙상블이나 미분 불가능한 파이프라인의 경우 항상 그런 것은 아니다.
의미론적 격차도 있다: 수학적으로 최소인 반사실적 설명이 인간적으로 해석 가능하지 않을 수 있다. 예를 들어, 특징을 0.3 단위 변경하는 것은 추상적일 수 있다. 따라서 연구자들은 도메인 지식이나 사용자 연구를 사용하여 인간 지각적으로 가까운 반사실적 설명을 생성하는 데 초점을 맞춘다.
미래 방향
연구는 사용자가 제안을 반복할 수 있는 대화형 설정에서 반사실적 설명을 생성하는 방향으로 이동하고 있다. Artificial intelligence 시스템에서 실제 예측을 대안과 비교하는 대조적 설명을 제공하는 것에 대한 관심이 증가하고 있으며, 이는 신뢰를 향상시킬 수 있다. 인과 모델의 통합은 특징 간 의존성을 존중하는 더 견고한 반사실적 설명을 생성하는 것을 목표로 한다.
Large language model의 부상으로 모델의 추론에서 자연어 반사실적 설명을 직접 생성할 가능성이 있다. 그러나 충실성을 보장하는 것은 여전히 열린 문제이다. 2020년대 초반 현재, 단일 방법이 지배하지 않으며, 선택은 데이터 유형, 모델 계열 및 사용자 요구에 따라 달라진다.
구현을 위한 실용적 고려 사항
반사실적 시스템을 배포할 때 실무자는 다음을 처리해야 한다:
- 확장성: 수백만 사용자에 대한 반사실적 설명을 실시간으로 생성하려면 효율적인 알고리즘이 필요하다. GPU에서의 경사 기반 최적화와 같은 방법은 빠를 수 있지만 블랙 박스 접근법은 더 느릴 수 있다.
- 사용자 인터페이스: 설명은 종종 "X를 A에서 B로 변경하면 결과가 P에서 Q로 변경됩니다"와 같은 인간이 이해할 수 있는 형식으로 제시되어야 한다.
- 모델 불가지론: 일부 규제 기관은 모델 유형에 관계없이 설명을 요구하므로 배포 가능한 프레임워크는 신경망 또는 규칙 기반 시스템과 같은 모든 예측 모델과 작동해야 한다.
Google DeepMind 및 OpenAI와 같은 기업은 견고한 반사실적 생성 연구에 자금을 지원했지만, 생산 도구는 여전히 초기 단계이다. 2023년 현재 이 개념은 계속 진화하고 있으며, 인과 반사실적 설명 및 다중 에이전트 시나리오에 대한 활발한 연구가 진행 중이다.
미래 방향
AI 시스템이 중요한 결정에 더 통합됨에 따라 반사실적 설명에 대한 수요는 증가할 것이다. 향후 개발은 다음을 포함할 수 있다:
- 원시 데이터에서 반사실적 내러티브를 생성하기 위한 Large language model과의 통합.
- 사용자의 도메인 지식과 선호도에 적응하는 개인화된 설명.
- 여러 가능한 세계를 고려하는 불확실성 하의 반사실적 생성.
- 인과 발견을 통한 실행 가능한 권장 사항과 반사실적 설명의 연결.
Carnegie Mellon University 및 BAIR (Berkeley AI Research)와 같은 기관의 연구자들은 이러한 영역에서 적극적으로 작업하고 있다.
결론
반사실적 설명은 머신 러닝 모델을 투명하고 실행 가능하게 만드는 강력한 도구이다. "만약" 질문을 통해 불투명한 예측을 사용자를 위한 구체적인 단계로 변환한다. 그 중요성은 설명 가능한 AI 및 윤리적 AI 관행에 대한 규제 압력에 의해 강조된다. 모델이 더 복잡해짐에 따라 반사실적 해석 가능성에 대한 필요성은 더욱 증가할 것이며, 효율적인 생성 및 검증의 추가 혁신을 주도할 것이다.