개념 병목 모델(CBM)은 모델이 먼저 인간이 이해할 수 있는 일련의 개념을 출력하도록 강제한 다음, 그 개념들을 사용하여 최종 결정을 내리도록 설계된 신경망 아키텍처의 한 유형이다. 이 2단계 설계는 내부 표현이 일반적으로 불투명한 표준 종단 간 딥러닝 모델과 대조된다. 중간 계층을 의미 있는 속성에 대응하도록 제한함으로써, CBM은 사용자가 어떤 개념이 예측에 영향을 미쳤는지 확인할 수 있게 하고, 나아가 개념 값을 수정하여 결과를 변경하는 개입까지 가능하게 한다.
2020년 MIT 컴퓨터과학 및 인공지능 연구소와 스탠포드 AI 연구소의 연구자들이 도입한 개념 병목 모델은 의료 진단, 자율 주행과 같은 고위험 응용 분야에서 투명성에 대한 증가하는 요구에 대한 응답으로 제안되었다. 핵심 아이디어는 컴퓨터 비전에서 의미 속성을 사용한 초기 해석 가능한 머신러닝 연구를 기반으로 하지만, 이를 현대 딥러닝 프레임워크 내에서 공식화한다. 도입 이후 CBM은 정확도 절충 문제를 해결하고 개념 레이블 요구 사항을 완화하는 변형들을 통해 확장 및 개선되어 왔다.
아키텍처 및 메커니즘
표준 개념 병목 모델은 개념 인코더와 작업 예측기라는 두 가지 주요 구성 요소로 이루어진다. 개념 인코더는 입력(예: 이미지 또는 텍스트)을 받아 개념 점수 벡터를 출력하며, 각 점수는 미리 정의된 개념의 존재 여부 또는 강도를 나타낸다. 이러한 개념은 인간 전문가가 선택하며 "깃털이 있음" 또는 "바퀴가 있음"과 같이 의미적으로 의미 있는 속성을 의미한다.
작업 예측기는 이러한 개념 점수를 입력으로 받아 클래스 레이블이나 회귀 값과 같은 최종 출력을 생성한다. 전체 모델은 개념 예측과 최종 작업 예측 모두에 손실 함수를 적용하여 공동으로 훈련된다. 추론 중에는 독립 모드(예측된 개념 사용), 순차 모드(예측된 개념을 사용하지만 작업 예측기는 실제 개념으로 훈련됨), 상호 작용 모드(최종 예측 전에 사용자가 개념 값을 수정할 수 있음)의 세 가지 방식으로 사용할 수 있다.
개념 계층은 입력과 최종 출력 사이의 정보 흐름을 제한하기 때문에 병목 역할을 한다. 이러한 제한은 의도적인 것으로, 모델이 해석 불가능한 특징에 의존하는 대신 인간이 해석할 수 있는 속성의 관점에서 추론하도록 강제한다. 개념의 선택은 작업을 예측할 수 있어야 하고 의도된 사용자가 이해할 수 있어야 하므로 매우 중요하다.
훈련 및 손실 함수
개념 병목 모델의 훈련은 일반적으로 다중 작업 손실을 포함한다. 총 손실은 개념 예측 손실(이진 개념의 경우 이진 교차 엔트로피, 연속 개념의 경우 평균 제곱 오차)과 작업 예측 손실(분류의 경우 교차 엔트로피)의 가중 합이다. 가중치는 개념 정확도와 작업 정확도 사이의 강조 균형을 조정하기 위해 조정될 수 있다.
원래 공식에서는 개념 인코더와 작업 예측기가 처음부터 공동으로 훈련된다. 그러나 이후 연구에서는 개념 인코더를 먼저 훈련한 다음 동결된 개념 인코더 위에서 작업 예측기를 훈련하는 2단계 훈련 방식을 탐구했다. 이 접근 방식은 더 안정적일 수 있으며 사전 훈련된 개념 인코더를 사용할 수 있게 한다. 또 다른 변형인 "개입 인식" 훈련은 훈련 중에 시뮬레이션된 사용자 개입을 통합하여 테스트 시 개념 수정에 더 강건하게 만든다.
주요 과제 중 하나는 개념 레이블을 얻는 비용이 종종 높다는 점이다. 이를 해결하기 위해 일부 방법은 약한 지도 또는 비지도 방식으로 개념을 발견하지만, 이는 인간 해석 가능성 보장을 희생할 수 있다. "사후" 개념 병목 모델과 같은 다른 접근 방식은 먼저 표준 블랙박스 모델을 훈련한 다음 개념 계층을 맞추어 결정을 설명하지만, 개념이 인과적으로 사용된다는 보장은 없다.
정확도 절충
개념 병목 모델에 대한 주요 비판 중 하나는 개념 집합이 불완전하거나 개념이 작업을 완벽하게 예측하지 못할 때 표준 종단 간 모델보다 성능이 떨어질 수 있다는 점이다. 병목은 최종 예측기에 사용 가능한 정보를 제한하며, 개념이 모든 관련 특징을 포착하지 못하면 정확도가 저하된다. CUB-200-2011(새) 및 AwA2(동물)와 같은 벤치마크 데이터셋에 대한 실증 연구에 따르면 CBM은 제약 없는 모델보다 낮은 정확도를 달성하는 경우가 많다.
그러나 절충이 항상 심각한 것은 아니다. 개념이 결정 경계와 잘 정렬된 일부 작업에서는 CBM이 블랙박스 모델과 거의 동등한 성능을 달성할 수 있다. 연구자들은 작업 예측기가 입력에서 잔여 연결을 받도록 허용하거나(병목 우회) 더 큰 개념 어휘를 사용하는 등 정확도 격차를 완화하는 방법도 제안했다. 개념 선택과 개념 감독의 품질은 정확도-해석 가능성 절충에 가장 큰 영향을 미치는 요소이다.
변형 및 확장
원래 CBM 이후로 여러 주목할 만한 변형이 개발되었다. "추가 입력이 있는 개념 병목 모델"(CBM-AI)은 입력에서 작업 예측기로의 잔여 연결을 추가하여 모델이 필요한 경우 해석 불가능한 특징을 사용할 수 있게 하지만, 해석 가능성을 일부 희생한다. "개입 인식 개념 병목 모델"(IA-CBM)은 시뮬레이션된 개입으로 훈련되어 사용자 수정에 더 잘 반응한다.
또 다른 연구 방향은 자동 개념 발견에 초점을 맞춘다. 예를 들어, "개념 임베딩 모델"은 이진 점수 대신 개념 임베딩을 학습하고, "레이블 없는 개념 병목 모델"은 사전 훈련된 대규모 언어 모델을 사용하여 텍스트 설명에서 개념 후보를 생성함으로써 수동 개념 주석의 필요성을 줄인다. 이러한 접근 방식은 개념 레이블이 부족한 의료 영상 및 자연어 처리 분야에 적용되었다.
생성형 AI 맥락에서 CBM은 개념 값에 개입하여 이미지 생성 모델의 출력을 제어하는 데 사용되었다. 예를 들어, CBM을 사용하여 "빨간 배" 또는 "긴 꼬리"와 같은 특정 속성을 가진 새 이미지를 해당 개념 점수를 설정하여 생성할 수 있다. 이는 분류를 넘어선 아키텍처의 더 넓은 유용성을 보여준다.
응용 분야
개념 병목 모델은 여러 고위험 분야에서 응용되고 있다. 의료 분야에서는 피부 병변 진단 및 전자 건강 기록에서 환자 결과 예측에 사용되며, 임상의는 어떤 증상이나 특징이 결정을 이끌었는지 확인할 수 있는 가치를 높이 평가한다. 자율 주행 분야에서 CBM은 "정지 표지판" 또는 "보행자 횡단"과 같은 개념을 기반으로 교통 표지판이나 보행자 행동을 예측하여 더 안전한 인간 감독을 가능하게 한다.
금융 분야에서 CBM은 신용 점수 산정 및 사기 탐지에 적용되었으며, 자동화된 결정에 대한 설명을 요구하는 규제 요건을 충족한다. 자연어 처리 분야에서는 "긍정적 감정" 또는 "혐오 발언 포함"과 같은 개념을 중간 출력으로 사용하여 감정 분석 및 유해 콘텐츠 탐지에 사용되었다. CBM이 제공하는 해석 가능성은 개발자가 어떤 개념이 오류를 유발하는지 식별하고 수정할 수 있게 하여 디버깅을 용이하게 한다.
한계 및 비판
장점에도 불구하고 개념 병목 모델은 여러 한계에 직면한다. 가장 중요한 것은 사전 정의된 개념에 의존한다는 점으로, 이는 도메인 전문 지식을 요구하며 작업의 모든 관련 측면을 포괄하지 못할 수 있다. 개념이 누락되면 모델이 이를 사용할 수 없어 체계적인 오류가 발생할 수 있다. 또한 개념이 독립적이라는 가정은 실제로 자주 위반되며, 개념 간 상관관계를 모델링하는 것은 계속 진행 중인 연구 영역이다.
또 다른 비판은 CBM이 제공하는 해석 가능성이 개념 정의만큼만 좋다는 것이다. 개념이 모호하거나 상호 배타적이지 않으면 설명이 오해를 불러일으킬 수 있다. 또한 사용자가 항상 효과적으로 개입할 수 있는 전문 지식을 갖추고 있지 않을 수 있으며, 상호 작용 모드는 모든 배포 시나리오에서 실현 가능하지 않을 수 있다. 마지막으로 정확도 절충은 실질적인 장벽으로 남아 있으며, 일부 연구자들은 블랙박스 모델에 대한 사후 설명 방법이 성능 저하 없이 유사한 통찰력을 제공할 수 있다고 주장한다.
향후 방향
개념 병목 모델에 대한 연구는 계속 진화하고 있으며 여러 유망한 방향이 있다. 한 영역은 비전과 언어 모두에서 지배적인 트랜스포머 아키텍처와의 통합이다. 최근 연구는 중간 계층에 개념 예측 헤드를 추가하는 등 트랜스포머 기반 모델에 개념 병목을 통합하는 방법을 탐구하고 있다. 또 다른 방향은 인간 피드백을 사용하여 개념 정의를 개선하고 모델을 사용자 기대와 더 잘 정렬하는 것이다.
모델 가지치기 및 효율성을 위해 CBM을 사용하는 것에 대한 관심도 증가하고 있으며, 병목 구조는 계산 비용을 줄이는 데 활용될 수 있다. 또한 개념 병목 프레임워크는 시각적 및 텍스트 속성을 결합하는 등 여러 양식을 포괄하는 다중 모달 입력으로 확장되고 있다. 규제 산업에서 설명 가능한 AI에 대한 수요가 증가함에 따라 개념 병목 모델은 활발한 연구 및 개발 영역으로 남을 가능성이 높다.