Concept Bottleneck Models

영어에서 번역됨

개념 병목 모델(Concept Bottleneck Models)은 명시적이고 인간이 해석할 수 있는 중간 개념을 통해 결과를 예측하는 신경망으로, 투명성과 개입을 가능하게 한다. 이는 이해 가능한 특징을 통해 결정 경로를 제한함으로써 표준 블랙박스 모델과 다르다.

Concept Bottleneck Models(CBM)은 명시적이고 인간이 해석할 수 있는 중간 개념 계층을 통해 두 단계 과정으로 예측을 수행하도록 설계된 신경망 아키텍처의 한 부류입니다. CBM은 원시 입력을 출력에 직접 매핑하는 대신, 먼저 사전 정의된 의미론적으로 의미 있는 속성(개념) 집합을 예측한 다음, 이렇게 예측된 개념을 사용하여 최종 결정을 내립니다. 이러한 설계 덕분에 인간은 모델의 내부 추론 과정을 검사하고 이해하며 심지어 개입할 수도 있어, 머신 러닝딥 러닝에서 표준 블랙박스 모델의 핵심적인 한계를 해결합니다.

개념 병목 접근법은 2020년 Pang Wei Koh, Thao Nguyen, Yew Siang Tang, Stephen Mussmann, Brandon Ying, Percy Liang이 스탠포드 대학교토론토 대학교에 소속되어 발표한 논문에서 공식적으로 소개되었습니다. "Concept Bottleneck Models"라는 제목의 이 논문은 모델이 최종 출력 전에 해석 가능한 개념을 예측하도록 강제함으로써 경쟁력 있는 정확도를 달성하면서도 모델의 행동을 디버깅하고 제어할 수 있는 능력을 얻을 수 있음을 입증했습니다. 이 연구는 해석 가능하고 분리된 표현에 대한 초기 아이디어를 바탕으로 했지만, 이후 광범위한 연구에 영향을 미친 구체적이고 훈련 가능한 아키텍처를 제공했습니다.

아키텍처 및 훈련

Concept Bottleneck Model은 입력 인코더, 개념 예측기, 작업 예측기의 세 가지 주요 구성 요소로 이루어져 있습니다. 입력 인코더는 원시 데이터(예: 이미지, 텍스트 시퀀스, 표 형식 레코드)를 특징 표현으로 처리합니다. 그런 다음 개념 예측기는 이 표현을 각 사전 정의된 개념에 대한 개념 점수 벡터로 매핑합니다. 마지막으로 작업 예측기는 이러한 개념 점수(선택적으로 원래 특징)를 입력으로 받아 클래스 레이블이나 회귀 값과 같은 최종 출력을 생성합니다.

CBM 훈련은 일반적으로 독립 훈련, 순차 훈련, 공동 훈련의 세 가지 패러다임 중 하나를 따릅니다. 독립 훈련에서는 먼저 개념 예측기를 훈련하여 실제 개념 레이블을 예측하게 한 다음, 작업 예측기를 예측된 개념(또는 개념 예측기가 고정된 상태에서 실제 개념)으로 훈련합니다. 순차 훈련은 먼저 개념 예측기를 훈련한 다음 개념 예측기를 고정한 채 작업 예측기를 훈련하지만, 작업 훈련 중에는 예측된 개념을 사용합니다. 공동 훈련은 두 구성 요소를 동시에 최적화하며, 종종 개념 예측 오류와 작업 예측 오류를 결합한 가중 손실을 사용합니다. 공동 훈련은 일반적으로 최상의 작업 정확도를 제공하지만 개념 정확도를 희생할 수 있습니다. 일반적인 변형으로는 "개입 인식" 훈련이 있는데, 이는 사용자가 테스트 시점에 실수를 수정할 수 있도록 인간의 개념 예측 수정에 견고하도록 모델을 훈련합니다.

해석 가능성 및 개입

CBM의 주요 동기는 해석 가능성입니다. 모델이 인간이 이해할 수 있는 개념을 통해 추론하도록 제한함으로써, 사용자는 모델이 어떤 개념이 존재한다고 믿는지, 그리고 그러한 개념이 최종 예측에 어떻게 영향을 미치는지 확인할 수 있습니다. 예를 들어, 새 분류 작업에서 CBM은 "노란 배가 있음", "뾰족한 날개가 있음", "긴 꼬리가 있음"과 같은 개념을 예측한 다음 이를 사용하여 종을 분류할 수 있습니다. 이러한 투명성 덕분에 도메인 전문가는 모델이 우연한 상관관계가 아닌 합리적인 특징을 사용하고 있는지 검증할 수 있습니다.

CBM의 독특한 특징은 개입 능력입니다. 사용자가 모델의 개념 예측이 잘못되었다는 것을 알게 되면(예: 노란 배를 감지하지 못한 경우), 해당 개념 값을 수동으로 수정할 수 있으며, 작업 예측기는 수정된 개념을 기반으로 새로운 출력을 생성합니다. 이러한 인간-인-더-루프 기능은 의료나 금융과 같은 고위험 영역에서 유용하며, 최종 결정이 내려지기 전에 모델의 실수를 수정할 수 있습니다. 연구에 따르면 소수의 개입만으로도 특히 개념 예측기가 불완전할 때 정확도를 크게 향상시킬 수 있습니다.

응용 분야

CBM은 다양한 영역에 적용되었습니다. 의료 영상에서는 "심장비대"나 "삼출"과 같은 가시적인 병리 상태에 해당하는 개념을 사용하여 흉부 X-레이 진단에 사용되었습니다. 피부과에서는 CBM이 악성 종양을 분류하기 전에 피부 병변 속성을 예측할 수 있습니다. 자율 주행에서는 "보행자 존재"나 "교통 신호등 색상"과 같은 개념이 운전 결정을 내리는 데 사용될 수 있지만, 이는 지각 작업보다 덜 일반적입니다. 자연어 처리에서는 "욕설 포함"이나 "분노 표현"과 같은 개념을 사용하여 감정 분석과 유해 콘텐츠 탐지에 CBM이 적용되었습니다. 표 형식 데이터에서는 "소득 수준"과 "지불 이력"과 같은 개념이 해석 가능한 신용 점수 산정에 CBM이 사용되었습니다.

변형 및 확장

CBM의 한계를 해결하기 위해 여러 변형이 제안되었습니다. 라벨 없는 CBM(2022년 Tu, Ma 등이 소개)은 수동 개념 주석의 필요성을 제거하고 대규모 사전 훈련 모델(예: 대규모 언어 모델 또는 비전-언어 모델)을 사용하여 클래스 설명에서 개념 레이블을 자동으로 생성합니다. 이는 새로운 작업에 CBM을 적용하는 데 주요 병목인 주석 부담을 줄여줍니다. 또 다른 변형인 개념 임베딩 모델은 이진 또는 범주형 레이블 대신 개념을 연속 임베딩 공간에 투영하여 더 풍부한 개념 표현을 가능하게 합니다. 사후 CBM은 프로빙 또는 클러스터링 기법을 사용하여 해석 가능한 차원을 식별함으로써 이미 훈련된 블랙박스 모델에서 개념 병목을 추출하려고 시도합니다.

다른 확장에는 개념 불확실성을 모델링하는 확률적 CBM과, 사용자가 어떤 개념이 가장 영향력 있는지 모델에 질의할 수 있도록 하는 상호작용형 CBM이 포함된다. 일부 연구는 트랜스포머 아키텍처와 CBM을 통합하여 주의 메커니즘을 사용해 개념을 입력 영역과 정렬하기도 한다.

한계 및 과제

이러한 이점에도 불구하고 CBM은 여러 과제에 직면한다. 가장 중요한 것은 개념 주석(annotation)이 필요하다는 점인데, 이는 비용이 많이 들고 종종 주관적이다. 작업에 대해 완전하고 중복되지 않는 개념 집합을 정의하는 것은 어렵고, 누락된 개념은 정보 손실과 정확도 저하로 이어질 수 있다. CBM은 또한 개념 병목 현상이 정보 흐름을 제한하기 때문에 복잡한 작업에서 표준 블랙박스 모델보다 성능이 떨어지는 경향이 있다. 해석 가능성과 정확성 사이의 절충은 핵심 연구 질문이다.

또 다른 문제는 개념 누출(concept leakage)이다. 작업 예측기가 개념 예측을 의도하지 않은 방식으로 사용하거나, 개념 예측기가 명시된 개념 너머의 정보(예: 상관된 특징을 통해)를 인코딩할 수 있다. 이는 모델을 의도보다 덜 해석 가능하게 만들 수 있다. 또한 인간의 개입은 작업 예측기가 개념 수정에 강건한 경우에만 효과적이다. 그렇지 않으면 개념을 수정해도 출력이 예상대로 바뀌지 않을 수 있다.

다른 해석 가능성 방법과의 관계

CBM은 더 넓은 해석 가능한 머신러닝 기법 계열의 일부이다. 이들은 종종 훈련 후 블랙박스 모델을 설명하려는 경사 기반 속성(attribution)이나 시각화 지도(saliency map) 같은 사후 설명 방법과 대조된다. CBM은 설계상 본질적으로 해석 가능하며, 이는 고위험 결정에서 일반적으로 선호된다. 또한 개념 활성화 벡터 테스트(TCAV)와 같은 개념 기반 설명과도 관련이 있는데, TCAV는 방향 도함수를 사용해 개념 영향을 측정하지만 모델 아키텍처를 제약하지는 않는다. CBM은 때때로 본질적으로 해석 가능하지만 덜 유연한 결정 트리 및 규칙 기반 모델과 비교되기도 한다.

현재 연구 및 향후 방향

CBM에 대한 연구는 계속 진화하고 있다. 최근 작업은 CBM을 대규모 데이터셋으로 확장하고 기반 모델(foundation model)과 통합하는 데 초점을 맞추고 있다. 예를 들어 CLIP 스타일 임베딩을 사용해 개념을 연속 공간에서 정의하는 것이 유망한 것으로 나타났다. 또 다른 방향은 강화 학습 및 로봇 공학에서 CBM을 사용하는 것으로, 해석 가능한 중간 표현이 안전성과 디버깅에 도움이 될 수 있다. 또한 보호 속성이 사용되는지 감사자가 확인할 수 있게 해주는 개념 병목 현상을 통해 공정성 및 편향 완화에 CBM을 사용하는 데에도 관심이 있다.

2025년 현재 CBM은 여전히 활발한 연구 분야이며, NeurIPS, ICML, ICLR 같은 주요 학회에 논문이 게재되고 있다. 해석 가능성과 성능 간의 절충은 아직 완전히 해결되지 않았지만, 이 분야는 고정된 인간 정의 집합에 의존하기보다 개념을 동적으로 학습하는 모델을 포함해 더 유연하고 확장 가능한 개념 기반 모델로 나아가고 있다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:machine-learning·interpretability·neural-networks·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사