Chris Olah는 기계 해석 가능성(mechanistic Mechanistic interpretability) 분야의 창시자 중 한 명으로 여겨지는 머신러닝 연구자이며, Anthropic의 공동 창립자로서 해석 가능성 연구를 이끌고 있다.
초기 연구 및 Distill
Olah는 전통적인 대학 학위를 마치지 않았지만, 독립적 연구와 산업계 경험을 통해 연구 경력을 쌓았다. 여기에는 Google Brain에서의 활동이 포함되며, 그곳에서 합성곱 신경망에 대한 초기 시각화 및 특징 해석 기법에 기여했고, OpenAI에서도 활동했다. 2017년에는 머신러닝 연구에 대한 명확하고 상호작용적인 시각적 설명에 초점을 맞춘 온라인 저널 Distill을 공동 창립했다. 이 저널은 출판물 수보다 진정한 이해를 중시하는 편집 방침으로 영향력을 얻었으며, 2021년에 정기 발행을 중단했다.
해석 가능성 연구
Olah의 연구는 기계 해석 가능성, 즉 훈련된 신경망의 내부 계산을 인간이 이해할 수 있는 알고리즘으로 역설계하려는 시도에 중점을 두며, 이를 불투명한 블랙박스로 취급하지 않는다. 그의 초기 회로 기반 연구는 OpenAI에서 일부 수행되고 Anthropic에서 계속되었으며, 비전 및 언어 모델 내부에서 해석 가능한 개념에 해당하는 특정 "특징"과 "회로"를 식별하는 것을 목표로 했다. Anthropic에서 그의 팀은 희소 오토인코더를 사용하여 대규모 언어 모델에서 단의적 특징을 추출하는 연구를 발표했으며, 이는 널리 인용되고 있다. 이는 모델의 출력에만 의존하지 않고 내부 추론을 감사할 수 있게 하는 것을 궁극적으로 목표로 하는 더 넓은 연구 의제의 일부다.
Anthropic
Olah는 2021년 Dario Amodei, Daniela Amodei, Tom Brown, Jared Kaplan과 함께 Anthropic을 공동 창립했으며, 이들 중 여러 명과 OpenAI에서 함께 일한 바 있다. 해석 가능성은 Anthropic 내에서 안전 전략의 핵심 축으로 자리 잡았으며, Constitutional AI 및 책임 있는 확장 정책(Responsible Scaling Policy, Responsible scaling policies 참조)과 함께, 모델의 내부를 이해하면 블랙박스 평가가 놓칠 수 있는 기만적이거나 보상 해킹 경향과 같은 위험한 행동을 궁극적으로 포착할 수 있다는 전제에 기반한다.
영향
Olah는 해석 가능성을 한정된 학문적 추구에서 프런티어 연구소의 충분한 자금을 지원받는 핵심 연구 프로그램으로 전환시킨 인물로 널리 평가받으며, Google DeepMind 및 다른 곳에서의 유사한 해석 가능성 노력에 영향을 주었고, AI safety 분야가 행동적 정렬과 모델 내부 추론에 대한 진정한 이해 사이의 차이를 생각하는 방식을 형성했다. 그의 독학적이고 비전통적인 진로는 프런티어 AI 연구에 전통적인 학문적 배경이 필요하다는 가정에 대한 반례로 자주 언급된다.