Jan Leike는 AI 정렬 연구자로, OpenAI의 Superalignment 팀을 공동 이끌었으며, 2024년에 공개적인 사임 후 Anthropic에 합류했다.
DeepMind 및 OpenAI에서의 경력
Leike는 호주국립대학교에서 강화 학습 이론으로 박사 학위를 받았다. OpenAI에 합류하기 전에는 DeepMind에서 AI 안전 및 AI alignment 문제에 관한 연구 과학자로 일했다. OpenAI에서는 모델을 더 유용하고 정직하게 훈련하는 기술에 광범위하게 작업했으며, ChatGPT를 형성한 RLHF 연구 프로그램에 기여했고, 이후 확장 가능한 감독과 약한-강한 일반화에 관한 OpenAI의 연구를 공동 저술했다.
Superalignment 및 사임
2023년 7월, OpenAI는 Leike와 OpenAI 공동 창업자 Ilya Sutskever가 공동 이끄는 Superalignment 팀을 발표했으며, 명시된 목표는 4년 이내에 가상의 미래 초지능 AI 시스템을 정렬하는 기술적 문제를 해결하는 것이었고, 상당한 컴퓨팅 자원의 투입이 약속되었다. 팀의 작업은 Mechanistic interpretability, 확장 가능한 감독, 자동화된 정렬 연구를 다루었다.
2024년 5월, Leike는 OpenAI에서 사임하며 회사에서 "안전 문화와 프로세스가 화려한 제품에 뒷전으로 밀렸다"고 공개적으로 밝혔고, 자신의 팀이 약속받은 컴퓨팅 자원을 확보하는 데 어려움을 겪고 있었다고 말했다. 그의 사임은 Sutskever의 사임과 같은 주에 이루어졌으며, 빠른 제품 배포와 장기적인 안전 연구 사이의 균형에 대한 OpenAI 내부의 긴장에 상당한 주목을 끌었다. 이러한 긴장은 2023년 11월 OpenAI board crisis 동안에도 표면화된 바 있다.
Anthropic으로의 이동
OpenAI를 떠난 직후, Leike는 정렬 연구를 계속하기 위해 Anthropic에 합류했으며, 안전 우선순위에 대한 의견 차이로 OpenAI에서 Anthropic으로 이동한 Jared Kaplan 및 Chris Olah와 같은 이전 합류자들을 포함한 성장하는 연구자 집단에 동참했다. Anthropic에서 그는 확장 가능한 감독 및 모델 평가와 관련된 작업을 계속하고 있다.
영향
Leike의 공개 사임 서한은 AI 안전 커뮤니티에서 최첨단 연구소의 내부 인센티브가 명시된 안전 약속을 신뢰할 수 있게 뒷받침하는지에 대한 논의에서 가장 널리 유포된 문서 중 하나가 되었으며, 이 논쟁은 AI governance 및 장기 AI 위험에 관한 더 넓은 질문과 밀접하게 연결되어 있다. 그의 사임은 다른 안전 중심 연구자들의 유사한 이탈에 이어, 빠르게 움직이는 상업 연구소의 내부 정렬 팀이 컴퓨팅 및 인력에 대해 제품 마감일과 경쟁해야 하는 구조적 압력에 직면한다는 증거로 자주 인용되었다.