폴 크리스티아노는 RLHF가 된 기법을 공동 개발하고 비영리 정렬 연구 기관인 정렬 연구 센터(Alignment Research Center)를 설립한 것으로 알려진 AI 정렬 분야의 미국 연구자이다.
초기 경력 및 RLHF
크리스티아노는 OpenAI에서 초기 연구원으로 일했으며, 2017년에는 "Deep Reinforcement Learning from Human Preferences"라는 논문의 공동 저자였다. 이 논문은 모델 출력 간의 인간 비교를 통해 보상 모델을 훈련하고, 그 보상 모델에 대해 정책을 최적화하는 핵심 방법을 소개했다. 이 접근 방식은 이후 확장되어 언어 모델에 RLHF로 적용되었으며, 대화형 모델을 인간 의도에 맞추는 지배적인 기술이 되었다. 가장 눈에 띄게는 ChatGPT와 그 지시 수행 전신인 InstructGPT의 훈련 뒤에 있었다.
정렬 연구 센터
2021년, 크리스티아노는 OpenAI를 떠나 AI AI alignment에 대한 이론적 작업에 초점을 맞춘 비영리 기관인 정렬 연구 센터(ARC)를 설립했다. 여기에는 모델에서 "잠재 지식 유도"에 대한 연구와 모델의 출력이 드러내지 않는 능력이나 의도를 평가하는 방법에 대한 연구가 포함된다. ARC는 또한 GPT-4를 포함한 출시에 앞서 Anthropic 및 OpenAI와 같은 연구소와 협력하여 수행된 위험한 능력 테스트를 포함하여, 최첨단 모델에 대한 가장 초기의 공식적인 사전 배포 능력 평가를 구축하고 실행한 것으로 알려지게 되었다.
미국 AI 안전 연구소
2024년, 크리스티아노는 미국 국립표준기술연구소 내에 있는 미국 AI 안전 연구소에서 안전 중심 평가 작업을 이끌도록 임명되었다. 이 역할은 기술적 정렬 작업과 밀접하게 연관된 연구자를, 2023년 11월 블레츨리 파크에서 시작된 국제 AI 안전 정상 회의 과정에 앞서 최첨단 모델을 평가하는 책임을 맡은 정부 기관 내부에 두었다. 이 임명은 독립성과 정부의 평가 역량에 대한 질문을 두고 AI 안전 커뮤니티의 여러 부분에서 지지와 비판을 모두 받았다.
영향
크리스티아노는 AI safety 분야에서 장기적 AI 위험에 대한 추상적 우려를 구체적이고 경험적으로 검증 가능한 연구 프로그램으로 전환하는 데 가장 책임이 있는 연구자 중 한 명으로 널리 간주된다. 그는 Nick Bostrom과 같은 인물과 관련된 보다 철학적인 작업과 2022년 이후 출시된 거의 모든 주요 대화형 모델에서 사용되는 응용 훈련 기법 사이를 연결했다.