영어에서 번역됨

John Schulman은 미국의 머신러닝 연구자이자 OpenAI 공동 창립자로, Proximal Policy Optimization 알고리즘 개발과 ChatGPT 뒤에 있는 인간 피드백 기반 강화 학습(RLHF) 작업을 주도한 것으로 알려져 있습니다.

John Schulman은 Reinforcement learning 알고리즘을 널리 개발하고 OpenAI의 초기 채팅 모델 뒤에 있는 훈련 방법론을 이끈 것으로 가장 잘 알려진 머신러닝 연구자입니다. 그는 캘리포니아 대학교 버클리에서 로봇공학 및 강화학습 연구실에서 박사 학위를 받았으며, 2015년 12월 OpenAI가 출범했을 때 창립 연구원 중 한 명이었습니다.

연구 기여

Schulman의 가장 많이 인용된 기술적 기여는 그가 주도한 2017년 논문에서 소개된 Proximal Policy Optimization(PPO)입니다. PPO는 기존의 신뢰 영역 방법을 구현하고 조정하기 더 쉬운 알고리즘으로 단순화했으며, 로봇공학과 이후 언어 모델 훈련 모두에서 가장 널리 배포된 정책 그래디언트 알고리즘 중 하나가 되었습니다. PPO는 이후 RLHF 파이프라인에서 사용되는 기본 최적화 알고리즘이 되었으며, 여기에는 ChatGPT 뒤에 있는 것도 포함됩니다.

OpenAI에서의 역할

OpenAI에서 Schulman은 RLHF를 대규모 언어 모델에 적용한 팀을 이끌었으며, 이 작업은 2022년 InstructGPT를 만들었고 2022년 11월 ChatGPT 출시에 직접 기여했습니다(Launch of ChatGPT 참조). 그는 내부 및 외부에서 GPT-3 시대 모델이 단순히 텍스트를 이어가는 대신 지시를 안정적으로 따르도록 만든 정렬 기술의 기술적 설계자로 널리 인정받았습니다. 그는 GPT-4 시대를 통해 사후 훈련 및 정렬 연구를 계속 이끌었으며, Ilya SutskeverSam Altman과 같은 동료들과 함께 일했습니다.

Anthropic 및 Thinking Machines Lab으로의 이직

2024년 8월, Schulman은 OpenAI를 떠나 Anthropic에 합류한다고 발표했으며, 관리보다는 AI 정렬 연구와 실무 기술 작업에 더 직접적으로 집중하고 싶다고 밝혔습니다. 이 움직임은 OpenAI의 2023년 11월 이사회 위기(OpenAI board crisis 참조) 이후 1년도 채 되지 않아 나온 것이어서 주목받았으며, 많은 관찰자들은 이를 안전 중심 연구소로 향하는 고위 연구자들의 더 넓은 이동의 일부로 해석했습니다. 그는 2024년 내내 Anthropic에서 정렬 및 사후 훈련 방법을 연구했습니다.

2025년, Schulman은 Anthropic을 떠나 전 OpenAI 최고 기술 책임자였던 Mira Murati가 설립한 스타트업 Thinking Machines Lab에 공동 창립자이자 최고 과학자로 합류했습니다. 이 움직임은 AI 스타트업 역사상 가장 큰 시드 라운드 중 하나를 모금한 회사에 여러 OpenAI 동문들과 함께 자리하게 했습니다.

영향

Schulman은 Reinforcement learning을 인간 피드백에서 연구적 호기심이 아닌 실용적이고 생산 규모의 기술로 전환하는 데 가장 책임이 있는 연구자 중 한 명으로 간주되며, 이는 2022년 이후 출시된 거의 모든 소비자 챗봇의 기반이 되는 변화입니다. OpenAI, Anthropic, Thinking Machines Lab을 거친 그의 경력 궤적은 최고의 AI 연구 인재가 최첨단 연구소 사이에서 어떻게 순환하는지에 대한 사례 연구로도 인용됩니다.

분류:reinforcement-learning·alignment·industry
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사