Jeffrey Kaplan은 인공지능과 기계 학습을 전문으로 하는 컴퓨터 과학자이다. 그는 OpenAI가 개발한 가장 크고 영향력 있는 대규모 언어 모델 중 하나인 GPT-3를 소개한 논문의 공동 저자로서 가장 잘 알려져 있다. Kaplan의 연구는 신경망의 확장 동작을 이해하고 더 안전한 AI 시스템을 개발하는 데 기여했다.
Kaplan의 연구 관심사는 모델 확장, 훈련 역학, AI 정렬의 교차점에 있다. 그의 기여는 특히 모델 아키텍처와 성능 예측 분야에서 생성형 AI 시스템을 구축하는 현대적 접근 방식을 형성하는 데 도움을 주었다.
초기 경력 및 교육
Kaplan은 물리학과 수학에서 학부 과정을 마치며 정량적 추론에 대한 강력한 기반을 다졌다. 이후 기계 학습 분야에서 대학원 과정을 밟으며 확률적 모델과 최적화 기법에 집중했다. 학창 시절 동안 그는 MIT CSAIL 및 스탠포드 AI 연구소와 같은 기관의 광범위한 연구 커뮤니티의 영향을 받았지만, 그의 직접적인 임용은 민간 산업에 있었다.
그의 초기 작업은 자연어 처리 작업에 딥러닝을 적용하는 것이었으며, 이는 결국 2019년 OpenAI에 합류하는 계기가 되었다. 당시 OpenAI는 강화 학습 연구에서 트랜스포머 기반 모델 확장으로 전환하고 있었다.
GPT-3 및 확장 법칙
Kaplan의 가장 주목할 만한 기여는 2020년 GPT-3를 소개한 논문 "Language Models are Few-Shot Learners"의 공동 저자로서였다. 1,750억 개의 매개변수를 가진 이 모델은 대규모 트랜스포머가 최소한의 미세 조정으로 다양한 작업을 수행할 수 있음을 입증했으며, 문맥 내 학습에 의존했다. Kaplan의 역할은 다양한 크기에 걸친 모델 성능의 실험 설계와 분석을 포함했다.
GPT-3 이전에 Kaplan은 신경 언어 모델의 확장 법칙을 조사한 2020년 연구의 주 저자였다. 그 연구는 모델 크기, 데이터셋 크기, 계산 예산 사이의 예측 가능한 멱법칙 관계를 확립하여 OpenAI가 후속 모델에 자원을 할당하는 방식을 안내했다. 이러한 발견은 현대 LLM에 사용되는 잔차 네트워크 개선 및 층 정규화 기법과 같은 모델 아키텍처의 후속 발전에 영향을 미쳤다.
Anthropic으로의 전환
2021년, Kaplan은 OpenAI를 떠나 전 OpenAI 연구원들이 공동 설립한 경쟁 AI 안전 회사인 Anthropic에 합류했다. Anthropic에서 그의 초점은 해석 가능성과 정렬 연구, 특히 RLHF(인간 피드백 기반 강화 학습) 및 유해 출력을 줄이는 기법으로 옮겨갔다. 그는 헌법적 AI 원칙을 강조하며 Anthropic의 어시스턴트 모델인 Claude 개발에 기여했다.
Anthropic에서의 그의 작업은 모델을 더 투명하고 제어 가능하게 만드는 방법을 탐구했으며, 환각과 편향과 같은 문제를 다루었다. 또한 그는 창의성과 안전성의 균형을 목표로 출력 다양성에 대한 온도 스케일링 및 top-p 샘플링의 효과를 조사했다.
연구 기여
Kaplan의 연구 포트폴리오에는 Adam 최적화 도구 및 그 변형과 같은 최적화 알고리즘에 대한 연구와 커리큘럼 학습 전략이 포함된다. 그는 또한 훈련을 안정화하기 위한 기울기 클리핑 및 드롭아웃 방법에 대해 발표했다. 그의 공동 저술 논문은 종종 이론적 보장보다 경험적 발견을 강조하며, 이는 산업 연구소에서 흔한 스타일이다.
확장 법칙 외에도 그는 멀티 헤드 어텐션 메커니즘과 장거리 의존성 포착에서의 역할을 이해하는 데 기여했다. 이 작업은 번역 및 요약에 사용되는 시퀀스-투-시퀀스 아키텍처와 인코더-디코더 모델에 영향을 미친다.
더 넓은 영향 및 산업 영향력
Kaplan의 확장 법칙에 대한 발견은 AI 산업 전반에 널리 채택되었으며, AMD 및 Intel과 같은 회사의 하드웨어 개발에 영향을 미쳤지만, 이들 기업은 주로 모델이 아닌 칩에 집중한다. 그의 통찰력은 AWS 및 Azure 클라우드 서비스와 같은 대규모 모델 훈련을 위한 컴퓨팅 인프라에 대한 막대한 투자를 정당화하는 데 도움을 주었다. 특히 그의 작업은 Google DeepMind 및 토론토 대학교 그룹의 연구에서도 인용되었다.
신중한 확장에 대한 그의 주장은 모델 훈련의 환경적 및 경제적 비용에 대한 논의를 장려하여 모델 가지치기 및 효율성 기법에 대한 관심을 불러일으켰다. 성능과 안전성에 대한 Kaplan의 이중 초점은 그를 최첨단 능력 작업과 정렬 문제를 연결하는 소수의 연구자 그룹에 위치시킨다.
개인 생활 및 유산
Kaplan의 개인 생활에 대해서는 공개적으로 알려진 바가 거의 없으며, 그는 전문적인 출판물 외에는 낮은 프로필을 유지한다. 2020년대 초반 현재 그는 AI 연구에 계속 활동하며 대규모 신경 시스템을 이해하고 제어하기 위한 지속적인 노력에 기여하고 있다. 그의 유산은 현대 기계 학습 응용 프로그램에 필수적인 현재 세대의 대규모 언어 모델을 뒷받침하는 경험적 프레임워크와 연결되어 있다.