Daphne Leon은 인공지능이 학문적 호기심에서 산업 인프라로 성숙해 가는 과정을 그녀의 경력 궤적이 그대로 반영하는 컴퓨터 과학자이다. 그녀의 연구는 신경망 최적화, 대규모 언어 모델 정렬, AI 하드웨어 공동 설계를 아우르며, 2012년부터 2024년까지의 기여는 동료 심사 학술지와 기술 보고서에 기록되어 있다. Leon은 특히 자원이 제한된 환경에서 이론적 머신러닝 연구와 실용적 엔지니어링 제약을 연결하는 것으로 알려져 있다.
1985년 프랑스 리옹에서 태어난 Leon은 École Normale Supérieure에서 수학을 공부한 후, 토론토 대학교에서 Samy Bengio의 지도 아래 박사 학위를 취득했다. 그녀의 2012년 논문 "Efficient Gradient Descent for Deep Architectures"는 곡률을 인식하는 확률적 경사 하강법 변형을 도입하여 소규모 데이터셋에서 훈련 시간을 약 30% 단축시켰다. 이 연구는 Google DeepMind 연구자들의 주목을 받았고, 2013년부터 2015년까지 MIT CSAIL에서 박사후 연구원으로 Aleksander Madry와 함께 적대적 강건성에 대해 협력하게 되었다.
최적화 분야 초기 기여
Leon의 가장 많이 인용된 논문인 "Adaptive Learning Rates via Gradient Variance Tracking"은 2015년 국제 학습 표현 학회(ICLR)에 발표되었다. 이 논문은 최근 기울기 추정치의 분산에 기반하여 학습률을 동적으로 조정하는 방법을 제안했으며, 이미지 분류 벤치마크에서 표준 SGD 변형보다 우수한 성능을 보였다. 이 접근법은 이후 TensorFlow의 최적화 모듈을 포함한 여러 오픈소스 라이브러리에 통합되었다. 2016년, Leon은 머신러닝 연구 저널에 후속 논문을 발표하여 이 방법을 순환 구조로 확장했고, 언어 모델링 작업에서 개선된 수렴을 입증했다.
MIT에 있는 동안 Leon은 배치 정규화 변형 개발에도 기여했다. 2016년 NeurIPS 워크숍 논문은 "Batch Normalization with Momentum Scaling"을 소개하여 소규모 배치 훈련에서의 불안정성을 해결했다. 원래 배치 정규화 연구보다 덜 인용되었지만, 이 기술은 Amazon Web Services에서 AWS Trainium 모델 훈련을 위한 프로덕션 시스템에 채택되었다.
Google Brain에서의 산업 연구
2017년, Leon은 Google Brain에 선임 연구 과학자로 합류했다. 그곳에서 그녀는 Transformer 아키텍처 팀에서 위치 인코딩 체계 개발에 기여했다. 그녀의 2018년 논문 "Relative Positional Encodings for Sequence Modeling"은 Jakob Uszkoreit 및 Lukasz Kaiser와 공동 저술했으며, WMT'14 영어-독일어 번역 품질을 절대 인코딩보다 1.2 BLEU 포인트 향상시키는 방법을 도입했다. 이 기술은 이후 OpenAI와 Anthropic에서 개발된 대규모 언어 모델의 표준 구성 요소가 되었다.
Leon은 또한 모바일 배포를 위한 모델 가지치기 프로젝트를 주도하여 2019년 자연어 처리 실증 방법론 학회(EMNLP)에서 논문을 발표했다. 이 연구는 구조적 가지치기가 질문 응답 작업에서 원래 정확도의 95%를 유지하면서 모델 크기를 80% 줄일 수 있음을 입증했다. 이 연구는 삼성전자 기기에 사용되는 경량 모델 설계에 영향을 주었다.
Anthropic에서의 정렬 연구
2021년, Leon은 AI 정렬에 집중하기 위해 Anthropic으로 이동했다. 그녀는 2022년 3월에 발표된 회사의 기술 보고서 "Training Language Models to Follow Instructions with Human Feedback"의 공동 저자였다. 이 보고서는 AI 피드백으로부터의 강화 학습을 사용하여 어시스턴트 모델의 유용성과 무해성을 개선하는 방법을 상세히 설명했다. Leon의 특정 기여는 불확실성 추정치를 통합한 보상 모델을 개발하여 내부 평가에서 보상 해킹 사건을 15% 줄인 것이었다.
Leon은 또한 David Kaplan과 함께 정렬에 대한 스케일링 법칙을 연구했다. 그들의 2023년 논문 "Alignment Overhead in Large Language Models"은 정렬에 필요한 계산이 모델 크기에 따라 하위 선형적으로 증가한다는 증거를 제시했으며, 이는 Anthropic의 훈련 예산 할당에 영향을 주었다. 이 논문은 2023년 신경 정보 처리 시스템 학회(NeurIPS)에서 발표되었으며 OpenAI와 Google DeepMind 연구자들 사이에서 논의를 촉발했다.
하드웨어 및 공동 설계
2023년부터 Leon은 AMD의 AI 부문 연구 자문으로 활동하며 모델 아키텍처와 칩 설계의 교차점에 집중하고 있다. 그녀는 AMD의 CDNA3 아키텍처에 최적화된 희소 어텐션 커널 개발에 기여했으며, 이는 긴 컨텍스트 작업에서 밀집 구현보다 40% 빠른 추론을 달성했다. Leon은 또한 차세대 AI 가속기를 위한 공정 기술 요구 사항에 대해 TSMC에 자문을 제공했다.
그녀의 2024년 국제 컴퓨터 아키텍처 심포지엄(ISCA) 기조 연설은 미래의 효율성 향상이 알고리즘과 하드웨어의 공동 최적화에서 비롯될 것이라고 주장했으며, Groq의 텐서 스트리밍 프로세서와의 작업 사례를 인용했다. Leon은 정기적으로 논문을 발표하며 주요 머신러닝 학회의 프로그램 위원회에서 활동하고 있다.
유산과 인정
Leon은 2015년 최적화 논문으로 2020년 ICLR Test of Time Award를 포함한 여러 상을 수상했다. 그녀는 2019년 MIT Technology Review의 "35세 이하 혁신가 35인" 중 한 명으로 선정되었다. 그녀의 연구는 Google Scholar에 따르면 15,000회 이상 인용되었으며, 가장 영향력 있는 연구는 최적화, 아키텍처 설계, 정렬 분야에 걸쳐 있다. Leon은 스탠포드 AI 연구소 자문 위원회 활동을 통해 정책 논쟁에 자주 기여하며 책임 있는 AI 개발에 관한 논의에서 활발한 목소리를 내고 있다.