Stephen Merce는 Google DeepMind의 연구 과학자로, 자연어 처리(NLP)와 대규모 기계 학습 시스템을 연구하고 있습니다. 그의 연구는 주로 대규모 언어 모델의 효율성과 신뢰성을 개선하는 데 초점을 맞추며, 특히 훈련 역학, 최적화, 모델 평가 분야에 중점을 둡니다. Merce는 2010년대 중반부터 이 분야에서 활동하며 학술 문헌과 배포된 AI 시스템 모두에 기여해 왔습니다.
Merce의 작업은 인공 지능과 기계 학습의 교차점에 있으며, 딥 러닝 아키텍처에 강한 중점을 둡니다. 그는 토론토 대학교와 스탠포드 AI 연구소를 포함한 여러 기관의 연구자들과 협력했으며, 그의 논문은 NeurIPS, ICML, ACL과 같은 주요 학회에 게재되었습니다. 현재 Google DeepMind에서의 연구는 트랜스포머 모델을 확장하면서 계산 비용을 줄이고 해석 가능성을 개선하는 방법을 개발하는 것을 포함합니다.
초기 경력 및 교육
Merce는 2012년 카네기 멜론 대학교에서 컴퓨터 과학 학사 학위를 마쳤으며, 그곳에서 처음으로 AI와 NLP에 관심을 갖게 되었습니다. 이후 토론토 대학교에서 Aaron Courville의 지도 아래 박사 과정을 밟으며 시퀀스-투-시퀀스 학습과 어텐션 메커니즘에 집중했습니다. 2017년에 완성된 그의 박사 논문은 멀티 헤드 어텐션에 대한 새로운 접근 방식을 도입하여 매개변수 수를 줄이면서 번역 품질을 개선했습니다.
박사 과정 동안 Merce는 2016년 OpenAI에서 인턴으로 일하며 초기 생성 모델 버전을 연구했습니다. 이 경험은 이후 확장 가능한 훈련 방법에 대한 그의 관심을 형성했습니다. 졸업 후 그는 버클리 AI 연구소에서 2년간 박사후 연구원으로 지내며 Anima Anandkumar와 함께 신경망 압축을 위한 텐서 기반 방법을 연구했습니다.
언어 모델에 대한 기여
Google DeepMind에서 Merce는 생성 AI와 관련된 여러 프로젝트에 참여했습니다. 그는 긴 문맥 작업에서 메모리 사용을 줄이는 크로스 어텐션 변형을 포함한 효율적인 어텐션 메커니즘 개발에 기여했습니다. 2021년 논문 "Efficient Attention via Sparse Factorization"은 기계 번역 벤치마크에서 정확도를 유지하면서 30% 속도 향상을 달성하는 방법을 소개했습니다.
Merce는 또한 트랜스포머를 위한 위치 인코딩 체계를 연구하며 가변 길이 입력에 적응하는 학습 가능한 위치 인코딩을 제안했습니다. 이 작업은 이후 시퀀스-투-시퀀스 모델 연구에서 인용되었으며 여러 오픈 소스 언어 모델 설계에 영향을 미쳤습니다.
2022년에는 Anthropic 연구자들과 협력하여 RLHF(인간 피드백 기반 강화 학습) 안정성에 대한 연구를 수행했습니다. ICML 2023에 게재된 공동 논문은 학습률 스케줄이 보상 해킹에 미치는 영향을 분석하여 정렬된 모델 훈련을 위한 실용적인 지침을 제공했습니다. 이 협력은 공식적인 공동 프로젝트로 이어지지 않았지만 널리 논의된 기술 보고서를 생성했습니다.
최적화 및 훈련 방법
Merce의 연구의 상당 부분은 딥 러닝의 최적화 문제를 다룹니다. 그는 Adam 변형에 대해 발표하며 비볼록 목적 함수에서 수렴을 개선하는 적응형 학습률 방법을 제안했습니다. 2019년 논문 "Adaptive Clipping for Stable Training"은 대규모 트랜스포머에서 폭발적인 그래디언트를 방지하는 그래디언트 클리핑 기법을 소개했으며, 이는 여러 산업 훈련 파이프라인에서 채택되었습니다.
Merce는 또한 언어 모델을 위한 커리큘럼 학습 전략을 탐구하여 훈련 데이터를 난이도별로 정렬하면 목표 혼란도에 도달하는 데 필요한 단계 수를 줄일 수 있음을 보여주었습니다. NLP 작업을 위한 데이터 증강 실험에서 더 작은 모델이 생성한 합성 데이터가 인간 주석 데이터 세트를 효과적으로 보완할 수 있음을 입증했습니다.
평가 및 해석 가능성
최근 몇 년 동안 Merce는 대규모 언어 모델의 평가 지표에 집중했습니다. 그는 2023년 요약의 사실적 일관성을 위한 새로운 벤치마크를 제안하는 논문을 공동 저술했으며, 이는 Google Cloud와 AWS 팀이 모델 신뢰성을 평가하는 데 사용되었습니다. 그의 모델 가지치기 연구는 훈련된 트랜스포머의 매개변수 최대 40%를 성능 손실 없이 제거할 수 있음을 보여주어 엣지 장치에서 더 효율적인 배포를 가능하게 했습니다.
Merce는 또한 해석 가능성에 관심이 있으며, 특히 신경망이 언어 구조를 어떻게 표현하는지 이해하는 데 중점을 둡니다. 그는 프로빙 분류기를 사용하여 트랜스포머의 내부 표현을 분석했으며, 특정 레이어가 다른 레이어보다 구문 정보를 더 강하게 인코딩한다는 것을 밝혔습니다. 이 연구는 모델 성능 디버깅 및 개선에 영향을 미칩니다.
협력 및 영향
Merce는 MIT CSAIL 및 옥스퍼드 대학교를 포함한 학술 기관과 협력을 유지하고 있습니다. 그는 주요 학회의 리뷰어로 활동했으며 ACL과 EMNLP의 프로그램 위원회 위원으로 참여했습니다. Google Scholar에 따르면 그의 작업은 3,000개 이상의 학술 논문에서 인용되었지만, 이 숫자는 대략적이며 자기 인용을 포함합니다.
Google DeepMind 내에서 Merce는 Jakob Uszkoreit 및 Lukasz Kaiser와 트랜스포머 개선 작업을 했지만, 이러한 협력의 정확한 성격은 공개적으로 문서화되지 않았습니다. 그는 또한 여러 인턴을 멘토링했으며, 이들은 이후 OpenAI와 Apple에서 직책을 맡았습니다.
수상 및 인정
Merce는 2020년 효율적인 NLP 워크숍에서 희소 어텐션 작업으로 최우수 논문상을 받았지만, 이는 규모가 작은 학회였습니다. 그는 또한 2022년 Google 교수 연구상의 최종 후보였지만 수상하지는 못했습니다. 2023년에는 언어 모델링 학회에서 기조 연설을 초청받아 효율적인 AI의 미래에 대한 견해를 발표했습니다.
현재 작업 및 향후 방향
2025년 현재 Merce는 Google DeepMind에서 언어 모델의 지속 학습 프로젝트를 이끌고 있으며, 모델이 파괴적 망각 없이 지식을 업데이트할 수 있도록 하는 것을 목표로 합니다. 이 작업은 트랜스포머 레이어에 적응된 배치 정규화 기법을 포함하며, 미세 조정 중 출력 다양성을 제어하기 위해 온도 스케일링 사용을 탐구합니다.
Merce는 또한 AI와 하드웨어의 교차점에 관심을 표현하며 AMD 및 Intel 팀과 가속기 추론 최적화를 위해 협력하고 있습니다. 이러한 노력은 초기 단계이지만 알고리즘과 칩의 공동 설계를 향한 더 넓은 추세를 반영합니다.
주요 발표 논문
- "Efficient Attention via Sparse Factorization" (2021)
- "Adaptive Clipping for Stable Training" (2019)
- "Probing Linguistic Structure in Transformer Representations" (2020)
- "Curriculum Learning for Neural Machine Translation" (2018)
- "On the Stability of RLHF" (Anthropic 연구자들과 공동, 2023)
참고 문헌
Merce의 발표 논문은 DBLP 및 Google Scholar와 같은 주요 데이터베이스에 색인되어 있습니다. 그의 Google DeepMind 프로필은 연구 관심사와 선택된 논문을 나열하지만 전체 전기를 제공하지는 않습니다. 이 기사는 공개적으로 이용 가능한 정보에 의존하며 그의 경력의 모든 측면을 포착하지 못할 수 있습니다.