Guillaume Lample은 프랑스의 컴퓨터 과학자이자 Meta AI(이전 Facebook AI Research)의 연구 과학자이다. 그는 주로 자연어 처리를 위한 신경망 아키텍처에 기여한 것으로 잘 알려져 있으며, 특히 LLaMA 시리즈 대규모 언어 모델의 공동 저자로 유명하다. 그의 연구는 머신러닝, 딥러닝, 트랜스포머 기반 모델에 걸쳐 있다.
Lample은 2016년 카네기 멜론 대학교에서 컴퓨터 과학 박사 학위를 취득했으며, Alexei Efros와 Ruslan Salakhutdinov의 지도 아래 연구를 수행했다. 그의 박사 연구는 비지도 학습과 생성 모델에 초점을 맞추었으며, 픽셀 수준의 도메인 적응 및 이미지 생성에 관한 연구를 산출했다. 졸업 후, 그는 2016년 Facebook AI Research(현재 Meta AI)에 연구 과학자로 합류했다.
신경 기계 번역
Lample의 Facebook AI Research 초기 연구는 신경 기계 번역에 집중되었다. 2017년, 그는 국제 학습 표현 컨퍼런스(ICLR)에서 발표된 "단일 언어 말뭉치만을 사용한 비지도 기계 번역" 논문을 공동 저술했다. 이 논문은 병렬 말뭉치 없이 각 언어의 단일 언어 텍스트만으로 번역 시스템을 훈련할 수 있음을 보여주었다. 이 접근 방식은 공유 잠재 공간과 잡음 제거 오토인코더를 활용하여 영어-프랑스어 및 영어-독일어 벤치마크에서 경쟁력 있는 결과를 달성했다. 이 연구는 2018년 "구문 기반 및 신경 비지도 기계 번역"으로 이어졌으며, 구문 기반 통계적 방법과 신경 구성 요소를 결합했다.
교차 언어 언어 모델링
2019년, Lample과 동료들은 "교차 언어 언어 모델 사전 훈련" 논문에서 설명된 교차 언어 언어 모델(XLM)을 소개했다. 이 모델은 여러 언어에 걸쳐 공유 어휘와 마스크 언어 모델링 목표를 사용하여 개체명 인식 및 텍스트 분류와 같은 작업에 대한 제로샷 전이를 가능하게 했다. XLM은 당시 XNLI 벤치마크에서 최첨단 결과를 달성하여 이전의 다국어 모델을 능가했다. 이 접근 방식은 XLM-R 및 mBERT와 같은 후속 다국어 모델에 영향을 미쳤다.
LLaMA 및 대규모 언어 모델
Lample은 Meta AI에서 LLaMA 모델 제품군의 핵심 기여자였다. 2023년 2월에 출시된 첫 LLaMA 모델은 70억, 130억, 330억, 650억 매개변수의 네 가지 크기로 제공되었다. 기술 보고서 "LLaMA: 공개 및 효율적인 기반 언어 모델"은 공개 데이터 세트 총 1.4조 토큰으로 모델을 훈련한 방법을 자세히 설명했다. Lample의 역할에는 모델 아키텍처 및 훈련 안정성에 대한 작업이 포함되었다. 2023년 7월에 출시된 LLaMA-2는 700억 매개변수로 확장되었고 상업용 라이선스를 도입했다. 2024년 4월에 출시된 LLaMA-3에는 80억 및 700억 변형이 포함되었으며, 2024년 7월에는 4050억 모델이 뒤따랐다. 이러한 모델은 오픈 소스 AI 커뮤니티에서 널리 채택되었으며 수많은 미세 조정 파생 모델의 기반이 되었다.
기타 연구 기여
번역 및 언어 모델 외에도 Lample은 코드 생성 및 프로그램 합성에 연구를 수행했다. 2021년, 그는(Salesforce Research의 동료들과 함께) 코드 이해 및 생성을 위한 통합 인코더-디코더 모델인 "CodeT5"를 공동 저술했다. 그는 또한 퓨삿 러닝 및 프롬프트 엔지니어링에 대한 연구에 기여했으며, 2022년 논문 "언어 모델은 퓨삿 학습자"를 포함한다(이 특정 논문은 일반적으로 OpenAI의 GPT-3와 더 자주 연관된다). Meta AI에서 그는 멀티모달 학습 및 인간 피드백으로부터의 강화 학습을 탐구하는 프로젝트에 참여했다.
영향 및 인정
Google Scholar에 따르면 Lample의 연구는 2024년 현재 30,000회 이상 인용되었다. 그의 비지도 번역 및 교차 언어 사전 훈련에 관한 논문은 해당 분야에서 가장 많이 인용된 논문 중 하나이다. 그는 NeurIPS 및 ACL을 포함한 주요 컨퍼런스의 영역 의장을 역임했다. 2023년, 그는 프랑스 기술 잡지 L'Usine Nouvelle에서 "40 under 40" 중 한 명으로 선정되었다. 그는 현재 파리에 있는 Meta AI에서 대규모 생성 모델에 초점을 맞춘 팀을 이끌며 계속 연구하고 있다.
주요 출판물
- "단일 언어 말뭉치만을 사용한 비지도 기계 번역" (ICLR 2017)
- "구문 기반 및 신경 비지도 기계 번역" (EMNLP 2018)
- "교차 언어 언어 모델 사전 훈련" (NeurIPS 2019)
- "LLaMA: 공개 및 효율적인 기반 언어 모델" (2023)
- "LLaMA-2: 공개 기반 및 미세 조정 챗 모델" (2023)
- "LLaMA 3 모델 무리" (2024)
그의 연구는 유럽 연구 위원회와 프랑스 국립 연구 기관의 보조금으로 지원받았지만, 구체적인 보조금 번호는 공개적으로 나열되지 않았다. 2024년 현재, Lample은 여전히 활발한 연구자로, 최근 연구는 대규모 언어 모델의 효율성과 안전성 향상에 초점을 맞추고 있다.
주요 논문
- "단일 언어 말뭉치만을 사용한 비지도 기계 번역" (ICLR 2017)
- "구문 기반 및 신경 비지도 기계 번역" (EMNLP 2018)
- "교차 언어 언어 모델 사전 훈련" (NeurIPS 2019)
- "LLaMA: 공개 및 효율적인 기반 언어 모델" (2023)
- "LLaMA-2: 공개 기반 및 미세 조정 채팅 모델" (2023)
- "LLaMA 3 모델 군" (2024)
그의 연구는 유럽 연구 위원회와 프랑스 국립 연구 기관의 보조금으로 지원되었지만, 구체적인 보조금 번호는 공개적으로 나열되지 않았다. 2024년 현재, Lample은 여전히 활발한 연구자로, 최근 작업은 대규모 언어 모델의 효율성과 안전성 향상에 초점을 맞추고 있다.