EleutherAI는 2020년 7월에 주로 Discord 서버를 통해 조직된 비공식적 자원봉사 연구 집단으로 시작되었으며, OpenAI가 GPT-3를 공개 가중치나 전체 훈련 세부 정보 없이 상업용 API를 통해서만 출시하기로 한 결정에 대응하여 형성되었습니다. 초기 조직자로는 Connor Leahy, Leo Gao, Sid Black이 있었으며, 연구 목적으로 GPT-3와 공개적으로 동등한 모델을 원했던 독립 연구자, 대학원생, 엔지니어들의 기여를 받았습니다.
The Pile과 초기 모델
EleutherAI의 첫 주요 성과는 Pile로, 2020년에 공개된 폐쇄 실험실이 사용한 비공개 Training data 혼합물에 대한 공개 대안으로 출시된 800기가바이트 규모의 선별된 데이터셋으로, 서적, 학술 논문, 코드 저장소, 웹 텍스트를 포함한 22개의 작은 소스에서 수집되었습니다. Pile은 널리 사용되는 Pretraining 말뭉치가 되어 EleutherAI 자체 모델을 넘어 다른 공개 연구 노력에도 채택되었으며, Common Crawl이 원시 웹 데이터로 제공한 역할과 유사한 역할을 했습니다. 그 후 그룹은 GPT-Neo와 GPT-J, 트랜스포머 언어 모델을 훈련하고 공개했는데, 이들은 GPT-3보다 작지만 당시 가장 큰 공개 체크포인트 중 하나였으며, 2022년에는 당시 공개적으로 제공된 가장 큰 Foundation model 출시작 중 하나인 GPT-NeoX-20B가 이어졌습니다.
공식화와 이후 작업
EleutherAI는 2022년에 비영리 연구 기관으로 법인화되어 임시 자원봉사 노력으로 시작된 것을 공식화했으며, AI safety와 공개 연구 접근에 관심 있는 조직의 지원을 포함한 보조금과 기부를 받을 수 있게 되었습니다. 조직은 언어 모델 복제를 넘어 모델 행동, Mechanistic interpretability, 평가 방법론에 대한 광범위한 경험적 연구로 범위를 확장했으며, 연구 커뮤니티에서 AI benchmark 성능을 일관되게 측정하는 데 널리 채택된 LLM evaluation 하네스를 포함한 평가 도구를 유지하고 배포했습니다.
유산과 영향
EleutherAI의 모델과 데이터셋은 이후 이어진 Open-weights models 출시 물결을 앞서고 직접적으로 알렸으며, 여기에는 나중에 Hugging Face에서 광범위하게 호스팅된 작업과 Allen Institute for AI 및 Meta AI의 Llama 프로그램과 같은 자금이 더 풍부한 조직의 노력이 포함되었습니다. 평론가들은 이 집단이 주요 기업 지원 없이 느슨하게 조직된 대부분 자원봉사 그룹이 최첨단에 가까운 언어 모델 연구에 의미 있게 기여할 수 있음을 입증했고, 데이터셋 문서화와 공개 출시에 관한 규범을 확립했으며, 이후 더 자금이 풍부한 공개 모델 노력이 계속 따르게 했다고 평가했습니다.