영어에서 번역됨

EleutherAI는 2020년에 설립된 비영리 인공지능 연구 그룹으로, GPT-3의 오픈소스 버전을 만드는 것을 목표로 하며, The Pile 및 GPT-NeoX-20B와 같은 대규모 언어 모델과 데이터셋을 공개한 것으로 알려져 있다.

EleutherAI는 오픈소스 AI 모델과 데이터셋을 개발하는 비영리 인공지능 연구 그룹이다. 2020년에 설립된 이 집단은 종종 OpenAI의 오픈소스 대응체로 묘사되며, 대규모 언어 모델과 관련 연구에 대한 접근성을 민주화하는 것을 목표로 한다. 2023년 초, 이 단체는 공식적으로 비영리 연구 기관인 EleutherAI Institute로 법인화되었다. 2025년 기준으로, 이 조직은 널리 사용되는 훈련 데이터셋을 유지하고, 해석 가능성과 정렬과 같은 분야에서 연구를 수행하며, 공공 정책 논의에 참여하고 있다.

이 그룹은 Discord 서버에서 시작되었으며 수백 명의 자원봉사 연구자들로 구성된 협력적 커뮤니티로 성장했다. 이들의 작업은 자유롭게 이용 가능한 모델과 데이터셋을 제공함으로써 생성형 AI의 광범위한 분야에 영향을 미쳤으며, 이는 새로운 스타트업과 학술 연구에 연료를 공급했다.

역사

EleutherAI는 2020년 7월 7일 "LibreAI"라는 임시 이름으로 Discord 서버에서 시작되었으며, 같은 달에 그리스어로 자유를 뜻하는 eleutheria를 참조하여 "EleutherAI"로 이름을 변경했다. 창립 멤버는 Connor Leahy, Leo Gao, Sid Black으로, 이들은 GPT-3와 유사한 머신 러닝 모델을 만들기 위한 초기 코드를 공동 작성했다.

2020년 12월 31일, 이 그룹은 대규모 언어 모델 훈련을 위한 다양한 텍스트로 구성된 선별된 데이터셋인 The Pile을 출시했다. 첫 번째 모델인 GPT-Neo는 2021년 3월 21일에 출시되었고, GPT-J-6B는 2021년 6월 9일에 이어졌으며, 이는 당시 가장 큰 오픈소스 GPT-3 유사 모델이었다. 이 모델들은 Apache 2.0 라이선스로 출시되었으며 완전히 새로운 스타트업 물결에 연료를 공급한 것으로 간주된다.

처음에 EleutherAI는 자금 제안을 거절했고, 컴퓨팅 자원을 위해 Google의 TPU Research Cloud Program에 의존했다. 2021년 초, 이들은 CoreWeave와 SpellML로부터 GPU 클러스터 접근 형태의 자금을 수락했다. 2022년 2월 10일, 이들은 이러한 자원으로 가능해진 더 큰 모델인 GPT-NeoX-20B를 출시했다.

2023년 초, EleutherAI는 Stella Biderman, Curtis Huebner, Shivanshu Purohit가 이끄는 비영리 연구 기관으로 법인화되었다. 이 조직은 해석 가능성, 정렬, 과학적 연구에 초점을 전환했으며, 이는 LLM 훈련과 출시가 다른 곳에서 더 일반화되었기 때문이다.

2024년 7월, Proof News와 Wired의 조사에 따르면 The Pile 데이터셋에는 48,000개 이상의 채널에서 170,000개 이상의 YouTube 비디오의 자막이 포함되어 있어 비판과 도난 혐의를 받았다. 이에 대응하여 EleutherAI는 2025년에 논란이 되는 저작권 자료가 없는 데이터셋인 "Common Pile"을 출시하고, 이를 기반으로 두 개의 모델을 훈련했다. 영국 AI 보안 연구소와 협력하여, 이들은 핵심 개념을 제거하기 위해 훈련 데이터를 필터링하면 성능을 유지하면서 유해한 정보를 줄일 수 있다는 것도 발견했다.

연구 및 모델

EleutherAI의 연구는 수백 명의 자원봉사 기여자와 함께 여러 분야에 걸쳐 있다. 이 그룹은 AI 커뮤니티에서 널리 사용되는 여러 주목할 만한 모델과 데이터셋을 출시했다.

The Pile

The Pile은 대규모 언어 모델 훈련을 위해 설계된 886 GB 데이터셋이다. 원래 GPT-Neo를 위해 개발되었으며, Microsoft의 Megatron-Turing Natural Language Generation을 포함한 다른 모델을 훈련하는 데 사용되었다. 이 데이터셋의 특징은 연구자들이 선택한 선별된 데이터와 철저한 문서화이다. 초기 버전은 책과 다양한 미디어의 자막을 포함한 저작권 자료를 포함하고 있다는 비판을 받았다.

Common Pile

Common Pile v0.1은 2025년 6월에 많은 협력자들과의 파트너십으로 출시되었으며, AI 모델 훈련에 사용을 허용하는 라이선스가 있는 작품만 포함한다. 이는 The Pile의 저작권 문제를 해결한다.

GPT 모델

EleutherAI는 OpenAI의 GPT-3에서 영감을 받은 오픈소스 대규모 언어 모델을 훈련했으며, 매개변수 수는 1억 2,500만, 13억, 27억, 60억, 200억이다. GPT-Neo(125M, 1.3B, 2.7B)는 2021년 3월에 출시되었고, GPT-J(6B)는 2021년 6월에 이어졌으며, 둘 다 출시 당시 가장 큰 오픈소스 GPT-3 스타일 모델이었다. GPT-NeoX-20B는 2022년 2월 10일에 이어졌다.

VQGAN-CLIP

OpenAI가 2021년 1월에 DALL-E를 공개 접근 없이 출시한 후, EleutherAI의 Katherine Crowson과 디지털 아티스트 Ryan Murdock은 일반 이미지 생성 모델을 텍스트-이미지 합성 모델로 변환하기 위해 Contrastive Language-Image Pre-training(CLIP)을 사용하는 기술을 개발했다. Google의 DeepDream의 아이디어를 기반으로, 이들은 CLIP을 VQGAN과 결합하여 VQGAN-CLIP을 만들었다. Crowson은 사람들이 무료로 실행할 수 있는 노트북을 통해 이 기술을 공유했다.

영향 및 정책

EleutherAI의 오픈소스 모델과 데이터셋은 AI 생태계에 상당한 영향을 미쳤으며, 스타트업과 연구자들이 독점적 제한 없이 대규모 언어 모델을 작업할 수 있게 했다. 이 조직은 또한 공공 정책 논의에 참여하여 개방형 연구를 옹호하고 데이터 사용과 모델 안전성에 관한 윤리적 우려를 다루고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·open-source·non-profit·large-language-models
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사