EleutherAI始于2020年7月,作为一个非正式、志愿者性质的研究集体,主要通过Discord服务器组织起来,其成立是对OpenAI决定仅通过商业API发布GPT-3而非开放权重或提供完整训练细节的回应。早期组织者包括Connor Leahy、Leo Gao和Sid Black,该团体吸引了独立研究人员、研究生和工程师的贡献,他们希望有一个公开可用的GPT-3等价物用于研究目的。
The Pile与早期模型
EleutherAI的首个主要成果是The Pile,一个800GB的精选数据集,由包括书籍、学术论文、代码库和网络文本在内的22个较小来源组成,于2020年发布,作为封闭实验室使用未公开Training data混合物的开放替代品。The Pile成为广泛使用的Pretraining语料库,不仅用于EleutherAI自身的模型,还被其他开放研究工作采用,其作用类似于Common Crawl作为原始网络数据所提供的功能。该团体随后训练并发布了GPT-Neo和GPT-J,这些Transformer语言模型虽然比GPT-3小,但当时是可公开获得的最大检查点之一,随后在2022年发布了GPT-NeoX-20B,这是当时最大的公开Foundation model发布之一。
正式化与后续工作
EleutherAI于2022年注册为非营利研究机构,将最初的非正式志愿者努力正式化,使其能够接受赠款和捐赠,包括来自对AI safety和开放研究访问感兴趣组织的支持。该组织将其范围从语言模型复制扩展到更广泛的模型行为、Mechanistic interpretability和评估方法的实证研究,并维护和分发评估工具,包括一个广泛使用的LLM evaluation工具包,被研究社区采用以一致地衡量AI benchmark性能。
遗产与影响
EleutherAI的模型和数据集早于并直接影响了随后的Open-weights models发布浪潮,包括后来在Hugging Face上广泛托管的工作,以及由资金更充足的组织如Allen Institute for AI和Meta AI的Llama项目所做的努力。评论者认为该集体证明了,一个松散组织、主要由志愿者组成且没有大型企业支持的团体,能够对前沿相关的语言模型研究做出有意义的贡献,并确立了数据集文档和开放发布的规范,后来的、资金更充足的开放模型工作继续遵循这些规范。