译自英文

EleutherAI是一个成立于2020年的非营利人工智能研究团体,旨在创建GPT-3的开源版本,以发布大型语言模型和数据集(如The Pile和GPT-NeoX-20B)而闻名。

EleutherAI是一个非营利性人工智能研究团体,致力于开发开源AI模型和数据集。该团体成立于2020年,常被描述为OpenAI的开源对应组织,旨在使大型语言模型及相关研究更加普及。2023年初,该团体正式注册为EleutherAI研究所,一个非营利性研究机构。截至2025年,该组织维护着广泛使用的训练数据集,在可解释性和对齐等领域开展研究,并参与公共政策讨论。

该团体起源于一个Discord服务器,现已发展为一个由数百名志愿研究人员组成的协作社区。其工作通过提供免费可用的模型和数据集,推动了新初创企业和学术研究的发展,对生成式AI领域产生了广泛影响。

历史

EleutherAI于2020年7月7日以暂定名称“LibreAI”在Discord服务器上起步,随后于当月更名为“EleutherAI”,引用希腊语中意为自由的词汇eleutheria。创始成员为Connor Leahy、Leo Gao和Sid Black,他们共同编写了初始代码,以创建类似于GPT-3的机器学习模型。

2020年12月31日,该团体发布了The Pile,这是一个经过策划的多样化文本数据集,用于训练大型语言模型。首批模型GPT-Neo于2021年3月21日发布,随后GPT-J-6B于2021年6月9日发布,后者是当时最大的开源GPT-3类模型。这些模型以Apache 2.0许可证发布,被认为催生了全新一波初创企业。

最初,EleutherAI拒绝了资金提议,依赖Google的TPU研究云计划获取计算资源。到2021年初,他们接受了CoreWeave和SpellML以GPU集群访问形式提供的资助。2022年2月10日,他们发布了GPT-NeoX-20B,这是一个借助这些资源实现的更大模型。

2023年初,EleutherAI注册为非营利性研究机构,由Stella Biderman、Curtis Huebner和Shivanshu Purohit领导。该组织将重心转向可解释性、对齐和科学研究,因为训练和发布大型语言模型在其他地方已变得更加普遍。

2024年7月,Proof News和Wired的一项调查发现,The Pile数据集包含来自超过48,000个频道的170,000多个YouTube视频的字幕,引发了批评和盗窃指控。作为回应,EleutherAI于2025年发布了“Common Pile”,这是一个不含争议性版权材料的数据集,并从中训练了两个模型。该组织还与英国AI安全研究所合作,发现过滤训练数据以移除关键概念可以在保持性能的同时减少有害信息。

研究与模型

EleutherAI的研究涵盖多个领域,拥有数百名志愿贡献者。该团体发布了多个在AI社区中广泛使用的知名模型和数据集。

The Pile

The Pile是一个886 GB的数据集,专为训练大型语言模型而设计。最初为GPT-Neo开发,它也被用于训练其他模型,包括Microsoft的Megatron-Turing自然语言生成模型。其显著特点在于研究人员精心策划的数据选择以及详尽的文档记录。初始版本因包含版权材料(包括书籍和各种媒体的字幕)而受到审查。

Common Pile

Common Pile v0.1于2025年6月与众多合作者联合发布,仅包含其许可证允许用于训练AI模型的作品。这解决了The Pile的版权问题。

GPT模型

EleutherAI训练了受OpenAI的GPT-3启发的开源大型语言模型,参数数量分别为1.25亿、13亿、27亿、60亿和200亿。GPT-Neo(125M、1.3B、2.7B)于2021年3月发布,随后GPT-J(6B)于2021年6月发布,两者在发布时均为最大的开源GPT-3风格模型。GPT-NeoX-20B于2022年2月10日发布。

VQGAN-CLIP

在OpenAI于2021年1月发布DALL-E但未提供公开访问后,EleutherAI的Katherine Crowson和数字艺术家Ryan Murdock开发了一种技术,利用对比语言-图像预训练(CLIP)将常规图像生成模型转换为文本到图像合成模型。基于Google的DeepDream思想,他们将CLIP与VQGAN结合,创建了VQGAN-CLIP。Crowson通过笔记本共享了该技术,人们可以免费运行这些笔记本。

影响与政策

EleutherAI的开源模型和数据集显著影响了AI生态系统,使初创企业和研究人员能够在没有专有限制的情况下使用大型语言模型。该组织还参与公共政策讨论,倡导开放研究,并解决数据使用和模型安全方面的伦理问题。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·open-source·non-profit·large-language-models
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史