EleutherAI begann im Juli 2020 als informelles, ehrenamtliches Forschungskollektiv, das hauptsächlich über einen Discord-Server organisiert wurde. Es entstand als Reaktion auf die Entscheidung von OpenAI, GPT-3 nur über eine kommerzielle API freizugeben, anstatt als offene Gewichte oder mit vollständigen Trainingsdetails. Zu den frühen Organisatoren gehörten Connor Leahy, Leo Gao und Sid Black. Die Gruppe zog Beiträge von unabhängigen Forschern, Doktoranden und Ingenieuren an, die für Forschungszwecke eine öffentlich verfügbare Alternative zu GPT-3 wollten.
The Pile und frühe Modelle
Die erste größere Veröffentlichung von EleutherAI war der Pile, ein kuratierter Datensatz von 800 Gigabyte, der aus 22 kleineren Quellen zusammengestellt wurde, darunter Bücher, wissenschaftliche Arbeiten, Code-Repositories und Webtexte. Er wurde 2020 als offene Alternative zu den nicht offengelegten Trainingsdaten-Mischungen geschlossener Labore veröffentlicht. Der Pile wurde ein weit verbreitetes Pretraining-Korpus, das über EleutherAIs eigene Modelle hinaus von anderen offenen Forschungsprojekten übernommen wurde – in einer Rolle, die mit der von Common Crawl als rohen Webdaten vergleichbar ist. Die Gruppe trainierte und veröffentlichte anschließend GPT-Neo und GPT-J, Transformer-Sprachmodelle, die zwar kleiner als GPT-3 waren, aber zu den größten offen verfügbaren Checkpoints ihrer Zeit gehörten. 2022 folgte GPT-NeoX-20B, eines der damals größten offen veröffentlichten Foundation-Modelle.
Formalisierung und spätere Arbeit
EleutherAI wurde 2022 als gemeinnütziges Forschungsinstitut eingetragen und formalisierte damit das, was als Ad-hoc-Ehrenamtsprojekt begonnen hatte. Dies ermöglichte es der Organisation, Zuschüsse und Spenden zu erhalten, einschließlich Unterstützung von Organisationen, die sich für KI-Sicherheit und offenen Forschungszugang interessieren. Die Organisation erweiterte ihren Fokus über die Nachbildung von Sprachmodellen hinaus auf breitere empirische Forschung zu Modellverhalten, Interpretierbarkeit und Evaluierungsmethoden. Sie pflegte und verteilte zudem Evaluierungswerkzeuge, darunter eine weit verbreitete LLM-Evaluierungs-Umgebung, die in der Forschungsgemeinschaft für konsistente Benchmark-Messungen übernommen wurde.
Vermächtnis und Einfluss
EleutherAIs Modelle und Datensätze kamen vor der Welle von offenen Gewichts-Veröffentlichungen, die folgte, und informierten diese direkt – einschließlich Arbeiten, die später umfassend auf Hugging Face gehostet wurden, sowie Bemühungen besser finanzierter Organisationen wie Allen Institute for AI und Meta AI's LLaMA-Programm. Kommentatoren haben dem Kollektiv zugeschrieben, gezeigt zu haben, dass eine lose organisierte, weitgehend ehrenamtliche Gruppe ohne große Unternehmensunterstützung sinnvoll zur Forschung an Sprachmodellen an der Grenze des Machbaren beitragen kann. Zudem habe sie Normen für Datensatzdokumentation und offene Veröffentlichung etabliert, denen spätere, besser finanzierte offene Modellprojekte weiterhin folgten.