EleutherAI ist eine gemeinnützige Forschungsgruppe für künstliche Intelligenz, die Open-Source-KI-Modelle und Datensätze entwickelt. Das Kollektiv wurde 2020 gegründet und wird oft als Open-Source-Pendant zu OpenAI beschrieben, mit dem Ziel, den Zugang zu großen Sprachmodellen und verwandter Forschung zu demokratisieren. Anfang 2023 wurde es formell als EleutherAI Institute, ein gemeinnütziges Forschungsinstitut, eingetragen. Stand 2025 pflegt die Organisation weit verbreitete Trainingsdatensätze, betreibt Forschung in Bereichen wie Interpretierbarkeit und Alignment und beteiligt sich an öffentlichen politischen Diskussionen.
Die Gruppe entstand in einem Discord-Server und ist zu einer kollaborativen Gemeinschaft von Hunderten von freiwilligen Forschern herangewachsen. Ihre Arbeit hat das breitere Feld der generativen KI beeinflusst, indem sie frei verfügbare Modelle und Datensätze bereitstellte, die neue Startups und akademische Forschung befeuert haben.
Geschichte
EleutherAI begann am 7. Juli 2020 als Discord-Server unter dem vorläufigen Namen „LibreAI“, bevor es später im selben Monat in „EleutherAI“ umbenannt wurde, in Anlehnung an das griechische Wort für Freiheit, eleutheria. Die Gründungsmitglieder waren Connor Leahy, Leo Gao und Sid Black, die den ursprünglichen Code für ein maschinelles Lernmodell ähnlich wie GPT-3 mitverfassten.
Am 31. Dezember 2020 veröffentlichte die Gruppe The Pile, einen kuratierten Datensatz mit vielfältigen Texten zum Training großer Sprachmodelle. Die ersten Modelle, GPT-Neo, wurden am 21. März 2021 veröffentlicht, gefolgt von GPT-J-6B am 9. Juni 2021, das damals das größte Open-Source-Modell im GPT-3-Stil war. Diese Modelle wurden unter der Apache-2.0-Lizenz veröffentlicht und gelten als Auslöser einer völlig neuen Welle von Startups.
Zunächst lehnte EleutherAI Finanzierungsangebote ab und verließ sich auf das TPU Research Cloud Program von Google für Rechenleistung. Anfang 2021 akzeptierten sie Finanzierung von CoreWeave und SpellML in Form von GPU-Cluster-Zugang. Am 10. Februar 2022 veröffentlichten sie GPT-NeoX-20B, ein größeres Modell, das durch diese Ressourcen ermöglicht wurde.
Anfang 2023 wurde EleutherAI als gemeinnütziges Forschungsinstitut eingetragen, geleitet von Stella Biderman, Curtis Huebner und Shivanshu Purohit. Die Organisation verlagerte ihren Fokus auf Interpretierbarkeit, Alignment und wissenschaftliche Forschung, da das Training und die Veröffentlichung von LLMs anderswo üblicher geworden waren.
Im Juli 2024 ergab eine Untersuchung von Proof News und Wired, dass der Datensatz The Pile Untertitel von über 170.000 YouTube-Videos aus mehr als 48.000 Kanälen enthielt, was Kritik und Vorwürfe von Diebstahl hervorrief. Als Reaktion veröffentlichte EleutherAI 2025 „Common Pile“, einen Datensatz ohne das umstrittene urheberrechtlich geschützte Material, und trainierte zwei Modelle daraus. In Zusammenarbeit mit dem britischen AI Security Institute fanden sie außerdem heraus, dass das Filtern von Trainingsdaten zur Entfernung zentraler Konzepte die Leistung aufrechterhalten kann, während schädliche Informationen reduziert werden.
Forschung und Modelle
Die Forschung von EleutherAI erstreckt sich über mehrere Bereiche, mit Hunderten von freiwilligen Mitwirkenden. Die Gruppe hat mehrere bemerkenswerte Modelle und Datensätze veröffentlicht, die in der KI-Gemeinschaft weit verbreitet sind.
The Pile
The Pile ist ein 886 GB großer Datensatz, der für das Training großer Sprachmodelle entwickelt wurde. Ursprünglich für GPT-Neo entwickelt, wurde er auch zum Training anderer Modelle verwendet, darunter Microsofts Megatron-Turing Natural Language Generation. Seine Unterscheidungsmerkmale sind die kuratierte Auswahl von Daten durch Forscher und die gründliche Dokumentation. Die erste Version wurde wegen urheberrechtlich geschützten Materials, einschließlich Büchern und Untertiteln aus verschiedenen Medien, kritisiert.
Common Pile
Common Pile v0.1, veröffentlicht im Juni 2025 in Partnerschaft mit vielen Mitarbeitern, enthält nur Werke, deren Lizenzen die Nutzung zum Training von KI-Modellen erlauben. Dies adressiert die Urheberrechtsprobleme von The Pile.
GPT-Modelle
EleutherAI trainierte Open-Source-Sprachmodelle, die von OpenAIs GPT-3 inspiriert waren, mit Parameterzahlen von 125 Millionen, 1,3 Milliarden, 2,7 Milliarden, 6 Milliarden und 20 Milliarden. GPT-Neo (125M, 1,3B, 2,7B) wurde im März 2021 veröffentlicht, gefolgt von GPT-J (6B) im Juni 2021, beide waren zum Zeitpunkt ihrer Veröffentlichung die größten Open-Source-Modelle im GPT-3-Stil. GPT-NeoX-20B folgte am 10. Februar 2022.
VQGAN-CLIP
Nachdem OpenAI DALL-E im Januar 2021 ohne öffentlichen Zugang veröffentlicht hatte, entwickelten EleutherAIs Katherine Crowson und der digitale Künstler Ryan Murdock eine Technik, die Contrastive Language-Image Pre-training (CLIP) nutzt, um reguläre Bildgenerierungsmodelle in Text-zu-Bild-Synthese-Modelle umzuwandeln. Aufbauend auf Ideen von Googles DeepDream kombinierten sie CLIP mit VQGAN, um VQGAN-CLIP zu erstellen. Crowson teilte die Technologie über Notebooks, die Menschen kostenlos ausführen konnten.
Auswirkungen und Politik
Die Open-Source-Modelle und Datensätze von EleutherAI haben das KI-Ökosystem erheblich beeinflusst, indem sie Startups und Forschern die Arbeit mit großen Sprachmodellen ohne proprietäre Einschränkungen ermöglichten. Die Organisation beteiligt sich auch an öffentlichen politischen Diskussionen, setzt sich für offene Forschung ein und adressiert ethische Bedenken hinsichtlich Datennutzung und Modellsicherheit.