Traduit de l'anglais

EleutherAI est un groupe de recherche à but non lucratif en intelligence artificielle fondé en 2020 afin de créer des versions open-source de GPT-3, connu pour la publication de grands modèles de langage et de jeux de données comme [[the-pile|The Pile]] et GPT-NeoX-20B.

EleutherAI est un groupe de recherche à but non lucratif en intelligence artificielle qui développe des modèles et des ensembles de données d'IA open source. Fondé en 2020, le collectif est souvent décrit comme un équivalent open source d'OpenAI, visant à démocratiser l'accès aux grands modèles de langage et à la recherche connexe. Début 2023, il s'est officiellement constitué en tant qu'EleutherAI Institute, un institut de recherche à but non lucratif. En 2025, l'organisation maintient des ensembles de données d'entraînement largement utilisés, mène des recherches dans des domaines tels que l'interprétabilité et l'alignement, et participe aux débats de politique publique.

Le groupe est né d'un serveur Discord et s'est développé en une communauté collaborative de centaines de chercheurs bénévoles. Son travail a influencé le domaine plus large de l'IA générative en fournissant des modèles et des ensembles de données librement accessibles qui ont alimenté de nouvelles startups et la recherche académique.

Histoire

EleutherAI a commencé comme un serveur Discord le 7 juillet 2020, sous le nom provisoire « LibreAI » avant d'être rebaptisé « EleutherAI » plus tard dans le mois, en référence au mot grec pour la liberté, eleutheria. Les membres fondateurs étaient Connor Leahy, Leo Gao et Sid Black, qui ont coécrit le code initial pour créer un modèle d'apprentissage automatique similaire à GPT-3.

Le 31 décembre 2020, le groupe a publié The Pile, un ensemble de données organisé de textes divers pour entraîner de grands modèles de langage. Les premiers modèles, GPT-Neo, ont été publiés le 21 mars 2021, suivis de GPT-J-6B le 9 juin 2021, qui était alors le plus grand modèle open source de type GPT-3. Ces modèles ont été publiés sous licence Apache 2.0 et sont considérés comme ayant stimulé une toute nouvelle vague de startups.

Au départ, EleutherAI a refusé des offres de financement, s'appuyant sur le programme TPU Research Cloud de Google pour le calcul. Début 2021, ils ont accepté un financement de CoreWeave et SpellML sous forme d'accès à des clusters de GPU. Le 10 février 2022, ils ont publié GPT-NeoX-20B, un modèle plus grand rendu possible par ces ressources.

Début 2023, EleutherAI s'est constitué en institut de recherche à but non lucratif dirigé par Stella Biderman, Curtis Huebner et Shivanshu Purohit. L'organisation a recentré ses activités sur l'interprétabilité, l'alignement et la recherche scientifique, car l'entraînement et la publication de grands modèles de langage étaient devenus plus courants ailleurs.

En juillet 2024, une enquête de Proof News et Wired a révélé que l'ensemble de données The Pile incluait des sous-titres de plus de 170 000 vidéos YouTube provenant de plus de 48 000 chaînes, suscitant des critiques et des accusations de vol. En réponse, EleutherAI a publié « Common Pile » en 2025, un ensemble de données sans le matériel protégé par le droit d'auteur controversé, et a entraîné deux modèles à partir de celui-ci. En collaboration avec l'Institut de sécurité de l'IA du Royaume-Uni, ils ont également constaté que filtrer les données d'entraînement pour supprimer des concepts clés peut maintenir les performances tout en réduisant les informations nuisibles.

Recherche et modèles

La recherche d'EleutherAI couvre plusieurs domaines, avec des centaines de contributeurs bénévoles. Le groupe a publié plusieurs modèles et ensembles de données notables largement utilisés dans la communauté de l'IA.

The Pile

The Pile est un ensemble de données de 886 Go conçu pour entraîner de grands modèles de langage. Initialement développé pour GPT-Neo, il a été utilisé pour entraîner d'autres modèles, y compris le Megatron-Turing Natural Language Generation de Microsoft. Ses caractéristiques distinctives sont sa sélection organisée de données choisies par des chercheurs et sa documentation approfondie. La version initiale a fait l'objet d'un examen minutieux pour avoir contenu du matériel protégé par le droit d'auteur, y compris des livres et des sous-titres de divers médias.

Common Pile

Common Pile v0.1, publié en juin 2025 en partenariat avec de nombreux collaborateurs, ne contient que des œuvres dont les licences permettent l'utilisation pour l'entraînement de modèles d'IA. Cela répond aux problèmes de droit d'auteur de The Pile.

Modèles GPT

EleutherAI a entraîné de grands modèles de langage open source inspirés de GPT-3 d'OpenAI, avec des nombres de paramètres de 125 millions, 1,3 milliard, 2,7 milliards, 6 milliards et 20 milliards. GPT-Neo (125M, 1,3B, 2,7B) a été publié en mars 2021, suivi de GPT-J (6B) en juin 2021, tous deux étant les plus grands modèles open source de style GPT-3 à leur publication. GPT-NeoX-20B a suivi le 10 février 2022.

VQGAN-CLIP

Après qu'OpenAI a publié DALL-E en janvier 2021 sans accès public, Katherine Crowson d'EleutherAI et l'artiste numérique Ryan Murdock ont développé une technique utilisant l'apprentissage contrastif image-texte (CLIP) pour convertir des modèles de génération d'images classiques en modèles de synthèse texte-image. S'appuyant sur des idées de DeepDream de Google, ils ont combiné CLIP avec VQGAN pour créer VQGAN-CLIP. Crowson a partagé la technologie via des notebooks que les gens pouvaient exécuter gratuitement.

Impact et politique

Les modèles et ensembles de données open source d'EleutherAI ont considérablement influencé l'écosystème de l'IA, permettant aux startups et aux chercheurs de travailler avec de grands modèles de langage sans restrictions propriétaires. L'organisation participe également aux débats de politique publique, plaidant pour une recherche ouverte et abordant les préoccupations éthiques concernant l'utilisation des données et la sécurité des modèles.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·open-source·non-profit·large-language-models
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique