EleutherAI comenzó en julio de 2020 como un colectivo de investigación informal y voluntario, organizado principalmente a través de un servidor de Discord, formado en respuesta a la decisión de OpenAI de lanzar GPT-3 solo a través de una API comercial, en lugar de hacerlo con pesos abiertos o con detalles completos de entrenamiento. Los primeros organizadores incluyeron a Connor Leahy, Leo Gao y Sid Black, y el grupo atrajo contribuciones de investigadores independientes, estudiantes de posgrado e ingenieros que querían un equivalente disponible públicamente a GPT-3 con fines de investigación.
The Pile y los primeros modelos
La primera gran producción de EleutherAI fue The Pile, un conjunto de datos curado de 800 gigabytes, ensamblado a partir de 22 fuentes más pequeñas, incluidos libros, artículos académicos, repositorios de código y texto web, lanzado en 2020 como una alternativa abierta a las mezclas no divulgadas de datos de entrenamiento utilizadas por laboratorios cerrados. The Pile se convirtió en un corpus de preentrenamiento ampliamente utilizado, adoptado más allá de los propios modelos de EleutherAI por otros esfuerzos de investigación abierta, en un papel comparable al que Common Crawl había proporcionado como datos web crudos. El grupo luego entrenó y lanzó GPT-Neo y GPT-J, modelos de lenguaje transformadores que, aunque más pequeños que GPT-3, estaban entre los puntos de control abiertos más grandes de su época, seguidos en 2022 por GPT-NeoX-20B, entonces uno de los mayores lanzamientos abiertos de modelos fundacionales disponibles públicamente.
Formalización y trabajo posterior
EleutherAI se incorporó como instituto de investigación sin fines de lucro en 2022, formalizando lo que había comenzado como un esfuerzo voluntario ad hoc y permitiéndole recibir subvenciones y donaciones, incluido el apoyo de organizaciones interesadas en seguridad de la IA y el acceso abierto a la investigación. La organización amplió su alcance más allá de la replicación de modelos de lenguaje hacia una investigación empírica más amplia sobre el comportamiento de los modelos, la interpretabilidad y la metodología de evaluación, y mantuvo y distribuyó herramientas de evaluación, incluido un arnés de evaluación de LLM amplamente utilizado, adoptado en toda la comunidad de investigación para medir el rendimiento de puntos de referencia de manera consistente.
Legado e influencia
Los modelos y conjuntos de datos de EleutherAI precedieron e informaron directamente la ola de lanzamientos de pesos abiertos que siguieron, incluido el trabajo posteriormente alojado extensamente en Hugging Face y los esfuerzos de organizaciones mejor financiadas como Allen Institute for AI y el programa LLaMA de Meta AI. Los comentaristas han atribuido al colectivo el mérito de demostrar que un grupo poco organizado, en gran parte voluntario y sin respaldo corporativo importante, podría contribuir significativamente a la investigación de modelos de lenguaje en la frontera, y de establecer normas sobre la documentación de conjuntos de datos y el lanzamiento abierto que los esfuerzos posteriores de modelos abiertos, mejor financiados, continuaron siguiendo.