英語からの翻訳

EleutherAIは、草の根の研究集団として始まり、後に非営利団体として正式化された組織で、2020年にGPT-3に匹敵する大規模言語モデルを再現し、公開リリースすることを目的として設立された。この組織は、広く利用されるオープンデータセットとモデルチェックポイントを生み出している。

EleutherAIは2020年7月に、主にDiscordサーバー上で組織された非公式のボランティア研究集団として始まりました。これは、OpenAIGPT-3をオープンウェイトや完全なトレーニング詳細ではなく、商業APIを通じてのみリリースするという決定に対応して形成されました。初期の主催者にはConnor Leahy、Leo Gao、Sid Blackが含まれ、独立した研究者、大学院生、エンジニアから貢献が集まり、研究目的でGPT-3に相当する公開利用可能なモデルを求める人々が参加しました。

The Pileと初期モデル

EleutherAIの最初の主要な成果はThe Pileでした。これは、書籍、学術論文、コードリポジトリ、ウェブテキストを含む22の小規模ソースから収集された800ギガバイトの厳選データセットで、2020年にクローズドラボが使用する非公開のTraining data混合物に対するオープンな代替としてリリースされました。The Pileは広く使用されるPretrainingコーパスとなり、EleutherAI自身のモデルを超えて、他のオープン研究プロジェクトにも採用され、Common Crawlが生のウェブデータとして提供していた役割に匹敵するものとなりました。その後、グループはGPT-NeoとGPT-Jをトレーニングしてリリースしました。これらはトランスフォーマー言語モデルで、GPT-3よりは小さいものの、当時公開されていたチェックポイントの中では最大級のものでした。続いて2022年にはGPT-NeoX-20Bがリリースされ、当時公開されていたFoundation modelのうち最大級のものの一つとなりました。

正式化とその後の活動

EleutherAIは2022年に非営利研究機関として法人化し、その場限りのボランティア活動として始まったものを正式化し、助成金や寄付を受けられるようにしました。これにはAI safetyやオープン研究アクセスに関心のある組織からの支援も含まれます。組織は言語モデルの再現を超えて、モデル行動、Mechanistic interpretability、評価方法論に関するより広範な実証研究に範囲を拡大し、研究コミュニティ全体でAI benchmark性能を一貫して測定するために広く採用されたLLM evaluationハーネスを含む評価ツールを維持・配布しました。

遺産と影響

EleutherAIのモデルとデータセットは、その後に続くOpen-weights modelsリリースの波に先行し、直接情報を提供しました。これには、後にHugging Faceで広くホストされた作品や、Allen Institute for AIMeta AILlamaプログラムなど、より資金力のある組織による取り組みが含まれます。コメンテーターは、この集団が、大企業の支援なしに緩やかに組織されたほぼボランティアのグループが、最先端に近い言語モデル研究に有意義に貢献できることを実証し、データセットの文書化とオープンリリースに関する規範を確立し、後のより資金力のあるオープンモデルプロジェクトが引き続き従う道筋を示したと評価しています。

カテゴリ:industry·open-source·research
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴