英語からの翻訳

The Pileは、EleutherAIが2020年に大規模言語モデルのトレーニング用に作成した886 GBのオープンソース英語テキストデータセットであり、22のサブデータセットで構成されています。。著作権紛争に直面し、2025年にCommon Pile v0.1のリリースにつながりました。。

The Pileは、大規模言語モデル(LLM)のトレーニング用に作成された、886GBの多様なオープンソースの英語テキストデータセットである。2020年にEleutherAIによって構築され、同年12月31日に公開された。このデータセットは、書籍、映画の台本、科学論文など、22のサブデータセットで構成されている。2024年時点で、The PileとCommon Crawlは、AIモデルのトレーニングに使用される2つの主要なトレーニングデータセットとなっていた。

The Pileは、ウェブのみのコーパスに代わる、より多様で高品質な選択肢を提供するために設計され、学術出版物、法律文書、創作文章などの情報源から引き出されている。その規模と多様性により、多くの大規模言語モデルプロジェクト、特にオープンソースコミュニティにおけるプロジェクトにとって、基礎的なリソースとなった。このデータセットの構造により、研究者は異なるデータタイプがモデルのパフォーマンスに与える影響を研究することができ、機械学習人工知能の進歩に貢献した。

構成とサブデータセット

The Pileは、英語テキストの異なる領域とスタイルをカバーするために選択された22の異なるサブデータセットを統合している。これには、書籍のコレクションであるBooks3、映画やテレビの字幕を含むOpenSubtitles、科学論文を提供するarXivが含まれる。その他の構成要素には、PubMedの抄録、米国の法律意見書、GitHubのコードなどがある。この多様性は、トレーニングされたモデルの汎化能力を向上させ、技術的な質問応答から創作文章まで、さまざまなタスクを処理できるようにすることを意図していた。

GitHubからのコードとarXivからの学術論文を含めることで、The Pileは、プログラミングや科学研究を支援できるモデルのトレーニングに特に有用となった。非営利のAI研究グループであるEleutherAIのデータセット作成者は、以前はOpenAIGoogle DeepMindのような大企業に限定されていた高品質なトレーニングデータへのアクセスを民主化することを目指した。

著作権論争

The Pileの使用をめぐる著作権紛争は、2023年に激化した。Books3コンポーネントには、海賊版サイトであるBibliotikから収集された著作権で保護された素材が含まれている。2023年7月、デンマークの反海賊版グループであるRights Allianceは、DMCA通知を通じてBooks3を削除した。Books3は、2024年に3人の著者によって損害賠償を求める集団訴訟が提起される前にThe Pileから削除されたが、元のデータセットのコピーはウェブ上でまだ入手可能だった。2024年までに、The Pileは元のサイトからも削除されたが、他のファイル共有サービスからは引き続きアクセス可能だった。

別のサブデータセットであるOpenSubtitlesは、ドキュメンタリー、映画、テレビ、オンラインビデオからの著作権で保護された作品の使用をめぐって論争を引き起こした。何万ものYouTubeビデオの字幕がYouTubeから直接スクレイピングされ、The Pileに含まれており、YouTubeはこれを利用規約に反すると主張した。これらの問題は、ニューラルネットワークトランスフォーマーモデルのトレーニングにウェブスクレイピングされたデータを使用することの法的および倫理的課題を浮き彫りにした。

Common Pile v0.1

2025年6月、EleutherAIは、Poolside、Hugging Face、米国議会図書館、およびトロント大学MITCMU、Vector Institute、Allen Institute for AIを含む14の機関の20人以上の研究者と協力して、Common Pile v0.1をリリースした。このトレーニングデータセットには、AIモデルのトレーニングに使用することをライセンスが許可する作品のみが含まれている。その意図は、著作権を尊重しながらAIシステムを倫理的にトレーニングすることが可能であることを示すことだった。

作成者らは、データの収集は完全に自動化できず、人間がすべてのエントリを検証および注釈付けする必要があるため、時間がかかることがわかった。それにもかかわらず、結果として得られたモデルは期待を超える結果を達成できたが、それでもフロンティアモデルと比較できるものではなかった。作成者らは、Common Pileから生成された結果を、Common Pile作成の2年前にリリースされたモデルであるLlama 2と類似していると比較した。このモデルは、基礎となるトレーニングデータに関する著作権問題が少なければ、その出力を使用する人々に提供する法的リスクが少ないはずである。

影響と遺産

The Pileは、深層学習モデルのトレーニング用に大規模でアクセス可能なデータセットを提供することで、オープンソースAI研究の状況に大きな影響を与えた。そのリリースにより、小規模な研究グループや独立した開発者が大規模なトレーニングを実験できるようになり、これは以前はハイテク大手が独占していた。このデータセットはまた、AIにおけるデータの出所と著作権に関する議論を促進し、倫理的な調達を優先するCommon Pileのようなイニシアチブにつながった。

2024年時点で、The PileとCommon Crawlは、法的な課題にもかかわらず、多くのAIモデルの主要なトレーニングデータセットであり続けた。Common Pileのようなより慎重にキュレーションされたデータセットへの移行は、イノベーションと法的および倫理的考慮事項のバランスを取りながら、責任あるAI開発に向けた業界の幅広い傾向を反映している。The Pileの遺産は、その技術的貢献だけでなく、生成AIの分野でトレーニングデータが収集され使用される方法の再評価を促したことにある。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·large-language-model·open-source·ai-training
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴