The Pile एक 886 GB विविध, ओपन-सोर्स अंग्रेजी पाठ डेटासेट है जिसे बड़े भाषा मॉडल (LLMs) को प्रशिक्षित करने के लिए बनाया गया था। इसे EleutherAI द्वारा 2020 में निर्मित किया गया था और उसी वर्ष 31 दिसंबर को सार्वजनिक रूप से जारी किया गया था। डेटासेट में 22 उप-डेटासेट शामिल हैं, जिनमें पुस्तकें, फिल्म स्क्रिप्ट और वैज्ञानिक पेपर, अन्य मीडिया के अलावा शामिल हैं। 2024 तक, The Pile और Common Crawl AI मॉडल को प्रशिक्षित करने के लिए उपयोग किए जाने वाले दो मुख्य प्रशिक्षण डेटासेट रहे हैं।
The Pile को केवल-वेब कॉर्पोरा के लिए एक अधिक विविध और उच्च-गुणवत्ता वाले विकल्प प्रदान करने के लिए डिज़ाइन किया गया था, जो शैक्षणिक प्रकाशनों, कानूनी दस्तावेजों और रचनात्मक लेखन जैसे स्रोतों से लिया गया था। इसका पैमाना और विविधता इसे कई बड़े भाषा मॉडल परियोजनाओं के लिए एक आधारभूत संसाधन बनाती है, विशेष रूप से ओपन-सोर्स समुदाय में। डेटासेट की संरचना ने शोधकर्ताओं को मॉडल प्रदर्शन पर विभिन्न डेटा प्रकारों के प्रभाव का अध्ययन करने की अनुमति दी, जिससे मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में प्रगति में योगदान मिला।
संरचना और उप-डेटासेट
The Pile में 22 अलग-अलग उप-डेटासेट शामिल हैं, जिनमें से प्रत्येक को अंग्रेजी पाठ के विभिन्न डोमेन और शैलियों को कवर करने के लिए चुना गया है। इनमें Books3, पुस्तकों का एक संग्रह; OpenSubtitles, जिसमें फिल्म और टेलीविजन उपशीर्षक शामिल हैं; और arXiv, जो वैज्ञानिक पेपर प्रदान करता है। अन्य घटकों में PubMed सार, अमेरिकी कानूनी राय और GitHub कोड, अन्य के अलावा शामिल हैं। इस विविधता का उद्देश्य इस पर प्रशिक्षित मॉडलों की सामान्यीकरण क्षमताओं में सुधार करना था, जिससे वे तकनीकी प्रश्न-उत्तर से लेकर रचनात्मक लेखन तक के कार्यों को संभाल सकें।
GitHub से कोड और arXiv से शैक्षणिक पेपरों का समावेश The Pile को विशेष रूप से उन मॉडलों को प्रशिक्षित करने के लिए उपयोगी बनाता है जो प्रोग्रामिंग और वैज्ञानिक अनुसंधान में सहायता कर सकते हैं। EleutherAI, एक गैर-लाभकारी AI अनुसंधान समूह, के डेटासेट निर्माताओं का लक्ष्य उच्च-गुणवत्ता वाले प्रशिक्षण डेटा तक पहुंच को लोकतांत्रिक बनाना था, जो पहले OpenAI और Google DeepMind जैसे बड़े निगमों तक सीमित था।
कॉपीराइट विवाद
The Pile के उपयोग के आसपास केंद्रित कॉपीराइट विवाद 2023 में बढ़ गए। Books3 घटक में Bibliotik, एक पायरेसी वेबसाइट, से संकलित कॉपीराइट सामग्री शामिल है। जुलाई 2023 में, डेनिश एंटी-पायरेसी समूह Rights Alliance ने DMCA नोटिस के माध्यम से Books3 को हटा दिया। Books3 को The Pile से हटा दिया गया था, इससे पहले 2024 में तीन लेखकों द्वारा एक क्लास एक्शन मुकदमा दायर किया गया था, क्योंकि मूल डेटासेट की प्रतियां अभी भी वेब पर उपलब्ध थीं। 2024 तक, The Pile को भी अपनी मूल साइट से हटा दिया गया था, हालांकि यह अन्य फ़ाइल साझाकरण सेवाओं से सुलभ रहा।
एक और उप-डेटासेट, OpenSubtitles, ने वृत्तचित्रों, फिल्मों, टेलीविजन और ऑनलाइन वीडियो से कॉपीराइट कार्यों के उपयोग पर विवाद पैदा किया। दसियों हज़ार YouTube वीडियो के उपशीर्षक सीधे YouTube से स्क्रैप किए गए और The Pile में शामिल किए गए, जिसे YouTube ने अपनी सेवा की शर्तों के खिलाफ बताया। इन मुद्दों ने तंत्रिका नेटवर्क और ट्रांसफॉर्मर मॉडल को प्रशिक्षित करने के लिए वेब-स्क्रैप किए गए डेटा का उपयोग करने की कानूनी और नैतिक चुनौतियों को उजागर किया।
Common Pile v0.1
जून 2025 में, EleutherAI ने Poolside, Hugging Face, अमेरिकी लाइब्रेरी ऑफ कांग्रेस, और टोरंटो विश्वविद्यालय, MIT, CMU, वेक्टर इंस्टीट्यूट और एलन इंस्टीट्यूट फॉर AI सहित 14 संस्थानों के दो दर्जन से अधिक शोधकर्ताओं के साथ साझेदारी में, Common Pile v0.1 जारी किया। इस प्रशिक्षण डेटासेट में केवल वे कार्य शामिल हैं जहां लाइसेंस AI मॉडल के प्रशिक्षण के लिए उनके उपयोग की अनुमति देते हैं। इसका उद्देश्य यह दिखाना था कि कॉपीराइट का सम्मान करते हुए नैतिक रूप से AI सिस्टम को प्रशिक्षित करते समय क्या संभव है।
निर्माताओं ने पाया कि डेटा एकत्र करना समय लेने वाला था क्योंकि इसे पूरी तरह से स्वचालित नहीं किया जा सकता था, मनुष्यों द्वारा हर प्रविष्टि को सत्यापित और एनोटेट किया जाता था। इसके बावजूद, परिणामी मॉडल उनकी अपेक्षाओं से अधिक परिणाम प्राप्त कर सकते थे, हालांकि वे अभी भी सीमांत मॉडल के बराबर नहीं थे। निर्माताओं ने Common Pile से उत्पन्न परिणामों की तुलना Llama 2 से की, जो Common Pile के निर्माण से दो साल पहले जारी एक मॉडल था। यदि अंतर्निहित प्रशिक्षण डेटा के साथ कम कॉपीराइट मुद्दे हैं, तो मॉडल को इसके आउटपुट का उपयोग करने वालों को कम कानूनी जोखिम प्रदान करना चाहिए।
प्रभाव और विरासत
The Pile ने गहन शिक्षण मॉडल को प्रशिक्षित करने के लिए एक बड़ा, सुलभ डेटासेट प्रदान करके ओपन-सोर्स AI अनुसंधान के परिदृश्य को महत्वपूर्ण रूप से प्रभावित किया। इसकी रिलीज़ ने छोटे अनुसंधान समूहों और स्वतंत्र डेवलपर्स को बड़े पैमाने पर प्रशिक्षण के साथ प्रयोग करने में सक्षम बनाया, जो पहले तकनीकी दिग्गजों द्वारा हावी था। डेटासेट ने AI में डेटा उत्पत्ति और कॉपीराइट के बारे में चर्चाओं को भी प्रेरित किया, जिससे Common Pile जैसी पहल हुई जो नैतिक सोर्सिंग को प्राथमिकता देती हैं।
2024 तक, The Pile और Common Crawl कानूनी चुनौतियों के बावजूद कई AI मॉडलों के लिए प्राथमिक प्रशिक्षण डेटासेट बने रहे। Common Pile जैसे अधिक सावधानी से क्यूरेट किए गए डेटासेट की ओर बदलाव उद्योग में जिम्मेदार AI विकास की ओर एक व्यापक प्रवृत्ति को दर्शाता है, जो नवाचार को कानूनी और नैतिक विचारों के साथ संतुलित करता है। The Pile की विरासत न केवल इसके तकनीकी योगदान में निहित है, बल्कि जनरेटिव AI के क्षेत्र में प्रशिक्षण डेटा को एकत्र करने और उपयोग करने के तरीके के पुनर्मूल्यांकन को प्रेरित करने में भी है।