अंग्रेज़ी से अनुवादित

EleutherAI एक गैर-लाभकारी कृत्रिम बुद्धिमत्ता अनुसंधान समूह है, जिसकी स्थापना 2020 में GPT-3 के ओपन-सोर्स संस्करण बनाने के लिए की गई थी। यह समूह बड़े भाषा मॉडल और डेटासेट जैसे [[the-pile|The Pile]] और [[gpt-neox-20b|GPT-NeoX-20B]] जारी करने के लिए जाना जाता है।

EleutherAI एक गैर-लाभकारी कृत्रिम बुद्धिमत्ता अनुसंधान समूह है जो ओपन-सोर्स AI मॉडल और डेटासेट विकसित करता है। 2020 में स्थापित, इस समूह को अक्सर OpenAI के ओपन-सोर्स समकक्ष के रूप में वर्णित किया जाता है, जिसका उद्देश्य बड़े भाषा मॉडल और संबंधित अनुसंधान तक पहुंच को लोकतांत्रिक बनाना है। 2023 की शुरुआत में, इसने औपचारिक रूप से EleutherAI Institute के रूप में एक गैर-लाभकारी अनुसंधान संस्थान के रूप में शामिल किया। 2025 तक, संगठन व्यापक रूप से उपयोग किए जाने वाले प्रशिक्षण डेटासेट बनाए रखता है, व्याख्यात्मकता और संरेखण जैसे क्षेत्रों में अनुसंधान करता है, और सार्वजनिक नीति चर्चाओं में शामिल होता है।

यह समूह एक Discord सर्वर से उत्पन्न हुआ और सैकड़ों स्वयंसेवी शोधकर्ताओं के एक सहयोगी समुदाय के रूप में विकसित हुआ है। इसके काम ने जनरेटिव AI के व्यापक क्षेत्र को स्वतंत्र रूप से उपलब्ध मॉडल और डेटासेट प्रदान करके प्रभावित किया है, जिसने नए स्टार्टअप और शैक्षणिक अनुसंधान को बढ़ावा दिया है।

इतिहास

EleutherAI की शुरुआत 7 जुलाई, 2020 को एक Discord सर्वर के रूप में हुई, जिसका अस्थायी नाम "LibreAI" था, इससे पहले उसी महीने बाद में इसका नाम बदलकर "EleutherAI" कर दिया गया, जो स्वतंत्रता के लिए ग्रीक शब्द, eleutheria को संदर्भित करता है। संस्थापक सदस्य कॉनर लेही, लियो गाओ और सिड ब्लैक थे, जिन्होंने GPT-3 के समान एक मशीन लर्निंग मॉडल बनाने के लिए प्रारंभिक कोड सह-लिखा था।

31 दिसंबर, 2020 को, समूह ने द पाइल जारी किया, जो बड़े भाषा मॉडल को प्रशिक्षित करने के लिए विविध पाठ का एक क्यूरेटेड डेटासेट है। पहले मॉडल, GPT-Neo, 21 मार्च, 2021 को जारी किए गए थे, इसके बाद 9 जून, 2021 को GPT-J-6B आया, जो उस समय सबसे बड़ा ओपन-सोर्स GPT-3-शैली का मॉडल था। ये मॉडल Apache 2.0 लाइसेंस के तहत जारी किए गए थे और माना जाता है कि इन्होंने स्टार्टअप की एक पूरी तरह से नई लहर को बढ़ावा दिया।

शुरुआत में, EleutherAI ने फंडिंग के प्रस्तावों को ठुकरा दिया, कंप्यूटिंग के लिए Google के TPU रिसर्च क्लाउड प्रोग्राम पर निर्भर रहा। 2021 की शुरुआत तक, उन्होंने GPU क्लस्टर एक्सेस के रूप में CoreWeave और SpellML से फंडिंग स्वीकार कर ली। 10 फरवरी, 2022 को, उन्होंने GPT-NeoX-20B जारी किया, जो इन संसाधनों द्वारा सक्षम एक बड़ा मॉडल था।

2023 की शुरुआत में, EleutherAI ने स्टेला बिडरमैन, कर्टिस ह्यूबनेर और शिवांशु पुरोहित के नेतृत्व में एक गैर-लाभकारी अनुसंधान संस्थान के रूप में शामिल किया। संगठन ने व्याख्यात्मकता, संरेखण और वैज्ञानिक अनुसंधान पर ध्यान केंद्रित किया, क्योंकि LLM को प्रशिक्षित करना और जारी करना अन्यत्र अधिक सामान्य हो गया था।

जुलाई 2024 में, प्रूफ न्यूज़ और वायर्ड द्वारा एक जांच में पाया गया कि द पाइल डेटासेट में 48,000 से अधिक चैनलों के 170,000 से अधिक YouTube वीडियो के उपशीर्षक शामिल थे, जिससे आलोचना और चोरी के आरोप लगे। जवाब में, EleutherAI ने 2025 में "कॉमन पाइल" जारी किया, जो विवादास्पद कॉपीराइट सामग्री के बिना एक डेटासेट है, और इससे दो मॉडलों को प्रशिक्षित किया। यूके के AI सुरक्षा संस्थान के साथ सहयोग करते हुए, उन्होंने यह भी पाया कि प्रशिक्षण डेटा से मुख्य अवधारणाओं को हटाने के लिए फ़िल्टर करने से हानिकारक जानकारी को कम करते हुए प्रदर्शन बनाए रखा जा सकता है।

अनुसंधान और मॉडल

EleutherAI का अनुसंधान कई क्षेत्रों में फैला हुआ है, जिसमें सैकड़ों स्वयंसेवी योगदानकर्ता शामिल हैं। समूह ने कई उल्लेखनीय मॉडल और डेटासेट जारी किए हैं जो AI समुदाय में व्यापक रूप से उपयोग किए जाते हैं।

द पाइल

द पाइल एक 886 GB डेटासेट है जिसे बड़े भाषा मॉडल को प्रशिक्षित करने के लिए डिज़ाइन किया गया है। मूल रूप से GPT-Neo के लिए विकसित, इसका उपयोग माइक्रोसॉफ्ट के मेगाट्रॉन-ट्यूरिंग नेचुरल लैंग्वेज जनरेशन सहित अन्य मॉडलों को प्रशिक्षित करने के लिए किया गया है। इसकी विशिष्ट विशेषताएं शोधकर्ताओं द्वारा चुने गए डेटा का क्यूरेटेड चयन और इसका संपूर्ण दस्तावेज़ीकरण हैं। इसके प्रारंभिक संस्करण को कॉपीराइट सामग्री, जिसमें किताबें और विभिन्न मीडिया के उपशीर्षक शामिल हैं, शामिल करने के लिए आलोचना का सामना करना पड़ा।

कॉमन पाइल

कॉमन पाइल v0.1, जून 2025 में कई सहयोगियों के साथ साझेदारी में जारी किया गया, इसमें केवल ऐसे कार्य शामिल हैं जिनके लाइसेंस AI मॉडल को प्रशिक्षित करने के लिए उपयोग की अनुमति देते हैं। यह द पाइल के कॉपीराइट मुद्दों को संबोधित करता है।

GPT मॉडल

EleutherAI ने OpenAI के GPT-3 से प्रेरित ओपन-सोर्स बड़े भाषा मॉडल को प्रशिक्षित किया, जिसमें 125 मिलियन, 1.3 बिलियन, 2.7 बिलियन, 6 बिलियन और 20 बिलियन के पैरामीटर गिनती शामिल हैं। GPT-Neo (125M, 1.3B, 2.7B) मार्च 2021 में जारी किया गया था, इसके बाद जून 2021 में GPT-J (6B) आया, दोनों अपने रिलीज़ के समय सबसे बड़े ओपन-सोर्स GPT-3-शैली के मॉडल थे। GPT-NeoX-20B 10 फरवरी, 2022 को आया।

VQGAN-CLIP

जनवरी 2021 में OpenAI द्वारा DALL-E को सार्वजनिक पहुंच के बिना जारी करने के बाद, EleutherAI की कैथरीन क्रॉसन और डिजिटल कलाकार रयान मर्डॉक ने नियमित छवि निर्माण मॉडल को टेक्स्ट-टू-इमेज संश्लेषण में बदलने के लिए कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग (CLIP) का उपयोग करने की एक तकनीक विकसित की। Google के DeepDream से विचारों पर निर्माण करते हुए, उन्होंने VQGAN-CLIP बनाने के लिए CLIP को VQGAN के साथ जोड़ा। क्रॉसन ने तकनीक को नोटबुक के माध्यम से साझा किया जिसे लोग मुफ्त में चला सकते थे।

प्रभाव और नीति

EleutherAI के ओपन-सोर्स मॉडल और डेटासेट ने AI पारिस्थितिकी तंत्र को महत्वपूर्ण रूप से प्रभावित किया है, जिससे स्टार्टअप और शोधकर्ताओं को मालिकाना प्रतिबंधों के बिना बड़े भाषा मॉडल के साथ काम करने में सक्षम बनाया गया है। संगठन सार्वजनिक नीति चर्चाओं में भी भाग लेता है, खुले अनुसंधान की वकालत करता है और डेटा उपयोग और मॉडल सुरक्षा के आसपास नैतिक चिंताओं को संबोधित करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·open-source·non-profit·large-language-models
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास