अंग्रेज़ी से अनुवादित

RedPajama, Together AI द्वारा संचालित एक ओपन-सोर्स परियोजना है, जो बड़े भाषा मॉडलों के प्रशिक्षण के लिए पारदर्शी डेटासेट और मॉडल उपलब्ध कराती है। इसका लक्ष्य LLaMA प्रशिक्षण डेटा की नकल करना और उसमें सुधार करना है।

RedPajama एक ओपन-सोर्स पहल है जिसे Together AI द्वारा शुरू किया गया है, जो एक कंपनी है जो Generative AI बुनियादी ढांचे को आगे बढ़ाने पर केंद्रित है। परियोजना का प्राथमिक लक्ष्य Large language model के प्रशिक्षण के लिए पूरी तरह से पारदर्शी, पुनरुत्पादनीय डेटासेट और मॉडल चेकपॉइंट प्रदान करना है। इसे मालिकाना प्रशिक्षण डेटा के खुले विकल्पों की बढ़ती आवश्यकता के जवाब में बनाया गया था, जो अक्सर प्रमुख AI अनुसंधान संगठनों द्वारा अज्ञात रहता है। डेटा और मॉडल दोनों जारी करके, RedPajama शोधकर्ताओं और डेवलपर्स को बंद-स्रोत संसाधनों की बाधाओं के बिना अत्याधुनिक भाषा मॉडल प्रशिक्षण प्रक्रियाओं का अध्ययन, प्रतिकृति और निर्माण करने में सक्षम बनाता है।

यह परियोजना अप्रैल 2023 में RedPajama डेटासेट की रिलीज़ के साथ शुरू हुई, जो LLaMA मॉडल के लिए उपयोग किए गए प्रशिक्षण डेटा की संरचना को दर्शाने के लिए डिज़ाइन किया गया 1.2 ट्रिलियन टोकन संग्रह था। यह प्रारंभिक रिलीज़ Together AI और कई शैक्षणिक भागीदारों, जिनमें Stanford AI Lab और BAIR (Berkeley AI Research) समूह शामिल थे, के बीच एक सहयोगात्मक प्रयास था। डेटासेट को सार्वजनिक रूप से उपलब्ध स्रोतों, जैसे Common Crawl, Wikipedia, GitHub, और पुस्तकों से इकट्ठा किया गया था, और अनुमेय लाइसेंस के तहत उपलब्ध कराया गया था। डेटासेट के बाद, Together AI ने RedPajama-INCITE मॉडल परिवार जारी किया, जो इस डेटा पर प्रशिक्षित Neural network हैं, और समान आकार के अन्य खुले मॉडलों के खिलाफ प्रतिस्पर्धात्मक प्रदर्शन दिखाते हैं।

डेटासेट संरचना और निर्माण

RedPajama डेटासेट का निर्माण मूल LLaMA मॉडल के लिए उपयोग किए गए डेटा मिश्रण को दोहराने के लिए किया गया था, जिसे एक शोध पत्र में विस्तृत किया गया था लेकिन सार्वजनिक रूप से जारी नहीं किया गया था। डेटासेट में सात अलग-अलग घटक शामिल हैं: Common Crawl (एक विशाल वेब स्क्रैप), C4 (एक और वेब कॉर्पस), Wikipedia, GitHub कोड, ArXiv पेपर, StackExchange, और पुस्तकें। प्रत्येक घटक को गुणवत्ता और स्थिरता सुनिश्चित करने के लिए संसाधित किया गया था, जिसमें निम्न-गुणवत्ता या दोहराव वाली सामग्री को हटाने के लिए डीडुप्लिकेशन और फ़िल्टरिंग लागू की गई थी। अंतिम डेटासेट कुल 1.2 ट्रिलियन टोकन था, जो इसे रिलीज़ के समय भाषा मॉडल प्रशिक्षण के लिए सबसे बड़े खुले तौर पर उपलब्ध कॉर्पस में से एक बनाता है।

डेटासेट की एक प्रमुख विशेषता पारदर्शिता पर इसका ध्यान केंद्रित है। कई मालिकाना डेटासेट के विपरीत, RedPajama स्रोतों और प्रीप्रोसेसिंग चरणों के बारे में विस्तृत मेटाडेटा प्रदान करता है, जिससे शोधकर्ताओं को यह समझने में मदद मिलती है कि मॉडल वास्तव में किस पर प्रशिक्षित थे। यह पारदर्शिता पूर्वाग्रहों का ऑडिट करने, डेटा गुणवत्ता सत्यापित करने और पुनरुत्पादनीय अनुसंधान को सक्षम करने के लिए महत्वपूर्ण है। डेटासेट को सामान्य Machine learning फ्रेमवर्क के साथ संगत प्रारूप में वितरित किया जाता है, जिससे मौजूदा प्रशिक्षण पाइपलाइनों में आसान एकीकरण की सुविधा मिलती है।

RedPajama-INCITE मॉडल

मई 2023 में, Together AI ने RedPajama-INCITE मॉडल परिवार जारी किया, जो RedPajama डेटासेट पर प्रशिक्षित थे। ये मॉडल कई आकारों में उपलब्ध थे, जिनमें 3B और 7B पैरामीटर शामिल थे, और बेस, इंस्ट्रक्शन-ट्यून्ड, और चैट-ट्यून्ड वेरिएंट में आए। इंस्ट्रक्शन-ट्यून्ड मॉडल को Reinforcement Learning from AI Feedback (RLAIF) (रिनफोर्समेंट लर्निंग फ्रॉम AI फीडबैक) और मानव फीडबैक जैसी तकनीकों का उपयोग करके फाइन-ट्यून किया गया था, जिससे वे संवादात्मक और कार्य-उन्मुख अनुप्रयोगों के लिए उपयुक्त बन गए। मॉडलों को कुशल और सुलभ बनाने के लिए डिज़ाइन किया गया था, जो उपभोक्ता-ग्रेड हार्डवेयर पर चलते थे और एज डिवाइसों पर तैनाती के लिए क्वांटाइजेशन का समर्थन करते थे।

INCITE मॉडलों को AI21 Labs और Anthropic जैसे अन्य खुले मॉडलों के खिलाफ बेंचमार्क किया गया था, और प्रश्न उत्तर और तर्क जैसे मानक NLP कार्यों पर प्रतिस्पर्धात्मक प्रदर्शन दिखाया। हालांकि, वे OpenAI या Google DeepMind जैसे सबसे बड़े मालिकाना मॉडलों को पार करने के लिए डिज़ाइन नहीं किए गए थे, बल्कि ओपन-सोर्स समुदाय के लिए एक ठोस, पुनरुत्पादनीय आधार रेखा प्रदान करने के लिए थे। रिलीज़ में हाइपरपैरामीटर और कंप्यूट आवश्यकताओं सहित पूर्ण प्रशिक्षण विवरण शामिल थे, जिससे दूसरों को प्रशिक्षण प्रक्रिया को दोहराने में सक्षम बनाया गया।

विस्तार और वेरिएंट

प्रारंभिक रिलीज़ के बाद, RedPajama परियोजना अतिरिक्त डेटासेट और मॉडल वेरिएंट शामिल करने के लिए विस्तारित हुई। जुलाई 2023 में, Together AI ने RedPajama-V2 जारी किया, एक अद्यतन डेटासेट जिसमें बेहतर फ़िल्टरिंग और एक बड़ा कॉर्पस था, जो अकेले Common Crawl से कुल 30 ट्रिलियन से अधिक टोकन था। इस संस्करण ने डेटा सफाई के लिए एक अधिक परिष्कृत पाइपलाइन पेश की, जिसमें निम्न-गुणवत्ता या दोहराव वाली सामग्री की पहचान करने और हटाने के लिए क्लासिफायर का उपयोग किया गया। V2 डेटासेट को और बड़े मॉडलों के प्रशिक्षण का समर्थन करने और अनुसंधान समुदाय के लिए एक अधिक व्यापक संसाधन प्रदान करने के लिए डिज़ाइन किया गया था।

इसके अतिरिक्त, परियोजना ने विशेष मॉडल पेश किए, जैसे RedPajama-INCITE-Base और RedPajama-INCITE-Chat, जो विशिष्ट उपयोग मामलों के लिए अनुकूलित थे। चैट वेरिएंट को संवादात्मक डेटा पर फाइन-ट्यून किया गया था और मल्टी-टर्न संवाद कार्यों में बेहतर प्रदर्शन दिखाया। Together AI ने डेटा प्रोसेसिंग के लिए उपकरण और स्क्रिप्ट भी जारी किए, जिससे उपयोगकर्ता अपनी आवश्यकताओं के अनुसार डेटासेट को अनुकूलित कर सकते हैं, जैसे भाषा या डोमेन द्वारा फ़िल्टर करना।

तकनीकी नवाचार और योगदान

RedPajama परियोजना ने ओपन-सोर्स AI के क्षेत्र में कई तकनीकी नवाचारों में योगदान दिया। एक उल्लेखनीय योगदान कुशल डेटा प्रोसेसिंग पाइपलाइनों का विकास था जो डेटासेट के विशाल पैमाने को संभाल सकती थीं। टीम ने समय पर डेटा संसाधित करने के लिए वितरित कंप्यूटिंग और अनुकूलित Data Augmentation तकनीकों का उपयोग किया। उन्होंने टोकनाइजेशन और डीडुप्लिकेशन सहित प्रीप्रोसेसिंग चरणों पर विस्तृत दस्तावेज़ीकरण भी प्रकाशित किया, जो समान डेटासेट बनाने वाले अन्य शोधकर्ताओं के लिए मूल्यवान रहा है।

एक और योगदान खुले डेटासेट पर मॉडल प्रशिक्षण तकनीकों की खोज थी। INCITE मॉडल ने Transformer (architecture) आर्किटेक्चर का उपयोग Multi-Head Attention और Positional Encoding के साथ किया, लेकिन प्रशिक्षण प्रक्रिया में Gradient Clipping और Learning Rate Scheduling अनुकूलन जैसी आधुनिक प्रथाओं को शामिल किया गया। परियोजना ने फाइन-ट्यूनिंग और अनुमान के लिए कोड भी जारी किया, जिससे डेवलपर्स के लिए मॉडलों को अपने विशिष्ट अनुप्रयोगों के अनुकूल बनाना आसान हो गया।

समुदाय और पारिस्थितिकी तंत्र प्रभाव

RedPajama का ओपन-सोर्स AI पारिस्थितिकी तंत्र पर महत्वपूर्ण प्रभाव पड़ा है। मालिकाना डेटासेट के लिए एक पारदर्शी और पुनरुत्पादनीय विकल्प प्रदान करके, इसने शोधकर्ताओं और छोटे संगठनों के लिए प्रवेश की बाधा को कम किया है। MIT CSAIL और Carnegie Mellon University सहित कई शैक्षणिक संस्थानों ने अपने शोध परियोजनाओं में RedPajama डेटा का उपयोग किया है। परियोजना ने योगदानकर्ताओं के एक समुदाय को भी बढ़ावा दिया है जिन्होंने फीडबैक और कोड योगदान के माध्यम से डेटासेट और मॉडलों को बेहतर बनाने में मदद की है।

RedPajama की रिलीज़ ने अन्य ओपन-सोर्स पहलों को भी प्रभावित किया है। उदाहरण के लिए, इसका उपयोग डेटा गुणवत्ता और प्रोसेसिंग तकनीकों के लिए एक बेंचमार्क के रूप में किया गया है, और इसका दृष्टिकोण पारदर्शी प्रशिक्षण संसाधन बनाने की कोशिश कर रहे अन्य परियोजनाओं द्वारा अपनाया गया है। परियोजना का पारदर्शिता पर जोर Artificial intelligence प्रणालियों में जवाबदेही और निष्पक्षता सुनिश्चित करने के लिए खुले डेटा के महत्व के बारे में AI समुदाय में व्यापक चर्चाओं को जन्म दिया है।

चुनौतियाँ और सीमाएँ

अपनी सफलताओं के बावजूद, RedPajama परियोजना को कई चुनौतियों का सामना करना पड़ा है। एक प्रमुख सीमा स्रोत डेटा में निहित पूर्वाग्रह है, जो इंटरनेट से स्क्रैप किया गया है और इसमें हानिकारक या पक्षपाती सामग्री हो सकती है। जबकि फ़िल्टरिंग और डीडुप्लिकेशन कुछ मुद्दों को कम करने में मदद करते हैं, वे उन्हें पूरी तरह से समाप्त नहीं कर सकते। परियोजना ने इन सीमाओं को स्वीकार किया है और मॉडलों को तैनात करते समय उपयोगकर्ताओं को अतिरिक्त सुरक्षा उपाय लागू करने के लिए प्रोत्साहित करती है।

एक और चुनौती इतने विशाल डेटासेट पर बड़े मॉडलों के प्रशिक्षण से जुड़ी कम्प्यूटेशनल लागत है। जबकि INCITE मॉडल अपेक्षाकृत छोटे हैं, बड़े मॉडलों तक स्केलिंग के लिए महत्वपूर्ण कंप्यूट संसाधनों की आवश्यकता होती है, जो सभी शोधकर्ताओं के लिए सुलभ नहीं हो सकते। परियोजना ने पूर्व-प्रशिक्षित चेकपॉइंट और कुशल फाइन-ट्यूनिंग के लिए उपकरण प्रदान करके इसे संबोधित किया है, लेकिन शुरू से प्रशिक्षण चाहने वालों के लिए बाधा बनी हुई है।

भविष्य की दिशाएँ

2024 तक, RedPajama परियोजना विकसित हो रही है। Together AI ने समुदाय से फीडबैक और Machine learning अनुसंधान में प्रगति को शामिल करते हुए अद्यतन डेटासेट और मॉडल जारी करने की योजना का संकेत दिया है। भविष्य के पुनरावृत्तियों में अधिक विविध डेटा स्रोत, बेहतर फ़िल्टरिंग तकनीक, और मल्टीमॉडल डेटा के लिए समर्थन शामिल हो सकते हैं। परियोजना का उद्देश्य पारदर्शिता के प्रति अपनी प्रतिबद्धता बनाए रखना है, यह सुनिश्चित करना कि सभी संसाधन खुले और सुलभ रहें।

RedPajama का व्यापक लक्ष्य उच्च-गुणवत्ता वाले प्रशिक्षण डेटा और मॉडलों तक पहुंच को लोकतांत्रिक बनाना है, जिससे प्रतिभागियों की एक व्यापक श्रेणी Large language model के विकास में योगदान कर सके। ऐसा करके, यह नवाचार को बढ़ावा देने और यह सुनिश्चित करने की उम्मीद करता है कि AI के लाभ समाज में अधिक समान रूप से साझा किए जाएं। परियोजना की निरंतर सफलता निरंतर समुदाय जुड़ाव और स्थायी वित्त पोषण और शासन मॉडल के विकास पर निर्भर करेगी।

निष्कर्ष

RedPajama ओपन-सोर्स AI आंदोलन में एक ऐतिहासिक प्रयास का प्रतिनिधित्व करता है, जो भाषा मॉडलों के प्रशिक्षण के लिए एक व्यापक और पारदर्शी संसाधन प्रदान करता है। इसके डेटासेट और मॉडल व्यापक रूप से अपनाए गए हैं और खुले AI अनुसंधान की दिशा को प्रभावित किया है। जबकि चुनौतियाँ बनी हुई हैं, परियोजना की खुलेपन और पुनरुत्पादनीयता के प्रति प्रतिबद्धता ने क्षेत्र के लिए एक नया मानक स्थापित किया है, और इसका प्रभाव आने वाले वर्षों में महसूस किए जाने की संभावना है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:open-source-ai·large-language-models·datasets·together-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास