Palmyra खुले-स्रोत बड़े भाषा मॉडल का एक परिवार है, जिसे Writer द्वारा विकसित किया गया है, जो उद्यम अनुप्रयोगों पर केंद्रित एक जनरेटिव AI कंपनी है। ये मॉडल पाठ निर्माण, सारांशीकरण और प्रश्न उत्तर सहित प्राकृतिक भाषा कार्यों की एक श्रृंखला को संभालने के लिए डिज़ाइन किए गए हैं, जिसमें तथ्यात्मक सटीकता और कम भ्रम (hallucination) पर जोर दिया गया है। Palmyra मॉडल खुले लाइसेंस के तहत उपलब्ध हैं, जिससे संगठन उन्हें कस्टम वातावरण में तैनात कर सकते हैं, और वे OpenAI और Anthropic जैसे विक्रेताओं के स्वामित्व वाले मॉडलों के विकल्प के रूप में स्थित हैं।
Palmyra परिवार में कई मॉडल आकार और विशेष संस्करण शामिल हैं, जिनमें से प्रत्येक विभिन्न उपयोग मामलों और कम्प्यूटेशनल बाधाओं के लिए अनुकूलित है। Writer ने बेस मॉडल, निर्देश-ट्यून किए गए मॉडल और वित्त और स्वास्थ्य सेवा जैसे विशिष्ट डोमेन के लिए फाइन-ट्यून किए गए मॉडल जारी किए हैं। वास्तुकला मानक Transformer डिज़ाइन का पालन करती है, जो आधुनिक बड़े भाषा मॉडल में सामान्य मल्टी-हेड अटेंशन और अन्य घटकों का लाभ उठाती है। प्रशिक्षण और मूल्यांकन विवरण मॉडल कार्ड और तकनीकी रिपोर्टों में प्रकाशित किए जाते हैं, जो जनरेटिव AI के क्षेत्र में पारदर्शिता में योगदान करते हैं।
इतिहास और विकास
Writer, जिसकी स्थापना 2020 में May Habib और Waseem Alshikh द्वारा की गई थी, शुरू में व्यवसायों के लिए AI-संचालित लेखन सहायता पर केंद्रित थी। कंपनी ने 2023 में पहले Palmyra मॉडल जारी करने के साथ बड़े भाषा मॉडल विकास में विस्तार किया। प्रारंभिक Palmyra बेस मॉडल को पाठ और कोड के विविध कोष पर प्रशिक्षित किया गया था, जिसमें आकार 128 मिलियन से 20 बिलियन पैरामीटर तक थे। बाद के रिलीज़ में Palmyra-X, एक 128 बिलियन पैरामीटर मॉडल, और Palmyra-Med, चिकित्सा अनुप्रयोगों के लिए एक विशेष मॉडल शामिल थे।
Palmyra मॉडल का विकास Writer की व्यापक रणनीति का हिस्सा है, जो उद्यम-ग्रेड AI समाधान प्रदान करता है जिन्हें ऑन-प्रिमाइसेस या निजी क्लाउड में तैनात किया जा सकता है, जो डेटा गोपनीयता और सुरक्षा संबंधी चिंताओं को संबोधित करता है। मॉडल को स्वामित्व डेटा पर फाइन-ट्यून करने के लिए डिज़ाइन किया गया है, जिससे संगठन कस्टम AI सहायक और स्वचालन उपकरण बना सकते हैं। Writer ने Palmyra Studio नामक एक प्लेटफ़ॉर्म भी विकसित किया है, जो फाइन-ट्यूनिंग, मूल्यांकन और तैनाती के लिए उपकरण प्रदान करता है।
वास्तुकला और प्रशिक्षण
Palmyra मॉडल Transformer वास्तुकला पर आधारित हैं, जिसे 2017 के पेपर "Attention Is All You Need" में Google और University of Toronto के शोधकर्ताओं द्वारा पेश किया गया था। वास्तुकला इनपुट अनुक्रमों को समानांतर में संसाधित करने के लिए मल्टी-हेड अटेंशन तंत्र का उपयोग करती है, जिससे मॉडल पाठ में दीर्घकालिक निर्भरता को पकड़ सकता है। प्रत्येक Palmyra मॉडल में स्व-अटेंशन और फीड-फॉरवर्ड तंत्रिका नेटवर्क की कई परतें होती हैं, जिसमें प्रशिक्षण को स्थिर करने के लिए लेयर नॉर्मलाइज़ेशन लागू किया जाता है।
Palmyra मॉडल के लिए प्रशिक्षण डेटा में इंटरनेट, पुस्तकों, शैक्षणिक पेपरों और कोड रिपॉजिटरी से सार्वजनिक रूप से उपलब्ध पाठ शामिल है। डेटा को डुप्लिकेट और निम्न-गुणवत्ता वाली सामग्री को हटाने के लिए पूर्व-संसाधित किया जाता है। प्रशिक्षण प्रक्रिया Adam को अनुकूलक के रूप में उपयोग करती है, जिसमें सीखने की दर अनुसूची शामिल है जिसमें वार्मअप और कोसाइन क्षय शामिल है। ग्रेडिएंट क्लिपिंग को विस्फोटक ग्रेडिएंट को रोकने के लिए लागू किया जाता है। मॉडल GPU क्लस्टर पर प्रशिक्षित होते हैं, जिसमें सबसे बड़े मॉडल को हजारों GPU-घंटे की आवश्यकता होती है।
तथ्यात्मक सटीकता में सुधार करने के लिए, Writer RLHF (मानव प्रतिक्रिया से सुदृढीकरण सीखना) और पाठ्यक्रम सीखना जैसी तकनीकों का उपयोग करता है। RLHF में मानव प्राथमिकताओं के आधार पर एक पुरस्कार मॉडल को प्रशिक्षित करना और फिर भाषा मॉडल को फाइन-ट्यून करने के लिए इसका उपयोग करना शामिल है। पाठ्यक्रम सीखना प्रशिक्षण उदाहरणों को एक संरचित क्रम में प्रस्तुत करता है, जो सरल कार्यों से शुरू होकर अधिक जटिल कार्यों की ओर बढ़ता है। ये विधियाँ भ्रम को कम करने और बेंचमार्क पर प्रदर्शन में सुधार करने में मदद करती हैं।
मॉडल संस्करण
Palmyra मॉडल कई आकारों में उपलब्ध हैं, जिनमें से प्रत्येक में अलग-अलग पैरामीटर गणना और प्रदर्शन विशेषताएँ हैं। सबसे छोटे मॉडल, जैसे Palmyra-128M और Palmyra-1B, एज डिवाइस और वास्तविक समय अनुप्रयोगों के लिए उपयुक्त हैं। मध्यम आकार के मॉडल, जिनमें Palmyra-3B और Palmyra-7B शामिल हैं, प्रदर्शन और कम्प्यूटेशनल लागत के बीच संतुलन प्रदान करते हैं। सबसे बड़े मॉडल, Palmyra-20B और Palmyra-X (128B), उच्च-प्रदर्शन सर्वर और क्लाउड तैनाती के लिए डिज़ाइन किए गए हैं।
बेस मॉडल के अलावा, Writer निर्देश-ट्यून किए गए संस्करण जारी करता है, जिन्हें प्रत्यय "-Instruct" के साथ दर्शाया जाता है। ये मॉडल निर्देशों और प्रतिक्रियाओं के डेटासेट पर फाइन-ट्यून किए जाते हैं, जिससे वे उपयोगकर्ता संकेतों का पालन करने में बेहतर होते हैं। डोमेन-विशिष्ट संस्करण भी हैं, जैसे वित्त के लिए Palmyra-Fin और स्वास्थ्य सेवा के लिए Palmyra-Med, जो विशेष कोष पर फाइन-ट्यून किए जाते हैं। प्रत्येक संस्करण के साथ एक मॉडल कार्ड होता है जो इसके प्रशिक्षण डेटा, मूल्यांकन परिणाम और इच्छित उपयोग मामलों का विवरण देता है।
प्रदर्शन और बेंचमार्क
Palmyra मॉडल का मूल्यांकन प्राकृतिक भाषा समझ और निर्माण के लिए विभिन्न मानक बेंचमार्क पर किया गया है। इनमें MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग), HellaSwag और TruthfulQA शामिल हैं। MMLU पर, Palmyra-X अपनी श्रेणी के अन्य बड़े मॉडलों के बराबर स्कोर प्राप्त करता है, जबकि छोटे संस्करण अपने आकार के सापेक्ष अच्छा प्रदर्शन करते हैं। मॉडलों का परीक्षण HumanEval जैसे बेंचमार्क का उपयोग करके कोड निर्माण कार्यों पर भी किया जाता है, जहाँ Palmyra मॉडल Python और अन्य प्रोग्रामिंग भाषाओं में दक्षता प्रदर्शित करते हैं।
Writer तकनीकी रिपोर्टों और Hugging Face मॉडल हब पर विस्तृत मूल्यांकन परिणाम प्रकाशित करता है। कंपनी तथ्यात्मक सटीकता पर जोर देती है और रिपोर्ट करती है कि Palmyra मॉडल कुछ प्रतिस्पर्धी मॉडलों की तुलना में कम भ्रम दर प्राप्त करते हैं। हालाँकि, स्वतंत्र मूल्यांकनों ने नोट किया है कि प्रदर्शन विशिष्ट कार्य और फाइन-ट्यूनिंग के आधार पर भिन्न हो सकता है। 2025 तक, Palmyra मॉडल को AI21 Labs और Inflection AI के मॉडलों के साथ, खुले-स्रोत LLM परिदृश्य में प्रतिस्पर्धी माना जाता है।
तैनाती और उपयोग मामले
Palmyra मॉडल को विभिन्न वातावरणों में तैनात किया जा सकता है, जिसमें ऑन-प्रिमाइसेस सर्वर, निजी क्लाउड और Amazon Web Services, Microsoft Azure और Google Cloud जैसे सार्वजनिक क्लाउड प्लेटफ़ॉर्म शामिल हैं। Writer मॉडल के कंटेनरीकृत संस्करण प्रदान करता है जिन्हें NVIDIA GPU या AMD एक्सेलेरेटर के साथ चलाया जा सकता है। मॉडल vLLM और TensorRT-LLM जैसे लोकप्रिय अनुमान फ्रेमवर्क के साथ संगत हैं, जो कम-विलंबता सेवा सक्षम करते हैं।
Palmyra मॉडल के सामान्य उपयोग मामलों में ग्राहक सहायता चैटबॉट, दस्तावेज़ सारांशीकरण, अनुबंध विश्लेषण और कोड निर्माण शामिल हैं। स्वास्थ्य सेवा क्षेत्र में, Palmyra-Med का उपयोग नैदानिक दस्तावेज़ीकरण और चिकित्सा साहित्य समीक्षा में सहायता के लिए किया गया है। वित्तीय संस्थान नियामक अनुपालन और जोखिम मूल्यांकन के लिए Palmyra-Fin का उपयोग करते हैं। मॉडलों की खुली-स्रोत प्रकृति संगठनों को संवेदनशील जानकारी को बाहरी API में भेजे बिना स्वामित्व डेटा पर फाइन-ट्यून करने की अनुमति देती है।
लाइसेंसिंग और समुदाय
Palmyra मॉडल खुले लाइसेंस के तहत जारी किए जाते हैं, जैसे छोटे मॉडलों के लिए Apache 2.0 लाइसेंस और बड़े मॉडलों के लिए एक कस्टम लाइसेंस। यह डेवलपर्स को न्यूनतम प्रतिबंधों के साथ मॉडल का उपयोग, संशोधन और वितरण करने की अनुमति देता है। मॉडल Hugging Face मॉडल हब पर उपलब्ध हैं, जहाँ उन्हें हजारों बार डाउनलोड किया गया है। Writer एक सामुदायिक फोरम और दस्तावेज़ीकरण साइट बनाए रखता है जहाँ उपयोगकर्ता फाइन-ट्यूनिंग रेसिपी और तैनाती सर्वोत्तम अभ्यास साझा कर सकते हैं।
Writer शैक्षणिक संस्थानों और अनुसंधान प्रयोगशालाओं के साथ भी सहयोग करता है ताकि कृत्रिम बुद्धिमत्ता के क्षेत्र को आगे बढ़ाया जा सके। कंपनी ने मॉडल व्याख्या और दक्षता पर शोध को प्रायोजित किया है। मॉडल वजन और प्रशिक्षण विवरण जारी करके, Writer खुले अनुसंधान पारिस्थितिकी तंत्र में योगदान देता है, जिससे अन्य डेवलपर्स अपने काम पर निर्माण कर सकते हैं।
अन्य मॉडलों के साथ तुलना
Palmyra मॉडल Meta से Llama, Mistral और Falcon जैसे अन्य खुले-स्रोत LLM के साथ प्रतिस्पर्धा करते हैं। Llama 2 की तुलना में, Palmyra मॉडल समान प्रदर्शन प्रदान करते हैं लेकिन विभिन्न लाइसेंसिंग शर्तों के साथ। Palmyra-X, 128 बिलियन पैरामीटर के साथ, सबसे बड़े खुले-स्रोत मॉडलों में से एक है, जो Llama 3 70B और Mixtral 8x7B के बराबर है। दक्षता के संदर्भ में, Palmyra मॉडल मेमोरी-कुशल होने के लिए डिज़ाइन किए गए हैं, जिसमें मॉडल प्रूनिंग जैसी क्वांटाइज़ेशन और प्रूनिंग तकनीकों के लिए समर्थन है।
Palmyra की एक विशिष्ट विशेषता डेटा गोपनीयता और अनुपालन जैसी उद्यम आवश्यकताओं पर इसका ध्यान केंद्रित है। जबकि GPT-4 जैसे मॉडल केवल API के माध्यम से उपलब्ध हैं, Palmyra को सेल्फ-होस्ट किया जा सकता है, जिससे संगठनों को अपने डेटा पर पूर्ण नियंत्रण मिलता है। इसने Palmyra को सख्त नियामक आवश्यकताओं वाले उद्योगों, जैसे बैंकिंग और स्वास्थ्य सेवा, के लिए एक लोकप्रिय विकल्प बना दिया है।
भविष्य की दिशाएँ
Writer Palmyra परिवार का विकास जारी रखता है, जिसमें बड़े मॉडल और बेहतर प्रशिक्षण तकनीकों की योजनाएँ हैं। कंपनी प्रशिक्षण और अनुमान की कम्प्यूटेशनल लागत को कम करने के तरीकों की खोज कर रही है, जिसमें AWS Trainium चिप्स और अन्य विशेष हार्डवेयर का उपयोग शामिल है। लंबे दस्तावेज़ों पर तर्क की आवश्यकता वाले कार्यों पर प्रदर्शन में सुधार करने के लिए क्रॉस-अटेंशन और एनकोडर-डिकोडर वास्तुकला जैसे क्षेत्रों में भी अनुसंधान चल रहा है।
2025 तक, Writer ने Palmyra के लिए एक विशिष्ट रोडमैप की घोषणा नहीं की है, लेकिन कंपनी ने खुले-स्रोत AI के प्रति अपनी प्रतिबद्धता बताई है। Palmyra की सफलता ने Writer को बड़े प्रतिस्पर्धियों के साथ, जनरेटिव AI बाजार में एक महत्वपूर्ण खिलाड़ी के रूप में स्थापित करने में मदद की है। मॉडलों से गहन शिक्षण और तंत्रिका नेटवर्क अनुसंधान में प्रगति के साथ विकसित होने की उम्मीद है, जिसमें डेटा संवर्धन और हानि फलन के लिए नई विधियाँ शामिल हैं।
निष्कर्ष
Palmyra खुले-स्रोत LLM पारिस्थितिकी तंत्र में एक उल्लेखनीय योगदान का प्रतिनिधित्व करता है, जो मॉडलों की एक श्रृंखला प्रदान करता है जो प्रदर्शन, दक्षता और पहुंच को संतुलित करते हैं। उद्यम अनुप्रयोगों और तथ्यात्मक सटीकता पर ध्यान केंद्रित करने के साथ, Palmyra स्वामित्व मॉडलों के लिए एक व्यवहार्य विकल्प प्रदान करता है। खुला लाइसेंसिंग और विस्तृत दस्तावेज़ीकरण इसे कस्टम AI समाधान बनाने के इच्छुक डेवलपर्स और शोधकर्ताओं के लिए एक आकर्षक विकल्प बनाता है। जैसे-जैसे बड़े भाषा मॉडल का क्षेत्र विकसित होता रहता है, Palmyra के प्रासंगिक और व्यापक रूप से उपयोग किए जाने वाले मॉडल परिवार बने रहने की संभावना है।
संदर्भ
Writer. (2024). Palmyra Model Cards. Hugging Face.
Writer. (2023). Introducing Palmyra: Open-Source LLMs for Enterprise. Writer Blog.
Vaswani, A., et al. (2017). Attention Is All You Need. NeurIPS.