WizardLM बड़े भाषा मॉडल का एक परिवार है, जिसे माइक्रोसॉफ्ट रिसर्च एशिया द्वारा विकसित किया गया है। इस परियोजना ने Evolve-Instruct विधि पेश की, जो मशीन लर्निंग फाइन-ट्यूनिंग में उपयोग के लिए जटिल निर्देश डेटा स्वचालित रूप से उत्पन्न करने की एक तकनीक है। पहला WizardLM मॉडल 2023 में जारी किया गया था और यह LLaMA आर्किटेक्चर पर आधारित था, जो एक Transformer (architecture) मॉडल है जो मल्टी-हेड अटेंशन और लेयर नॉर्मलाइज़ेशन पर निर्भर करता है।
"WizardLM" नाम जटिल उपयोगकर्ता निर्देशों को संभालने में सक्षम मॉडल बनाने के लक्ष्य को दर्शाता है, जो एक जादूगर की विशेषज्ञता के समान है। ये मॉडल जनरेटिव एआई के व्यापक क्षेत्र का हिस्सा हैं और कृत्रिम बुद्धिमत्ता अनुसंधान में प्रगति पर आधारित हैं। WizardLM को निर्देश-पालन की चुनौती को संबोधित करने के लिए डिज़ाइन किया गया था, जहाँ मॉडलों को उच्च सटीकता के साथ उपयोगकर्ता अनुरोधों की व्याख्या और निष्पादन करना होता है।
पृष्ठभूमि और प्रेरणा
निर्देश ट्यूनिंग तंत्रिका नेटवर्क को उपयोगकर्ता संकेतों का पालन करने के लिए अनुकूलित करने की एक मानक प्रथा है। इस प्रक्रिया में, एक आधार मॉडल को निर्देशों और वांछित प्रतिक्रियाओं के जोड़े पर फाइन-ट्यून किया जाता है। हालाँकि, विविध और जटिल निर्देशों को मैन्युअल रूप से तैयार करना श्रम-गहन है और अक्सर ऐसे डेटासेट उत्पन्न करता है जिनमें गहराई की कमी होती है। WizardLM इसे एक एआई सिस्टम का उपयोग करके सरल बीज निर्देशों को अधिक जटिल रूपों में विकसित करके संबोधित करता है। यह दृष्टिकोण पाठ्यक्रम सीखने से संबंधित है, जहाँ मॉडलों को धीरे-धीरे कठिन उदाहरणों पर प्रशिक्षित किया जाता है। लक्ष्य मॉडल को तर्क पैटर्न और बाधाओं की एक व्यापक श्रेणी से अवगत कराना है, जिससे वास्तविक दुनिया के उपयोगकर्ता अनुरोधों को संभालने की इसकी क्षमता में सुधार हो।
Evolve-Instruct विधि को "WizardLM: Empowering Large Language Models to Follow Complex Instructions" शीर्षक वाले एक पेपर में पेश किया गया था, जो अप्रैल 2023 में arXiv पर पोस्ट किया गया था। लेखक माइक्रोसॉफ्ट रिसर्च एशिया से संबद्ध थे। पेपर ने एक दो-चरणीय प्रक्रिया प्रस्तावित की: गहन विकास और गहराई से विकास। गहन विकास में, मॉडल बाधाओं को जोड़कर, तर्क को गहरा करके, या इनपुट को जटिल बनाकर नए निर्देश उत्पन्न करता है। गहराई से विकास में, मॉडल मौजूदा निर्देशों को फिर से लिखता है ताकि उनकी जटिलता बढ़ सके। परिणामी डेटासेट का उपयोग फिर एक आधार मॉडल को फाइन-ट्यून करने के लिए किया जाता है।
Evolve-Instruct विधि
Evolve-Instruct विधि एक शिक्षक मॉडल, जैसे ChatGPT, का उपयोग करती है ताकि बीज निर्देशों को बाधाओं को जोड़ने, तर्क को गहरा करने और इनपुट को जटिल बनाने जैसे संचालन के माध्यम से फिर से लिखा जा सके। विकसित निर्देश फाइन-ट्यूनिंग के लिए डेटा वृद्धि के एक रूप के रूप में कार्य करते हैं। विधि में कई विकास प्रकार शामिल हैं, जिनमें बाधाएँ जोड़ना, गहरा करना, ठोस बनाना और तर्क चरणों को बढ़ाना शामिल है। उदाहरण के लिए, "एक कविता लिखें" जैसे सरल निर्देश को "प्यार करना सीखने वाले रोबोट के बारे में शेक्सपियर की शैली में एक कविता लिखें" में विकसित किया जा सकता है। यह कार्य की जटिलता और विशिष्टता को बढ़ाता है।
प्रक्रिया पुनरावृत्त है, जिसमें मॉडल को बार-बार अधिक चुनौतीपूर्ण निर्देशों से अवगत कराया जाता है। लेखकों ने उन निर्देशों को फ़िल्टर करने के लिए एक गुणवत्ता नियंत्रण तंत्र भी पेश किया जो बहुत अस्पष्ट या उत्तर देने में असंभव हैं। यह सुनिश्चित करता है कि प्रशिक्षण डेटा उपयोगी बना रहे और मॉडल के प्रदर्शन को खराब न करे। विकसित निर्देशों को फिर मूल बीज निर्देशों के साथ जोड़कर एक अंतिम प्रशिक्षण सेट बनाया जाता है।
मॉडल संस्करण और बेंचमार्क
पहला WizardLM मॉडल, WizardLM-7B, LLaMA-7B से फाइन-ट्यून किया गया था। बाद के संस्करणों में WizardLM-13B और WizardLM-30B शामिल थे। मॉडलों का मूल्यांकन Evol-Instruct परीक्षण सेट और अन्य बेंचमार्क पर किया गया था। लेखकों ने बताया कि WizardLM-7B ने अपने मूल्यांकन में जटिल निर्देश-पालन पर ChatGPT से बेहतर प्रदर्शन किया। विशेष रूप से, उन्होंने प्रतिक्रियाओं की तुलना करने के लिए GPT-4 को न्यायाधीश के रूप में उपयोग किया और पाया कि WizardLM-7B ने Evol-Instruct परीक्षण सेट पर उच्च जीत दर हासिल की। बाद के संस्करण, जैसे WizardLM v1.1 और v1.2, में बड़े प्रशिक्षण डेटासेट और बेहतर विकास रणनीतियों सहित और शोधन शामिल किए गए।
मॉडल वेट सार्वजनिक रूप से जारी किए गए थे, जिससे शोधकर्ताओं और डेवलपर्स को उनका उपयोग और फाइन-ट्यून करने की अनुमति मिली। WizardLM मॉडल को विभिन्न ओपन-सोर्स परियोजनाओं में भी एकीकृत किया गया था और बाद के निर्देश-पालन मॉडल के लिए आधार रेखा के रूप में कार्य किया गया। 2024 तक, WizardLM परिवार में विभिन्न आकारों के मॉडल शामिल हैं, और Evolve-Instruct विधि को अन्य डोमेन पर लागू किया गया है।
प्रभाव और संबंधित कार्य
WizardLM की Evolve-Instruct विधि ने बाद के मॉडलों को प्रभावित किया, जिनमें कोड जनरेशन के लिए WizardCoder और गणितीय तर्क के लिए WizardMath शामिल हैं। इन मॉडलों ने विशेष डोमेन में समान विकास तकनीकों को लागू किया, जो दृष्टिकोण की बहुमुखी प्रतिभा को प्रदर्शित करता है। इस दृष्टिकोण को क्षेत्र के अन्य शोधकर्ताओं द्वारा अपनाया गया है, और पेपर को व्यापक रूप से उद्धृत किया गया है। WizardLM गहन शिक्षण में स्वचालित डेटा जनरेशन के माध्यम से निर्देश-पालन में सुधार करने की एक व्यापक प्रवृत्ति का हिस्सा है। विधि ने निर्देश-पालन मॉडल के लिए अधिक परिष्कृत मूल्यांकन बेंचमार्क के विकास में भी योगदान दिया।