InstructGPT-175B एक बड़ा भाषा मॉडल है जिसे OpenAI द्वारा विकसित किया गया है, जो InstructGPT परिवार में सबसे बड़ा कॉन्फ़िगरेशन प्रस्तुत करता है। यह GPT-3 आर्किटेक्चर का एक प्रकार है, विशेष रूप से 175B पैरामीटर संस्करण, जिसे मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) नामक तकनीक का उपयोग करके फाइन-ट्यून किया गया था। मॉडल को पहले के GPT-3 मॉडल की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था, जो अक्सर ऐसे आउटपुट उत्पन्न करते थे जो असत्य, विषाक्त या उपयोगकर्ता के इरादे से खराब संरेखित होते थे। InstructGPT-175B को 2022 की शुरुआत में प्रकाशित एक शोध पत्र में पेश किया गया था, जो अपने पूर्ववर्ती, समान आकार के आधार GPT-3 मॉडल की तुलना में निर्देश पालन और सहायकता में महत्वपूर्ण सुधार प्रदर्शित करता है।
InstructGPT-175B का विकास जनरेटिव आर्टिफिशियल इंटेलिजेंस के क्षेत्र में एक महत्वपूर्ण बदलाव का प्रतीक था, क्योंकि इसने बड़े भाषा मॉडल को मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए RLHF को एक मुख्य प्रशिक्षण प्रतिमान के रूप में स्थापित किया। मॉडल की प्रशिक्षण प्रक्रिया में तीन चरण शामिल थे: मानव-लिखित प्रदर्शनों पर पर्यवेक्षित फाइन-ट्यूनिंग, मानवीय तुलनाओं पर पुरस्कार मॉडल प्रशिक्षण, और प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) का उपयोग करके सुदृढीकरण सीखने का अनुकूलन। इस दृष्टिकोण ने मॉडल को ऐसी प्रतिक्रियाएँ उत्पन्न करने में सक्षम बनाया जो मूल GPT-3 से प्राप्त प्रतिक्रियाओं की तुलना में मानव मूल्यांकनकर्ताओं द्वारा अधिक पसंद की जाती थीं, समान आर्किटेक्चर और पैरामीटर संख्या होने के बावजूद।
प्रशिक्षण पद्धति
InstructGPT-175B को मानव लेबलरों से एकत्रित प्रॉम्प्ट और वांछित आउटपुट के डेटासेट का उपयोग करके प्रशिक्षित किया गया था। प्रारंभिक पर्यवेक्षित फाइन-ट्यूनिंग चरण में लगभग 13,000 प्रशिक्षण प्रॉम्प्ट का उपयोग किया गया, जहाँ लेबलरों ने प्रदर्शन प्रतिक्रियाएँ लिखीं। इसके बाद, लगभग 33,000 तुलनाओं के डेटासेट पर एक पुरस्कार मॉडल प्रशिक्षित किया गया, जहाँ लेबलरों ने समान प्रॉम्प्ट के लिए विभिन्न मॉडल आउटपुट को रैंक किया। अंतिम सुदृढीकरण सीखने के चरण ने पॉलिसी को अनुकूलित करने के लिए पुरस्कार मॉडल का उपयोग किया, जिसमें 175B मॉडल कई प्रशिक्षित आकारों में सबसे बड़ा था (1.3B, 6.7B और 13B वेरिएंट सहित)। प्रशिक्षण में स्थिरता सुनिश्चित करने के लिए Adam ऑप्टिमाइज़र का उपयोग सीखने की दर अनुसूची और ग्रेडिएंट क्लिपिंग के साथ किया गया।
मूल्यांकन और परिणाम
मानव मूल्यांकनकर्ताओं ने अधिकांश प्रॉम्प्ट श्रेणियों के लिए GPT-3 175B के आउटपुट की तुलना में InstructGPT-175B के आउटपुट को लगातार प्राथमिकता दी, जिसमें 70% से अधिक प्राथमिकता दर शामिल है। मॉडल ने विशेष रूप से भ्रम को कम करने, स्पष्ट निर्देशों का पालन करने और विषाक्त या पक्षपाती भाषा से बचने में सुधार दिखाया। हालाँकि, मूल्यांकन से यह भी पता चला कि InstructGPT-175B कुछ प्रतिकूल प्रॉम्प्ट के प्रति संवेदनशील बना रहा और अस्पष्ट विषयों के बारे में पूछे जाने पर गलत जानकारी उत्पन्न कर सकता था। मानक NLP बेंचमार्क पर मॉडल का प्रदर्शन आम तौर पर GPT-3 के समान था, लेकिन उपयोगकर्ता की आवश्यकताओं के साथ बेहतर संरेखण के कारण इसकी वास्तविक दुनिया की उपयोगिता काफी अधिक थी।
प्रभाव और विरासत
InstructGPT-175B की सफलता ने OpenAI में बाद के मॉडल विकास को प्रभावित किया, जिसमें ChatGPT श्रृंखला भी शामिल है, जिसने समान RLHF तकनीकों को अपनाया। इसने Anthropic और Google DeepMind जैसे अन्य संगठनों को भी अपने स्वयं के प्रशिक्षण पाइपलाइनों में मानवीय प्रतिक्रिया को शामिल करने के लिए प्रेरित किया। मॉडल ने प्रदर्शित किया कि उपयोगी AI सिस्टम बनाने के लिए अकेले स्केलिंग पर्याप्त नहीं थी, और व्यावहारिक तैनाती के लिए संरेखण तकनीकें आवश्यक थीं। InstructGPT-175B को अक्सर AI संरेखण के क्षेत्र में एक मूलभूत कार्य के रूप में उद्धृत किया जाता है, और इसकी पद्धति बाद के मॉडल जैसे LLaMA और Claude के लिए एक मानक संदर्भ बन गई।
सीमाएँ और नैतिक विचार
अपने सुधारों के बावजूद, InstructGPT-175B की उल्लेखनीय सीमाएँ थीं। यह अत्यधिक विस्तृत हो सकता था, कभी-कभी जानकारी दोहराता था, और अस्पष्ट प्रॉम्प्ट के लिए स्पष्ट प्रश्न पूछने में विफल हो सकता था। मॉडल ने अपने प्रशिक्षण डेटा में मौजूद पूर्वाग्रह भी प्रदर्शित किए, और RLHF ने हानिकारक आउटपुट को पूरी तरह से समाप्त नहीं किया। OpenAI ने मॉडल को अपने API के माध्यम से जारी किया, लेकिन दुरुपयोग को कम करने के लिए पहुंच प्रतिबंधित की। मॉडल के साथ आने वाले शोध पत्र में इन सीमाओं पर खुलकर चर्चा की गई, जिसमें मजबूती, व्याख्यात्मकता और सुरक्षा में चल रहे काम की आवश्यकता पर जोर दिया गया। इन चर्चाओं ने जिम्मेदार AI विकास और बड़े पैमाने पर बड़े भाषा मॉडल की तैनाती के नैतिक निहितार्थों के बारे में व्यापक बातचीत में योगदान दिया।
तकनीकी विशिष्टताएँ
InstructGPT-175B GPT-3 के समान ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है, जिसमें 96 परतें, 96 ध्यान शीर्ष और 12,288 की छिपी हुई आकार शामिल है। यह मल्टी-हेड अटेंशन और लेयर नॉर्मलाइज़ेशन का उपयोग करता है, जिसमें 2048 टोकन की संदर्भ विंडो होती है। मॉडल को वेब टेक्स्ट, पुस्तकों और अन्य स्रोतों के मिश्रण पर प्रशिक्षित किया गया था, और इसकी फाइन-ट्यूनिंग प्रक्रिया ने आधार आर्किटेक्चर को नहीं बदला। 175B पैरामीटर संख्या ने इसे अपने समय के सबसे बड़े मॉडलों में से एक बना दिया, जिसके लिए प्रशिक्षण और अनुमान दोनों के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की आवश्यकता थी। OpenAI ने सटीक प्रशिक्षण कंप्यूट को सार्वजनिक रूप से खुलासा नहीं किया है, लेकिन अनुमान बताते हैं कि इसमें NVIDIA हार्डवेयर पर हजारों GPU-दिन शामिल थे।
निष्कर्ष
InstructGPT-175B मानवीय इरादे के साथ बड़े भाषा मॉडल को संरेखित करने में एक ऐतिहासिक उपलब्धि का प्रतिनिधित्व करता है। इसके विकास ने RLHF की प्रभावशीलता को प्रदर्शित किया और AI सिस्टम में सहायकता और सुरक्षा के लिए एक नया मानक स्थापित किया। हालाँकि नए मॉडल क्षमता में इसे पार कर चुके हैं, इसका प्रभाव आधुनिक निर्देश-ट्यून किए गए मॉडलों के डिज़ाइन में बना हुआ है। मॉडल की विरासत AI उद्योग में मानवीय प्रतिक्रिया तकनीकों के व्यापक रूप से अपनाने में स्पष्ट है, जो इसे समकालीन मशीन लर्निंग अनुसंधान और अनुप्रयोग का एक आधारशिला बनाती है।
संदर्भ
इस लेख का प्राथमिक स्रोत OpenAI शोध पत्र "Training language models to follow instructions with human feedback" (2022) है, जिसे Long Ouyang, Jeff Wu, Xu Jiang और सहयोगियों द्वारा लिखा गया है। अतिरिक्त जानकारी AI समुदाय में बाद के विश्लेषणों और समीक्षाओं से ली गई है।
यह भी देखें
श्रेणियाँ
- large-language-models
- OpenAI
- Reinforcement learning
- AI Alignment