InstructGPT बड़े भाषा मॉडलों का एक परिवार है जिसे OpenAI द्वारा विकसित किया गया था, और पहली बार जनवरी 2022 में पेश किया गया था। ये मॉडल पहले के GPT-3 मॉडलों की तुलना में उपयोगकर्ता निर्देशों का बेहतर पालन करने और मानवीय इरादों के साथ संरेखित करने के लिए डिज़ाइन किए गए हैं। वे एक प्रशिक्षण तकनीक का उपयोग करते हैं जिसे मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) कहा जाता है, जहाँ मानव मूल्यांकनकर्ता मॉडल आउटपुट को रैंक करते हैं, और मॉडल को अधिक सहायक, सत्य और कम हानिकारक प्रतिक्रियाएँ उत्पन्न करने के लिए निर्देशित किया जाता है।
InstructGPT जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) आर्किटेक्चर की नींव पर आधारित है, जो एक प्रकार का Transformer (architecture) मॉडल है जो 2017 में ट्रांसफॉर्मर आर्किटेक्चर की शुरुआत से उत्पन्न हुआ था। मूल GPT-3, जिसे OpenAI द्वारा 2020 में जारी किया गया था, 175 बिलियन पैरामीटर वाला एक डिकोडर-ओनली ट्रांसफॉर्मर था, लेकिन यह कभी-कभी ऐसे आउटपुट उत्पन्न कर सकता था जो कार्य से भटके हुए या उपयोगकर्ता के इरादे से असंगत होते थे। InstructGPT का उद्देश्य मॉडल को मानव प्रतिक्रिया के साथ परिष्कृत करके इन मुद्दों को ठीक करना था।
प्रशिक्षण और कार्यप्रणाली
InstructGPT मॉडल GPT-3 को पर्यवेक्षित सीखने के साथ फाइन-ट्यून करके और फिर मानव प्रतिक्रिया से सुदृढीकरण सीखने को लागू करके बनाए गए थे। मानव मूल्यांकनकर्ताओं को विभिन्न मॉडलों द्वारा उत्पन्न प्रतिक्रियाओं की तुलना करने के लिए कहा गया था, और उनकी प्राथमिकताओं का उपयोग एक पुरस्कार मॉडल को प्रशिक्षित करने के लिए किया गया था। नीति (यानी, मॉडल) को फिर इस पुरस्कार को अधिकतम करने के लिए अद्यतन किया गया था, साथ ही मूल GPT-3 वितरण से विचलन के लिए दंड को शामिल करते हुए, अत्यधिक बहाव से बचने के लिए।
OpenAI ने बताया कि InstructGPT मॉडल निर्देशों का पालन करने, कम निर्मित तथ्यों (एक घटना जिसे मतिभ्रम के रूप में जाना जाता है) उत्पन्न करने, और कुछ हद तक कम विषाक्त सामग्री उत्पन्न करने में GPT-3 की तुलना में काफी बेहतर थे, साथ ही सारांशीकरण और प्रश्नोत्तर जैसे कुछ कार्यों पर बेहतर प्रदर्शन भी दिखाया।
क्षमताएँ और सीमाएँ
InstructGPT ने GPT-3 की मुख्य क्षमताओं को विरासत में प्राप्त किया, जिसमें सुसंगत पाठ उत्पन्न करने, प्रश्नों के उत्तर देने, भाषाओं का अनुवाद करने और कोड लिखने की क्षमता शामिल है। यह फ्यू-शॉट और जीरो-शॉट प्रॉम्प्ट भी संभाल सकता है। हालाँकि, अपने पूर्ववर्तियों की तरह, यह विषाक्त इनपुट के साथ प्रेरित होने पर हानिकारक या पक्षपाती सामग्री उत्पन्न कर सकता है। OpenAI ने API का उपयोग करने वाले डेवलपर्स के लिए सामग्री मॉडरेशन उपकरण लागू किए, और जनवरी 2022 तक, InstructGPT OpenAI API ग्राहकों के लिए डिफ़ॉल्ट मॉडल बन गया।
पूर्ववर्तियों के साथ तुलना
मूल GPT-3 मॉडलों की तुलना में, InstructGPT ने उपयोगकर्ता-इरादे संरेखण में उल्लेखनीय सुधार प्रदर्शित किए, जैसा कि मानव मूल्यांकनों से प्रमाणित है। उदाहरण के लिए, मशीन-लर्निंग अध्ययनों में, मूल्यांकनकर्ताओं ने विभिन्न प्रॉम्प्टों पर InstructGPT आउटपुट को GPT-3 की तुलना में अधिक अनुकूल माना, जिसमें अनपेक्षित ऑफ-टॉपिक प्रतिक्रियाओं को कम करना शामिल है। इसके बावजूद, InstructGPT ने बड़े भाषा मॉडलों में आम सीमाओं को बरकरार रखा, जैसे वाक्यांशीकरण के प्रति संवेदनशीलता और सामयिक तथ्यात्मक त्रुटियाँ।
InstructGPT का विकास जनरेटिव आर्टिफिशियल इंटेलिजेंस में व्यापक रुझानों को दर्शाता है, जहाँ मॉडल मानव नैतिकता और सुरक्षा मानकों के साथ अधिक संरेखित होने के लिए प्रशिक्षित किए जाते हैं। यह दृष्टिकोण बाद के मॉडलों जैसे ChatGPT को प्रभावित करता है, जो समान संरेखण पद्धति का उपयोग करते हैं।
स्वागत और प्रभाव
InstructGPT ने सहायक और सुरक्षित AI पर केंद्रित AI मॉडलों के बढ़ते पारिस्थितिकी तंत्र में योगदान दिया। अन्य संगठनों के शोधकर्ताओं, जैसे Anthropic और Google DeepMind, ने भी समान संरेखण तकनीकों की खोज की। यह मॉडल अधिक व्यावहारिक AI सहायकों की दिशा में एक कदम था, लेकिन इसने AI-जनित गलत सूचना के जोखिमों और AI प्रणालियों में पारदर्शिता के महत्व के बारे में चर्चाएँ भी उठाईं। 2025 तक, OpenAI ने संरेखण तकनीकों पर पुनरावृत्ति जारी रखी, जो InstructGPT द्वारा स्थापित नींव पर निर्माण कर रहा है।
यह भी देखें
संबंधित विषयों जैसे Machine learning, Transformer (architecture), OpenAI, और Generative AI से मनमाने लिंक बनाए जा सकते हैं।