OPT-175B एक बड़ा भाषा मॉडल है जिसे मेटा एआई द्वारा विकसित किया गया था और मई 2022 में जारी किया गया था। 175 बिलियन पैरामीटर के साथ, इसे ओपनएआई के GPT-3 के पैमाने से मेल खाने के लिए डिज़ाइन किया गया था, जबकि यह शोधकर्ताओं के लिए खुले तौर पर उपलब्ध था। मॉडल के रिलीज़ में इसके वेट, कोड और प्रशिक्षण लॉग शामिल थे, जो कई समकालीन एआई प्रयोगशालाओं की बंद प्रथाओं से एक विचलन था। इस पारदर्शिता का उद्देश्य पुनरुत्पादनीय अनुसंधान और बड़े पैमाने के तंत्रिका नेटवर्क की गहरी समझ को बढ़ावा देना था।
OPT-175B ट्रांसफॉर्मर आर्किटेक्चर पर बनाया गया है, विशेष रूप से एक ऑटोरेग्रेसिव डिकोडर-ओनली डिज़ाइन। यह GPT-3 के समान संरचना का उपयोग करता है, जिसमें 96 परतें, 96 अटेंशन हेड और 12,288 का हिडन डाइमेंशन है। मॉडल को सार्वजनिक रूप से उपलब्ध पाठ के विविध कॉर्पस पर प्रशिक्षित किया गया था, जिसमें कुल लगभग 180 बिलियन टोकन शामिल थे। इस डेटासेट में किताबें, वेब टेक्स्ट और अन्य स्रोत शामिल थे, जिन्हें निम्न-गुणवत्ता या डुप्लिकेट सामग्री को हटाने के लिए फ़िल्टर किया गया था। प्रशिक्षण में 992 80GB A100 GPU का उपयोग किया गया, जिसमें लगभग 2.5 मिलियन GPU-घंटे की खपत हुई, जो कुशल समानांतरीकरण तकनीकों के कारण पहले के मॉडलों की तुलना में महत्वपूर्ण लेकिन कम लागत थी।
प्रशिक्षण और अनुकूलन
OPT-175B की प्रशिक्षण प्रक्रिया में इसके पैमाने को प्रबंधित करने के लिए कई उन्नत तकनीकों का उपयोग किया गया। मेटा ने GPU क्लस्टर में डेटा, मॉडल और पाइपलाइन समानांतरीकरण का संयोजन उपयोग किया। उन्होंने प्रशिक्षण को स्थिर करने के लिए ग्रेडिएंट-क्लिपिंग भी लागू किया और लर्निंग-रेट-शेड्यूल का उपयोग किया, जिसमें वार्मअप चरण के बाद कोसाइन डेके शामिल था। मॉडल को Adam ऑप्टिमाइज़र के साथ प्रशिक्षित किया गया, जिसमें 4 मिलियन टोकन का बैच आकार उपयोग किया गया। मेमोरी उपयोग को कम करने के लिए, उन्होंने मिश्रित-परिशुद्धता प्रशिक्षण का उपयोग किया, वेट को FP16 में संग्रहीत किया और ऑप्टिमाइज़र स्टेट्स के लिए FP32 का उपयोग किया। सार्वजनिक रूप से जारी किए गए प्रशिक्षण लॉग ने लॉस स्पाइक्स और टीम की प्रतिक्रियाओं जैसी चुनौतियों का दस्तावेजीकरण किया, जिससे बड़े पैमाने पर प्रशिक्षण गतिशीलता में दुर्लभ अंतर्दृष्टि मिली।
ओपन-सोर्स प्रभाव
OPT-175B की रिलीज़ बड़े-भाषा-मॉडल परिदृश्य में एक मील का पत्थर थी। इससे पहले, इस पैमाने के मॉडल, जैसे GPT-3, केवल भुगतान किए गए API के माध्यम से उपलब्ध थे, जिससे अकादमिक अध्ययन सीमित हो गया था। खुले वेट प्रदान करके, मेटा ने शोधकर्ताओं को मॉडल को सीधे चलाने, फाइन-ट्यून करने और जांचने में सक्षम बनाया। इससे पूर्वाग्रह, विषाक्तता और व्याख्यात्मकता जैसे विषयों पर अध्ययन की एक लहर आई। मॉडल ने बाद के खुले मॉडलों, जैसे BLOOM और LLaMA, के लिए एक आधार रेखा के रूप में भी कार्य किया, जिन्होंने इसके सबक पर निर्माण किया। हालांकि, खुली रिलीज़ ने दुरुपयोग के बारे में भी चिंताएं उठाईं, क्योंकि मॉडल सम्मोहक दुष्प्रचार या स्पैम उत्पन्न कर सकता था। मेटा ने शोधकर्ताओं को एक्सेस के लिए आवेदन करने की आवश्यकता के द्वारा इसे संबोधित किया, हालांकि वेट अभी भी विशिष्ट मालिकाना मॉडलों की तुलना में अधिक सुलभ थे।
प्रदर्शन और मूल्यांकन
मानक बेंचमार्क पर, OPT-175B ने GPT-3 के बराबर प्रदर्शन किया, हालांकि मामूली भिन्नताओं के साथ। उदाहरण के लिए, SuperGLUE सूट पर, इसने समान स्कोर प्राप्त किए, जबकि Winograd Schema जैसे कुछ तर्क कार्यों पर, इसने मामूली अंतर दिखाए। मॉडल ने फ्यू-शॉट लर्निंग में उत्कृष्ट प्रदर्शन किया, GPT-3 की कुछ उदाहरणों के साथ नए कार्यों को अपनाने की क्षमता से मेल खाता है। हालांकि, यह कुछ प्रकार के तथ्यात्मक स्मरण के साथ संघर्ष करता था और कभी-कभी भ्रामक जानकारी उत्पन्न करता था। मेटा के मूल्यांकन में मानव वरीयता परीक्षण भी शामिल थे, जहां OPT-175B को खुले-अंत उत्पादन में GPT-3 के साथ प्रतिस्पर्धी के रूप में रेट किया गया था, हालांकि यह कुछ संरचित कार्यों में पीछे रह गया। कोड उत्पादन पर मॉडल का प्रदर्शन कम मजबूत था, जो इसके प्रशिक्षण डेटा की सीमित कोड सामग्री को दर्शाता है।
सीमाएं और नैतिक विचार
अन्य बड़े मॉडलों की तरह, OPT-175B ने अपने प्रशिक्षण डेटा में मौजूद पूर्वाग्रहों को प्रदर्शित किया। मेटा के अपने विश्लेषण में पाया गया कि यह रूढ़िबद्ध या आपत्तिजनक सामग्री उत्पन्न कर सकता है, विशेष रूप से लिंग, जाति और धर्म के संबंध में। मॉडल में वाक्यांशों को दोहराने की प्रवृत्ति भी थी और इसे आसानी से हानिकारक पाठ उत्पन्न करने के लिए प्रेरित किया जा सकता था। इन मुद्दों को कम करने के लिए, मेटा ने एक विस्तृत मॉडल कार्ड प्रदान किया और जिम्मेदार उपयोग को प्रोत्साहित किया। उन्होंने आसान प्रयोग के लिए एक छोटा संस्करण, OPT-1.3B भी जारी किया। ऐसे शक्तिशाली मॉडलों को ओपन-सोर्स करने के आसपास की नैतिक बहस जारी रही, कुछ ने तर्क दिया कि पारदर्शिता जोखिमों से अधिक महत्वपूर्ण थी, जबकि अन्य ने अधिक नियंत्रित पहुंच का आह्वान किया। 2024 तक, OPT-175B खुले मॉडल विकास के लिए एक संदर्भ बिंदु बना हुआ है, हालांकि नए मॉडलों ने इसकी क्षमताओं को पार कर लिया है।
विरासत और प्रभाव
OPT-175B ने एआई अनुसंधान की दिशा को प्रभावित किया, यह प्रदर्शित करके कि बड़े पैमाने के मॉडल विनाशकारी परिणामों के बिना खुले हो सकते हैं। इसने मेटा की बाद की LLaMA श्रृंखला के लिए मार्ग प्रशस्त किया, जिसने दक्षता और पहुंच में और सुधार किया। मॉडल ने कुशल प्रशिक्षण और अनुमान के लिए तकनीकों के विकास में भी योगदान दिया, जैसे एक्टिवेशन चेकपॉइंटिंग और टेंसर समानांतरीकरण। इसके सार्वजनिक प्रशिक्षण लॉग स्केलिंग की व्यावहारिक चुनौतियों को समझने के लिए एक मूल्यवान संसाधन बन गए। हालांकि आज सबसे शक्तिशाली मॉडल नहीं है, OPT-175B जनरेटिव-एआई के इतिहास में एक महत्वपूर्ण स्थान रखता है, जो मालिकाना प्रणालियों के प्रभुत्व वाले क्षेत्र में खुलेपन की ओर एक बदलाव का प्रतिनिधित्व करता है। इसकी रिलीज़ ने एआई21-लैब्स और इन्फ्लेक्शन-एआई जैसी अन्य प्रयोगशालाओं को खुली रणनीतियों पर विचार करने के लिए प्रोत्साहित किया, हालांकि कई ने अभी भी मालिकाना दृष्टिकोण चुना।