अंग्रेज़ी से अनुवादित

OPT (Open Pre-trained Transformer) मेटा AI द्वारा विकसित डिकोडर-केवल भाषा मॉडलों का एक सुइट है, जो मई 2022 में जारी किया गया था। ये मॉडल 125 मिलियन से 175 बिलियन पैरामीटर तक होते हैं और पूरी तरह से ओपन-सोर्स होने के लिए उल्लेखनीय हैं, जिसमें वेट, कोड और प्रशिक्षण लॉग शामिल हैं।

OPT (ओपन प्री-ट्रेंड ट्रांसफॉर्मर) डिकोडर-ओनली बड़े भाषा मॉडल का एक परिवार है, जिसे मेटा एआई द्वारा विकसित किया गया था और मई 2022 में जारी किया गया था। यह सूट 125 मिलियन से 175 बिलियन तक के पैरामीटर आकारों में फैला हुआ है, जिसमें सबसे बड़ा मॉडल, OPT-175B, GPT-3 के पैमाने से मेल खाता है। कई समकालीन मॉडलों के विपरीत, OPT को इसके वजन, प्रशिक्षण कोड और विस्तृत लॉग के साथ सार्वजनिक रूप से उपलब्ध कराया गया था, जिसका उद्देश्य बड़े पैमाने पर भाषा मॉडल अनुसंधान तक पहुंच को लोकतांत्रिक बनाना था।

OPT की वास्तुकला मानक Transformer (architecture) डिकोडर डिज़ाइन का पालन करती है, जिसमें लेयर नॉर्मलाइज़ेशन और अवशिष्ट कनेक्शन जैसे सुधार शामिल हैं। मॉडलों को 180 बिलियन टोकन के विविध कॉर्पस पर प्रशिक्षित किया गया था, जिसमें कॉमन क्रॉल, विकिपीडिया और बुक्सकॉर्पस जैसे स्रोत शामिल थे। प्रशिक्षण प्रक्रिया में कंप्यूटेशनल दक्षता और स्थिरता पर जोर दिया गया, जिसमें डायनामिक लॉस स्केलिंग और ग्रेडिएंट क्लिपिंग जैसी तकनीकों का उपयोग किया गया।

विकास और रिलीज़

OPT को मेटा एआई में सुसान झांग और सहयोगियों द्वारा "OPT: ओपन प्री-ट्रेंड ट्रांसफॉर्मर लैंग्वेज मॉडल" शीर्षक वाले एक पेपर में पेश किया गया था। रिलीज़ में न केवल मॉडल वजन शामिल था, बल्कि प्रशिक्षण कोड और प्रशिक्षण प्रक्रिया का विस्तृत लॉग भी शामिल था, जो इस पैमाने के मॉडल के लिए अभूतपूर्व था। लक्ष्य कृत्रिम बुद्धिमत्ता अनुसंधान समुदाय के भीतर प्रतिलिपि प्रस्तुत करने योग्यता और सहयोग को प्रोत्साहित करना था।

मॉडलों को एक गैर-व्यावसायिक लाइसेंस के तहत उपलब्ध कराया गया था, जिसमें अनुरोध प्रक्रिया के माध्यम से पहुंच प्रदान की गई थी। रिलीज़ के साथ एक डेमो और दस्तावेज़ीकरण भी शामिल था। सबसे बड़े मॉडल, OPT-175B को महत्वपूर्ण कंप्यूटिंग संसाधनों की आवश्यकता थी, लेकिन विभिन्न अनुसंधान आवश्यकताओं को समायोजित करने के लिए छोटे संस्करण (जैसे, 125M, 350M, 1.3B, 2.7B, 6.7B, 13B, 30B, 66B) भी प्रदान किए गए थे।

वास्तुकला और प्रशिक्षण

OPT कारणात्मक ध्यान के साथ एक डिकोडर-ओनली वास्तुकला का उपयोग करता है, जो GPT-3 के समान है। प्रमुख डिज़ाइन विकल्पों में प्री-नॉर्मलाइज़ेशन (प्रत्येक उप-परत से पहले लेयर नॉर्म लागू करना), GELU के बजाय ReLU सक्रियण, और सीखे गए स्थितीय एम्बेडिंग शामिल हैं। प्रशिक्षण डेटा को फ़िल्टर और डीडुप्लिकेट किया गया था, और मॉडलों को कोसाइन लर्निंग रेट शेड्यूल के साथ एडम ऑप्टिमाइज़ेशन का उपयोग करके प्रशिक्षित किया गया था।

OPT-175B का प्रशिक्षण NVIDIA A100 GPUs पर लगभग 992 GPU-घंटे लेता था, जो अनुकूलन तकनीकों के कारण तुलनीय मॉडलों की तुलना में काफी अधिक कुशल था। प्रशिक्षण लॉग में नुकसान की वृद्धि और उपयोग की गई शमन रणनीतियों जैसी चुनौतियों का दस्तावेज़ीकरण किया गया था।

प्रदर्शन और मूल्यांकन

OPT मॉडलों का मूल्यांकन प्राकृतिक भाषा प्रसंस्करण बेंचमार्क की एक श्रृंखला पर किया गया था, जिसमें सुपरग्लू, SQuAD और ओपनबुकक्यूए शामिल हैं। जबकि OPT-175B ने कई कार्यों पर GPT-3 के साथ प्रतिस्पर्धात्मक प्रदर्शन किया, इसमें कुछ अंतर दिखे, जैसे कोड निर्माण कार्यों पर थोड़ा कम प्रदर्शन। मॉडलों ने कुछ-शॉट लर्निंग क्षमताएं भी प्रदर्शित कीं, जो प्रदान किए गए उदाहरणों की संख्या के साथ सुधार करती हैं।

शून्य-शॉट और कुछ-शॉट सेटिंग्स में, OPT-175B ने प्रश्न उत्तर और सामान्य ज्ञान तर्क कार्यों पर मजबूत परिणाम प्राप्त किए। हालांकि, अन्य बड़े मॉडलों की तरह, यह पक्षपाती या हानिकारक आउटपुट उत्पन्न कर सकता था, और पेपर में सीमाओं और नैतिक विचारों पर चर्चा की गई थी।

प्रभाव और विरासत

OPT ओपन-सोर्स एआई समुदाय में एक महत्वपूर्ण रिलीज़ था, जिसने बड़े पैमाने पर मॉडल विकास में पारदर्शिता के लिए एक मिसाल कायम की। इसने BLOOM और LLaMA जैसे बाद के ओपन मॉडलों को प्रभावित किया। OPT की उपलब्धता ने शोधकर्ताओं को मालिकाना मॉडलों की बाधाओं के बिना मॉडल व्यवहार, फाइन-ट्यूनिंग और व्याख्या का अध्ययन करने में सक्षम बनाया।

रिलीज़ ने शक्तिशाली मॉडलों को ओपन-सोर्स करने के जोखिमों के बारे में भी चर्चा शुरू की, जिसमें संभावित दुरुपयोग शामिल है। मेटा एआई ने एक जिम्मेदार रिलीज़ रणनीति लागू की, जिसमें उपयोग के मामले की नीति और पहुंच नियंत्रण शामिल थे। इन चिंताओं के बावजूद, OPT शैक्षणिक अनुसंधान में व्यापक रूप से उपयोग किया जाने वाला आधार रेखा और ओपन मॉडल विकास के लिए एक संदर्भ बिंदु बना हुआ है।

यह भी देखें

संदर्भ

  • झांग, एस., एट अल. (2022). "OPT: ओपन प्री-ट्रेंड ट्रांसफॉर्मर लैंग्वेज मॉडल." arXiv:2205.01068.
  • मेटा एआई. (2022). "OPT का परिचय."
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·meta-ai·open-source-ai·transformer-architecture
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास