अंग्रेज़ी से अनुवादित

2024 में OpenAI द्वारा जारी किया गया एक तर्क-केंद्रित बड़ा भाषा मॉडल, जो उत्तर देने से पहले अनुमान के समय विस्तारित, छिपी हुई विचार-श्रृंखला तर्क का उपयोग करने वाला पहला व्यापक रूप से तैनात मॉडल है।

OpenAI o1 एक Reasoning model है जिसे OpenAI द्वारा विकसित किया गया था और सितंबर 2024 में पूर्वावलोकन रूप में जारी किया गया था, जिसका पूर्ण विमोचन दिसंबर 2024 में हुआ। यह पिछली GPT-4 श्रृंखला से एक अलग दिशा का प्रतिनिधित्व करता है, क्योंकि इसमें प्रशिक्षण और अनुमान दृष्टिकोण पेश किया गया जो विशेष रूप से बहु-चरणीय तर्क कार्यों जैसे प्रतियोगिता गणित, कोडिंग और वैज्ञानिक समस्या-समाधान के लिए अनुकूलित था, न कि केवल सामान्य-उद्देश्यीय पैमाने को और बढ़ाने पर ध्यान केंद्रित करना।

विस्तारित विचार-श्रृंखला

o1 का केंद्रीय तकनीकी नवाचार, जैसा कि OpenAI द्वारा वर्णित किया गया, मॉडल को अंतिम उत्तर उत्पन्न करने से पहले एक विस्तारित आंतरिक Chain-of-thought उत्पन्न करने के लिए प्रशिक्षित करना था, जिसमें Reinforcement learning का उपयोग करके उस मध्यवर्ती तर्क प्रक्रिया की गुणवत्ता में सुधार किया गया। पहले की प्रॉम्प्टिंग तकनीकों के विपरीत, जो उपयोगकर्ता-आपूर्ति निर्देशों के माध्यम से विचार-श्रृंखला तर्क को उत्तेजित करती थीं, o1 को इस तर्क को स्वचालित रूप से करने के लिए प्रशिक्षित किया गया था, और कठिन समस्याओं के लिए अधिक गणना आवंटित करने के लिए, एक दृष्टिकोण जो Test-time compute स्केलिंग के रूप में जाना जाने लगा: केवल मॉडल या प्रशिक्षण डेटा आकार बढ़ाने के बजाय, क्षमता को अनुमान समय पर मॉडल को अधिक "सोचने" देकर सुधारा जा सकता था। OpenAI ने जानबूझकर मॉडल के कच्चे आंतरिक तर्क निशानों को उपयोगकर्ताओं से छिपाया, केवल एक सारांशित संस्करण दिखाया, और इसके लिए तकनीक की नकल किए जाने के प्रतिस्पर्धात्मक चिंताओं और कच्चे विचार-श्रृंखला में अनफ़िल्टर्ड या हेरफेर करने वाली सामग्री होने की सुरक्षा चिंताओं का हवाला दिया।

प्रदर्शन और बेंचमार्क

OpenAI ने तर्क-भारी मूल्यांकनों पर GPT-4-श्रेणी के मॉडलों की तुलना में o1 के लिए पर्याप्त लाभ की सूचना दी, जिसमें प्रतियोगिता गणित समस्याओं और SWE-bench सॉफ्टवेयर इंजीनियरिंग बेंचमार्क पर बड़े सुधार शामिल थे, साथ ही पीएचडी-स्तर के विज्ञान प्रश्नों पर मजबूत प्रदर्शन भी था। मॉडल के लाभ उन कार्यों पर सबसे अधिक स्पष्ट थे जिनमें विस्तारित, सत्यापन योग्य बहु-चरणीय तर्क की आवश्यकता थी, जबकि अधिक खुले-अंत या ज्ञान-स्मरण कार्यों पर सुधार अपेक्षाकृत मामूली थे, एक पैटर्न जिसने कच्चे ज्ञान क्षमता और तर्क क्षमता के बीच क्षेत्र में बढ़ते भेद को मजबूत किया।

उद्योग प्रभाव

o1 की रिलीज़ ने उद्योग भर में त्वरित प्रतिक्रियाएँ उत्पन्न कीं, जिसमें DeepSeek सहित प्रतिस्पर्धी प्रयोगशालाओं ने अपने स्वयं के तर्क-केंद्रित मॉडल जारी किए, विशेष रूप से जनवरी 2025 में DeepSeek-R1, जिसने नाटकीय रूप से कम रिपोर्ट किए गए प्रशिक्षण लागत पर तुलनीय तर्क बेंचमार्क प्रदर्शन प्राप्त किया और, o1 के विपरीत, अपने पूर्ण विचार-श्रृंखला तर्क निशान और खुले वजन प्रकाशित किए। इस अंतर ने OpenAI के अपने तर्क निशान छिपाने के निर्णय के मूल्य पर बहस को तेज कर दिया और सीमांत AI में Open-weights models प्रतिस्पर्धा की व्यापक चर्चा में योगदान दिया। o1 ने प्रीट्रेनिंग पैमाने के साथ-साथ परीक्षण-समय कंप्यूट स्केलिंग को एक विशिष्ट और स्थायी प्रतिमान के रूप में स्थापित किया, जिसके बाद OpenAI और प्रतिस्पर्धियों ने उसी अंतर्निहित दृष्टिकोण पर निर्मित आगे के तर्क-मॉडल पुनरावृत्तियों को जारी किया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·reasoning·openai
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास