OpenAI o1 एक जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) है और OpenAI की "o" श्रृंखला के तर्क मॉडलों में पहला मॉडल है। 12 सितंबर, 2024 को एक पूर्वावलोकन के रूप में जारी, o1 उत्तर उत्पन्न करने से पहले अतिरिक्त समय "सोचने" में बिताता है, जो जटिल तर्क कार्यों, विशेष रूप से विज्ञान, गणित और प्रोग्रामिंग में, GPT-4o जैसे पहले के मॉडलों की तुलना में इसके प्रदर्शन में सुधार करता है। o1 का पूर्ण संस्करण 5 दिसंबर, 2024 को ChatGPT उपयोगकर्ताओं के लिए जारी किया गया था।
o1 Large language model डिज़ाइन में एक बदलाव का प्रतिनिधित्व करता है: मॉडल आकार और प्रशिक्षण डेटा को केवल बढ़ाने के बजाय, यह प्रतिक्रिया देने से पहले विचार की एक श्रृंखला उत्पन्न करने के लिए अनुमान के दौरान अधिक कंप्यूटिंग शक्ति आवंटित करता है। यह दृष्टिकोण, जिसे OpenAI द्वारा एक नए प्रतिमान के रूप में वर्णित किया गया है, का उद्देश्य मॉडल को आंतरिक रूप से विचार करने की अनुमति देकर आउटपुट गुणवत्ता को बढ़ाना है। o1 की रिलीज़ ने Generative AI में बाद के विकासों को प्रभावित किया है और इसके बाद o3 जैसे उत्तराधिकारी आए हैं।
इतिहास
पृष्ठभूमि
लीक हुई जानकारी के अनुसार, o1 को पहले OpenAI के भीतर "Q" और बाद में "Strawberry" के रूप में जाना जाता था। कोडनेम "Q" पहली बार नवंबर 2023 में सामने आया, सैम ऑल्टमैन के बाहर किए जाने और बाद में OpenAI के CEO के रूप में बहाल किए जाने के समय, अफवाहों के साथ कि यह प्रयोगात्मक मॉडल गणितीय बेंचमार्क पर आशाजनक परिणाम दिखा चुका था। जुलाई 2024 में, रॉयटर्स ने बताया कि OpenAI "Strawberry" के रूप में जाना जाने वाला एक जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर विकसित कर रहा था, जो बाद में o1 बन गया।
रिलीज़
"o1-preview" और "o1-mini" 12 सितंबर, 2024 को ChatGPT Plus और Team उपयोगकर्ताओं के लिए जारी किए गए थे। GitHub ने उसी दिन अपनी Copilot सेवा में o1-preview के एकीकरण का परीक्षण शुरू किया। 5 दिसंबर, 2024 को, o1 का पूर्ण संस्करण जारी किया गया था। उसी दिन, ChatGPT Pro नामक एक सदस्यता जारी की गई, जिसमें o1 के एक प्रो संस्करण तक पहुंच शामिल थी जो बेहतर उत्तर प्रदान करने के लिए अधिक कंप्यूट का उपयोग करता है। जनवरी 2025 में, o1 को Microsoft Copilot में एकीकृत किया गया था।
o1-preview का API GPT-4o की तुलना में कई गुना अधिक महंगा है। जनवरी 2025 तक, पूर्ण o1 मॉडल के लिए API उपयोग उपयोग स्तर 5 पर डेवलपर्स तक सीमित है। OpenAI ने नोट किया कि o1 "तर्क" मॉडलों की एक श्रृंखला में पहला है। दिसंबर 2024 में, OpenAI ने अपने उत्तराधिकारी o3 के लिए बेंचमार्क परिणाम साझा किए (मोबाइल कैरियर ब्रांड O2 के साथ ट्रेडमार्क संघर्ष से बचने के लिए o2 नाम छोड़ दिया गया था)। मार्च 2025 में, OpenAI ने o1-pro API जारी किया, जो अब तक का सबसे महंगा AI मॉडल है, जिसकी कीमत $150 प्रति 1 मिलियन इनपुट टोकन और $600 प्रति 1 मिलियन आउटपुट टोकन है।
क्षमताएँ
OpenAI के अनुसार, o1 को एक नए अनुकूलन एल्गोरिदम और विशेष रूप से इसके लिए तैयार किए गए डेटासेट का उपयोग करके प्रशिक्षित किया गया है, साथ ही इसके प्रशिक्षण में सुदृढीकरण सीखने को भी शामिल किया गया है। OpenAI ने o1 को GPT-4o के उत्तराधिकारी के बजाय एक पूरक के रूप में वर्णित किया।
o1 उत्तर उत्पन्न करने से पहले अतिरिक्त समय सोचने (विचार की एक श्रृंखला उत्पन्न करने) में बिताता है, जो इसे जटिल तर्क कार्यों, विशेष रूप से विज्ञान और गणित के लिए बेहतर बनाता है। पिछले मॉडलों की तुलना में, o1 को अंतिम उत्तर लौटाने से पहले लंबी "विचार श्रृंखलाएं" उत्पन्न करने के लिए प्रशिक्षित किया गया है। मीरा मुराती के अनुसार, प्रतिक्रिया देने से पहले सोचने की यह क्षमता एक नया, अतिरिक्त प्रतिमान है, जो उत्तर उत्पन्न करते समय अधिक कंप्यूटिंग शक्ति खर्च करके मॉडल आउटपुट में सुधार करती है, जबकि मॉडल स्केलिंग प्रतिमान मॉडल आकार, प्रशिक्षण डेटा और प्रशिक्षण कंप्यूटिंग शक्ति को बढ़ाकर आउटपुट में सुधार करता है। OpenAI के परीक्षण परिणाम उत्तर देने से पहले सोचने में खर्च की गई कंप्यूट की मात्रा के लघुगणक और सटीकता के बीच एक सहसंबंध का सुझाव देते हैं।
o1-preview ने भौतिकी, रसायन विज्ञान और जीव विज्ञान से संबंधित बेंचमार्क परीक्षणों पर लगभग पीएचडी स्तर पर प्रदर्शन किया। अमेरिकी आमंत्रण गणित परीक्षा में, इसने 83% (12.5/15) समस्याओं को हल किया, जबकि GPT-4o ने 13% (1.8/15) हल किया। इसने Codeforces कोडिंग प्रतियोगिताओं में 89वें प्रतिशत में भी स्थान प्राप्त किया। o1-mini o1-preview की तुलना में तेज़ और 80% सस्ता है। यह प्रोग्रामिंग और STEM से संबंधित कार्यों के लिए विशेष रूप से उपयुक्त है, लेकिन इसमें o1-preview के समान "व्यापक विश्व ज्ञान" नहीं है।
OpenAI ने नोट किया कि o1 की तर्क क्षमताएं इसे प्रॉम्प्ट के संदर्भ विंडो में दिए गए सुरक्षा नियमों का पालन करने में बेहतर बनाती हैं। OpenAI ने बताया कि एक परीक्षण के दौरान, o1-preview के एक उदाहरण ने एक बग के कारण असंभव होने वाले कार्य को सफल करने के लिए एक गलत कॉन्फ़िगरेशन का फायदा उठाया। OpenAI ने अनुसंधान, मूल्यांकन और परीक्षण के लिए यूके और यूएस AI सुरक्षा संस्थानों को प्रारंभिक पहुंच भी प्रदान की। OpenAI के आकलन के अनुसार, o1-preview और o1-mini CBRN (जैविक, रासायनिक, रेडियोलॉजिकल और परमाणु) हथियारों में "मध्यम जोखिम" में पार हो गए। डैन हेंड्रिक्स ने लिखा कि "मॉडल पहले से ही अधिकांश समय जैव हथियारों से संबंधित प्रश्नों का उत्तर देने में पीएचडी वैज्ञानिकों से बेहतर प्रदर्शन करता है।" उन्होंने सुझाव दिया कि ये चिंताजनक क्षमताएं बढ़ती रहेंगी।
सीमाएँ
o1 को आमतौर पर OpenAI के अन्य GPT मॉडलों की तुलना में अधिक कंप्यूटिंग समय और शक्ति की आवश्यकता होती है, क्योंकि यह अंतिम प्रतिक्रिया देने से पहले विचार की लंबी श्रृंखलाएं उत्पन्न करता है। यह बढ़ी हुई कम्प्यूटेशनल लागत इसके API मूल्य निर्धारण और उपयोग सीमाओं में परिलक्षित होती है।
OpenAI के अनुसार, o1 लगभग 0.38% मामलों में "नकली संरेखण" कर सकता है, अर्थात सटीकता और अपनी विचार श्रृंखला के विपरीत एक प्रतिक्रिया उत्पन्न कर सकता है। OpenAI उपयोगकर्ताओं को o1 की विचार श्रृंखला को प्रकट करने का प्रयास करने से रोकता है, जो डिज़ाइन द्वारा छिपी हुई है और कंपनी की नीतियों का पालन करने के लिए प्रशिक्षित नहीं है। प्रॉम्प्ट की निगरानी की जाती है, और जो उपयोगकर्ता जानबूझकर या गलती से इसका उल्लंघन करते हैं, वे o1 तक अपनी पहुंच खो सकते हैं। OpenAI प्रतिबंध के कारणों के रूप में AI सुरक्षा और प्रतिस्पर्धात्मक लाभ का हवाला देता है, जिसे बड़े भाषा मॉडल के साथ काम करने वाले डेवलपर्स द्वारा पारदर्शिता के नुकसान के रूप में वर्णित किया गया है।
अक्टूबर 2024 में, Apple के शोधकर्ताओं ने एक प्रीप्रिंट प्रस्तुत किया जिसमें बताया गया कि o1 जैसे LLM मॉडलों के अपने प्रशिक्षण डेटा से तर्क चरणों की नकल कर सकते हैं। गणित की समस्या में संख्याओं और नामों को बदलकर या केवल उसी समस्या को फिर से चलाकर, LLM अपने सर्वोत्तम बेंचमार्क परिणामों की तुलना में कुछ हद तक खराब प्रदर्शन करेंगे। समस्याओं में अप्रासंगिक लेकिन तार्किक रूप से नगण्य जानकारी जोड़ने से प्रदर्शन में बहुत अधिक गिरावट आई, o1-preview के लिए −17.5% और o1-mini के लिए −29.1% से लेकर परीक्षण किए गए सबसे खराब मॉडल के लिए −65.7% तक।
Apollo Research के सुरक्षा मूल्यांकनों में पाया गया कि o1 नियंत्रित परीक्षणों में अन्य फ्रंटियर मॉडलों की तुलना में अधिक लगातार धोखा देने में सक्षम था (उदाहरण के लिए, बंद होने की धमकी दिए जाने पर खुद को बाहरी सर्वर पर कॉपी करने का प्रयास)। जब सामना किया गया, तो इसने अपेक्षाकृत शायद ही कभी धोखाधड़ी की कार्रवाई स्वीकार की (20% परीक्षण मामलों में)।
प्रभाव और स्वागत
o1 की रिलीज़ ने Artificial intelligence परिदृश्य में एक उल्लेखनीय बदलाव को चिह्नित किया, क्योंकि इसने स्केलिंग का एक नया आयाम पेश किया: अनुमान-समय कंप्यूट। यह दृष्टिकोण मॉडल आकार और प्रशिक्षण डेटा बढ़ाने पर पारंपरिक ध्यान के विपरीत है, और इसे बाद के तर्क-केंद्रित मॉडलों में Anthropic और Google DeepMind सहित अन्य संगठनों द्वारा अपनाया गया है। o1 की सफलता ने AI प्रणालियों की व्याख्यात्मकता और पारदर्शिता के बारे में चर्चाओं को भी बढ़ावा दिया, क्योंकि इसकी छिपी हुई विचार श्रृंखला ने शोधकर्ताओं और डेवलपर्स के बीच चिंताएं पैदा कीं।
अमेरिकी आमंत्रण गणित परीक्षा और Codeforces प्रतियोगिताओं जैसे बेंचमार्क पर मॉडल के प्रदर्शन ने तर्क और कोडिंग क्षमताओं में महत्वपूर्ण सुधार प्रदर्शित किए, o1 को वैज्ञानिक अनुसंधान और सॉफ्टवेयर विकास के लिए एक उपकरण के रूप में स्थापित किया। हालांकि, इसकी सीमाओं, जिसमें उच्च कम्प्यूटेशनल लागत और धोखाधड़ी व्यवहार की संभावना शामिल है, ने क्षेत्र में चल रही चुनौतियों को उजागर किया।