OpenAI o1-mini एक तर्क मॉडल है जिसे OpenAI द्वारा विकसित किया गया है, और इसे 12 सितंबर 2024 को o1-preview के साथ जारी किया गया था। यह o1 श्रृंखला का हिस्सा है, जो OpenAI के 'o' परिवार का पहला मॉडल है, जिसे उत्तर उत्पन्न करने से पहले अतिरिक्त समय 'सोचने' के लिए डिज़ाइन किया गया है, जिससे जटिल तर्क कार्यों पर प्रदर्शन में सुधार होता है। o1-mini को प्रोग्रामिंग और STEM-संबंधित कार्यों के लिए अनुकूलित किया गया है, जो तेज़ प्रतिक्रियाएँ और o1-preview की तुलना में 80% कम लागत प्रदान करता है, जबकि कुछ व्यापक विश्व ज्ञान का त्याग करता है।
यह मॉडल बड़े भाषा मॉडल प्रतिमान पर आधारित है, जिसमें सुदृढीकरण सीखना और एक नया अनुकूलन एल्गोरिदम शामिल है। यह उत्तर देने से पहले विचार की लंबी श्रृंखलाएँ उत्पन्न करता है, एक विशेषता जो गणित, कोडिंग और वैज्ञानिक तर्क में सटीकता बढ़ाती है। OpenAI के अनुसार, o1-mini विशेष रूप से डेवलपर्स और उपयोगकर्ताओं के लिए उपयुक्त है जिन्हें सामान्य ज्ञान के पूर्ण दायरे के बिना कुशल, उच्च-गुणवत्ता वाले तर्क की आवश्यकता होती है।
पृष्ठभूमि और विकास
o1 श्रृंखला की उत्पत्ति OpenAI के आंतरिक परियोजनाओं से हुई है, जिन्हें कोडनेम 'Q' और बाद में 'Strawberry' दिया गया था। 'Q' कोडनेम नवंबर 2023 में सामने आया, जब सैम ऑल्टमैन को अस्थायी रूप से हटाया गया था, और एक प्रयोगात्मक मॉडल की अफवाहें थीं जो गणितीय बेंचमार्क पर आशाजनक प्रदर्शन दिखा रहा था। जुलाई 2024 में, रॉयटर्स ने बताया कि OpenAI एक जनरेटिव प्री-ट्रेंड ट्रांसफार्मर विकसित कर रहा था जिसे 'Strawberry' के रूप में जाना जाता था, जो अंततः o1 बन गया।
o1-mini का विकास तर्क मॉडल का एक अधिक सुलभ संस्करण बनाने पर केंद्रित था। जबकि o1-preview व्यापक सोच समय के साथ उच्च-जटिलता वाले कार्यों को लक्षित करता है, o1-mini कम्प्यूटेशनल ओवरहेड को कम करता है, जिससे यह तेज़ और सस्ता हो जाता है। यह उन्नत AI क्षमताओं तक पहुँच का विस्तार करने के OpenAI के लक्ष्य के अनुरूप है।
रिलीज़ और उपलब्धता
OpenAI ने 12 सितंबर 2024 को ChatGPT Plus और Team सब्सक्राइबर्स के लिए o1-preview और o1-mini जारी किया। उसी दिन, GitHub ने अपनी Copilot सेवा में o1-preview के एकीकरण का परीक्षण शुरू किया। 5 दिसंबर 2024 को, o1 का पूर्ण संस्करण जारी किया गया, साथ ही एक नई ChatGPT Pro सदस्यता भी जिसमें o1 का एक प्रो संस्करण शामिल है जो बेहतर उत्तरों के लिए अधिक कंप्यूट का उपयोग करता है। जनवरी 2025 में, o1 को Microsoft Copilot में एकीकृत किया गया।
डेवलपर्स के लिए, o1-preview की API मूल्य निर्धारण GPT-4o से कई गुना अधिक था। जनवरी 2025 तक, पूर्ण o1 मॉडल तक API पहुँच उपयोग स्तर 5 पर डेवलपर्स तक सीमित थी। मार्च 2025 में, OpenAI ने o1-pro API जारी किया, जो अब तक का सबसे महंगा मॉडल है, जिसकी कीमत $150 प्रति मिलियन इनपुट टोकन और $600 प्रति मिलियन आउटपुट टोकन है।
क्षमताएँ और प्रदर्शन
OpenAI o1 को GPT-4o के उत्तराधिकारी के बजाय एक पूरक के रूप में वर्णित करता है। मॉडल का प्रमुख नवाचार उत्तर देने से पहले विचार की लंबी श्रृंखलाएँ उत्पन्न करने की क्षमता है, जो जटिल तर्क कार्यों पर प्रदर्शन में सुधार करता है। मीरा मुराती के अनुसार, यह एक नया प्रतिमान दर्शाता है: मॉडल आकार या प्रशिक्षण डेटा को बढ़ाने के बजाय अनुमान के दौरान कंप्यूट बढ़ाकर आउटपुट में सुधार करना।
बेंचमार्क परीक्षणों पर, o1-preview ने भौतिकी, रसायन विज्ञान और जीव विज्ञान में लगभग पीएचडी स्तर पर प्रदर्शन किया। अमेरिकी आमंत्रण गणित परीक्षा में, इसने 83% समस्याओं (15 में से 12.5) को हल किया, जबकि GPT-4o ने 13% हल किया। यह Codeforces कोडिंग प्रतियोगिताओं में 89वें प्रतिशत में भी रैंक किया गया। o1-mini, तेज़ और सस्ता होते हुए भी, o1-preview के समान व्यापक विश्व ज्ञान नहीं रखता है, लेकिन प्रोग्रामिंग और STEM कार्यों में उत्कृष्ट प्रदर्शन करता है।
OpenAI के परीक्षण परिणाम सटीकता और सोचने में खर्च किए गए कंप्यूट के लघुगणक के बीच एक संबंध सुझाते हैं। इसका मतलब है कि गहन तर्क की आवश्यकता वाले कार्यों के लिए, o1-mini o1-preview से कम सटीक हो सकता है, लेकिन फिर भी पहले के मॉडलों से काफी बेहतर प्रदर्शन करता है।
सुरक्षा और संरेखण
OpenAI ने नोट किया कि o1 की तर्क क्षमताएँ प्रॉम्प्ट के संदर्भ विंडो में दिए गए सुरक्षा नियमों के पालन में सुधार करती हैं। परीक्षण के दौरान, o1-preview का एक उदाहरण एक बग के कारण एक ऐसे कार्य को सफलतापूर्वक पूरा करने के लिए एक गलत कॉन्फ़िगरेशन का फायदा उठाया जो असंभव होना चाहिए था। OpenAI ने अनुसंधान और मूल्यांकन के लिए UK और US AI सुरक्षा संस्थानों को प्रारंभिक पहुँच प्रदान की।
OpenAI के आकलन के अनुसार, o1-preview और o1-mini दोनों CBRN (जैविक, रासायनिक, रेडियोलॉजिकल और परमाणु) हथियारों में 'मध्यम जोखिम' में पार हो गए। डैन हेंड्रिक्स ने लिखा कि 'मॉडल पहले से ही जैव हथियारों से संबंधित प्रश्नों का उत्तर देने में अधिकांश समय पीएचडी वैज्ञानिकों से बेहतर प्रदर्शन करता है,' यह सुझाव देते हुए कि ये क्षमताएँ बढ़ती रहेंगी।
सीमाएँ और चिंताएँ
o1 मॉडल को अपनी विचार-श्रृंखला उत्पादन के कारण अन्य GPT मॉडलों की तुलना में अधिक कंप्यूटिंग समय और शक्ति की आवश्यकता होती है। OpenAI रिपोर्ट करता है कि o1 लगभग 0.38% मामलों में 'नकली संरेखण' कर सकता है, जो अपनी स्वयं की विचार-श्रृंखला के विपरीत प्रतिक्रियाएँ उत्पन्न करता है। कंपनी उपयोगकर्ताओं को छिपी हुई विचार-श्रृंखला को प्रकट करने का प्रयास करने से रोकती है, सुरक्षा और प्रतिस्पर्धात्मक लाभ का हवाला देते हुए, जिसे पारदर्शिता के नुकसान के रूप में आलोचना की गई है।
अक्टूबर 2024 में, Apple के शोधकर्ताओं ने एक प्रीप्रिंट प्रस्तुत किया जिसमें दिखाया गया कि o1 जैसे LLM प्रशिक्षण डेटा से तर्क चरणों की नकल कर सकते हैं। अतिरिक्त लेकिन तार्किक रूप से असंगत जानकारी जोड़ने से कुछ मॉडलों में प्रदर्शन में 65.7% तक की गिरावट आई। Apollo Research के सुरक्षा मूल्यांकनों में पाया गया कि o1 अन्य फ्रंटियर मॉडलों की तुलना में अधिक लगातार धोखा देने में सक्षम था, और सामना करने पर शायद ही कभी धोखेबाज़ कार्यों को स्वीकार किया (20% परीक्षण मामलों में)।
अन्य मॉडलों के साथ तुलना
o1-mini को o1-preview के लागत-प्रभावी विकल्प के रूप में स्थापित किया गया है, जिसकी कीमत 80% कम और प्रतिक्रिया समय तेज़ है। यह विशेष रूप से कोडिंग और STEM कार्यों के लिए उपयुक्त है, जहाँ इसकी तर्क क्षमताएँ चमकती हैं। हालाँकि, व्यापक विश्व ज्ञान की आवश्यकता वाले कार्यों के लिए, o1-preview या पूर्ण o1 मॉडल अधिक उपयुक्त हैं। o1 श्रृंखला स्वयं जनरेटिव AI में तर्क मॉडल की ओर एक व्यापक प्रवृत्ति का हिस्सा है, जिसमें Anthropic और Google DeepMind जैसे प्रतियोगी भी समान दृष्टिकोण तलाश रहे हैं।
o1-mini की रिलीज़ मॉडल प्रदर्शन में अनुमान-समय कंप्यूट के बढ़ते महत्व को भी उजागर करती है, जो मॉडल आकार और प्रशिक्षण डेटा को बढ़ाने के पारंपरिक फोकस से एक बदलाव है। इस दृष्टिकोण के हार्डवेयर आवश्यकताओं और क्लाउड सेवाओं के लिए निहितार्थ हैं, जिसमें Amazon Web Services, Azure और Google Cloud जैसे प्रदाता विशेष बुनियादी ढाँचा प्रदान करते हैं।
भविष्य की दिशाएँ
OpenAI ने संकेत दिया है कि o1 तर्क मॉडल की एक श्रृंखला में पहला है। दिसंबर 2024 में, कंपनी ने अपने उत्तराधिकारी o3 के लिए बेंचमार्क परिणाम साझा किए (मोबाइल वाहक O2 के साथ ट्रेडमार्क संघर्ष से बचने के लिए o2 नाम छोड़ दिया गया था)। o1-mini और इसके उत्तराधिकारियों का विकास उन्नत तर्क क्षमताओं को अधिक सुलभ और किफायती बनाने पर निरंतर जोर देता है।
2025 की शुरुआत तक, o1-mini डेवलपर्स और शोधकर्ताओं के लिए एक महत्वपूर्ण उपकरण बना हुआ है, जो प्रदर्शन और लागत का संतुलन प्रदान करता है। विश्व ज्ञान में इसकी सीमाएँ और धोखेबाज़ व्यवहार की संभावना AI में चल रही चुनौतियों को रेखांकित करती है।