अंग्रेज़ी से अनुवादित

एक तर्क मॉडल एक भाषा मॉडल है जिसे सुदृढीकरण सीखने के साथ प्रशिक्षित किया जाता है ताकि उत्तर देने से पहले विस्तारित आंतरिक तर्क श्रृंखलाएँ उत्पन्न की जा सकें, कठिन समस्याओं पर उच्च सटीकता के लिए अतिरिक्त अनुमान-समय कम्प्यूटेशन का व्यापार किया जा सके।

एक तर्क मॉडल एक बड़ा भाषा मॉडल है जिसे आम तौर पर सुदृढ़ीकरण सीखने के साथ प्रशिक्षित किया जाता है, ताकि अंतिम उत्तर देने से पहले तर्क के विस्तारित आंतरिक अनुक्रम उत्पन्न किए जा सकें, बजाय पिछली पीढ़ी के मॉडलों की तरह तुरंत उत्तर देने के। यह श्रेणी सामान्य चेन-ऑफ-थॉट प्रॉम्प्टिंग से अलग है, जो पारंपरिक रूप से प्रशिक्षित मॉडल को प्रॉम्प्ट में निर्देशों के माध्यम से चरण-दर-चरण तर्क करने के लिए कहती है, क्योंकि एक तर्क मॉडल विशेष रूप से अपनी स्वयं की तर्क प्रक्रिया उत्पन्न करने और सुधारने के लिए प्रशिक्षित होता है, और अक्सर एक प्रॉम्प्ट किए गए मॉडल की तुलना में कहीं अधिक मध्यवर्ती पाठ उत्पन्न करता है।

उत्पत्ति

OpenAI ने सितंबर 2024 में पहला व्यापक रूप से ज्ञात तर्क मॉडल, OpenAI o1, पेश किया, और इसे सत्यापन योग्य उत्तरों वाली समस्याओं, जैसे गणित और प्रोग्रामिंग, पर सुदृढ़ीकरण सीखने का उपयोग करके प्रतिक्रिया देने से पहले "सोचने" के लिए प्रशिक्षित बताया, जहां सही अंतिम उत्तर स्वचालित रूप से जांचा जा सकता है। OpenAI ने o1 की आंतरिक तर्क श्रृंखला को उपयोगकर्ताओं से काफी हद तक छिपाकर रखा, केवल एक सारांशित संस्करण दिखाया, यह निर्णय कंपनी ने कहा कि मॉडल की स्वतंत्र रूप से तर्क करने की क्षमता को संरक्षित करने के लिए था, जिसमें गलत रास्तों की खोज भी शामिल है, बिना उस अपरिष्कृत तर्क को अंतिम, समर्थित उत्तर के रूप में लिए जाने के। इस दृष्टिकोण ने बहु-चरणीय तर्क की आवश्यकता वाले बेंचमार्क पर महत्वपूर्ण सटीकता लाभ उत्पन्न किया, जिसमें प्रतियोगिता गणित और कोडिंग कार्य जैसे SWE-bench शामिल हैं।

DeepSeek-R1 और खुले तर्क मॉडल

जनवरी 2025 में, चीनी प्रयोगशाला DeepSeek ने DeepSeek-R1 जारी किया, एक खुले-भार वाला तर्क मॉडल जो बड़े पैमाने पर सुदृढ़ीकरण सीखने के साथ प्रशिक्षित था, जो कई बेंचमार्क पर OpenAI के तर्क मॉडलों के प्रदर्शन से मेल खाता था या उसके करीब पहुंच गया, और बताई गई प्रशिक्षण लागत के एक अंश पर, और o1 के विपरीत, उपयोगकर्ताओं को अपनी पूरी तर्क श्रृंखला उजागर की। इस रिलीज़ ने वह घटना शुरू की जिसे डीपसीक बाजार झटका के रूप में जाना जाता है, जिससे एआई बुनियादी ढांचे के शेयरों में बड़ी बिकवाली हुई और अत्याधुनिक स्तर के तर्क मॉडल को प्रशिक्षित करने के लिए आवश्यक कंप्यूट की धारणाओं का व्यापक पुनर्मूल्यांकन हुआ। DeepSeek ने R1 के छोटे आसवित संस्करण भी जारी किए, जिससे तर्क-शैली का व्यवहार उन मॉडलों में उपलब्ध हो गया जो मामूली हार्डवेयर पर चलने के लिए पर्याप्त सस्ते हैं।

परीक्षण-समय कंप्यूट

तर्क मॉडलों का परिभाषित व्यापार-बंद यह है कि वे अतिरिक्त परीक्षण-समय कंप्यूट को परिवर्तित कर सकते हैं, जिसका अर्थ है उत्तर देने के क्षण में प्रशिक्षण के बजाय अधिक गणना खर्च करना, कठिन समस्याओं पर उच्च सटीकता में। यह पारंपरिक स्केलिंग संबंध से भिन्न है जो स्केलिंग-कानून में वर्णित है, जो मॉडल आकार, प्रशिक्षण डेटा और प्रशिक्षण कंप्यूट पर केंद्रित था; तर्क मॉडलों ने एक और अक्ष जोड़ा जिसके साथ बिना किसी नए, बड़े मॉडल को प्रशिक्षित किए क्षमता में सुधार किया जा सकता था। Noam Brown सहित शोधकर्ताओं, जिन्होंने OpenAI के तर्क मॉडल प्रयास में शामिल होने से पहले तर्क और रणनीतिक खेल-खेल प्रणालियों पर काम किया, ने इसे उस तरीके के अनुरूप बताया है जिस तरह एक मानव विशेषज्ञ को सोचने के लिए अधिक समय दिए जाने पर तुरंत प्रतिक्रिया देने के लिए मजबूर किए जाने की तुलना में बेहतर उत्तर मिलते हैं।

मूल्यांकन और सीमाएं

तर्क मॉडल विशेष रूप से वस्तुनिष्ठ रूप से जांचने योग्य उत्तरों वाले कार्यों पर अच्छा प्रदर्शन करते हैं, जिसने उनके मूल्यांकन को ARC-AGI और प्रतियोगिता गणित जैसे बेंचमार्क की ओर प्रेरित किया है, बजाय अधिक व्यक्तिपरक लेखन या संवादी कार्यों के, जहां विस्तारित तर्क का लाभ कम सुसंगत होता है और अतिरिक्त अनुमान समय और लागत को सही ठहराना कठिन होता है। तर्क मॉडल अन्य भाषा मॉडलों के समान मतिभ्रम जोखिम के अधीन भी रहते हैं, क्योंकि लंबा तर्क तथ्यात्मक रूप से सही अंतिम उत्तर की गारंटी नहीं देता है, और कभी-कभी ऐसे तर्क निशान उत्पन्न कर सकते हैं जो कठोर लगते हैं जबकि एक गलत कदम अंतर्निहित होता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·reasoning·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास