एक तर्क मॉडल एक बड़ा भाषा मॉडल है जिसे आम तौर पर सुदृढ़ीकरण सीखने के साथ प्रशिक्षित किया जाता है, ताकि अंतिम उत्तर देने से पहले तर्क के विस्तारित आंतरिक अनुक्रम उत्पन्न किए जा सकें, बजाय पिछली पीढ़ी के मॉडलों की तरह तुरंत उत्तर देने के। यह श्रेणी सामान्य चेन-ऑफ-थॉट प्रॉम्प्टिंग से अलग है, जो पारंपरिक रूप से प्रशिक्षित मॉडल को प्रॉम्प्ट में निर्देशों के माध्यम से चरण-दर-चरण तर्क करने के लिए कहती है, क्योंकि एक तर्क मॉडल विशेष रूप से अपनी स्वयं की तर्क प्रक्रिया उत्पन्न करने और सुधारने के लिए प्रशिक्षित होता है, और अक्सर एक प्रॉम्प्ट किए गए मॉडल की तुलना में कहीं अधिक मध्यवर्ती पाठ उत्पन्न करता है।
उत्पत्ति
OpenAI ने सितंबर 2024 में पहला व्यापक रूप से ज्ञात तर्क मॉडल, OpenAI o1, पेश किया, और इसे सत्यापन योग्य उत्तरों वाली समस्याओं, जैसे गणित और प्रोग्रामिंग, पर सुदृढ़ीकरण सीखने का उपयोग करके प्रतिक्रिया देने से पहले "सोचने" के लिए प्रशिक्षित बताया, जहां सही अंतिम उत्तर स्वचालित रूप से जांचा जा सकता है। OpenAI ने o1 की आंतरिक तर्क श्रृंखला को उपयोगकर्ताओं से काफी हद तक छिपाकर रखा, केवल एक सारांशित संस्करण दिखाया, यह निर्णय कंपनी ने कहा कि मॉडल की स्वतंत्र रूप से तर्क करने की क्षमता को संरक्षित करने के लिए था, जिसमें गलत रास्तों की खोज भी शामिल है, बिना उस अपरिष्कृत तर्क को अंतिम, समर्थित उत्तर के रूप में लिए जाने के। इस दृष्टिकोण ने बहु-चरणीय तर्क की आवश्यकता वाले बेंचमार्क पर महत्वपूर्ण सटीकता लाभ उत्पन्न किया, जिसमें प्रतियोगिता गणित और कोडिंग कार्य जैसे SWE-bench शामिल हैं।
DeepSeek-R1 और खुले तर्क मॉडल
जनवरी 2025 में, चीनी प्रयोगशाला DeepSeek ने DeepSeek-R1 जारी किया, एक खुले-भार वाला तर्क मॉडल जो बड़े पैमाने पर सुदृढ़ीकरण सीखने के साथ प्रशिक्षित था, जो कई बेंचमार्क पर OpenAI के तर्क मॉडलों के प्रदर्शन से मेल खाता था या उसके करीब पहुंच गया, और बताई गई प्रशिक्षण लागत के एक अंश पर, और o1 के विपरीत, उपयोगकर्ताओं को अपनी पूरी तर्क श्रृंखला उजागर की। इस रिलीज़ ने वह घटना शुरू की जिसे डीपसीक बाजार झटका के रूप में जाना जाता है, जिससे एआई बुनियादी ढांचे के शेयरों में बड़ी बिकवाली हुई और अत्याधुनिक स्तर के तर्क मॉडल को प्रशिक्षित करने के लिए आवश्यक कंप्यूट की धारणाओं का व्यापक पुनर्मूल्यांकन हुआ। DeepSeek ने R1 के छोटे आसवित संस्करण भी जारी किए, जिससे तर्क-शैली का व्यवहार उन मॉडलों में उपलब्ध हो गया जो मामूली हार्डवेयर पर चलने के लिए पर्याप्त सस्ते हैं।
परीक्षण-समय कंप्यूट
तर्क मॉडलों का परिभाषित व्यापार-बंद यह है कि वे अतिरिक्त परीक्षण-समय कंप्यूट को परिवर्तित कर सकते हैं, जिसका अर्थ है उत्तर देने के क्षण में प्रशिक्षण के बजाय अधिक गणना खर्च करना, कठिन समस्याओं पर उच्च सटीकता में। यह पारंपरिक स्केलिंग संबंध से भिन्न है जो स्केलिंग-कानून में वर्णित है, जो मॉडल आकार, प्रशिक्षण डेटा और प्रशिक्षण कंप्यूट पर केंद्रित था; तर्क मॉडलों ने एक और अक्ष जोड़ा जिसके साथ बिना किसी नए, बड़े मॉडल को प्रशिक्षित किए क्षमता में सुधार किया जा सकता था। Noam Brown सहित शोधकर्ताओं, जिन्होंने OpenAI के तर्क मॉडल प्रयास में शामिल होने से पहले तर्क और रणनीतिक खेल-खेल प्रणालियों पर काम किया, ने इसे उस तरीके के अनुरूप बताया है जिस तरह एक मानव विशेषज्ञ को सोचने के लिए अधिक समय दिए जाने पर तुरंत प्रतिक्रिया देने के लिए मजबूर किए जाने की तुलना में बेहतर उत्तर मिलते हैं।
मूल्यांकन और सीमाएं
तर्क मॉडल विशेष रूप से वस्तुनिष्ठ रूप से जांचने योग्य उत्तरों वाले कार्यों पर अच्छा प्रदर्शन करते हैं, जिसने उनके मूल्यांकन को ARC-AGI और प्रतियोगिता गणित जैसे बेंचमार्क की ओर प्रेरित किया है, बजाय अधिक व्यक्तिपरक लेखन या संवादी कार्यों के, जहां विस्तारित तर्क का लाभ कम सुसंगत होता है और अतिरिक्त अनुमान समय और लागत को सही ठहराना कठिन होता है। तर्क मॉडल अन्य भाषा मॉडलों के समान मतिभ्रम जोखिम के अधीन भी रहते हैं, क्योंकि लंबा तर्क तथ्यात्मक रूप से सही अंतिम उत्तर की गारंटी नहीं देता है, और कभी-कभी ऐसे तर्क निशान उत्पन्न कर सकते हैं जो कठोर लगते हैं जबकि एक गलत कदम अंतर्निहित होता है।