चेन-ऑफ-थॉट एक प्रॉम्प्टिंग तकनीक है जिसमें एक भाषा मॉडल से पूछा जाता है, या उसे प्रोत्साहित किया जाता है, कि वह अंतिम उत्तर देने से पहले मध्यवर्ती तर्क चरणों का एक क्रम उत्पन्न करे, बजाय सीधे निष्कर्ष पर पहुँचने के। यह तकनीक उन कार्यों पर सटीकता में सुधार करती है जिनके लिए अंकगणित, तर्क, या सामान्य ज्ञान के कई चरणों की आवश्यकता होती है, और 2022 में औपचारिक रूप से वर्णित होने के बाद यह Prompt engineering में सबसे प्रभावशाली विचारों में से एक बन गई।
उत्पत्ति
यह शब्द जनवरी 2022 के एक पेपर, "चेन-ऑफ-थॉट प्रॉम्प्टिंग एलिसिट्स रीजनिंग इन लार्ज लैंग्वेज मॉडल्स," में जेसन वेई और गूगल में सह-लेखकों द्वारा पेश किया गया था। पेपर ने दिखाया कि एक प्रॉम्प्ट में कुछ हल किए गए उदाहरणों को शामिल करना, प्रत्येक में केवल अंतिम उत्तर के बजाय तर्क चरणों को लिखा हुआ, ने गणित के शब्द समस्याओं और अन्य बहु-चरणीय कार्यों पर मॉडल के प्रदर्शन में नाटकीय रूप से सुधार किया, जो स्वयं प्रॉम्प्ट के माध्यम से लागू Few-shot learning का एक रूप है। महत्वपूर्ण रूप से, पेपर ने बताया कि यह लाभ केवल पर्याप्त रूप से बड़े मॉडलों में दिखाई दिया, जिसने चेन-ऑफ-थॉट को Emergent abilities और Scaling laws की चर्चा से निकटता से जोड़ दिया।
ज़ीरो-शॉट चेन-ऑफ-थॉट
बाद में 2022 में, ताकेशी कोजिमा और सह-लेखकों द्वारा एक अलग पेपर ने पाया कि एक बहुत सरल प्रॉम्प्ट, एक प्रश्न में "आइए चरण दर चरण सोचें" वाक्यांश को जोड़ना, बिना किसी हल किए उदाहरण के, कई कार्यों पर तर्क सटीकता में समान सुधार उत्पन्न करता है। यह परिणाम, जिसे ज़ीरो-शॉट चेन-ऑफ-थॉट के रूप में जाना जाता है, ने दिखाया कि लाभ के लिए सख्ती से फ्यू-शॉट उदाहरणों की आवश्यकता नहीं थी; केवल मॉडल को उत्तर देने से पहले तर्क करने का निर्देश देना अक्सर बेहतर प्रदर्शन को अनलॉक करने के लिए पर्याप्त था, जो ज़ीरो-शॉट व्यवहार का एक उदाहरण है जो मॉडल के पास प्रीट्रेनिंग से पहले से मौजूद क्षमताओं पर निर्माण करता है।
तंत्र और आत्म-संगति
शोधकर्ताओं ने कई स्पष्टीकरण पेश किए हैं कि चेन-ऑफ-थॉट क्यों मदद करता है, जिसमें यह शामिल है कि यह मॉडल को उत्तर देने से पहले काम करने के लिए अधिक कम्प्यूटेशनल चरण देता है, कि यह मॉडल को अपने स्वयं के पहले के तर्क को In-context learning के माध्यम से अतिरिक्त संदर्भ के रूप में उपयोग करने देता है, और कि यह एक एकल फॉरवर्ड पास के अंदर एक त्रुटि के चुपचाप बढ़ने की संभावना को कम करता है। आत्म-संगति नामक एक संबंधित तकनीक एक ही प्रश्न के लिए कई स्वतंत्र तर्क श्रृंखलाएँ उत्पन्न करती है और उनमें से सबसे सामान्य अंतिम उत्तर लेती है, जिससे अतिरिक्त गणना की लागत पर सटीकता में और सुधार होता है।
प्रॉम्प्टिंग तकनीक से प्रशिक्षित व्यवहार तक
चेन-ऑफ-थॉट एक प्रॉम्प्टिंग रणनीति के रूप में शुरू हुआ जो उन मॉडलों पर लागू किया गया था जिन्हें विशेष रूप से चरण दर चरण तर्क करने के लिए प्रशिक्षित नहीं किया गया था, लेकिन यह सिस्टम की एक नई श्रेणी के लिए मौलिक बन गया। 2024 में OpenAI o1 से शुरू करके, प्रयोगशालाओं ने मॉडलों को सुदृढीकरण सीखने के साथ विशेष रूप से उत्तर देने से पहले लंबी, प्रभावी तर्क श्रृंखलाएँ उत्पन्न करने के लिए प्रशिक्षित करना शुरू किया, बजाय उपयोगकर्ता पर उस व्यवहार को प्रॉम्प्टिंग के माध्यम से अनुरोध करने पर निर्भर रहने के। इस बदलाव ने तर्क मॉडल की श्रेणी को जन्म दिया, जिसमें DeepSeek-R1 शामिल है, और चेन-ऑफ-थॉट को एक वैकल्पिक प्रॉम्प्टिंग चाल से एक प्रशिक्षित, अक्सर छिपी हुई, आंतरिक प्रक्रिया में पुनः परिभाषित किया, जिसमें एक मॉडल द्वारा किए गए तर्क की मात्रा एक नया लीवर बन गई, जिसे Test-time compute कहा जाता है, जो अतिरिक्त अनुमान समय की लागत पर सटीकता में सुधार करता है।