एक ऑटोरेग्रेसिव मॉडल एक जनरेटिव मॉडल है जो एक अनुक्रम को एक समय में एक तत्व उत्पन्न करता है, जिसमें प्रत्येक नया तत्व उस सब कुछ पर आधारित होता है जो उससे पहले उत्पन्न किया गया है। प्राकृतिक भाषा प्रसंस्करण में, इसका अर्थ है पहले से उत्पन्न टोकनों के अनुक्रम को देखते हुए अगले टोकन की भविष्यवाणी करना, फिर उस टोकन को वापस फीड करके उसके बाद वाले टोकन की भविष्यवाणी करना। यह शब्द सांख्यिकी से उत्पन्न हुआ है, जहाँ ऑटोरेग्रेसिव मॉडल समय श्रृंखला में किसी मान की भविष्यवाणी उसके अपने पिछले मानों से करते हैं; आधुनिक बड़े भाषा मॉडल उसी बाएँ-से-दाएँ गुणनखंडन को पाठ पर लागू करते हैं।
ऑटोरेग्रेसिव जनरेशन अधिकांश आधुनिक चैट सहायकों के पीछे डिफ़ॉल्ट डिकोडिंग रणनीति है जो बड़े भाषा मॉडल पर निर्मित हैं, OpenAI के GPT श्रृंखला से लेकर Anthropic के Claude और Meta के Llama तक। यह अनुक्रम उत्पन्न करने का एकमात्र तरीका नहीं है, लेकिन 2025 तक यह पाठ के लिए प्रमुख प्रतिमान बना हुआ है, और इसके प्रकार ऑडियो, कोड और यहाँ तक कि कुछ छवि मॉडल के लिए भी उपयोग किए जाते हैं।
इतिहास
सांख्यिकीय AR मॉडल 1920 के दशक के समय श्रृंखला पर काम से संबंधित है, जो कंप्यूटिंग के अस्तित्व में आने से बहुत पहले का है। भाषा मॉडलिंग में, 1980 और 1990 के दशक के n-gram मॉडल आत्मा में ऑटोरेग्रेसिव थे, जो पूर्ववर्ती शब्दों की एक निश्चित विंडो से एक शब्द की भविष्यवाणी गिने हुए संभावनाओं का उपयोग करके करते थे। तंत्रिका ऑटोरेग्रेसिव भाषा मॉडल आवर्ती तंत्रिका नेटवर्क और बाद में LSTM नेटवर्क के साथ उभरे, जो एक अनुक्रम को चरण दर चरण संसाधित करते थे और प्रत्येक चरण पर अगले शब्द की भविष्यवाणी करते थे। यह प्रतिमान ट्रांसफॉर्मर वास्तुकला में काफी हद तक अपरिवर्तित रूप से स्थानांतरित हो गया: GPT-2 और इसके उत्तराधिकारी डिकोडर-केवल ट्रांसफॉर्मर हैं जिन्हें अगले टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, एक उद्देश्य जिसे कभी-कभी कारणात्मक भाषा मॉडलिंग कहा जाता है।
यह कैसे काम करता है
प्रशिक्षण के दौरान, एक ऑटोरेग्रेसिव मॉडल को पाठ का एक संग्रह दिखाया जाता है और हर स्थिति पर, सभी पूर्ववर्ती टोकन दिए जाने पर अगले टोकन की भविष्यवाणी करने के लिए कहा जाता है, यह दृष्टिकोण स्व-पर्यवेक्षित शिक्षण के रूप में जाना जाता है क्योंकि लेबल मानव एनोटेशन के बजाय पाठ से ही आते हैं। मॉडल का हानि फलन आमतौर पर भविष्यवाणी किए गए अगले-टोकन वितरण और वास्तविक अगले टोकन के बीच क्रॉस-एन्ट्रॉपी होता है। अनुमान के समय, लालची डिकोडिंग, top-k, या न्यूक्लियस सैंपलिंग जैसी सैंपलिंग रणनीतियाँ निर्धारित करती हैं कि मॉडल के भविष्यवाणी किए गए संभाव्यता वितरण से अगला टोकन कैसे चुना जाता है, और चुना गया टोकन अगली भविष्यवाणी से पहले संदर्भ में जोड़ दिया जाता है, यह प्रक्रिया तब तक दोहराई जाती है जब तक कि अनुक्रम-अंत टोकन या लंबाई सीमा तक नहीं पहुँच जाती।
ऑटोरेग्रेसिव बनाम अन्य दृष्टिकोण
ऑटोरेग्रेसिव मॉडल गैर-ऑटोरेग्रेसिव और प्रसार-आधारित दृष्टिकोणों के विपरीत हैं। प्रसार मॉडल, जो अधिकांश छवि और वीडियो जनरेशन के लिए उपयोग किए जाते हैं, एक बार में पूरा आउटपुट उत्पन्न करते हैं और शोर हटाकर इसे पुनरावृत्त रूप से परिष्कृत करते हैं, बजाय तत्व दर तत्व उत्पन्न करने के। कुछ शोध प्रणालियों ने गति के लिए गैर-ऑटोरेग्रेसिव पाठ जनरेशन का पता लगाया है, और 2020 के दशक के मध्य तक कुछ प्रयोगशालाओं ने प्रसार-आधारित पाठ मॉडल के साथ प्रयोग किया, लेकिन 2025 तक किसी ने भी भाषा के लिए मुख्यधारा के दृष्टिकोण के रूप में ऑटोरेग्रेसिव डिकोडिंग को विस्थापित नहीं किया था। राज्य-स्थान मॉडल जैसे कि Mamba भी अनुक्रमिक रूप से भविष्यवाणी करने के अर्थ में ऑटोरेग्रेसिव हैं, लेकिन ट्रांसफॉर्मर के ध्यान तंत्र को एक अलग कम्प्यूटेशनल संरचना से बदल देते हैं।
सीमाएँ
ऑटोरेग्रेसिव जनरेशन स्वाभाविक रूप से अनुक्रमिक है: प्रत्येक टोकन उससे पहले वाले पर निर्भर करता है, जो प्रशिक्षण की तुलना में अनुमान के समय समानता को सीमित करता है, जहाँ सभी स्थितियों की गणना टीचर फोर्सिंग का उपयोग करके एक साथ की जा सकती है। इस अनुक्रमिक बाधा ने सट्टा डिकोडिंग जैसी तकनीकों को प्रेरित किया, जो कई टोकन प्रस्तावित करने के लिए एक छोटे ड्राफ्ट मॉडल का उपयोग करती है जिसे बड़ा मॉडल समानांतर में सत्यापित करता है। ऑटोरेग्रेसिव मॉडल छोटी त्रुटियों को भी बढ़ा सकते हैं: जनरेशन में शुरुआती एक असंभावित या गलत टोकन बाद के हर टोकन के लिए संदर्भ का हिस्सा बन जाता है, एक गतिशीलता जो मतिभ्रम और बहुत लंबे जनरेशन में घटी हुई आउटपुट गुणवत्ता से जुड़ी है।
प्रभाव
ऑटोरेग्रेसिव, अगले-टोकन-भविष्यवाणी उद्देश्य आधुनिक AI की कहानी के लिए केंद्रीय है: यह सरल है, किसी लेबल किए गए डेटा की आवश्यकता नहीं है, और डेटा और कंप्यूट के साथ पूर्वानुमानित रूप से स्केल करता है, एक संबंध जिसका अध्ययन स्केलिंग कानूनों के तहत किया गया है। इसकी सरलता का एक हिस्सा यह है कि एक ही प्रशिक्षण उद्देश्य अनुवाद, कोडिंग और तर्क करने में सक्षम मॉडल क्यों उत्पन्न कर सकता है, बिना कार्य-विशिष्ट वास्तुकला के, एक सामान्यता जिसे बाद में फाउंडेशन मॉडल के विचार में औपचारिक रूप दिया गया।