संदर्भ विंडो पाठ की वह अधिकतम मात्रा है, जिसे टोकन में मापा जाता है, जिसे एक भाषा मॉडल एक साथ ध्यान में रख सकता है, जिसमें उपयोगकर्ता द्वारा दिया गया प्रॉम्प्ट, कोई सिस्टम निर्देश, पुनर्प्राप्त दस्तावेज़, और मॉडल का अपना अब तक का आउटपुट शामिल होता है। यह मॉडल की कार्यशील स्मृति के रूप में कार्य करता है: संदर्भ विंडो के बाहर की जानकारी उत्पादन के समय मॉडल के लिए अदृश्य होती है, जब तक कि इसे स्पष्ट रूप से पुनः आपूर्ति न की जाए।
तकनीकी आधार
संदर्भ विंडो का आकार ध्यान तंत्र द्वारा सीमित होता है, जो Transformer (architecture) वास्तुकला के मूल में है, जो इनपुट में टोकन के प्रत्येक जोड़े के बीच संबंधों की गणना करता है। क्योंकि यह गणना मानक सूत्रीकरण में अनुक्रम लंबाई के साथ द्विघात रूप से बढ़ती है, संदर्भ विंडो को दोगुना करने से इसे संसाधित करने के लिए आवश्यक कंप्यूट और मेमोरी लगभग चार गुना बढ़ जाती है, जिसने ऐतिहासिक रूप से लंबी संदर्भ विंडो को सेवा देना महंगा बना दिया। बाद की इंजीनियरिंग तकनीकों, जिनमें विरल और विंडोड ध्यान विविधताएं, कुंजी-मूल्य कैश संपीड़न, और विशेष मेमोरी प्रबंधन शामिल हैं, ने इस लागत को इतना कम कर दिया कि बहुत बड़ी विंडो व्यावसायिक रूप से व्यावहारिक हो गईं।
समय के साथ वृद्धि
प्रारंभिक ट्रांसफॉर्मर-आधारित भाषा मॉडल केवल कुछ सौ से लेकर कुछ हज़ार टोकन का समर्थन करते थे; GPT-3, जिसे 2020 में OpenAI द्वारा जारी किया गया था, लगभग 2,048 टोकन का समर्थन करता था। संदर्भ विंडो अगले वर्षों में लगातार बढ़ती रही: GPT-4 2023 में 32,000 टोकन तक का समर्थन करने वाले संस्करणों के साथ लॉन्च हुआ, और 2024 तक कई प्रयोगशालाओं ने सैकड़ों हजारों टोकन की संदर्भ विंडो की पेशकश की। Gemini, Google DeepMind से, एक लाख टोकन या उससे अधिक की संदर्भ विंडो का समर्थन करने के लिए उल्लेखनीय बन गया, जो एक पूरे उपन्यास, एक बड़े कोडबेस, या घंटों के वीडियो ट्रांसक्रिप्ट को एक ही प्रॉम्प्ट में संसाधित करने के लिए पर्याप्त है। Anthropic के Claude (AI model family) मॉडल ने भी प्रारंभिक 9,000-टोकन विंडो से बाद के रिलीज़ में सैकड़ों हजारों टोकन की संदर्भ लंबाई तक विस्तार किया।
व्यापार-नाप और लंबे-संदर्भ सीमाएं
एक बड़ी संदर्भ विंडो यह गारंटी नहीं देती कि मॉडल इसका अच्छी तरह से उपयोग करता है। लंबे-संदर्भ प्रदर्शन पर शोध ने बार-बार एक "बीच में खोया" प्रभाव पाया है, जिसमें मॉडल लंबे संदर्भ की शुरुआत या अंत के पास रखी जानकारी को पुनः प्राप्त करने में अधिक सटीक होते हैं, बीच में दबी जानकारी की तुलना में, भले ही वास्तुकला में कुछ भी औपचारिक रूप से उन पदों का पक्ष न लेता हो। लंबे-संदर्भ "सुई इन अ हेस्टैक" परीक्षण, जिसमें एक विशिष्ट तथ्य अप्रासंगिक पाठ की एक बड़ी मात्रा के भीतर छिपा होता है, यह मापने का एक मानक तरीका बन गया कि क्या मॉडल का प्रभावी संदर्भ उसके विज्ञापित अधिकतम से मेल खाता है। बहुत लंबे संदर्भों की सेवा करना भी कम्प्यूटेशनल रूप से महंगा है, इसलिए सिस्टम अक्सर संदर्भ विंडो में बड़ी मात्रा में कच्चा पाठ भरने और केवल सबसे प्रासंगिक अंशों का चयन करने के लिए Retrieval-augmented generation का उपयोग करने के बीच एक व्यावहारिक विकल्प का सामना करते हैं, पूर्णता को लागत और, सिद्धांत रूप में, सटीकता के लिए व्यापार करते हुए।
तर्क से संबंध
संदर्भ विंडो Chain-of-thought प्रॉम्प्टिंग और तर्क मॉडल जैसी तकनीकों को भी सीमित करती है, जो अंतिम उत्तर देने से पहले पर्याप्त मध्यवर्ती पाठ उत्पन्न करते हैं; एक मॉडल जो लंबाई में तर्क करता है, वह उस तर्क के साथ अपनी संदर्भ विंडो का एक हिस्सा खपत करता है, यही एक कारण है कि लंबी संदर्भ विंडो अधिक महत्वपूर्ण हो गईं क्योंकि वे तकनीकें व्यापक हो गईं।