llms.txt एक प्रस्तावित परंपरा है जिसके तहत वेबसाइटें /llms.txt पथ पर एक सादा-पाठ या Markdown फ़ाइल प्रकाशित करती हैं, जिसमें क्यूरेटेड लिंक और सारांश सूचीबद्ध होते हैं। इसका उद्देश्य AI प्रणालियों और बड़े भाषा मॉडल को किसी साइट की सामग्री को उसके पूर्ण HTML को क्रॉल और पार्स करने की तुलना में अधिक कुशलता से खोजने और समझने में मदद करना है। इसे सितंबर 2024 में जेरेमी हॉवर्ड द्वारा प्रस्तावित किया गया था, जो fast.ai के सह-संस्थापक हैं, और इसे स्पष्ट रूप से लंबे समय से स्थापित robots.txt और sitemap.xml परंपराओं पर आधारित बनाया गया था, जो पहले से ही स्वचालित क्रॉलर को साइट के बारे में संरचित मार्गदर्शन प्रदान करती हैं।
यह प्रस्ताव एक व्यावहारिक समस्या के जवाब में आया: आधुनिक वेब पेज अक्सर नेविगेशन, JavaScript रेंडरिंग, विज्ञापन और लेआउट मार्कअप से भारी होते हैं, जिससे सीमित संदर्भ-विंडो के भीतर भाषा मॉडल के लिए उन्हें संसाधित करना महंगा या अविश्वसनीय हो जाता है, जबकि प्रमुख पृष्ठों के सीधे लिंक वाला एक क्यूरेटेड Markdown सारांश सस्ते और विश्वसनीय रूप से उपभोग किया जा सकता है।
प्रारूप और अपनाना
एक सामान्य llms.txt फ़ाइल साइट के H1 शीर्षक और संक्षिप्त सारांश के साथ शुरू होती है, उसके बाद शीर्षकों के अंतर्गत समूहीकृत Markdown-स्वरूपित लिंक सूचियाँ होती हैं, जो अक्सर संबंधित llms-full.txt फ़ाइल की ओर इशारा करती हैं जिसमें Markdown में प्रस्तुत पूर्ण पृष्ठ सामग्री होती है। अपनाना पहले डेवलपर-टूल कंपनियों और दस्तावेज़ीकरण साइटों के बीच फैला, जहाँ स्वच्छ, क्रॉल करने योग्य तकनीकी सामग्री पहले से ही प्राथमिकता थी, और फिर 2025 और 2026 के दौरान व्यापक उपभोक्ता और सामग्री प्लेटफार्मों तक विस्तारित हुआ। robots.txt के विपरीत, जो लगभग सभी प्रमुख क्रॉलरों में परंपरा द्वारा लागू होती है, llms.txt के पास कोई समकक्ष सार्वभौमिक समर्थन नहीं है; 2020 के दशक के मध्य तक किसी भी प्रमुख AI प्रयोगशाला ने पुष्टि नहीं की थी कि उसके मॉडल या क्रॉलर व्यवस्थित रूप से इस फ़ाइल को प्राप्त और उपयोग करते हैं, जिसके कारण कुछ टिप्पणीकारों ने अपनाने को काफी हद तक अनुमानात्मक या प्रतीकात्मक बताया।
GEO से संबंध और आलोचना
इस प्रस्ताव पर अक्सर जनरेटिव इंजन अनुकूलन के साथ चर्चा की जाती है, जो सामग्री को AI उत्तर इंजनों द्वारा उद्धृत किए जाने की अधिक संभावना बनाने की प्रथा है, क्योंकि एक अच्छी तरह से बनाए रखा गया llms.txt GEO के लिए एक संभावित लीवर है, भले ही उद्धरण दरों पर इसका वास्तविक प्रभाव अप्रमाणित हो। आलोचकों ने तर्क दिया है कि प्रमुख AI प्रणालियों द्वारा पुष्ट उपभोग के अभाव में, llms.txt एक सिद्ध अनुकूलन तकनीक की तुलना में इरादे के बयान या बचाव के रूप में अधिक कार्य करता है, और यह कि AI एजेंट तेजी से पूर्ण-पृष्ठ ब्राउज़िंग और टूल उपयोग की ओर बढ़ रहे हैं, न कि एक स्थिर क्यूरेटेड सारांश पर निर्भर रहने की ओर। समर्थकों का जवाब है कि आंशिक अपनाना भी उन एजेंटों और पुनर्प्राप्ति पाइपलाइनों के लिए घर्षण कम करता है जो इसका सम्मान करते हैं, और यह कि इस परंपरा को प्रकाशित करने की लागत अपनाने की स्थिति की परवाह किए बिना बहुत कम है।