Blog›Guides

हमने अपनी पूरी प्रॉम्प्ट कैटलॉग को ओपन क्यों बनाया

विकिपीडिया ने साबित किया कि पूर्ण डंप प्रकाशित करने से एक संग्रह अधिक आवश्यक बन जाता है, कम नहीं। हमने यही तर्क अपने 55,000+ प्रॉम्प्ट कैटलॉग पर लागू किया, और मूल लेखकों को श्रेय देना वह समझौता है जो इसे काम करता है।

हमने अपनी पूरी प्रॉम्प्ट कैटलॉग को ओपन क्यों बनाया

हमने अपनी पूरी प्रॉम्प्ट कैटलॉग को ओपन क्यों बनाया

हर हफ्ते, कोई न कोई wikiprompt.org से प्रॉम्प्ट खींचने के लिए एक स्क्रैपर लिखता है। हम इसे लॉग्स में देख सकते हैं: /category/creative के खिलाफ अनुरोधों का एक बर्स्ट, फिर /category/coding, साइट के हर पेज से गुजरते हुए एक व्यक्ति की तरह जो हजारों बार "next" क्लिक करता है, सिवाय इसके कि यह एक स्क्रिप्ट है और यह कभी बोर नहीं होती। हम इसे एक उपद्रव के रूप में मानते थे जिसे रेट-लिमिट करके दूर किया जा सकता है। फिर हमने खुद से एक बेहतर सवाल पूछा: हम लोगों को ऐसा करने के लिए क्यों मजबूर कर रहे हैं?

जवाब, जब हमने इसे स्वीकार किया, तो वह चापलूसी वाला नहीं था। हम 55,000+ क्यूरेटेड प्रॉम्प्ट्स पर बैठे थे, जो किसी के लिए भी उपयोगी कच्चा माल था जो अध्ययन करना चाहता है कि लोग वास्तव में AI मॉडल्स से कैसे बात करते हैं, और एक समय में एक से अधिक पाने का एकमात्र स्वीकृत तरीका वेबसाइट पर क्लिक करना था जैसे यह 2004 था। यह नहीं है कि ओपन नॉलेज को कैसे काम करना चाहिए, और हम जानते हैं कि ओपन नॉलेज को कैसा दिखना चाहिए, क्योंकि इसका सबसे अच्छा उदाहरण 2001 से मौजूद है।

विकिपीडिया मॉडल, गंभीरता से लिया गया

विकिपीडिया आपको केवल ब्राउज़र में एक-एक करके लेख पढ़ने नहीं देता। यह पूरे एनसाइक्लोपीडिया के फुल डेटाबेस डंप को प्रकाशित करता है, एक शेड्यूल पर, मुफ्त में, बिना किसी अकाउंट की आवश्यकता के। कोई भी पूरी चीज़ डाउनलोड कर सकता है और उसके साथ कुछ कर सकता है: एक सर्च इंजन बनाएं, एक मॉडल ट्रेन करें, बिना इंटरनेट वाली जगह पर ऑफलाइन मिरर चलाएं, या सिर्फ अध्ययन करें कि दस साल के संपादनों में एक लेख कैसे बदला। विकिपीडिया ने यह अनिच्छा से नहीं किया। उसने इसे इसलिए किया क्योंकि डंप *ही* मिशन है। एक एनसाइक्लोपीडिया जो केवल स्क्रैपिंग-प्रतिरोधी फ्रंटएंड के पीछे मौजूद है, वह वास्तव में ओपन नहीं है, चाहे पेज के नीचे कोई भी लाइसेंस छपा हो।

साइड इफेक्ट जो कोई प्लान नहीं करता लेकिन हर कोई लाभ उठाता है: क्योंकि डंप मौजूद है, किसी को भी विकिपीडिया की सामग्री को बड़े पैमाने पर पाने के लिए स्क्रैप करने की जरूरत नहीं है। स्क्रैपिंग ट्रैफिक जो अन्यथा लाइव साइट को हिट करता, एक स्टैटिक फाइल द्वारा अवशोषित हो जाता है, और विकिपीडिया को हर जगह एक मामले के रूप में उद्धृत किया जाता है, क्योंकि इसे उद्धृत करना न उद्धृत करने से आसान है। ओपननेस ने विकिपीडिया की स्थिति को कैनोनिकल स्रोत के रूप में कमजोर नहीं किया। इसने इसे मजबूत किया।

हमें लगता है कि प्रॉम्प्ट्स को भी उसी उपचार की जरूरत है, उसी कारण से। एक अच्छा प्रॉम्प्ट वास्तव में "कंटेंट" नहीं है जैसे एक ब्लॉग पोस्ट कंटेंट है। यह एक तकनीक है, लागू क्राफ्ट का एक छोटा टुकड़ा, आमतौर पर ट्रायल और एरर द्वारा बनाया गया और साझा किया गया क्योंकि कोई चाहता था कि दूसरे उससे लाभ उठाएं जो उन्होंने समझा। यह एक विकिपीडिया लेख के बहुत करीब है, एक मालिकाना IP के टुकड़े से। एक प्रागैतिहासिक प्राणी संप्रभु चित्र या एक वास्तुशिल्प सीढ़ी पर मंचित संपादकीय चित्र किसी की खोज है कि एक इमेज मॉडल से कैसे बात करें, लिखा गया ताकि अगला व्यक्ति इसे शुरू से फिर से खोजना न पड़े। इसे एक दीवार वाले बगीचे, एक लॉगिन दीवार, या "संपर्क करें API एक्सेस के लिए" फॉर्म के पीछे बंद करना उस चीज़ के विपरीत है जिसके लिए सामग्री है।

सामूहिक ज्ञान एक समय में एक अनुरोध के साथ स्केल नहीं होता

एक विशिष्ट विफलता मोड था जिसे हम टालना चाहते थे: प्रॉम्प्ट मार्केटप्लेस जहां वास्तविक प्रॉम्प्ट टेक्स्ट तब तक छिपा रहता है जब तक आप भुगतान नहीं करते, या समुदाय जहां अच्छी चीज़ें एक Discord सर्वर में रहती हैं जिसे समूह के बाहर कोई खोज नहीं सकता। वे मॉडल एकल लेनदेन के बिंदु पर मूल्य कैप्चर करने के लिए अनुकूलित होते हैं। हमें लगता है कि वे बड़ा पुरस्कार खो देते हैं, जो कि वह जगह बनना है जहां लोग डिफ़ॉल्ट रूप से जाते हैं जब वे जानना चाहते हैं कि एक अच्छा प्रॉम्प्ट कैसे बनाया जाता है, जैसे विकिपीडिया वह जगह बन गया जहां आप डिफ़ॉल्ट रूप से एक तथ्य के लिए जाते हैं। आप वह संदर्भ बिंदु नहीं बन सकते यदि आपकी सामग्री को बड़े पैमाने पर अध्ययन नहीं किया जा सकता, ठीक से इंडेक्स नहीं किया जा सकता, या उस पर निर्माण नहीं किया जा सकता।

इसलिए डेटासेट उस तरह काम करता है जैसे एक डंप को काम करना चाहिए: कोई API की नहीं, कोई रेट-लिमिट टियर नहीं जिस पर बातचीत करनी पड़े, CORS पूरी तरह खुला, और एज पर इतना कैश्ड कि भारी उपयोग हमें नींद नहीं खोता। https://www.wikiprompt.org/dataset हिट करें और आपको total_prompts और पेजिनेशन स्कीम के साथ एक मैनिफेस्ट मिलता है। `/dataset/prompts` हिट करें और आपको कैटलॉग खुद JSON के रूप में मिलता है, एक कीसेट कर्सर के साथ पेजिनेटेड, प्रति पेज 500 रिकॉर्ड तक:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

प्रत्येक प्रतिक्रिया के next URL का पालन करें जब तक यह null न लौटे और आपने पूरी कैटलॉग चल ली है। हर रिकॉर्ड में slug, url, title, description, content (प्रॉम्प्ट टेक्स्ट खुद), category, tags, media, model, संरचित metadata, author, original_source, और टाइमस्टैम्प होते हैं, क्रिएटिव और कोडिंग से लेकर मार्केटिंग, रिसर्च और शिक्षा तक की श्रेणियों में। यदि आप बल्क-डाउनलोड के बजाय क्वेरी करना पसंद करते हैं, तो एक सर्च API और एक MCP सर्वर भी है उन एजेंट्स के लिए जो लाइव कैटलॉग में पहुंचना चाहते हैं बजाय एक स्टैटिक कॉपी खींचने के।

ओपननेस अनामता के समान नहीं है

यहां वह हिस्सा है जो तकनीकी एक्सेस जितना ही महत्वपूर्ण है: इनमें से कोई भी हमारा नहीं है कि हम क्रेडिट छीन लें। कैटलॉग में हर प्रॉम्प्ट एक वास्तविक व्यक्ति से जुड़ा है जिसने इसे सार्वजनिक रूप से पोस्ट किया, चाहे वह एक बारिश में पराजित सफेद सांप आत्मा हो जो Twitter पर साझा किया गया या एक तकनीक जो एक subreddit थ्रेड में डाली गई। original_source एक सजावटी फील्ड नहीं है। यह सौदे का दूसरा आधा है। हम एक औपचारिक लाइसेंस का दावा नहीं कर रहे जो हमारे पास नहीं है, और हम यह दिखावा नहीं कर रहे कि प्रॉम्प्ट्स हमारे हैं ताकि हम उन्हें जैसे चाहें रिलाइसेंस कर सकें। हम स्पष्ट रूप से पूछ रहे हैं कि यदि आप इस डेटासेट के साथ कुछ बनाते हैं, तो आप wikiprompt.org को एग्रीगेटर के रूप में और मूल लेखक को स्रोत के रूप में श्रेय दें। यह वही सौदा है जो विकिपीडिया हर उस व्यक्ति के साथ करता है जो एक लेख का पुन: उपयोग करता है: ज्ञान लें, क्रेडिट जुड़ा रखें।

विकिपीडिया के डंप ने विकिपीडिया को कम आवश्यक नहीं बनाया। उन्होंने इसे इंफ्रास्ट्रक्चर बना दिया। हम चाहेंगे कि wikiprompt.org वह उबाऊ, विश्वसनीय जगह हो जहां हर किसी के पास पहले से एक कॉपी हो, बजाय उस साइट के जिसे लोग चुपचाप एक स्क्रैपर के आसपास रूट करते हैं। ओपननेस यहां कभी जोखिम नहीं थी। दीवार वाला बगीचा था।

Tags
open-data·dataset·manifesto·wikipedia·attribution·ai-prompts·open-knowledge