Blog›Guides

विकिप्रॉम्प्ट डेटासेट पर AI ऐप बनाना

एक डेवलपर वॉकथ्रू जो Wikiprompt के सार्वजनिक 55,000+ प्रॉम्प्ट डेटासेट के ऊपर प्रॉम्प्ट-सर्च UI, प्रॉम्प्ट-ऑफ़-द-डे बॉट, ब्राउज़र एक्सटेंशन या Discord बॉट बनाने के लिए है, जिसमें इन्जेस्ट कोड और एट्रिब्यूशन नोट्स शामिल हैं।

विकिप्रॉम्प्ट डेटासेट पर AI ऐप बनाना

विकिप्रॉम्प्ट डेटासेट पर AI ऐप बनाना

हर इंडी हैकर जिसने "प्रॉम्प्ट लाइब्रेरी" ऐप बनाने की कोशिश की है, उसे पहले ही दिन एक ही दीवार का सामना करना पड़ता है: आपको सीड कंटेंट चाहिए, और स्क्रैपिंग धीमी, नाजुक और जिस सर्वर को आप हिट कर रहे हैं उसके प्रति अशिष्ट है। विकिप्रॉम्प्ट ने अभी-अभी वह दीवार हटा दी है। पूरा कैटलॉग, ChatGPT, Claude, Gemini, Midjourney, GPT Image, Veo, Kling, Seedance, Nano Banana, Grok और अधिक में फैले 55,000 से अधिक प्रॉम्प्ट, अब एक सार्वजनिक बल्क डेटासेट के रूप में उपलब्ध है। कोई की नहीं, कोई रेट-लिमिट डांस नहीं, कोई स्क्रैपिंग नहीं। बस JSON।

यह पोस्ट एक बिल्ड लॉग है, प्रेस रिलीज़ नहीं। चार छोटे ऐप जिन्हें आप इस सप्ताहांत शिप कर सकते हैं, और वहां पहुंचने के लिए सटीक प्लंबिंग।

आप वास्तव में किसके साथ काम कर रहे हैं

पहले मेनिफेस्ट को हिट करें:

curl "https://www.wikiprompt.org/dataset"

यह total_prompts, record_fields लौटाता है जिसकी आप हर पंक्ति पर उम्मीद कर सकते हैं, और पेजिनेशन स्कीम। असली डेटा /dataset/prompts पर रहता है, जो कीसेट कर्सर के साथ पेजिनेटेड है: हर पेज आपको एक next URL देता है, आप उसका अनुसरण करते हैं जब तक next null नहीं लौटता। प्रति पेज 500 रिकॉर्ड तक।

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

हर रिकॉर्ड एक छोटा, उपयोगी ऑब्जेक्ट है: slug, url, title, description, content (वास्तविक प्रॉम्प्ट टेक्स्ट जिसे आप मॉडल में पेस्ट करेंगे), category, tags, media (छवि/वीडियो URL जब प्रॉम्प्ट ने एक उत्पन्न किया), model (जिसके लिए यह बनाया गया था या जिस पर चलाया गया था), metadata (संरचित फ़ील्ड जैसे मीडिया प्रकार, पहलू अनुपात, शैली, और गुणवत्ता मूल्यांकन), author, original_source (मूल ट्वीट या पोस्ट जिससे यह आया), और टाइमस्टैम्प। यह एक भी अतिरिक्त API कॉल के बिना एक वास्तविक UI बनाने के लिए पर्याप्त है।

यहाँ पायथन में पूरा इनजेस्ट लूप है, शायद स्थानीय SQLite कैश के लिए 15 लाइनें:

import requests, sqlite3

db = sqlite3.connect("wikiprompt.db")

db.execute("""create table if not exists prompts(

slug text primary key, title text, description text,

content text, category text, model text, url text)""")

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

while url:

data = requests.get(url).json()

for p in data["records"]:

db.execute(

"insert or replace into prompts values (?,?,?,?,?,?,?)",

(p["slug"], p["title"], p["description"],

p["content"], p["category"], p.get("model"), p["url"]),

)

db.commit()

url = data.get("next")

इसे एक बार चलाएं, और आपके पास पूरे कैटलॉग की एक स्थानीय, क्वेरी करने योग्य प्रति होगी। CORS पूरी तरह से खुला है (Access-Control-Allow-Origin: *) और प्रतिक्रियाएं एज-कैश्ड हैं, इसलिए यह ब्राउज़र से भी चलाने के लिए अनुकूल है, सिर्फ बैकएंड जॉब से नहीं।

चार चीजें जो बनाने लायक हैं

एक प्रॉम्प्ट-सर्च UI। डेटासेट आपको category, tags, model और metadata मुफ्त में देता है, जिसका मतलब है कि फेसेटेड सर्च मूल रूप से एक SQL WHERE क्लॉज दूर है: "Midjourney प्रॉम्प्ट टैग किए गए पोर्ट्रेट" या "Claude के लिए कोडिंग प्रॉम्प्ट" एक फिल्टर में हल हो जाते हैं, एक शोध परियोजना में नहीं। यदि आप इंडेक्स खुद नहीं बनाना चाहते हैं, तो wikiprompt पहले से ही एक चलाता है: सर्च API ?q= लेता है और रैंक किया हुआ JSON लौटाता है, जो आपके द्वारा रिट्रीवल कोड की एक भी लाइन लिखने से पहले सर्च बॉक्स का प्रोटोटाइप बनाने के लिए काफी अच्छा है।

एक "दिन का प्रॉम्प्ट" बॉट। क्रॉन जॉब, अपने स्थानीय कैश से एक रैंडम पंक्ति चुनें (या थीम वाले फीड के लिए category=creative द्वारा फिल्टर करें), title + content + url को मूल स्रोत पर पोस्ट करें। media फ़ील्ड का मतलब है कि आप वास्तविक आउटपुट छवि या वीडियो को पोस्ट से जोड़ सकते हैं, सिर्फ टेक्स्ट नहीं। यह शायद 40 लाइनों का कोड है और स्लैक बॉट, टेलीग्राम बॉट, या एक क्रॉन के रूप में समान रूप से अच्छा काम करता है जो X पर पोस्ट करता है।

एक ब्राउज़र एक्सटेंशन। किसी भी टेक्स्ट फ़ील्ड पर राइट-क्लिक करें, "एक प्रॉम्प्ट डालें," अपने स्थानीय कैश को श्रेणी या मॉडल द्वारा खोजें, content पेस्ट करें। चूंकि प्रारंभिक सिंक के बाद डेटा स्थानीय है, यह ऑफ़लाइन और तुरंत काम करता है, हर कीस्ट्रोक पर कोई नेटवर्क राउंड-ट्रिप नहीं।

एक Discord बॉट। /prompt image midjourney स्लैश कमांड, अपने कैश को category और model द्वारा फिल्टर करें, title, content, और मीडिया को एम्बेड के रूप में उत्तर दें। यदि कोई मूल देखना चाहता है, तो फुटर में original_source लिंक करें, उसी संदेश में एट्रिब्यूशन कवर हो जाता है।

मेटाडेटा फ़ील्ड का वास्तविक उपयोग

metadata वह जगह है जहां मीडिया से संबंधित किसी भी चीज़ के लिए दिलचस्प सामान रहता है: पहलू अनुपात, शैली टैग, एक गुणवत्ता मूल्यांकन। यदि आप कुछ ऐसा बना रहे हैं जो प्रॉम्प्ट को रैंक या अनुशंसा करता है (सिर्फ सूचीबद्ध करने के बजाय), यह आपका संकेत है। एक "पोर्ट्रेट के लिए सर्वश्रेष्ठ Midjourney प्रॉम्प्ट, 3:4 पहलू अनुपात, उच्च गुणवत्ता स्कोर" फिल्टर फ़ील्ड को इनजेस्ट करने के बाद कुछ अतिरिक्त WHERE क्लॉज हैं, कोई अलग स्कोरिंग पाइपलाइन आवश्यक नहीं है।

एक अच्छे प्रॉम्प्ट रिकॉर्ड का स्वाद लेने के लिए, कुछ लाइव पेज ब्राउज़ करें: एक डेटा फिजिकलाइज़ेशन इमेज प्रॉम्प्ट, एक भविष्यवादी अरचनिड चरित्र परिवर्तन, और एक रहस्यमय खानाबदोश यात्री चरित्र डिज़ाइन। उनमें से प्रत्येक डेटासेट में भी एक पूर्ण रिकॉर्ड है, समान फ़ील्ड, समान content जिसे आप मॉडल में कॉपी करेंगे।

एट्रिब्यूशन वैकल्पिक नहीं है, और यह कठिन भी नहीं है

विकिप्रॉम्प्ट अपने मूल लेखकों द्वारा सार्वजनिक पोस्ट से प्रॉम्प्ट एकत्र करता है; यह लाइसेंस-धारक नहीं है, यह लाइब्रेरियन है। यदि आपका ऐप एक प्रॉम्प्ट सतह पर लाता है, तो उसके साथ original_source दिखाएं और wikiprompt.org को क्रेडिट करें जहां से आपको कैटलॉग मिला। यही सौदा है, और डेटासेट इसे सम्मानित करना आसान बनाता है क्योंकि original_source पहले से ही हर रिकॉर्ड में मौजूद है। इसे इनजेस्ट के दौरान न हटाएं सिर्फ इसलिए कि आपके स्कीमा में अभी तक इसके लिए एक कॉलम नहीं है।

यदि आप अपना खुद का इंडेक्स नहीं चलाना चाहते हैं

तीन विकल्प मौजूद हैं जो इस बात पर निर्भर करते हैं कि आप कितना इंफ्रास्ट्रक्चर खुद रखना चाहते हैं। पूर्ण नियंत्रण के लिए बल्क डेटासेट को अपनी खुद की सर्च/अनुशंसा परत के माध्यम से चलाएं। सर्च API को सीधे कॉल करें यदि आपको सिर्फ परिणाम चाहिए, पाइपलाइन नहीं। या, यदि आप एक ऐप के बजाय एक एजेंट बना रहे हैं, तो इसे MCP सर्वर पर इंगित करें, जो सर्च, श्रेणियां, और व्यक्तिगत प्रॉम्प्ट को टूल के रूप में उजागर करता है जिसे Claude और अन्य एजेंट मूल रूप से कॉल कर सकते हैं। llms.txt भी है यदि आप चाहते हैं कि एक मॉडल एक ही फेच में पूरी सतह क्षेत्र को समझे।

यहां से शुरू करें

curl "https://www.wikiprompt.org/dataset/prompts?limit=500" | head -c 2000

देखें कि क्या लौटता है, ऊपर दिए गए चार विचारों में से एक चुनें, और कॉफी ठंडी होने से पहले आपके पास कुछ काम करने वाला होगा। कठिन हिस्सा, एक दर्जन मॉडलों में 55,000+ क्यूरेटेड प्रॉम्प्ट, पहले से ही हो चुका है। आप इसके साथ क्या बनाते हैं यह मजेदार हिस्सा है।

Tags
open-data·dataset·api·developers·tutorial·discord-bot·ai-prompts