विकिप्रॉम्प्ट डेटासेट पर AI ऐप बनाना
एक डेवलपर वॉकथ्रू जो Wikiprompt के सार्वजनिक 55,000+ प्रॉम्प्ट डेटासेट के ऊपर प्रॉम्प्ट-सर्च UI, प्रॉम्प्ट-ऑफ़-द-डे बॉट, ब्राउज़र एक्सटेंशन या Discord बॉट बनाने के लिए है, जिसमें इन्जेस्ट कोड और एट्रिब्यूशन नोट्स शामिल हैं।

विकिप्रॉम्प्ट डेटासेट पर AI ऐप बनाना
हर इंडी हैकर जिसने "प्रॉम्प्ट लाइब्रेरी" ऐप बनाने की कोशिश की है, उसे पहले ही दिन एक ही दीवार का सामना करना पड़ता है: आपको सीड कंटेंट चाहिए, और स्क्रैपिंग धीमी, नाजुक और जिस सर्वर को आप हिट कर रहे हैं उसके प्रति अशिष्ट है। विकिप्रॉम्प्ट ने अभी-अभी वह दीवार हटा दी है। पूरा कैटलॉग, ChatGPT, Claude, Gemini, Midjourney, GPT Image, Veo, Kling, Seedance, Nano Banana, Grok और अधिक में फैले 55,000 से अधिक प्रॉम्प्ट, अब एक सार्वजनिक बल्क डेटासेट के रूप में उपलब्ध है। कोई की नहीं, कोई रेट-लिमिट डांस नहीं, कोई स्क्रैपिंग नहीं। बस JSON।
यह पोस्ट एक बिल्ड लॉग है, प्रेस रिलीज़ नहीं। चार छोटे ऐप जिन्हें आप इस सप्ताहांत शिप कर सकते हैं, और वहां पहुंचने के लिए सटीक प्लंबिंग।
आप वास्तव में किसके साथ काम कर रहे हैं
पहले मेनिफेस्ट को हिट करें:
curl "https://www.wikiprompt.org/dataset"
यह total_prompts, record_fields लौटाता है जिसकी आप हर पंक्ति पर उम्मीद कर सकते हैं, और पेजिनेशन स्कीम। असली डेटा /dataset/prompts पर रहता है, जो कीसेट कर्सर के साथ पेजिनेटेड है: हर पेज आपको एक next URL देता है, आप उसका अनुसरण करते हैं जब तक next null नहीं लौटता। प्रति पेज 500 रिकॉर्ड तक।
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
हर रिकॉर्ड एक छोटा, उपयोगी ऑब्जेक्ट है: slug, url, title, description, content (वास्तविक प्रॉम्प्ट टेक्स्ट जिसे आप मॉडल में पेस्ट करेंगे), category, tags, media (छवि/वीडियो URL जब प्रॉम्प्ट ने एक उत्पन्न किया), model (जिसके लिए यह बनाया गया था या जिस पर चलाया गया था), metadata (संरचित फ़ील्ड जैसे मीडिया प्रकार, पहलू अनुपात, शैली, और गुणवत्ता मूल्यांकन), author, original_source (मूल ट्वीट या पोस्ट जिससे यह आया), और टाइमस्टैम्प। यह एक भी अतिरिक्त API कॉल के बिना एक वास्तविक UI बनाने के लिए पर्याप्त है।
यहाँ पायथन में पूरा इनजेस्ट लूप है, शायद स्थानीय SQLite कैश के लिए 15 लाइनें:
import requests, sqlite3
db = sqlite3.connect("wikiprompt.db")
db.execute("""create table if not exists prompts(
slug text primary key, title text, description text,
content text, category text, model text, url text)""")
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
while url:
data = requests.get(url).json()
for p in data["records"]:
db.execute(
"insert or replace into prompts values (?,?,?,?,?,?,?)",
(p["slug"], p["title"], p["description"],
p["content"], p["category"], p.get("model"), p["url"]),
)
db.commit()
url = data.get("next")
इसे एक बार चलाएं, और आपके पास पूरे कैटलॉग की एक स्थानीय, क्वेरी करने योग्य प्रति होगी। CORS पूरी तरह से खुला है (Access-Control-Allow-Origin: *) और प्रतिक्रियाएं एज-कैश्ड हैं, इसलिए यह ब्राउज़र से भी चलाने के लिए अनुकूल है, सिर्फ बैकएंड जॉब से नहीं।
चार चीजें जो बनाने लायक हैं
एक प्रॉम्प्ट-सर्च UI। डेटासेट आपको category, tags, model और metadata मुफ्त में देता है, जिसका मतलब है कि फेसेटेड सर्च मूल रूप से एक SQL WHERE क्लॉज दूर है: "Midjourney प्रॉम्प्ट टैग किए गए पोर्ट्रेट" या "Claude के लिए कोडिंग प्रॉम्प्ट" एक फिल्टर में हल हो जाते हैं, एक शोध परियोजना में नहीं। यदि आप इंडेक्स खुद नहीं बनाना चाहते हैं, तो wikiprompt पहले से ही एक चलाता है: सर्च API ?q= लेता है और रैंक किया हुआ JSON लौटाता है, जो आपके द्वारा रिट्रीवल कोड की एक भी लाइन लिखने से पहले सर्च बॉक्स का प्रोटोटाइप बनाने के लिए काफी अच्छा है।
एक "दिन का प्रॉम्प्ट" बॉट। क्रॉन जॉब, अपने स्थानीय कैश से एक रैंडम पंक्ति चुनें (या थीम वाले फीड के लिए category=creative द्वारा फिल्टर करें), title + content + url को मूल स्रोत पर पोस्ट करें। media फ़ील्ड का मतलब है कि आप वास्तविक आउटपुट छवि या वीडियो को पोस्ट से जोड़ सकते हैं, सिर्फ टेक्स्ट नहीं। यह शायद 40 लाइनों का कोड है और स्लैक बॉट, टेलीग्राम बॉट, या एक क्रॉन के रूप में समान रूप से अच्छा काम करता है जो X पर पोस्ट करता है।
एक ब्राउज़र एक्सटेंशन। किसी भी टेक्स्ट फ़ील्ड पर राइट-क्लिक करें, "एक प्रॉम्प्ट डालें," अपने स्थानीय कैश को श्रेणी या मॉडल द्वारा खोजें, content पेस्ट करें। चूंकि प्रारंभिक सिंक के बाद डेटा स्थानीय है, यह ऑफ़लाइन और तुरंत काम करता है, हर कीस्ट्रोक पर कोई नेटवर्क राउंड-ट्रिप नहीं।
एक Discord बॉट। /prompt image midjourney स्लैश कमांड, अपने कैश को category और model द्वारा फिल्टर करें, title, content, और मीडिया को एम्बेड के रूप में उत्तर दें। यदि कोई मूल देखना चाहता है, तो फुटर में original_source लिंक करें, उसी संदेश में एट्रिब्यूशन कवर हो जाता है।
मेटाडेटा फ़ील्ड का वास्तविक उपयोग
metadata वह जगह है जहां मीडिया से संबंधित किसी भी चीज़ के लिए दिलचस्प सामान रहता है: पहलू अनुपात, शैली टैग, एक गुणवत्ता मूल्यांकन। यदि आप कुछ ऐसा बना रहे हैं जो प्रॉम्प्ट को रैंक या अनुशंसा करता है (सिर्फ सूचीबद्ध करने के बजाय), यह आपका संकेत है। एक "पोर्ट्रेट के लिए सर्वश्रेष्ठ Midjourney प्रॉम्प्ट, 3:4 पहलू अनुपात, उच्च गुणवत्ता स्कोर" फिल्टर फ़ील्ड को इनजेस्ट करने के बाद कुछ अतिरिक्त WHERE क्लॉज हैं, कोई अलग स्कोरिंग पाइपलाइन आवश्यक नहीं है।
एक अच्छे प्रॉम्प्ट रिकॉर्ड का स्वाद लेने के लिए, कुछ लाइव पेज ब्राउज़ करें: एक डेटा फिजिकलाइज़ेशन इमेज प्रॉम्प्ट, एक भविष्यवादी अरचनिड चरित्र परिवर्तन, और एक रहस्यमय खानाबदोश यात्री चरित्र डिज़ाइन। उनमें से प्रत्येक डेटासेट में भी एक पूर्ण रिकॉर्ड है, समान फ़ील्ड, समान content जिसे आप मॉडल में कॉपी करेंगे।
एट्रिब्यूशन वैकल्पिक नहीं है, और यह कठिन भी नहीं है
विकिप्रॉम्प्ट अपने मूल लेखकों द्वारा सार्वजनिक पोस्ट से प्रॉम्प्ट एकत्र करता है; यह लाइसेंस-धारक नहीं है, यह लाइब्रेरियन है। यदि आपका ऐप एक प्रॉम्प्ट सतह पर लाता है, तो उसके साथ original_source दिखाएं और wikiprompt.org को क्रेडिट करें जहां से आपको कैटलॉग मिला। यही सौदा है, और डेटासेट इसे सम्मानित करना आसान बनाता है क्योंकि original_source पहले से ही हर रिकॉर्ड में मौजूद है। इसे इनजेस्ट के दौरान न हटाएं सिर्फ इसलिए कि आपके स्कीमा में अभी तक इसके लिए एक कॉलम नहीं है।
यदि आप अपना खुद का इंडेक्स नहीं चलाना चाहते हैं
तीन विकल्प मौजूद हैं जो इस बात पर निर्भर करते हैं कि आप कितना इंफ्रास्ट्रक्चर खुद रखना चाहते हैं। पूर्ण नियंत्रण के लिए बल्क डेटासेट को अपनी खुद की सर्च/अनुशंसा परत के माध्यम से चलाएं। सर्च API को सीधे कॉल करें यदि आपको सिर्फ परिणाम चाहिए, पाइपलाइन नहीं। या, यदि आप एक ऐप के बजाय एक एजेंट बना रहे हैं, तो इसे MCP सर्वर पर इंगित करें, जो सर्च, श्रेणियां, और व्यक्तिगत प्रॉम्प्ट को टूल के रूप में उजागर करता है जिसे Claude और अन्य एजेंट मूल रूप से कॉल कर सकते हैं। llms.txt भी है यदि आप चाहते हैं कि एक मॉडल एक ही फेच में पूरी सतह क्षेत्र को समझे।
यहां से शुरू करें
curl "https://www.wikiprompt.org/dataset/prompts?limit=500" | head -c 2000
देखें कि क्या लौटता है, ऊपर दिए गए चार विचारों में से एक चुनें, और कॉफी ठंडी होने से पहले आपके पास कुछ काम करने वाला होगा। कठिन हिस्सा, एक दर्जन मॉडलों में 55,000+ क्यूरेटेड प्रॉम्प्ट, पहले से ही हो चुका है। आप इसके साथ क्या बनाते हैं यह मजेदार हिस्सा है।
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read