Blog›Guides

55,000 एआई प्रॉम्प्ट्स कैसे डाउनलोड करें (मुफ्त, बिना स्क्रैपिंग के)

विकिप्रॉम्प्ट कैटलॉग को सार्वजनिक डेटासेट एंडपॉइंट के माध्यम से पूरी तरह से खींचने के लिए एक चरण-दर-चरण मार्गदर्शिका, कीसेट पेजिनेशन कर्सर का पालन करते हुए जब तक कुछ भी शेष न रहे, कोई स्क्रैपिंग आवश्यक नहीं है।

55,000 एआई प्रॉम्प्ट्स कैसे डाउनलोड करें (मुफ्त, बिना स्क्रैपिंग के)

55,000 AI प्रॉम्प्ट कैसे डाउनलोड करें (मुफ्त, बिना स्क्रैपिंग के)

अगर आपने कभी ट्विटर थ्रेड्स को स्क्रैप करके, डिस्कॉर्ड सर्वर के स्क्रीनशॉट लेकर, या हेडलेस ब्राउज़र से किसी वेबसाइट के HTML को पेजिनेट करके प्रॉम्प्ट डेटासेट बनाने की कोशिश की है, तो आप पहले से जानते हैं कि यह कितना नाजुक है। सेलेक्टर बदलते हैं, रेट लिमिट लगती है, और आपके द्वारा इकट्ठा किए गए आधे "प्रॉम्प्ट" प्रॉम्प्ट के जवाब होते हैं, न कि खुद प्रॉम्प्ट।

Wikiprompt ने अब इस सब की ज़रूरत खत्म कर दी है। कैटलॉग, जिसमें 55,000 से अधिक क्यूरेटेड AI प्रॉम्प्ट हैं, जो मिडजर्नी, GPT इमेज, Veo, Kling, Nano Banana और Claude जैसे मॉडल्स के लिए इमेज, वीडियो और टेक्स्ट जनरेशन को कवर करते हैं, अब एक सादे JSON डेटासेट के रूप में उपलब्ध है जिसे आप curl से पेज कर सकते हैं। कोई API की नहीं, कोई लॉगिन नहीं, कोई स्क्रैपिंग नहीं। यह पोस्ट "मुझे डेटा चाहिए" से लेकर 55,000 रिकॉर्ड वाली लोकल फाइल तक का सबसे तेज़ रास्ता है।

चरण 1: मैनिफेस्ट देखें

कोई भी रिकॉर्ड खींचने से पहले, मैनिफेस्ट जांचें ताकि आपकी स्क्रिप्ट को पता चले कि वह किससे निपट रही है:

curl "https://www.wikiprompt.org/dataset"

यह एक छोटा JSON दस्तावेज़ लौटाता है जो डेटासेट का वर्णन करता है: total_prompts (वर्तमान संख्या, 55,000+), record_fields (नीचे दिया गया स्कीमा), और pagination योजना। इस एंडपॉइंट को कुल संख्या के लिए स्रोत के रूप में मानें, अपने पाइपलाइन में कोई संख्या हार्डकोड न करें।

चरण 2: अपना पहला पेज खींचें

असली रिकॉर्ड /dataset/prompts पर रहते हैं। पेजिनेशन कीज़ेट-आधारित है (एक कर्सर, पेज नंबर नहीं), जिसका मतलब है कि यह पेज 200 पर भी तेज़ और स्थिर रहता है। डिफ़ॉल्ट पेज साइज़ 200 रिकॉर्ड है; आप एक बार में 500 तक मांग सकते हैं:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

प्रतिक्रिया एक JSON ऑब्जेक्ट है जिसमें रिकॉर्ड की सूची और एक next फील्ड होता है। next एक पूरा URL है, जो जैसे-का-तैसा लाने के लिए तैयार है, जिसमें एक after कर्सर होता है जो आपके द्वारा अभी प्राप्त अंतिम रिकॉर्ड की ओर इशारा करता है। जब पेज करने के लिए कुछ नहीं बचता, तो next null होता है। वह एक फील्ड आपकी पूरी लूप स्थिति है।

चरण 3: `next` को तब तक फॉलो करें जब तक वह null न हो

यहाँ पूरा पेजिनेशन लूप Python में है। यह हर रिकॉर्ड को एक लोकल फाइल में लिखता है और खुद को रोक देता है:

import json

import time

import urllib.request

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

out = open("wikiprompt_dataset.jsonl", "w")

count = 0

while url:

with urllib.request.urlopen(url) as resp:

data = json.loads(resp.read())

for record in data["records"]:

out.write(json.dumps(record) + "\n")

count += 1

url = data.get("next")

time.sleep(0.2)

out.close()

print(f"Downloaded {count} prompts")

वही लूप Node में, अगर आपका स्टैक वह है:

let url = "https://www.wikiprompt.org/dataset/prompts?limit=500";

const fs = require("fs");

const out = fs.createWriteStream("wikiprompt_dataset.jsonl");

let count = 0;

while (url) {

const res = await fetch(url);

const data = await res.json();

for (const record of data.records) {

out.write(JSON.stringify(record) + "\n");

count++;

}

url = data.next;

}

console.log(Downloaded ${count} prompts);

किसी भी एक को चलाएं और चले जाएं। हर प्रतिक्रिया एज-कैश्ड और CORS-सक्षम है (Access-Control-Allow-Origin: *), इसलिए यह सर्वर, ब्राउज़र कंसोल, नोटबुक, या सर्वरलेस फंक्शन से बिना किसी विशेष हेडर के काम करता है। सामान्य कनेक्शन पर, limit=500 पर सभी 55,000+ रिकॉर्ड खींचने में कुछ मिनट से कम समय लगता है।

आपको प्रति रिकॉर्ड वास्तव में क्या मिलता है

डेटासेट में हर JSON ऑब्जेक्ट का आकार समान है, जो इसे एक-बार ब्राउज़िंग से परे किसी भी चीज़ के लिए उपयोगी बनाता है:

  • slug और url, wikiprompt.org पर उस प्रॉम्प्ट के लिए कैनोनिकल पेज
  • title और description
  • content, असली प्रॉम्प्ट टेक्स्ट जिसे आप मॉडल में कॉपी करेंगे
  • category (रचनात्मक, मार्केटिंग, व्यक्तिगत, उत्पादकता, कोडिंग, शिक्षा, व्यवसाय, शोध, अन्य) और tags
  • media, इमेज या वीडियो URL जब प्रॉम्प्ट ने विज़ुअल आउटपुट उत्पन्न किया हो
  • model, वह AI मॉडल जिसके लिए प्रॉम्प्ट लिखा गया था या जिसके साथ उत्पन्न किया गया था
  • metadata, एक संरचित ब्लॉक जो मीडिया प्रकार, पहलू अनुपात, शैली और गुणवत्ता मूल्यांकन को कवर करता है
  • author और original_source, मूल ट्वीट या पोस्ट का लिंक जहाँ से प्रॉम्प्ट आया था
  • created_at और updated_at
  • वह content फील्ड ही पूरा बिंदु है: यह उपयोग के लिए तैयार प्रॉम्प्ट टेक्स्ट है, न कि उसका सारांश, जो ज्यादातर स्क्रैप किए गए डेटासेट गलत करते हैं।

    पहले देखने के लिए कुछ रिकॉर्ड

    स्कीमा को विश्वास पर लेने के बजाय, कुछ असली प्रविष्टियाँ खोलें। Titan: Engineering Blueprint of a Transforming Robot एक विस्तृत इमेज प्रॉम्प्ट का अच्छा उदाहरण है जिसमें पूरा मेटाडेटा ब्लॉक है। Data Physicalization दिखाता है कि अधिक अवधारणात्मक, डिज़ाइन-उन्मुख प्रॉम्प्ट के लिए category और tags कैसे असाइन किए जाते हैं। और Pastel Fantasy Portrait of a Young Woman एक संक्षिप्त शैली-संचालित प्रॉम्प्ट है जिसकी तुलना उसके मेटाडेटा में style फील्ड से करना उचित है। अपनी लोकल JSONL फाइल से उन तीन slugs को खींचना आपके पार्सर को सभी 55,000 पर भरोसा करने से पहले जांचने का एक तेज़ तरीका है।

    अगर आप डाउनलोड के बजाय क्वेरी करना चाहते हैं

    बल्क डेटासेट तब है जब आप सब कुछ चाहते हैं, लोकल, एक बार। अगर आपको केवल एक हिस्सा चाहिए, तो सर्च API ऑन-डिमांड क्वेरी का जवाब JSON में देता है, MCP सर्वर उसी कैटलॉग को Claude और अन्य एजेंटों के लिए टूल के रूप में उजागर करता है, और llms.txt क्रॉलर को साइट का नक्शा देता है। डेटासेट एक्सपोर्ट और ये लाइव एंडपॉइंट एक ही अंतर्निहित डेटा साझा करते हैं, इसलिए बाद में उनके बीच स्विच करने में आपको कुछ भी खर्च नहीं होता।

    इसका पुन: उपयोग करने पर एक नियम

    Wikiprompt मूल लेखकों द्वारा सार्वजनिक पोस्ट से प्रॉम्प्ट एकत्र करता है; यह कॉपीराइट धारक नहीं है। अगर आप इस डेटासेट पर निर्मित कुछ प्रकाशित करते हैं, तो wikiprompt.org और उन विशिष्ट रिकॉर्ड पर original_source लिंक को क्रेडिट करें जिनका आपने उपयोग किया। यही इस सब से जुड़ी एकमात्र शर्त है।

    इसे डाउनलोड करें, पेज करें, और कुछ बनाएं। मैनिफेस्ट और next कर्सर केवल दो चीजें हैं जिन्हें आपको याद रखने की जरूरत है।

    Tags
    open-data·dataset·ai-prompts·api·download·pagination