Blog›Guides

एआई इमेज और वीडियो प्रॉम्प्ट्स का सबसे बड़ा ओपन डेटासेट

Wikiprompt का सार्वजनिक डेटासेट 55,000+ इमेज, वीडियो, और टेक्स्ट प्रॉम्प्ट्स को कवर करता है, जिसमें GPT Image, Midjourney, Seedance, Veo, Kling, ChatGPT, और अन्य शामिल हैं, प्रत्येक के साथ उसका वास्तविक परिणाम मीडिया और संरचित मेटाडेटा भी दिया गया है।

एआई इमेज और वीडियो प्रॉम्प्ट्स का सबसे बड़ा ओपन डेटासेट

एआई इमेज और वीडियो प्रॉम्प्ट्स का सबसे बड़ा ओपन डेटासेट

ऑनलाइन मिलने वाले अधिकांश प्रॉम्प्ट कलेक्शन एक मॉडल, एक मीडिया प्रकार को कवर करते हैं, और आपको हाथ से स्क्रॉल करने के लिए एक पेज देते हैं। यहाँ मिडजर्नी प्रॉम्प्ट्स की एक गैलरी, वहाँ ChatGPT सिस्टम प्रॉम्प्ट्स का एक गिस्ट, एक पेड कोर्स जो चेकआउट पेज के पीछे "50 Veo प्रॉम्प्ट्स" बंडल करता है। उनमें से कोई भी आपको वास्तव में डेटा के साथ काम करने नहीं देता।

Wikiprompt एक तरह से अलग है जिसे बताना आसान है और स्पष्ट करने लायक है: यह 55,000 से अधिक प्रॉम्प्ट्स का एक एकल, खुला कैटलॉग है जो इमेज जनरेशन, वीडियो जनरेशन, और टेक्स्ट को कवर करता है, जिसमें वे मॉडल शामिल हैं जिन्हें लोग वास्तव में अभी उपयोग कर रहे हैं - GPT Image, Midjourney, Seedance, Veo, Kling, Nano Banana, ChatGPT, Claude, Grok, और अन्य - और इस महीने से यह सब एक सादे JSON डेटासेट के रूप में डाउनलोड करने योग्य है। कोई लॉगिन नहीं, कोई API key नहीं, कोई प्रति-मॉडल साइलो नहीं। एक ही फीड।

चौड़ाई ही मुख्य बिंदु है

अधिकांश "प्रॉम्प्ट लाइब्रेरी" साइटें एक लेन चुनती हैं। एक Midjourney-केवल गैलरी आपको यह नहीं बता सकती कि एक ही अवधारणा के लिए Kling प्रॉम्प्ट कैसे भिन्न होता है, और ChatGPT के लिए एक टेक्स्ट-प्रॉम्प्ट रिपॉजिटरी का पहलू अनुपात या स्टाइल टैग्स के बारे में कुछ नहीं कहता। Wikiprompt का कैटलॉग इस तरह व्यवस्थित है कि इमेज, वीडियो, और टेक्स्ट प्रॉम्प्ट्स एक ही स्कीमा में रहते हैं, उसी क्रिएटिव प्रॉम्प्ट्स श्रेणी के माध्यम से ब्राउज़ करने योग्य और उसी सर्च API के माध्यम से खोजने योग्य होते हैं।

व्यावहारिक रूप से, इसका मतलब है कि आप निकाल सकते हैं:

  • GPT Image, Midjourney, Nano Banana, और समान टूल्स के लिए इमेज प्रॉम्प्ट्स, जैसे एक पेस्टल फंतासी पोर्ट्रेट या एक हाथ से कटा लिनोकट ट्रैवल पोस्टर।
  • Seedance, Veo, और Kling के लिए वीडियो प्रॉम्प्ट्स, जिसमें सीन-संचालित टुकड़े शामिल हैं जैसे बारिश में हारा हुआ एक सफेद साँप आत्मा।
  • ChatGPT, Claude, और Gemini के लिए टेक्स्ट प्रॉम्प्ट्स, जो कोडिंग, लेखन, व्यवसाय, और अनुसंधान उपयोग के मामलों को कवर करते हैं।
  • वह चौड़ाई पूरी थीसिस है। यदि आप एक टूल बनाने, एक क्लासिफायर प्रशिक्षित करने, या सिर्फ यह समझने के लिए प्रॉम्प्ट संसाधनों का मूल्यांकन कर रहे हैं कि विभिन्न मोडैलिटीज में अच्छा प्रॉम्प्टिंग कैसा दिखता है, तो एक एकल-मॉडल सूची आपको बाकी खुद इकट्ठा करने के लिए मजबूर करती है। Wikiprompt का डेटासेट पहले से ही इसे एक जगह रखता है।

    हर प्रॉम्प्ट अपने परिणाम के साथ आता है, सिर्फ उसका टेक्स्ट नहीं

    बिखरे हुए प्रॉम्प्ट कलेक्शन में दूसरा अंतर यह है कि आमतौर पर आपको केवल प्रॉम्प्ट मिलता है। आप टेक्स्ट देखते हैं, शायद एक ट्वीट में चिपकाया गया स्क्रीनशॉट, और आप खुद तय करने के लिए छोड़ दिए जाते हैं कि यह वास्तव में काम करता है या नहीं।

    Wikiprompt डेटासेट में हर रिकॉर्ड प्रॉम्प्ट टेक्स्ट के साथ-साथ उसके द्वारा उत्पादित वास्तविक मीडिया, साथ ही संरचित metadata रखता है: उपयोग किया गया मॉडल, पहलू अनुपात, रिज़ॉल्यूशन, स्टाइल टैग्स, और एक संपादकीय गुणवत्ता मूल्यांकन (रचनात्मकता, उपयोगिता, तकनीकी गुणवत्ता, और इमेज/वीडियो के लिए, प्रॉम्प्ट पालन और "वाह कारक")। यह प्रॉम्प्ट स्ट्रिंग्स की एक सूची और एक डेटासेट के बीच का अंतर है जिसे आप वास्तव में यह अध्ययन करने के लिए उपयोग कर सकते हैं कि क्या काम करता है। आप अनुमान नहीं लगा रहे हैं कि एक प्रॉम्प्ट अच्छा है या नहीं, आप उसके द्वारा उत्पन्न आउटपुट और उसके स्कोर को देख सकते हैं।

    यह बाकी चीजों से कैसे तुलना करता है

    X या Reddit से प्रॉम्प्ट्स को खुद स्क्रैप करने का मतलब है रेट लिमिट्स, असंगत फॉर्मेटिंग, और गायब होने वाली पोस्ट्स से निपटना। पेवॉल्ड "प्रॉम्प्ट पैक" उत्पाद आपको एक क्यूरेटेड हिस्सा देते हैं लेकिन आपको बाकी से बाहर कर देते हैं और शायद ही वास्तविक उत्पन्न मीडिया शामिल करते हैं। एकल-मॉडल समुदाय उपयोगी हैं लेकिन संरचनात्मक रूप से क्रॉस-मॉडल प्रश्नों का उत्तर नहीं दे सकते, जैसे कि क्या एक विशेष फ्रेमिंग शैली Midjourney से Kling में अनुवादित होती है।

    Wikiprompt डेटासेट तीनों समस्याओं से बचता है: यह मुफ्त है, यह एक मॉडल तक सीमित नहीं है, और हर रिकॉर्ड पहले से ही अपने मूल स्रोत के साथ निर्माता से जुड़ा हुआ आता है (original_source फ़ील्ड), इसलिए एट्रिब्यूशन अंतर्निहित है न कि बाद में जोड़ा गया।

    डेटा खींचना

    मैनिफेस्ट डेटासेट पर रहता है, जो कुल प्रॉम्प्ट गिनती, रिकॉर्ड स्कीमा, और पेजिनेशन योजना लौटाता है। वास्तविक कैटलॉग /dataset/prompts पर है, जो एक keyset कर्सर के साथ पेजिनेटेड है, प्रति पेज 500 रिकॉर्ड तक:

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    प्रत्येक प्रतिक्रिया में एक next URL शामिल है। इसे तब तक फॉलो करें जब तक next null न लौटे और आपके पास पूरा कैटलॉग हो। एक न्यूनतम पेजिनेशन लूप इस तरह दिखता है:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    records = []

    while url:

    resp = requests.get(url).json()

    records.extend(resp["prompts"])

    url = resp.get("next")

    print(len(records), "prompts collected")

    कोई API key नहीं, CORS सक्षम है, और पूरी चीज़ Vercel के एज कैश के पीछे बैठती है, इसलिए पूरा सेट खींचना तेज़ है और लाइव साइट पर स्क्रैपिंग की तरह लोड नहीं डालता।

    संरचित फ़ील्ड्स, मुक्त टेक्स्ट नहीं

    प्रत्येक रिकॉर्ड में slug, url, title, description, content (वास्तविक प्रॉम्प्ट), category, tags, media, model, metadata, author, original_source, created_at, और updated_at शामिल हैं। श्रेणियाँ क्रिएटिव, मार्केटिंग, पर्सनल, प्रोडक्टिविटी, कोडिंग, एजुकेशन, बिजनेस, रिसर्च, और अन्य में फैली हुई हैं, इसलिए उपयोग के मामले से फ़िल्टर करना एक फ़ील्ड लुकअप है, न कि एक टेक्स्ट क्लासिफायर जिसे आपको खुद प्रशिक्षित करना पड़े।

    केवल सक्रिय, साफ किए गए प्रॉम्प्ट्स एक्सपोर्ट में शामिल होते हैं, जिसका मतलब है कि आप असली चीज़ के साथ स्पैम, डुप्लिकेट, या अधूरे ड्राफ्ट डाउनलोड नहीं कर रहे हैं।

    यदि आपको इसे बल्क के बजाय लाइव चाहिए

    डेटासेट बल्क विश्लेषण के लिए है। यदि आप इसके बजाय मांग पर क्वेरी करना चाहते हैं, तो सर्च API एक लाइव क्वेरी के लिए JSON लौटाता है, MCP सर्वर एक AI एजेंट को बातचीत के अंदर सीधे प्रॉम्प्ट्स खोजने और खींचने देता है, और llms.txt किसी भी LLM को साइट की संरचना का नक्शा देता है। तीनों डेटासेट के समान अंतर्निहित कैटलॉग की ओर इशारा करते हैं।

    एट्रिब्यूशन

    Wikiprompt में हर प्रॉम्प्ट उसके मूल लेखक द्वारा एक सार्वजनिक पोस्ट से एकत्र किया गया था। जब आप किसी प्रॉम्प्ट या डेटासेट एक्सपोर्ट को अपनी प्रकाशित चीज़ में पुनः उपयोग करते हैं, तो wikiprompt.org और रिकॉर्ड के original_source लिंक को उस निर्माता को श्रेय दें जिसने इसे लिखा था। यह एक औपचारिक लाइसेंस नहीं है, यह आधारभूत शिष्टाचार है जिस पर पूरा कैटलॉग निर्भर करता है।

    यदि आप बुकमार्क किए गए ट्वीट्स और पेवॉल्ड पैक्स से प्रॉम्प्ट उदाहरणों को जोड़ रहे हैं, तो यह शॉर्टकट है: एक डाउनलोड, हर मोडैलिटी, वास्तविक आउटपुट संलग्न, कैटलॉग बढ़ने के साथ अपडेटेड।

    Tags
    open-data·dataset·ai-prompts·image-generation·video-generation·api