एआई इमेज और वीडियो प्रॉम्प्ट्स का सबसे बड़ा ओपन डेटासेट
Wikiprompt का सार्वजनिक डेटासेट 55,000+ इमेज, वीडियो, और टेक्स्ट प्रॉम्प्ट्स को कवर करता है, जिसमें GPT Image, Midjourney, Seedance, Veo, Kling, ChatGPT, और अन्य शामिल हैं, प्रत्येक के साथ उसका वास्तविक परिणाम मीडिया और संरचित मेटाडेटा भी दिया गया है।

एआई इमेज और वीडियो प्रॉम्प्ट्स का सबसे बड़ा ओपन डेटासेट
ऑनलाइन मिलने वाले अधिकांश प्रॉम्प्ट कलेक्शन एक मॉडल, एक मीडिया प्रकार को कवर करते हैं, और आपको हाथ से स्क्रॉल करने के लिए एक पेज देते हैं। यहाँ मिडजर्नी प्रॉम्प्ट्स की एक गैलरी, वहाँ ChatGPT सिस्टम प्रॉम्प्ट्स का एक गिस्ट, एक पेड कोर्स जो चेकआउट पेज के पीछे "50 Veo प्रॉम्प्ट्स" बंडल करता है। उनमें से कोई भी आपको वास्तव में डेटा के साथ काम करने नहीं देता।
Wikiprompt एक तरह से अलग है जिसे बताना आसान है और स्पष्ट करने लायक है: यह 55,000 से अधिक प्रॉम्प्ट्स का एक एकल, खुला कैटलॉग है जो इमेज जनरेशन, वीडियो जनरेशन, और टेक्स्ट को कवर करता है, जिसमें वे मॉडल शामिल हैं जिन्हें लोग वास्तव में अभी उपयोग कर रहे हैं - GPT Image, Midjourney, Seedance, Veo, Kling, Nano Banana, ChatGPT, Claude, Grok, और अन्य - और इस महीने से यह सब एक सादे JSON डेटासेट के रूप में डाउनलोड करने योग्य है। कोई लॉगिन नहीं, कोई API key नहीं, कोई प्रति-मॉडल साइलो नहीं। एक ही फीड।
चौड़ाई ही मुख्य बिंदु है
अधिकांश "प्रॉम्प्ट लाइब्रेरी" साइटें एक लेन चुनती हैं। एक Midjourney-केवल गैलरी आपको यह नहीं बता सकती कि एक ही अवधारणा के लिए Kling प्रॉम्प्ट कैसे भिन्न होता है, और ChatGPT के लिए एक टेक्स्ट-प्रॉम्प्ट रिपॉजिटरी का पहलू अनुपात या स्टाइल टैग्स के बारे में कुछ नहीं कहता। Wikiprompt का कैटलॉग इस तरह व्यवस्थित है कि इमेज, वीडियो, और टेक्स्ट प्रॉम्प्ट्स एक ही स्कीमा में रहते हैं, उसी क्रिएटिव प्रॉम्प्ट्स श्रेणी के माध्यम से ब्राउज़ करने योग्य और उसी सर्च API के माध्यम से खोजने योग्य होते हैं।
व्यावहारिक रूप से, इसका मतलब है कि आप निकाल सकते हैं:
वह चौड़ाई पूरी थीसिस है। यदि आप एक टूल बनाने, एक क्लासिफायर प्रशिक्षित करने, या सिर्फ यह समझने के लिए प्रॉम्प्ट संसाधनों का मूल्यांकन कर रहे हैं कि विभिन्न मोडैलिटीज में अच्छा प्रॉम्प्टिंग कैसा दिखता है, तो एक एकल-मॉडल सूची आपको बाकी खुद इकट्ठा करने के लिए मजबूर करती है। Wikiprompt का डेटासेट पहले से ही इसे एक जगह रखता है।
हर प्रॉम्प्ट अपने परिणाम के साथ आता है, सिर्फ उसका टेक्स्ट नहीं
बिखरे हुए प्रॉम्प्ट कलेक्शन में दूसरा अंतर यह है कि आमतौर पर आपको केवल प्रॉम्प्ट मिलता है। आप टेक्स्ट देखते हैं, शायद एक ट्वीट में चिपकाया गया स्क्रीनशॉट, और आप खुद तय करने के लिए छोड़ दिए जाते हैं कि यह वास्तव में काम करता है या नहीं।
Wikiprompt डेटासेट में हर रिकॉर्ड प्रॉम्प्ट टेक्स्ट के साथ-साथ उसके द्वारा उत्पादित वास्तविक मीडिया, साथ ही संरचित metadata रखता है: उपयोग किया गया मॉडल, पहलू अनुपात, रिज़ॉल्यूशन, स्टाइल टैग्स, और एक संपादकीय गुणवत्ता मूल्यांकन (रचनात्मकता, उपयोगिता, तकनीकी गुणवत्ता, और इमेज/वीडियो के लिए, प्रॉम्प्ट पालन और "वाह कारक")। यह प्रॉम्प्ट स्ट्रिंग्स की एक सूची और एक डेटासेट के बीच का अंतर है जिसे आप वास्तव में यह अध्ययन करने के लिए उपयोग कर सकते हैं कि क्या काम करता है। आप अनुमान नहीं लगा रहे हैं कि एक प्रॉम्प्ट अच्छा है या नहीं, आप उसके द्वारा उत्पन्न आउटपुट और उसके स्कोर को देख सकते हैं।
यह बाकी चीजों से कैसे तुलना करता है
X या Reddit से प्रॉम्प्ट्स को खुद स्क्रैप करने का मतलब है रेट लिमिट्स, असंगत फॉर्मेटिंग, और गायब होने वाली पोस्ट्स से निपटना। पेवॉल्ड "प्रॉम्प्ट पैक" उत्पाद आपको एक क्यूरेटेड हिस्सा देते हैं लेकिन आपको बाकी से बाहर कर देते हैं और शायद ही वास्तविक उत्पन्न मीडिया शामिल करते हैं। एकल-मॉडल समुदाय उपयोगी हैं लेकिन संरचनात्मक रूप से क्रॉस-मॉडल प्रश्नों का उत्तर नहीं दे सकते, जैसे कि क्या एक विशेष फ्रेमिंग शैली Midjourney से Kling में अनुवादित होती है।
Wikiprompt डेटासेट तीनों समस्याओं से बचता है: यह मुफ्त है, यह एक मॉडल तक सीमित नहीं है, और हर रिकॉर्ड पहले से ही अपने मूल स्रोत के साथ निर्माता से जुड़ा हुआ आता है (original_source फ़ील्ड), इसलिए एट्रिब्यूशन अंतर्निहित है न कि बाद में जोड़ा गया।
डेटा खींचना
मैनिफेस्ट डेटासेट पर रहता है, जो कुल प्रॉम्प्ट गिनती, रिकॉर्ड स्कीमा, और पेजिनेशन योजना लौटाता है। वास्तविक कैटलॉग /dataset/prompts पर है, जो एक keyset कर्सर के साथ पेजिनेटेड है, प्रति पेज 500 रिकॉर्ड तक:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
प्रत्येक प्रतिक्रिया में एक next URL शामिल है। इसे तब तक फॉलो करें जब तक next null न लौटे और आपके पास पूरा कैटलॉग हो। एक न्यूनतम पेजिनेशन लूप इस तरह दिखता है:
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
resp = requests.get(url).json()
records.extend(resp["prompts"])
url = resp.get("next")
print(len(records), "prompts collected")
कोई API key नहीं, CORS सक्षम है, और पूरी चीज़ Vercel के एज कैश के पीछे बैठती है, इसलिए पूरा सेट खींचना तेज़ है और लाइव साइट पर स्क्रैपिंग की तरह लोड नहीं डालता।
संरचित फ़ील्ड्स, मुक्त टेक्स्ट नहीं
प्रत्येक रिकॉर्ड में slug, url, title, description, content (वास्तविक प्रॉम्प्ट), category, tags, media, model, metadata, author, original_source, created_at, और updated_at शामिल हैं। श्रेणियाँ क्रिएटिव, मार्केटिंग, पर्सनल, प्रोडक्टिविटी, कोडिंग, एजुकेशन, बिजनेस, रिसर्च, और अन्य में फैली हुई हैं, इसलिए उपयोग के मामले से फ़िल्टर करना एक फ़ील्ड लुकअप है, न कि एक टेक्स्ट क्लासिफायर जिसे आपको खुद प्रशिक्षित करना पड़े।
केवल सक्रिय, साफ किए गए प्रॉम्प्ट्स एक्सपोर्ट में शामिल होते हैं, जिसका मतलब है कि आप असली चीज़ के साथ स्पैम, डुप्लिकेट, या अधूरे ड्राफ्ट डाउनलोड नहीं कर रहे हैं।
यदि आपको इसे बल्क के बजाय लाइव चाहिए
डेटासेट बल्क विश्लेषण के लिए है। यदि आप इसके बजाय मांग पर क्वेरी करना चाहते हैं, तो सर्च API एक लाइव क्वेरी के लिए JSON लौटाता है, MCP सर्वर एक AI एजेंट को बातचीत के अंदर सीधे प्रॉम्प्ट्स खोजने और खींचने देता है, और llms.txt किसी भी LLM को साइट की संरचना का नक्शा देता है। तीनों डेटासेट के समान अंतर्निहित कैटलॉग की ओर इशारा करते हैं।
एट्रिब्यूशन
Wikiprompt में हर प्रॉम्प्ट उसके मूल लेखक द्वारा एक सार्वजनिक पोस्ट से एकत्र किया गया था। जब आप किसी प्रॉम्प्ट या डेटासेट एक्सपोर्ट को अपनी प्रकाशित चीज़ में पुनः उपयोग करते हैं, तो wikiprompt.org और रिकॉर्ड के original_source लिंक को उस निर्माता को श्रेय दें जिसने इसे लिखा था। यह एक औपचारिक लाइसेंस नहीं है, यह आधारभूत शिष्टाचार है जिस पर पूरा कैटलॉग निर्भर करता है।
यदि आप बुकमार्क किए गए ट्वीट्स और पेवॉल्ड पैक्स से प्रॉम्प्ट उदाहरणों को जोड़ रहे हैं, तो यह शॉर्टकट है: एक डाउनलोड, हर मोडैलिटी, वास्तविक आउटपुट संलग्न, कैटलॉग बढ़ने के साथ अपडेटेड।
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read