55,000 प्रॉम्प्ट्स से पता चलता है कि लोग AI का उपयोग कैसे करते हैं
विकिप्रॉम्प्ट के सार्वजनिक डेटासेट का विश्लेषण करके आप क्या सीख सकते हैं, इस पर एक नज़र: कौन से मॉडल हावी हैं, छवि, वीडियो और टेक्स्ट प्रॉम्प्ट कैसे भिन्न होते हैं, और कॉर्पस पर अपना खुद का विश्लेषण कैसे चलाएं।

55,000 प्रॉम्प्ट्स से पता चलता है कि लोग AI का उपयोग कैसे करते हैं
Wikiprompt पर हर प्रॉम्प्ट एक वास्तविक अनुरोध से शुरू हुआ जो किसी ने किसी वास्तविक मॉडल से किया, फिर उसे साझा करने लायक समझा गया। इसे 55,000+ से गुणा करें और आपके पास उदाहरणों की सूची नहीं, बल्कि एक संग्रह होता है: एक मोटा सर्वेक्षण कि लोग AI से कुछ विशेष चाहते समय वास्तव में कैसे बात करते हैं। हमने डेटासेट बनाया ताकि कोई भी उस पूरे संग्रह को खींच सके और पैटर्न खुद देख सके, बजाय हमारे सारांश पर भरोसा करने के।
यह पोस्ट वही सारांश है, लेकिन एक निमंत्रण के रूप में। नीचे सब कुछ एक प्रारंभिक परिकल्पना है, कोई निष्कर्ष नहीं जिसे आपको अंधविश्वास से मानना पड़े। डेटा /dataset/prompts पर उपलब्ध है, यह मुफ़्त है, और इसे खींचने के लिए लगभग दस लाइनों का कोड चाहिए।
एक रिकॉर्ड में वास्तव में क्या होता है
डंप में प्रत्येक प्रविष्टि में slug, url, title, description, content (प्रॉम्प्ट टेक्स्ट स्वयं), category, tags, media, model, एक metadata ऑब्जेक्ट जिसमें संरचित फ़ील्ड जैसे पहलू अनुपात और शैली, author, original_source, और दोनों टाइमस्टैम्प होते हैं। यह लाइव साइट को छुए बिना तीन अलग-अलग प्रकार के विश्लेषण चलाने के लिए पर्याप्त है: content और title पर टेक्स्ट विश्लेषण, category/tags/model/metadata पर श्रेणीबद्ध विश्लेषण, और created_at पर समय-श्रृंखला विश्लेषण यदि आप देखना चाहते हैं कि कैटलॉग के जीवनकाल में वाक्यांश या मॉडल चयन कैसे बदला।
मॉडल परिदृश्य
model फ़ील्ड द्वारा रिकॉर्ड समूहित करें और आपको लगभग एक लीडरबोर्ड मिलता है कि लोग वास्तव में क्या उपयोग कर रहे हैं, न कि सबसे नया या सबसे अधिक प्रचारित। छवि और वीडियो जनरेटर (Midjourney, GPT Image, Seedance, Veo, Kling, Nano Banana) टेक्स्ट और रीज़निंग मॉडल (Claude, GPT, Gemini, Grok) के साथ एक ही तालिका में बैठते हैं, क्योंकि Wikiprompt "चैट प्रॉम्प्ट्स" और "इमेज प्रॉम्प्ट्स" को अलग-अलग उत्पादों के रूप में अलग नहीं करता। यह अपने आप में खोजने लायक है: क्या एक दिया गया मॉडल श्रेणियों का संकीर्ण या व्यापक फैलाव आकर्षित करता है? क्या कुछ मॉडल metadata में कुछ शैलियों के आसपास समूहित होते हैं? metadata.model और metadata.style फ़ील्ड विशेष रूप से मौजूद हैं ताकि आपको उत्तर देने के लिए प्रॉम्प्ट टेक्स्ट को regex न करना पड़े।
छवि, वीडियो और टेक्स्ट समान रूप से विभाजित नहीं हैं
metadata.media_type प्रत्येक रिकॉर्ड को छवि, वीडियो या टेक्स्ट के रूप में टैग करता है, और तीनों के बीच का अनुपात अपने आप में एक संकेत है कि अभी दिलचस्प प्रॉम्प्ट इंजीनियरिंग कहाँ हो रही है। टेक्स्ट प्रॉम्प्ट्स (सिस्टम प्रॉम्प्ट्स, पर्सनास, संरचित टेम्पलेट) लंबे और अधिक मचान वाले होते हैं। छवि प्रॉम्प्ट्स घने दृश्य शब्दावली पर निर्भर करते हैं जो एक या दो वाक्यों में पैक होती है। वीडियो प्रॉम्प्ट्स, सबसे नया और सबसे छोटा हिस्सा, शॉट सूचियों की तरह पढ़ते हैं, जिसमें कैमरा मूवमेंट, अवधि और गति स्पष्ट रूप से बताई जाती है। यदि आप समझने की कोशिश कर रहे हैं कि "प्रॉम्प्टिंग" एक कौशल के रूप में विभिन्न मोडैलिटीज़ में कैसे भिन्न होता है, तो कुछ और करने से पहले डंप को media_type द्वारा फ़िल्टर करना आपको तीन अलग-अलग विषयों को एक साथ औसत करने से बचाएगा।
श्रेणियाँ और शैलियाँ, वास्तविक उदाहरणों के साथ
कैटलॉग सब कुछ नौ श्रेणियों (रचनात्मक, विपणन, व्यक्तिगत, उत्पादकता, कोडिंग, शिक्षा, व्यवसाय, अनुसंधान, अन्य) में समूहित करता है, और रचनात्मक शैली शब्दावली को काम पर देखने के लिए एक अच्छी जगह है। एक न्यूनतम काले और सफेद संपादकीय धूम्रपान पोस्टर लें: प्रॉम्प्ट संयम, नकारात्मक स्थान और एक नामित फोटोग्राफिक परंपरा के साथ बहुत काम कर रहा है, बजाय विशेषणों के ढेर लगाने के। इसकी तुलना एक प्रागैतिहासिक प्राणी संप्रभु चित्र से करें, जो एक विशिष्ट स्वर को मॉडल से बाहर निकालने के लिए शैली-मिश्रण भाषा (राजसी, पौराणिक, संप्रभु) पर निर्भर करता है, या एक युवा महिला का पेस्टल फंतासी चित्र, जो लगभग पूरी तरह से रंग और प्रकाश विवरण है। तीन प्रॉम्प्ट्स, एक छवि मॉडल से विशिष्टता पाने के लिए तीन पूरी तरह से अलग रणनीतियाँ, और तीनों एक ही category: creative बकेट में बैठे हैं। टैग और metadata.style वे फ़ील्ड हैं जो आपको "रचनात्मक" को शीर्ष-स्तरीय श्रेणी से अधिक सूक्ष्म कुछ में विभाजित करने देते हैं।
वाक्यांश पैटर्न जो खोजने लायक हैं
कुछ चीजें पूरे संग्रह के खिलाफ परीक्षण करने लायक हैं, बजाय किस्सों पर भरोसा करने के: क्या कुछ शुरुआती निर्माण (अनिवार्य क्रियाएं, "आप एक हैं...", दृश्य-सेटिंग खंड) मेटाडेटा में quality/assessment स्कोर के साथ सहसंबंधित होते हैं; क्या एक विशिष्ट नामित मॉडल को लक्षित करने वाले प्रॉम्प्ट्स मॉडल-अज्ञेयवादी लोगों से अलग शब्दावली का उपयोग करते हैं; क्या टैग सह-घटना उन श्रेणियों को प्रकट करती है जो एक दूसरे की तरह व्यवहार करती हैं भले ही वे अलग-अलग लेबल हों (विपणन और व्यवसाय प्रॉम्प्ट्स, उदाहरण के लिए, बहुत सारे टैग साझा करते हैं)। इनमें से किसी के लिए n-ग्राम गिनने और फ़ील्ड द्वारा समूहित करने से अधिक फैंसी कुछ नहीं चाहिए। यह उस तरह का डेटासेट है जहां pandas या स्प्रेडशीट के साथ एक धीमी दोपहर कुछ वास्तविक खोज देती है।
इसे स्वयं खींचना
डेटासेट पर मैनिफेस्ट आपको एक भी रिकॉर्ड लाने से पहले कुल संख्या, रिकॉर्ड आकार और पेजिनेशन कैसे काम करता है बताता है। वास्तविक डेटा कीसेट-पेजिनेटेड है, प्रति पेज 500 रिकॉर्ड तक:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
प्रत्येक प्रतिक्रिया में एक next URL शामिल है; इसे तब तक फॉलो करें जब तक next null न लौटे। एक न्यूनतम लूप इस तरह दिखता है:
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
res = requests.get(url).json()
records.extend(res["records"])
url = res.get("next")
print(len(records), "prompts pulled")
कोई API कुंजी नहीं, CORS सक्षम है, और पूरी चीज़ एक एज कैश के पीछे बैठती है, इसलिए पूर्ण खींच तेज़ है और हमारे सर्वर पर निर्भर नहीं है। यदि आप बल्क-डाउनलोड के बजाय क्वेरी करना पसंद करते हैं, तो खोज API आकस्मिक लुकअप को कवर करता है, और llms.txt सब कुछ मशीन-पठनीय एक स्थान पर दस्तावेज करता है।
एट्रिब्यूशन, और हम क्या देखना चाहेंगे
हर रिकॉर्ड original_source के माध्यम से एक वास्तविक लेखक तक वापस जाता है, इसलिए इस डेटा से निकलने वाले किसी भी विश्लेषण, चार्ट या लेखन को wikiprompt.org और उसके द्वारा एकत्र किए गए मूल रचनाकारों दोनों को श्रेय देना चाहिए। हम अंतर्निहित प्रॉम्प्ट्स पर औपचारिक लाइसेंस नहीं रखते; हम कैटलॉग हैं, कॉपीराइट धारक नहीं, और डेटासेट उसी आधार पर पेश किया जाता है: खोजने के लिए स्वतंत्र, कृपया श्रेय दें।
यदि आप संग्रह पर कुछ दिलचस्प चलाते हैं, मॉडल-अपनाने के चार्ट से लेकर शैली वर्गीकरण तक, या अध्ययन कि प्रॉम्प्ट लंबाई गुणवत्ता स्कोर के साथ कैसे सहसंबंधित होती है, हम इसे देखना चाहते हैं। पचपन हजार प्रॉम्प्ट्स यह कहने के लिए पर्याप्त संकेत हैं कि लोग अभी AI का उपयोग कैसे कर रहे हैं, और ईमानदार जवाब यह है कि हमने खुद भी उस पर हर विश्लेषण नहीं चलाया है।
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read