55,000 वास्तविक-विश्व AI प्रॉम्प्ट्स पर फाइन-ट्यूनिंग
विकिप्रॉम्प्ट का सार्वजनिक डेटासेट 55,000 से अधिक वास्तविक, मानव-लिखित प्रॉम्प्ट प्रदान करता है, जो आउटपुट और गुणवत्ता संकेत के साथ जोड़े गए हैं - यह सिंथेटिक कॉर्पोरा से अलग तरह का प्रशिक्षण डेटा है।

55,000 वास्तविक-विश्व AI प्रॉम्प्ट्स पर फाइन-ट्यूनिंग
अधिकांश प्रॉम्प्ट डेटासेट जो फाइन-ट्यूनिंग और मूल्यांकन के लिए उपयोग किए जाते हैं, सिंथेटिक होते हैं: किसी अन्य मॉडल द्वारा उत्पन्न, तीसरे मॉडल द्वारा फ़िल्टर किए गए, और चौथे द्वारा स्कोर किए गए। यह पाइपलाइन सस्ती है और यह स्केल करती है, लेकिन इसका मतलब यह भी है कि डेटा ने कभी मानवीय इरादे को छुआ नहीं है। किसी को वास्तव में आउटपुट की आवश्यकता नहीं थी। कोई भी वास्तविक काम पूरा करने की कोशिश नहीं कर रहा था।
विकीप्रॉम्प्ट के पीछे का डेटासेट विपरीत प्रकार का आर्टिफैक्ट है। यह 55,000 से अधिक प्रॉम्प्ट्स हैं जो वास्तविक लोगों ने लिखे, सार्वजनिक रूप से पोस्ट किए, और एक परिणाम उत्पन्न करने के लिए उपयोग किए जिसे वे साझा करने के लिए पर्याप्त महत्वपूर्ण मानते थे: एक पोर्ट्रेट, एक मार्केटिंग हेडलाइन, कोड का एक टुकड़ा, एक पाठ योजना। "मॉडल को प्रशिक्षित करने के लिए लिखा गया" और "काम पूरा करने के लिए लिखा गया" के बीच का यह अंतर ही पूरा कारण है कि यदि आप LLM बना रहे हैं या मूल्यांकन कर रहे हैं तो यह डेटा दूसरी नज़र के लायक है।
वास्तविक प्रॉम्प्ट्स सिंथेटिक वाले से अलग संकेत क्यों देते हैं
सिंथेटिक प्रॉम्प्ट कॉर्पोरा उस चीज़ के आसपास क्लस्टर होता है जो जनरेटिंग मॉडल एक प्रशंसनीय निर्देश मानता है: व्याकरणिक रूप से साफ, विषयों पर समान रूप से वितरित, क्योंकि किसी ने एक टैक्सोनॉमी डिज़ाइन की और मॉडल से इसे भरने के लिए कहा। वास्तविक प्रॉम्प्ट्स अधिक गड़बड़ होते हैं, और वह गड़बड़ी जानकारी है। लोग कम-विनिर्दिष्ट करते हैं, अधिक-विनिर्दिष्ट करते हैं, बाधाओं को अजीब क्रम में जोड़ते हैं, और विवरण के बजाय एक उचित नाम से एक शैली का संदर्भ देते हैं। यदि आप एक मॉडल को वास्तव में उपयोगी होने के लिए प्रशिक्षित कर रहे हैं, न कि केवल बेंचमार्क पर अच्छा व्यवहार करने के लिए, तो वास्तविक अनुरोधों का वितरण उसके करीब है जो आपका मॉडल वास्तव में प्रोडक्शन में सामना करेगा।
यहां एक चयन प्रभाव भी है जो आपके पक्ष में काम करता है। इस डेटासेट में हर रिकॉर्ड एक प्रॉम्प्ट है जिसे किसी ने प्रकाशित करने की जहमत उठाई क्योंकि यह इतना अच्छा काम किया कि दिखाने लायक था। यह "लोगों द्वारा टाइप किए गए प्रॉम्प्ट्स" के यादृच्छिक नमूने के समान नहीं है, लेकिन फाइन-ट्यूनिंग या फ्यू-शॉट रिट्रीवल के लिए यह शायद एक बेहतर नमूना है: एक प्रॉम्प्ट जो इस बात के सबूत के साथ जोड़ा गया है कि इसने कुछ अच्छा उत्पन्न किया।
डंप में वास्तव में क्या है
/dataset/prompts खींचें और प्रत्येक रिकॉर्ड आपको देता है:
content: वास्तविक प्रॉम्प्ट टेक्स्ट, वह चीज़ जिसे आप एक प्रशिक्षण उदाहरण में डालेंगे।model: प्रॉम्प्ट किस AI मॉडल को लक्षित करता है या जिसके खिलाफ चलाया गया था (GPT Image, Midjourney, Claude, Nano Banana, Kling, और अन्य), ताकि आप एक मानने के बजाय लक्षित मॉडल द्वारा स्लाइस कर सकें।category और tags: विषय-सशर्त सैंपलिंग या स्तरीकृत स्प्लिट्स के लिए मोटे और बारीक लेबल।metadata: संरचित फ़ील्ड जिनमें media_type, aspect_ratio, style, और जहां एक मानव संपादक ने आउटपुट को स्कोर किया है, एक गुणवत्ता मूल्यांकन शामिल है जो रचनात्मकता, उपयोगिता, और तकनीकी निष्पादन जैसी चीज़ों को कवर करता है।media: वास्तविक आउटपुट (छवि या वीडियो URL) जो उस प्रॉम्प्ट से जुड़ा है जिसने इसे उत्पन्न किया, जो लैब के बाहर आपको मिलने वाली ग्राउंड ट्रुथ के सबसे करीब है।author और original_source: मूल पोस्ट तक प्रोवेनेंस।वह अंतिम समूह, मीडिया प्लस मेटाडेटा प्लस गुणवत्ता मूल्यांकन, वह है जो सिंथेटिक डेटासेट संरचनात्मक रूप से नहीं रख सकते। एक उत्पन्न प्रॉम्प्ट कॉर्पस आपको बता सकता है कि एक प्रॉम्प्ट क्या कहता है। यह आपको, एक स्वतंत्र मानव निर्णय से, यह नहीं बता सकता कि उसने जो उत्पन्न किया वह वास्तव में अच्छा था या नहीं। विकीप्रॉम्प्ट की संपादकीय परत का मतलब है कि रिकॉर्ड्स का एक सार्थक हिस्सा ठीक उसी निर्णय के साथ आता है, जो उन्हें रिवॉर्ड मॉडल या LLM-एज़-जज कैलिब्रेशन सेट के लिए कमजोर लेबल के रूप में उपयोग करने योग्य बनाता है, न कि केवल इंस्ट्रक्शन-ट्यूनिंग इनपुट के रूप में।
इस स्मारकीय ईंट वास्तुकला शॉट जैसा प्रॉम्प्ट लें: मूल्य केवल टेक्स्ट नहीं है, यह टेक्स्ट है जो उस छवि के बगल में है जो उसने वास्तव में उत्पन्न की, जो आपको जांचने देता है कि क्या एक उम्मीदवार मॉडल उसी निर्देश से समान रूप से कुछ उत्पन्न करेगा। इस वूशिया तलवार-मेडेन थांगका रचना या इस तांग राजवंश पोर्ट्रेट प्रॉम्प्ट जैसे स्टाइलिश टुकड़े के साथ भी यही कहानी है: प्रत्येक एक विशिष्ट, राय-युक्त निर्देश को एक ठोस दृश्य परिणाम के साथ जोड़ता है, जो ठीक उसी तरह का (निर्देश, आउटपुट) जोड़ा है जिसे किसी अन्य तरीके से बड़े पैमाने पर सोर्स करना मुश्किल है।
वास्तविक उपयोग के लिए इसे फ़िल्टर और संरचित करना
कच्चा डंप डिज़ाइन द्वारा अनफ़िल्टर्ड है (विकीप्रॉम्प्ट के अपने मॉडरेशन से परे: केवल सक्रिय, साफ प्रॉम्प्ट्स निर्यात किए जाते हैं), इसलिए इस पर फाइन-ट्यून इंगित करने से पहले, तय करें कि आप किसके लिए अनुकूलन कर रहे हैं और तदनुसार फ़िल्टर करें:
model फ़ील्ड का उपयोग करके, यदि आप एक मॉडल-विशिष्ट एडेप्टर बना रहे हैं और नहीं चाहते कि, कहें, Midjourney-शैली सिंटैक्स एक Claude प्रॉम्प्ट सेट में लीक हो।creative, coding, marketing, research, और पांच और) पूरे कैटलॉग के बजाय। UI में क्रिएटिव प्रॉम्प्ट्स ब्राउज़ करना यह देखने का एक तेज़ तरीका है कि एक श्रेणी वास्तव में क्या रखती है, इससे पहले कि आप उस पर फ़िल्टर करने के लिए प्रतिबद्ध हों।यांत्रिक रूप से, पेजिनेशन कीसेट-आधारित है: प्रत्येक प्रतिक्रिया में एक next URL शामिल होता है, और आप इसे तब तक फॉलो करते हैं जब तक next null नहीं लौटता। प्रति पेज 500 रिकॉर्ड तक:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
एक न्यूनतम सब-कुछ-खींचें लूप पायथन में इस तरह दिखता है:
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
resp = requests.get(url).json()
records.extend(resp["records"])
url = resp.get("next")
print(len(records), "records")
कोई API कुंजी नहीं, CORS सक्षम है, और यह एज-कैश्ड है, इसलिए कैटलॉग का पूरा क्रॉल तेज़ है और किसी के ओरिजिन सर्वर को हथौड़ा नहीं मारता। बल्क पुल के बजाय इंटरैक्टिव एक्सेस चाहते हैं, तो वही कैटलॉग सर्च API के माध्यम से क्वेरी करने योग्य है, और एक MCP सर्वर है यदि आप इसे एक एजेंट में वायर कर रहे हैं, न कि एक प्रशिक्षण पाइपलाइन में।
एट्रिब्यूशन वैकल्पिक नहीं है, और यह एक लाइसेंस नहीं है
इस डेटा के बारे में सटीक रहें। विकीप्रॉम्प्ट सार्वजनिक पोस्ट एकत्र करता है; यह अंतर्निहित सामग्री पर एक औपचारिक लाइसेंस नहीं रखता या प्रदान नहीं करता, और न ही यह डंप करता है। हर प्रॉम्प्ट में एक original_source है जो उस पोस्ट की ओर इशारा करता है जिससे वह आया था और एक author फ़ील्ड है जो उस व्यक्ति का नाम देता है जिसने इसे लिखा। यदि आप इस डेटा पर फाइन-ट्यून करते हैं, तो एक मॉडल कार्ड शिप करें जो विकीप्रॉम्प्ट को एकत्रक के रूप में श्रेय देता है और किसी भी चीज़ के लिए मूल लेखकों को एट्रिब्यूशन संरक्षित करता है जिसे आप पुनर्वितरित या सीधे उद्धृत करते हैं। यह एक कम बार है, और यह सही है: यह डेटासेट मौजूद है क्योंकि हजारों लोगों ने अपने काम को सार्वजनिक रूप से साझा करना चुना, और इसे मुक्त-तैरते प्रशिक्षण अपशिष्ट के रूप में मानना वह तरीका है जिससे इस तरह का डेटा उत्पन्न करने वाला पारिस्थितिकी तंत्र अस्तित्व में रहना बंद कर देता है।
यदि आप तय कर रहे हैं कि वास्तविक-लेकिन-गड़बड़ सिंथेटिक-लेकिन-साफ से आपके उपयोग के मामले के लिए बेहतर है, तो ईमानदार उत्तर यह है कि यह इस पर निर्भर करता है कि आप किसके लिए प्रशिक्षित कर रहे हैं। यदि आपके मॉडल को उन चीज़ों के वास्तविक वितरण को संभालने की आवश्यकता है जो लोग पूछते हैं, साथ ही स्वतंत्र निर्णय कि परिणाम अच्छे थे या नहीं, तो यह कुछ सार्वजनिक कॉर्पोरा में से एक है जहां आपको दोनों एक ही रिकॉर्ड में मिलते हैं।
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read