Blog›Guides

55,000 वास्तविक-विश्व AI प्रॉम्प्ट्स पर फाइन-ट्यूनिंग

विकिप्रॉम्प्ट का सार्वजनिक डेटासेट 55,000 से अधिक वास्तविक, मानव-लिखित प्रॉम्प्ट प्रदान करता है, जो आउटपुट और गुणवत्ता संकेत के साथ जोड़े गए हैं - यह सिंथेटिक कॉर्पोरा से अलग तरह का प्रशिक्षण डेटा है।

55,000 वास्तविक-विश्व AI प्रॉम्प्ट्स पर फाइन-ट्यूनिंग

55,000 वास्तविक-विश्व AI प्रॉम्प्ट्स पर फाइन-ट्यूनिंग

अधिकांश प्रॉम्प्ट डेटासेट जो फाइन-ट्यूनिंग और मूल्यांकन के लिए उपयोग किए जाते हैं, सिंथेटिक होते हैं: किसी अन्य मॉडल द्वारा उत्पन्न, तीसरे मॉडल द्वारा फ़िल्टर किए गए, और चौथे द्वारा स्कोर किए गए। यह पाइपलाइन सस्ती है और यह स्केल करती है, लेकिन इसका मतलब यह भी है कि डेटा ने कभी मानवीय इरादे को छुआ नहीं है। किसी को वास्तव में आउटपुट की आवश्यकता नहीं थी। कोई भी वास्तविक काम पूरा करने की कोशिश नहीं कर रहा था।

विकीप्रॉम्प्ट के पीछे का डेटासेट विपरीत प्रकार का आर्टिफैक्ट है। यह 55,000 से अधिक प्रॉम्प्ट्स हैं जो वास्तविक लोगों ने लिखे, सार्वजनिक रूप से पोस्ट किए, और एक परिणाम उत्पन्न करने के लिए उपयोग किए जिसे वे साझा करने के लिए पर्याप्त महत्वपूर्ण मानते थे: एक पोर्ट्रेट, एक मार्केटिंग हेडलाइन, कोड का एक टुकड़ा, एक पाठ योजना। "मॉडल को प्रशिक्षित करने के लिए लिखा गया" और "काम पूरा करने के लिए लिखा गया" के बीच का यह अंतर ही पूरा कारण है कि यदि आप LLM बना रहे हैं या मूल्यांकन कर रहे हैं तो यह डेटा दूसरी नज़र के लायक है।

वास्तविक प्रॉम्प्ट्स सिंथेटिक वाले से अलग संकेत क्यों देते हैं

सिंथेटिक प्रॉम्प्ट कॉर्पोरा उस चीज़ के आसपास क्लस्टर होता है जो जनरेटिंग मॉडल एक प्रशंसनीय निर्देश मानता है: व्याकरणिक रूप से साफ, विषयों पर समान रूप से वितरित, क्योंकि किसी ने एक टैक्सोनॉमी डिज़ाइन की और मॉडल से इसे भरने के लिए कहा। वास्तविक प्रॉम्प्ट्स अधिक गड़बड़ होते हैं, और वह गड़बड़ी जानकारी है। लोग कम-विनिर्दिष्ट करते हैं, अधिक-विनिर्दिष्ट करते हैं, बाधाओं को अजीब क्रम में जोड़ते हैं, और विवरण के बजाय एक उचित नाम से एक शैली का संदर्भ देते हैं। यदि आप एक मॉडल को वास्तव में उपयोगी होने के लिए प्रशिक्षित कर रहे हैं, न कि केवल बेंचमार्क पर अच्छा व्यवहार करने के लिए, तो वास्तविक अनुरोधों का वितरण उसके करीब है जो आपका मॉडल वास्तव में प्रोडक्शन में सामना करेगा।

यहां एक चयन प्रभाव भी है जो आपके पक्ष में काम करता है। इस डेटासेट में हर रिकॉर्ड एक प्रॉम्प्ट है जिसे किसी ने प्रकाशित करने की जहमत उठाई क्योंकि यह इतना अच्छा काम किया कि दिखाने लायक था। यह "लोगों द्वारा टाइप किए गए प्रॉम्प्ट्स" के यादृच्छिक नमूने के समान नहीं है, लेकिन फाइन-ट्यूनिंग या फ्यू-शॉट रिट्रीवल के लिए यह शायद एक बेहतर नमूना है: एक प्रॉम्प्ट जो इस बात के सबूत के साथ जोड़ा गया है कि इसने कुछ अच्छा उत्पन्न किया।

डंप में वास्तव में क्या है

/dataset/prompts खींचें और प्रत्येक रिकॉर्ड आपको देता है:

  • content: वास्तविक प्रॉम्प्ट टेक्स्ट, वह चीज़ जिसे आप एक प्रशिक्षण उदाहरण में डालेंगे।
  • model: प्रॉम्प्ट किस AI मॉडल को लक्षित करता है या जिसके खिलाफ चलाया गया था (GPT Image, Midjourney, Claude, Nano Banana, Kling, और अन्य), ताकि आप एक मानने के बजाय लक्षित मॉडल द्वारा स्लाइस कर सकें।
  • category और tags: विषय-सशर्त सैंपलिंग या स्तरीकृत स्प्लिट्स के लिए मोटे और बारीक लेबल।
  • metadata: संरचित फ़ील्ड जिनमें media_type, aspect_ratio, style, और जहां एक मानव संपादक ने आउटपुट को स्कोर किया है, एक गुणवत्ता मूल्यांकन शामिल है जो रचनात्मकता, उपयोगिता, और तकनीकी निष्पादन जैसी चीज़ों को कवर करता है।
  • media: वास्तविक आउटपुट (छवि या वीडियो URL) जो उस प्रॉम्प्ट से जुड़ा है जिसने इसे उत्पन्न किया, जो लैब के बाहर आपको मिलने वाली ग्राउंड ट्रुथ के सबसे करीब है।
  • author और original_source: मूल पोस्ट तक प्रोवेनेंस।
  • वह अंतिम समूह, मीडिया प्लस मेटाडेटा प्लस गुणवत्ता मूल्यांकन, वह है जो सिंथेटिक डेटासेट संरचनात्मक रूप से नहीं रख सकते। एक उत्पन्न प्रॉम्प्ट कॉर्पस आपको बता सकता है कि एक प्रॉम्प्ट क्या कहता है। यह आपको, एक स्वतंत्र मानव निर्णय से, यह नहीं बता सकता कि उसने जो उत्पन्न किया वह वास्तव में अच्छा था या नहीं। विकीप्रॉम्प्ट की संपादकीय परत का मतलब है कि रिकॉर्ड्स का एक सार्थक हिस्सा ठीक उसी निर्णय के साथ आता है, जो उन्हें रिवॉर्ड मॉडल या LLM-एज़-जज कैलिब्रेशन सेट के लिए कमजोर लेबल के रूप में उपयोग करने योग्य बनाता है, न कि केवल इंस्ट्रक्शन-ट्यूनिंग इनपुट के रूप में।

    इस स्मारकीय ईंट वास्तुकला शॉट जैसा प्रॉम्प्ट लें: मूल्य केवल टेक्स्ट नहीं है, यह टेक्स्ट है जो उस छवि के बगल में है जो उसने वास्तव में उत्पन्न की, जो आपको जांचने देता है कि क्या एक उम्मीदवार मॉडल उसी निर्देश से समान रूप से कुछ उत्पन्न करेगा। इस वूशिया तलवार-मेडेन थांगका रचना या इस तांग राजवंश पोर्ट्रेट प्रॉम्प्ट जैसे स्टाइलिश टुकड़े के साथ भी यही कहानी है: प्रत्येक एक विशिष्ट, राय-युक्त निर्देश को एक ठोस दृश्य परिणाम के साथ जोड़ता है, जो ठीक उसी तरह का (निर्देश, आउटपुट) जोड़ा है जिसे किसी अन्य तरीके से बड़े पैमाने पर सोर्स करना मुश्किल है।

    वास्तविक उपयोग के लिए इसे फ़िल्टर और संरचित करना

    कच्चा डंप डिज़ाइन द्वारा अनफ़िल्टर्ड है (विकीप्रॉम्प्ट के अपने मॉडरेशन से परे: केवल सक्रिय, साफ प्रॉम्प्ट्स निर्यात किए जाते हैं), इसलिए इस पर फाइन-ट्यून इंगित करने से पहले, तय करें कि आप किसके लिए अनुकूलन कर रहे हैं और तदनुसार फ़िल्टर करें:

  • लक्षित मॉडल द्वारा, model फ़ील्ड का उपयोग करके, यदि आप एक मॉडल-विशिष्ट एडेप्टर बना रहे हैं और नहीं चाहते कि, कहें, Midjourney-शैली सिंटैक्स एक Claude प्रॉम्प्ट सेट में लीक हो।
  • श्रेणी द्वारा, यदि आप एक डोमेन-विशिष्ट स्लाइस चाहते हैं (creative, coding, marketing, research, और पांच और) पूरे कैटलॉग के बजाय। UI में क्रिएटिव प्रॉम्प्ट्स ब्राउज़ करना यह देखने का एक तेज़ तरीका है कि एक श्रेणी वास्तव में क्या रखती है, इससे पहले कि आप उस पर फ़िल्टर करने के लिए प्रतिबद्ध हों।
  • गुणवत्ता मूल्यांकन द्वारा, उन रिकॉर्ड्स को हटाना या कम-वेट करना जहां मेटाडेटा स्कोर कम है, यदि आपका लक्ष्य कच्चे कवरेज के बजाय एक रिवॉर्ड सिग्नल है।
  • हालिया (`created_at`/`updated_at`) द्वारा, यदि आप उन प्रॉम्प्ट्स की परवाह करते हैं जो वर्तमान मॉडल क्षमताओं को दर्शाते हैं, न कि पुरानी पीढ़ी के टूल्स के पैटर्न।
  • यांत्रिक रूप से, पेजिनेशन कीसेट-आधारित है: प्रत्येक प्रतिक्रिया में एक next URL शामिल होता है, और आप इसे तब तक फॉलो करते हैं जब तक next null नहीं लौटता। प्रति पेज 500 रिकॉर्ड तक:

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    एक न्यूनतम सब-कुछ-खींचें लूप पायथन में इस तरह दिखता है:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    records = []

    while url:

    resp = requests.get(url).json()

    records.extend(resp["records"])

    url = resp.get("next")

    print(len(records), "records")

    कोई API कुंजी नहीं, CORS सक्षम है, और यह एज-कैश्ड है, इसलिए कैटलॉग का पूरा क्रॉल तेज़ है और किसी के ओरिजिन सर्वर को हथौड़ा नहीं मारता। बल्क पुल के बजाय इंटरैक्टिव एक्सेस चाहते हैं, तो वही कैटलॉग सर्च API के माध्यम से क्वेरी करने योग्य है, और एक MCP सर्वर है यदि आप इसे एक एजेंट में वायर कर रहे हैं, न कि एक प्रशिक्षण पाइपलाइन में।

    एट्रिब्यूशन वैकल्पिक नहीं है, और यह एक लाइसेंस नहीं है

    इस डेटा के बारे में सटीक रहें। विकीप्रॉम्प्ट सार्वजनिक पोस्ट एकत्र करता है; यह अंतर्निहित सामग्री पर एक औपचारिक लाइसेंस नहीं रखता या प्रदान नहीं करता, और न ही यह डंप करता है। हर प्रॉम्प्ट में एक original_source है जो उस पोस्ट की ओर इशारा करता है जिससे वह आया था और एक author फ़ील्ड है जो उस व्यक्ति का नाम देता है जिसने इसे लिखा। यदि आप इस डेटा पर फाइन-ट्यून करते हैं, तो एक मॉडल कार्ड शिप करें जो विकीप्रॉम्प्ट को एकत्रक के रूप में श्रेय देता है और किसी भी चीज़ के लिए मूल लेखकों को एट्रिब्यूशन संरक्षित करता है जिसे आप पुनर्वितरित या सीधे उद्धृत करते हैं। यह एक कम बार है, और यह सही है: यह डेटासेट मौजूद है क्योंकि हजारों लोगों ने अपने काम को सार्वजनिक रूप से साझा करना चुना, और इसे मुक्त-तैरते प्रशिक्षण अपशिष्ट के रूप में मानना वह तरीका है जिससे इस तरह का डेटा उत्पन्न करने वाला पारिस्थितिकी तंत्र अस्तित्व में रहना बंद कर देता है।

    यदि आप तय कर रहे हैं कि वास्तविक-लेकिन-गड़बड़ सिंथेटिक-लेकिन-साफ से आपके उपयोग के मामले के लिए बेहतर है, तो ईमानदार उत्तर यह है कि यह इस पर निर्भर करता है कि आप किसके लिए प्रशिक्षित कर रहे हैं। यदि आपके मॉडल को उन चीज़ों के वास्तविक वितरण को संभालने की आवश्यकता है जो लोग पूछते हैं, साथ ही स्वतंत्र निर्णय कि परिणाम अच्छे थे या नहीं, तो यह कुछ सार्वजनिक कॉर्पोरा में से एक है जहां आपको दोनों एक ही रिकॉर्ड में मिलते हैं।

    Tags
    open-data·dataset·fine-tuning·machine-learning·ai-prompts·training-data·api