Blog›Guides

विकिप्रॉम्प्ट कॉर्पस का उपयोग और उद्धरण अनुसंधान के लिए

शोधकर्ताओं, छात्रों और पत्रकारों के लिए एक मार्गदर्शिका, जिसमें बताया गया है कि कैसे Wikiprompt डेटासेट को प्रतिलिपि-योग्य रूप से खींचा जाए, इसे सही ढंग से श्रेय दिया जाए, और एक क्यूरेटेड, विकसित होते, एकत्रित कॉर्पस के रूप में इसकी सीमाओं को समझा जाए।

विकिप्रॉम्प्ट कॉर्पस का उपयोग और उद्धरण अनुसंधान के लिए

विकिप्रॉम्प्ट कॉर्पस का उपयोग और उद्धरण अनुसंधान के लिए

प्रॉम्प्ट इंजीनियरिंग बड़े पैमाने पर टेक्स्ट उत्पन्न करती है, और बड़े पैमाने पर टेक्स्ट ठीक वही चीज़ है जिसका अध्ययन शोधकर्ता, छात्र और पत्रकार करना पसंद करते हैं। विभिन्न मॉडलों को लक्षित करने वाले छवि प्रॉम्प्ट्स में कौन से वाक्यांश पैटर्न दोहराए जाते हैं? रचनात्मक प्रॉम्प्ट्स संरचनात्मक रूप से कोडिंग या उत्पादकता प्रॉम्प्ट्स से कैसे भिन्न होते हैं? ये उत्तर देने योग्य प्रश्न हैं, लेकिन केवल तभी जब उनके उत्तर देने के लिए कोई कॉर्पस मौजूद हो, और अब तक वह कॉर्पस व्यक्तिगत सोशल अकाउंट्स की टाइमलाइनों में बिखरा हुआ था, बिना अनुक्रमित और प्रभावी रूप से अध्ययन योग्य नहीं।

विकिप्रॉम्प्ट ने पिछले कई महीनों में ठीक इसी तरह का संग्रह तैयार किया है: खुले वेब से लिए गए सार्वजनिक, उपयोगकर्ता-सबमिट किए गए AI प्रॉम्प्ट्स, व्यवस्थित और टैग किए गए। कैटलॉग में अब 55,000 से अधिक प्रॉम्प्ट्स हैं, जिनमें ChatGPT, Claude और Gemini जैसे टेक्स्ट मॉडल, और Midjourney, GPT Image, Seedance, Veo, Kling और Nano Banana जैसे छवि या वीडियो मॉडल शामिल हैं। यह कॉर्पस एक सार्वजनिक बल्क डेटासेट के रूप में उपलब्ध है, और यह पोस्ट अकादमिक या पत्रकारिता कार्यों में इसका जिम्मेदारी से उपयोग करने के लिए एक मार्गदर्शिका है: इसे प्रतिलिपि योग्य रूप से कैसे खींचें, इसका श्रेय कैसे दें, और इसकी सीमाएँ कहाँ हैं।

यह कॉर्पस क्यों

अनुसंधान संदर्भों में प्रसारित होने वाले अधिकांश प्रॉम्प्ट डेटासेट छोटे हाथ से एकत्र किए गए नमूने या अस्पष्ट उत्पत्ति वाले स्क्रैप किए गए स्नैपशॉट होते हैं। विकिप्रॉम्प्ट का तीन तरीकों से अंतर है।

पहला, हर रिकॉर्ड एक वास्तविक, श्रेय देने योग्य उत्पत्ति से जुड़ा होता है: एक original_source फ़ील्ड मूल पोस्ट से लिंक करता है, और एक author फ़ील्ड उस व्यक्ति का नाम देता है जिसने इसे लिखा था। यह वास्तविक सार्वजनिक प्रॉम्प्ट-साझाकरण गतिविधि का एक क्यूरेटेड इंडेक्स है, न कि सिंथेटिक या अनाम डेटासेट।

दूसरा, यह संरचित और रिकॉर्ड्स के बीच तुलनीय है। हर प्रॉम्प्ट में एक category (रचनात्मक, विपणन, व्यक्तिगत, उत्पादकता, कोडिंग, शिक्षा, व्यवसाय, अनुसंधान, या अन्य), tags, लक्षित AI सिस्टम का नाम देने वाला एक model फ़ील्ड, और जहाँ लागू हो, एक metadata ऑब्जेक्ट होता है जिसमें media_type, aspect_ratio, style, और एक संपादकीय गुणवत्ता मूल्यांकन शामिल होता है, जो सार्वजनिक डेटासेट के लिए असामान्य है और यह अध्ययन करने के लिए उपयोगी है कि एक मजबूत प्रॉम्प्ट को कमजोर से क्या अलग करता है।

तीसरा, यह बिना किसी बाधा के सुलभ है: कोई API कुंजी नहीं, दर सीमाओं से निपटने की आवश्यकता नहीं, बनाए रखने के लिए कोई स्क्रैपिंग इंफ्रास्ट्रक्चर नहीं। यह प्रतिलिपि योग्यता के लिए मायने रखता है, जो इस पोस्ट का मुख्य बिंदु है।

डेटा को प्रतिलिपि योग्य रूप से खींचना

डेटासेट दो एंडपॉइंट्स के रूप में उजागर होता है। डेटासेट मेनिफेस्ट एक JSON दस्तावेज़ लौटाता है जो संग्रह का वर्णन करता है: total_prompts, पूर्ण record_fields स्कीमा, और पेजिनेशन योजना। कैटलॉग स्वयं /dataset/prompts पर रहता है, जो JSON भी है, पेज नंबरों के बजाय कीसेट कर्सर के साथ पेजिनेटेड।

कीसेट पेजिनेशन को उजागर करना उचित है क्योंकि यही एक शोध पुल को प्रतिलिपि योग्य बनाता है। ऑफसेट-आधारित पेजिनेशन आपके नीचे स्थानांतरित हो जाता है यदि क्रॉल के दौरान रिकॉर्ड जोड़े या हटाए जाते हैं, चुपचाप पंक्तियों को डुप्लिकेट या छोड़ देता है। एक कीसेट कर्सर में वह विफलता मोड नहीं होता है: प्रत्येक प्रतिक्रिया में next URL का पालन करें जब तक यह null न लौटाए, और प्रत्येक पेज एक स्थिर स्थिति से जुड़ा होता है, न कि एक पंक्ति गणना से जो बह सकती है।

एक न्यूनतम पुल:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

limit प्रति पेज 500 रिकॉर्ड तक स्वीकार करता है (डिफ़ॉल्ट 200), और कर्सर पैरामीटर after है। Python में एक पूर्ण क्रॉल एक छोटा लूप है:

import requests

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

records = []

while url:

resp = requests.get(url, timeout=30).json()

records.extend(resp["prompts"])

url = resp.get("next")

print(len(records), "records pulled")

प्रतिक्रिया Access-Control-Allow-Origin: * और भारी एज कैशिंग के साथ परोसी जाती है, इसलिए यह लूप सस्ता है और बैकएंड प्रॉक्सी की आवश्यकता नहीं होती है। एक निश्चित, प्रतिलिपि योग्य नमूने के लिए, अपने डेटासेट स्नैपशॉट के साथ अपने पुल की तारीख दर्ज करें, क्योंकि कॉर्पस सक्रिय रूप से बढ़ रहा है।

एक रिकॉर्ड में क्या होता है

प्रत्येक रिकॉर्ड में टेक्स्ट विश्लेषण के लिए फ़ील्ड शामिल हैं (title, description, content, वास्तविक प्रॉम्प्ट टेक्स्ट), वर्गीकरण के लिए (category, tags, model), और मल्टीमॉडल कार्य के लिए (media, छवि या वीडियो URL की एक सरणी, साथ ही संरचित metadata ऑब्जेक्ट)। टाइमस्टैम्प (created_at, updated_at) अनुदैर्ध्य अध्ययन का समर्थन करते हैं, और slug प्लस url हर रिकॉर्ड को एक स्थिर, डीरेफरेंस योग्य पहचानकर्ता देते हैं, जो केवल समग्र आँकड़ों के बजाय विशिष्ट उदाहरणों का उद्धरण देने के लिए है।

इसे ठोस बनाने के लिए, एक उद्धरण एक वास्तुशिल्प फोटोग्राफी प्रॉम्प्ट की ओर इशारा कर सकता है जो एक एकल ईंट के चारों ओर बनाया गया है जो एक विशाल छाया डालती है, या एक शैलीगत रूप से विशिष्ट प्रविष्टि जैसे शरद ऋतु की कल्पना को तिब्बती मंडला रूपांकन के साथ जोड़ने वाला एक चित्र, या वुक्सिया और थांगका सौंदर्य परंपराओं पर आधारित एक। उन पृष्ठों में से प्रत्येक उस रिकॉर्ड के लिए विहित, उद्धरण योग्य स्थान है: स्थिर URL, मूल लेखक को दृश्य श्रेय, और मूल पोस्ट के लिए एक लिंक।

बल्क पुल के बजाय लाइव फ़िल्टरिंग के लिए, खोज API उसी कैटलॉग पर क्वेरी-आधारित लुकअप का समर्थन करता है, और मशीन-पठनीय सारांश llms.txt पर रहते हैं। कोई भी व्यवस्थित नमूने के लिए बल्क डेटासेट की जगह नहीं लेता, लेकिन दोनों स्पॉट-चेक या स्कोप्ड नमूनों में मदद करते हैं, जैसे कि उस डोमेन तक सीमित अध्ययन के लिए केवल रचनात्मक श्रेणी खींचना।

श्रेय और उद्धरण

विकिप्रॉम्प्ट एक एग्रीगेटर है, कॉर्पस में प्रॉम्प्ट्स का मूल लेखक नहीं। सामग्री व्यक्तिगत रचनाकारों के सार्वजनिक पोस्ट से आती है, और सही श्रेय के लिए दोनों परतों का उद्धरण आवश्यक है: विकिप्रॉम्प्ट को डेटासेट स्रोत के रूप में, और किसी भी रिकॉर्ड के लिए विशिष्ट original_source जिसे आप उद्धृत करते हैं, पुनरुत्पादित करते हैं, या विस्तार से विश्लेषण करते हैं। हम अंतर्निहित सामग्री पर औपचारिक लाइसेंस नहीं रखते या दावा नहीं करते; पुन: उपयोग को व्यापक अधिकारों के अनुदान के बजाय उचित रूप से श्रेय देने के अनुरोध के रूप में मानें। यदि कोई उपयोग मामला ऐसा प्रश्न उठाता है जिसका डेटासेट के फ़ील्ड उत्तर नहीं देते हैं, तो रिकॉर्ड को उसके original_source पर वापस ट्रेस करें और अपने दस्तावेज़ीकरण में उस वंशावली को नोट करें।

संपूर्ण कॉर्पस के लिए एक उचित उद्धरण प्रारूप:

विकिप्रॉम्प्ट कॉर्पस। [तारीख] को https://www.wikiprompt.org/dataset/prompts से प्राप्त।

एकत्रित सार्वजनिक AI प्रॉम्प्ट डेटा; व्यक्तिगत रिकॉर्ड original_source फ़ील्ड के माध्यम से मूल लेखकों को श्रेय देते हैं।

किसी व्यक्तिगत प्रॉम्प्ट का उद्धरण देते समय, उसके विहित URL (wikiprompt.org/<slug>) का उद्धरण दें और, जहाँ विश्लेषण मूल संदर्भ पर निर्भर करता है, लिंक किए गए original_source का भी।

सीमाएँ जिन्हें स्पष्ट रूप से बताना उचित है

यह एक क्यूरेटेड कॉर्पस है, ऑनलाइन सभी AI प्रॉम्प्ट गतिविधि का यादृच्छिक नमूना नहीं। केवल सक्रिय, स्वच्छ प्रॉम्प्ट्स निर्यात किए जाते हैं; गुणवत्ता या नीति कारणों से हटाई गई कोई भी चीज़ दिखाई नहीं देगी। यह इसे अध्ययन करने के लिए उपयुक्त बनाता है कि एक मॉडरेटेड, सार्वजनिक-सामना करने वाला प्रॉम्प्ट संग्रह कैसा दिखता है, लेकिन सामान्य रूप से "लोग AI मॉडल्स को कैसे प्रॉम्प्ट करते हैं" के बारे में दावों को तदनुसार सीमित किया जाना चाहिए।

कॉर्पस भी बढ़ रहा है, न कि स्थिर। एक सप्ताह का पुल अगले सप्ताह के पुल से बिल्कुल मेल नहीं खाएगा। जहाँ सटीक प्रतिलिपि योग्यता मायने रखती है, डेटा को स्वयं स्नैपशॉट करें (ऊपर कीसेट पेजिनेशन इसे सस्ता बनाता है) और पुनर्प्राप्ति तिथि और, आदर्श रूप से, अपने स्नैपशॉट की रिकॉर्ड गणना का उद्धरण दें, बजाय पाठकों को लाइव एंडपॉइंट की ओर इशारा करने और यह मानने के कि यह बाद में मेल खाएगा।

अंत में, metadata में गुणवत्ता मूल्यांकन क्यूरेशन के दौरान किए गए संपादकीय निर्णय हैं, न कि औपचारिक या सहकर्मी-समीक्षित रूब्रिक। वे अध्ययन के लिए एक चर के रूप में उपयोगी हैं, उस उत्पत्ति को प्रकट किए बिना जमीनी सत्य के रूप में कम उपयोगी।

इनमें से कोई भी कॉर्पस से बचने का कारण नहीं है। यह वह शर्त है जिसके तहत किसी भी एकत्रित सार्वजनिक डेटासेट का उपयोग किया जाना चाहिए: जानें कि डेटा कहाँ से आया, नमूने की सीमाओं को प्रकट करें, और उन लोगों को उद्धृत करें जिन्होंने वास्तव में प्रॉम्प्ट्स लिखे थे।

Tags
open-data·dataset·research·citation·reproducibility·academic·api