अंग्रेज़ी से अनुवादित

एक स्टोकेस्टिक तोता एक भाषा मॉडल के लिए एक शब्द है जो अपने प्रशिक्षण डेटा से पैटर्न को धाराप्रवाह रूप से पुनःसंयोजित करता है बिना आधारभूत समझ के, जिसे बड़े भाषा मॉडलों की एक प्रभावशाली 2021 आलोचना में गढ़ा गया था।

एक स्टोकेस्टिक तोता एक भाषा मॉडल के लिए एक शब्द है जो अपने प्रशिक्षण डेटा से पैटर्न को सांख्यिकीय रूप से पुनर्संयोजित करके प्रशंसनीय-ध्वनि वाला पाठ धाराप्रवाह रूप से पुनरुत्पादित करता है, बिना उन शब्दों के पीछे के अर्थ की कोई आधारभूत समझ के जो यह उत्पन्न करता है। यह वाक्यांश 2021 के पेपर "ऑन द डेंजर्स ऑफ स्टोकेस्टिक पैरट्स: कैन लैंग्वेज मॉडल्स बी टू बिग?" के शीर्षक से आया है, जो एमिली बेंडर, टिमनिट गेब्रू, एंजेलिना मैकमिलन-मेजर और मार्गरेट मिशेल द्वारा लिखा गया था, और यह बड़े भाषा मॉडल अनुसंधान दिशा की सबसे अधिक उद्धृत और सबसे विवादास्पद आलोचनाओं में से एक बन गया, जो जल्द ही GPT-3-श्रेणी के सिस्टम और बाद में ChatGPT का उत्पादन करेगा।

पेपर ने तर्क दिया कि स्क्रैप किए गए वेब टेक्स्ट पर प्रशिक्षित तेजी से बड़े भाषा मॉडल गंभीर जोखिम उठाते हैं: पर्यावरणीय और वित्तीय लागत, अनफ़िल्टर्ड प्रशिक्षण कॉर्पोरा से एन्कोडेड और प्रवर्धित पूर्वाग्रह, और शोधकर्ताओं और जनता दोनों की प्रवृत्ति धाराप्रवाह आउटपुट को वास्तविक समझ के लिए गलती करने की।

उत्पत्ति और विवाद

पेपर का प्रकाशन गेब्रू के दिसंबर 2020 में Google से प्रस्थान से जुड़ा हुआ था, जिसे उन्होंने कहा कि कंपनी की मांग पर पेपर वापस लेने या Google-संबद्ध सह-लेखकों के नाम हटाने के कारण निकाल दिया जाना था; Google ने इसे इस्तीफा बताया। इस घटना ने प्रमुख प्रयोगशालाओं में AI नैतिकता अनुसंधान और उत्पाद टीमों के बीच आंतरिक तनावों की ओर व्यापक ध्यान आकर्षित किया, और यह AI नैतिकता में सबसे व्यापक रूप से चर्चित घटनाओं में से एक बन गई। बेंडर और गेब्रू का व्यापक तर्क NLP अनुसंधान में प्रशिक्षण डेटा गुणवत्ता और वेब-स्केल कॉर्पोरा के ऑडिट की कठिनाई के बारे में पहले की चिंताओं को विस्तारित करता है।

मुख्य तर्क

भाषा मॉडल को पिछले संदर्भ को देखते हुए सांख्यिकीय रूप से संभावित अगले टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, एक उद्देश्य जो लेखकों ने तर्क दिया कि शब्दों के वास्तविक-विश्व अर्थ या इरादे में किसी भी आधार के बिना ठोस रूप उत्पन्न करता है, एक चिंता जो AI में ग्राउंडिंग की व्यापक समस्या से निकटता से संबंधित है। पेपर ने चेतावनी दी कि यह अनग्राउंडेड धाराप्रवाहता मतिभ्रमित और पक्षपाती सामग्री को विशेष रूप से खतरनाक बनाती है, क्योंकि मानव पाठक सहज रूप से धाराप्रवाह पाठ के लिए समझ और विश्वसनीयता का श्रेय देते हैं।

स्वागत और बाद की बहस

यह शब्द सामान्य उपयोग में आया, दोनों एक गंभीर शोध आलोचना के रूप में और LLM उत्साह के खिलाफ तैनात एक अलंकारिक अपमान के रूप में। स्केलिंग के समर्थकों ने जवाब दिया कि आकस्मिक क्षमताओं और मॉडलों की तर्क, उपकरण उपयोग और बहु-चरणीय योजना की स्पष्ट क्षमता पर बाद के शोध ने विशुद्ध रूप से "स्टोकेस्टिक" चरित्र-चित्रण को जटिल बना दिया, हालांकि आलोचकों का मानना है कि धाराप्रवाह आउटपुट सत्यापित समझ से अलग रहता है। बहस अनसुलझी बनी हुई है और बड़े भाषा मॉडल वास्तव में क्या जानते हैं बनाम केवल पुनरुत्पादित करते हैं, इसकी चर्चा को आकार देना जारी रखती है, और यह बाद के शब्दों जैसे AI स्लॉप में गूंजता है जो बड़े पैमाने पर उत्पादित मशीन पाठ के निम्न-गुणवत्ता वाले अंत का वर्णन करते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-ethics·natural-language-processing·large-language-models
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास