एक स्टोकेस्टिक तोता एक भाषा मॉडल के लिए एक शब्द है जो अपने प्रशिक्षण डेटा से पैटर्न को सांख्यिकीय रूप से पुनर्संयोजित करके प्रशंसनीय-ध्वनि वाला पाठ धाराप्रवाह रूप से पुनरुत्पादित करता है, बिना उन शब्दों के पीछे के अर्थ की कोई आधारभूत समझ के जो यह उत्पन्न करता है। यह वाक्यांश 2021 के पेपर "ऑन द डेंजर्स ऑफ स्टोकेस्टिक पैरट्स: कैन लैंग्वेज मॉडल्स बी टू बिग?" के शीर्षक से आया है, जो एमिली बेंडर, टिमनिट गेब्रू, एंजेलिना मैकमिलन-मेजर और मार्गरेट मिशेल द्वारा लिखा गया था, और यह बड़े भाषा मॉडल अनुसंधान दिशा की सबसे अधिक उद्धृत और सबसे विवादास्पद आलोचनाओं में से एक बन गया, जो जल्द ही GPT-3-श्रेणी के सिस्टम और बाद में ChatGPT का उत्पादन करेगा।
पेपर ने तर्क दिया कि स्क्रैप किए गए वेब टेक्स्ट पर प्रशिक्षित तेजी से बड़े भाषा मॉडल गंभीर जोखिम उठाते हैं: पर्यावरणीय और वित्तीय लागत, अनफ़िल्टर्ड प्रशिक्षण कॉर्पोरा से एन्कोडेड और प्रवर्धित पूर्वाग्रह, और शोधकर्ताओं और जनता दोनों की प्रवृत्ति धाराप्रवाह आउटपुट को वास्तविक समझ के लिए गलती करने की।
उत्पत्ति और विवाद
पेपर का प्रकाशन गेब्रू के दिसंबर 2020 में Google से प्रस्थान से जुड़ा हुआ था, जिसे उन्होंने कहा कि कंपनी की मांग पर पेपर वापस लेने या Google-संबद्ध सह-लेखकों के नाम हटाने के कारण निकाल दिया जाना था; Google ने इसे इस्तीफा बताया। इस घटना ने प्रमुख प्रयोगशालाओं में AI नैतिकता अनुसंधान और उत्पाद टीमों के बीच आंतरिक तनावों की ओर व्यापक ध्यान आकर्षित किया, और यह AI नैतिकता में सबसे व्यापक रूप से चर्चित घटनाओं में से एक बन गई। बेंडर और गेब्रू का व्यापक तर्क NLP अनुसंधान में प्रशिक्षण डेटा गुणवत्ता और वेब-स्केल कॉर्पोरा के ऑडिट की कठिनाई के बारे में पहले की चिंताओं को विस्तारित करता है।
मुख्य तर्क
भाषा मॉडल को पिछले संदर्भ को देखते हुए सांख्यिकीय रूप से संभावित अगले टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, एक उद्देश्य जो लेखकों ने तर्क दिया कि शब्दों के वास्तविक-विश्व अर्थ या इरादे में किसी भी आधार के बिना ठोस रूप उत्पन्न करता है, एक चिंता जो AI में ग्राउंडिंग की व्यापक समस्या से निकटता से संबंधित है। पेपर ने चेतावनी दी कि यह अनग्राउंडेड धाराप्रवाहता मतिभ्रमित और पक्षपाती सामग्री को विशेष रूप से खतरनाक बनाती है, क्योंकि मानव पाठक सहज रूप से धाराप्रवाह पाठ के लिए समझ और विश्वसनीयता का श्रेय देते हैं।
स्वागत और बाद की बहस
यह शब्द सामान्य उपयोग में आया, दोनों एक गंभीर शोध आलोचना के रूप में और LLM उत्साह के खिलाफ तैनात एक अलंकारिक अपमान के रूप में। स्केलिंग के समर्थकों ने जवाब दिया कि आकस्मिक क्षमताओं और मॉडलों की तर्क, उपकरण उपयोग और बहु-चरणीय योजना की स्पष्ट क्षमता पर बाद के शोध ने विशुद्ध रूप से "स्टोकेस्टिक" चरित्र-चित्रण को जटिल बना दिया, हालांकि आलोचकों का मानना है कि धाराप्रवाह आउटपुट सत्यापित समझ से अलग रहता है। बहस अनसुलझी बनी हुई है और बड़े भाषा मॉडल वास्तव में क्या जानते हैं बनाम केवल पुनरुत्पादित करते हैं, इसकी चर्चा को आकार देना जारी रखती है, और यह बाद के शब्दों जैसे AI स्लॉप में गूंजता है जो बड़े पैमाने पर उत्पादित मशीन पाठ के निम्न-गुणवत्ता वाले अंत का वर्णन करते हैं।