Authors Guild बनाम OpenAI की शिकायत, जो सितंबर 2023 में दायर की गई थी, कृत्रिम बुद्धिमत्ता और जनरेटिव AI के क्षेत्र में एक महत्वपूर्ण कानूनी चुनौती है। Authors Guild द्वारा प्रमुख कथा लेखकों के एक समूह की ओर से तैयार की गई, जिसमें जॉन ग्रिशम, जॉर्ज आर.आर. मार्टिन और अन्य शामिल हैं, यह शिकायत आरोप लगाती है कि OpenAI के बड़े भाषा मॉडल को बिना प्राधिकरण के कॉपीराइट किए गए कार्यों पर प्रशिक्षित किया गया था, जिससे अमेरिकी कॉपीराइट कानून के तहत लेखकों के अधिकारों का उल्लंघन हुआ। यह मामला मशीन लर्निंग और बौद्धिक संपदा के प्रतिच्छेदन पर चल रही कानूनी बहसों में एक केंद्र बिंदु बन गया है, क्योंकि AI प्रणालियों के लिए प्रशिक्षण डेटा एकत्र करने में अक्सर पाठ के विशाल संग्रह, जिसमें पुस्तकें, लेख और अन्य संरक्षित कार्य शामिल हैं, का पुनरुत्पादन या उद्धरण शामिल होता है।
विवाद के केंद्र में विशाल डेटासेट पर Transformer (architecture)-आधारित मॉडलों को प्रशिक्षित करने की प्रथा है। शिकायत में कहा गया है कि लेखकों के कार्यों का अनधिकृत उपयोग, दोनों मॉडलों को प्रशिक्षित करने के लिए और उन आउटपुट को उत्पन्न करने में जो उन कार्यों से निकटता से मिलते-जुलते या पुनरुत्पादित हो सकते हैं, रचनात्मक श्रम की सीधी जब्ती का प्रतिनिधित्व करता है। वादी कंपनी के खिलाफ क्षतिपूर्ति और निषेधाज्ञा राहत सहित विभिन्न उपाय चाहते हैं, जो AI प्रौद्योगिकियों के नवाचार और मूल लेखकों को दी गई सुरक्षा के बीच बढ़ते तनाव को रेखांकित करता है।
पृष्ठभूमि: बड़े भाषा मॉडल का उदय
विवादित प्रणालियों के लिए तकनीकी आधार में तंत्रिका नेटवर्क वास्तुकला शामिल है जिसे Transformer (architecture) के रूप में जाना जाता है। Google DeepMind द्वारा प्रकाशित शोध में पेश किया गया और मूल रूप से Jakob Uszkoreit, Lukasz Kaiser और सहयोगियों द्वारा 2017 के पेपर 'Attention Is All You Need' में अग्रणी, ट्रांसफॉर्मर ने अनुक्रमिक डेटा को संसाधित करने के लिए Multi-Head Attention और Positional Encoding जैसे तंत्रों का लाभ उठाया, जिससे प्राकृतिक भाषा समझ और उत्पादन में सफलताएं मिलीं। OpenAI के GPT-श्रृंखला मॉडल, जिनमें GPT-3 और GPT-4 शामिल हैं, इन ट्रांसफॉर्मर पर आधारित हैं और मानव-समान पाठ उत्पन्न करने के लिए विशाल संग्रह, जिसमें वेब पाठ, पुस्तकें और शैक्षणिक पेपर शामिल हैं, पर प्रशिक्षित हैं।
प्रशिक्षण डेटा का पैमाना मॉडलों की क्षमताओं के लिए महत्वपूर्ण है। बड़े भाषा मॉडल Adam (Optimizer) जैसे एल्गोरिदम और अगले-शब्द भविष्यवाणी कार्यों पर त्रुटि को कम करने के लिए अरबों मापदंडों को समायोजित करने वाले विविधताओं का उपयोग करके प्रशिक्षण से गुजरते हैं। व्यापक मशीन लर्निंग क्षेत्र की तकनीकें, जैसे Data Augmentation और Batch Normalization (हालांकि ट्रांसफॉर्मर में कम बार), मिनी-मॉडल प्रशिक्षण पाइपलाइनों में योगदान करती हैं। फिर मॉडलों को कभी-कभी Reinforcement Learning from AI Feedback (RLAIF) (AI फीडबैक से सुदृढीकरण सीखना) या मानव फीडबैक का उपयोग करके उपयोगकर्ता अपेक्षाओं के साथ संरेखण में सुधार करने के लिए ट्यून किया जाता है।
वादी और उनके आरोप
Authors Guild द्वारा एक क्लास एक्शन के रूप में लाई गई शिकायत में विभिन्न शैलियों के लेखकों का एक गठबंधन शामिल है। ज्ञात वादियों में john-grisham, george-r-r-martin, dave-eggers, jodi-picoult, jonathan-franzen और pat-tigret शामिल हैं। उन्होंने तर्क दिया कि OpenAI की प्रशिक्षण प्रक्रिया, जिसमें अक्सर अपने डेटासेट के माध्यम से उनकी पुस्तकों के पाठ को स्क्रैप या अंतर्ग्रहण करना शामिल है, सीधे कॉपीराइट उल्लंघन का गठन करती है। लेखकों ने इस बात पर जोर दिया कि उनका रचनात्मक कार्य उनकी आजीविका है और बिना लाइसेंस के उनकी कॉपीराइट सामग्री का उपयोग उनके विशेष अधिकारों का उल्लंघन करता है।
विशिष्ट दावों में वादियों के कार्यों के लिए बाजार के लिए खतरे शामिल हैं, यह तर्क देते हुए कि AI-जनित सामग्री मानव-लिखित कार्यों के लिए विकल्प के रूप में कार्य कर सकती है, और मॉडल व्युत्पन्न आउटपुट भी उत्पन्न कर सकते हैं जो मूल के साथ अनुचित रूप से प्रतिस्पर्धा करेंगे। मुकदमा वैध AI उपयोग के बीच अंतर करता है जो कॉपीराइट किए गए कार्यों को अस्पष्ट या रूपांतरित करता है और कथित अनधिकृत नकल जो पूर्व-प्रशिक्षण के दौरान हुई थी।
कानूनी संदर्भ और पिछले मामले
अमेरिका में, कॉपीराइट कानून उचित उपयोग के लिए कुछ गुंजाइश के साथ सुरक्षा प्रदान करता है। लंबित AI मुकदमेबाजी ने उचित उपयोग बचाव पर भरोसा किया है, जैसा कि न्यूयॉर्क टाइम्स के OpenAI और Microsoft के खिलाफ मुकदमे जैसे अन्य मुकदमों में देखा गया है। हालांकि, Authors Guild की शिकायत पीछे धकेलती है, यह कहते हुए कि कोई भी उचित उपयोग बचाव अस्थिर है जब प्रशिक्षण डेटा इतने बड़े पैमाने पर उपयोग किया जाता है, और जब मॉडल पाठ को शब्दशः याद कर सकते हैं और पुनरुत्पादित कर सकते हैं।
यह पहली बार नहीं है जब Authors Guild कॉपीराइट विवाद के केंद्र में रहा है। गिल्ड Google Books और Datasail स्कैन में शामिल रहा था, जो इंडेक्सिंग और खोज उपयोग के लिए पुस्तकों की डिजिटल प्रतियों को लाइसेंस देने के अधिकार का पक्ष लेता था। हालांकि, गिल्ड का तर्क है कि वाणिज्यिक AI उपयोग आउटपुट की टिप्पणी प्रकृति और लेखकों को संभावित आर्थिक नुकसान के कारण भौतिक रूप से भिन्न है।
कानूनी ढांचा और प्रस्तुत दावे
शिकायत में 8 आरोप शामिल हैं, जिनमें प्रत्यक्ष कॉपीराइट उल्लंघन, विकृत उल्लंघन और कॉपीराइट प्रबंधन जानकारी को हटाने के लिए डिजिटल मिलेनियम कॉपीराइट अधिनियम (DMCA) का उल्लंघन शामिल है। पाठ के केंद्र में AI मॉडलों के प्रशिक्षण के दौरान साहित्यिक कार्यों का अवैध पुनरुत्पादन है। वादी कॉपीराइट किए गए कार्यों के शेष से OpenAI द्वारा अर्जित किसी भी लाभ के लिए एक न्यायसंगत ट्रस्ट के निर्माण की मांग कर रहे हैं।
यह मामला न्यूयॉर्क के दक्षिणी जिले के लिए संयुक्त राज्य अमेरिका जिला न्यायालय में चल रहा है। OpenAI ने शुरू में खारिज करने के लिए आगे बढ़ा, लेकिन मुकदमों का संयुक्त दृष्टिकोण - प्रमुख विद्वान और उद्योग टिप्पणीकारों ने वजन किया है, जो तंत्रिका नेटवर्क में अनुपयोगी सीखने के लिए कॉपीराइट पाठ्य डेटा का उपयोग करते समय दायित्व अस्पष्टताओं को उजागर करते हैं।
AI उद्योग और व्यापक निहितार्थ
यह मुकदमा 2023 में AI कंपनियों के खिलाफ दायर कई क्लास एक्शनों में से एक है। यह अगस्त 2023 में करिन एले और फेंग मिंग द्वारा लेखकों के एक प्रस्तावित वर्ग की ओर से दायर करने के तुरंत बाद आया और इसे AI और कॉपीराइट के प्रतिच्छेदन पर मुकदमेबाजी की लहर के भीतर देखा जाना चाहिए। विशेष रूप से, Anthropic, Google DeepMind और Amazon Web Services जैसे अन्य खिलाड़ी भी मॉडलों को प्रशिक्षित करने के लिए विशाल डेटा पर भरोसा करते हैं। फिर भी, विवाद ने कानूनी जोखिम के बारे में चिंताएं उठाई हैं जो भविष्य की AI विकास प्रथाओं को आकार दे सकता है - चाहे कंपनियों को लाइसेंस लेना होगा या कॉपीराइट मुकदमेबाजी से बचने के लिए प्रशिक्षण रणनीतियों को संशोधित करना होगा।
प्रौद्योगिकी अधिकारियों और डेवलपर्स ने बताया है कि Gradient Clipping और Learning Rate Scheduling जैसे मौजूदा ढांचे अपने मॉडलों को ठीक करते हैं लेकिन कहते हैं कि डेटा संग्रह आवश्यक है; पुस्तकों पर प्रशिक्षण एक तरीका है लेकिन कच्चे पाठ पर संपत्ति अधिकारों पर कोई सहमति नहीं है। यह मामला ऐसे प्रश्न उठाता है: उचित उपयोग क्या है जब एक मॉडल की स्मृति अर्थ से अधिक याद करने के लिए पर्याप्त बड़ी हो? क्या अनुमान पर Beam Search या Top-P (Nucleus) Sampling Temperature Scaling उल्लंघनकारी मिश्रण उत्पन्न कर सकता है - नमूना अनुक्रम जो लगभग एक कॉपीराइट अध्याय को दोहराते हैं?
संबंधित मामले और भविष्य की कार्यवाही
Authors Guild मामला अकेला नहीं है। 2024 तक, अन्य लंबित कार्रवाइयों में जनरेटिव AI प्लेटफार्मों के खिलाफ हास्य कलाकारों और फोटोग्राफरों द्वारा क्लास-एक्शन मुकदमेबाजी शामिल है। OpenAI और अन्य खिलाड़ियों के पास लंबित उचित उपयोग तर्क हैं, लेकिन Authors Guild शिकायत का परिणाम स्टार्टअप पारिस्थितिकी तंत्र के लिए एक मिसाल स्थापित करेगा, क्योंकि स्टार्टअप-चिंता के रूप में उन्हें वैकल्पिक डेटा स्रोतों, जैसे ओपन-एक्सेस या उचित रूप से लाइसेंस प्राप्त संग्रह की आवश्यकता हो सकती है।
OpenAI ने आंशिक रूप से महत्वपूर्ण समाचार एजेंसियों से कॉपीराइट सामग्री को लाइसेंस देना शुरू करके जवाब दिया है और प्रकाशकों से मिलने की भी सूचना है। हालांकि, घर्षण बना हुआ है। Authors Guild कार्रवाई अपनी सामूहिक प्रकृति के लिए उल्लेखनीय है - यह मुद्दे को एक पूरे पेशे को प्रभावित करने वाले प्रणालीगत के रूप में तैयार करती है - कोई भी निर्णय जो सामग्री निर्माताओं और AI डेवलपर्स के बीच अनुबंधों को बांधेगा और आकार देगा।
लेखकों और AI नैतिकता पर प्रभाव
एक सामान्य चिंता AI प्रतिमान का आर्थिक झुकाव है। आलोचकों का तर्क है कि चूंकि प्रशिक्षण डेटा में सभी विषयों से मानव कार्य शामिल हैं, लेकिन केवल तकनीकी दिग्गज लाभ उठाते हैं, यह एक असंतुलित व्यवसाय मॉडल का प्रतिनिधित्व करता है। उपन्यासकार अक्सर पतले मार्जिन पर व्यक्तिगत रूप से लिखते हैं, और $5 मूल्य की कंपनी द्वारा उनके आउटपुट का उपयोग बिना मुआवजे के असंतुलन पैदा करता है। यह फिर से सहमति, एट्रिब्यूशन और विवादित डेटा क्यूरेशन के बारे में व्यापक नैतिक AI बहसों के साथ प्रतिध्वनित होता है।
हालांकि, कुछ विश्लेषक AI21 Labs और Inflection AI के विकास की ओर इशारा करते हैं जो परिवर्तन को संतुलित कर सकते हैं। मॉडलों को परिष्कृत करने के लिए Reinforcement Learning from AI Feedback (RLAIF) का उपयोग सटीकता और कम त्रुटियों की दिशा में रहा है, जिसमें कॉपीराइट के मामले भी शामिल हैं। लेकिन जैसा कि शिकायत जोर देती है, यह पूर्व-प्रशिक्षण चरण में अंतिम नकल को नकारता नहीं है।
प्रशिक्षण बुनियादी ढांचे पर नज़र
घटना पर, प्रशिक्षण में एक अलग बड़ा बुनियादी ढांचा शामिल है। विशाल Deep learning संग्रहों को संसाधित करने के लिए, कंप्यूटिंग संसाधन महत्वपूर्ण हैं। NVIDIA (हार्डवेयर प्रदाता) या वास्तविक GPU उपयोग जैसी कंपनियां, AWS Trainium क्लाउड या Google Cloud जैसे विकल्पों के साथ उपलब्ध हैं। पुस्तकों को मिलीसेकंड में मॉडल वेट तक लाने का पैमाना ऐसा है कि वे व्यवसाय AI डोमेन से लाभ उठाते हैं।
मुकदमे में प्रस्तुत समस्या क्लाउड-कंप्यूटिंग उद्योग को प्रभावित कर सकती है, क्योंकि मुकदमे Amazon Web Services और Google Cloud में मल्टीमॉडल मॉडल अनुप्रयोगों में निवेश को रोक सकते हैं। अनुमान इंजन, Groq जैसे प्लेटफॉर्म जो तेज अनुमान सोचते हैं, एक भूमिका निभा सकते हैं, लेकिन कॉपीराइट मॉडलिंग में फोकस के रूप में मूल्यांकन में प्रशिक्षण inf-e-inference-nodes बना हुआ है।
दृष्टिकोण
मामले की प्रक्रियात्मक चरण को देखते हुए, कोई अंतिम निर्णय नहीं आया है। इस लेख के अनुसार, अदालत ने खारिज करने के प्रस्तावों पर फैसला नहीं किया है। कई कानूनी पर्यवेक्षक ट्रैक करते हैं, यह निर्णय न केवल पक्षों को प्रभावित करेगा बल्कि व्यापक AI कॉपीराइट परिदृश्य की निगरानी करेगा, जिसमें संभावित विधायी कार्रवाई शामिल है जो भविष्य में लाइसेंसिंग और डेटा उत्पत्ति को संबोधित कर सकती है।
Authors Guild बनाम OpenAI शिकायत उस डोमेन के कारण घबराहट को रेखांकित करती है जिसकी सटीक संस्कृति - पिछले पेपरों के जनरेटिव मॉडल से जो शैली लाए हैं या कंपनी की उन्नति पर - अब उन कानूनों के साथ ओवरलैप होती है जिनके तहत हमारी संस्कृति, फिल्म और कलाकृति बनाई जाती है। अदालतें तकनीकी नवाचार की परिभाषा को प्रभावित करेंगी, और संभवतः 2020 के दशक में बड़े मॉडल विकास के प्रक्षेपवक्र को बदल देंगी। लेकिन परिणाम जो भी हो, यह सबूत है कि कृत्रिम बुद्धिमत्ता अब स्वायत्त नहीं है; यह कानून के जाल और उन लोगों के जनसांख्यिकी में बुना गया है जिनकी रचनात्मकता से यह प्रशिक्षित होती है।