Authors Guild v. OpenAI एक क्लास एक्शन मुकदमा है जो 20 सितंबर, 2023 को संयुक्त राज्य अमेरिका के दक्षिणी जिला न्यायालय (न्यूयॉर्क) में दायर किया गया था। यह मुकदमा Authors Guild और प्रमुख कथा और गैर-कथा लेखकों के एक समूह द्वारा लाया गया है, जिसमें आरोप लगाया गया है कि OpenAI, जो ChatGPT के पीछे बड़े भाषा मॉडल का विकासकर्ता है, ने अपने जनरेटिव एआई सिस्टम को प्रशिक्षित करने के लिए उनकी पुस्तकों का बिना अनुमति के उपयोग करके उनके कॉपीराइट का उल्लंघन किया। यह मामला एआई कंपनियों की डेटा प्रथाओं के खिलाफ कई हाई-प्रोफाइल कानूनी चुनौतियों में से एक है, जो उचित उपयोग, लेखकत्व और मशीन लर्निंग के युग में रचनात्मक श्रम की अर्थव्यवस्था के बारे में मौलिक प्रश्न उठाता है।
वादी में Authors Guild, जो संयुक्त राज्य अमेरिका में लेखकों का सबसे बड़ा पेशेवर संगठन है, के साथ-साथ जॉन ग्रिशम, जॉर्ज आर.आर. मार्टिन, जोडी पिकॉल्ट और डेविड बाल्डैकी जैसे व्यक्तिगत लेखक शामिल हैं। उनकी शिकायत में कहा गया है कि OpenAI ने अपने मॉडलों के प्रशिक्षण डेटासेट में उनके कार्यों को पूर्ण रूप से कॉपी किया, जो फिर उन कार्यों की नकल या सारांश उत्पन्न कर सकते हैं, और बाजार में मूल कार्यों के साथ प्रतिस्पर्धा करते हैं। यह मुकदमा वैधानिक क्षतिपूर्ति, निषेधाज्ञा राहत, और यह घोषणा चाहता है कि OpenAI का बिना सहमति या मुआवजे के कॉपीराइट सामग्री का उपयोग 1976 के कॉपीराइट अधिनियम का उल्लंघन है।
पृष्ठभूमि: बड़े भाषा मॉडल का उदय
OpenAI, जिसकी स्थापना 2015 में एक गैर-लाभकारी अनुसंधान संगठन के रूप में हुई थी, ने 2019 में विशाल कंप्यूटिंग संसाधनों के लिए धन सुरक्षित करने के लिए एक सीमित-लाभ संरचना में परिवर्तन किया। इसका प्रमुख उत्पाद, ChatGPT, जो नवंबर 2022 में जनता के लिए जारी किया गया था, इतिहास में सबसे तेजी से बढ़ने वाले उपभोक्ता अनुप्रयोगों में से एक बन गया, जो दो महीनों के भीतर 100 मिलियन से अधिक मासिक उपयोगकर्ताओं तक पहुंच गया। अंतर्निहित तकनीक ट्रांसफॉर्मर आर्किटेक्चर पर आधारित है, जिसे 2017 में Google के शोधकर्ताओं द्वारा एक पेपर में पेश किया गया था, जिसने विशाल मात्रा में पाठ डेटा पर कुशल प्रशिक्षण सक्षम किया।
एक बड़े भाषा मॉडल को प्रशिक्षित करने में इसे पुस्तकों, लेखों, वेबसाइटों और अन्य लिखित सामग्री सहित विविध स्रोतों से अरबों शब्द खिलाना शामिल है। OpenAI ने अपने प्रशिक्षण डेटासेट की पूरी सामग्री सार्वजनिक रूप से प्रकट नहीं की है, लेकिन कंपनी ने स्वीकार किया है कि उसने अपने पहले के मॉडलों जैसे GPT-2 और GPT-3 में इंटरनेट से सार्वजनिक रूप से उपलब्ध पाठ, जिसमें पुस्तकें शामिल हैं, का उपयोग किया। पैमाना विशाल है: GPT-3, जो 2020 में जारी किया गया था, को सैकड़ों अरबों टोकन पर प्रशिक्षित किया गया था, एक टोकन पाठ की एक इकाई है जो मोटे तौर पर एक शब्द या शब्द के हिस्से के बराबर है।
वादी तर्क देते हैं कि पुस्तकें अद्वितीय रूप से मूल्यवान प्रशिक्षण डेटा हैं क्योंकि उनमें उच्च-गुणवत्ता, लंबी-रूप गद्य होता है जो मॉडलों को व्याकरण, तर्क और कथा संरचना सीखने में मदद करता है। हालांकि, वे तर्क देते हैं कि बिना अनुमति के कॉपीराइट पुस्तकों का उपयोग परिवर्तनकारी उचित उपयोग नहीं है, बल्कि लेखकों के श्रम का व्यावसायिक शोषण है। इस प्रकार यह मामला कॉपीराइट कानून और मशीन लर्निंग तकनीक के चौराहे पर स्थित है, एक ऐसा क्षेत्र जो डीप लर्निंग और तंत्रिका नेटवर्क जैसी तकनीकों के माध्यम से तेजी से आगे बढ़ा है।
कानूनी दावे और तर्क
शिकायत कई कारणों का दावा करती है, जिसमें प्रत्यक्ष कॉपीराइट उल्लंघन, परोक्ष उल्लंघन और अन्यायपूर्ण संवर्धन शामिल हैं। वादी आरोप लगाते हैं कि OpenAI की प्रशिक्षण प्रक्रिया में अनिवार्य रूप से उनके कार्यों की अनधिकृत प्रतिकृतियां बनाना शामिल है, दोनों प्रशिक्षण डेटासेट के निर्माण में और मॉडल की मूल कार्यों से निकटता से मिलते-जुलते पाठ उत्पन्न करने की क्षमता में। वे यह भी दावा करते हैं कि OpenAI के उनके कार्यों के उपयोग ने उनकी पुस्तकों के लिए बाजार को कम कर दिया है, क्योंकि पाठक अब मुफ्त में एआई-जनित सारांश या नकल प्राप्त कर सकते हैं।
OpenAI की संभावित बचाव उचित उपयोग के सिद्धांत पर केंद्रित है, जो आलोचना, टिप्पणी, समाचार रिपोर्टिंग, शिक्षण और अनुसंधान जैसे उद्देश्यों के लिए कॉपीराइट सामग्री के सीमित उपयोग की अनुमति देता है। कंपनी ने अन्य संदर्भों में तर्क दिया है कि सार्वजनिक रूप से उपलब्ध पाठ पर एआई मॉडल को प्रशिक्षित करना एक परिवर्तनकारी उपयोग है जो मूल कार्यों का विकल्प नहीं है। हालांकि, वादी जवाब देते हैं कि OpenAI का उपयोग व्यावसायिक, गैर-परिवर्तनकारी और उनके कार्यों के बाजार के लिए हानिकारक है, कंपनी के मूल्यांकन की ओर इशारा करते हुए, जो 2024 की शुरुआत में 80 बिलियन डॉलर से अधिक था।
यह मामला न्यायाधीश सिडनी एच. स्टीन को सौंपा गया है, जो दिसंबर 2023 में OpenAI और Microsoft के खिलाफ The New York Times द्वारा लाए गए एक संबंधित मुकदमे की भी अध्यक्षता करते हैं। Authors Guild मामले को अन्य समान मुकदमों के साथ समेकित किया गया है, जिसमें लेखकों सारा सिल्वरमैन, रिचर्ड कैड्रे और क्रिस्टोफर गोल्डन द्वारा दायर एक मामला शामिल है, हालांकि समेकन आंशिक और प्रक्रियात्मक रहा है। एक महत्वपूर्ण प्रारंभिक निर्णय नवंबर 2023 में आया, जब न्यायाधीश स्टीन ने सिल्वरमैन मामले में कुछ दावों को स्थायित्व की कमी के लिए खारिज कर दिया लेकिन अन्य को आगे बढ़ने की अनुमति दी, यह संकेत देते हुए कि अदालतें मूल कॉपीराइट प्रश्नों से जुड़ने को तैयार हैं।
व्यापक मुकदमेबाजी परिदृश्य
Authors Guild v. OpenAI एआई कंपनियों के खिलाफ मुकदमों की एक लहर का हिस्सा है। The New York Times मामले के अलावा, जो आरोप लगाता है कि OpenAI और इसके साथी Microsoft ने अपने मॉडलों को प्रशिक्षित करने के लिए लाखों कॉपीराइट लेखों का उपयोग किया, अन्य लेखकों ने Anthropic, जो Claude मॉडल का निर्माता है, और Google DeepMind के खिलाफ मुकदमे दायर किए हैं। इन मामलों को प्रौद्योगिकी उद्योग, प्रकाशन क्षेत्र और कानूनी विद्वानों द्वारा बारीकी से देखा जा रहा है, क्योंकि उनके परिणाम एआई कंपनियों के प्रशिक्षण डेटा प्राप्त करने और उपयोग करने के तरीके के लिए मिसाल स्थापित कर सकते हैं।
जुलाई 2024 में एक उल्लेखनीय विकास हुआ जब यू.एस. कॉपीराइट कार्यालय ने कॉपीराइट और एआई पर एक रिपोर्ट जारी की, जिसमें कांग्रेस को एआई प्रशिक्षण में कॉपीराइट कार्यों के उपयोग को संबोधित करने के लिए नए कानून पर विचार करने की सिफारिश की गई। रिपोर्ट ने उचित उपयोग पर कोई निश्चित रुख नहीं लिया, लेकिन स्पष्टता की आवश्यकता पर प्रकाश डाला और सुझाव दिया कि मौजूदा कानून लेखकों की पर्याप्त रूप से रक्षा नहीं कर सकता है। इस नियामक अनिश्चितता ने कुछ एआई कंपनियों को सामग्री प्रदाताओं के साथ लाइसेंसिंग समझौते करने के लिए प्रेरित किया है, जैसे कि OpenAI के Axel Springer और Associated Press जैसे समाचार संगठनों के साथ समझौते, हालांकि ऐसे समझौते अधिकांश लेखकों को कवर नहीं करते हैं।
Authors Guild सामूहिक लाइसेंसिंग तंत्र की वकालत करने में भी सक्रिय रहा है, जो संगीत प्रकाशकों और गीतकारों द्वारा उपयोग किए जाने वाले समान हैं। 2024 में, गिल्ड ने एक ढांचा प्रस्तावित किया जिसके तहत एआई कंपनियां कॉपीराइट कार्यों का उपयोग करने के लिए एक सदस्यता शुल्क का भुगतान करेंगी, जिसमें राजस्व उपयोग के आधार पर लेखकों को वितरित किया जाएगा। इस प्रस्ताव ने नीति हलकों में कुछ गति प्राप्त की है लेकिन 2025 की शुरुआत तक किसी भी प्रमुख एआई कंपनी द्वारा अपनाया नहीं गया है।
प्रमुख प्रक्रियात्मक मील के पत्थर
प्रारंभिक दाखिल करने के बाद, मामला कई प्रक्रियात्मक चरणों से गुजरा। अक्टूबर 2023 में, OpenAI ने खारिज करने का प्रस्ताव दायर किया, यह तर्क देते हुए कि वादी ने पर्याप्त रूप से प्रत्यक्ष उल्लंघन का आरोप नहीं लगाया क्योंकि प्रशिक्षण प्रक्रिया में मध्यवर्ती प्रतियां शामिल हैं जो जनता को वितरित नहीं की जाती हैं। कंपनी ने यह भी तर्क दिया कि वादी के पास स्थायित्व की कमी है क्योंकि उन्होंने अपने सभी कार्यों को यू.एस. कॉपीराइट कार्यालय के साथ पंजीकृत नहीं किया था, जो उल्लंघन मुकदमा दायर करने के लिए एक पूर्वापेक्षा है।
न्यायाधीश स्टीन ने फरवरी 2024 में आंशिक रूप से प्रस्ताव पर फैसला सुनाया, अधिकांश दावों को आगे बढ़ने की अनुमति दी लेकिन कुछ को तकनीकी आधार पर खारिज कर दिया। उन्होंने माना कि वादी ने प्रशंसनीय रूप से आरोप लगाया था कि OpenAI की प्रशिक्षण प्रक्रिया में कॉपी करना शामिल था, और उचित उपयोग बचाव सारांश निर्णय या परीक्षण के लिए बेहतर था, न कि खारिज करने के प्रस्ताव के लिए। इस फैसले को लेखकों के लिए एक जीत के रूप में देखा गया, क्योंकि इसने मूल दावों को जीवित रखा।
जून 2024 में, पक्षों ने खोज में संलग्न हुए, वादी ने OpenAI के प्रशिक्षण डेटासेट के बारे में विस्तृत जानकारी का अनुरोध किया और कंपनी ने व्यापार रहस्य के आधार पर विरोध किया। एक मजिस्ट्रेट न्यायाधीश ने OpenAI को कुछ दस्तावेज उत्पादित करने का आदेश दिया, लेकिन खोज का दायरा विवादित बना हुआ है। मामला मार्च 2025 में एक प्रीट्रायल सम्मेलन के लिए निर्धारित है, जिसमें संभावित परीक्षण तिथि 2025 के अंत या 2026 में है, हालांकि जटिल मुकदमेबाजी में ऐसी समयसीमाएं अक्सर बढ़ा दी जाती हैं।
लेखकों और एआई विकास के लिए निहितार्थ
Authors Guild v. OpenAI का परिणाम साहित्यिक दुनिया और एआई उद्योग दोनों के लिए गहरा प्रभाव डाल सकता है। यदि वादी प्रबल होते हैं, तो OpenAI और अन्य एआई कंपनियों को प्रशिक्षण में उपयोग किए गए प्रत्येक कॉपीराइट कार्य के लिए लाइसेंस प्राप्त करने की आवश्यकता हो सकती है, एक प्रक्रिया जो तार्किक रूप से चुनौतीपूर्ण और वित्तीय रूप से बोझिल हो सकती है। यह बड़े भाषा मॉडलों के विकास को धीमा कर सकता है, विशेष रूप से छोटी कंपनियों और अनुसंधान संस्थानों के लिए जिनके पास हजारों अधिकार धारकों के साथ बातचीत करने के संसाधनों की कमी है।
इसके विपरीत, OpenAI के पक्ष में एक फैसला एआई प्रशिक्षण पर लागू उचित उपयोग सिद्धांत की पुष्टि करेगा, संभावित रूप से कंपनियों को बिना मुआवजे के कॉपीराइट पाठ का उपयोग जारी रखने की अनुमति देगा। ऐसा निर्णय अधिक आक्रामक डेटा संग्रह को प्रोत्साहित कर सकता है और एआई उद्योग में और समेकन का कारण बन सकता है, क्योंकि केवल सबसे बड़े खिलाड़ी ही मुकदमेबाजी और समझौतों का खर्च उठा सकते हैं।
लेखकों के लिए, यह मामला पैसे से अधिक के बारे में है। यह लेखकत्व की प्रकृति के बारे में प्रश्न उठाता है जब मशीनें मानव रचनात्मकता की नकल करने वाला पाठ उत्पन्न कर सकती हैं। कुछ लेखकों ने एआई को एक उपकरण के रूप में अपनाया है, जबकि अन्य इसे अपनी आजीविका के लिए एक अस्तित्वगत खतरे के रूप में देखते हैं। Authors Guild ने मुकदमे को पेशे की रक्षा के रूप में तैयार किया है, यह तर्क देते हुए कि लेखकों को उनके कार्यों के एआई सिस्टम में योगदान के मूल्य के लिए मुआवजा दिया जाना चाहिए।
यह मामला OpenAI की व्यावसायिक प्रथाओं और रचनात्मक समुदाय के साथ इसके संबंधों के बारे में व्यापक बहसों के साथ भी जुड़ता है। 2023 में, OpenAI ने प्रशिक्षण में उनके कार्यों के उपयोग के लिए कुछ लेखकों को भुगतान करने के लिए एक कार्यक्रम शुरू किया, लेकिन शर्तों की व्यापक रूप से अपर्याप्त के रूप में आलोचना की गई। कंपनी को प्रशिक्षण डेटा के बारे में पारदर्शिता की कमी के लिए भी आलोचना का सामना करना पड़ा है, एक चिंता जो मुकदमेबाजी के केंद्र में है।
विशेषज्ञ राय और विद्वानों की बहस
कानूनी विद्वान संभावित परिणाम पर विभाजित हैं। कुछ, जैसे कि कैलिफोर्निया विश्वविद्यालय, बर्कले की प्रोफेसर पामेला सैमुएलसन, ने तर्क दिया है कि कॉपीराइट कार्यों पर एआई प्रशिक्षण को उचित उपयोग माना जाना चाहिए, खोज इंजन और अन्य प्रौद्योगिकियों के समानांतर चित्रण जो परिवर्तनकारी उद्देश्यों के लिए पाठ की नकल करते हैं। अन्य, जैसे कि कॉर्नेल विश्वविद्यालय के प्रोफेसर जेम्स ग्रिमेलमैन, ने सुझाव दिया है कि एआई प्रशिक्षण का पैमाना और व्यावसायिक प्रकृति लेखकों के पक्ष में संतुलन बदल सकती है, खासकर यदि मॉडल मूल कार्यों के साथ प्रतिस्पर्धा करने वाले आउटपुट उत्पन्न कर सकते हैं।
यह मामला अर्थशास्त्रियों का भी ध्यान आकर्षित कर रहा है, जो ध्यान देते हैं कि प्रशिक्षण डेटा का मूल्य पर्याप्त है। एक 2023 अध्ययन ने अनुमान लगाया कि एआई प्रशिक्षण के लिए एक उच्च-गुणवत्ता वाली पुस्तक का बाजार मूल्य हजारों डॉलर में हो सकता है, मॉडल प्रदर्शन में सुधार करने में विविध, अच्छी तरह से लिखित पाठ के महत्व को देखते हुए। इसने कुछ को यह तर्क देने के लिए प्रेरित किया है कि लेखक प्रभावी रूप से एआई उद्योग को सब्सिडी दे रहे हैं बिना लाभ का हिस्सा प्राप्त किए।
निष्कर्ष और दृष्टिकोण
2025 की शुरुआत तक, Authors Guild v. OpenAI खोज चरण में बना हुआ है, गुण-दोष पर कोई अंतिम फैसला नहीं हुआ है। मामले को हल करने में वर्षों लगने की संभावना है, और परिणाम की परवाह किए बिना यू.एस. अपील न्यायालय (द्वितीय सर्किट) में अपील की संभावना है। सुप्रीम कोर्ट अंततः हस्तक्षेप कर सकता है, जैसा कि उसने नई प्रौद्योगिकियों से जुड़े अन्य कॉपीराइट मामलों में किया है, जैसे कि 2021 का Google v. Oracle निर्णय, जिसने माना कि Google का Java कोड का उपयोग उचित उपयोग था।
इस बीच, मामले का पहले से ही प्रभाव पड़ा है। इसने अन्य लेखकों और प्रकाशकों को अपने स्वयं के मुकदमे दायर करने के लिए प्रेरित किया है, और स्वैच्छिक लाइसेंसिंग ढांचे विकसित करने के प्रयासों को तेज किया है। इसने एआई की नैतिकता, रचनाकारों के अधिकारों और डिजिटल युग में बौद्धिक संपदा के भविष्य के बारे में एक व्यापक सार्वजनिक बातचीत में भी योगदान दिया है। अंतिम निर्णय जो भी हो, Authors Guild v. OpenAI को कृत्रिम बुद्धिमत्ता और कॉपीराइट कानून के इतिहास में एक ऐतिहासिक मामले के रूप में याद किए जाने की संभावना है।