काद्रे बनाम मेटा प्लेटफॉर्म्स एक नागरिक मुकदमा है जो 2023 में संयुक्त राज्य अमेरिका के उत्तरी कैलिफोर्निया जिले के लिए जिला न्यायालय में दायर किया गया था। वादी, लेखकों का एक समूह जिसमें रिचर्ड काद्रे, सारा सिल्वरमैन, और क्रिस्टोफर गोल्डन शामिल हैं, आरोप लगाते हैं कि मेटा प्लेटफॉर्म्स, इंक. ने अपने LLaMA (लार्ज लैंग्वेज मॉडल मेटा एआई) परिवार के बड़े भाषा मॉडलों को प्रशिक्षित करने के लिए उनकी पुस्तकों की चोरी की गई प्रतियों का उपयोग करके उनके कॉपीराइट का उल्लंघन किया। यह मामला जनरेटिव आर्टिफिशियल इंटेलिजेंस सिस्टम के डेवलपर्स के खिलाफ मुकदमों की एक व्यापक लहर का हिस्सा है, जो स्पष्ट अनुमति के बिना कॉपीराइट पाठ पर मॉडलों को प्रशिक्षित करने की वैधता के बारे में प्रश्न उठाता है।
मुकदमा मेटा द्वारा "Books3" नामक डेटासेट के उपयोग पर केंद्रित है, जिसमें 195,000 से अधिक पुस्तकें शामिल हैं, जिनमें से कई शैडो लाइब्रेरी बिब्लियोटिक से प्राप्त की गई थीं। वादी दावा करते हैं कि मेटा ने LLaMA मॉडलों, जिनमें LLaMA 1 और LLaMA 2 शामिल हैं, को प्रशिक्षित करने के लिए इस डेटासेट को डाउनलोड और उपयोग किया, बिना लाइसेंस प्राप्त किए या लेखकों को मुआवजा दिए। यह मामला मशीन लर्निंग पर कॉपीराइट कानून के आवेदन के लिए एक प्रमुख परीक्षण बन गया है, विशेष रूप से उचित उपयोग के सिद्धांत का।
पृष्ठभूमि और पक्षकार
मुख्य वादी, रिचर्ड काद्रे, एक अमेरिकी लेखक हैं जो सैंडमैन स्लिम शहरी फंतासी श्रृंखला के लिए जाने जाते हैं। सारा सिल्वरमैन, एक हास्य कलाकार और लेखिका, और क्रिस्टोफर गोल्डन, एक हॉरर और फंतासी लेखक, मुकदमे में शामिल हुए। शिकायत 7 जुलाई, 2023 को दायर की गई थी, और बाद में इसे समान कार्रवाइयों के साथ समेकित किया गया, जिसमें लेखक पॉल ट्रेमब्ले द्वारा लाया गया एक मामला भी शामिल था। प्रतिवादी मेटा प्लेटफॉर्म्स, इंक. और इसकी सहायक कंपनी मेटा एआई हैं, जिन्होंने LLaMA मॉडल विकसित किए।
वादियों का प्रतिनिधित्व कानूनी फर्म जोसेफ सेवेरी लॉ फर्म द्वारा किया जाता है, जिसने एआई कंपनियों के खिलाफ कई मुकदमे दायर किए हैं। मेटा का प्रतिनिधित्व गिब्सन, डन और क्रचर के वकीलों द्वारा किया जाता है। मामला न्यायाधीश जैकलीन स्कॉट कोर्ले को सौंपा गया है, जो अन्य एआई कॉपीराइट विवादों की भी देखरेख करती हैं।
कॉपीराइट उल्लंघन के आरोप
मुख्य आरोप यह है कि मेटा ने प्रशिक्षण प्रक्रिया के दौरान बिना प्राधिकरण के कॉपीराइट पुस्तकों का पुनरुत्पादन और वितरण किया। वादी तर्क देते हैं कि LLaMA मॉडल, जब संकेत दिए जाते हैं, तो उनकी पुस्तकों के अंशों से मिलता-जुलता पाठ उत्पन्न कर सकते हैं, जो दर्शाता है कि मॉडलों ने कॉपीराइट सामग्री को याद कर लिया है और पुनरुत्पादित कर सकते हैं। वे यह भी दावा करते हैं कि मेटा का Books3 डेटासेट का उपयोग, जो एआई-केंद्रित प्लेटफॉर्म द आई पर एक उपयोगकर्ता द्वारा बनाया गया था, जानबूझकर उल्लंघनकारी था क्योंकि यह डेटासेट व्यापक रूप से चोरी की पुस्तकों से युक्त होने के लिए जाना जाता था।
शिकायत में विशिष्ट उदाहरणों का हवाला दिया गया है, जैसे कि मॉडल द्वारा काद्रे के उपन्यास "सैंडमैन स्लिम" और सिल्वरमैन के संस्मरण "द बेडवेटर" के अंशों से मेल खाता पाठ उत्पन्न करना। वादी जोर देकर कहते हैं कि यह पुनरुत्पादन प्रत्यक्ष और विकृत उल्लंघन के साथ-साथ योगदानकारी उल्लंघन का गठन करता है, क्योंकि मेटा ने उल्लंघनकारी डेटासेट के निर्माण की सुविधा प्रदान की।
मेटा की रक्षा और उचित उपयोग तर्क
मेटा की प्राथमिक रक्षा यह है कि कॉपीराइट पाठ पर एआई मॉडलों को प्रशिक्षित करना अमेरिकी कॉपीराइट अधिनियम की धारा 107 के तहत उचित उपयोग है। कंपनी तर्क देती है कि उपयोग परिवर्तनकारी है क्योंकि मॉडल पुस्तकों को पूर्ण रूप से पुनरुत्पादित नहीं करते हैं, बल्कि सांख्यिकीय पैटर्न और भाषा संरचनाएं सीखते हैं। मेटा यह भी दावा करती है कि प्रशिक्षण प्रक्रिया एक मानव द्वारा पुस्तक पढ़ने और उससे सीखने के समान है, और मॉडल बाजार में मूल कार्यों के साथ प्रतिस्पर्धा नहीं करते हैं।
मेटा ने मामले को खारिज करने के लिए प्रस्ताव दायर किए हैं, यह तर्क देते हुए कि वादी दावा प्रस्तुत करने में विफल रहे क्योंकि उन्होंने यह प्रदर्शित नहीं किया कि मॉडल कॉपीराइट कार्यों के पर्याप्त हिस्से आउटपुट करते हैं। कंपनी इस तथ्य की ओर भी इशारा करती है कि LLaMA मॉडल ओपन-सोर्स हैं और प्रशिक्षण डेटा सार्वजनिक रूप से वितरित नहीं किया जाता है, जो वह तर्क देती है कि किसी भी बाजार हानि को सीमित करता है।
प्रक्रियात्मक इतिहास
जुलाई 2023 में प्रारंभिक फाइलिंग के बाद, अदालत ने कई संबंधित मामलों को प्रमुख मामला संख्या 3:23-cv-03417 के तहत समेकित किया। नवंबर 2023 में, न्यायाधीश कोर्ले ने प्रत्यक्ष उल्लंघन के दावों पर मेटा के खारिज करने के प्रस्ताव को अस्वीकार कर दिया, लेकिन वादियों को विकृत और योगदानकारी उल्लंघन के संबंध में अपनी शिकायत में संशोधन करने की अनुमति दी। वादियों ने दिसंबर 2023 में एक संशोधित शिकायत दायर की, जिसमें अधिक विशिष्ट आरोप जोड़े गए।
फरवरी 2024 में, मेटा ने संशोधित शिकायत को खारिज करने के लिए एक नया प्रस्ताव दायर किया, जिसे मई 2024 में आंशिक रूप से स्वीकार किया गया। अदालत ने योगदानकारी उल्लंघन के दावे को खारिज कर दिया, लेकिन प्रत्यक्ष उल्लंघन और विकृत देयता के दावों को आगे बढ़ने की अनुमति दी। खोज जारी है, दोनों पक्ष मेटा से आंतरिक संचार और प्रशिक्षण डेटा दस्तावेज़ीकरण की मांग कर रहे हैं।
एआई कॉपीराइट मुकदमेबाजी का व्यापक संदर्भ
यह मामला एआई डेवलपर्स के खिलाफ कई हाई-प्रोफाइल मुकदमों में से एक है। इसी तरह की कार्रवाइयां ओपनएआई और एंथ्रोपिक के खिलाफ लेखकों द्वारा दायर की गई हैं, जिसमें हास्य कलाकार सारा सिल्वरमैन के नेतृत्व में एक क्लास एक्शन शामिल है (जिसे बाद में आंशिक रूप से खारिज कर दिया गया था), और गूगल के खिलाफ उसके जेमिनी मॉडल पर लेखकों द्वारा। इन मामलों के परिणाम जनरेटिव एआई के लिए कानूनी परिदृश्य को आकार देने की उम्मीद है, संभावित रूप से प्रभावित करते हुए कि कंपनियां प्रशिक्षण डेटा कैसे एकत्र करती हैं और क्या उन्हें कॉपीराइट कार्यों के लाइसेंस की आवश्यकता है।
अमेरिकी कॉपीराइट कार्यालय भी इस मुद्दे का अध्ययन कर रहा है, और 2023 में इसने एआई और कॉपीराइट के प्रतिच्छेदन पर सार्वजनिक टिप्पणियां मांगने के लिए एक नोटिस ऑफ इंक्वायरी जारी किया। कार्यालय ने अभी तक अंतिम मार्गदर्शन जारी नहीं किया है, लेकिन इसकी रिपोर्टों ने एक संतुलित दृष्टिकोण की आवश्यकता पर जोर दिया है जो लेखकों की रक्षा करते हुए तकनीकी नवाचार की अनुमति देता है।
प्रमुख कानूनी प्रश्न
यह मामला कई अनसुलझे कानूनी प्रश्न उठाता है। पहला, क्या प्रशिक्षण के दौरान कॉपीराइट कार्यों का पुनरुत्पादन कानूनी अर्थों में "प्रतिलिपि" का गठन करता है, भले ही प्रतियां क्षणिक हों और सीधे वितरित न हों। दूसरा, क्या एआई मॉडलों की परिवर्तनकारी प्रकृति उचित उपयोग के पक्ष में भार डालती है, यह देखते हुए कि मॉडल नया पाठ उत्पन्न कर सकते हैं लेकिन अंशों को याद और पुनरुत्पादित भी कर सकते हैं। तीसरा, क्या लेखकों को बाजार हानि महत्वपूर्ण है, खासकर यदि एआई मॉडल ऐसा पाठ उत्पन्न कर सकते हैं जो मूल पुस्तकों का विकल्प बनता है।
अदालतों ने ऐतिहासिक रूप से उचित उपयोग के लिए चार-कारक परीक्षण लागू किया है, जिसमें उपयोग का उद्देश्य और चरित्र, कॉपीराइट कार्य की प्रकृति, उपयोग की गई मात्रा, और बाजार पर प्रभाव पर विचार किया जाता है। संबंधित मामले ऑथर्स गिल्ड बनाम गूगल (2015) में, दूसरे सर्किट ने पाया कि खोज के लिए गूगल द्वारा पुस्तकों का डिजिटलीकरण उचित उपयोग था, लेकिन उस मामले में स्निपेट्स का सीमित प्रदर्शन शामिल था। काद्रे मामले में अधिक व्यापक पुनरुत्पादन शामिल है, जो एक अलग परिणाम की ओर ले जा सकता है।
संभावित परिणाम और निहितार्थ
यदि वादी विजयी होते हैं, तो मेटा को प्रति कार्य $150,000 तक के वैधानिक नुकसान का भुगतान करने की आवश्यकता हो सकती है, जो डेटासेट में पुस्तकों की संख्या को देखते हुए अरबों डॉलर तक हो सकता है। कंपनी को LLaMA मॉडलों को नष्ट करने या लाइसेंस प्राप्त डेटा पर उन्हें फिर से प्रशिक्षित करने का आदेश भी दिया जा सकता है। ऐसा फैसला एआई विकास पर ठंडा प्रभाव डाल सकता है, कंपनियों को सभी प्रशिक्षण डेटा के लिए लाइसेंस प्राप्त करने के लिए मजबूर कर सकता है, जो महंगा और समय लेने वाला होगा।
इसके विपरीत, यदि मेटा उचित उपयोग पर जीतता है, तो यह एक व्यापक मिसाल स्थापित करेगा कि कॉपीराइट पाठ पर एआई प्रशिक्षण अनुमेय है, संभावित रूप से बड़े भाषा मॉडलों के विकास को तेज करेगा। यह अन्य लंबित मामलों को भी प्रभावित कर सकता है और अधिक कंपनियों को बिना मुआवजे के स्क्रैप किए गए डेटा का उपयोग करने के लिए प्रोत्साहित कर सकता है।
वर्तमान स्थिति और भविष्य की कार्यवाही
2024 के अंत तक, मामला खोज चरण में है। पक्ष दस्तावेजों का आदान-प्रदान कर रहे हैं और बयान ले रहे हैं। एक परीक्षण तिथि निर्धारित नहीं की गई है, लेकिन कानूनी विश्लेषकों को उम्मीद है कि मामला 2025 में सारांश निर्णय प्रस्तावों की ओर बढ़ेगा। अदालत एक क्लास एक्शन प्रमाणित करने का भी निर्णय ले सकती है, जो वादी समूह को Books3 डेटासेट में कार्यों वाले सभी लेखकों तक विस्तारित करेगा।
मामले ने विभिन्न संगठनों से एमिकस ब्रीफ आकर्षित किए हैं, जिनमें ऑथर्स गिल्ड शामिल है, जो वादियों का समर्थन करता है, और इलेक्ट्रॉनिक फ्रंटियर फाउंडेशन, जिसने समान मामलों में उचित उपयोग के पक्ष में ब्रीफ दायर किए हैं। परिणाम की अपील होने की संभावना है, चाहे जिला अदालत का फैसला कुछ भी हो, संभावित रूप से सुप्रीम कोर्ट तक पहुंच सकता है।
एआई उद्योग के लिए महत्व
काद्रे मामला एआई उद्योग के लिए एक बेलवेदर है। यह परीक्षण करता है कि स्वीकार्य प्रशिक्षण डेटा क्या गठित करता है और क्या LLaMA जैसे मॉडलों की ओपन-सोर्स प्रकृति कानूनी विश्लेषण को बदलती है। यह मामला नवाचार और बौद्धिक संपदा अधिकारों के बीच तनाव को भी उजागर करता है, एक बहस जो Artificial intelligence और Generative AI के भविष्य के लिए केंद्रीय है।
OpenAI और Anthropic जैसी कंपनियां कार्यवाही को बारीकी से देख रही हैं, क्योंकि उन्हें समान मुकदमों का सामना करना पड़ता है। परिणाम प्रभावित कर सकता है कि वे प्रकाशकों और लेखकों के साथ लाइसेंसिंग सौदों पर कैसे बातचीत करते हैं, और क्या वे कॉपीराइट सामग्री से बचने वाले वैकल्पिक प्रशिक्षण तरीकों में निवेश करते हैं। इस मामले के Machine learning अनुसंधान के लिए भी निहितार्थ हैं, क्योंकि कई शैक्षणिक डेटासेट में कॉपीराइट पाठ होता है।
इस बीच, मेटा ने LLaMA के नए संस्करण जारी करना जारी रखा है, जिसमें LLaMA 3 शामिल है, जिसे एक बड़े डेटासेट पर प्रशिक्षित किया गया था जिसमें अतिरिक्त कॉपीराइट कार्य शामिल हो सकते हैं। कंपनी ने कहा है कि वह बौद्धिक संपदा अधिकारों का सम्मान करने के लिए प्रतिबद्ध है, लेकिन उसने व्यापार रहस्यों का हवाला देते हुए अपने प्रशिक्षण डेटा की पूरी सामग्री का खुलासा नहीं किया है।
निष्कर्ष
काद्रे बनाम मेटा प्लेटफॉर्म्स एक ऐतिहासिक मामला है जो एआई प्रशिक्षण की कानूनी सीमाओं को परिभाषित करने में मदद करेगा। निर्णय के लेखकों, प्रौद्योगिकी कंपनियों और जनता के लिए दूरगामी परिणाम होंगे। जबकि मामला अभी भी चल रहा है, इसका परिणाम एक मिसाल स्थापित करने की संभावना है जो Large language model और अन्य Neural network प्रणालियों पर कॉपीराइट कानून के आवेदन को प्रभावित करता है। अदालत के फैसले की कानूनी विद्वानों, नीति निर्माताओं और उद्योग हितधारकों द्वारा बारीकी से जांच की जाएगी, क्योंकि यह रचनात्मक कार्यों की रक्षा और तकनीकी प्रगति को बढ़ावा देने के बीच संतुलन के बारे में मौलिक प्रश्नों को संबोधित करता है।