न्यूयॉर्क टाइम्स कंपनी ने दिसंबर 2023 में OpenAI और Microsoft के खिलाफ मुकदमा दायर किया, जिसमें आरोप लगाया गया कि इन कंपनियों ने अपने बड़े भाषा मॉडल को प्रशिक्षित करने के लिए बिना अनुमति के लाखों कॉपीराइट समाचार लेखों का उपयोग किया। न्यूयॉर्क के दक्षिणी जिले के अमेरिकी जिला न्यायालय में दायर शिकायत में दावा किया गया है कि OpenAI का ChatGPT और Microsoft का Copilot उत्पाद, संकेत देने पर टाइम्स के लेखों को शब्दशः या न्यूनतम परिवर्तन के साथ पुन: प्रस्तुत करते हैं, जिससे अखबार की अपनी पत्रकारिता से मुद्रीकरण करने की क्षमता कमजोर होती है। टाइम्स वैधानिक हर्जाना, उसकी सामग्री के आगे उपयोग पर रोक, और उसके लेखों वाले किसी भी डेटासेट के विनाश की मांग करता है।
यह मुकदमा जनरेटिव एआई उद्योग के लिए सबसे प्रमुख कानूनी चुनौतियों में से एक है, जिसने प्रशिक्षण के लिए बड़े पैमाने पर वेब-स्क्रैप किए गए पाठ पर निर्भर रहा है। टाइम्स का तर्क है कि उसकी सामग्री का उपयोग बिना लाइसेंस के किया गया, जबकि OpenAI और Microsoft का दावा है कि उनका उपयोग उचित उपयोग सिद्धांत के अंतर्गत आता है, जो कॉपीराइट सामग्री के सीमित पुनरुत्पादन की अनुमति देता है, जैसे कि टिप्पणी या शोध के उद्देश्यों के लिए। इस मामले ने व्यापक ध्यान आकर्षित किया है क्योंकि इसका परिणाम यह आकार दे सकता है कि एआई कंपनियां प्रशिक्षण डेटा कैसे प्राप्त करती हैं और क्या उन्हें पहुंच के लिए प्रकाशकों को भुगतान करना होगा।
पृष्ठभूमि और पक्षकार
न्यूयॉर्क टाइम्स, जिसकी स्थापना 1851 में हुई, संयुक्त राज्य अमेरिका के सबसे बड़े और सबसे प्रभावशाली समाचार पत्रों में से एक है, जिसका डिजिटल सदस्यता आधार 2023 तक 10 मिलियन से अधिक है। OpenAI, जिसकी स्थापना 2015 में एक गैर-लाभकारी संस्था के रूप में हुई और बाद में लाभ-उद्देश्य वाली शाखा के साथ पुनर्गठित हुई, ChatGPT चैटबॉट और अंतर्निहित GPT श्रृंखला के मॉडल विकसित करती है। Microsoft ने 2019 से OpenAI में $13 बिलियन से अधिक का निवेश किया है और OpenAI के सिस्टम को प्रशिक्षित करने और तैनात करने के लिए उपयोग किए जाने वाले Azure क्लाउड इंफ्रास्ट्रक्चर प्रदान करता है। Microsoft अपने Bing खोज इंजन और Office उत्पादकता सुइट में OpenAI की तकनीक को भी एकीकृत करता है।
मुकदमे में OpenAI और Microsoft दोनों को प्रतिवादी बनाया गया है, यह तर्क देते हुए कि Microsoft की गहरी वित्तीय और तकनीकी भागीदारी इसे समान रूप से उत्तरदायी बनाती है। टाइम्स की कानूनी टीम, जिसका नेतृत्व कानून फर्म सुस्मान गॉडफ्रे कर रही है, ने OpenAI के साथ संभावित लाइसेंसिंग समझौते पर महीनों की असफल बातचीत के बाद 27 दिसंबर, 2023 को शिकायत दर्ज कराई।
कॉपीराइट उल्लंघन के आरोप
शिकायत में विशिष्ट उदाहरणों का विवरण दिया गया है जहां ChatGPT और Microsoft के Copilot ने कथित तौर पर टाइम्स के लेखों को पुन: प्रस्तुत किया। उदाहरण के लिए, सीसा विषाक्तता पर 2019 की एक जांच रिपोर्ट के बारे में प्रश्न पूछे जाने पर, ChatGPT ने कथित तौर पर लेख का लगभग शब्दशः अंश उत्पन्न किया, जिसमें शीर्षक और कई पैराग्राफ शामिल थे। टाइम्स ने यह भी सबूत पेश किया कि मॉडल उसके रेस्तरां समीक्षाओं, उत्पाद अनुशंसाओं और समाचार कहानियों से मेल खाता पाठ उत्पन्न कर सकते हैं, कभी-कभी बिना किसी श्रेय के।
टाइम्स का तर्क है कि यह पुनरुत्पादन स्वीकार्य उचित उपयोग से परे है क्योंकि यह सीधे अखबार की अपनी डिजिटल सामग्री के साथ प्रतिस्पर्धा करता है। जब उपयोगकर्ता ChatGPT से समाचार सारांश पूछते हैं, तो उन्हें ऐसी जानकारी मिल सकती है जिसके लिए अन्यथा टाइम्स सदस्यता की आवश्यकता होती, जिससे अखबार की वेबसाइट पर ट्रैफिक कम हो जाता है और विज्ञापन और सदस्यता राजस्व घट जाता है। शिकायत में यह भी नोट किया गया है कि OpenAI के प्रशिक्षण डेटा में टाइम्स के लेख कॉमन क्रॉल जैसे स्रोतों से शामिल थे, जो वेब पेजों को संग्रहीत करने वाली एक गैर-लाभकारी संस्था है, बिना अनुमति प्राप्त किए।
कानूनी तर्क और उचित उपयोग बचाव
OpenAI और Microsoft ने फरवरी 2024 में मुकदमे को खारिज करने के लिए एक प्रस्ताव दायर किया, यह तर्क देते हुए कि टाइम्स के दावे कॉपीराइट पाठ को निकालने के लिए डिज़ाइन किए गए असामान्य संकेतों के साथ ChatGPT को "हैक" करने पर आधारित हैं, न कि सामान्य उपयोगकर्ता व्यवहार पर। उन्होंने उचित उपयोग सिद्धांत का हवाला दिया, जो उपयोग के उद्देश्य (परिवर्तनकारी बनाम वाणिज्यिक), कॉपीराइट कार्य की प्रकृति, उपयोग की गई मात्रा और बाजार पर प्रभाव जैसे कारकों पर विचार करता है। OpenAI का कहना है कि सार्वजनिक रूप से उपलब्ध पाठ पर प्रशिक्षण एक मानव द्वारा पुस्तकों को पढ़ने और सीखने के समान है, और परिणामी मॉडल मूल लेखों की प्रतियां संग्रहीत नहीं करते हैं।
टाइम्स इसका जवाब देता है कि उपयोग परिवर्तनकारी नहीं है क्योंकि मॉडल ऐसा पाठ उत्पन्न करने के लिए डिज़ाइन किए गए हैं जो मूल लेखों के साथ प्रतिस्पर्धा करता है, और OpenAI के उत्पादों की वाणिज्यिक प्रकृति उचित उपयोग के खिलाफ है। अखबार "मात्रा और पर्याप्तता" कारक की ओर भी इशारा करता है, यह देखते हुए कि मॉडल संक्षिप्त अंशों को नहीं, बल्कि पूरे लेखों को पुन: प्रस्तुत कर सकते हैं। कानूनी विद्वानों ने नोट किया है कि परिणाम इस बात पर निर्भर हो सकता है कि अदालतें एआई प्रशिक्षण को ऑथर्स गिल्ड बनाम गूगल मामले में Google के पुस्तकों के डिजिटलीकरण के समान उचित उपयोग के रूप में देखती हैं, या अधिक प्रत्यक्ष उल्लंघन के रूप में।
एआई कॉपीराइट मुकदमेबाजी का व्यापक संदर्भ
टाइम्स मुकदमा एआई कंपनियों के खिलाफ कॉपीराइट कार्रवाइयों की लहर का हिस्सा है। 2023 में, सारा सिल्वरमैन, क्रिस्टोफर गोल्डन और रिचर्ड काद्रे सहित लेखकों ने प्रशिक्षण डेटा में अपनी पुस्तकों के उपयोग के लिए OpenAI और Meta पर मुकदमा किया। Getty Images ने यूनाइटेड किंगडम और संयुक्त राज्य अमेरिका में Stability AI के खिलाफ अपनी तस्वीरों के दुरुपयोग का आरोप लगाते हुए मुकदमा दायर किया। दिसंबर 2023 में, हास्य अभिनेत्री सारा सिल्वरमैन और अन्य वादी ने अपनी शिकायतों में ChatGPT द्वारा कॉपीराइट पाठ को पुन: प्रस्तुत करने के विशिष्ट उदाहरण शामिल करने के लिए संशोधन किया।
इन मामलों ने एआई प्रशिक्षण के लिए वेब स्क्रैपिंग की वैधता, मशीन लर्निंग पर उचित उपयोग की प्रयोज्यता और नए लाइसेंसिंग ढांचे की आवश्यकता के बारे में प्रश्न उठाए हैं। एसोसिएटेड प्रेस और एक्सल स्प्रिंगर जैसे कुछ प्रकाशकों ने OpenAI के साथ लाइसेंसिंग समझौतों पर हस्ताक्षर किए हैं, जबकि टाइम्स सहित अन्य ने मुकदमेबाजी को चुना है। टाइम्स का मुकदमा अपने पैमाने और साक्ष्य की गुणवत्ता के लिए उल्लेखनीय है, जिसमें मॉडल आउटपुट और मूल लेखों की साथ-साथ तुलना शामिल है।
तकनीकी और आर्थिक निहितार्थ
इस मामले के एआई उद्योग के लिए महत्वपूर्ण निहितार्थ हैं। यदि टाइम्स की जीत होती है, तो एआई कंपनियों को सभी कॉपीराइट प्रशिक्षण डेटा के लिए लाइसेंस प्राप्त करने की आवश्यकता हो सकती है, जिससे लागत बढ़ सकती है और मॉडल विकास धीमा हो सकता है। वैकल्पिक रूप से, OpenAI के पक्ष में एक फैसला बिना मुआवजे के सार्वजनिक रूप से उपलब्ध पाठ पर प्रशिक्षण की प्रथा को मजबूत कर सकता है, जिससे सदस्यता राजस्व पर निर्भर समाचार संगठनों को नुकसान हो सकता है।
आर्थिक दांव ऊंचे हैं। टाइम्स ने 2023 में लगभग $2.5 बिलियन का वार्षिक राजस्व दर्ज किया, जिसमें डिजिटल सदस्यताओं की हिस्सेदारी बढ़ रही है। अखबार ने अपने स्वयं के डिजिटल उत्पादों, जिनमें गेम, कुकिंग और ऑडियो शामिल हैं, में भारी निवेश किया है और तर्क देता है कि एआई-जनित सारांश इन निवेशों को कमजोर करते हैं। OpenAI, जिसका मूल्य 2024 की शुरुआत में $80 बिलियन से अधिक था, ने कहा है कि वह सामग्री के लिए भुगतान करने को तैयार है, लेकिन टाइम्स के व्यापक उल्लंघन के दावों को विवादित करता है।
प्रक्रियात्मक इतिहास और वर्तमान स्थिति
खारिज करने के प्रस्ताव के बाद, अदालत ने मामले को आगे बढ़ने की अनुमति दी, जिसमें 2024 के मध्य में खोज शुरू होने वाली थी। अप्रैल 2024 में, टाइम्स ने एक संशोधित शिकायत दायर की जिसमें कथित उल्लंघन के नए उदाहरण जोड़े गए, जिनमें ऐसे उदाहरण शामिल थे जहां ChatGPT ने टाइम्स के वायरकटर उत्पाद समीक्षा अनुभाग के लेखों को पुन: प्रस्तुत किया। OpenAI ने जवाब दिया कि संशोधित शिकायत अभी भी यह दिखाने में विफल रही कि मॉडल उल्लंघन का गठन करने वाले तरीके से लेखों को "याद" करते हैं।
मई 2024 में, अदालत ने OpenAI के खारिज करने के प्रस्ताव को आंशिक रूप से खारिज कर दिया, मुख्य कॉपीराइट दावों को आगे बढ़ने की अनुमति दी, जबकि डिजिटल मिलेनियम कॉपीराइट अधिनियम से संबंधित कुछ सहायक दावों को खारिज कर दिया। यह मामला वर्तमान में खोज चरण में है, दोनों पक्ष दस्तावेजों और बयानों का आदान-प्रदान कर रहे हैं। कोई परीक्षण तिथि निर्धारित नहीं की गई है, लेकिन कानूनी विशेषज्ञों को उम्मीद है कि यह मामला कई वर्षों तक चलेगा, जिसमें उच्च न्यायालयों में संभावित अपीलें शामिल हैं।
एआई और प्रकाशन उद्योगों की प्रतिक्रियाएं
मुकदमे ने एआई समुदाय के भीतर बहस छेड़ दी है। कुछ शोधकर्ताओं का तर्क है कि सक्षम मॉडल बनाने के लिए कॉपीराइट पाठ पर प्रशिक्षण आवश्यक है, जबकि अन्य अधिक पारदर्शी डेटा सोर्सिंग की वकालत करते हैं। OpenAI के सीईओ सैम ऑल्टमैन ने सार्वजनिक रूप से कहा है कि कंपनी लाइसेंसिंग समझौतों के लिए खुली है और अपनी डेटा प्रथाओं में स्पष्टता की कमी पर खेद व्यक्त किया है। Microsoft काफी हद तक चुप रहा है, सार्वजनिक बयानों में OpenAI को प्राथमिकता देता है।
न्यूज़ मीडिया एलायंस सहित प्रकाशन उद्योग समूहों ने टाइम्स का समर्थन करते हुए एमिकस ब्रीफ दायर किए हैं, यह तर्क देते हुए कि एआई कंपनियां पत्रकारों के काम पर मुफ्त सवारी कर रही हैं। इसके विपरीत, कुछ प्रौद्योगिकी वकालत समूहों ने चेतावनी दी है कि OpenAI के खिलाफ एक फैसला नवाचार में बाधा डाल सकता है और बड़े प्रकाशकों को सूचना पर अत्यधिक नियंत्रण दे सकता है। इस मामले ने विधायी चर्चाओं को भी प्रभावित किया है, कुछ विधायकों ने ऐसे कानूनों का प्रस्ताव किया है जिनके लिए एआई कंपनियों को अपने प्रशिक्षण डेटा स्रोतों का खुलासा करना आवश्यक होगा।
संभावित परिणाम और मिसाल
यदि टाइम्स जीतता है, तो अदालत OpenAI और Microsoft को प्रति उल्लंघित कार्य $150,000 तक का वैधानिक हर्जाना देने का आदेश दे सकती है, जो कथित रूप से उपयोग किए गए लाखों लेखों को देखते हुए अरबों डॉलर तक हो सकता है। अदालत प्रशिक्षण डेटासेट के विनाश की आवश्यकता वाला निषेधाज्ञा भी जारी कर सकती है, जो OpenAI को टाइम्स सामग्री के बिना अपने मॉडलों को फिर से प्रशिक्षित करने के लिए मजबूर करेगा। ऐसा परिणाम संभवतः अन्य प्रकाशकों से समान मुकदमों की लहर का कारण बनेगा।
यदि OpenAI जीतता है, तो यह मामला एआई प्रशिक्षण के लिए एक व्यापक उचित उपयोग मिसाल स्थापित करेगा, संभावित रूप से कंपनियों को बिना मुआवजे के किसी भी सार्वजनिक रूप से उपलब्ध पाठ का उपयोग करने की अनुमति देगा। यह एआई विकास को तेज कर सकता है, लेकिन समाचार संगठनों की वित्तीय व्यवहार्यता को भी कम कर सकता है, जिन्होंने पहले से ही प्रिंट राजस्व में गिरावट देखी है। कुछ पर्यवेक्षकों का सुझाव है कि एक समझौता अधिक संभावित है, जिसमें OpenAI अपनी सामग्री तक निरंतर पहुंच के बदले टाइम्स को लाइसेंसिंग शुल्क का भुगतान करने पर सहमत होगा।
एआई शासन के लिए महत्व
यह मुकदमा एआई शासन और नवाचार और बौद्धिक संपदा अधिकारों के बीच संतुलन पर व्यापक बहस में एक मील का पत्थर है। यह मौलिक प्रश्न उठाता है कि क्या एआई मॉडल को परिवर्तनकारी उपकरण या व्युत्पन्न कार्यों के रूप में माना जाना चाहिए, और क्या प्रशिक्षण डेटा के निर्माता मुआवजे के हकदार हैं। इस मामले पर नियामकों द्वारा बारीकी से नजर रखी जा रही है, जिसमें अमेरिकी कॉपीराइट कार्यालय भी शामिल है, जो एआई और कॉपीराइट मुद्दों पर एक अध्ययन कर रहा है।
2024 के अंत तक, यह मामला अनसुलझा है, दोनों पक्ष लंबी कानूनी लड़ाई की तैयारी कर रहे हैं। परिणाम संभवतः न केवल OpenAI और Microsoft के भविष्य को प्रभावित करेगा, बल्कि Anthropic और Google DeepMind जैसी अन्य एआई कंपनियों की प्रथाओं को भी प्रभावित करेगा, जो बड़े पैमाने पर पाठ प्रशिक्षण पर भी निर्भर हैं। टाइम्स का बातचीत के बजाय मुकदमा करने का निर्णय इसे जनरेटिव एआई के युग में सामग्री निर्माताओं के अधिकारों के लिए एक परीक्षण मामला बनाता है।