Authors Guild और किताबों के अन्य वादी संघीय न्यायाधीश से कह रहे हैं कि OpenAI ने कॉपीराइट वाली किताबें कैसे हासिल कीं, इसकी जाँच बाद में उन किताबों के साथ किए गए काम से अलग की जाए। 17 सितंबर को सार्वजनिक किए गए उनके दस्तावेज़ों में Library Genesis—मॉडल प्रशिक्षण में इस्तेमाल किए गए पुस्तक-संग्रहों का स्रोत—के बारे में आंतरिक चर्चाओं का वर्णन है। उनका तर्क है कि किताबें डाउनलोड करना, उनसे मॉडल को प्रशिक्षित करना और प्रतियाँ आगे देना—हर काम के लिए कॉपीराइट का अलग कानूनी विश्लेषण होना चाहिए।
OpenAI इस दृष्टिकोण से असहमत है। उसी दिन दाख़िल उसके संशोधित दस्तावेज़ में तर्क है कि किताबें हासिल करना और मॉडल प्रशिक्षित करना एक ही परिवर्तनकारी उद्देश्य के हिस्से थे, जिसे fair use संरक्षण देता है। दोनों पक्षों के अनुरोध न्यूयॉर्क में न्यायाधीश Sidney H. Stein के सामने लंबित हैं। 24 सितंबर के आदेश ने दलीलें दाख़िल करने की समय-सारणी बढ़ाई; उसने कॉपीराइट विवाद का फैसला नहीं किया। (वादी पक्ष का संक्षिप्त ज्ञापन, OpenAI का संक्षिप्त ज्ञापन, समय-सारणी का आदेश)
बड़ा बदलाव
- क्या बदला: अब लेखक किताबें हासिल करने से जुड़े उन फैसलों का अधिक विस्तृत सार्वजनिक विवरण पाठकों के सामने रख सकते हैं, जिन्हें वे चुनौती दे रहे हैं। सितंबर में दाख़िल दस्तावेज़ बताते हैं कि प्रशिक्षण की किताबें कहाँ से आईं और कंपनियों ने उन्हें कैसे संभाला—इस पर विवाद का अधिक हिस्सा।
- यह क्यों मायने रखता है: भुगतान माँग रहे लेखकों और किताबों के इस्तेमाल का बचाव कर रहे डेवलपरों—दोनों के लिए, किताबें हासिल करने का कानूनी मूल्यांकन प्रशिक्षण के मूल्यांकन जितना ही अहम है। पक्षों में मतभेद है कि क्या मॉडल का उद्देश्य उससे पहले की गई नकल को जायज़ ठहरा सकता है।
- किस पर नज़र रखें:आने वाली दलीलें उस कानूनी तर्क और लेखकों को हुए नुकसान के साक्ष्य—दोनों को चुनौती देंगी। न्यायाधीश कौन-से साक्ष्य स्वीकार करते हैं और किन उपयोगों का अलग-अलग मूल्यांकन करते हैं, इससे तय होगा कि बिना मुक़दमे के किन दावों का निपटारा हो सकता है।
सार्वजनिक रिकॉर्ड में Books1 और Books2
17 सितंबर के दस्तावेज़ summary judgment के लिए दाख़िल अर्ज़ियों के अधिक विस्तृत सार्वजनिक संस्करण हैं। अदालत के 3 सितंबर के गोपनीयता-सीमा हटाने वाले आदेश में पक्षों को निर्देश दिया गया था कि जहाँ किसी पक्ष या तीसरे पक्ष ने गोपनीयता जारी रखने की माँग नहीं की, वहाँ महत्वपूर्ण अंश बिना कालिमा के फिर से दाख़िल करें। कुछ अंश अब भी ढके हुए हैं।
लेखक संघ की 21 सितंबर की विज्ञप्ति ने उन दस्तावेज़ों में से दो पर ध्यान दिलाया: वादी पक्ष का कानूनी ज्ञापन, Docket 1982, और तथ्य-संबंधी उनका संशोधित बयान, Docket 1987। यह विज्ञप्ति वादी के रूप में संघ का अपना विवरण है।
Docket 1987 में लेखक Books1 और Books2 नाम वाले प्रशिक्षण डेटा-समूहों के बारे में गवाही और आंतरिक संदेश उद्धृत करते हैं। अनुच्छेद 271 में OpenAI के पूर्व कर्मचारी Ben Mann का कथन है कि दोनों LibGen पर आधारित थे। अनुच्छेद 275 में वह मसौदा शोधपत्र की भाषा समझाते हुए कहते हैं: “यह जानबूझकर अस्पष्ट है, क्योंकि यह libgen है।”
उसी दस्तावेज़ के अनुच्छेद 749 में मई 2020 का एक संदेश फिर छापा गया है। उस समय OpenAI में नीति निदेशक रहे Jack Clark ने उसमें शैली-कथा के लेखकों से प्रतिस्पर्धा की आशंका जताई थी। वादी इसे विस्थापन को लेकर कंपनी के भीतर चिंता का साक्ष्य बताते हैं। संदेश बाद में हुई किताबों की बिक्री में कमी नहीं मापता और न ही बाजार को हुए नुकसान पर अदालत का दृष्टिकोण स्थापित करता है।
तथ्य-संबंधी दस्तावेज़ के शीर्षक में “विवादरहित महत्वपूर्ण तथ्य” शब्द हैं। यह summary judgment के लिए वादी पक्ष की ओर से दाख़िल बयान है। स्थानीय दीवानी नियम 56.1 के तहत विरोधी पक्ष क्रमांकित बयानों का जवाब स्वीकार या अस्वीकार करके और सहायक साक्ष्य देकर देता है। शीर्षक का अर्थ यह नहीं कि न्यायाधीश ने पूरा विवरण स्वीकार कर लिया है।
किताबें हासिल करने और प्रशिक्षण को लेकर विवाद
वादी पक्ष का कानूनी ज्ञापन अदालत से कहता है कि बिना भुगतान किताबें हासिल करना, प्रशिक्षण के लिए उनकी प्रतियाँ बनाना और अन्य पक्षों को प्रतियाँ देना—अलग-अलग उपयोग माने जाएँ। वह यह भी तर्क देता है कि OpenAI के साथ व्यावसायिक संबंध और उसके आचरण की निगरानी करने की क्षमता के कारण Microsoft भी कथित उल्लंघन के लिए ज़िम्मेदार है।
खुद प्रशिक्षण के बारे में लेखक तर्क देते हैं कि मॉडल किताबों की रचनात्मक अभिव्यक्ति का उपयोग करके प्रतिस्पर्धी रचनाएँ बनाते हैं। उनका कहना है कि इससे लेखकों के बाज़ार को ख़तरा है और वे लाइसेंस से होने वाली आय से वंचित होते हैं। (वादी पक्ष, पृष्ठ 25 से 38)
OpenAI का 17 सितंबर का ज्ञापन स्वीकार करता है कि GPT-3 और GPT-3.5 को प्रशिक्षित करने के लिए Library Genesis के संकलन इस्तेमाल किए गए। उसका कानूनी तर्क है कि डाउनलोड करना ऐसे मॉडल बनाने की प्रक्रिया का हिस्सा था जो भाषा के सामान्य ढर्रे सीखते हैं। OpenAI का कहना है कि अदालत को पूरी प्रक्रिया का उद्देश्य देखना चाहिए; वह किताबों के स्थानापन्न बनने और कानूनन मान्य बाज़ार-हानि—दोनों से असहमत है। (OpenAI, पृष्ठ 3, 23 से 25 और 28 से 37)
Microsoft का किताब-मामले पर संशोधित ज्ञापन भी प्रशिक्षण को fair use बताकर उसका बचाव करता है। उसका कहना है कि OpenAI द्वारा इस्तेमाल किए गए LibGen डेटा-समूह हासिल करने में Microsoft शामिल नहीं था। आउटपुट के बारे में वह 82 लाख Copilot बातचीत के विश्लेषण का हवाला देता है, जिसमें लेखकों की बताई रचनाओं से मेल खाते 30 शब्दों वाले 24 जवाब मिले। यह एक विशिष्ट विश्लेषण और खास मेल-सीमा के बारे में Microsoft का विवरण है; यह लेखक जिस तरह के नुकसान का दावा कर सकते हैं, उन सभी को नहीं मापता।
यह असहमति अहम है, क्योंकि अमेरिकी कॉपीराइट कानून अदालतों से उपयोग का उद्देश्य, रचना का स्वरूप, ली गई सामग्री की मात्रा और उसके बाज़ार पर असर—इन बातों पर विचार करने को कहता है। किताब की प्रति हासिल करने का विवाद और तैयार किए गए पाठ से प्रतिस्पर्धा का विवाद अलग तथ्यात्मक सवाल उठाते हैं। पक्ष यह भी बहस कर रहे हैं कि कानून में ये सवाल एक-दूसरे से कैसे जुड़ते हैं।
साक्ष्य पर अभी भी विवाद है
23 सितंबर को OpenAI और Microsoft ने अदालत से कहा कि लेखकों की अर्ज़ियों में उद्धृत AI-निर्मित किताबों और बाज़ार में गिरावट के अध्ययन पर आधारित पूरक विशेषज्ञ रिपोर्ट तथा कुछ अंशों को बाहर रखा जाए। प्रस्ताव के समर्थन में दाख़िल ज्ञापन में आरोप है कि वादी पक्ष के वकीलों ने शोध के लिए धन दिया और आवश्यक विशेषज्ञ-प्रक्रिया के तहत उसे प्रकट तथा पेश नहीं किया। ये बाहर रखने की माँग के समर्थन में प्रतिवादियों के आरोप हैं, कदाचार के निष्कर्ष नहीं। प्रस्ताव सीधे Docket 1982 और 1987 में उद्धृत सामग्री को निशाना बनाता है।
Summary judgment के तहत अदालत किसी दावे या उसके हिस्से का फैसला तब कर सकती है, जब किसी महत्वपूर्ण तथ्य पर वास्तविक विवाद मुक़दमे की माँग न करे और कानून के अनुसार निर्णय माँगने वाला पक्ष उसका हक़दार हो। (संघीय नियम 56)
25 सितंबर तक देखे गए सार्वजनिक docket में दलीलों और विशेषज्ञ साक्ष्य से जुड़े प्रस्तावों पर जारी कार्यवाही दर्ज है। Stein का 24 सितंबर का समय-सारणी आदेश सभी पक्षों के जवाबी ज्ञापन के लिए 23 अक्टूबर, amicus ज्ञापनों के लिए 30 अक्टूबर और प्रत्युत्तर के लिए 20 नवंबर तय करता है। लेखकों और AI डेवलपरों के लिए अगला चरण नकल और नुकसान के इन परस्पर विरोधी विवरणों का अदालत द्वारा आकलन है। नए सार्वजनिक दस्तावेज़ उस आकलन के लिए दलीलें और उद्धृत साक्ष्य देते हैं; वे न मुआवज़ा तय करते हैं, न fair use पर अंतिम फैसला।



