Authors Guild এবং বইয়ের অন্য বাদীরা ফেডারেল বিচারকের কাছে জানতে চেয়েছেন, OpenAI কপিরাইট-সুরক্ষিত বই কীভাবে সংগ্রহ করেছিল, সেটিকে পরে বই নিয়ে তাদের করা কাজ থেকে আলাদাভাবে পরীক্ষা করা উচিত কি না। ১৭ সেপ্টেম্বর প্রকাশ্যে দাখিল করা নথিতে Library Genesis নিয়ে অভ্যন্তরীণ আলোচনা তুলে ধরা হয়েছে—মডেল প্রশিক্ষণে ব্যবহৃত বইয়ের সংগ্রহের উৎস এটি—এবং যুক্তি দেওয়া হয়েছে, বই download, প্রশিক্ষণে ব্যবহার এবং অন্য পক্ষের কাছে copy হস্তান্তর: প্রত্যেকটির জন্য আলাদা কপিরাইট বিশ্লেষণ দরকার।
OpenAI এই পদ্ধতির বিরোধিতা করছে। একই দিনে জমা দেওয়া নিজেদের সংশোধিত নথিতে তাদের যুক্তি, বই সংগ্রহ ও model প্রশিক্ষণ ন্যায্য ব্যবহারের নীতিতে সুরক্ষিত একটি রূপান্তরমূলক উদ্দেশ্যের অংশ ছিল। পাল্টাপাল্টি আবেদন নিউইয়র্কে বিচারক Sidney H. Stein-এর সামনে রয়েছে। ২৪ সেপ্টেম্বরের আদেশে লিখিত যুক্তি দাখিলের সময় বাড়ানো হয়েছে; কপিরাইট-বিতর্কের নিষ্পত্তি করা হয়নি। (বাদীপক্ষের brief, OpenAI-র brief, সময়সূচি-সংক্রান্ত আদেশ)
মূল পরিবর্তন
- কী বদলেছে: লেখকেরা এখন তাদের চ্যালেঞ্জ করা বই সংগ্রহের সিদ্ধান্ত সম্পর্কে আরও পূর্ণাঙ্গ প্রকাশ্য বিবরণ পাঠকদের দেখাতে পারেন। সেপ্টেম্বরের নথিতে প্রশিক্ষণের বই কোথা থেকে এসেছিল এবং কোম্পানিগুলো সেগুলো কীভাবে সামলেছিল—তা নিয়ে বিরোধের আরও অংশ প্রকাশ পেয়েছে।
- কেন গুরুত্বপূর্ণ: পারিশ্রমিক চাইছেন এমন লেখকদের জন্য এবং বই ব্যবহারের পক্ষে যুক্তি দিচ্ছেন এমন developer-দের জন্য, বই সংগ্রহের আইনি বিচার প্রশিক্ষণের বিচারটির পাশাপাশি গুরুত্বপূর্ণ। একটি model-এর উদ্দেশ্য আগের copy করাকে ন্যায্যতা দিতে পারে কি না, তা নিয়ে পক্ষগুলোর মতভেদ রয়েছে।
- যা নজরে রাখা দরকার: পরবর্তী লিখিত যুক্তিতে ওই আইনি তর্কের পাশাপাশি লেখকদের ক্ষতির প্রমাণ নিয়েও পাল্টাপাল্টি বক্তব্য আসবে। বিচারক কোন প্রমাণ গ্রহণ করবেন এবং কোন ব্যবহার আলাদাভাবে মূল্যায়ন করবেন, তা বিচার ছাড়াই তিনি কোন দাবিগুলোর নিষ্পত্তি করতে পারবেন তা নির্ধারণে ভূমিকা রাখবে।
প্রকাশ্য নথিতে Books1 ও Books2
১৭ সেপ্টেম্বরের নথিগুলো summary judgment আবেদনের সংক্ষিপ্ত সংস্করণের চেয়ে পূর্ণাঙ্গ প্রকাশ্য সংস্করণ। আদালতের ৩ সেপ্টেম্বরের গোপনীয়তা-সংক্রান্ত আদেশ অনুযায়ী, কোনো পক্ষ বা তৃতীয় পক্ষ কোনো তথ্য গোপন রাখার আবেদন না করলে গুরুত্বপূর্ণ তথ্য redaction ছাড়া brief ও তথ্যবিবৃতি আবার দাখিল করতে হয়েছে। কিছু অংশ এখনো কালো করে ঢেকে রাখা আছে।
Authors Guild-এর ২১ সেপ্টেম্বরের ঘোষণা ওই দুই নথির দিকে দৃষ্টি আকর্ষণ করেছে: বাদীপক্ষের আইনি brief, Docket 1982, এবং সংশোধিত তথ্যবিবৃতি, Docket 1987। ঘোষণাটি মামলার বাদী হিসেবে Guild-এর নিজস্ব বিবরণ।
নথি Docket 1987-এ লেখকেরা Books1 ও Books2 নামে প্রশিক্ষণ dataset চিহ্নিত করার প্রসঙ্গে সাক্ষ্য ও অভ্যন্তরীণ বার্তা উদ্ধৃত করেছেন। ২৭১ নম্বর অনুচ্ছেদে সাবেক OpenAI কর্মী Ben Mann-এর বক্তব্য উদ্ধৃত করে বলা হয়েছে, দুটিই LibGen-ভিত্তিক। ২৭৫ নম্বর অনুচ্ছেদে draft গবেষণাপত্রের ভাষা ব্যাখ্যা করতে Mann-এর বক্তব্য উদ্ধৃত: “it's deliberately vague since it’s libgen.”
একই নথির ৭৪৯ নম্বর অনুচ্ছেদে ২০২০ সালের মে মাসে তৎকালীন OpenAI policy director Jack Clark-এর একটি message পুনরুৎপাদন করা হয়েছে; সেখানে genre fiction লেখকদের সঙ্গে প্রতিযোগিতার আশঙ্কা করা হয়েছিল। বাদীপক্ষ সেটিকে লেখকদের স্থানচ্যুত হওয়া নিয়ে অভ্যন্তরীণ উদ্বেগের প্রমাণ হিসেবে উপস্থাপন করেছে। ওই message পরবর্তী বই বিক্রির ক্ষতি পরিমাপ করে না, কিংবা বাজারে ক্ষতি সম্পর্কে আদালতের মতও প্রতিষ্ঠা করে না।
নথির শিরোনামে “undisputed material facts” কথাগুলো রয়েছে। সেটি summary judgment আবেদনে বাদীপক্ষের জমা দেওয়া বিবৃতি। স্থানীয় দেওয়ানি বিধি ৫৬.১-এর বিধান অনুযায়ী, প্রতিপক্ষ নম্বর দেওয়া প্রতিটি বক্তব্যে সমর্থনকারী প্রমাণসহ স্বীকার বা অস্বীকার করে জবাব দেয়। শিরোনামটির অর্থ এই নয় যে বিচারক পুরো বিবরণ মেনে নিয়েছেন।
বই সংগ্রহ ও প্রশিক্ষণ নিয়ে বিরোধ
বাদীপক্ষ আদালতকে বলেছে, পারিশ্রমিক ছাড়া বই সংগ্রহ, প্রশিক্ষণের জন্য copy করা এবং অন্য পক্ষের কাছে copy বিতরণ—এগুলোকে আলাদা ব্যবহার হিসেবে বিবেচনা করতে হবে। বাণিজ্যিক সম্পর্ক ও আচরণ তদারকির সামর্থ্যের কারণে OpenAI-র কথিত লঙ্ঘনের জন্য Microsoft-ও দায়ী—এমন যুক্তিও তাদের brief-এ আছে।
প্রশিক্ষণ প্রসঙ্গে লেখকদের যুক্তি, model বইয়ের সৃজনশীল প্রকাশভঙ্গি কাজে লাগিয়ে প্রতিযোগী লেখা তৈরি করে। তাদের দাবি, এতে লেখকদের বাজার হুমকির মুখে পড়ে এবং লাইসেন্স থেকে আয়ের সুযোগ নষ্ট হয়। (বাদীপক্ষ, পৃষ্ঠা ২৫–৩৮)
১৭ সেপ্টেম্বরের OpenAI brief-এ স্বীকার করা হয়েছে, GPT-3 ও GPT-3.5 প্রশিক্ষণে Library Genesis-এর সংকলন ব্যবহার করা হয়েছিল। তাদের আইনি যুক্তি হলো, download ছিল এমন model তৈরির প্রক্রিয়ার অংশ, যা ভাষার সাধারণ ধরন শেখে। পুরো প্রক্রিয়ার উদ্দেশ্য একসঙ্গে বিবেচনা করা উচিত বলে OpenAI-র বক্তব্য। বইয়ের বিকল্প তৈরি হওয়া এবং আইন স্বীকৃত বাজার-ক্ষতি—দুটিই তারা অস্বীকার করে। (OpenAI, পৃষ্ঠা ৩, ২৩–২৫ ও ২৮–৩৭)
Microsoft-এর বই-সংক্রান্ত মামলায় সংশোধিত brief-এও প্রশিক্ষণকে ন্যায্য ব্যবহার হিসেবে রক্ষা করা হয়েছে। Microsoft বলেছে, OpenAI যে LibGen dataset ব্যবহার করেছে, সেগুলো সংগ্রহে তাদের ভূমিকা ছিল না। output প্রসঙ্গে তারা ৮২ লাখ Copilot কথোপকথনের একটি বিশ্লেষণের কথা বলেছে; সেখানে লেখকদের দাবিকৃত রচনার সঙ্গে মিলে যায় এমন ৩০টি শব্দ থাকা ২৪টি উত্তর পাওয়া গিয়েছিল। এটি Microsoft-এর বর্ণিত নির্দিষ্ট বিশ্লেষণ ও নির্দিষ্ট মিল-সীমার ফল; লেখকরা ক্ষতির দাবি করতে পারেন এমন প্রতিটি উপায়ের পরিমাপ নয়।
মতবিরোধটি গুরুত্বপূর্ণ, কারণ যুক্তরাষ্ট্রের কপিরাইট আইন আদালতকে ব্যবহারের উদ্দেশ্য, রচনার প্রকৃতি, নেওয়া অংশের পরিমাণ এবং তার বাজারে প্রভাব বিবেচনা করতে বলে। একটি copy সংগ্রহের বিরোধ আর তৈরি করা লেখা থেকে প্রতিযোগিতার প্রশ্নে আলাদা তথ্যগত বিষয় উঠে আসে। আইনি দৃষ্টিতে এই প্রশ্নগুলো কীভাবে একসঙ্গে বিচার করা হবে, তা নিয়েও পক্ষগুলোর তর্ক চলছে।
প্রমাণ নিয়ে এখনো বিরোধ চলছে
২৩ সেপ্টেম্বর OpenAI ও Microsoft আদালতকে একটি পরিপূরক expert report এবং AI-তৈরি বই ও বাজার সংকোচন নিয়ে গবেষণার ওপর নির্ভর করা লেখকদের দাখিলের কিছু অংশ বাদ দিতে বলেছে। তাদের motion-এর সমর্থনে দাখিল করা brief-এ অভিযোগ করা হয়েছে, বাদীপক্ষের আইনজীবীরা ওই গবেষণায় অর্থ জুগিয়েছেন এবং প্রয়োজনীয় expert-প্রক্রিয়ায় তা প্রকাশ ও উপস্থাপন করেননি। এগুলো প্রমাণ বাদ দেওয়ার পক্ষে বিবাদীপক্ষের যুক্তি, অসদাচরণের বিচারিক সিদ্ধান্ত নয়। motion-টি সরাসরি Docket 1982 ও 1987-এ উদ্ধৃত উপাদানকে লক্ষ্য করেছে।
কোনো গুরুত্বপূর্ণ তথ্য নিয়ে প্রকৃত বিরোধ থাকলে বিচার দরকার হয় এবং আইন অনুযায়ী আবেদনকারী পক্ষ রায় পাওয়ার অধিকারী হলে summary judgment-এর মাধ্যমে আদালত কোনো দাবি বা দাবির অংশ বিচার ছাড়াই মীমাংসা করতে পারে। (Federal Rule 56)
২৫ সেপ্টেম্বর পর্যন্ত পর্যালোচনা করা প্রকাশ্য docket-এ চলমান লিখিত যুক্তি দাখিল ও expert-প্রমাণ-সংক্রান্ত motion নথিভুক্ত আছে। Stein-এর ২৪ সেপ্টেম্বরের আদেশ সব পক্ষের বিরোধী brief-এর জন্য ২৩ অক্টোবর, amicus brief-এর জন্য ৩০ অক্টোবর এবং জবাবের জন্য ২০ নভেম্বর নির্ধারণ করেছে। লেখক ও AI developer-দের জন্য পরবর্তী ধাপ হলো copy করা এবং ক্ষতি নিয়ে পক্ষগুলোর পাল্টা বিবরণ আদালতের মূল্যায়ন। সদ্য প্রকাশিত নথিতে সেই মূল্যায়নের জন্য যুক্তি ও উদ্ধৃত প্রমাণ আছে; ক্ষতিপূরণ দেওয়ার আদেশ বা ন্যায্য ব্যবহার নিয়ে চূড়ান্ত রায় নেই।



