OpenAI ने 5 अक्टूबर को textGrain की घोषणा की। यह एक अदृश्य वॉटरमार्क है, जो उसके मॉडल द्वारा चुने गए शब्दों के सांख्यिकीय पैटर्न को बदलता है। कंपनी का कहना है कि वह यूरोपीय संघ के टेक्स्ट-उद्गम नियमों के जवाब में इसे चरणबद्ध तरीके से लागू कर रही है। इससे मेल खाने वाला डिटेक्टर किसी अंश में पैटर्न खोज सकता है, लेकिन परिणाम केवल सीमित संकेत देता है कि OpenAI प्रणाली ने टेक्स्ट बनाया या संसाधित किया था या नहीं।

बड़ा बदलाव

  • क्या बदला: OpenAI टेक्स्ट के उद्गम को शोध का विषय मानने से आगे बढ़कर सीमित रूप से जारी कर रहा है। यूरोपीय संघ में पात्र ChatGPT और Codex आउटपुट पर आने वाले हफ्तों में वॉटरमार्क लगेगा; चुनिंदा API ग्राहक इसे अभी दुनिया भर में चालू कर सकते हैं।
  • यह क्यों मायने रखता है: AI टेक्स्ट का आकलन करने वाले संगठनों को भविष्य में शब्दों में ही अंतर्निहित संकेत मिल सकता है। OpenAI के प्रकाशित नतीजे बताते हैं कि डिटेक्टर के परिणाम को संदर्भ की जरूरत क्यों है: छोटे या कड़े शब्द-बंधन वाले अंश और संपादित टेक्स्ट पहचान से बच सकते हैं, जबकि गलत सकारात्मक नतीजे भी संभव हैं।
  • अब क्या देखना है: तत्काल सवाल यह है कि अलग-अलग लंबाई, विषयों और भाषाओं में सामान्य उपयोग के दौरान संकेत कितनी भरोसेमंद तरह से बना रहता है। इन सीमाओं का मूल्यांकन करते हुए OpenAI डिटेक्टर की पहुँच स्वीकृत शोधकर्ताओं और विशेषज्ञ संगठनों तक सीमित रख रहा है।

दो रिलीज़, पहुँच के अलग नियम

OpenAI का कहना है कि आने वाले हफ्तों में वह यूरोपीय संघ के सभी प्लान में पात्र ChatGPT और Codex टेक्स्ट आउटपुट के साथ textGrain जोड़ेगा। यह नियोजित क्षेत्रीय विस्तार है; इसका अर्थ यह नहीं कि आज यूरोपीय संघ के हर उत्तर पर वॉटरमार्क है। API के लिए दुनिया भर के ग्राहक 5 अक्टूबर से चुनिंदा मॉडल में इसे चालू कर सकते हैं; वॉटरमार्किंग डिफ़ॉल्ट रूप से बंद है। OpenAI कहता है कि ग्राहक प्रोजेक्ट या संगठन की सेटिंग में इसे सक्षम करके समर्थित मॉडल चुन सकते हैं। पात्र मॉडलों की सूची उन सेटिंग में दिखती है और बदल सकती है।

TextGrain मॉडल द्वारा संभावित शब्दों या शब्दांशों, जिन्हें टोकन कहा जाता है, में से चुनाव करने के तरीके से काम करता है। OpenAI का कहना है कि एक गुप्त कुंजी निर्माण के दौरान इन चुनावों में छोटे बदलाव निर्देशित करती है। फिर मिलती-जुलती कुंजी और सेटिंग वाला डिटेक्टर जाँचता है कि किसी अंश में बना हुआ सांख्यिकीय पैटर्न मौजूद है या नहीं। वॉटरमार्क कोई छिपे अक्षर, रिक्त स्थान या दिखाई देने वाले विराम-चिह्न नहीं जोड़ता। इसलिए टेक्स्ट कॉपी करने के लिए अलग मेटाडेटा साथ रखना जरूरी नहीं, हालांकि शब्द जस के तस रखने से संकेत के पहचाने जाने की गारंटी नहीं मिलती।

यह अंतर यह भी सीमित करता है कि कौन किसी अंश की जाँच कर सकता है। OpenAI टेक्स्ट डिटेक्टर के लिए आवेदन स्वीकार कर रहा है, शुरुआत में स्वीकृत शोधकर्ताओं और विशेषज्ञ संगठनों से। लॉन्च के समय वह डिटेक्टर जनता के लिए नहीं खोलेगा। समर्थित चित्रों और ऑडियो के लिए उसके सार्वजनिक सत्यापन उपकरण अलग हैं; वे textGrain की खुली जाँच नहीं देते।

संकेत छूट सकता है या गलती से पहचाना जा सकता है

OpenAI ने एक मूल्यांकन में पहचान दरें 1% की लक्षित गलत-सकारात्मक दर पर रिपोर्ट कीं। मनोविज्ञान के अंशों में डिटेक्टर ने 200-टोकन नमूनों के लगभग 80% और 400-टोकन नमूनों के करीब 95% में वॉटरमार्क पाया। कंपनी के अनुसार गणित में पहचान काफी कम रही, जहाँ शब्दों को चुनने की गुंजाइश कम होती है। ये तय परिस्थितियों में कंपनी के मूल्यांकन के नतीजे हैं, वास्तविक दुनिया में मिलने वाले टेक्स्ट की मापी गई सफलता दर नहीं।

400-टोकन अंशों पर कंपनी के एक अन्य परीक्षण में संपादन से संकेत कमजोर हुआ: 10% शब्दों को समानार्थी शब्दों से बदलने पर पहचान लगभग 92% से घटकर 66% रह गई; 25% बदलने पर यह 17% हुई। OpenAI के दस्तावेज़ में अनुवाद, बड़े पैमाने पर भावांतर, छोटे उत्तर और कोड को भी कठिन मामले बताया गया है। कंपनी कहती है कि भाषा के अनुसार पहचान बदलती है। इसलिए नकारात्मक नतीजा यह साबित नहीं कर सकता कि टेक्स्ट किसी इंसान ने लिखा। अंश बहुत छोटा हो सकता है, बदला गया हो सकता है, विस्तार से पहले बना हो सकता है, या ऐसे मॉडल अथवा उत्पाद से आया हो जिस पर वॉटरमार्क लागू नहीं है।

सकारात्मक नतीजे की भी सीमाएँ हैं। डिटेक्टर गलती से वॉटरमार्क की मौजूदगी बता सकता है। संकेत मिलने पर OpenAI का कहना है कि यह इस बात का सबूत है कि उसकी प्रणाली ने संभवतः अंश के कम-से-कम कुछ हिस्से को बनाया या संसाधित किया। इससे यह नहीं मापा जा सकता कि किसी व्यक्ति ने कितना योगदान दिया, किस खाते या प्रॉम्प्ट का उपयोग हुआ, या टेक्स्ट किसने लिखा, उसका मालिक कौन है अथवा जिम्मेदार कौन है। यह अंश की सटीकता भी सत्यापित नहीं कर सकता। केवल परिणाम से उपकरण का उपयोग करने वाले व्यक्ति की पहचान नहीं होती।

OpenAI आगे मूल्यांकन करने की योजना बना रहा है और कहता है कि वह textGrain को ओपन-सोर्स तकनीक के रूप में जारी करना चाहता है। फिलहाल व्यावहारिक बदलाव सीमित है: OpenAI के कुछ नए टेक्स्ट में मशीन से पढ़ा जा सकने वाला संकेत होगा, जबकि उसे जाँचने के तरीके और उससे निकाले जा सकने वाले निष्कर्ष सीमित रहेंगे। यह लेख OpenAI की घोषणा और सहायता दस्तावेज़ों पर आधारित है; BIG CHANGE ने वॉटरमार्क वाला टेक्स्ट नहीं बनाया और न ही डिटेक्टर चलाया।