OpenAI ने 5 ऑक्टोबर रोजी textGrain ची घोषणा केली. हा अदृश्य वॉटरमार्क त्याच्या मॉडेलने निवडलेल्या शब्दांच्या सांख्यिकीय पद्धतीत बदल करतो. युरोपियन युनियनच्या मजकूर-उगम नियमांना प्रतिसाद म्हणून टप्प्याटप्प्याने तो आणत असल्याचे कंपनीने म्हटले आहे. जुळणारा डिटेक्टर एखाद्या उताऱ्यात ती पद्धत शोधू शकतो; मात्र निकालातून OpenAI प्रणालीने मजकूर तयार केला किंवा त्यावर प्रक्रिया केली का, याचा मर्यादित संकेतच मिळतो.
मोठा बदल
- काय बदलले: OpenAI मजकूराच्या उगमाचा विषय संशोधनातून मर्यादित उपलब्धतेकडे नेत आहे. युरोपियन युनियनमधील पात्र ChatGPT आणि Codex आउटपुटवर येत्या काही आठवड्यांत वॉटरमार्क येईल; निवडक API ग्राहक तो जगभरात आताच सुरू करू शकतात.
- हे महत्त्वाचे का: AI मजकूराचे मूल्यमापन करणाऱ्या संस्थांना भविष्यात शब्दरचनेतच अंतर्भूत संकेत मिळू शकतो. OpenAI ने प्रसिद्ध केलेले निकाल दाखवतात की डिटेक्टरचा निष्कर्ष संदर्भासह का पाहावा: लहान किंवा शब्दरचनेवर कडक बंधने असलेले उतारे आणि संपादित मजकूर तपासणीतून सुटू शकतात; चुकीचे सकारात्मक निष्कर्षही शक्य आहेत.
- पुढे काय पाहावे: विविध लांबी, विषय आणि भाषांमधील नेहमीच्या वापरात हा संकेत किती विश्वासार्हपणे टिकतो, ही तातडीची कसोटी आहे. या मर्यादांचे मूल्यमापन करताना OpenAI डिटेक्टरचा प्रवेश मान्यताप्राप्त संशोधक आणि तज्ज्ञ संस्थांपुरता मर्यादित ठेवत आहे.
दोन प्रकारची उपलब्धता, प्रवेशाचे वेगळे नियम
येत्या काही आठवड्यांत युरोपियन युनियनमधील सर्व प्लॅनवर पात्र ChatGPT आणि Codex मजकूर आउटपुटमध्ये textGrain जोडणार असल्याचे OpenAI म्हणते. ही नियोजित प्रादेशिक सुरुवात आहे; याचा अर्थ आज युरोपियन युनियनमधील प्रत्येक उत्तरावर वॉटरमार्क आहे असा नाही. API साठी जगभरातील ग्राहक 5 ऑक्टोबरपासून निवडक मॉडेलमध्ये तो सुरू करू शकतात; वॉटरमार्किंग डीफॉल्टने बंद असते. प्रकल्प किंवा संस्थेच्या सेटिंग्जमधून ते सुरू करून समर्थित मॉडेल निवडता येतात, असे OpenAI सांगते. पात्र मॉडेलची यादी त्या सेटिंग्जमध्ये दिसते आणि बदलू शकते.
शक्य शब्द किंवा शब्दांच्या तुकड्यांमधून—ज्यांना टोकन म्हणतात—मॉडेल जे निवडते त्यावर textGrain काम करतो. निर्मितीदरम्यान गुप्त किल्ली त्या निवडींमध्ये सूक्ष्म बदल घडवते, असे OpenAI सांगते. त्यानंतर जुळणारी किल्ली आणि सेटिंग्ज असलेला डिटेक्टर उताऱ्यात तयार झालेली सांख्यिकीय पद्धत आहे का ते तपासतो. वॉटरमार्क लपलेली अक्षरे, मोकळ्या जागा किंवा दिसणारी विरामचिन्हे जोडत नाही. त्यामुळे मजकूर कॉपी करताना वेगळा मेटाडेटा सोबत नेण्याची गरज नसते; तरीही शब्द तसेच ठेवल्याने संकेत सापडेल याची खात्री मिळत नाही.
हा फरक उतारा कोण तपासू शकतो हेही मर्यादित करतो. मजकूर डिटेक्टरसाठी OpenAI अर्ज स्वीकारत आहे; सुरुवातीला मान्यताप्राप्त संशोधक आणि तज्ज्ञ संस्थांकडून. सुरुवातीच्या टप्प्यात तो डिटेक्टर जनतेसाठी खुला होणार नाही. समर्थित प्रतिमा आणि ऑडिओसाठीची सार्वजनिक पडताळणी साधने वेगळी आहेत; त्यातून textGrain ची खुली तपासणी होत नाही.
संकेत नजरेतून सुटू शकतो किंवा चुकीने आढळू शकतो
एका मूल्यमापनात OpenAI ने शोधाचे प्रमाण 1% च्या लक्ष्यित चुकीच्या-सकारात्मक दरावर नोंदवले. मानसशास्त्रविषयक उताऱ्यांत 200-टोकन नमुन्यांपैकी सुमारे 80% आणि 400-टोकन नमुन्यांपैकी सुमारे 95% मध्ये डिटेक्टरला वॉटरमार्क आढळला. शब्दरचनेचे स्वातंत्र्य कमी असल्यामुळे गणितात शोधाचे प्रमाण बरेच कमी होते, असे कंपनी म्हणते. ठरवलेल्या अटींनुसार कंपनीने केलेल्या मूल्यमापनाचे हे निकाल आहेत; प्रत्यक्ष जगात आढळणाऱ्या मजकुरातील यशाचे मोजमाप नाही.
400 टोकनच्या उताऱ्यांवरील कंपनीच्या दुसऱ्या चाचणीत संपादनामुळे संकेत कमकुवत झाला: 10% शब्द समानार्थी शब्दांनी बदलल्यास शोधाचे प्रमाण सुमारे 92% वरून 66% झाले; 25% बदलल्यास ते 17% वर आले. OpenAI च्या दस्तऐवजांत भाषांतर, मोठ्या प्रमाणात पुनर्लेखन, लहान उत्तरे आणि कोडही कठीण प्रकरणे असल्याचे नमूद आहे. भाषेनुसार शोधाचे प्रमाण बदलते, असे कंपनी सांगते. त्यामुळे नकारात्मक निकाल म्हणजे मजकूर माणसाने लिहिला हे सिद्ध होत नाही. उतारा खूप छोटा किंवा बदललेला असू शकतो, हे वैशिष्ट्य आणण्यापूर्वी तयार झालेला असू शकतो, किंवा वॉटरमार्कच्या कक्षेबाहेरील मॉडेल वा उत्पादनाने तयार केलेला असू शकतो.
सकारात्मक निकालालाही मर्यादा आहेत. डिटेक्टर वॉटरमार्क असल्याचा चुकीचा निष्कर्ष देऊ शकतो. संकेत आढळल्यास OpenAI च्या मते, तिच्या प्रणालीने उताऱ्याचा किमान काही भाग तयार केला किंवा त्यावर प्रक्रिया केली असण्याचा तो पुरावा आहे. एखाद्या व्यक्तीचे योगदान किती होते हे तो मोजत नाही, खाते किंवा प्रॉम्प्ट ओळखत नाही, तसेच मजकूर कोणी लिहिला, त्याचा मालक कोण किंवा त्याची जबाबदारी कोणाची हे ठरवत नाही. उतारा अचूक आहे का हेही तपासता येत नाही. केवळ निकालावरून साधन वापरणाऱ्या व्यक्तीची ओळख पटत नाही.
OpenAI पुढील मूल्यमापनाची योजना आखत आहे आणि textGrain मुक्त-स्रोत तंत्रज्ञान म्हणून प्रसिद्ध करण्याचा मानस असल्याचे सांगते. सध्या प्रत्यक्ष बदल मर्यादित आहे: OpenAI ने नव्याने तयार केलेल्या काही मजकुरात यंत्राला वाचता येणारा संकेत असेल; मात्र तो तपासण्याचे मार्ग आणि त्यातून समर्थित होणारे निष्कर्ष मर्यादितच राहतील. हा लेख OpenAI च्या घोषणेवर आणि मदत दस्तऐवजांवर आधारित आहे; BIG CHANGE ने वॉटरमार्क असलेला मजकूर तयार केला नाही किंवा डिटेक्टर चालवला नाही.



