அக்டோபர் 5 அன்று textGrain-ஐ OpenAI அறிவித்தது. அதன் மாடல்கள் தேர்ந்தெடுக்கும் சொற்களின் புள்ளிவிவர வடிவத்தை மாற்றும் கண்ணுக்குப் புலப்படாத வாட்டர்மார்க் இது. ஐரோப்பிய ஒன்றியத்தின் உரைத் தோற்ற விதிகளுக்குப் பதிலளிக்கும் வகையில் படிப்படியாக அறிமுகப்படுத்துவதாக நிறுவனம் கூறுகிறது. பொருந்தக்கூடிய கருவி ஒரு பத்தியில் அந்த வடிவத்தைத் தேடலாம்; ஆனால் OpenAI அமைப்பு உரையை உருவாக்கியதா அல்லது செயலாக்கியதா என்பதற்கான வரையறுக்கப்பட்ட குறிப்பை மட்டுமே முடிவு வழங்கும்.
முக்கிய மாற்றம்
- என்ன மாறியது: உரையின் தோற்றம் குறித்த ஆய்விலிருந்து வரையறுக்கப்பட்ட வெளியீட்டுக்கு OpenAI நகர்கிறது. ஐரோப்பிய ஒன்றியத்தில் தகுதிபெறும் ChatGPT மற்றும் Codex வெளியீடுகளுக்கு அடுத்த சில வாரங்களில் வாட்டர்மார்க் சேர்க்கப்படும்; தேர்ந்தெடுக்கப்பட்ட API வாடிக்கையாளர்கள் அதை இப்போதே உலகளவில் செயல்படுத்தலாம்.
- இது ஏன் முக்கியம்: AI உரையை மதிப்பிடும் நிறுவனங்களுக்கு எதிர்காலத்தில் சொற்களிலேயே உட்பொதிக்கப்பட்ட சமிக்ஞை கிடைக்கலாம். கண்டறியும் கருவியின் முடிவுக்கு ஏன் சூழல் தேவை என்பதை OpenAI வெளியிட்ட முடிவுகள் காட்டுகின்றன: குறுகிய அல்லது கடுமையான சொல் கட்டுப்பாடுகள் கொண்ட பகுதிகளையும் திருத்தப்பட்ட உரையையும் கண்டறிய முடியாமல் போகலாம்; தவறான நேர்மறை முடிவுகளும் சாத்தியம்.
- கவனிக்க வேண்டியது: வெவ்வேறு நீளம், தலைப்பு, மொழிகளில் இயல்பான பயன்பாட்டின்போது இந்த சமிக்ஞை எவ்வளவு நம்பகமாகத் தொடர்கிறது என்பதே உடனடிச் சோதனை. அந்த வரம்புகளை மதிப்பிடும் வரை அங்கீகரிக்கப்பட்ட ஆராய்ச்சியாளர்கள் மற்றும் நிபுணத்துவ நிறுவனங்களுக்கு மட்டுமே கருவி அணுகலை OpenAI வழங்குகிறது.
இரண்டு வெளியீடுகள்; அணுகல் விதிகள் வேறுபடும்
OpenAI கூறுவதாவது, அடுத்த சில வாரங்களில் ஐரோப்பிய ஒன்றியத்தின் அனைத்துத் திட்டங்களிலும் தகுதிபெறும் ChatGPT மற்றும் Codex உரை வெளியீடுகளுக்கு textGrain சேர்க்கப்படும். இது திட்டமிட்ட பிராந்திய அறிமுகம்; ஐரோப்பிய ஒன்றியத்தின் ஒவ்வொரு பதிலிலும் இப்போதே வாட்டர்மார்க் உள்ளது என்ற கூற்று அல்ல. API-க்கு, உலகெங்கிலும் உள்ள வாடிக்கையாளர்கள் அக்டோபர் 5 முதல் தேர்ந்தெடுக்கப்பட்ட மாடல்களில் இதைச் செயல்படுத்திக்கொள்ளலாம்; இயல்பாக வாட்டர்மார்க் முடக்கப்பட்டிருக்கும். திட்டம் அல்லது நிறுவன அமைப்புகளில் அதைச் செயல்படுத்தி ஆதரிக்கப்படும் மாடல்களைத் தேர்வு செய்யலாம் என OpenAI கூறுகிறது. தகுதியான மாடல்களின் பட்டியல் அந்த அமைப்புகளில் காட்டப்படும்; அது மாறக்கூடும்.
சாத்தியமான சொற்கள் அல்லது சொல் பகுதிகள்—டோக்கன்கள் எனப்படுபவை—இவற்றில் மாடல் செய்யும் தேர்வுகளின் மூலம் textGrain செயல்படுகிறது. உருவாக்கத்தின்போது ஒரு ரகசிய விசை அந்தத் தேர்வுகளில் சிறிய மாற்றங்களை வழிநடத்துவதாக OpenAI கூறுகிறது. பின்னர் பொருந்தும் விசை மற்றும் அமைப்புகளைக் கொண்ட கருவி, உருவான புள்ளிவிவர வடிவம் அந்தப் பகுதியில் உள்ளதா எனச் சரிபார்க்கிறது. வாட்டர்மார்க் மறைக்கப்பட்ட எழுத்துகள், இடைவெளிகள் அல்லது கண்ணுக்குத் தெரியும் நிறுத்தக்குறிகளைச் சேர்ப்பதில்லை. எனவே உரையை நகலெடுக்கும்போது தனி மெட்டாடேட்டாவை எடுத்துச் செல்லத் தேவையில்லை; இருப்பினும் சொற்களை மாற்றாமல் வைத்திருப்பதால் சமிக்ஞையைக் கண்டறிய முடியும் என உறுதியளிக்க முடியாது.
இந்த வேறுபாடு ஒரு பகுதியை யார் சரிபார்க்கலாம் என்பதையும் கட்டுப்படுத்துகிறது. உரை கண்டறியும் கருவிக்கான விண்ணப்பங்களை OpenAI ஏற்கிறது; தொடக்கத்தில் அங்கீகரிக்கப்பட்ட ஆராய்ச்சியாளர்கள் மற்றும் நிபுணத்துவ நிறுவனங்களிடமிருந்து மட்டுமே. அறிமுகத்தின் போது கருவி பொதுமக்களுக்கு வழங்கப்படாது. ஆதரிக்கப்படும் படங்கள் மற்றும் ஒலிக்கான அதன் பொது சரிபார்ப்புக் கருவிகள் தனியானவை; அவை textGrain-ஐத் திறந்தவெளியில் சரிபார்க்க உதவாது.
சமிக்ஞை தவறவிடப்படலாம் அல்லது தவறாகக் கண்டறியப்படலாம்
ஒரு மதிப்பீட்டில் OpenAI கண்டறிதல் விகிதங்களை 1% இலக்கு தவறான நேர்மறை விகிதத்தில் அறிவித்தது. உளவியல் சார்ந்த உரைப் பகுதிகளில் 200-டோக்கன் மாதிரிகளில் சுமார் 80% மற்றும் 400-டோக்கன் மாதிரிகளில் சுமார் 95% ஆகியவற்றில் கருவி வாட்டர்மார்க்கைக் கண்டறிந்தது. சொற்களைத் தேர்ந்தெடுக்கும் சுதந்திரம் குறைவாக இருப்பதால் கணிதத்தில் கண்டறிதல் கணிசமாகக் குறைந்ததாக நிறுவனம் கூறுகிறது. குறிப்பிட்ட நிபந்தனைகளில் நிறுவனம் செய்த மதிப்பீட்டின் முடிவுகள் இவை; நிஜ உலகில் கிடைக்கும் உரைக்கான வெற்றி விகித அளவீடு அல்ல.
400 டோக்கன் உரைப் பகுதிகளைப் பயன்படுத்திய நிறுவனத்தின் மற்றொரு சோதனையில் திருத்தங்கள் சமிக்ஞையைப் பலவீனப்படுத்தின: 10% சொற்களை இணைச்சொற்களால் மாற்றியபோது கண்டறிதல் சுமார் 92%-லிருந்து 66%-ஆகக் குறைந்தது; 25% மாற்றியபோது 17%-ஆகக் குறைந்தது. மொழிபெயர்ப்பு, கணிசமான மறுஎழுத்தாக்கம், குறுகிய பதில்கள் மற்றும் குறியீடு ஆகியவையும் கடினமானவை என்று OpenAI ஆவணங்கள் குறிப்பிடுகின்றன. மொழியைப் பொறுத்து கண்டறிதல் மாறும் என நிறுவனம் கூறுகிறது. எனவே எதிர்மறை முடிவால் மனிதர் உரையை எழுதியதாக நிரூபிக்க முடியாது. பகுதி மிகவும் குறுகியதாகவோ திருத்தப்பட்டதாகவோ இருக்கலாம்; அறிமுகத்திற்கு முன் உருவாக்கப்பட்டிருக்கலாம்; அல்லது வாட்டர்மார்க் வரம்புக்கு வெளியிலுள்ள மாடல் அல்லது தயாரிப்பால் உருவாக்கப்பட்டிருக்கலாம்.
நேர்மறை முடிவுக்கும் வரம்புகள் உள்ளன. வாட்டர்மார்க் இருப்பதாகக் கருவி தவறாகக் கூறலாம். ஒரு சமிக்ஞை கிடைத்தால், அதன் அமைப்பு அந்தப் பகுதியின் குறைந்தபட்சம் ஒரு பகுதியை உருவாக்கியிருக்கலாம் அல்லது செயலாக்கியிருக்கலாம் என்பதற்கான சான்று என OpenAI கூறுகிறது. ஒரு நபரின் பங்களிப்பு எவ்வளவு என்பதை இது அளவிடாது; கணக்கு அல்லது prompt-ஐ அடையாளம் காணாது; உரையை எழுதியவர், உரிமையாளர் அல்லது பொறுப்பாளர் யார் என்பதையும் தீர்மானிக்காது. பகுதி துல்லியமானதா என்றும் சரிபார்க்க முடியாது. முடிவை மட்டும் வைத்து கருவியைப் பயன்படுத்திய நபரை அடையாளம் காண முடியாது.
மேலும் மதிப்பீடு செய்ய OpenAI திட்டமிட்டுள்ளது; textGrain-ஐ திறந்த மூலத் தொழில்நுட்பமாக வெளியிடவும் உத்தேசித்துள்ளதாகக் கூறுகிறது. இப்போதைக்கு நடைமுறை மாற்றம் குறுகியது: புதிதாக உருவாக்கப்படும் OpenAI உரைகளில் சிலவற்றில் இயந்திரம் படிக்கக்கூடிய சமிக்ஞை இருக்கும்; அதை ஆய்வு செய்யும் வழிகளும் அது ஆதரிக்கும் முடிவுகளும் கட்டுப்படுத்தப்பட்டவையாகவே இருக்கும். OpenAI அறிவிப்பு மற்றும் உதவி ஆவணங்களை அடிப்படையாகக் கொண்டு இந்தக் கட்டுரை எழுதப்பட்டுள்ளது; BIG CHANGE வாட்டர்மார்க் கொண்ட உரையை உருவாக்கவோ கருவியை இயக்கவோ இல்லை.



