అక్టోబర్ 5న textGrainను OpenAI ప్రకటించింది. ఇది మోడళ్లు ఎంచుకునే పదాల గణాంక నమూనాను మార్చే కనిపించని వాటర్మార్క్. EU టెక్స్ట్ మూలాధార నియమాలకు ప్రతిస్పందనగా దశలవారీ విడుదలను ప్రారంభిస్తున్నట్లు కంపెనీ చెబుతోంది. సరిపోలే డిటెక్టర్ ఒక భాగంలో ఆ నమూనాను వెతకగలదు; అయితే ఫలితం OpenAI వ్యవస్థ టెక్స్ట్ను రూపొందించిందా లేదా ప్రాసెస్ చేసిందా అన్నదానికి పరిమిత సూచన మాత్రమే ఇస్తుంది.
ప్రధాన మార్పు
- ఏమి మారింది: టెక్స్ట్ మూలాధారాన్ని పరిశోధన సమస్యగా చూడటం నుంచి పరిమిత విడుదల దిశగా OpenAI అడుగేస్తోంది. EUలో అర్హతగల ChatGPT, Codex అవుట్పుట్లకు రాబోయే వారాల్లో వాటర్మార్క్ జోడిస్తారు; ఎంపిక చేసిన API కస్టమర్లు ఇప్పుడు ప్రపంచవ్యాప్తంగా దాన్ని ఆన్ చేయవచ్చు.
- ఇది ఎందుకు ముఖ్యం: AI టెక్స్ట్ను అంచనా వేసే సంస్థలకు భవిష్యత్తులో పదబంధాల్లోనే పొందుపరిచిన సంకేతం లభించవచ్చు. డిటెక్టర్ ఫలితాన్ని సందర్భంతో ఎందుకు చూడాలో OpenAI ప్రచురించిన ఫలితాలు చూపిస్తున్నాయి: చిన్న భాగాలు, పదప్రయోగంపై కఠిన పరిమితులున్న భాగాలు, సవరించిన టెక్స్ట్ గుర్తింపును తప్పించుకోవచ్చు; తప్పుడు పాజిటివ్లు కూడా సాధ్యమే.
- ఏమి గమనించాలి: వివిధ నిడివులు, అంశాలు, భాషల్లో సాధారణ వినియోగం జరిగినప్పుడు సంకేతం ఎంత విశ్వసనీయంగా నిలుస్తుందనేది తక్షణ పరీక్ష. ఈ పరిమితులను అంచనా వేస్తున్నప్పుడు OpenAI డిటెక్టర్ ప్రవేశాన్ని ఆమోదిత పరిశోధకులు, నిపుణ సంస్థలకే పరిమితం చేస్తోంది.
రెండు విడుదలలు, వేర్వేరు ప్రవేశ నియమాలు
రాబోయే వారాల్లో యూరోపియన్ యూనియన్లోని అన్ని ప్లాన్లలో అర్హతగల ChatGPT, Codex టెక్స్ట్ అవుట్పుట్లకు textGrainను జోడిస్తామని OpenAI చెబుతోంది. ఇది ప్రణాళికాబద్ధమైన ప్రాంతీయ విడుదల మాత్రమే; EUలోని ప్రతి సమాధానానికి ఇప్పటికే వాటర్మార్క్ ఉందని చెప్పడం కాదు. API కోసం, ప్రపంచవ్యాప్త కస్టమర్లు అక్టోబర్ 5 నుంచి ఎంపిక చేసిన మోడళ్లలో దీన్ని ఆన్ చేయవచ్చు; డిఫాల్ట్గా వాటర్మార్కింగ్ ఆఫ్లో ఉంటుంది. ప్రాజెక్ట్ లేదా సంస్థ సెట్టింగ్లలో దీన్ని ప్రారంభించి, మద్దతున్న మోడళ్లను ఎంచుకోవచ్చని OpenAI చెబుతోంది. అర్హతగల మోడళ్ల జాబితా ఆ సెట్టింగ్లలో కనిపిస్తుంది; అది మారవచ్చు.
సాధ్యమైన పదాలు లేదా పద భాగాలు—వీటిని టోకెన్లు అంటారు—వాటిలో మోడల్ చేసే ఎంపికల ద్వారా TextGrain పనిచేస్తుంది. సృష్టి సమయంలో రహస్య కీ ఆ ఎంపికల్లో స్వల్ప మార్పులకు మార్గనిర్దేశం చేస్తుందని OpenAI చెబుతోంది. ఆ తర్వాత సరిపోలే కీ, సెట్టింగ్లున్న డిటెక్టర్ ఆ భాగంలో ఏర్పడిన గణాంక నమూనా ఉందా అని తనిఖీ చేస్తుంది. వాటర్మార్క్ దాచిన అక్షరాలు, ఖాళీలు లేదా కనిపించే విరామచిహ్నాలను జోడించదు. అందువల్ల టెక్స్ట్ను కాపీ చేయడానికి ప్రత్యేక మెటాడేటాను వెంట తీసుకెళ్లాల్సిన అవసరం లేదు; అయినా పదాలను యథాతథంగా ఉంచడం వల్ల సంకేతం గుర్తించబడుతుందని హామీ లేదు.
ఈ తేడా ఒక భాగాన్ని ఎవరు తనిఖీ చేయగలరో కూడా పరిమితం చేస్తుంది. టెక్స్ట్ డిటెక్టర్ కోసం OpenAI దరఖాస్తులను స్వీకరిస్తోంది; మొదట ఆమోదిత పరిశోధకులు, నిపుణ సంస్థల నుంచి. ప్రారంభంలో డిటెక్టర్ను ప్రజలకు అందుబాటులో ఉంచడం లేదు. మద్దతున్న చిత్రాలు, ఆడియో కోసం ఉన్న పబ్లిక్ వెరిఫికేషన్ సాధనాలు వేరు; అవి textGrainను బహిరంగంగా తనిఖీ చేయవు.
సంకేతం కనిపించకపోవచ్చు లేదా పొరపాటున కనిపించవచ్చు
ఒక మూల్యాంకనంలో OpenAI గుర్తింపు రేట్లను 1% లక్ష్య తప్పుడు-పాజిటివ్ రేటుతో నివేదించింది. మనస్తత్వశాస్త్ర భాగాల్లో 200-టోకెన్ నమూనాల్లో సుమారు 80%, 400-టోకెన్ నమూనాల్లో సుమారు 95% వద్ద డిటెక్టర్ వాటర్మార్క్ను కనుగొంది. పదప్రయోగానికి తక్కువ స్వేచ్ఛ ఉండే గణితంలో గుర్తింపు గణనీయంగా తక్కువగా ఉందని కంపెనీ చెబుతోంది. ఇవి నిర్దిష్ట పరిస్థితుల్లో కంపెనీ చేసిన మూల్యాంకన ఫలితాలు; వాస్తవ ప్రపంచంలో ఎదురయ్యే టెక్స్ట్కు కొలిచిన విజయ రేటు కాదు.
400 టోకెన్ల భాగాలపై కంపెనీ చేసిన మరో పరీక్షలో సవరణలు సంకేతాన్ని బలహీనపరిచాయి: 10% పదాలను పర్యాయపదాలతో మార్చినప్పుడు గుర్తింపు సుమారు 92% నుంచి 66%కు తగ్గింది; 25% మార్చినప్పుడు 17%కు పడిపోయింది. అనువాదం, విస్తృతంగా భావం మార్చి రాయడం, చిన్న సమాధానాలు, కోడ్లను కూడా గుర్తించడం కష్టమని OpenAI పత్రాలు చెబుతున్నాయి. భాషను బట్టి గుర్తింపు మారుతుందని కంపెనీ పేర్కొంది. కాబట్టి నెగటివ్ ఫలితం వల్ల టెక్స్ట్ను మనిషి రాశాడని నిర్ధారించలేం. ఆ భాగం మరీ చిన్నదై ఉండవచ్చు, మార్చబడి ఉండవచ్చు, విడుదలకు ముందే తయారై ఉండవచ్చు లేదా వాటర్మార్క్ పరిధిలో లేని మోడల్ లేదా ఉత్పత్తి నుంచి వచ్చి ఉండవచ్చు.
పాజిటివ్ ఫలితానికీ పరిమితులున్నాయి. డిటెక్టర్ పొరపాటున వాటర్మార్క్ ఉందని చెప్పవచ్చు. సంకేతం కనిపిస్తే, తన వ్యవస్థ ఆ భాగంలో కనీసం కొంతను రూపొందించి లేదా ప్రాసెస్ చేసి ఉండే అవకాశం ఉందని OpenAI చెబుతోంది. ఒక వ్యక్తి ఎంతవరకు తోడ్పడ్డారో ఇది కొలవదు; ఖాతా లేదా ప్రాంప్ట్ను గుర్తించదు; టెక్స్ట్ను ఎవరు రాశారు, ఎవరిది, ఎవరు బాధ్యులు అన్నది తేల్చదు. ఆ భాగం ఖచ్చితమైనదో కాదో కూడా నిర్ధారించదు. ఫలితం ఒక్కటితో సాధనాన్ని ఉపయోగించిన వ్యక్తిని గుర్తించలేం.
మరింత మూల్యాంకనం చేయాలని OpenAI యోచిస్తోంది; textGrainను ఓపెన్-సోర్స్ సాంకేతికతగా విడుదల చేయాలనుకుంటున్నట్లు చెబుతోంది. ప్రస్తుతానికి ఆచరణాత్మక మార్పు పరిమితమైనది: కొత్తగా రూపొందించే కొన్ని OpenAI టెక్స్ట్లలో యంత్రం చదవగల సంకేతం ఉంటుంది; అయితే దాన్ని పరిశీలించే మార్గాలు, దాని ఆధారంగా చెప్పగల నిర్ణయాలు పరిమితంగానే ఉంటాయి. ఈ కథనం OpenAI ప్రకటన, సహాయ పత్రాలపై ఆధారపడింది; BIG CHANGE వాటర్మార్క్ ఉన్న టెక్స్ట్ను రూపొందించలేదు, డిటెక్టర్ను నడపలేదు.



