कंपनियां मॉडल के जवाबों की तुलना करने, उनमें गलतियां समझाने और बेहतर काम के उदाहरण देने के लिए लोगों को नियुक्त करती हैं। ऐसे काम में चमकदार जवाब ही पूरा मूल्य नहीं होता। खरीदार शायद ऐसे निर्णय के लिए भुगतान कर रहा हो जो जांचे जा रहे मॉडल से नहीं आया।

404 Media की रिपोर्ट में OpenAI से जुड़ी परियोजनाओं पर काम करने वाले तीन ठेकेदारों ने AI इस्तेमाल करने के विरुद्ध नियमों का वर्णन किया; उनमें से दो ने कहा कि ऐसा करने पर ठेकेदारों को परियोजना से हटाया गया। इंटरव्यू में शामिल दो लोगों को काम देने वाली Mercor ने प्रकाशन से कहा कि उसके अनुबंध परियोजना का काम पूरा करने के लिए बड़े भाषा मॉडल इस्तेमाल करने से रोकते हैं और पुष्टि हुए उल्लंघन पर व्यक्ति को हटा दिया जाता है। OpenAI ने टिप्पणी से इनकार किया। हमने निजी परियोजना दस्तावेज़ नहीं देखे और न ही अलग-अलग मामलों की स्वतंत्र पुष्टि की है।

उपयोगी सवाल एक ठेकेदार मंच से आगे जाता है: जब कारोबार स्वतंत्र मानवीय जांच मांगता है, तो उसे उस काम से कैसे अलग रखा जाए जहां AI की मदद का स्वागत है?

बड़ा बदलाव

  • क्या बदला: ठेकेदारों के विवाद की रिपोर्ट उस बात पर टकराव दिखाती है कि AI प्रशिक्षण के काम से क्या चाहिए: पूरे किए गए जवाब या स्वतंत्र मानवीय आकलन।
  • यह क्यों मायने रखता है: Mercor का सार्वजनिक पायलट पेशेवर निर्णय को ही माप बनाता है। मॉडल से बनवाई गई रैंकिंग उसकी जगह लेने पर मूल्यांकन क्या मापता है, यह बदल जाता है—भले ही जमा किया गया काम अच्छी तरह लिखा हो।
  • क्या देखना है: मूल्यांकन खरीदने वालों को तय करना चाहिए कि किन चरणों में बिना AI सहायता के निर्णय चाहिए। काम स्वीकार करने से पहले यह बात काम के निर्देशों में स्पष्ट होनी चाहिए।

खरीदी जा रही चीज़ स्वतंत्र निर्णय हो सकती है

जब काम जल्दी पहला मसौदा तैयार करना हो, AI सहायक उपयोगी है। लेकिन जब काम संदर्भ-जवाब या स्वतंत्र तुलना देने का हो और यह फर्क छिपा दिया जाए, तब वही सहायक समस्या बनता है।

Mercor की सार्वजनिक कारोबारी क्षेत्र के विशेषज्ञों के लिए मॉडल-मूल्यांकन पायलट में यह आवश्यकता असामान्य रूप से स्पष्ट है। विशेषज्ञ पेशेवर काम करते हैं, मॉडल के पांच प्रयासों की रैंकिंग और स्कोर देते हैं और सबूत पर आधारित तर्क लिखते हैं। सूची के अनुसार कोई रूब्रिक या सही-जवाब पहले से नहीं दिया जाता, क्योंकि पेशेवर निर्णय ही माप है। काम हल करने, रैंकिंग, स्कोरिंग और तर्क लिखने के दौरान AI सहायक निषिद्ध हैं।

ये शर्तें एक पायलट का वर्णन करती हैं। इसकी तुलना विशेषज्ञ के अपने आकलन पर निर्भर है; वही आकलन किसी मॉडल को सौंपने से प्रयोग बदल जाता है।

सिंथेटिक प्रतिक्रिया अपने-आप खराब डेटा नहीं होती

हर AI-जनित प्रशिक्षण जवाब को “मॉडल पतन” से जोड़ने का मन हो सकता है। यहां ऐसा निष्कर्ष उपलब्ध प्रमाण से आगे जाएगा। Nature में प्रकाशित शोध ने ऐसे बार-बार प्रशिक्षण के तरीकों की जांच की जिनमें मूल वितरण से लिए डेटा की जगह जनरेट किए हुए डेटा इस्तेमाल होते हैं। उन प्रयोगों में लगातार बने मॉडलों ने मूल वितरण की जानकारी खो दी। यह तरीका रिपोर्ट किए गए ठेकेदार के काम का अध्ययन नहीं है और शोध-पत्र यह नहीं बताता कि किसी खास रेटिंग ने OpenAI के तैनात मॉडल को प्रभावित किया या नहीं।

एक अन्य मॉडल-पतन अध्ययन दिखाता है कि यह फर्क क्यों मायने रखता है। लेखकों ने पाया कि जब हर पीढ़ी का सिंथेटिक डेटा मूल वास्तविक डेटा की जगह लेता है तो मॉडल पतन होता है; लेकिन उनके प्रयोगों में वास्तविक डेटा बनाए रखने और लगातार सिंथेटिक डेटा जोड़ने पर यह नहीं हुआ। इससे यह साबित नहीं होता कि हर मिश्रण सुरक्षित है। इससे इतना पता चलता है कि केवल “AI-जनित” कहना पर्याप्त निदान नहीं; डेटा का स्रोत, चयन और प्रशिक्षण प्रक्रिया मायने रखते हैं।

अनुमत कार्य-प्रक्रिया स्पष्ट करें

एक संक्षिप्त विवरण में अनुमत टूल, बिना सहायता के निर्णय वाले चरण और मदद का खुलासा करने का तरीका साफ़ होना चाहिए। Mercor का पायलट काम हल करने और मूल्यांकन करने, दोनों में स्वतंत्रता तय करता है। सहायता लेकर किया गया काम देने वाले खरीदारों को बताना चाहिए कि वे कर्मचारी से कौन-सा पेशेवर निर्णय अब भी चाहते हैं।

समीक्षा में भी यही सावधानी चाहिए। 404 Media की रिपोर्ट के अनुसार, एक आंतरिक दस्तावेज़ में समीक्षकों को AI पहचानने वाले टूल न इस्तेमाल करने की चेतावनी दी गई थी और उन्हें अविश्वसनीय बताया गया था। यह प्रबंधन के एक बुनियादी सिद्धांत से मेल खाता है: विराम-चिह्न, गति या चमकदार भाषा इस बात का प्रमाण नहीं कि किसी ने मॉडल इस्तेमाल किया। समीक्षक देख सकता है कि तर्क स्रोत सामग्री का हवाला देता है या नहीं, कर्मचारी से निर्णय समझाने को कह सकता है, बार-बार जमा किए गए काम की तुलना कर सकता है और परियोजना द्वारा कानूनी तौर पर जुटाए गए टूल रिकॉर्ड देख सकता है। किसी एक शैलीगत संकेत से कर्मचारी का मामला तय नहीं होना चाहिए।

कर्मचारियों को अनुमान लगाने का खेल नहीं, चुनौती देने योग्य नियम चाहिए

स्वतंत्र ठेकेदार को किसी परियोजना से जल्दी हटाया जा सकता है। इसलिए भरोसेमंद व्यवस्था में काम शुरू होने और भुगतान वाले कार्य को स्वीकार करने से पहले नियम दिखना चाहिए, संदिग्ध उल्लंघन को पुष्ट उल्लंघन से अलग रखना चाहिए और कर्मचारी को प्रासंगिक सबूत समझाने का रास्ता देना चाहिए। यह निष्पक्ष प्रक्रिया की सिफ़ारिश है, किसी अनुबंध या कानून के तहत अधिकारों का दावा नहीं।

वहीं, कर्मचारियों को बिना सहायता वाले निर्णय की शर्त को काम के विनिर्देश का हिस्सा समझना चाहिए। जिसे लगे कि स्वीकृत टूल ज़रूरी है, वह उसका उपयोग करने से पहले पूछ सकता है या काम ठुकरा सकता है। छिपी हुई सहायता सिर्फ़ इसलिए स्वीकार्य नहीं हो जाती कि मॉडल अच्छी भाषा लिखता है—जैसे उत्तर सही होने से निषिद्ध बाहरी सहयोग स्वीकार्य नहीं हो जाता।

निर्णय का स्रोत स्पष्ट करें

Mercor का सार्वजनिक पायलट काम का विनिर्देश साफ़ देता है: पेशेवर द्वारा बिना सहायता किया गया आकलन। सहायता लेकर किए जाने वाले काम के लिए खरीदारों को उतना ही स्पष्ट बताना चाहिए कि कौन-से टूल अनुमत हैं और कर्मचारी से किस निर्णय की अपेक्षा है।