Anthropic का कहना है कि कंपनी के भीतर मापे गए AI शोध और विकास के 26% काम में अब Claude अग्रणी है। इसका अर्थ है कि कोई सिस्टम ऊँचे स्तर के निर्देश से किसी काम का अधिकांश हिस्सा पूरा कर सकता है, जबकि व्यक्ति उसकी निगरानी करता है। Anthropic यह भी कहता है कि मापा गया कोई भी R&D काम Claude पूरी तरह स्वायत्त रूप से नहीं करता। यह अंतर नए कैम्ब्रिज प्रोग्राम ऑन AI साइंस एंड पॉलिसी के कार्य-पत्रमें उठाए गए सवाल के लिए अहम है: क्या AI द्वारा अपना अधिक R&D करने से अंततः AI की प्रगति तेज़ी से बढ़ सकती है?

सितंबर 2026 का यह शोध-पत्र विश्वविद्यालयों, AI कंपनियों और नागरिक समाज के 22 लेखकों की साझा रचना है। इसमें तर्क दिया गया है कि तेज़ फ़ीडबैक लूप संभव है: सक्षम सिस्टम बेहतर सिस्टम बनाने में मदद करें और फिर वे आगे और शोध करें। इसका मुख्य निष्कर्ष एक संभावित रास्ते के बारे में चेतावनी और उसे मापने की ज़रूरत है। शोध-पत्र यह रिपोर्ट नहीं करता कि ऐसी तेज़ी शुरू हो चुकी है।

बड़ा बदलाव

  • क्या बदला:विभिन्न संस्थानों के इस कार्य-पत्र में AI-नेतृत्व वाले R&D के साक्ष्य, किन शर्तों में यह AI की प्रगति तेज़ कर सकता है, और अग्रणी लैबों से सरकारों द्वारा माँगे जाने वाले विशिष्ट माप बताए गए हैं।
  • यह क्यों मायने रखता है:AI सिस्टम को उन कंपनियों के भीतर शोध के अधिक काम सौंपे जा रहे हैं जो उन्हें बना रही हैं। इस प्रतिनिधि काम के सार्वजनिक माप अब भी अधूरे हैं, इसलिए यह जानना कठिन है कि पूरी शोध प्रक्रिया कितनी तेज़ हो रही है।
  • आगे क्या देखें:स्वतंत्र रूप से जाँचे गए माप कि AI कितना काम पूरा करता है, उसके योगदान से बाद के मॉडल बेहतर होते हैं या नहीं, और कंप्यूट, प्रयोग तथा मानवीय समीक्षा फ़ीडबैक लूप को धीमा करते हैं या नहीं।

साक्ष्य मौजूद हैं, लेकिन माप अलग-अलग सवालों के जवाब देते हैं

Anthropic की सितंबर की मापन रिपोर्ट कहती है कि “AI leads” स्तर पर वर्गीकृत उसके R&D काम का हिस्सा अगस्त 2026 में 26% तक पहुँचा, जो फरवरी में 1% से कम था। इस वर्ग में अब भी मानव पर्यवेक्षक शामिल है। Anthropic कहता है कि यह सूचकांक प्रायोगिक है, उसके अपने मॉडल काम का मूल्यांकन करने में मदद करते हैं और कंपनियों में इन आँकड़ों की तुलना का कोई साझा तरीका नहीं है। मापा गया कोई काम पूरी तरह स्वायत्त नहीं है—Anthropic के इस बयान को 26% के आँकड़े के साथ ही देखना चाहिए।

OpenAI के सितंबर के विवरण में शोधकर्ताओं द्वारा अधिक कोडिंग एजेंट इस्तेमाल करने, तेज़ी से कोड देने और अधिक प्रयोग करने की बात है। OpenAI का कहना है कि प्रयोगों की संख्या एजेंटों के बढ़ते इस्तेमाल से जुड़ी है, जबकि उपलब्ध कंप्यूट भी बढ़ा है। कंपनी के अनुसार, लोग अब भी शोध की प्राथमिकताएँ चुनते हैं और तय करते हैं कि किन नतीजों पर आगे काम करना है। अधिक कोड और प्रयोग शोध में मदद कर सकते हैं, लेकिन इससे यह साबित नहीं होता कि अधिक सक्षम मॉडल बनने की गति भी उतनी ही बढ़ी है।

स्वतंत्र मूल्यांकन प्रक्रिया के एक हिस्से को मापने में मदद करते हैं। METR का Time Horizon 1.1 अपडेट पाता है कि अपने परीक्षण-संग्रह में मॉडल पहले के सिस्टमों की तुलना में लंबे शोध और सॉफ़्टवेयर कार्य पूरे कर सकते हैं। METR लंबे कार्यों के नतीजों में बड़ी अनिश्चितता भी बताता है; इनमें कई कार्यों को पूरा करने में लोगों का समय अनुमान से लिया गया था। कोई कार्य-बेंचमार्क चुने हुए कार्यों पर क्षमता मापता है; वह AI लैब की कुल शोध उत्पादकता नहीं मापता। 246 कार्यों पर काम कर रहे 16 अनुभवी ओपन-सोर्स डेवलपरों के एक अलग यादृच्छिक अध्ययन में METR ने पाया कि 2025 की शुरुआत के AI टूल उपलब्ध होने पर काम पूरा करने में 19% अधिक समय लगा। 2026 के सितंबर की अग्रणी लैब के लिए उस पुराने सॉफ़्टवेयर परिवेश को प्रतिनिधि नहीं माना जा सकता, लेकिन यह दिखाता है कि केवल टूल इस्तेमाल और कार्य-बेंचमार्क से उत्पादकता का सवाल तय नहीं होता।

एक संभावित फ़ीडबैक लूप पर कई रोकें हैं

CASP का शोध-पत्र सॉफ़्टवेयर-आधारित लूप पर केंद्रित है। AI सिस्टम समानांतर काम करके प्रभावी शोध कार्यबल बढ़ाएँगे। सफल सुधार अगले सिस्टमों को बेहतर शोधकर्ता बनाएँगे, जिससे और सुधार संभव होंगे। लेखकों का कहना है कि शुरुआती साक्ष्य इस प्रक्रिया से मेल खाते हैं और वे कुछ वर्षों में R&D स्वचालन का बड़ा हिस्सा संभव मानते हैं। “इंटेलिजेंस विस्फोट”—जिसमें वर्षों की प्रगति महीनों या उससे कम समय में सिमट जाए—की अधिक गंभीर संभावना इस बात पर निर्भर है कि लूप अपनी बाधाओं से तेज़ निकलता है या नहीं। यह सशर्त परिदृश्य है, जो होने वाली घटनाओं का मापा हुआ पूर्वानुमान नहीं।

शोध-पत्र चार अहम सीमाएँ बताता है: अतिरिक्त शोध प्रयास से मिलने वाला घटता लाभ, सीमित कंप्यूट और डेटा, ऐसे कार्य जिन्हें स्वचालित करना अब भी कठिन है, और लंबी ट्रेनिंग प्रक्रिया जिन्हें मनचाहे ढंग से तेज़ नहीं किया जा सकता। इसके अनुसार, इनमें से कुछ पर साक्ष्य मिश्रित या अप्रत्यक्ष हैं और समय लेने वाली बाधाओं की ताक़त पर प्रत्यक्ष साक्ष्य नहीं है। लगभग 1.5 वर्ष में प्रगति दस गुना तेज़ होने का उदाहरण, पूरे R&D स्वचालन के बाद की मॉडल-आधारित गणना है; यह शोध प्रयास से अनुमानित लाभ जारी रहने और कोई नई बाधा न आने की शर्त पर निर्भर है। यह न तो देखी गई तेज़ी है और न ही बिना शर्त बताई गई तारीख़।

अन्य शोध अनिश्चितता को और स्पष्ट करता है। चार AI लैबों के चार AI लैबों का 2025 का अध्ययनमें Parker Whitfill और Cheryl Wu ने पाया कि शोध-कंप्यूट को कैसे मॉडल किया जाता है, इस पर नतीजे बदलते हैं। एक विनिर्देशन में संज्ञानात्मक श्रम और कंप्यूट एक-दूसरे के विकल्प जैसे दिखे; अग्रणी प्रयोगों की बढ़ती माँग को शामिल करने वाले मॉडल में वे एक-दूसरे के पूरक जैसे दिखे। लेखकों ने डेटा और मॉडल को सीमित बताया है। Toby Ord का अगस्त 2026 का विश्लेषण हर सुधार चक्र को पूरा करने में लगने वाले समय को एक और अहम पैरामीटर मानता है। ये विश्लेषण तेज़ी से प्रगति की संभावना को खारिज नहीं करते। वे दिखाते हैं कि एजेंटों की संख्या या उनके लिखे कोड की मात्रा से लूप की गति सीधे नहीं जानी जा सकती।

लेखक क्या मापने की माँग करते हैं

कैम्ब्रिज के लेखक तीन नीतिगत प्राथमिकताएँ सुझाते हैं: AI R&D स्वचालन की जानकारी हासिल करना, संभावित तेज़ी को दिशा देने और सीमित करने के तरीके विकसित करना, और उसके संभावित प्रभावों की तैयारी करना। इनमें सबसे तात्कालिक और जाँचने योग्य प्राथमिकता मापन है। वे शोध में AI के योगदान का हिस्सा, एल्गोरिदम में सुधार की गति, लोगों और कंप्यूट पर लैबों का खर्च-बँटवारा, AI सिस्टम से प्रभावित शोध निर्णय और आंतरिक एजेंटों से जुड़ी घटनाएँ रिपोर्ट करने का सुझाव देते हैं। वे स्वतंत्र ऑडिट का भी प्रस्ताव रखते हैं, जिसमें AI R&D क्षमता की अग्रिम सीमा पर मौजूद सिस्टमों के लिए कड़ी शर्तें हों।

बाद के कुछ प्रस्ताव—जैसे आगे तैनाती से पहले की शर्तें, तय R&D कार्यभार रोकने के उपाय और अंतरराष्ट्रीय सत्यापन—में बड़े डिज़ाइन और समझौते शामिल होंगे। शोध-पत्र स्वयं चेताता है कि ठीक से न बनाई गई शक्तियाँ किसी एक कंपनी को लाभ पहुँचा सकती हैं और लाभकारी काम में देरी कर सकती हैं। संभावित लाभों और गंभीर नुकसानों का इसका आकलन पहले बताई गई सशर्त तेज़ी पर टिका है। सबसे चरम परिदृश्य मान लिए बिना भी नीति निर्माता निकट भविष्य में रिपोर्टिंग की दलील जाँच सकते हैं।

इस रिपोर्ट के बाद उपयोगी सवाल यह नहीं है कि क्या AI अचानक अतिबुद्धिमान हो जाएगा, बल्कि यह है कि क्या लैब तुलनीय तरीक़े से बता सकती हैं कि शोध के किन हिस्सों में AI अब अग्रणी है, कौन-से सुधार मानव मूल्यांकन के बाद भी कायम रहते हैं और वे सुधार अगली पीढ़ी के सिस्टमों तक कितनी तेज़ी से पहुँचते हैं। कंपनियों के बीच इस सवाल का जवाब देने के लिए सार्वजनिक साक्ष्य अभी पर्याप्त नहीं हैं।

स्रोत और आगे पढ़ें