एक 10 सितंबर को arXiv पर प्रकाशित और 22 सितंबर को संशोधित सर्वेक्षण एआई प्रणालियों के सुधार में उनकी भागीदारी के पांच स्तर प्रस्तुत करता है। इसका शीर्षक, The Last AI Built by Humans, लेखकों द्वारा बताई गई घटना नहीं, बल्कि एक महत्वाकांक्षा को व्यक्त करता है। उनके साक्ष्य उन सीमित उदाहरणों तक पहुंचते हैं जहां प्रणालियां अपनी विकास प्रक्रिया के कुछ हिस्से संशोधित करती हैं। इससे यह स्थापित नहीं होता कि कोई प्रणाली हर पीढ़ी में भरोसेमंद ढंग से बेहतर उत्तराधिकारी बना सकती है।
स्वचालित एआई अनुसंधान के दावों को समझते समय यह फर्क अहम है। कोई एजेंट प्रयोग चला सकता है, उनसे मिली सीख सहेज सकता है और बेंचमार्क स्कोर सुधार सकता है, जबकि लक्ष्य तय करना, परीक्षण नियंत्रित करना और बदलावों में से किसे बनाए रखना है यह निर्णय लोग ही लें। अधिक मजबूत दावे के लिए यह प्रमाण चाहिए कि प्रणाली ने अपना अगला संस्करण बनाने की विधि सुधारी और निष्पक्ष तुलना में संशोधित विधि बेहतर साबित हुई।
बड़ा बदलाव
- क्या बदला: अब शोधकर्ता अधिक सटीक तरीके से बता सकते हैं कि एआई-सुधार चक्र के कितने हिस्से पर कोई प्रणाली नियंत्रण रखती है—सौंपे गए बदलाव लागू करने से लेकर बाद के बदलावों की प्रक्रिया संशोधित करने तक। नया सर्वेक्षण मौजूदा काम को व्यवस्थित करता है; यह पूरी तरह स्वायत्त उत्तराधिकारी निर्माता की घोषणा नहीं है।
- यह क्यों मायने रखता है: एआई प्रयोगशालाएं अधिक प्रयोग स्वचालित कर सकती हैं, पर इससे यह साबित नहीं होता कि हर नया एजेंट अगला एजेंट बनाने में बेहतर है। यह फर्क प्रदर्शन के दावों को समझने और यह तय करने में अहम है कि मानवीय समीक्षा तथा स्वतंत्र परीक्षण कहां बनाए रखने चाहिए।
- क्या देखना है: निर्णायक साक्ष्य उत्तराधिकारियों की ऐसी श्रृंखला होगी जो विरासत में मिली, संशोधित सुधार-विधि से बनी हो और सुरक्षित रखे गए कार्यों पर पुराने तरीके से तुलनीय संसाधनों के साथ जांची गई हो। सर्वेक्षण में शामिल काम ने इस आधार पर सांख्यिकीय रूप से भरोसेमंद संचयी सुधार अब तक स्थापित नहीं किया है।
सुधार चक्र पर नियंत्रण के पांच स्तर
लेख पहले एक ही कार्य में संशोधन—जिसे वह B0 कहता है—और लगातार चलने वाले सुधार के बीच फर्क करता है। कोई मॉडल जांच में पास होने तक एक उत्तर संपादित करे, तो उस उत्तर में सुधार हुआ है। जब तक बदलाव बाद के स्वतंत्र कार्यों में कायम न रहे, प्रणाली ने खुद कोई स्थायी सुधार हासिल नहीं किया।
स्तर 1 पर लक्ष्य और सफलता की जांच लोग तय करते हैं; एआई कोई बदलाव लागू करता है, जैसे किसी व्यक्ति द्वारा तय किए गए डेटा-गुणवत्ता नियम को लागू करना। स्तर 2 पर एआई सौंपे गए लक्ष्य के लिए रणनीति भी चुनता है—मसलन, कोडिंग एजेंट की विफलताओं का पता लगाकर उसके टूल में बदलाव सुझाना। उद्देश्य और स्वीकृति-जांच फिर भी प्रणाली के बाहर से तय होते हैं।
स्तर 3 पर प्रणाली यह चुनने में मदद करती है कि उसे आगे किस अनुभव की जरूरत है, जैसे अपनी पहचानी कमजोरियों पर केंद्रित अभ्यास-कार्य चुनना। स्तर 4 में लगातार उपयोग से मिलने वाला प्रतिपुष्टि-संकेत जुड़ता है: नई परिस्थितियों का सामना करने के बाद प्रणाली स्मृति, नियमों या घटकों में स्वीकृत बदलाव बनाए रखती है। लेख के अनुसार दोनों स्तर इस बात पर निर्भर हैं कि प्रतिपुष्टि कितनी अच्छी है और कौन से नियम तय करते हैं कि कौन से बदलाव टिकेंगे।
स्तर 5 सर्वेक्षण के केंद्रीय विचार तक पहुंचता है। एआई उस प्रक्रिया को संशोधित करता है जो बाद के सुधार का मार्गदर्शन करती है—उदाहरण के लिए उसकी खोज-नीति, मूल्यांकनकर्ता या उत्तराधिकारी सुझाने वाला एजेंट। संशोधित प्रक्रिया को सहेजना और अगले दौर में इस्तेमाल करना जरूरी है। यहां भी लेख कहता है कि लोग समग्र उद्देश्य, सुरक्षित स्वीकृति-परीक्षण और संसाधनों पर नियंत्रण बनाए रख सकते हैं। स्तर सौंपे गए दायित्व को बताता है, प्रगति या असीमित स्वायत्तता की गारंटी नहीं।
मौजूदा प्रणालियां इस सीमा को दिखाती हैं
यह Darwin Gödel Machine का अध्ययन बताता है कि उसके कोडिंग एजेंट का स्कोर अध्ययन के SWE-bench उपसमूह पर 20% से 50% तक बढ़ा। इसके लिए अलग-अलग संस्करणों ने एजेंट के कोड में बदलाव किए और सफल संस्करण संग्रह में जोड़े गए। लेखकों ने यह भी कहा कि संग्रह का रखरखाव और यह नियम कि कौन सा संस्करण अगला आधार बनेगा, तयशुदा थे। सर्वेक्षण इसका उपयोग यह दिखाने के लिए करता है कि बेहतर अगली पीढ़ियां भर यह साबित नहीं करतीं कि उन्हें चुनने वाली प्रक्रिया ने खुद को बेहतर किया है।
A-Evolve-Training स्तर 5 का अधिक सीमित उदाहरण देता है। इसमें 30 अरब पैरामीटर वाले मॉडल पर पोस्ट-ट्रेनिंग के चार दौर चलाए गए। एक मेटा-एजेंट ने नतीजों को समेकित किया और जब आंतरिक विकास स्कोर बाहरी लीडरबोर्ड से मेल खाना बंद हुआ, तो बाद के कार्यकर्ताओं को दिशा देने वाली अनुसंधान नीति बदल दी। अध्ययन का अंतिम स्कोर 0.86 था, जबकि उस समय शीर्ष मानवीय प्रविष्टि का स्कोर 0.87 था। विरासत में मिली नीति ने बाद के प्रयोगों के चयन का तरीका बदला। कार्यकर्ताओं की मूल प्रणाली और प्रतियोगिता का उद्देश्य स्थिर रहे। यह एक परिभाषित परियोजना के भीतर संशोधित अनुसंधान-प्रक्रिया के काम करने का उदाहरण है, मॉडल विकास के हर हिस्से पर स्वायत्त नियंत्रण का नहीं।
यह HyperAgents का अध्ययन जांचता है कि एजेंट बनाने की बेहतर प्रक्रिया नए क्षेत्र में भी काम आती है या नहीं। गणित के उत्तरों की ग्रेडिंग पर 200 दौर के बाद, हस्तांतरित सुधारों से शुरू हुए एक रन को परीक्षण-समूह पर 0.640 स्कोर मिला; अपने शुरुआती एजेंट से शुरू हुए रन का स्कोर 0.610 था। लेखकों के अनुसार यह अंतर सांख्यिकीय रूप से महत्वपूर्ण नहीं था। नतीजा इस तरह के हस्तांतरण की जांच का समर्थन करता है, लेकिन कई दौर में भरोसेमंद संचयी सुधार स्थापित नहीं करता।
अधिक गतिविधि बेहतर सुधार का प्रमाण नहीं
सर्वेक्षण संशोधित प्रक्रिया के दोबारा इस्तेमाल को संरचनात्मक पुनरावृत्ति कहता है, जबकि प्रभावी पुनरावृत्ति का अर्थ है कि संशोधित प्रक्रिया तुलनीय संसाधनों और स्वतंत्र मूल्यांकन में अधिक सक्षम उत्तराधिकारी बनाए। यही दूसरी कसौटी है, जिसे नाटकीय शीर्षक पढ़कर लोग शायद पहले से हासिल मान लें।
गतिविधि को प्रगति समझने की कई वजहें हो सकती हैं। प्रणाली खोज में अधिक कंप्यूटिंग समय लगा सकती है, बार-बार देखे गए बेंचमार्क के अनुरूप खुद को ढाल सकती है, या ऐसा बदलाव बनाए रख सकती है जो एक कार्य में मदद करे मगर दूसरे को बिगाड़ दे। यदि वह अपना मूल्यांकनकर्ता भी बदल दे, तो ऊंचा स्कोर नए पैमाने का नतीजा हो सकता है। इसलिए लेख कहता है कि यह दर्ज करना चाहिए कि क्या बदला गया; दिखाना चाहिए कि संशोधित घटक ने अगले दौर का सचमुच मार्गदर्शन किया; पुराने घटक से समान संसाधनों में तुलना करनी चाहिए; और स्वतंत्र कार्यों पर बदलाव के टिकने तथा दूसरे कार्यों में लागू होने की जांच करनी चाहिए।
लेखक साफ कहते हैं कि मौजूदा नतीजे सुधार-तंत्र, मूल्यांकनकर्ताओं और अनुसंधान-नीतियों में सीमित बदलावों का समर्थन करते हैं, जबकि “तुलनीय संसाधनों में पीढ़ियों के दौरान सांख्यिकीय रूप से भरोसेमंद संचयी सुधार का सवाल खुला है।” “मनुष्यों द्वारा बनाया गया आखिरी एआई” उस मंजिल का नाम है जो उनके ढांचे को प्रेरित करती है। यह सर्वेक्षण उस दिशा में प्रगति आंकने की कसौटियां देता है।
स्रोत और आगे पढ़ें
- Duan और सहलेखक, The Last AI Built by Humans, संस्करण 3 (22 सितंबर 2026)। यह मूल सर्वेक्षण B0 और स्तर 1–5 परिभाषित करता है, संरचनात्मक और प्रभावी पुनरावृत्ति में फर्क करता है तथा साक्ष्य की सीमाएं बताता है। इसका वर्गीकरण और व्याख्या लेखकों का ढांचा है, किसी नई प्रणाली का प्रदर्शन नहीं।
- Zhang और सहलेखक, Darwin Gödel Machine (संस्करण 3, 12 मार्च 2026)। मूल अध्ययन कोडिंग बेंचमार्क में बढ़त बताता है और स्पष्ट करता है कि संग्रह का रखरखाव तथा अगले आधार का चयन तयशुदा हैं।
- Shi और सहलेखक, A-Evolve-Training (संस्करण 3, 8 सितंबर 2026)। मूल प्रीप्रिंट पोस्ट-ट्रेनिंग के चार दौर, नीति में संशोधन और बताए गए लीडरबोर्ड नतीजे का वर्णन करता है। इसका उद्देश्य और कार्यकर्ताओं की मूल प्रणाली बाहर से तय रहे।
- Zhang और सहलेखक, HyperAgents (2026)। मूल अध्ययन एजेंट बनाने की प्रक्रिया के हस्तांतरण की जांच करता है और बताता है कि यहां उद्धृत 200-दौर की तुलना में सांख्यिकीय महत्व नहीं मिला।
- Manuel Muñoz Plá की विस्तृत समीक्षा (18 सितंबर 2026) सर्वेक्षण के ऊंचे स्तरों वाले उदाहरणों और साक्ष्य की सीमाओं की पड़ताल करती है। यह शोधपत्र के पुराने संस्करण का विश्लेषण है; ऊपर दिए गए तथ्यात्मक दावे संस्करण 3 और उद्धृत मूल अध्ययनों पर आधारित हैं।
- South China Morning Post की रिपोर्ट (14 सितंबर 2026) सर्वेक्षण के पांच-चरणीय खाके और एआई अनुसंधान के संदर्भ को कवर करती है। यह द्वितीयक रिपोर्टिंग है, अध्ययनों के नतीजों का साक्ष्य नहीं।
- The Rundown AI की व्याख्या (16 सितंबर 2026) स्तरों का सार देती है और स्वचालित एआई अनुसंधान पर बहस में लेख को रखती है। यह द्वितीयक स्रोत है; तथ्यात्मक दावों का आधार शोधपत्र और मूल अध्ययन हैं।



