arXiv वर 10 सप्टेंबर रोजी प्रसिद्ध आणि 22 सप्टेंबरला सुधारित झालेल्या सर्वेक्षणात AI प्रणाली सुधारण्यात AI कितपत सहभागी असते याच्या पाच पातळ्या मांडल्या आहेत. त्याचे शीर्षक मानवांनी बनवलेला शेवटचा AIही लेखकांची आकांक्षा दर्शवते; त्यांनी घडल्याचे नोंदवलेली घटना नव्हे. स्वतःच्या विकासप्रक्रियेतील काही भाग प्रणाली सुधारतात, अशी मर्यादित उदाहरणे पुरावा म्हणून दिला आहे. पिढ्यान्पिढ्या अधिक सक्षम उत्तराधिकारी विश्वासार्हपणे निर्माण करणारी प्रणाली त्यावरून सिद्ध होत नाही.
स्वयंचलित AI संशोधनावरील दावे समजून घेताना हा फरक महत्त्वाचा ठरतो. एजंट प्रयोग करू शकतो, त्यातून मिळालेले धडे जतन करू शकतो आणि बेंचमार्कचा गुण सुधारू शकतो; तरीही माणसे त्याचे उद्दिष्ट ठरवत, चाचण्यांवर नियंत्रण ठेवत आणि कोणते बदल टिकतील ते ठरवत असू शकतात. अधिक ठोस दाव्यासाठी प्रणालीने पुढील आवृत्ती तयार करणारी पद्धत सुधारली आणि सुधारित पद्धतीने निष्पक्ष तुलनेत अधिक चांगले काम केले, याचा पुरावा हवा.
मोठा बदल
- काय बदलले: संशोधकांकडे आता AI सुधारण्याच्या चक्रावर प्रणालीचे किती नियंत्रण आहे हे सांगण्याची अधिक नेमकी चौकट आहे—नेमून दिलेले बदल करणे ते पुढील बदलांसाठी वापरली जाणारी प्रक्रिया सुधारणे इथपर्यंत. हे नवे सर्वेक्षण आधीचे संशोधन मांडते; पूर्णपणे स्वायत्त उत्तराधिकारी तयार करणारी सिद्ध प्रणाली जाहीर करत नाही.
- याचे महत्त्व: AI प्रयोगशाळा अधिक प्रयोग स्वयंचलित करू शकतात; पण प्रत्येक नवा एजंट पुढचा एजंट अधिक चांगला बनवतो हे त्यातून सिद्ध होत नाही. कामगिरीच्या दाव्यांचा अर्थ लावताना आणि मानवी पुनरावलोकन व स्वतंत्र चाचण्या कुठे ठेवायच्या हे ठरवताना हा फरक महत्त्वाचा आहे.
- काय पाहावे: पुढील निर्णायक पुरावा म्हणजे मागील सुधारणा-पद्धतीत बदल करून तयार केलेल्या उत्तराधिकाऱ्यांची मालिका; जुन्या पद्धतीशी तुलनीय संसाधनांत, संरक्षित कामांवर चाचणी केलेली. सर्वेक्षणातील संशोधनाने या आधारावर सांख्यिकीयदृष्ट्या विश्वासार्ह संचयी प्रगती अद्याप सिद्ध केलेली नाही.
सुधारणा-चक्रावरील नियंत्रणाच्या पाच पातळ्या
लेख प्रथम B0 असे नाव दिलेली एकाच कामापुरती सुधारणा आणि टिकाऊ सुधारणेतील फरक स्पष्ट करतो. तपासणी उत्तीर्ण होईपर्यंत उत्तर संपादित करणाऱ्या मॉडेलने ते उत्तर सुधारले आहे. तो बदल पुढील स्वतंत्र कामांत टिकून राहिला नाही, तर प्रणालीला कायमस्वरूपी अद्ययावत लाभलेले नाही.
पातळी 1, लोक लक्ष्य आणि यशाची चाचणी ठरवतात; AI बदल करतो—उदाहरणार्थ, माणसाने ठरवलेला डेटा-गुणवत्तेचा नियम लागू करणे. पातळी 2वर, AI नेमून दिलेल्या उद्दिष्टासाठीची रणनीतीही निवडतो; उदाहरणार्थ, कोडिंग एजंटच्या अपयशांचे निदान करून त्याच्या साधनांत बदल सुचवणे. उद्दिष्ट आणि स्वीकार-चाचणी मात्र प्रणालीबाहेरूनच ठरतात.
पातळी 3वर, पुढे कोणत्या अनुभवाची गरज आहे हे ठरवण्यासही प्रणाली मदत करते; उदाहरणार्थ, स्वतःला आढळलेल्या कमकुवत बाजूंवर केंद्रित सरावकामे तयार करणे. पातळी 4 सततच्या वापरातून मिळणारा अभिप्राय जोडते: नवी परिस्थिती अनुभवून झाल्यावर मंजूर बदल स्मृती, नियम किंवा घटकांत प्रणाली कायम ठेवते. कोणते बदल टिकतात हे ठरवणाऱ्या नियमांची गुणवत्ता आणि अभिप्रायावर या दोन्ही पातळ्या अवलंबून आहेत, असे लेख सांगतो.
पातळी 5 सर्वेक्षणाची मध्यवर्ती संकल्पना मांडते. पुढील सुधारणा
मार्गदर्शन करणारी प्रक्रिया AI बदलते—उदाहरणार्थ, शोध धोरण, मूल्यमापक किंवा उत्तराधिकारी सुचवणारा एजंट. सुधारित प्रक्रिया जतन करून पुढील फेरीत वापरली पाहिजे. तरीही एकूण उद्दिष्ट, संरक्षित स्वीकार-चाचण्या आणि संसाधने माणसे नियंत्रित करू शकतात, असे लेख सांगतो. पातळी म्हणजे सोपवलेल्या जबाबदारीचे वर्णन; प्रगतीची हमी किंवा निर्बंधविरहित स्वायत्तता नव्हे.
विद्यमान प्रणाली मर्यादा स्पष्ट करतात या Darwin Gödel Machine च्या अभ्यासात
पातळी 5 चे अधिक मर्यादित उदाहरण देते. 30 अब्ज पॅरामीटर मॉडेलवर पोस्ट-ट्रेनिंगच्या चार फेऱ्या चालवल्या. अंतर्गत विकास गुण बाह्य लीडरबोर्डशी जुळेनासा झाल्यावर मेटा-एजंटने निकाल एकत्र करून पुढील कार्यकर्त्यांना मार्गदर्शन करणारे संशोधन धोरण बदलले. त्या वेळी सर्वोच्च मानवी सादरीकरणाच्या 0.87 गुणांच्या तुलनेत अंतिम गुण 0.86 असल्याचे अभ्यास सांगतो. बदललेल्या धोरणाने पुढील प्रयोगांची निवड बदलली. मात्र कार्यकर्त्यांची मूळ प्रणाली आणि स्पर्धेचे उद्दिष्ट स्थिर राहिले. हे निश्चित प्रकल्पात सुधारित संशोधन प्रक्रिया वापरल्याचे दाखवते; मॉडेल विकासाच्या प्रत्येक भागावरील स्वायत्त नियंत्रण नव्हे. हा HyperAgents चा अभ्यास
अधिक क्रियाकलाप म्हणजे अधिक चांगली सुधारणा नव्हे
सुधारित प्रक्रिया पुन्हा वापरण्याला सर्वेक्षण संरचनात्मक पुनरावृत्तीम्हणते; त्याहून वेगळे म्हणजे प्रभावी पुनरावृत्ती: सुधारित प्रक्रियेमुळे तुलनीय संसाधने आणि स्वतंत्र मूल्यमापनांत अधिक सक्षम उत्तराधिकारी तयार होतात. नाट्यमय शीर्षक वाचकांना हे दुसरे आधीच घडले आहे असे वाटू देऊ शकते; प्रत्यक्षात हीच निर्णायक कसोटी आहे.
क्रियाकलापाला प्रगती समजण्याचे अनेक मार्ग आहेत. प्रणाली अधिक संगणकीय वेळ शोधात खर्च करू शकते, वारंवार तपासलेल्या बेंचमार्कवर जुळवून घेऊ शकते किंवा एका कामाला उपयोगी पण दुसरे बिघडवणारा बदल ठेवू शकते. स्वतःचा मूल्यमापकही बदलल्यास, जास्त गुण हे नवा निकष वापरल्यामुळे आलेले असू शकतात. म्हणून काय बदलले, सुधारित घटक पुढील फेरीला प्रत्यक्ष दिशा देतो का, समान संसाधनांत जुन्या घटकाशी तुलना कशी होते, आणि स्वतंत्र कामांवर बदल टिकतो व हस्तांतरित होतो का हे नोंदवण्याचे आवाहन लेख करतो.
सध्याचे निकाल सुधारक, मूल्यमापक आणि संशोधन धोरणांत मर्यादित बदलांना आधार देतात; मात्र “तुलनीय संसाधनांत पिढ्यान्पिढ्या सांख्यिकीयदृष्ट्या विश्वासार्ह संचयी प्रगती अद्याप खुला प्रश्न आहे,” असे लेखक स्पष्टपणे सांगतात. “मानवांनी बनवलेला शेवटचा AI” हे वाक्य त्यांच्या चौकटीमागचे अंतिम ध्येय दर्शवते. त्या दिशेने प्रगती कशी तपासावी याचे निकष सर्वेक्षण देते.
स्रोत आणि पुढील वाचन
- Duan आणि सहलेखक, मानवांनी बनवलेला शेवटचा AI, आवृत्ती 3 (22 सप्टेंबर 2026). प्राथमिक सर्वेक्षणात B0 आणि पातळी 1–5 स्पष्ट करून संरचनात्मक व प्रभावी पुनरावृत्ती यांतील फरक आणि पुराव्याच्या मर्यादा नमूद केल्या आहेत. वर्गीकरण व अर्थलक्षण ही लेखकांची चौकट आहे; नव्या प्रणालीचे प्रात्यक्षिक नाही.
- Zhang आणि सहलेखक, Darwin Gödel Machine , आवृत्ती 3 (12 मार्च 2026)
- . मूळ अभ्यासात कोडिंग बेंचमार्कमधील सुधारणा नोंदवून संग्रहाची देखभाल आणि पालक आवृत्तीची निवड निश्चित राहते असे स्पष्ट केले आहे. Shi आणि सहलेखक, A-Evolve-Training
- , आवृत्ती 3 (8 सप्टेंबर 2026) . मूळ पूर्वप्रकाशनात पोस्ट-ट्रेनिंगच्या चार फेऱ्या, धोरणातील बदल आणि नमूद लीडरबोर्ड निकाल दिले आहेत. त्याचे उद्दिष्ट व कार्यकर्त्यांची मूळ प्रणाली बाहेरून निश्चित राहते. Zhang आणि सहलेखक,
- HyperAgents , 2026
- . मूळ अभ्यास एजंट-निर्मिती प्रक्रियेचे हस्तांतरण तपासतो आणि येथे उद्धृत 200 पुनरावृत्तींच्या तुलनेत सांख्यिकीय महत्त्व नसल्याचे सांगतो. Manuel Muñoz Plá यांचे सखोल वाचन
- The Rundown AI चे स्पष्टीकरण (16 सप्टेंबर 2026) पातळ्यांचा सारांश देते आणि स्वयंचलित AI संशोधनावरील वादाच्या संदर्भात हा लेख मांडते. हे दुय्यम वृत्तांकन आहे; वरील तथ्यात्मक दाव्यांना आधार पेपर आणि मूळ अभ्यास आहेत.



