arXiv वर 10 सप्टेंबर रोजी प्रसिद्ध आणि 22 सप्टेंबरला सुधारित झालेल्या सर्वेक्षणात AI प्रणाली सुधारण्यात AI कितपत सहभागी असते याच्या पाच पातळ्या मांडल्या आहेत. त्याचे शीर्षक मानवांनी बनवलेला शेवटचा AIही लेखकांची आकांक्षा दर्शवते; त्यांनी घडल्याचे नोंदवलेली घटना नव्हे. स्वतःच्या विकासप्रक्रियेतील काही भाग प्रणाली सुधारतात, अशी मर्यादित उदाहरणे पुरावा म्हणून दिला आहे. पिढ्यान्‌पिढ्या अधिक सक्षम उत्तराधिकारी विश्वासार्हपणे निर्माण करणारी प्रणाली त्यावरून सिद्ध होत नाही.

स्वयंचलित AI संशोधनावरील दावे समजून घेताना हा फरक महत्त्वाचा ठरतो. एजंट प्रयोग करू शकतो, त्यातून मिळालेले धडे जतन करू शकतो आणि बेंचमार्कचा गुण सुधारू शकतो; तरीही माणसे त्याचे उद्दिष्ट ठरवत, चाचण्यांवर नियंत्रण ठेवत आणि कोणते बदल टिकतील ते ठरवत असू शकतात. अधिक ठोस दाव्यासाठी प्रणालीने पुढील आवृत्ती तयार करणारी पद्धत सुधारली आणि सुधारित पद्धतीने निष्पक्ष तुलनेत अधिक चांगले काम केले, याचा पुरावा हवा.

मोठा बदल

  • काय बदलले: संशोधकांकडे आता AI सुधारण्याच्या चक्रावर प्रणालीचे किती नियंत्रण आहे हे सांगण्याची अधिक नेमकी चौकट आहे—नेमून दिलेले बदल करणे ते पुढील बदलांसाठी वापरली जाणारी प्रक्रिया सुधारणे इथपर्यंत. हे नवे सर्वेक्षण आधीचे संशोधन मांडते; पूर्णपणे स्वायत्त उत्तराधिकारी तयार करणारी सिद्ध प्रणाली जाहीर करत नाही.
  • याचे महत्त्व: AI प्रयोगशाळा अधिक प्रयोग स्वयंचलित करू शकतात; पण प्रत्येक नवा एजंट पुढचा एजंट अधिक चांगला बनवतो हे त्यातून सिद्ध होत नाही. कामगिरीच्या दाव्यांचा अर्थ लावताना आणि मानवी पुनरावलोकन व स्वतंत्र चाचण्या कुठे ठेवायच्या हे ठरवताना हा फरक महत्त्वाचा आहे.
  • काय पाहावे: पुढील निर्णायक पुरावा म्हणजे मागील सुधारणा-पद्धतीत बदल करून तयार केलेल्या उत्तराधिकाऱ्यांची मालिका; जुन्या पद्धतीशी तुलनीय संसाधनांत, संरक्षित कामांवर चाचणी केलेली. सर्वेक्षणातील संशोधनाने या आधारावर सांख्यिकीयदृष्ट्या विश्वासार्ह संचयी प्रगती अद्याप सिद्ध केलेली नाही.

सुधारणा-चक्रावरील नियंत्रणाच्या पाच पातळ्या

लेख प्रथम B0 असे नाव दिलेली एकाच कामापुरती सुधारणा आणि टिकाऊ सुधारणेतील फरक स्पष्ट करतो. तपासणी उत्तीर्ण होईपर्यंत उत्तर संपादित करणाऱ्या मॉडेलने ते उत्तर सुधारले आहे. तो बदल पुढील स्वतंत्र कामांत टिकून राहिला नाही, तर प्रणालीला कायमस्वरूपी अद्ययावत लाभलेले नाही.

पातळी 1, लोक लक्ष्य आणि यशाची चाचणी ठरवतात; AI बदल करतो—उदाहरणार्थ, माणसाने ठरवलेला डेटा-गुणवत्तेचा नियम लागू करणे. पातळी 2वर, AI नेमून दिलेल्या उद्दिष्टासाठीची रणनीतीही निवडतो; उदाहरणार्थ, कोडिंग एजंटच्या अपयशांचे निदान करून त्याच्या साधनांत बदल सुचवणे. उद्दिष्ट आणि स्वीकार-चाचणी मात्र प्रणालीबाहेरूनच ठरतात.

पातळी 3वर, पुढे कोणत्या अनुभवाची गरज आहे हे ठरवण्यासही प्रणाली मदत करते; उदाहरणार्थ, स्वतःला आढळलेल्या कमकुवत बाजूंवर केंद्रित सरावकामे तयार करणे. पातळी 4 सततच्या वापरातून मिळणारा अभिप्राय जोडते: नवी परिस्थिती अनुभवून झाल्यावर मंजूर बदल स्मृती, नियम किंवा घटकांत प्रणाली कायम ठेवते. कोणते बदल टिकतात हे ठरवणाऱ्या नियमांची गुणवत्ता आणि अभिप्रायावर या दोन्ही पातळ्या अवलंबून आहेत, असे लेख सांगतो.

पातळी 5 सर्वेक्षणाची मध्यवर्ती संकल्पना मांडते. पुढील सुधारणा

मार्गदर्शन करणारी प्रक्रिया AI बदलते—उदाहरणार्थ, शोध धोरण, मूल्यमापक किंवा उत्तराधिकारी सुचवणारा एजंट. सुधारित प्रक्रिया जतन करून पुढील फेरीत वापरली पाहिजे. तरीही एकूण उद्दिष्ट, संरक्षित स्वीकार-चाचण्या आणि संसाधने माणसे नियंत्रित करू शकतात, असे लेख सांगतो. पातळी म्हणजे सोपवलेल्या जबाबदारीचे वर्णन; प्रगतीची हमी किंवा निर्बंधविरहित स्वायत्तता नव्हे.

विद्यमान प्रणाली मर्यादा स्पष्ट करतात या Darwin Gödel Machine च्या अभ्यासात

एजंटच्या कोडमध्ये बदल करून आणि यशस्वी आवृत्त्या संग्रहात घालून त्याने अभ्यासातील SWE-bench उपसंचावर गुण 20% वरून 50% पर्यंत सुधारल्याचे नोंदवले आहे. संग्रहाची देखभाल आणि पुढील पालक आवृत्ती निवडण्याचा नियम निश्चितच राहिला, असे लेखकही सांगतात. वंशज अधिक चांगले झाले म्हणून वंशज निवडणारी प्रक्रिया स्वतः सुधारली असे सिद्ध होत नाही हे दाखवण्यासाठी सर्वेक्षण हा अभ्यास वापरते. A-Evolve-Training

पातळी 5 चे अधिक मर्यादित उदाहरण देते. 30 अब्ज पॅरामीटर मॉडेलवर पोस्ट-ट्रेनिंगच्या चार फेऱ्या चालवल्या. अंतर्गत विकास गुण बाह्य लीडरबोर्डशी जुळेनासा झाल्यावर मेटा-एजंटने निकाल एकत्र करून पुढील कार्यकर्त्यांना मार्गदर्शन करणारे संशोधन धोरण बदलले. त्या वेळी सर्वोच्च मानवी सादरीकरणाच्या 0.87 गुणांच्या तुलनेत अंतिम गुण 0.86 असल्याचे अभ्यास सांगतो. बदललेल्या धोरणाने पुढील प्रयोगांची निवड बदलली. मात्र कार्यकर्त्यांची मूळ प्रणाली आणि स्पर्धेचे उद्दिष्ट स्थिर राहिले. हे निश्चित प्रकल्पात सुधारित संशोधन प्रक्रिया वापरल्याचे दाखवते; मॉडेल विकासाच्या प्रत्येक भागावरील स्वायत्त नियंत्रण नव्हे. हा HyperAgents चा अभ्यास

अधिक क्रियाकलाप म्हणजे अधिक चांगली सुधारणा नव्हे

सुधारित प्रक्रिया पुन्हा वापरण्याला सर्वेक्षण संरचनात्मक पुनरावृत्तीम्हणते; त्याहून वेगळे म्हणजे प्रभावी पुनरावृत्ती: सुधारित प्रक्रियेमुळे तुलनीय संसाधने आणि स्वतंत्र मूल्यमापनांत अधिक सक्षम उत्तराधिकारी तयार होतात. नाट्यमय शीर्षक वाचकांना हे दुसरे आधीच घडले आहे असे वाटू देऊ शकते; प्रत्यक्षात हीच निर्णायक कसोटी आहे.

क्रियाकलापाला प्रगती समजण्याचे अनेक मार्ग आहेत. प्रणाली अधिक संगणकीय वेळ शोधात खर्च करू शकते, वारंवार तपासलेल्या बेंचमार्कवर जुळवून घेऊ शकते किंवा एका कामाला उपयोगी पण दुसरे बिघडवणारा बदल ठेवू शकते. स्वतःचा मूल्यमापकही बदलल्यास, जास्त गुण हे नवा निकष वापरल्यामुळे आलेले असू शकतात. म्हणून काय बदलले, सुधारित घटक पुढील फेरीला प्रत्यक्ष दिशा देतो का, समान संसाधनांत जुन्या घटकाशी तुलना कशी होते, आणि स्वतंत्र कामांवर बदल टिकतो व हस्तांतरित होतो का हे नोंदवण्याचे आवाहन लेख करतो.

सध्याचे निकाल सुधारक, मूल्यमापक आणि संशोधन धोरणांत मर्यादित बदलांना आधार देतात; मात्र “तुलनीय संसाधनांत पिढ्यान्‌पिढ्या सांख्यिकीयदृष्ट्या विश्वासार्ह संचयी प्रगती अद्याप खुला प्रश्न आहे,” असे लेखक स्पष्टपणे सांगतात. “मानवांनी बनवलेला शेवटचा AI” हे वाक्य त्यांच्या चौकटीमागचे अंतिम ध्येय दर्शवते. त्या दिशेने प्रगती कशी तपासावी याचे निकष सर्वेक्षण देते.

स्रोत आणि पुढील वाचन