ஒரு செப்டம்பர் 10 அன்று arXiv-இல் வெளியிடப்பட்டு, செப்டம்பர் 22 அன்று திருத்தப்பட்ட ஆய்வு AI அமைப்புகளை மேம்படுத்துவதில் செயற்கை நுண்ணறிவு எந்த அளவு ஈடுபடுகிறது என்பதற்கு ஐந்து நிலைகளை வகுக்கிறது. அதன் தலைப்பான மனிதர்கள் உருவாக்கும் கடைசி AI, ஆசிரியர்கள் அறிக்கையிடும் நிகழ்வைக் குறிக்கவில்லை; அது அவர்களின் இலட்சியத்தைக் குறிக்கிறது. தங்கள் சொந்த மேம்பாட்டுச் செயல்முறையின் பகுதிகளை அமைப்புகள் திருத்திய வரையறுக்கப்பட்ட எடுத்துக்காட்டுகள் வரைதான் அவர்களின் சான்றுகள் செல்கின்றன. ஒவ்வொரு தலைமுறையிலும் நம்பகமாகச் சிறந்த அடுத்த தலைமுறையை உருவாக்கும் அமைப்பை அவை நிறுவவில்லை.

வலுவான கூற்றுக்கு, அமைப்பு அடுத்த பதிப்பை உருவாக்கும் முறையை மேம்படுத்தியது என்பதற்கும், திருத்திய முறை நியாயமான ஒப்பீட்டில் சிறப்பாகச் செயல்பட்டது என்பதற்கும் சான்று தேவை.

முக்கிய மாற்றம்

  • என்ன மாறியது:ஒதுக்கப்பட்ட புதுப்பிப்புகளைச் செய்வதிலிருந்து, பின்னர் செய்யப்படும் புதுப்பிப்புகளின் நடைமுறையையே திருத்துவது வரை, AI மேம்பாட்டு வட்டத்தின் எந்தப் பகுதியை ஒரு அமைப்பு கட்டுப்படுத்துகிறது என்பதை ஆராய்ச்சியாளர்கள் இப்போது துல்லியமாக விவரிக்க முடிகிறது. இந்தப் புதிய ஆய்வு முந்தைய ஆராய்ச்சிகளை ஒழுங்குபடுத்துகிறது; முழுமையான தன்னாட்சி அடுத்த தலைமுறை உருவாக்கியைக் கண்டுபிடித்ததாக அறிவிக்கவில்லை.
  • இது ஏன் முக்கியம்:ஒவ்வொரு புதிய முகவரும் அடுத்த முகவரை உருவாக்குவதில் சிறந்தது என்பதை நிரூபிக்காமலேயே AI ஆய்வகங்கள் மேலும் பல சோதனைகளைத் தானியக்கமாக்கலாம். செயல்திறன் கூற்றுகளை ஆராய்ச்சியாளர்கள் எவ்வாறு புரிந்துகொள்கிறார்கள், மனித மதிப்பாய்வு மற்றும் சுயாதீனச் சோதனைகளை எங்கு தொடர்கிறார்கள் என்பதற்கு இந்த வேறுபாடு முக்கியம்.
  • கவனிக்க வேண்டியது:மேம்படுத்தப்பட்ட முறையைப் பயன்படுத்தி உருவாக்கப்பட்ட அடுத்தடுத்த அமைப்புகளின் வரிசைதான் தீர்மானகரமான சான்று. பழைய முறையுடன் ஒப்பிடும்போது, பாதுகாக்கப்பட்ட பணிகளில், ஒப்பிடத்தக்க வளங்களைப் பயன்படுத்திச் சோதிக்க வேண்டும். ஆய்வு செய்த பணி, அந்த அடிப்படையில் புள்ளியியல் ரீதியாக நம்பகமான திரட்சியை இதுவரை நிறுவவில்லை.

மேம்பாட்டு வட்டத்தின் மீதான கட்டுப்பாட்டை ஐந்து நிலைகள் விவரிக்கின்றன

ஒற்றைப் பணிக்கான திருத்தம்—ஆய்வு B0 என அழைப்பது—மற்றும் நீடித்த மேம்பாடு ஆகியவற்றை ஆய்வுக் கட்டுரை முதலில் வேறுபடுத்துகிறது. சரிபார்ப்பில் தேர்ச்சி பெறும் வரை ஒரு பதிலைத் திருத்தும் மாதிரி அந்தப் பதிலை மேம்படுத்தியுள்ளது. அந்த மாற்றம் பின்னர் வரும் சுயாதீனப் பணிகளிலும் தொடராவிட்டால், அமைப்பு நீடிக்கும் புதுப்பிப்பைப் பெற்றதாகாது.

நிலை 1-இல், இலக்கும் வெற்றிச் சோதனையும் மனிதர்களால் தேர்ந்தெடுக்கப்படும்; மனிதர்கள் வரையறுத்த தரவுத் தர விதியைப் பயன்படுத்துவது போன்ற புதுப்பிப்பை AI செய்கிறது. 2-ஆம் நிலையில், ஒதுக்கப்பட்ட இலக்கை அடைய வேண்டிய உத்தியையும் AI தேர்வு செய்கிறது. எடுத்துக்காட்டாக, குறியீட்டு முகவர் ஏன் தோல்வியடைகிறது எனக் கண்டறிந்து அதன் கருவிகளில் மாற்றங்களை முன்மொழியலாம். நோக்கமும் ஏற்றுக்கொள்ளும் சோதனையும் இன்னும் அமைப்புக்கு வெளியிலிருந்து நிர்ணயிக்கப்படுகின்றன.

நிலை 3, அடுத்து எந்த அனுபவம் தேவை என்பதைத் தேர்வுசெய்ய அமைப்பு உதவுகிறது; அது கண்டறிந்த பலவீனங்களை நோக்கிய பயிற்சிப் பணிகளை அமைப்பது ஓர் எடுத்துக்காட்டு. 4-ஆம் நிலை தொடர்ச்சியான பயன்பாட்டிலிருந்து வரும் பின்னூட்டத்தையும் சேர்க்கிறது: புதிய சூழல்களை எதிர்கொண்ட பிறகு, நினைவகம், விதிகள் அல்லது கூறுகளில் செய்யப்பட்ட அங்கீகரிக்கப்பட்ட மாற்றங்களை அமைப்பு தக்கவைக்கிறது. பின்னூட்டத்தின் தரத்தையும் எந்த மாற்றங்கள் நிலைக்க வேண்டும் என்பதற்கான விதிகளையும் இந்த இரு நிலைகளும் சார்ந்துள்ளன என ஆய்வுக் கட்டுரை கருதுகிறது.

நிலை 5 ஆய்வின் மையக் கருத்தை எட்டுகிறது. அடுத்தகட்ட மேம்பாட்டை வழிநடத்தும் நடைமுறையையே AI திருத்துகிறது; எடுத்துக்காட்டாக, அதன் தேடல் கொள்கை, மதிப்பீட்டாளர் அல்லது அடுத்தடுத்த அமைப்புகளை முன்மொழியும் முகவர். திருத்திய நடைமுறை தக்கவைக்கப்பட்டு, அடுத்த சுற்றில் பயன்படுத்தப்பட வேண்டும். இந்நிலையிலும் ஒட்டுமொத்த நோக்கம், பாதுகாக்கப்பட்ட ஏற்றுக்கொள்ளும் சோதனைகள், வளங்கள் ஆகியவற்றைக் கட்டுப்படுத்தும் அதிகாரத்தை மனிதர்கள் வைத்திருக்கலாம் எனக் கட்டுரை கூறுகிறது. ஒரு நிலை ஒப்படைக்கப்பட்ட பொறுப்பை விவரிக்கிறது; முன்னேற்றத்துக்கான உத்தரவாதத்தையோ வரம்பற்ற தன்னாட்சியையோ அல்ல.

தற்போதைய அமைப்புகள் இந்த எல்லையை எடுத்துக்காட்டுகின்றன

முந்தைய Darwin Gödel Machine ஆய்வு அதன் குறியீட்டு முகவர், ஆய்வின் SWE-bench துணைத்தொகுப்பில் 20%-இலிருந்து 50%-க்கு உயர்ந்ததாக அறிக்கையிடுகிறது. முகவர் குறியீட்டில் மாறுபாடுகளைச் செய்து, வெற்றிகரமான மாறுபாடுகள் காப்பகத்தில் சேர்க்கப்பட்டன. காப்பகப் பராமரிப்பும் எந்த மாறுபாடு பெற்றோர் பதிப்பாகும் என்பதற்கான விதியும் நிலையானவையாக இருந்தன என்றும் ஆசிரியர்கள் குறிப்பிடுகின்றனர். சிறந்த அடுத்தடுத்த பதிப்புகள் தோன்றினாலே, அவற்றைத் தேர்ந்தெடுக்கும் செயல்முறையும் தன்னைத்தானே மேம்படுத்தியது என நிரூபிக்க முடியாது என்பதை விளக்க இந்த ஆய்வைச் சர்வே பயன்படுத்துகிறது.

A-Evolve-Training குறுகிய வரம்புடைய நிலை 5 எடுத்துக்காட்டை வழங்குகிறது. 30 பில்லியன் அளவுரு மாதிரியில் நான்கு சுற்றுப் பிந்தைய பயிற்சி நடந்தது. உள்ளக மேம்பாட்டு மதிப்பெண் வெளிப்புற முன்னணி அட்டவணையுடன் பொருந்தாமல் போனதும், பின்னர் பணிபுரியும் முகவர்களை வழிநடத்தும் ஆராய்ச்சிக் கொள்கையை ஒரு மேல்-முகவர் முடிவுகளை ஒருங்கிணைத்துத் திருத்தியது. இறுதி மதிப்பெண் 0.86 என ஆய்வு தெரிவிக்கிறது; அப்போதைய சிறந்த மனிதச் சமர்ப்பிப்பின் மதிப்பெண் 0.87. பின்னர் வரும் சோதனைகள் எப்படித் தேர்வு செய்யப்பட்டன என்பதை மாற்றியமைத்த கொள்கைத் திருத்தம் பயன்படுத்தப்பட்டது. தொழிலாளி அமைப்பும் போட்டியின் நோக்கமும் மாறாமல் இருந்தன. வரையறுக்கப்பட்ட திட்டத்துக்குள் திருத்திய ஆராய்ச்சி நடைமுறை செயல்படுவதை இது காட்டுகிறது; மாதிரி மேம்பாட்டின் ஒவ்வொரு பகுதியையும் தன்னாட்சி கட்டுப்படுத்துவதை அல்ல.

அந்த HyperAgents ஆய்வு மேம்படுத்திய முகவர் உருவாக்கும் நடைமுறை புதிய துறைக்குப் பொருந்துமா எனச் சோதிக்கிறது. கணித மதிப்பீட்டில் 200 முறைத் திரும்பச் செய்த பிறகு, மாற்றங்களைப் பெற்றுத் தொடங்கிய ஓட்டம் அதன் சோதனைத் தொகுப்பில் 0.640 மதிப்பெண் பெற்றது; தொடக்க முகவரிலிருந்து தொடங்கிய ஓட்டம் 0.610 பெற்றது. இந்த வேறுபாடு புள்ளியியல் ரீதியாக முக்கியத்துவம் பெறவில்லை என ஆசிரியர்கள் தெரிவிக்கின்றனர். முடிவுகள், வேறு சூழலுக்கு மாற்றும் ஆய்வை ஆதரிக்கின்றன; ஆனால் ஓட்டங்களுக்கிடையே நம்பகமான திரட்டலை நிறுவவில்லை.

மேலும் செயல்பாடு இருப்பது சிறந்த மேம்பாட்டுக்கான சான்றல்ல

திருத்திய நடைமுறை மீண்டும் பயன்படுத்தப்படுவதை ஆய்வு கட்டமைப்பு மறுசுழற்சி என அழைக்கிறது; அதை செயல்திறன் மறுசுழற்சி எனப்படுவது: ஒப்பிடத்தக்க வளங்களிலும் சுயாதீன மதிப்பீட்டிலும், திருத்திய நடைமுறை இன்னும் சிறந்த அடுத்த தலைமுறை அமைப்புகளை உருவாக்க வேண்டும். வியப்பூட்டும் தலைப்பு ஏற்கெனவே நிகழ்ந்துவிட்டதாக வாசகர்களை நம்பச் செய்யக்கூடியது அந்த இரண்டாவது சோதனையே.

செயல்பாட்டை முன்னேற்றம் எனத் தவறாகக் கருதப் பல வழிகள் உள்ளன. ஒரு அமைப்பு தேடலுக்குக் கூடுதல் கணினி நேரம் செலவிடலாம்; மீண்டும் மீண்டும் வினவிய அளவுகோலுக்கு மிகையாகப் பொருந்தலாம்; ஒரு பணிக்கு உதவும் மாற்றத்தைச் சேமித்தபோது மற்றொரு பணியை உடைக்கலாம். அது தன் மதிப்பீட்டாளரையும் மாற்றினால், உயர்ந்த மதிப்பெண் புதிய அளவுகோலைப் பிரதிபலிக்கலாம். ஆகவே, எதைத் திருத்தினார்கள் என்பதைப் பதிவு செய்யவும், அடுத்த சுற்றை அந்தக் கூறு உண்மையில் வழிநடத்தியது எனக் காட்டவும், ஒத்த வளங்களில் பழைய கூறுடன் ஒப்பிடவும், சுயாதீனப் பணிகளில் மாற்றம் நீடிப்பதையும் வேறு பணிகளுக்குப் பரவுவதையும் சோதிக்கவும் கட்டுரை அழைக்கிறது.

தற்போதைய முடிவுகள் மேம்பாட்டாளர்கள், மதிப்பீட்டாளர்கள், ஆராய்ச்சிக் கொள்கைகளில் வரையறுக்கப்பட்ட மாற்றங்களுக்கு ஆதரவளிக்கின்றன; “ஒப்பிடத்தக்க வளங்களில் தலைமுறைகளுக்கிடையே புள்ளியியல் ரீதியாக நம்பகமான திரட்சி இன்னும் நிரூபிக்கப்படவில்லை” என ஆசிரியர்கள் வெளிப்படையாகக் கூறுகின்றனர். “மனிதர்கள் உருவாக்கும் கடைசி AI” என்ற சொற்றொடர், அவர்களின் கட்டமைப்பைத் தூண்டும் இலக்கைக் குறிக்கிறது. அதை நோக்கிய முன்னேற்றத்தை மதிப்பிடுவதற்கான அளவுகோல்களை இந்த ஆய்வு வழங்குகிறது.

ஆதாரங்களும் மேலும் வாசிப்பும்

  • Duan உள்ளிட்டோர், மனிதர்கள் உருவாக்கும் கடைசி AI, பதிப்பு 3 (2026 செப்டம்பர் 22). முதன்மை ஆய்வு B0 மற்றும் 1–5 நிலைகளை வரையறுத்து, கட்டமைப்பு மற்றும் செயல்திறன் மறுசுழற்சியை வேறுபடுத்தி, சான்றுகளின் வரம்புகளை விளக்குகிறது. இதன் வகைப்பாடும் விளக்கங்களும் ஆசிரியர்கள் முன்வைக்கும் கட்டமைப்பு; புதிய அமைப்பின் செயல்விளக்கம் அல்ல.
  • Zhang உள்ளிட்டோர், Darwin Gödel Machine (பதிப்பு 3, 2026 மார்ச் 12). அசல் ஆய்வு குறியீட்டு அளவுகோலில் ஏற்பட்ட உயர்வுகளை அறிக்கையிட்டு, காப்பகப் பராமரிப்பும் பெற்றோர் தேர்வும் நிலையாகவே இருந்தன எனக் குறிப்பிடுகிறது.
  • Shi உள்ளிட்டோர், A-Evolve-Training (பதிப்பு 3, 2026 செப்டம்பர் 8). அசல் முன்அச்சு நான்கு பிந்தைய பயிற்சிச் சுற்றுகள், கொள்கைத் திருத்தம், தெரிவிக்கப்பட்ட முன்னணி அட்டவணை முடிவு ஆகியவற்றை விவரிக்கிறது. அதன் நோக்கமும் அடிப்படைத் தொழிலாளி அமைப்பும் வெளிப்புறமாக நிர்ணயிக்கப்பட்டிருந்தன.
  • Zhang உள்ளிட்டோர், HyperAgents (2026). அசல் ஆய்வு முகவர் உருவாக்கும் நடைமுறையின் மாற்றத்தைக் கணித மதிப்பீட்டுச் சோதனைத் தொகுப்பில் 200 முறை ஒப்பிடுகிறது; இங்கு குறிப்பிடப்படும் வேறுபாடு புள்ளியியல் முக்கியத்துவம் பெறவில்லை என அறிக்கையிடுகிறது.
  • Manuel Muñoz Plá-வின் விரிவான வாசிப்பு (2026 செப்டம்பர் 18) ஆய்வின் மேம்பட்ட நிலை எடுத்துக்காட்டுகளையும் சான்று வரம்புகளையும் ஆராய்கிறது. அது ஆய்வுக் கட்டுரையின் முந்தைய பதிப்பைப் பகுப்பாய்வு செய்கிறது; மேலுள்ள கட்டுரை பதிப்பு 3-ஐயும் குறிப்பிடப்பட்ட அசல் ஆய்வுகளையும் உண்மைத் தகவல்களுக்குப் பயன்படுத்துகிறது.
  • South China Morning Post செய்தி (2026 செப்டம்பர் 14) ஆய்வின் ஐந்து கட்டப் பாதையையும் AI ஆராய்ச்சிச் சூழலையும் விவரிக்கிறது. இது இரண்டாம் நிலைச் செய்தி; ஆய்வுகளின் முடிவுகளுக்கான சான்று அல்ல.
  • The Rundown AI விளக்கக் கட்டுரை (2026 செப்டம்பர் 16) நிலைகளைச் சுருக்கி, தானியங்கியான AI ஆராய்ச்சி குறித்த விவாதத்தில் ஆய்வை அமைவிடுகிறது. இது இரண்டாம் நிலை விளக்கம்; மேலுள்ள உண்மைக் கூற்றுகளை ஆய்வுக் கட்டுரையும் அசல் ஆய்வுகளுமே ஆதரிக்கின்றன.