ఒక సెప్టెంబర్ 10న arXivలో ప్రచురించి, సెప్టెంబర్ 22న సవరించిన సర్వే AI వ్యవస్థలను మెరుగుపరచడంలో AI పాత్రకు ఐదు స్థాయిలను ప్రతిపాదిస్తుంది. దాని శీర్షిక, The Last AI Built by Humans, రచయితల ఆకాంక్షను సూచిస్తుంది; వారు నివేదించిన సంఘటనను కాదు. తమ అభివృద్ధి ప్రక్రియలోని కొన్ని భాగాలను వ్యవస్థలు సవరించిన పరిమిత ఉదాహరణల వరకు మాత్రమే ఆధారాలు ఉన్నాయి. ప్రతి తరంలోనూ మరింత మెరుగైన వారస నమూనాలను వ్యవస్థ విశ్వసనీయంగా తయారు చేస్తుందని ఇది నిరూపించదు.
స్వయంచాలక AI పరిశోధన వాదనలను అర్థం చేసుకునేటప్పుడు ఈ తేడా ముఖ్యం. ఒక ఏజెంట్ ప్రయోగాలు నిర్వహించి, నేర్చుకున్న విషయాలను భద్రపరచి, benchmark స్కోరును పెంచినా, దాని లక్ష్యాన్ని మనుషులు నిర్ణయించి, పరీక్షలను నియంత్రించి, ఏ మార్పులు నిలవాలో తేల్చవచ్చు. మరింత బలమైన వాదనకు, తదుపరి వెర్షన్ను రూపొందించే విధానాన్ని వ్యవస్థ మెరుగుపరిచిందని, సవరించిన విధానం న్యాయమైన పోలికలో మెరుగ్గా పనిచేసిందని ఆధారం అవసరం.
పెద్ద మార్పు
- ఏం మారింది: అప్పగించిన నవీకరణలు చేయడం నుంచి, తర్వాతి నవీకరణల ప్రక్రియనే సవరించడం వరకు, AI మెరుగుదల చక్రాన్ని ఒక వ్యవస్థ ఎంతవరకు నియంత్రిస్తుందో వివరించేందుకు పరిశోధకులకు ఇప్పుడు మరింత కచ్చితమైన పద్ధతి ఉంది. కొత్త సర్వే ఇప్పటికే ఉన్న పనిని వర్గీకరిస్తుంది; పూర్తిస్థాయి స్వయంప్రతిపత్తి గల వారస-వ్యవస్థను ప్రకటించదు.
- ఇది ఎందుకు ముఖ్యం: ప్రతి కొత్త ఏజెంట్ తదుపరి ఏజెంట్ను మెరుగ్గా తయారు చేస్తుందని నిరూపించకుండానే AI ప్రయోగశాలలు మరిన్ని ప్రయోగాలను ఆటోమేట్ చేయగలవు. ఈ తేడా పనితీరు వాదనలను పరిశోధకులు ఎలా అర్థం చేసుకుంటారు, మనుషుల సమీక్ష, స్వతంత్ర పరీక్షలను ఎక్కడ కొనసాగిస్తారు అన్నదానిపై ప్రభావం చూపుతుంది.
- ఏమి గమనించాలి: స్వీకరించిన, సవరించిన మెరుగుదల పద్ధతితో తయారైన వారస నమూనాల పరంపరను చూపి, పాత పద్ధతితో సమాన వనరులపై రక్షిత పనులను ఉపయోగించి పోల్చడం కీలక ఆధారం. ఈ ప్రమాణం ప్రకారం గణాంకపరంగా నమ్మదగిన సమీకృత మెరుగుదలను సర్వేలోని పరిశోధనలు ఇంకా నిరూపించలేదు.
మెరుగుదల చక్రంపై నియంత్రణను ఐదు స్థాయిలు వివరిస్తాయి
వ్యక్తిగత పనిలో మార్పులు చేయడాన్ని—పేపర్ దీనిని B0 అంటుంది—నిరంతర మెరుగుదల నుంచి ముందుగా వేరు చేస్తుంది. ఒక తనిఖీలో ఉత్తీర్ణమయ్యే వరకు సమాధానాన్ని సవరించే మోడల్ ఆ సమాధానాన్ని మెరుగుపరిచింది. ఆ మార్పు తర్వాతి స్వతంత్ర పనులకు కొనసాగకపోతే, వ్యవస్థలో శాశ్వత నవీకరణ ఏర్పడినట్లు కాదు.
స్థాయి 1లో, లక్ష్యాన్ని, విజయ ప్రమాణాన్ని మనుషులు నిర్ణయిస్తారు; ఉదాహరణకు, మనిషి నిర్వచించిన డేటా నాణ్యత నియమాన్ని AI అమలు చేస్తుంది. స్థాయి 2లో, అప్పగించిన లక్ష్యానికి వ్యూహాన్ని కూడా AI ఎంచుకుంటుంది—ఉదాహరణకు, coding agent వైఫల్యాలను గుర్తించి, దాని సాధనాల్లో మార్పులు సూచించవచ్చు. లక్ష్యం, ఆమోద పరీక్ష మాత్రం వ్యవస్థ వెలుపలే నిర్ణయిస్తారు.
స్థాయి 3లో, తనకు తర్వాత ఏ అనుభవం అవసరమో ఎంచుకోవడంలో వ్యవస్థ సహాయపడుతుంది; ఉదాహరణకు, గుర్తించిన బలహీనతలపై సాధన పనులను రూపొందిస్తుంది. స్థాయి 4 లో నిరంతర వినియోగం నుంచి వచ్చే అభిప్రాయమూ చేరుతుంది: కొత్త పరిస్థితులు ఎదురైన తర్వాత, ఆమోదించిన మార్పులను స్మృతి, నియమాలు లేదా భాగాల రూపంలో వ్యవస్థ నిలుపుకుంటుంది. అభిప్రాయ నాణ్యత, ఏ మార్పులు కొనసాగాలనే నియమాలపై ఈ రెండు స్థాయిలూ ఆధారపడతాయని పేపర్ పేర్కొంటుంది.
స్థాయి 5 సర్వేలోని ప్రధాన భావన. తర్వాతి దశల మెరుగుదలకు మార్గనిర్దేశం చేసే విధానాన్నే AI సవరిస్తుంది—దాని search విధానం, evaluator లేదా వారస నమూనాలను ప్రతిపాదించే ఏజెంట్ వంటివి. సవరించిన విధానాన్ని భద్రపరచి, తర్వాతి దశలో ఉపయోగించాలి. ఇక్కడ కూడా మొత్తం లక్ష్యం, రక్షిత ఆమోద పరీక్షలు, వనరులపై మనుషులు నియంత్రణ కొనసాగించవచ్చని పేపర్ చెబుతుంది. స్థాయి అనేది అప్పగించిన బాధ్యతను వివరిస్తుంది; పురోగతికి హామీని లేదా పరిమితుల్లేని స్వయంప్రతిపత్తిని కాదు.
ప్రస్తుత వ్యవస్థలు హద్దును చూపిస్తాయి
ఒక Darwin Gödel Machine అధ్యయనం ప్రకారం, ఆ అధ్యయనంలోని SWE-bench ఉపసమితిపై coding agent పనితీరు 20% నుంచి 50%కి పెరిగింది; agent కోడ్లో వేరియంట్లు మార్పులు చేసి, విజయవంతమైన వేరియంట్లు archiveలో చేరాయి. archive నిర్వహణ, తర్వాతి parentగా ఏ వేరియంట్ను ఎంచుకోవాలనే నియమం స్థిరంగా ఉన్నాయని రచయితలూ చెబుతున్నారు. వారస నమూనాలు మెరుగవడమే, వాటిని ఎంచుకునే ప్రక్రియను వ్యవస్థ స్వయంగా మెరుగుపరిచిందని నిరూపించదని చూపేందుకు సర్వే దీన్ని ఉపయోగిస్తుంది.
A-Evolve-Training మరింత పరిమితమైన స్థాయి 5 ఉదాహరణ. 30 బిలియన్ పారామీటర్ల మోడల్పై నాలుగు post-training దశలను ఇది నిర్వహించింది. అంతర్గత అభివృద్ధి స్కోరు బాహ్య leaderboard పురోగతిని ప్రతిబింబించడం ఆగిన తర్వాత, meta-agent ఫలితాలను సమీకరించి, తర్వాతి కార్మికులకు మార్గనిర్దేశం చేసే పరిశోధన విధానాన్ని మార్చింది. చివరి స్కోరు 0.86గా, అప్పటి అత్యుత్తమ మానవ సమర్పణ 0.87గా అధ్యయనం నివేదించింది. స్వీకరించిన విధానం తర్వాతి ప్రయోగాల ఎంపికను మార్చింది. కార్మికుల మూల వ్యవస్థ, పోటీ లక్ష్యం మాత్రం స్థిరంగానే ఉన్నాయి. మోడల్ అభివృద్ధిలోని ప్రతి భాగంపై స్వయంప్రతిపత్తి నియంత్రణకు ఇది ఉదాహరణ కాదు; నిర్వచిత ప్రాజెక్టులో సవరించిన పరిశోధన ప్రక్రియ పనిచేసినట్లు చూపిస్తుంది.
ఈ HyperAgents అధ్యయనం మెరుగైన agent-నిర్మాణ విధానం కొత్త రంగానికి బదిలీ అవుతుందా అని పరీక్షించింది. గణిత మూల్యాంకనంలో 200 iterations తర్వాత, బదిలీ చేసిన మెరుగుదలలతో మొదలైన run తన test setలో 0.640 సాధించింది; మొదటి agentతో ప్రారంభమైన run 0.610 సాధించింది. ఈ తేడా గణాంకపరంగా ముఖ్యమైనది కాదని రచయితలు నివేదించారు. ఈ ఫలితం బదిలీపై మరింత పరిశోధనకు మద్దతిస్తుంది; runs అంతటా నమ్మదగిన సమీకృత మెరుగుదలను మాత్రం నిరూపించదు.
ఎక్కువ కార్యకలాపం అంటే మెరుగైన అభివృద్ధి కాదు
సవరించిన విధానాన్ని మళ్లీ ఉపయోగించడాన్ని నిర్మాణాత్మక పునరావర్తనం అంటారు; దానిని సమర్థవంతమైన పునరావర్తనం నుంచి సర్వే వేరు చేస్తుంది: సమాన వనరులు, స్వతంత్ర మూల్యాంకనంలో సవరించిన విధానం మరింత మెరుగైన వారస నమూనాలను తయారు చేయాలి. నాటకీయంగా ఉన్న శీర్షిక ఇప్పటికే జరిగిపోయిందని పాఠకులు భావించేలా చేసే రెండో పరీక్ష ఇదే.
కార్యకలాపాన్ని పురోగతిగా పొరబడే మార్గాలు అనేకం. వ్యవస్థ ఎక్కువ కంప్యూటింగ్ సమయాన్ని వెచ్చించి వెతకవచ్చు, పదేపదే ప్రశ్నించిన benchmarkకు అతిగా సరిపోవచ్చు, ఒక పనికి తోడ్పడినా మరో పనిని దెబ్బతీసే మార్పును నిలుపుకోవచ్చు. తన evaluatorనూ మార్చుకుంటే, పెరిగిన స్కోరు కొత్త కొలమానం వల్ల కావచ్చు. అందువల్ల ఏది సవరించారో నమోదు చేయాలని, సవరించిన భాగమే తర్వాతి దశకు మార్గనిర్దేశం చేసిందని చూపాలని, పాత భాగంతో సమాన వనరులపై పోల్చాలని, స్వతంత్ర పనుల్లో మార్పు నిలకడ, బదిలీని పరీక్షించాలని పేపర్ సూచిస్తుంది.
ప్రస్తుత ఫలితాలు improverలు, evaluatorలు, పరిశోధన విధానాల్లో పరిమిత మార్పులకు మద్దతిస్తున్నాయని రచయితలు స్పష్టంగా చెబుతున్నారు; “సమాన వనరులపై తరాల మధ్య గణాంకపరంగా నమ్మదగిన సమీకరణ ఇంకా నిరూపితం కాలేదు.” “మనుషులు నిర్మించిన చివరి AI” అనే పదబంధం వారి చట్రానికి ప్రేరణనిచ్చే గమ్యాన్ని సూచిస్తుంది. దిశగా పురోగతిని అంచనా వేయడానికి సర్వే ప్రమాణాలను అందిస్తుంది.
మూలాలు, మరింత చదవండి
- Duan తదితరులు, The Last AI Built by Humans, మూడో సంచిక (సెప్టెంబర్ 22, 2026). B0, స్థాయి 1–5ను నిర్వచించి, నిర్మాణాత్మక, సమర్థవంతమైన పునరావర్తనాలను వేరు చేసి, ఆధారాల పరిమితులను పేర్కొన్న ప్రాథమిక సర్వే. వర్గీకరణ, అర్థాలు రచయితల చట్రం; కొత్త వ్యవస్థ ప్రదర్శన కాదు.
- Zhang తదితరులు, Darwin Gödel Machine (మూడో సంచిక, మార్చి 12, 2026). అసలు అధ్యయనం coding benchmark మెరుగుదలను నివేదిస్తూ, archive నిర్వహణ, parent ఎంపిక స్థిరంగా ఉన్నాయని పేర్కొంటుంది.
- Shi తదితరులు, A-Evolve-Training (మూడో సంచిక, సెప్టెంబర్ 8, 2026). అసలు preprint నాలుగు post-training దశలు, విధాన సవరణ, నివేదించిన leaderboard ఫలితాన్ని వివరిస్తుంది. దాని లక్ష్యం, మూల worker వ్యవస్థను బయటి వారు నిర్ణయిస్తారు.
- Zhang తదితరులు, HyperAgents (2026). agent-నిర్మాణ విధానం బదిలీని అసలు అధ్యయనం పరీక్షించి, ఇక్కడ పేర్కొన్న 200-iteration పోలిక గణాంకపరంగా ముఖ్యమైనది కాదని నివేదిస్తుంది.
- Manuel Muñoz Plá చేసిన లోతైన పఠనం (సెప్టెంబర్ 18, 2026) సర్వేలోని ఉన్నత స్థాయి ఉదాహరణలు, ఆధారాల పరిమితులను పరిశీలిస్తుంది. అది పేపర్ పూర్వ సంచికను విశ్లేషించింది; పై వ్యాసం వాస్తవ వాదనలకు మూడో సంచిక, అసలు అధ్యయనాలను ఉపయోగిస్తుంది.
- South China Morning Post నివేదిక (సెప్టెంబర్ 14, 2026) సర్వేలోని ఐదు దశల మార్గసూచీ, AI పరిశోధన సందర్భాన్ని వివరిస్తుంది. ఇది ద్వితీయ కథనం; అధ్యయన ఫలితాలకు ఆధారం కాదు.
- The Rundown AI వివరణ (సెప్టెంబర్ 16, 2026) స్థాయిలను సంగ్రహించి, స్వయంచాలక AI పరిశోధనపై చర్చలో పేపర్ స్థానాన్ని వివరిస్తుంది. ఇది ద్వితీయ కథనం; పై వాస్తవ వాదనలకు పేపర్, అసలు అధ్యయనాలే ఆధారం.



