পৃথিবী স্থির নেই।RSS
BIG CHANGE.

Markdown সংস্করণ

AI-translated from English; not yet reviewed by a fluent editor.

# AI-এর স্ব-উন্নতির সমীক্ষা দেখায়, স্বয়ংক্রিয়তা ও আরও ভালো উত্তরসূরির মাঝের ফারাক

> AI-কে নিজেকে উন্নত করার কাজে কতটা নিয়ন্ত্রণ দেওয়া হয়েছে, তার পাঁচটি স্তর নতুন এক সমীক্ষায় সাজানো হয়েছে। বিদ্যমান ব্যবস্থায় সীমিত উন্নতির উদাহরণ আছে; পরপর প্রজন্ম জুড়ে নির্ভরযোগ্য উন্নতি এখনো প্রমাণিত নয়।

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

arXiv-এ [১০ সেপ্টেম্বর প্রকাশিত ও ২২ সেপ্টেম্বর সংশোধিত একটি সমীক্ষা](https://arxiv.org/html/2609.11873v3) AI ব্যবস্থার উন্নতিতে AI কতটা যুক্ত, তার পাঁচটি স্তর তুলে ধরেছে। এর শিরোনাম *The Last AI Built by Humans* একটি উচ্চাকাঙ্ক্ষার কথা বলে, লেখকদের প্রতিবেদিত কোনো ঘটনার নয়। তাদের প্রমাণ এমন সীমিত উদাহরণ পর্যন্ত পৌঁছায়, যেখানে ব্যবস্থা নিজস্ব উন্নয়ন-প্রক্রিয়ার কিছু অংশ সংশোধন করে। তবে এক প্রজন্মের পর আরেক প্রজন্মে আরও ভালো উত্তরসূরি নির্ভরযোগ্যভাবে তৈরি করতে পারে—এমন কোনো ব্যবস্থা এর মাধ্যমে প্রতিষ্ঠিত হয় না।

স্বয়ংক্রিয় AI গবেষণার দাবি বুঝতে এই পার্থক্যটি জরুরি। কোনো agent পরীক্ষা চালাতে, শেখা বিষয় সংরক্ষণ করতে এবং benchmark score বাড়াতে পারে; তবু লক্ষ্য নির্ধারণ, পরীক্ষা নিয়ন্ত্রণ এবং কোন পরিবর্তন টিকে থাকবে তা ঠিক করতে মানুষের ভূমিকা থাকতে পারে। আরও জোরালো দাবির জন্য প্রমাণ দরকার যে ব্যবস্থাটি তার পরবর্তী সংস্করণ তৈরির *পদ্ধতি* সংশোধন করেছে এবং ন্যায্য তুলনায় নতুন পদ্ধতিটি ভালো ফল দিয়েছে।

## বড় পরিবর্তন

- **কী বদলেছে:** গবেষকেরা এখন আরও নির্দিষ্টভাবে বর্ণনা করতে পারেন, AI উন্নয়নের চক্রের কতটা নিয়ন্ত্রণ কোনো ব্যবস্থা পায়—নির্ধারিত হালনাগাদ করা থেকে শুরু করে পরের হালনাগাদের পদ্ধতি বদলানো পর্যন্ত। নতুন সমীক্ষাটি বিদ্যমান গবেষণাকে সাজিয়েছে; স্বয়ংক্রিয়ভাবে উত্তরসূরি তৈরি করে এমন সম্পূর্ণ ব্যবস্থার ঘোষণা দেয়নি।
- **কেন গুরুত্বপূর্ণ:** প্রতিটি নতুন agent পরেরটি তৈরিতে আরও দক্ষ—এ প্রমাণ না দিয়েও AI গবেষণাগার আরও বেশি পরীক্ষা স্বয়ংক্রিয় করতে পারে। এই পার্থক্য কর্মদক্ষতার দাবি গবেষকেরা কীভাবে ব্যাখ্যা করেন এবং কোথায় মানুষের পর্যালোচনা ও স্বাধীন পরীক্ষা রাখেন, তা প্রভাবিত করে।
- **কী নজরে রাখবেন:** নির্ণায়ক প্রমাণ হবে এমন উত্তরসূরির ধারাবাহিকতা, যেখানে আগে থেকে পাওয়া ও সংশোধিত উন্নয়ন-পদ্ধতি ব্যবহার করে পরের ব্যবস্থাগুলো তৈরি হয়েছে; পুরোনো পদ্ধতির সঙ্গে সমতুল্য সম্পদে সেগুলোকে সুরক্ষিত কাজের ভিত্তিতে পরীক্ষা করা হয়েছে। পর্যালোচিত গবেষণা এই মানদণ্ডে পরিসংখ্যানগতভাবে নির্ভরযোগ্য সঞ্চিত উন্নতি এখনো প্রতিষ্ঠা করতে পারেনি।

## উন্নয়ন-চক্রের নিয়ন্ত্রণ বোঝাতে পাঁচটি স্তর

সমীক্ষাটি প্রথমে একক কাজের সংশোধনকে—যাকে B0 বলা হয়েছে—দীর্ঘস্থায়ী উন্নতি থেকে আলাদা করে। কোনো উত্তর যাচাইয়ে উত্তীর্ণ না হওয়া পর্যন্ত মডেল সেটি সম্পাদনা করলে, ওই উত্তরটি উন্নত হয়েছে। পরিবর্তনটি পরের স্বতন্ত্র কাজেও কার্যকর না হলে ব্যবস্থাটি নিজে কোনো স্থায়ী হালনাগাদ অর্জন করেনি।

স্তর **১**-এ মানুষ লক্ষ্য ও সাফল্যের পরীক্ষা বেছে নেন; AI হালনাগাদটি কার্যকর করে, যেমন মানুষের নির্ধারিত data quality নিয়ম প্রয়োগ করা। স্তর **২**-এ AI নির্ধারিত লক্ষ্যের জন্য কৌশলও বেছে নেয়—যেমন coding agent কোথায় ব্যর্থ হচ্ছে তা শনাক্ত করে তার tool-এ পরিবর্তনের প্রস্তাব দেওয়া। লক্ষ্য ও গ্রহণযোগ্যতার পরীক্ষা তখনো ব্যবস্থার বাইরের কেউ ঠিক করেন।

স্তর **৩**-এ পরবর্তী অভিজ্ঞতা কী হওয়া দরকার, তা বেছে নিতে ব্যবস্থা সাহায্য করে; যেমন চিহ্নিত দুর্বলতার জন্য অনুশীলনের কাজ তৈরি করা। স্তর **৪**-এ চলমান ব্যবহার থেকে পাওয়া feedback-ও যুক্ত হয়: নতুন পরিস্থিতির মুখোমুখি হয়ে অনুমোদিত পরিবর্তন memory, rule বা component-এ সংরক্ষিত থাকে। সমীক্ষাটিতে বলা হয়েছে, দুই স্তরই feedback-এর মান এবং কোন পরিবর্তন টিকবে সে নিয়মের ওপর নির্ভরশীল।

**স্তর** ৫-এ সমীক্ষাটির মূল ধারণাটি উঠে আসে। AI তার *পরবর্তী* উন্নয়নকে পরিচালিত করার পদ্ধতিটি সংশোধন করে—যেমন তার search policy, evaluator, অথবা উত্তরসূরি প্রস্তাবকারী agent। সংশোধিত পদ্ধতিটি সংরক্ষণ করে পরের ধাপে ব্যবহার করতে হয়। এখানেও সামগ্রিক লক্ষ্য, সুরক্ষিত গ্রহণযোগ্যতা-পরীক্ষা এবং সম্পদ মানুষের নিয়ন্ত্রণে থাকতে পারে বলে প্রবন্ধে উল্লেখ করা হয়েছে। কোনো স্তর দায়িত্ব কতটা অর্পিত হয়েছে তা বোঝায়; অগ্রগতি বা সীমাহীন স্বায়ত্তশাসনের নিশ্চয়তা নয়।

## বিদ্যমান ব্যবস্থা কোথায় সীমা টানে

এই [Darwin Gödel Machine গবেষণায়](https://arxiv.org/html/2505.22954) বলা হয়েছে, coding agent-এর কয়েকটি সংস্করণ agent-এর code বদলেছে এবং সফল সংস্করণগুলো archive-এ জমা হয়েছে; এভাবে গবেষণার SWE-bench উপসেটে ফল ২০% থেকে ৫০%-এ উঠেছে। লেখকেরা আরও জানান, archive রক্ষণাবেক্ষণ এবং কোন সংস্করণ parent হবে তা বেছে নেওয়ার নিয়ম স্থির ছিল। বংশধরদের ফল ভালো হলেই বংশধর বাছাইয়ের প্রক্রিয়াটি নিজেই উন্নত হয়েছে—এ কথা প্রমাণিত হয় না, সমীক্ষাটি উদাহরণটি দিয়ে সেটিই দেখায়।

[A-Evolve-Training](https://arxiv.org/html/2606.20657) স্তর ৫-এর আরও সীমিত একটি উদাহরণ দেয়। ৩০ বিলিয়ন parameter-এর একটি মডেলে post-training-এর চারটি ধাপ চালানো হয়েছিল। অভ্যন্তরীণ development score বহিঃস্থ leaderboard-এর ফলের সঙ্গে আর না মেলায়, meta-agent ফলাফল একত্র করে এবং পরবর্তী কর্মীদের গবেষণা-নীতিতে পরিবর্তন আনে। গবেষণায় শেষ score ০.৮৬ জানানো হয়েছে; ওই সময় মানুষের জমা দেওয়া সেরা ফল ছিল ০.৮৭। উত্তরাধিকারসূত্রে পাওয়া নীতিটি পরের পরীক্ষাগুলো বেছে নেওয়ার পদ্ধতি বদলেছিল। কর্মীদের মূল ব্যবস্থা ও প্রতিযোগিতার লক্ষ্য অপরিবর্তিত ছিল। এতে নির্ধারিত একটি project-এর ভেতরে সংশোধিত গবেষণা-পদ্ধতির ব্যবহার দেখা যায়; মডেল উন্নয়নের প্রতিটি অংশের স্বয়ংক্রিয় নিয়ন্ত্রণ নয়।

এই [HyperAgents গবেষণায়](https://arxiv.org/html/2603.19461) পরীক্ষা করা হয়েছে, agent তৈরির উন্নত পদ্ধতি নতুন ক্ষেত্রে কাজে লাগে কি না। গণিতের নম্বর দেওয়ার কাজে ২০০ দফা চলার পর, স্থানান্তরিত উন্নতি দিয়ে শুরু করা একটি run test set-এ ০.৬৪০ score করে; প্রাথমিক agent থেকে শুরু করা run-এর score ছিল ০.৬১০। লেখকেরা জানান, এই পার্থক্য পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ ছিল না। ফলটি এক ক্ষেত্র থেকে অন্য ক্ষেত্রে পদ্ধতি স্থানান্তরের আরও অনুসন্ধানকে সমর্থন করে, তবে বিভিন্ন run-এ নির্ভরযোগ্যভাবে ক্রমবর্ধমান উন্নতি প্রমাণ করে না।

## বেশি কাজ মানেই উন্নতি নয়

সমীক্ষাটি সংশোধিত পদ্ধতি আবার ব্যবহারের ধারণাকে—যাকে *গাঠনিক পুনরাবৃত্তি* বলা হয়েছে—*কার্যকর পুনরাবৃত্তি* থেকে আলাদা করে: সমতুল্য সম্পদ ও স্বাধীন মূল্যায়নে সংশোধিত পদ্ধতিটি আরও শক্তিশালী উত্তরসূরি তৈরি করে কি না। নাটকীয় শিরোনামটি পাঠককে যে বিষয় ইতিমধ্যে ঘটেছে বলে ধরে নিতে প্ররোচিত করে, সেটিই এই দ্বিতীয় পরীক্ষা।

কাজকর্মকে অগ্রগতি ভেবে ভুল করার একাধিক উপায় আছে। কোনো ব্যবস্থা খোঁজ চালাতে বেশি computing time খরচ করতে পারে, বারবার দেখা benchmark-এ অতিরিক্ত মানিয়ে নিতে পারে, অথবা এমন পরিবর্তন ধরে রাখতে পারে যা এক কাজে সাহায্য করে কিন্তু অন্য কাজে ক্ষতি করে। নিজের evaluator-ও বদলালে বেশি score নতুন মাপকাঠির ফল হতে পারে। তাই প্রবন্ধে নথি রাখার পরামর্শ আছে: কী সংশোধিত হয়েছে, সংশোধিত অংশটি সত্যিই পরের ধাপ পরিচালনা করেছে কি না, সমান সম্পদে পুরোনো অংশের সঙ্গে তুলনা, এবং স্বাধীন কাজে পরিবর্তন টিকে থাকা ও অন্যত্র প্রয়োগের পরীক্ষা।

লেখকেরা স্পষ্টভাবে বলেছেন, বর্তমান ফল উন্নয়নকারী ব্যবস্থা, evaluator ও গবেষণা-নীতিতে সীমিত পরিবর্তনের প্রমাণ দেয়; “সমতুল্য সম্পদে প্রজন্মের পর প্রজন্মে পরিসংখ্যানগতভাবে নির্ভরযোগ্য সঞ্চয় এখনো অমীমাংসিত।” “The Last AI Built by Humans” কথাটি তাদের কাঠামোর পেছনের চূড়ান্ত লক্ষ্য বোঝায়। সমীক্ষাটি সেই লক্ষ্যের দিকে অগ্রগতি যাচাইয়ের মানদণ্ড দেয়।

## সূত্র ও আরও পড়ুন

- [Duan প্রমুখের *The Last AI Built by Humans*, সংস্করণ ৩](https://arxiv.org/html/2609.11873v3) (২২ সেপ্টেম্বর ২০২৬)। মূল সমীক্ষাটি B0 ও ১–৫ স্তর সংজ্ঞায়িত করে, গাঠনিক ও কার্যকর পুনরাবৃত্তির পার্থক্য করে এবং প্রমাণের সীমা জানায়। এর শ্রেণিবিন্যাস ও ব্যাখ্যা লেখকদের কাঠামো; নতুন কোনো ব্যবস্থা প্রদর্শনের ফল নয়।
- [Zhang প্রমুখের *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (সংস্করণ ৩, ১২ মার্চ ২০২৬)। মূল গবেষণায় coding benchmark-এর উন্নতির কথা আছে এবং archive রক্ষণাবেক্ষণ ও parent বাছাই অপরিবর্তনীয় ছিল বলে উল্লেখ করা হয়েছে।
- [Shi প্রমুখের *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (সংস্করণ ৩, ৮ সেপ্টেম্বর ২০২৬)। মূল preprint-এ post-training-এর চারটি ধাপ, policy সংশোধন এবং উল্লিখিত leaderboard ফল রয়েছে। এর লক্ষ্য ও কর্মীদের মূল ব্যবস্থা বাইরে থেকে নির্ধারিত ছিল।
- [Zhang প্রমুখের *HyperAgents*](https://arxiv.org/html/2603.19461) (২০২৬)। মূল গবেষণায় agent-তৈরির পদ্ধতি অন্য ক্ষেত্রে প্রয়োগ পরীক্ষা করা হয়েছে এবং এখানে উদ্ধৃত ২০০-দফার তুলনায় পরিসংখ্যানগত তাৎপর্য ছিল না বলে জানানো হয়েছে।
- [Manuel Muñoz Plá-র বিস্তারিত পাঠ](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (১৮ সেপ্টেম্বর ২০২৬) সমীক্ষার উচ্চতর স্তরের উদাহরণ ও প্রমাণের সীমা বিশ্লেষণ করে। এতে প্রবন্ধটির আগের সংস্করণ পড়া হয়েছে; এখানে তথ্যগত দাবির জন্য সংস্করণ ৩ ও উদ্ধৃত মূল গবেষণা ব্যবহার করা হয়েছে।
- [South China Morning Post-এর প্রতিবেদন](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (১৪ সেপ্টেম্বর ২০২৬) সমীক্ষার পাঁচ-ধাপের রূপরেখা এবং AI গবেষণার প্রেক্ষাপট নিয়ে লিখেছে। এটি গৌণ প্রতিবেদন, গবেষণাগুলোর ফলের প্রমাণ নয়।
- [The Rundown AI-এর ব্যাখ্যা](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (১৬ সেপ্টেম্বর ২০২৬) স্তরগুলো সংক্ষেপে তুলে ধরে এবং স্বয়ংক্রিয় AI গবেষণা নিয়ে বিতর্কে প্রবন্ধটির অবস্থান ব্যাখ্যা করে। এটি গৌণ ব্যাখ্যা; ওপরের তথ্যগত গবেষণা-দাবির ভিত্তি মূল প্রবন্ধ ও গবেষণাগুলো।

## Sources

- [Duan প্রমুখ: The Last AI Built by Humans, সংস্করণ ৩](https://arxiv.org/html/2609.11873v3) — স্বায়ত্তশাসনের স্তর ও গবেষণার উদাহরণ নিয়ে মূল সমীক্ষা। গাঠনিক ও কার্যকর পুনরাবৃত্তির পার্থক্য সংজ্ঞায়িত করে এবং সমতুল্য সম্পদে প্রজন্মের পর প্রজন্ম নির্ভরযোগ্য সঞ্চিত উন্নতি এখনো অমীমাংসিত বলে। নতুন স্বয়ংক্রিয় AI প্রদর্শন করে না।
- [arXiv submission history for 2609.11873](https://arxiv.org/abs/2609.11873) — ১০ সেপ্টেম্বরের সংস্করণ ১ ও ২২ সেপ্টেম্বরের সংস্করণ ৩ নথিবদ্ধ করে; Yi Duan ও ৩৪ সহলেখকের নাম জানায়।
- [Zhang প্রমুখ: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — মূল গবেষণায় SWE-bench উপসেটে ২০% থেকে ৫০% ফলের কথা আছে এবং বলা হয়েছে, archive রক্ষণাবেক্ষণ ও parent বাছাই ব্যবস্থা বদলাতে পারে না।
- [Shi প্রমুখ: A-Evolve-Training](https://arxiv.org/html/2606.20657) — মূল preprint-এ post-training-এর চারটি স্বয়ংক্রিয় ধাপ, সংরক্ষিত সংশোধিত গবেষণা-নীতি এবং উল্লিখিত তুলনার তারিখে ০.৮৬ বনাম ০.৮৭ leaderboard score আছে। কর্মীদের মূল ব্যবস্থা ও লক্ষ্য স্থির ছিল।
- [Zhang প্রমুখ: HyperAgents](https://arxiv.org/html/2603.19461) — মূল গবেষণায় গণিতের নম্বর-দেওয়ার test set-এ ২০০-দফার স্থানান্তর তুলনায় ০.৬৪০ বনাম ০.৬১০ ফল জানানো হয়েছে; পার্থক্যটি পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ নয়।
- [Manuel Muñoz Plá: The last AI built by humans, read in depth](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — সমীক্ষার আগের সংস্করণের স্বাধীন বিস্তারিত পাঠ। প্রেক্ষাপটের জন্য দেওয়া; এই নিবন্ধের গবেষণা-সংক্রান্ত দাবির ভিত্তি মূল গবেষণাপত্রগুলো।
- [South China Morning Post: Chinese researchers chart 5-stage path](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — এই সমীক্ষা ও গবেষণার প্রেক্ষাপট নিয়ে গৌণ প্রতিবেদন। পরীক্ষার ফলের প্রাথমিক প্রমাণ হিসেবে নয়, আরও পড়ার জন্য দেওয়া।
- [The Rundown AI: Chinese researchers outline AI that can build its successors](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — প্রবন্ধের পাঁচটি স্তর ও বৃহত্তর বিতর্কের গৌণ ব্যাখ্যা। নিবন্ধের তথ্যগত গবেষণা-দাবির ভিত্তি মূল গবেষণাপত্রগুলো।
BIG CHANGE নিউজলেটার

বড় ছবিটা। আপনার গতিতে।

এআই ও রোবোটিক্স নিয়ে সাম্প্রতিক খবর, নজর রাখার মতো পরিবর্তন এবং কাজে লাগানোর ব্যবহারিক ধারণা। দৈনিক ব্রিফিং, সাপ্তাহিক সংকলন বা মাসিক দৃষ্টিভঙ্গি বেছে নিন।