arXiv-এ ১০ সেপ্টেম্বর প্রকাশিত ও ২২ সেপ্টেম্বর সংশোধিত একটি সমীক্ষা AI ব্যবস্থার উন্নতিতে AI কতটা যুক্ত, তার পাঁচটি স্তর তুলে ধরেছে। এর শিরোনাম The Last AI Built by Humans একটি উচ্চাকাঙ্ক্ষার কথা বলে, লেখকদের প্রতিবেদিত কোনো ঘটনার নয়। তাদের প্রমাণ এমন সীমিত উদাহরণ পর্যন্ত পৌঁছায়, যেখানে ব্যবস্থা নিজস্ব উন্নয়ন-প্রক্রিয়ার কিছু অংশ সংশোধন করে। তবে এক প্রজন্মের পর আরেক প্রজন্মে আরও ভালো উত্তরসূরি নির্ভরযোগ্যভাবে তৈরি করতে পারে—এমন কোনো ব্যবস্থা এর মাধ্যমে প্রতিষ্ঠিত হয় না।

স্বয়ংক্রিয় AI গবেষণার দাবি বুঝতে এই পার্থক্যটি জরুরি। কোনো agent পরীক্ষা চালাতে, শেখা বিষয় সংরক্ষণ করতে এবং benchmark score বাড়াতে পারে; তবু লক্ষ্য নির্ধারণ, পরীক্ষা নিয়ন্ত্রণ এবং কোন পরিবর্তন টিকে থাকবে তা ঠিক করতে মানুষের ভূমিকা থাকতে পারে। আরও জোরালো দাবির জন্য প্রমাণ দরকার যে ব্যবস্থাটি তার পরবর্তী সংস্করণ তৈরির পদ্ধতি সংশোধন করেছে এবং ন্যায্য তুলনায় নতুন পদ্ধতিটি ভালো ফল দিয়েছে।

বড় পরিবর্তন

  • কী বদলেছে: গবেষকেরা এখন আরও নির্দিষ্টভাবে বর্ণনা করতে পারেন, AI উন্নয়নের চক্রের কতটা নিয়ন্ত্রণ কোনো ব্যবস্থা পায়—নির্ধারিত হালনাগাদ করা থেকে শুরু করে পরের হালনাগাদের পদ্ধতি বদলানো পর্যন্ত। নতুন সমীক্ষাটি বিদ্যমান গবেষণাকে সাজিয়েছে; স্বয়ংক্রিয়ভাবে উত্তরসূরি তৈরি করে এমন সম্পূর্ণ ব্যবস্থার ঘোষণা দেয়নি।
  • কেন গুরুত্বপূর্ণ: প্রতিটি নতুন agent পরেরটি তৈরিতে আরও দক্ষ—এ প্রমাণ না দিয়েও AI গবেষণাগার আরও বেশি পরীক্ষা স্বয়ংক্রিয় করতে পারে। এই পার্থক্য কর্মদক্ষতার দাবি গবেষকেরা কীভাবে ব্যাখ্যা করেন এবং কোথায় মানুষের পর্যালোচনা ও স্বাধীন পরীক্ষা রাখেন, তা প্রভাবিত করে।
  • কী নজরে রাখবেন: নির্ণায়ক প্রমাণ হবে এমন উত্তরসূরির ধারাবাহিকতা, যেখানে আগে থেকে পাওয়া ও সংশোধিত উন্নয়ন-পদ্ধতি ব্যবহার করে পরের ব্যবস্থাগুলো তৈরি হয়েছে; পুরোনো পদ্ধতির সঙ্গে সমতুল্য সম্পদে সেগুলোকে সুরক্ষিত কাজের ভিত্তিতে পরীক্ষা করা হয়েছে। পর্যালোচিত গবেষণা এই মানদণ্ডে পরিসংখ্যানগতভাবে নির্ভরযোগ্য সঞ্চিত উন্নতি এখনো প্রতিষ্ঠা করতে পারেনি।

উন্নয়ন-চক্রের নিয়ন্ত্রণ বোঝাতে পাঁচটি স্তর

সমীক্ষাটি প্রথমে একক কাজের সংশোধনকে—যাকে B0 বলা হয়েছে—দীর্ঘস্থায়ী উন্নতি থেকে আলাদা করে। কোনো উত্তর যাচাইয়ে উত্তীর্ণ না হওয়া পর্যন্ত মডেল সেটি সম্পাদনা করলে, ওই উত্তরটি উন্নত হয়েছে। পরিবর্তনটি পরের স্বতন্ত্র কাজেও কার্যকর না হলে ব্যবস্থাটি নিজে কোনো স্থায়ী হালনাগাদ অর্জন করেনি।

স্তর ১-এ মানুষ লক্ষ্য ও সাফল্যের পরীক্ষা বেছে নেন; AI হালনাগাদটি কার্যকর করে, যেমন মানুষের নির্ধারিত data quality নিয়ম প্রয়োগ করা। স্তর ২-এ AI নির্ধারিত লক্ষ্যের জন্য কৌশলও বেছে নেয়—যেমন coding agent কোথায় ব্যর্থ হচ্ছে তা শনাক্ত করে তার tool-এ পরিবর্তনের প্রস্তাব দেওয়া। লক্ষ্য ও গ্রহণযোগ্যতার পরীক্ষা তখনো ব্যবস্থার বাইরের কেউ ঠিক করেন।

স্তর ৩-এ পরবর্তী অভিজ্ঞতা কী হওয়া দরকার, তা বেছে নিতে ব্যবস্থা সাহায্য করে; যেমন চিহ্নিত দুর্বলতার জন্য অনুশীলনের কাজ তৈরি করা। স্তর ৪-এ চলমান ব্যবহার থেকে পাওয়া feedback-ও যুক্ত হয়: নতুন পরিস্থিতির মুখোমুখি হয়ে অনুমোদিত পরিবর্তন memory, rule বা component-এ সংরক্ষিত থাকে। সমীক্ষাটিতে বলা হয়েছে, দুই স্তরই feedback-এর মান এবং কোন পরিবর্তন টিকবে সে নিয়মের ওপর নির্ভরশীল।

স্তর ৫-এ সমীক্ষাটির মূল ধারণাটি উঠে আসে। AI তার পরবর্তী উন্নয়নকে পরিচালিত করার পদ্ধতিটি সংশোধন করে—যেমন তার search policy, evaluator, অথবা উত্তরসূরি প্রস্তাবকারী agent। সংশোধিত পদ্ধতিটি সংরক্ষণ করে পরের ধাপে ব্যবহার করতে হয়। এখানেও সামগ্রিক লক্ষ্য, সুরক্ষিত গ্রহণযোগ্যতা-পরীক্ষা এবং সম্পদ মানুষের নিয়ন্ত্রণে থাকতে পারে বলে প্রবন্ধে উল্লেখ করা হয়েছে। কোনো স্তর দায়িত্ব কতটা অর্পিত হয়েছে তা বোঝায়; অগ্রগতি বা সীমাহীন স্বায়ত্তশাসনের নিশ্চয়তা নয়।

বিদ্যমান ব্যবস্থা কোথায় সীমা টানে

এই Darwin Gödel Machine গবেষণায় বলা হয়েছে, coding agent-এর কয়েকটি সংস্করণ agent-এর code বদলেছে এবং সফল সংস্করণগুলো archive-এ জমা হয়েছে; এভাবে গবেষণার SWE-bench উপসেটে ফল ২০% থেকে ৫০%-এ উঠেছে। লেখকেরা আরও জানান, archive রক্ষণাবেক্ষণ এবং কোন সংস্করণ parent হবে তা বেছে নেওয়ার নিয়ম স্থির ছিল। বংশধরদের ফল ভালো হলেই বংশধর বাছাইয়ের প্রক্রিয়াটি নিজেই উন্নত হয়েছে—এ কথা প্রমাণিত হয় না, সমীক্ষাটি উদাহরণটি দিয়ে সেটিই দেখায়।

A-Evolve-Training স্তর ৫-এর আরও সীমিত একটি উদাহরণ দেয়। ৩০ বিলিয়ন parameter-এর একটি মডেলে post-training-এর চারটি ধাপ চালানো হয়েছিল। অভ্যন্তরীণ development score বহিঃস্থ leaderboard-এর ফলের সঙ্গে আর না মেলায়, meta-agent ফলাফল একত্র করে এবং পরবর্তী কর্মীদের গবেষণা-নীতিতে পরিবর্তন আনে। গবেষণায় শেষ score ০.৮৬ জানানো হয়েছে; ওই সময় মানুষের জমা দেওয়া সেরা ফল ছিল ০.৮৭। উত্তরাধিকারসূত্রে পাওয়া নীতিটি পরের পরীক্ষাগুলো বেছে নেওয়ার পদ্ধতি বদলেছিল। কর্মীদের মূল ব্যবস্থা ও প্রতিযোগিতার লক্ষ্য অপরিবর্তিত ছিল। এতে নির্ধারিত একটি project-এর ভেতরে সংশোধিত গবেষণা-পদ্ধতির ব্যবহার দেখা যায়; মডেল উন্নয়নের প্রতিটি অংশের স্বয়ংক্রিয় নিয়ন্ত্রণ নয়।

এই HyperAgents গবেষণায় পরীক্ষা করা হয়েছে, agent তৈরির উন্নত পদ্ধতি নতুন ক্ষেত্রে কাজে লাগে কি না। গণিতের নম্বর দেওয়ার কাজে ২০০ দফা চলার পর, স্থানান্তরিত উন্নতি দিয়ে শুরু করা একটি run test set-এ ০.৬৪০ score করে; প্রাথমিক agent থেকে শুরু করা run-এর score ছিল ০.৬১০। লেখকেরা জানান, এই পার্থক্য পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ ছিল না। ফলটি এক ক্ষেত্র থেকে অন্য ক্ষেত্রে পদ্ধতি স্থানান্তরের আরও অনুসন্ধানকে সমর্থন করে, তবে বিভিন্ন run-এ নির্ভরযোগ্যভাবে ক্রমবর্ধমান উন্নতি প্রমাণ করে না।

বেশি কাজ মানেই উন্নতি নয়

সমীক্ষাটি সংশোধিত পদ্ধতি আবার ব্যবহারের ধারণাকে—যাকে গাঠনিক পুনরাবৃত্তি বলা হয়েছে—কার্যকর পুনরাবৃত্তি থেকে আলাদা করে: সমতুল্য সম্পদ ও স্বাধীন মূল্যায়নে সংশোধিত পদ্ধতিটি আরও শক্তিশালী উত্তরসূরি তৈরি করে কি না। নাটকীয় শিরোনামটি পাঠককে যে বিষয় ইতিমধ্যে ঘটেছে বলে ধরে নিতে প্ররোচিত করে, সেটিই এই দ্বিতীয় পরীক্ষা।

কাজকর্মকে অগ্রগতি ভেবে ভুল করার একাধিক উপায় আছে। কোনো ব্যবস্থা খোঁজ চালাতে বেশি computing time খরচ করতে পারে, বারবার দেখা benchmark-এ অতিরিক্ত মানিয়ে নিতে পারে, অথবা এমন পরিবর্তন ধরে রাখতে পারে যা এক কাজে সাহায্য করে কিন্তু অন্য কাজে ক্ষতি করে। নিজের evaluator-ও বদলালে বেশি score নতুন মাপকাঠির ফল হতে পারে। তাই প্রবন্ধে নথি রাখার পরামর্শ আছে: কী সংশোধিত হয়েছে, সংশোধিত অংশটি সত্যিই পরের ধাপ পরিচালনা করেছে কি না, সমান সম্পদে পুরোনো অংশের সঙ্গে তুলনা, এবং স্বাধীন কাজে পরিবর্তন টিকে থাকা ও অন্যত্র প্রয়োগের পরীক্ষা।

লেখকেরা স্পষ্টভাবে বলেছেন, বর্তমান ফল উন্নয়নকারী ব্যবস্থা, evaluator ও গবেষণা-নীতিতে সীমিত পরিবর্তনের প্রমাণ দেয়; “সমতুল্য সম্পদে প্রজন্মের পর প্রজন্মে পরিসংখ্যানগতভাবে নির্ভরযোগ্য সঞ্চয় এখনো অমীমাংসিত।” “The Last AI Built by Humans” কথাটি তাদের কাঠামোর পেছনের চূড়ান্ত লক্ষ্য বোঝায়। সমীক্ষাটি সেই লক্ষ্যের দিকে অগ্রগতি যাচাইয়ের মানদণ্ড দেয়।

সূত্র ও আরও পড়ুন

  • Duan প্রমুখের The Last AI Built by Humans, সংস্করণ ৩ (২২ সেপ্টেম্বর ২০২৬)। মূল সমীক্ষাটি B0 ও ১–৫ স্তর সংজ্ঞায়িত করে, গাঠনিক ও কার্যকর পুনরাবৃত্তির পার্থক্য করে এবং প্রমাণের সীমা জানায়। এর শ্রেণিবিন্যাস ও ব্যাখ্যা লেখকদের কাঠামো; নতুন কোনো ব্যবস্থা প্রদর্শনের ফল নয়।
  • Zhang প্রমুখের Darwin Gödel Machine (সংস্করণ ৩, ১২ মার্চ ২০২৬)। মূল গবেষণায় coding benchmark-এর উন্নতির কথা আছে এবং archive রক্ষণাবেক্ষণ ও parent বাছাই অপরিবর্তনীয় ছিল বলে উল্লেখ করা হয়েছে।
  • Shi প্রমুখের A-Evolve-Training (সংস্করণ ৩, ৮ সেপ্টেম্বর ২০২৬)। মূল preprint-এ post-training-এর চারটি ধাপ, policy সংশোধন এবং উল্লিখিত leaderboard ফল রয়েছে। এর লক্ষ্য ও কর্মীদের মূল ব্যবস্থা বাইরে থেকে নির্ধারিত ছিল।
  • Zhang প্রমুখের HyperAgents (২০২৬)। মূল গবেষণায় agent-তৈরির পদ্ধতি অন্য ক্ষেত্রে প্রয়োগ পরীক্ষা করা হয়েছে এবং এখানে উদ্ধৃত ২০০-দফার তুলনায় পরিসংখ্যানগত তাৎপর্য ছিল না বলে জানানো হয়েছে।
  • Manuel Muñoz Plá-র বিস্তারিত পাঠ (১৮ সেপ্টেম্বর ২০২৬) সমীক্ষার উচ্চতর স্তরের উদাহরণ ও প্রমাণের সীমা বিশ্লেষণ করে। এতে প্রবন্ধটির আগের সংস্করণ পড়া হয়েছে; এখানে তথ্যগত দাবির জন্য সংস্করণ ৩ ও উদ্ধৃত মূল গবেষণা ব্যবহার করা হয়েছে।
  • South China Morning Post-এর প্রতিবেদন (১৪ সেপ্টেম্বর ২০২৬) সমীক্ষার পাঁচ-ধাপের রূপরেখা এবং AI গবেষণার প্রেক্ষাপট নিয়ে লিখেছে। এটি গৌণ প্রতিবেদন, গবেষণাগুলোর ফলের প্রমাণ নয়।
  • The Rundown AI-এর ব্যাখ্যা (১৬ সেপ্টেম্বর ২০২৬) স্তরগুলো সংক্ষেপে তুলে ধরে এবং স্বয়ংক্রিয় AI গবেষণা নিয়ে বিতর্কে প্রবন্ধটির অবস্থান ব্যাখ্যা করে। এটি গৌণ ব্যাখ্যা; ওপরের তথ্যগত গবেষণা-দাবির ভিত্তি মূল প্রবন্ধ ও গবেষণাগুলো।