Anthropic বলছে, কোম্পানির ভেতরে তারা যে AI গবেষণা ও উন্নয়ন (R&D) কাজ মাপে, তার 26% এখন Claude “AI leads” স্তরে সম্পন্ন করে। অর্থাৎ, উচ্চ-স্তরের prompt থেকে কোনো কাজের বেশির ভাগ ব্যবস্থা করতে পারে, তবে একজন মানুষ তত্ত্বাবধান করেন। Anthropic আরও বলছে, তাদের মাপা R&D কাজের কোনোটিই Claude পুরোপুরি স্বায়ত্তশাসিতভাবে করে না। এই পার্থক্যটি গুরুত্বপূর্ণ—কেমব্রিজের Programme on AI Science & Policy-এর একটি নতুন working paper-এ প্রশ্ন তোলা হয়েছে, AI নিজেই R&D-র আরও কাজ করলে শেষ পর্যন্ত AI-র অগ্রগতি দ্রুত ত্বরান্বিত হতে পারে কি না।

২০২৬ সালের সেপ্টেম্বর তারিখের এই paper-এ বিশ্ববিদ্যালয়, AI কোম্পানি ও নাগরিক সমাজের 22 জন লেখকের কাজ একত্র করা হয়েছে। এতে দ্রুত feedback loop সম্ভব বলে যুক্তি দেওয়া হয়েছে: সক্ষম system আরও ভালো system তৈরিতে সহায়তা করে, আর সেই system পরে আরও গবেষণা করে। মূল উপসংহার হলো, এটি একটি সম্ভাব্য পথ নিয়ে সতর্কতা এবং তা মাপার প্রয়োজনীয়তা। paper-টি এমন ত্বরণ শুরু হয়েছে বলে জানায় না।

মূল পরিবর্তন

  • কী বদলেছে: বিভিন্ন প্রতিষ্ঠান থেকে আসা একটি working paper AI-নেতৃত্বাধীন R&D-র প্রমাণ, এতে AI-র অগ্রগতি ত্বরান্বিত হওয়ার সম্ভাব্য শর্ত এবং frontier lab-গুলোর কাছ থেকে সরকার কী কী নির্দিষ্ট পরিমাপ চাইবে—এসব তুলে ধরেছে।
  • কেন গুরুত্বপূর্ণ: যে কোম্পানিগুলো AI system তৈরি করছে, তাদের ভেতরে গবেষণার আরও কাজ AI-কে দেওয়া হচ্ছে। এ delegation-এর প্রকাশ্য পরিমাপ এখনো খণ্ডিত, তাই পুরো গবেষণা প্রক্রিয়া কতটা দ্রুত হচ্ছে তা বোঝা কঠিন।
  • কী দেখার বিষয়: AI কতটা কাজ শেষ করে, তার অবদান পরের model-কে উন্নত করে কি না, এবং compute, experiment ও মানুষের review feedback loop-কে ধীর করে কি না—এসবের স্বাধীনভাবে যাচাই করা পরিমাপ।

প্রমাণ আছে, তবে মাপগুলো ভিন্ন প্রশ্নের উত্তর দেয়

Anthropic-এর সেপ্টেম্বরের পরিমাপ প্রতিবেদনে বলা হয়েছে, তাদের R&D কাজের যে অংশ “AI leads” স্তরে পড়ে, তা ২০২৬ সালের ফেব্রুয়ারির 1%-এর কম থেকে আগস্টে 26%-এ পৌঁছেছে। এই rating scale-এও ওই শ্রেণিতে একজন মানব তত্ত্বাবধায়ক থাকেন। Anthropic বলেছে, সূচকটি prototype; কাজের rating-এ তাদের নিজস্ব model সহায়তা করে; এবং কোম্পানিগুলোর মধ্যে এমন সংখ্যা তুলনার কোনো অভিন্ন পদ্ধতি নেই। কোনো মাপা কাজই পুরোপুরি স্বায়ত্তশাসিত নয়—Anthropic-এর এই বক্তব্যটিও 26% সংখ্যার পাশাপাশি বিবেচনা করা দরকার।

OpenAI-র সেপ্টেম্বরের বিবরণে গবেষকদের আরও coding agent ব্যবহার, দ্রুত code অবদান এবং বেশি experiment চালানোর কথা আছে। OpenAI বলছে, experiment-এর সংখ্যা agent-এর ব্যবহার বৃদ্ধির সঙ্গে সম্পর্কিত; একই সময়ে পাওয়া compute-ও বেড়েছে। গবেষণার অগ্রাধিকার এখনো মানুষই ঠিক করেন এবং কোন ফল নিয়ে এগোবেন তা বেছে নেন, কোম্পানির বক্তব্য। বেশি code ও experiment গবেষণায় কাজে লাগতে পারে, তবে তাতে আরও সক্ষম model তৈরির গতিও একই হারে বেড়েছে—এটি প্রতিষ্ঠিত হয় না।

স্বাধীন মূল্যায়ন প্রক্রিয়ার একটি অংশ মাপতে সাহায্য করে। METR-এর Time Horizon 1.1 হালনাগাদ দেখায়, পরীক্ষার তালিকায় আগের system-এর তুলনায় model দীর্ঘ সময়ের গবেষণা ও software task শেষ করতে পারে। দীর্ঘ task-এর ক্ষেত্রে METR বিস্তৃত অনিশ্চয়তার কথাও জানায়; অনেক task মানুষের কত সময় লাগত, তা অনুমান করে নির্ধারণ করা হয়েছিল। নির্বাচিত task-এ সক্ষমতা মাপে benchmark; কোনো AI lab-এর মোট গবেষণা উৎপাদনশীলতা নয়। 246টি task-এ কাজ করা 16 জন অভিজ্ঞ open-source developer-কে নিয়ে আলাদা randomized study-তে METR দেখেছে, ২০২৫ সালের শুরুর AI tool-এ access completion time 19% বাড়িয়েছে। সেপ্টেম্বর ২০২৬-এর frontier lab-এর জায়গায় সেই পুরোনো software কাজের পরিবেশকে বসানো যায় না; তবে tool ব্যবহার বা task benchmark একাই কেন উৎপাদনশীলতার প্রশ্নের মীমাংসা করে না, তা এটি দেখায়।

সম্ভাব্য feedback loop-এ রয়েছে কয়েকটি বাধা

CASP paper software-চালিত একটি loop-এ মনোযোগ দেয়। সমান্তরালে কাজ করে AI system কার্যকর গবেষক-দলকে বড় করতে পারে। সফল উন্নতি পরের system-কে আরও ভালো গবেষক বানাবে, ফলে আরও উন্নতি সম্ভব হবে। লেখকদের মতে, প্রাথমিক প্রমাণ এই কার্যপদ্ধতির সঙ্গে সামঞ্জস্যপূর্ণ; তাঁরা কয়েক বছরের মধ্যে R&D-র উল্লেখযোগ্য automation-কে সম্ভাব্য মনে করেন। আরও জোরালো “intelligence explosion”—যেখানে বছরের অগ্রগতি কয়েক মাসে বা তারও কম সময়ে সংকুচিত হবে—নির্ভর করে loop তার সীমাবদ্ধতাকে ছাড়িয়ে যেতে পারে কি না তার ওপর। এটি শর্তসাপেক্ষ দৃশ্যপট, কী ঘটবে তার মাপা পূর্বাভাস নয়।

গবেষণার অতিরিক্ত প্রচেষ্টা থেকে ক্রমহ্রাসমান ফল, সীমিত compute ও data, automation-এর জন্য এখনো কঠিন কাজ এবং ইচ্ছেমতো দ্রুত করা যায় না এমন প্রক্রিয়া—যেমন দীর্ঘ training run—paper-টি চারটি গুরুত্বপূর্ণ বাধা হিসেবে চিহ্নিত করেছে। এসবের কয়েকটির প্রমাণ মিশ্র বা পরোক্ষ বলে paper-এ উল্লেখ আছে; সময়সাপেক্ষ বাধাগুলো কতটা শক্তিশালী, সে বিষয়ে সরাসরি প্রমাণও নেই। পূর্ণ R&D automation-এর পরে প্রায় 1.5 বছরে অগ্রগতি দশ গুণ দ্রুত হওয়ার যে উদাহরণ দেওয়া হয়েছে, তা একটি model calculation: গবেষণার প্রচেষ্টা থেকে অনুমিত ফল একই থাকবে এবং নতুন বাধা দেখা দেবে না—এই শর্তে হিসাবটি করা। এটি পর্যবেক্ষিত ত্বরণ বা শর্তহীন কোনো তারিখ নয়।

অন্য গবেষণাও অনিশ্চয়তাটি আরও স্পষ্ট করে। ২০২৫ সালে চারটি AI lab নিয়ে করা গবেষণায়, Parker Whitfill ও Cheryl Wu দেখেছেন, গবেষণার compute কীভাবে model করা হয়েছে তার ওপর ফল আলাদা হয়। একটি specification-এ cognitive labor ও compute-কে পরস্পরের বিকল্প বলে মনে হয়েছে; frontier experiment-এর বাড়তি চাহিদা ধরে model-এ তারা পরস্পর-পরিপূরক। তথ্য ও model সীমিত—লেখকেরা এ সতর্কতাও দিয়েছেন। Toby Ord-এর আগস্ট ২০২৬-এর বিশ্লেষণে প্রতিটি উন্নতির cycle শেষ করতে কত সময় লাগে, সেটিকেও আরেকটি গুরুত্বপূর্ণ parameter বলা হয়েছে। এসব বিশ্লেষণ দ্রুত ত্বরণের সম্ভাবনা নাকচ করে না। এগুলো দেখায়, কত agent আছে বা তারা কত code লেখে—তা দেখে loop-এর গতি সরাসরি বোঝা যায় না।

লেখকেরা কী মাপতে চান

ক্যামব্রিজের লেখকেরা তিনটি নীতিগত অগ্রাধিকারের প্রস্তাব করেছেন: AI R&D-র automation সম্পর্কে তথ্য পাওয়া, সম্ভাব্য ত্বরণকে পরিচালনা ও সীমিত করার উপায় তৈরি এবং তার সম্ভাব্য প্রভাবের জন্য প্রস্তুতি। এর মধ্যে সবচেয়ে তাৎক্ষণিক ও পরীক্ষাযোগ্য হলো পরিমাপ। তাঁরা প্রস্তাব করেছেন—গবেষণায় AI-র অবদানের অংশ, algorithm-এর উন্নতির গতি, lab-গুলো মানুষ ও compute-এর মধ্যে কীভাবে ব্যয় ভাগ করে, AI system কোন গবেষণা-সিদ্ধান্তে প্রভাব ফেলে এবং ভেতরের agent-কে ঘিরে কী ঘটনা ঘটে—এসব জানানো হোক। AI R&D সক্ষমতার frontier-এ থাকা system-এর জন্য কঠোরতর শর্তসহ স্বাধীন audit-এর প্রস্তাবও তাঁরা দিয়েছেন।

আরও পরের কিছু প্রস্তাব—পরবর্তী deployment-এর আগে শর্ত, নির্দিষ্ট R&D workload থামানোর উপায় এবং আন্তর্জাতিক যাচাই—বাস্তবায়নে বড় ধরনের নকশা ও সমঝোতা লাগবে। দুর্বলভাবে নকশা করা ক্ষমতা কোনো একটি কোম্পানিকে সুবিধা দিতে পারে এবং উপকারী কাজ বিলম্বিত করতে পারে বলে paper-টি নিজেই সতর্ক করেছে। সম্ভাব্য সুফল ও গুরুতর ক্ষতির বিবরণ আগের শর্তসাপেক্ষ ত্বরণের ওপর নির্ভরশীল। চরম দৃশ্যপট ইতিমধ্যেই ঘটেছে ধরে না নিয়েও নীতিনির্ধারকেরা নিকট-মেয়াদি reporting-এর যুক্তি পরীক্ষা করতে পারেন।

এই প্রতিবেদন পড়ে কার্যকর প্রশ্নটি “AI হঠাৎ superintelligent হবে কি না”—এর চেয়ে সংকীর্ণ। lab-গুলো তুলনাযোগ্যভাবে দেখাতে পারে কি না যে গবেষণার কোন অংশে এখন AI নেতৃত্ব দিচ্ছে, কোন উন্নতি মানুষের মূল্যায়নে টিকে থাকছে এবং সেই উন্নতি কত দ্রুত পরবর্তী প্রজন্মের system-এ যাচ্ছে—প্রশ্নটি সেটাই। বিভিন্ন কোম্পানি জুড়ে এই প্রশ্নের উত্তর দেওয়ার মতো প্রকাশ্য প্রমাণ এখনো যথেষ্ট নয়।

সূত্র ও আরও পাঠ

  • ক্যামব্রিজের Programme on AI Science & Policy, সম্পূর্ণ working paper (সেপ্টেম্বর ২০২৬): লেখকদের যুক্তি, প্রমাণ পর্যালোচনা, model-এর অনুমান, সীমা ও নীতিগত প্রস্তাব। নথিটি working paper হিসেবে চিহ্নিত; প্রকাশ্য তথ্য থেকে বাইরের peer review হয়েছে বলে প্রতিষ্ঠা করা যায় না।
  • CASP executive summary: লেখকদের শর্তসাপেক্ষ দৃশ্যপট ও প্রস্তাবিত পদক্ষেপের সংক্ষিপ্ত বিবরণ। এটি লেখকদের একটি অংশ লিখেছেন।
  • Anthropic, AI-led R&D পরিমাপ: 26% “AI leads” সংখ্যার প্রাথমিক উৎস; সঙ্গে তত্ত্বাবধানের স্তর ও পদ্ধতিগত সীমাবদ্ধতা।
  • OpenAI, OpenAI-র ভেতরে research acceleration: agent ব্যবহার, experiment-এর সংখ্যা, মানুষের নির্দেশনা এবং গবেষণার অগ্রগতি মাপার সীমা নিয়ে কোম্পানির দেওয়া তথ্য।
  • METR, Time Horizon 1.1: task-ভিত্তিক স্বাধীন মূল্যায়ন এবং benchmark horizon কীভাবে অনুমান করা হয়, সে বিষয়ে অনিশ্চয়তা।
  • Whitfill ও Wu, compute bottleneck, এবং Ord, intelligence explosion-এর গতিবিদ্যা: recursive research loop-কে ধীর বা বদলে দিতে পারে এমন শর্তের পৃথক বিশ্লেষণ।