Atria Dawn Preview তৈরির দলটি AI ব্যবহার করেছে ৭৩৯টি কাজের মধ্যে ৭১৩টিতে—যেসব কাজে অংশগ্রহণকারীরা AI ব্যবহারের বিষয়ে স্পষ্ট উত্তর দিয়েছেন। দলের নিজেদের উন্নয়নকাজ নিয়ে করা গবেষণায়, পদ্ধতি বা parameter নিয়ে নথিভুক্ত সিদ্ধান্তের ৮৫.৫ শতাংশে চূড়ান্ত পছন্দটি মানুষ করেছেন। গবেষণাপত্রের শিরোনামে “agentic superintelligence” কথাটি থাকলেও, task record-গুলো দলটির কাজ ভাগ করার আরও নির্দিষ্ট চিত্র দেয়।

এই প্রিপ্রিন্ট জমা পড়ে ২০২৬ সালের ১৪ সেপ্টেম্বর এবং সংশোধিত হয় ১৭ সেপ্টেম্বর। একটি model development প্রকল্পের ৫৬ জন অংশগ্রহণকারীর ৭৬৯টি task record এবং agent log থেকে গবেষণাটি তৈরি। লেখকেরা নিজেদের Atria Dawn Preview তৈরিতে agent ব্যবহারের একটি case study হিসেবে record-গুলো বর্ণনা করেছেন।

মূল পরিবর্তন

  • কী বদলেছে: একটি model development প্রকল্পে agent ও মানুষের মধ্যে নির্দিষ্ট গবেষণাসংক্রান্ত সিদ্ধান্ত কীভাবে ভাগ হয়েছে, দলটি তা নথিভুক্ত করেছে; প্রস্তাব দেওয়া আর চূড়ান্ত সিদ্ধান্ত নেওয়াকে আলাদা করে দেখেছে।
  • কেন গুরুত্বপূর্ণ: কোনো agent পদ্ধতি তৈরি করতে বা সংশোধন করতে পারে, অথচ গবেষক তখনও লক্ষ্য বেছে নেন, পদ্ধতি অনুমোদন করেন এবং ফল কাজের মানদণ্ড পূরণ করেছে কি না স্থির করেন। শুধু agent-এর কাজ গুনলে এই ভিন্ন ভূমিকাগুলো আড়াল হয়।
  • যা নজরে রাখা দরকার: এগুলো একটি দলের কাজের পর্যবেক্ষণ; সিদ্ধান্তের বেশির ভাগ প্রমাণই অংশগ্রহণকারীরা দিয়েছেন। অন্য AI lab-গুলো কীভাবে সিদ্ধান্ত ভাগ করে বা agent-রা নিজের successor-কে স্বয়ংক্রিয়ভাবে তৈরি করতে পারে কি না, ফলাফল তা প্রতিষ্ঠা করে না।

agent-রা অনেক পদ্ধতি দিয়েছে; বেশির ভাগ বেছে নিয়েছেন মানুষ

execution ভূমিকার অংশগ্রহণকারীদের পদ্ধতি বা parameter নিয়ে নথিভুক্ত ৫৬৭টি সিদ্ধান্তে পার্থক্যটি সবচেয়ে স্পষ্ট। গবেষণাপত্রে বলা হয়েছে, এসব সিদ্ধান্তের ৬৪.৬ শতাংশে AI কোনো বিকল্প প্রস্তাব করেছে। একক বৃহত্তম শ্রেণি—৫৫.৪ শতাংশ—ছিল “AI প্রস্তাব করে, মানুষ বেছে নেয়।” ৮৫.৫ শতাংশ সিদ্ধান্তে চূড়ান্ত পছন্দ মানুষ করেছেন; AI করেছে ৯.২ শতাংশে। বাকি সিদ্ধান্তগুলো বাইরের কোনো সীমাবদ্ধতার কারণে হয়েছে বলে নথিভুক্ত।

প্রশ্নভেদে সিদ্ধান্তের ভাগ আলাদা ছিল। লক্ষ্য বা কাজের পরিধি নিয়ে ৬০৩টি সিদ্ধান্তের ৯৩.৪ শতাংশে এবং গ্রহণযোগ্যতার মানদণ্ড নিয়ে ৫৪২টি সিদ্ধান্তের ৮১.৯ শতাংশে চূড়ান্ত পছন্দ মানুষ করেছেন। লক্ষ্য নির্ধারণের তুলনায় পদ্ধতি নিয়ে AI-এর প্রস্তাব অনেক বেশি ছিল। গবেষণাপত্রের চিত্রে আরও দেখা যায়, AI ছাড়া কাজটি করা সম্ভব নয় বলে অংশগ্রহণকারীরা যে ১৫১টি task চিহ্নিত করেছেন, তার ১৪৪টিতে চূড়ান্ত লক্ষ্য মানুষ বেছে নিয়েছেন।

এই শতাংশগুলো অংশগ্রহণকারীদের জানানো সিদ্ধান্তের ভূমিকা বর্ণনা করে; প্রতিটি মানবিক পছন্দ যথাযথ তথ্যের ভিত্তিতে হয়েছিল কি না তা মাপে না। লেখকেরা এই ধারা ব্যাখ্যা করেছেন এভাবে: গবেষকেরা কাজের দিকনির্দেশ দিয়েছেন, আর agent-রা মানুষের ঠিক করে দেওয়া সীমার মধ্যে বিকল্প তৈরি করেছে। এই case study-তে প্রকল্পটির কাজ agent-দের হাতে ছেড়ে দেওয়া হলেও চূড়ান্ত কর্তৃত্ব মানুষের কাছেই ছিল বলে নথিভুক্ত হয়েছে।

মানুষের প্রতিক্রিয়ায় agent-রা প্রায়ই আবার কাজে ফিরেছে

প্রতিটি task-এ সবচেয়ে গুরুত্বপূর্ণ অসুবিধাটি অংশগ্রহণকারীদের মনে করে জানাতে বলা হয়েছিল। অসুবিধা ও প্রতিক্রিয়া নথিভুক্ত ৫৮৮টি task-এর মধ্যে ৪৪৭টিতে, অর্থাৎ ৭৬.০ শতাংশে, মানুষের সহায়তায় কাজ এগিয়েছে; ১৩৫টিতে, অর্থাৎ ২৩.০ শতাংশে, agent নিজেই সামলে নিয়েছে। প্রধান সহায়তাগুলোর মধ্যে ছিল বাড়তি প্রেক্ষাপট বা স্পষ্ট করে দেওয়া শর্ত (২০৭টি task) এবং সমস্যার কারণ শনাক্ত করা বা পদ্ধতি বদলানো (২০৪টি)। চারটি task-এ মানুষ মূল কাজের দায়িত্ব নিজের হাতে নিয়েছেন।

output-এর record-এও কাজের ভাগাভাগির এমন চিত্র দেখা যায়। প্রধান AI output-এর পরিণতি জানা ৬২৭টি task-এর মধ্যে ৩৫৪টিতে উল্লেখযোগ্য সংশোধন দরকার হয়েছিল। সংশোধিত এই অংশে ৭৫.৪ শতাংশ ক্ষেত্রে মানুষের প্রতিক্রিয়ার পর agent-ই পরিবর্তন করেছে; ১৯.২ শতাংশে মানুষ সরাসরি সম্পাদনা করেছেন। গবেষকেরা নিজে সম্পাদনা না করেও পরিবর্তনের নির্দেশ দিতে পেরেছেন।

উন্নয়নের সময় log-এর একটি পরিমাপও বেড়েছে: ২২ জনের দলে, প্রতি মানব prompt-এ log-করা agent action-এর দৈনিক মধ্যক ৭ আগস্ট ১১.০ থেকে ৪ সেপ্টেম্বর ২৮.৫-এ পৌঁছায়। হিসাবটিতে আগের সাত দিনের window ব্যবহার করা হয়েছে; প্রতিদিন ২১ বা ২২ জনের বৈধ অনুপাত ছিল। এটি কার্যকলাপ গোনে, agent-এর কর্তৃত্ব বা output-এর মান নয়।

task record থেকে কী জানা যায়

AI ছাড়া একই পরিধি, মান ও অন্যান্য সম্পদ নিয়ে নিজের task-এর অংশ শেষ করতে পারতেন কি না, অংশগ্রহণকারীদের তা অনুমান করতে বলা হয়েছিল। ব্যবহারযোগ্য উত্তর পাওয়া AI-সহায়তায় সম্পন্ন ৪৫৫টি task-এর মধ্যে তাঁরা ১৫১টি, অর্থাৎ ৩৩.২ শতাংশ, AI ছাড়া করা সম্ভব নয় বলে মনে করেছেন। এটি অংশগ্রহণকারীদের নিজেদের জানানো কাল্পনিক বিকল্প; দলটি agent ছাড়া একই task আবার করে দেখেনি। ভিন্ন শর্তে কাজগুলো একেবারেই শুরু করা হতো না—এমন সিদ্ধান্তও এটি দেয় না।

৫৬ জন অংশগ্রহণকারী বা ৭৬৯টি task record কীভাবে নমুনা হিসেবে নেওয়া হয়েছে, গবেষণাপত্রে তার পদ্ধতি নেই। প্রকাশ্য link-গুলোতেও task-ভিত্তিক উত্তর বা agent log নেই, তাই স্বাধীনভাবে নতুন করে বিশ্লেষণ করা যায় না। benchmark-এ Atria Dawn Preview model হিসেবে মূল্যায়িত হয়েছে; কোনো AI ব্যবস্থা স্বয়ংক্রিয়ভাবে নিজের successor-কে উন্নত করেছে, তা এতে দেখানো হয়নি। কোন কাজ agent-কে দেওয়া হবে তা ঠিক করতে দলগুলোর জন্য প্রতিবেদনটির সীমিত কিন্তু নির্দিষ্ট শিক্ষা হলো: এই প্রকল্পে agent-রা প্রায়ই কাজের প্রস্তাব ও সংশোধন করেছে, আর অংশগ্রহণকারীদের ভাষ্য অনুযায়ী লক্ষ্য, পদ্ধতি ও গ্রহণযোগ্যতার বেশির ভাগ সিদ্ধান্ত মানুষই ধরে রেখেছেন।