সেপ্টেম্বরের arXiv preprint, “In-Context Robot Learning with VLM Agents”-এ GPT-Policy পরিচয় করানো হয়েছে। এটি demonstration, image ও কাজের আগের interaction history ব্যবহার করে একটি স্থির vision-language model-কে robot tool-এর সঙ্গে যুক্ত করে। পরীক্ষায় robot-arm task এবং mobile exploration ছিল, কিন্তু আলাদা GPT-6 Astra ও Unitree G1-সংক্রান্ত Reddit দাবি যাচাই করে না।

মূল পরিবর্তন

  • কী বদলেছে: GPT-Policy একটি সাধারণ vision-language model-কে demonstration ও বর্তমান camera view থেকে কাঠামোবদ্ধ robot-tool request তৈরির উপায় দেয়। এরপর model-এর task-specific weight হালনাগাদ না করেই কাজের ফলের feedback নিয়ে পরের action বেছে নেওয়া যায়।
  • কেন গুরুত্বপূর্ণ: এই পদ্ধতিতে বিস্তৃত visual reasoning-কে চলাচলের পরীক্ষা ও বাস্তব action সম্পাদন থেকে আলাদা রাখা হয়। লেখকদের সীমিত trial-এ কিছু task-এ বাড়তি context সাহায্য করেছে; তবে স্পর্শ-সংবেদনশীল action-এর জন্য কখনো সামঞ্জস্যপূর্ণ robot-action reference দরকার হয়েছে।
  • যা নজরে রাখা দরকার: প্রতিটি condition-এ মাত্র তিনটি trial করা হয়েছে। গবেষণাপত্রে ধীরগতির, ব্যর্থতার ঝুঁকিযুক্ত চালনা—এর মধ্যে arm collision-ও—বর্ণনা করা হয়েছে। মানুষের আশপাশে কাজ করা রোবট সম্পর্কে ফল থেকে বেশি কিছু বলার আগে পুনরুৎপাদন, বড় evaluation এবং স্বাধীন safety control গুরুত্বপূর্ণ।

GPT-Policy কী করে

গবেষণাপত্রটি ১৬ সেপ্টেম্বর arXiv-এ জমা দেওয়া হয়। fine-tuning বা task-specific model parameter না বদলে সাধারণ vision-language model উদাহরণ ও feedback ব্যবহার করে নতুন প্রাথমিক অবস্থা থেকে কাজ করতে পারে কি না, সেটিই এতে পরীক্ষা করা হয়েছে। লেখকেরা framework-টির নাম দিয়েছেন GPT-Policy এবং মূল্যায়ন করা model-গুলোর মধ্যে GPT-6 Astra-র কথাও বলেছেন।

ব্যবস্থাটি কয়েক ধরনের context একত্র করে: কাজের নির্দেশ, বর্তমান camera view ও অবস্থা, এবং ঐচ্ছিকভাবে মানুষের demonstration video, action reference-সহ robot demonstration, লক্ষ্য-ছবি, আগের robot attempt অথবা human interaction। একটি context compiler কাজের সঙ্গে প্রাসঙ্গিক visual transition বেছে নিয়ে নির্দেশ, সীমাবদ্ধতা ও tool schema-র সঙ্গে মিলিয়ে দেয়। এরপর VLM একটি কাঠামোবদ্ধ robot-tool request প্রস্তাব করে।

request-টি নির্দিষ্ট embodiment-এর controller-এর কাছে যায়। inverse-kinematics সমাধান যাচাই, Cartesian pose নমুনা নেওয়া এবং joint reference-এর সময় নির্ধারণ করে তারপর চলাচল করানো বা বাতিল করার কথা লেখকেরা বর্ণনা করেছেন। পরের model decision-এর জন্য controller পর্যবেক্ষণ ও execution feedback ফেরত দেয়। model action প্রস্তাব করে; রোবট-নির্দিষ্ট code সেগুলো যাচাই করে কার্যকর করে।

এই loop-ই গবেষণাপত্রের মূল অবদান। gradient update ছাড়া উদাহরণ ও সাম্প্রতিক ফল অনুযায়ী একটি স্থির VLM-কে পরের action বদলাতে দেয়। এখানে “in-context learning” বলতে কোনো কাজের সময় দেওয়া তথ্য কীভাবে ব্যবস্থা ব্যবহার করে, সেটিই বোঝায়। এর অর্থ model স্থায়ীভাবে নতুন দক্ষতা শিখেছে বা সব রোবটে একই tool interface চলবে—তা নয়।

trial-গুলো কী মেপেছে

লেখকেরা দশটি robot task জুড়ে পাঁচ ধরনের experiment জানিয়েছেন; প্রতিটি condition-এ তিনটি করে trial। তাঁদের প্রকল্পের পাতায় বাস্তব রোবটের চালনা তালিকাভুক্ত, পাশাপাশি task-এর ফল, সিদ্ধান্ত এবং কেটে যাওয়া সময় প্রকাশ করা হয়েছে। তোয়ালে তোলার কাজে GPT-6 Astra মানুষের video-সহ তিনটির মধ্যে দুবার সফল, কিন্তু video ছাড়া তিনটির একবারও নয়। নোটবুক তুলতেও demonstration ছাড়া সাফল্য শূন্য থেকে demonstration-সহ তিনটির মধ্যে দুটিতে বেড়েছে।

স্পর্শ-নির্ভর কাজ দেখায়, বাড়তি context-ই যে সাধারণ সমাধান, তা নয়। বোতলের ঢাকনা খোলার কাজে robot video একাই তিনটির মধ্যে দুবার সফল; সামঞ্জস্যপূর্ণ robot action যোগ করলে সাফল্য তিনটির তিনটিতেই। plug খুলে আবার ঢোকানোর ক্ষেত্রে শুধু video-তে তিনটির একটিও সফল হয়নি; video-র সঙ্গে action reference দিলে সাফল্য দুটিতে পৌঁছায়। এগুলো নির্ভরযোগ্যতার অনুমান নয়, অল্প কয়েকটি trial-এর condition-ভিত্তিক ফল।

target image দিয়ে block ও ফল সাজানোর কাজে এবং দুইটি human-interaction task-এও ৩/৩ সাফল্যের কথা প্রকল্পে জানানো হয়েছে। নিজের interaction-এর ইতিহাস ব্যবহার করে “Lemon to Pink Plate” এবং “Movable Exploration”—দুটিতেই তিনটির তিনটিতে সাফল্যের কথা গবেষণাপত্রে আছে। শেষের task-এ লক্ষ্য খুঁজতে গিয়ে রোবট সক্রিয়ভাবে বাধা এড়িয়েছে; গড়ে কেটে যাওয়া সময় ছিল ২৫.৫৩ মিনিট। Figure 1-এ চলমান রোবট দিয়ে বস্তু খোঁজার কাজও দেখানো হয়েছে। এসব ফল tabletop manipulation-এর বাইরেও গবেষণাপত্রের পরিধি বাড়ায়; তবু এগুলো বাছাই করা task, প্রতিটি condition-এ মাত্র তিনটি trial। চালনাগুলো কয়েক মিনিট স্থায়ী হয়েছে: প্রকল্প পাতায় মানুষের video-সহ তোয়ালে তোলায় গড় সময় ১৮.৯ মিনিট এবং video ও action reference-সহ bottle-cap task-এ ১৭.৯ মিনিট জানানো হয়েছে। তাই latency ও পরিচালনার খরচ ব্যবহারিক প্রশ্ন হিসেবেই রয়ে যায়, সমাধান করা বিষয় নয়।

পরিশিষ্ট B-তে গবেষণাপত্রে বর্ণিত robot configuration হিসেবে YAM ও ARX X5-এর পাশাপাশি Morphi Kino-র নাম আছে। Morphi Kino-তে চলমান base, waist, head এবং সাত-joint-এর দুটি arm আছে বলে নথিতে উল্লেখ করা হয়েছে। অর্থাৎ arm-platform ছাড়াও গবেষণাপত্রে একটি mobile platform configuration আছে; তবে পরিশিষ্টে Unitree G1-এর পরিচয় নেই।

গবেষণাপত্রের mobile task Reddit-এর দৃশ্যটি প্রতিষ্ঠা করে না

আলাদা Reddit পোস্টে দাবি করা হয়েছে, GPT-6 Astra অচেনা ঘরে Unitree G1 নিয়ন্ত্রণ করে, বস্তুর অবস্থান মনে রাখে এবং পরে অস্পষ্ট অনুরোধে সেগুলো এনে দেয়। গবেষণাপত্রে আলাদা “Movable Exploration” task-এর ফল আছে এবং Morphi Kino-কে mobile-base platform বলা হয়েছে; কিন্তু গবেষণাপত্র, প্রকল্পের উপকরণ বা প্রকাশ্য GitHub repository-তে Reddit-এ বর্ণিত G1-র দৃশ্যটিকে GPT-Policy experiment বলে চিহ্নিত করা হয়নি। পোস্টের দাবিটি আলাদা ও অযাচাইকৃত; এই তুলনা দিয়ে সেটি ভুল প্রমাণও হয় না।

লেখকদের প্রকল্পের পাতায় পরীক্ষার video রয়েছে। সেগুলো লেখকদের বর্ণিত কাজের প্রমাণ, স্বাধীন যাচাই নয়। প্রকাশ্য code repository-তে বর্তমানে ARX X5 ও I2RT/YAM-এর adapter আছে বলে জানানো হয়েছে; deployment host, private prompt, চালনার recording, site-নির্দিষ্ট calibration এবং evaluation history প্রকাশ্য গাছে নেই। ওই adapter-তালিকা প্রকাশিত repository-কে বর্ণনা করে; গবেষণাপত্রের পুরো পরিধি নির্ধারণ করে না—তাতে mobile exploration-ও আছে এবং Appendix B-তে Morphi Kino-র উল্লেখ আছে। প্রকাশিত উপকরণে BIG CHANGE-এর পক্ষে জানানো চালনা পুনরুৎপাদন করার মতো যথেষ্ট বিবরণ নেই; আমরাও কোনো রোবট পরীক্ষা করিনি।

control-এর সীমাটিও গুরুত্বপূর্ণ

প্রকল্পের পাতায় দীর্ঘ action sequence এবং কাজ চালানোর অসুবিধার কথা আছে। আলোচনায় বলা হয়েছে, arm-দুটির সংঘর্ষে বোঝা গেছে যে বিদ্যমান সুরক্ষাব্যবস্থা নিরাপদ autonomous deployment-এর জন্য যথেষ্ট ছিল না। শারীরিক দূরত্ব ও সংস্পর্শ স্বাধীনভাবে পর্যবেক্ষণ করা, সঙ্গে দ্রুততর low-level control এবং আরও নিরাপদ recovery দরকার বলে লেখকেরা মত দিয়েছেন। কিছু অবৈধ চলাচল প্রত্যাখ্যান করতে পারে—শুধু এ কারণে কোনো controller-কে পূর্ণাঙ্গ safety system বলা যায় না।

গবেষণাটি একটি নির্দিষ্ট ফল দেয়: context কিছু task-এ সাধারণ VLM-কে robot tool পরিচালনায় সাহায্য করতে পারে, এবং context-এর ধরন গুরুত্বপূর্ণ। evaluation-এর ছোট পরিসর, প্রতি চালনায় লাগা সময়, পুনরুৎপাদনের জন্য প্রকাশ্য উপকরণের ঘাটতি এবং প্রতিবেদিত collision—সব মিলিয়ে এই ফল এমন গৃহস্থালি humanoid-এর প্রমাণ থেকে অনেক দূরে, যা খোলামেলা অনুরোধ নির্ভরযোগ্যভাবে বোঝে ও পূরণ করে।

সূত্র ও আরও পড়ুন