AI-translated from English; not yet reviewed by a fluent editor.
# GPT-Policy robot-arm ও mobile-exploration task-এ context পরীক্ষা করে
> সেপ্টেম্বরের একটি preprint-এ robot-arm পরীক্ষার পাশাপাশি চলমান রোবট দিয়ে exploration-এর একটি তিন-trial task-এর ফল জানানো হয়েছে। GPT-6 Astra ও Unitree G1 নিয়ে আলাদা Reddit দাবিটি এতে যাচাই করা হয়নি।
By BIG CHANGE Editorial
Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

AI-generated conceptual illustration by BIG CHANGE.
সেপ্টেম্বরের [arXiv preprint, “In-Context Robot Learning with VLM Agents”](https://arxiv.org/html/2609.19138v1)-এ GPT-Policy পরিচয় করানো হয়েছে। এটি demonstration, image ও কাজের আগের interaction history ব্যবহার করে একটি স্থির vision-language model-কে robot tool-এর সঙ্গে যুক্ত করে। পরীক্ষায় robot-arm task এবং mobile exploration ছিল, কিন্তু আলাদা [GPT-6 Astra ও Unitree G1-সংক্রান্ত Reddit দাবি](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) যাচাই করে না।
## মূল পরিবর্তন
- **কী বদলেছে:** GPT-Policy একটি সাধারণ vision-language model-কে demonstration ও বর্তমান camera view থেকে কাঠামোবদ্ধ robot-tool request তৈরির উপায় দেয়। এরপর model-এর task-specific weight হালনাগাদ না করেই কাজের ফলের feedback নিয়ে পরের action বেছে নেওয়া যায়।
- **কেন গুরুত্বপূর্ণ:** এই পদ্ধতিতে বিস্তৃত visual reasoning-কে চলাচলের পরীক্ষা ও বাস্তব action সম্পাদন থেকে আলাদা রাখা হয়। লেখকদের সীমিত trial-এ কিছু task-এ বাড়তি context সাহায্য করেছে; তবে স্পর্শ-সংবেদনশীল action-এর জন্য কখনো সামঞ্জস্যপূর্ণ robot-action reference দরকার হয়েছে।
- **যা নজরে রাখা দরকার:** প্রতিটি condition-এ মাত্র তিনটি trial করা হয়েছে। গবেষণাপত্রে ধীরগতির, ব্যর্থতার ঝুঁকিযুক্ত চালনা—এর মধ্যে arm collision-ও—বর্ণনা করা হয়েছে। মানুষের আশপাশে কাজ করা রোবট সম্পর্কে ফল থেকে বেশি কিছু বলার আগে পুনরুৎপাদন, বড় evaluation এবং স্বাধীন safety control গুরুত্বপূর্ণ।
## GPT-Policy কী করে
গবেষণাপত্রটি ১৬ সেপ্টেম্বর arXiv-এ জমা দেওয়া হয়। fine-tuning বা task-specific model parameter না বদলে সাধারণ vision-language model উদাহরণ ও feedback ব্যবহার করে নতুন প্রাথমিক অবস্থা থেকে কাজ করতে পারে কি না, সেটিই এতে পরীক্ষা করা হয়েছে। লেখকেরা framework-টির নাম দিয়েছেন GPT-Policy এবং মূল্যায়ন করা model-গুলোর মধ্যে GPT-6 Astra-র কথাও বলেছেন।
ব্যবস্থাটি কয়েক ধরনের context একত্র করে: কাজের নির্দেশ, বর্তমান camera view ও অবস্থা, এবং ঐচ্ছিকভাবে মানুষের demonstration video, action reference-সহ robot demonstration, লক্ষ্য-ছবি, আগের robot attempt অথবা human interaction। একটি context compiler কাজের সঙ্গে প্রাসঙ্গিক visual transition বেছে নিয়ে নির্দেশ, সীমাবদ্ধতা ও tool schema-র সঙ্গে মিলিয়ে দেয়। এরপর VLM একটি কাঠামোবদ্ধ robot-tool request প্রস্তাব করে।
request-টি নির্দিষ্ট embodiment-এর controller-এর কাছে যায়। inverse-kinematics সমাধান যাচাই, Cartesian pose নমুনা নেওয়া এবং joint reference-এর সময় নির্ধারণ করে তারপর চলাচল করানো বা বাতিল করার কথা লেখকেরা বর্ণনা করেছেন। পরের model decision-এর জন্য controller পর্যবেক্ষণ ও execution feedback ফেরত দেয়। model action প্রস্তাব করে; রোবট-নির্দিষ্ট code সেগুলো যাচাই করে কার্যকর করে।
এই loop-ই গবেষণাপত্রের মূল অবদান। gradient update ছাড়া উদাহরণ ও সাম্প্রতিক ফল অনুযায়ী একটি স্থির VLM-কে পরের action বদলাতে দেয়। এখানে “in-context learning” বলতে কোনো কাজের সময় দেওয়া তথ্য কীভাবে ব্যবস্থা ব্যবহার করে, সেটিই বোঝায়। এর অর্থ model স্থায়ীভাবে নতুন দক্ষতা শিখেছে বা সব রোবটে একই tool interface চলবে—তা নয়।
## trial-গুলো কী মেপেছে
লেখকেরা দশটি robot task জুড়ে পাঁচ ধরনের experiment জানিয়েছেন; প্রতিটি condition-এ তিনটি করে trial। তাঁদের [প্রকল্পের পাতায়](https://cheng-haha.github.io/GPT-Policy/) বাস্তব রোবটের চালনা তালিকাভুক্ত, পাশাপাশি task-এর ফল, সিদ্ধান্ত এবং কেটে যাওয়া সময় প্রকাশ করা হয়েছে। তোয়ালে তোলার কাজে GPT-6 Astra মানুষের video-সহ তিনটির মধ্যে দুবার সফল, কিন্তু video ছাড়া তিনটির একবারও নয়। নোটবুক তুলতেও demonstration ছাড়া সাফল্য শূন্য থেকে demonstration-সহ তিনটির মধ্যে দুটিতে বেড়েছে।
স্পর্শ-নির্ভর কাজ দেখায়, বাড়তি context-ই যে সাধারণ সমাধান, তা নয়। বোতলের ঢাকনা খোলার কাজে robot video একাই তিনটির মধ্যে দুবার সফল; সামঞ্জস্যপূর্ণ robot action যোগ করলে সাফল্য তিনটির তিনটিতেই। plug খুলে আবার ঢোকানোর ক্ষেত্রে শুধু video-তে তিনটির একটিও সফল হয়নি; video-র সঙ্গে action reference দিলে সাফল্য দুটিতে পৌঁছায়। এগুলো নির্ভরযোগ্যতার অনুমান নয়, অল্প কয়েকটি trial-এর condition-ভিত্তিক ফল।
target image দিয়ে block ও ফল সাজানোর কাজে এবং দুইটি human-interaction task-এও ৩/৩ সাফল্যের কথা প্রকল্পে জানানো হয়েছে। নিজের interaction-এর ইতিহাস ব্যবহার করে “Lemon to Pink Plate” এবং “Movable Exploration”—দুটিতেই তিনটির তিনটিতে সাফল্যের কথা গবেষণাপত্রে আছে। শেষের task-এ লক্ষ্য খুঁজতে গিয়ে রোবট সক্রিয়ভাবে বাধা এড়িয়েছে; গড়ে কেটে যাওয়া সময় ছিল ২৫.৫৩ মিনিট। Figure 1-এ চলমান রোবট দিয়ে বস্তু খোঁজার কাজও দেখানো হয়েছে। এসব ফল tabletop manipulation-এর বাইরেও গবেষণাপত্রের পরিধি বাড়ায়; তবু এগুলো বাছাই করা task, প্রতিটি condition-এ মাত্র তিনটি trial। চালনাগুলো কয়েক মিনিট স্থায়ী হয়েছে: প্রকল্প পাতায় মানুষের video-সহ তোয়ালে তোলায় গড় সময় ১৮.৯ মিনিট এবং video ও action reference-সহ bottle-cap task-এ ১৭.৯ মিনিট জানানো হয়েছে। তাই latency ও পরিচালনার খরচ ব্যবহারিক প্রশ্ন হিসেবেই রয়ে যায়, সমাধান করা বিষয় নয়।
পরিশিষ্ট B-তে গবেষণাপত্রে বর্ণিত robot configuration হিসেবে YAM ও ARX X5-এর পাশাপাশি Morphi Kino-র নাম আছে। Morphi Kino-তে চলমান base, waist, head এবং সাত-joint-এর দুটি arm আছে বলে নথিতে উল্লেখ করা হয়েছে। অর্থাৎ arm-platform ছাড়াও গবেষণাপত্রে একটি mobile platform configuration আছে; তবে পরিশিষ্টে Unitree G1-এর পরিচয় নেই।
## গবেষণাপত্রের mobile task Reddit-এর দৃশ্যটি প্রতিষ্ঠা করে না
আলাদা [Reddit পোস্টে](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) দাবি করা হয়েছে, GPT-6 Astra অচেনা ঘরে Unitree G1 নিয়ন্ত্রণ করে, বস্তুর অবস্থান মনে রাখে এবং পরে অস্পষ্ট অনুরোধে সেগুলো এনে দেয়। গবেষণাপত্রে আলাদা “Movable Exploration” task-এর ফল আছে এবং Morphi Kino-কে mobile-base platform বলা হয়েছে; কিন্তু গবেষণাপত্র, প্রকল্পের উপকরণ বা [প্রকাশ্য GitHub repository-তে](https://github.com/cheng-haha/GPT-Policy) Reddit-এ বর্ণিত G1-র দৃশ্যটিকে GPT-Policy experiment বলে চিহ্নিত করা হয়নি। পোস্টের দাবিটি আলাদা ও অযাচাইকৃত; এই তুলনা দিয়ে সেটি ভুল প্রমাণও হয় না।
লেখকদের [প্রকল্পের পাতায়](https://cheng-haha.github.io/GPT-Policy/) পরীক্ষার video রয়েছে। সেগুলো লেখকদের বর্ণিত কাজের প্রমাণ, স্বাধীন যাচাই নয়। প্রকাশ্য [code repository](https://github.com/cheng-haha/GPT-Policy)-তে বর্তমানে ARX X5 ও I2RT/YAM-এর adapter আছে বলে জানানো হয়েছে; deployment host, private prompt, চালনার recording, site-নির্দিষ্ট calibration এবং evaluation history প্রকাশ্য গাছে নেই। ওই adapter-তালিকা প্রকাশিত repository-কে বর্ণনা করে; গবেষণাপত্রের পুরো পরিধি নির্ধারণ করে না—তাতে mobile exploration-ও আছে এবং Appendix B-তে Morphi Kino-র উল্লেখ আছে। প্রকাশিত উপকরণে BIG CHANGE-এর পক্ষে জানানো চালনা পুনরুৎপাদন করার মতো যথেষ্ট বিবরণ নেই; আমরাও কোনো রোবট পরীক্ষা করিনি।
## control-এর সীমাটিও গুরুত্বপূর্ণ
প্রকল্পের পাতায় দীর্ঘ action sequence এবং কাজ চালানোর অসুবিধার কথা আছে। আলোচনায় বলা হয়েছে, arm-দুটির সংঘর্ষে বোঝা গেছে যে বিদ্যমান সুরক্ষাব্যবস্থা নিরাপদ autonomous deployment-এর জন্য যথেষ্ট ছিল না। শারীরিক দূরত্ব ও সংস্পর্শ স্বাধীনভাবে পর্যবেক্ষণ করা, সঙ্গে দ্রুততর low-level control এবং আরও নিরাপদ recovery দরকার বলে লেখকেরা মত দিয়েছেন। কিছু অবৈধ চলাচল প্রত্যাখ্যান করতে পারে—শুধু এ কারণে কোনো controller-কে পূর্ণাঙ্গ safety system বলা যায় না।
গবেষণাটি একটি নির্দিষ্ট ফল দেয়: context কিছু task-এ সাধারণ VLM-কে robot tool পরিচালনায় সাহায্য করতে পারে, এবং context-এর ধরন গুরুত্বপূর্ণ। evaluation-এর ছোট পরিসর, প্রতি চালনায় লাগা সময়, পুনরুৎপাদনের জন্য প্রকাশ্য উপকরণের ঘাটতি এবং প্রতিবেদিত collision—সব মিলিয়ে এই ফল এমন গৃহস্থালি humanoid-এর প্রমাণ থেকে অনেক দূরে, যা খোলামেলা অনুরোধ নির্ভরযোগ্যভাবে বোঝে ও পূরণ করে।
## সূত্র ও আরও পড়ুন
- [Cheng প্রমুখ, “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138, সংস্করণ ১, জমা ১৬ সেপ্টেম্বর ২০২৬)](https://arxiv.org/abs/2609.19138) — পদ্ধতি, মূল্যায়ন ও ঘোষিত সীমাবদ্ধতার প্রাথমিক preprint; peer-reviewed প্রমাণ বা deployment প্রতিবেদন নয়।
- [লেখকদের GPT-Policy প্রকল্পের পাতা](https://cheng-haha.github.io/GPT-Policy/) — experiment-এর বর্ণনা, video, condition-ভিত্তিক ফল এবং আলোচনা। এগুলো লেখকদের নিজস্ব উপকরণ।
- [লেখকদের প্রকাশ্য GPT-Policy code repository](https://github.com/cheng-haha/GPT-Policy) — বর্তমানে প্রকাশিত adapter এবং public tree-তে কী নেই তা দেখায়; repository থাকা মাত্রেই জানানো experiment পুনরুৎপাদন করা যাবে, তা প্রমাণ হয় না।
- [এই প্রতিবেদনটির সূত্র Reddit পোস্ট](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Unitree G1-সংক্রান্ত দাবির উৎস; পোস্টে ওই দৃশ্যের সঙ্গে গবেষণাপত্রের কোনো সম্পর্কের প্রমাণ উদ্ধৃত করা হয়নি।
## Sources
- [Cheng প্রমুখ, In-Context Robot Learning with VLM Agents, arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — প্রাথমিক preprint, জমা ১৬ সেপ্টেম্বর; GPT-Policy পদ্ধতির প্রস্তাব এবং লেখকদের মূল্যায়ন ও সীমাবদ্ধতা নথিভুক্ত করে; peer-reviewed বা deployment-সংক্রান্ত প্রমাণ নয়।
- [লেখকদের GPT-Policy প্রকল্পের পাতা](https://cheng-haha.github.io/GPT-Policy/) — ব্যবস্থার বিবরণ, experiment, ফলের table, video এবং আলোচনা সম্পর্কে লেখকদের প্রাথমিক উপকরণ; স্বাধীন যাচাই নয়।
- [লেখকদের GPT-Policy-র প্রকাশ্য code repository](https://github.com/cheng-haha/GPT-Policy) — প্রকাশিত adapter এবং repository-তে কী আছে বা নেই তার প্রাথমিক প্রমাণ; turnkey ভাবে পুনরুৎপাদনের জন্য দরকারি সব calibration, prompt বা evaluation history এখানে নেই।
- [GPT-6 Astra ও Unitree G1 নিয়ে দাবি করা Reddit পোস্ট](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — ভাইরাল দাবিটির উৎস; গবেষণাপত্র বা তালিকাভুক্ত robot-arm platform-গুলোতে বর্ণিত দৃশ্যটি করা হয়েছিল—তার প্রমাণ নয়।
BIG CHANGE নিউজলেটার
বড় ছবিটা। আপনার গতিতে।
এআই ও রোবোটিক্স নিয়ে সাম্প্রতিক খবর, নজর রাখার মতো পরিবর্তন এবং কাজে লাগানোর ব্যবহারিক ধারণা। দৈনিক ব্রিফিং, সাপ্তাহিক সংকলন বা মাসিক দৃষ্টিভঙ্গি বেছে নিন।
Belgrade সময় 09:00-এ পাঠানো হয়: প্রতিদিন, সোমবারে বা মাসের প্রথম দিনে। নিশ্চিত করার পরের নির্ধারিত পাঠানোতেই আপনার প্রথম সংস্করণ আসবে।
আপনার গোপনীয়তা, আপনার পছন্দ।
প্রয়োজনীয় স্টোরেজ সাইটের নিরাপত্তায় সাহায্য করে এবং আপনার পছন্দ মনে রাখে। আপনি অনুমতি না দেওয়া পর্যন্ত ঐচ্ছিক Google Analytics বন্ধ থাকবে। প্রয়োজনীয় স্টোরেজ ব্যবহার করেই প্রতিটি গল্প পড়তে পারেন। গোপনীয়তার বিবরণ