পৃথিবী স্থির নেই।RSS
BIG CHANGE.

Markdown সংস্করণ

AI-translated from English; not yet reviewed by a fluent editor.

# GPT-Policy robot-arm ও mobile-exploration task-এ context পরীক্ষা করে

> সেপ্টেম্বরের একটি preprint-এ robot-arm পরীক্ষার পাশাপাশি চলমান রোবট দিয়ে exploration-এর একটি তিন-trial task-এর ফল জানানো হয়েছে। GPT-6 Astra ও Unitree G1 নিয়ে আলাদা Reddit দাবিটি এতে যাচাই করা হয়নি।

By BIG CHANGE Editorial

Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

![A conceptual robot arm reaches toward a bottle cap on a workbench beneath a mounted camera.](https://bigchange.ai/api/media/file/gpt-policy-robot-arm-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

সেপ্টেম্বরের [arXiv preprint, “In-Context Robot Learning with VLM Agents”](https://arxiv.org/html/2609.19138v1)-এ GPT-Policy পরিচয় করানো হয়েছে। এটি demonstration, image ও কাজের আগের interaction history ব্যবহার করে একটি স্থির vision-language model-কে robot tool-এর সঙ্গে যুক্ত করে। পরীক্ষায় robot-arm task এবং mobile exploration ছিল, কিন্তু আলাদা [GPT-6 Astra ও Unitree G1-সংক্রান্ত Reddit দাবি](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) যাচাই করে না।

## মূল পরিবর্তন

- **কী বদলেছে:** GPT-Policy একটি সাধারণ vision-language model-কে demonstration ও বর্তমান camera view থেকে কাঠামোবদ্ধ robot-tool request তৈরির উপায় দেয়। এরপর model-এর task-specific weight হালনাগাদ না করেই কাজের ফলের feedback নিয়ে পরের action বেছে নেওয়া যায়।
- **কেন গুরুত্বপূর্ণ:** এই পদ্ধতিতে বিস্তৃত visual reasoning-কে চলাচলের পরীক্ষা ও বাস্তব action সম্পাদন থেকে আলাদা রাখা হয়। লেখকদের সীমিত trial-এ কিছু task-এ বাড়তি context সাহায্য করেছে; তবে স্পর্শ-সংবেদনশীল action-এর জন্য কখনো সামঞ্জস্যপূর্ণ robot-action reference দরকার হয়েছে।
- **যা নজরে রাখা দরকার:** প্রতিটি condition-এ মাত্র তিনটি trial করা হয়েছে। গবেষণাপত্রে ধীরগতির, ব্যর্থতার ঝুঁকিযুক্ত চালনা—এর মধ্যে arm collision-ও—বর্ণনা করা হয়েছে। মানুষের আশপাশে কাজ করা রোবট সম্পর্কে ফল থেকে বেশি কিছু বলার আগে পুনরুৎপাদন, বড় evaluation এবং স্বাধীন safety control গুরুত্বপূর্ণ।

## GPT-Policy কী করে

গবেষণাপত্রটি ১৬ সেপ্টেম্বর arXiv-এ জমা দেওয়া হয়। fine-tuning বা task-specific model parameter না বদলে সাধারণ vision-language model উদাহরণ ও feedback ব্যবহার করে নতুন প্রাথমিক অবস্থা থেকে কাজ করতে পারে কি না, সেটিই এতে পরীক্ষা করা হয়েছে। লেখকেরা framework-টির নাম দিয়েছেন GPT-Policy এবং মূল্যায়ন করা model-গুলোর মধ্যে GPT-6 Astra-র কথাও বলেছেন।

ব্যবস্থাটি কয়েক ধরনের context একত্র করে: কাজের নির্দেশ, বর্তমান camera view ও অবস্থা, এবং ঐচ্ছিকভাবে মানুষের demonstration video, action reference-সহ robot demonstration, লক্ষ্য-ছবি, আগের robot attempt অথবা human interaction। একটি context compiler কাজের সঙ্গে প্রাসঙ্গিক visual transition বেছে নিয়ে নির্দেশ, সীমাবদ্ধতা ও tool schema-র সঙ্গে মিলিয়ে দেয়। এরপর VLM একটি কাঠামোবদ্ধ robot-tool request প্রস্তাব করে।

request-টি নির্দিষ্ট embodiment-এর controller-এর কাছে যায়। inverse-kinematics সমাধান যাচাই, Cartesian pose নমুনা নেওয়া এবং joint reference-এর সময় নির্ধারণ করে তারপর চলাচল করানো বা বাতিল করার কথা লেখকেরা বর্ণনা করেছেন। পরের model decision-এর জন্য controller পর্যবেক্ষণ ও execution feedback ফেরত দেয়। model action প্রস্তাব করে; রোবট-নির্দিষ্ট code সেগুলো যাচাই করে কার্যকর করে।

এই loop-ই গবেষণাপত্রের মূল অবদান। gradient update ছাড়া উদাহরণ ও সাম্প্রতিক ফল অনুযায়ী একটি স্থির VLM-কে পরের action বদলাতে দেয়। এখানে “in-context learning” বলতে কোনো কাজের সময় দেওয়া তথ্য কীভাবে ব্যবস্থা ব্যবহার করে, সেটিই বোঝায়। এর অর্থ model স্থায়ীভাবে নতুন দক্ষতা শিখেছে বা সব রোবটে একই tool interface চলবে—তা নয়।

## trial-গুলো কী মেপেছে

লেখকেরা দশটি robot task জুড়ে পাঁচ ধরনের experiment জানিয়েছেন; প্রতিটি condition-এ তিনটি করে trial। তাঁদের [প্রকল্পের পাতায়](https://cheng-haha.github.io/GPT-Policy/) বাস্তব রোবটের চালনা তালিকাভুক্ত, পাশাপাশি task-এর ফল, সিদ্ধান্ত এবং কেটে যাওয়া সময় প্রকাশ করা হয়েছে। তোয়ালে তোলার কাজে GPT-6 Astra মানুষের video-সহ তিনটির মধ্যে দুবার সফল, কিন্তু video ছাড়া তিনটির একবারও নয়। নোটবুক তুলতেও demonstration ছাড়া সাফল্য শূন্য থেকে demonstration-সহ তিনটির মধ্যে দুটিতে বেড়েছে।

স্পর্শ-নির্ভর কাজ দেখায়, বাড়তি context-ই যে সাধারণ সমাধান, তা নয়। বোতলের ঢাকনা খোলার কাজে robot video একাই তিনটির মধ্যে দুবার সফল; সামঞ্জস্যপূর্ণ robot action যোগ করলে সাফল্য তিনটির তিনটিতেই। plug খুলে আবার ঢোকানোর ক্ষেত্রে শুধু video-তে তিনটির একটিও সফল হয়নি; video-র সঙ্গে action reference দিলে সাফল্য দুটিতে পৌঁছায়। এগুলো নির্ভরযোগ্যতার অনুমান নয়, অল্প কয়েকটি trial-এর condition-ভিত্তিক ফল।

target image দিয়ে block ও ফল সাজানোর কাজে এবং দুইটি human-interaction task-এও ৩/৩ সাফল্যের কথা প্রকল্পে জানানো হয়েছে। নিজের interaction-এর ইতিহাস ব্যবহার করে “Lemon to Pink Plate” এবং “Movable Exploration”—দুটিতেই তিনটির তিনটিতে সাফল্যের কথা গবেষণাপত্রে আছে। শেষের task-এ লক্ষ্য খুঁজতে গিয়ে রোবট সক্রিয়ভাবে বাধা এড়িয়েছে; গড়ে কেটে যাওয়া সময় ছিল ২৫.৫৩ মিনিট। Figure 1-এ চলমান রোবট দিয়ে বস্তু খোঁজার কাজও দেখানো হয়েছে। এসব ফল tabletop manipulation-এর বাইরেও গবেষণাপত্রের পরিধি বাড়ায়; তবু এগুলো বাছাই করা task, প্রতিটি condition-এ মাত্র তিনটি trial। চালনাগুলো কয়েক মিনিট স্থায়ী হয়েছে: প্রকল্প পাতায় মানুষের video-সহ তোয়ালে তোলায় গড় সময় ১৮.৯ মিনিট এবং video ও action reference-সহ bottle-cap task-এ ১৭.৯ মিনিট জানানো হয়েছে। তাই latency ও পরিচালনার খরচ ব্যবহারিক প্রশ্ন হিসেবেই রয়ে যায়, সমাধান করা বিষয় নয়।

পরিশিষ্ট B-তে গবেষণাপত্রে বর্ণিত robot configuration হিসেবে YAM ও ARX X5-এর পাশাপাশি Morphi Kino-র নাম আছে। Morphi Kino-তে চলমান base, waist, head এবং সাত-joint-এর দুটি arm আছে বলে নথিতে উল্লেখ করা হয়েছে। অর্থাৎ arm-platform ছাড়াও গবেষণাপত্রে একটি mobile platform configuration আছে; তবে পরিশিষ্টে Unitree G1-এর পরিচয় নেই।

## গবেষণাপত্রের mobile task Reddit-এর দৃশ্যটি প্রতিষ্ঠা করে না

আলাদা [Reddit পোস্টে](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) দাবি করা হয়েছে, GPT-6 Astra অচেনা ঘরে Unitree G1 নিয়ন্ত্রণ করে, বস্তুর অবস্থান মনে রাখে এবং পরে অস্পষ্ট অনুরোধে সেগুলো এনে দেয়। গবেষণাপত্রে আলাদা “Movable Exploration” task-এর ফল আছে এবং Morphi Kino-কে mobile-base platform বলা হয়েছে; কিন্তু গবেষণাপত্র, প্রকল্পের উপকরণ বা [প্রকাশ্য GitHub repository-তে](https://github.com/cheng-haha/GPT-Policy) Reddit-এ বর্ণিত G1-র দৃশ্যটিকে GPT-Policy experiment বলে চিহ্নিত করা হয়নি। পোস্টের দাবিটি আলাদা ও অযাচাইকৃত; এই তুলনা দিয়ে সেটি ভুল প্রমাণও হয় না।

লেখকদের [প্রকল্পের পাতায়](https://cheng-haha.github.io/GPT-Policy/) পরীক্ষার video রয়েছে। সেগুলো লেখকদের বর্ণিত কাজের প্রমাণ, স্বাধীন যাচাই নয়। প্রকাশ্য [code repository](https://github.com/cheng-haha/GPT-Policy)-তে বর্তমানে ARX X5 ও I2RT/YAM-এর adapter আছে বলে জানানো হয়েছে; deployment host, private prompt, চালনার recording, site-নির্দিষ্ট calibration এবং evaluation history প্রকাশ্য গাছে নেই। ওই adapter-তালিকা প্রকাশিত repository-কে বর্ণনা করে; গবেষণাপত্রের পুরো পরিধি নির্ধারণ করে না—তাতে mobile exploration-ও আছে এবং Appendix B-তে Morphi Kino-র উল্লেখ আছে। প্রকাশিত উপকরণে BIG CHANGE-এর পক্ষে জানানো চালনা পুনরুৎপাদন করার মতো যথেষ্ট বিবরণ নেই; আমরাও কোনো রোবট পরীক্ষা করিনি।

## control-এর সীমাটিও গুরুত্বপূর্ণ

প্রকল্পের পাতায় দীর্ঘ action sequence এবং কাজ চালানোর অসুবিধার কথা আছে। আলোচনায় বলা হয়েছে, arm-দুটির সংঘর্ষে বোঝা গেছে যে বিদ্যমান সুরক্ষাব্যবস্থা নিরাপদ autonomous deployment-এর জন্য যথেষ্ট ছিল না। শারীরিক দূরত্ব ও সংস্পর্শ স্বাধীনভাবে পর্যবেক্ষণ করা, সঙ্গে দ্রুততর low-level control এবং আরও নিরাপদ recovery দরকার বলে লেখকেরা মত দিয়েছেন। কিছু অবৈধ চলাচল প্রত্যাখ্যান করতে পারে—শুধু এ কারণে কোনো controller-কে পূর্ণাঙ্গ safety system বলা যায় না।

গবেষণাটি একটি নির্দিষ্ট ফল দেয়: context কিছু task-এ সাধারণ VLM-কে robot tool পরিচালনায় সাহায্য করতে পারে, এবং context-এর ধরন গুরুত্বপূর্ণ। evaluation-এর ছোট পরিসর, প্রতি চালনায় লাগা সময়, পুনরুৎপাদনের জন্য প্রকাশ্য উপকরণের ঘাটতি এবং প্রতিবেদিত collision—সব মিলিয়ে এই ফল এমন গৃহস্থালি humanoid-এর প্রমাণ থেকে অনেক দূরে, যা খোলামেলা অনুরোধ নির্ভরযোগ্যভাবে বোঝে ও পূরণ করে।

## সূত্র ও আরও পড়ুন

- [Cheng প্রমুখ, “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138, সংস্করণ ১, জমা ১৬ সেপ্টেম্বর ২০২৬)](https://arxiv.org/abs/2609.19138) — পদ্ধতি, মূল্যায়ন ও ঘোষিত সীমাবদ্ধতার প্রাথমিক preprint; peer-reviewed প্রমাণ বা deployment প্রতিবেদন নয়।
- [লেখকদের GPT-Policy প্রকল্পের পাতা](https://cheng-haha.github.io/GPT-Policy/) — experiment-এর বর্ণনা, video, condition-ভিত্তিক ফল এবং আলোচনা। এগুলো লেখকদের নিজস্ব উপকরণ।
- [লেখকদের প্রকাশ্য GPT-Policy code repository](https://github.com/cheng-haha/GPT-Policy) — বর্তমানে প্রকাশিত adapter এবং public tree-তে কী নেই তা দেখায়; repository থাকা মাত্রেই জানানো experiment পুনরুৎপাদন করা যাবে, তা প্রমাণ হয় না।
- [এই প্রতিবেদনটির সূত্র Reddit পোস্ট](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Unitree G1-সংক্রান্ত দাবির উৎস; পোস্টে ওই দৃশ্যের সঙ্গে গবেষণাপত্রের কোনো সম্পর্কের প্রমাণ উদ্ধৃত করা হয়নি।

## Sources

- [Cheng প্রমুখ, In-Context Robot Learning with VLM Agents, arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — প্রাথমিক preprint, জমা ১৬ সেপ্টেম্বর; GPT-Policy পদ্ধতির প্রস্তাব এবং লেখকদের মূল্যায়ন ও সীমাবদ্ধতা নথিভুক্ত করে; peer-reviewed বা deployment-সংক্রান্ত প্রমাণ নয়।
- [লেখকদের GPT-Policy প্রকল্পের পাতা](https://cheng-haha.github.io/GPT-Policy/) — ব্যবস্থার বিবরণ, experiment, ফলের table, video এবং আলোচনা সম্পর্কে লেখকদের প্রাথমিক উপকরণ; স্বাধীন যাচাই নয়।
- [লেখকদের GPT-Policy-র প্রকাশ্য code repository](https://github.com/cheng-haha/GPT-Policy) — প্রকাশিত adapter এবং repository-তে কী আছে বা নেই তার প্রাথমিক প্রমাণ; turnkey ভাবে পুনরুৎপাদনের জন্য দরকারি সব calibration, prompt বা evaluation history এখানে নেই।
- [GPT-6 Astra ও Unitree G1 নিয়ে দাবি করা Reddit পোস্ট](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — ভাইরাল দাবিটির উৎস; গবেষণাপত্র বা তালিকাভুক্ত robot-arm platform-গুলোতে বর্ণিত দৃশ্যটি করা হয়েছিল—তার প্রমাণ নয়।
BIG CHANGE নিউজলেটার

বড় ছবিটা। আপনার গতিতে।

এআই ও রোবোটিক্স নিয়ে সাম্প্রতিক খবর, নজর রাখার মতো পরিবর্তন এবং কাজে লাগানোর ব্যবহারিক ধারণা। দৈনিক ব্রিফিং, সাপ্তাহিক সংকলন বা মাসিক দৃষ্টিভঙ্গি বেছে নিন।