AI-translated from English; not yet reviewed by a fluent editor.

# HomeBody মানবরূপী রোবটের স্থানিক স্মৃতিকে পুনর্ব্যবহারযোগ্য দক্ষতার সঙ্গে যুক্ত করে

> Caltech ও Stanford-এর গবেষকেরা Unitree G1-কে মনে রাখা রান্নাঘরের মানচিত্র ও পুনর্ব্যবহারযোগ্য দক্ষতা কাজে লাগাতে দেখিয়েছেন। প্রকাশিত উপকরণে বাছাই করা কয়েকটি প্রদর্শনী আছে, কিন্তু নিয়ন্ত্রিত ফলাফল, পূর্ণাঙ্গ গবেষণাপত্র বা রোবটের code নেই।

By BIG CHANGE Editorial

Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

![Conceptual charcoal illustration of a white humanoid robot walking toward a closed drawer in a light wood kitchen.](https://bigchange.ai/api/media/file/homebody-kitchen-g1-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Caltech ও Stanford-এর একটি দল [HomeBody-কে দেখিয়েছে](https://tml.stanford.edu/homebody/), গবেষণার এমন এক ব্যবস্থা যেখানে GPT Astra নেভিগেশন ও বস্তু ধরার দক্ষতা ডেকে Unitree G1-কে রান্নাঘরের কাজ করায়। রোবটটি প্রথমে ঘর ঘুরে দেখে এবং কোথায় বস্তু দেখেছে তা সংরক্ষণ করে। দলের প্রদর্শনীতে এটি কফির ব্যাগ জড়ো করে, নির্দিষ্ট carton ফেলে দেয়, আর ওষুধের বোতলটি camera-র দৃশ্য থেকে সরে যাওয়ার পর drawer থেকে তুলে আনে।

## মূল পরিবর্তন

- **কী বদলেছে:** HomeBody একটি vision-language model-কে ঘুরে দেখা ঘরের স্থানিক নথিতে প্রবেশাধিকার এবং রোবটের দক্ষতা চালানোর জন্য অভিন্ন interface দেয়। model একটি দক্ষতা ও লক্ষ্য বেছে নেয়; স্থানীয় software চলাচলের পরিকল্পনা করে তা সম্পাদন করে, তারপর ফল জানায়।
- **কেন গুরুত্বপূর্ণ:** এই রান্নাঘরের জন্য নতুন করে action policy প্রশিক্ষণ না দিয়েই modelটি বিভিন্ন স্থানের মধ্যে পরিকল্পনা করতে ও feedback কাজে লাগাতে পারে। দীর্ঘ কাজের জন্য স্মৃতি এবং আগে থেকে থাকা মোটর-দক্ষতা কীভাবে একসঙ্গে সাজানো যায়, দলের প্রদর্শনী তা দেখায়।
- **যা এখনো অমীমাংসিত:** সবার জন্য উন্মুক্ত প্রকাশনায় বাছাই করা প্রদর্শনী দেখানো হয়েছে, নিয়ন্ত্রিত সাফল্যের হার-সংক্রান্ত গবেষণা নয়। ২৭ সেপ্টেম্বর পর্যন্ত কোনো গবেষণাপত্র বা রোবটের code প্রকাশ্যে নেই; তাই প্রকাশিত উপকরণ থেকে জানানো কার্যকারিতা এখনো স্বাধীনভাবে পুনরুৎপাদন করা যায় না।

## রোবটটি ঘর কীভাবে মনে রাখে

HomeBody-র কাজ শুরু হয় ঘর ঘুরে দেখার মাধ্যমে। [প্রকল্পের বাস্তবায়ন বর্ণনা অনুযায়ী](https://tml.stanford.edu/homebody/), G1-টি চওড়া দৃশ্যের iPhone video, D435i camera-র পর্যবেক্ষণ, LiDAR scan, joint pose এবং model-বেছে-নেওয়া waypoint সংগ্রহ করে। LiDAR-ভিত্তিক SLAM মানচিত্রে ঘরের মাপা জ্যামিতি থাকে। Astra ওই উপাদান ব্যবহার করে Nvidia Isaac Sim-এ একটি digital twin তৈরি করে। দলটি মানচিত্র ও পুনর্গঠিত ঘরকে একই coordinate frame-এ মেলায়, যাতে রেকর্ড করা camera view এবং রোবটের বর্তমান অবস্থান পরস্পরের সঙ্গে সামঞ্জস্যপূর্ণ হয়।

নির্দেশে এমন বস্তু থাকলে এই প্রস্তুতি কাজে লাগে যা রোবটটি তখন দেখতে পাচ্ছে না। ওষুধ আনার অনুরোধে দলের বর্ণনা অনুযায়ী, HomeBody সংরক্ষিত camera keyframe মনে করে drawer খুঁজে পায়, সেখানে যায়, drawer খোলে এবং বোতলটি তোলে। ঘরের model নেভিগেশন ও অবস্থান মনে রাখতে সাহায্য করে; বস্তু ধরার শেষ শারীরিক কাজটি তখনও live camera-র নির্দেশনায় হয়।

এই [রান্নাঘরের মিথস্ক্রিয়ার প্রদর্শনীটি](https://tml.stanford.edu/homebody/) প্রকল্প পাতায় স্পষ্টভাবেই illustrative বলে চিহ্নিত এবং পুনর্গঠিত ঘরে দেখানো। পাতায় আলাদা করে G1-র রান্নাঘরের কাজ করার video-ও আছে; নেভিগেশন, তোলা, রাখা ও drawer-সংক্রান্ত দক্ষতার clip-গুলোকে বাস্তব রোবটের footage বলা হয়েছে। ওই video-গুলো দলের বাছাই করা চালনা নথিবদ্ধ করে, আর simulated replay পরিকল্পনার ধাপ বোঝায়।

## model-এর সিদ্ধান্ত থেকে চলাচল

modelটি কাজের নির্দেশ, বর্তমান camera view, মানচিত্রের প্রেক্ষাপট, gripper-এর অবস্থা, মনে করে আনা পর্যবেক্ষণ এবং আগের দক্ষতার ফল পায়। এরপর কোন দক্ষতা ও লক্ষ্য নেওয়া হবে তা জানিয়ে একটি কাঠামোবদ্ধ call পাঠায়। কোনো বস্তু তুলতে লক্ষ্যটি ০–১০০০ স্কেলের ছবির একটি বিন্দু এবং কোন হাত ব্যবহার হবে তার নির্বাচন। স্থানীয় perception ব্যবস্থা বস্তুটিকে segment করে, stereo image থেকে তার গভীরতা হিসাব করে এবং নির্বাচনটিকে 3D grasp-এ রূপ দেয়। arm planner চলাচলের পথ হিসাব করে এবং যাচাই করে। নেভিগেশনে map coordinate-এ 2D গন্তব্য ও মুখ ফেরানোর বিন্দু লাগে; বস্তু রাখার ক্ষেত্রে লাগে 3D ছাড়ার স্থান। drawer খুলতে handle-এর সঙ্গে হাত মেলানো, ধরে টানা এবং পিছিয়ে হাঁটা—এই ধাপগুলো একটি action-এ একত্রিত।

দক্ষতাগুলো স্থানীয়ভাবে ছোটখাটো সংশোধন করে। কাছে যাওয়ার সময় visual tracking এবং বস্তু ধরতে ব্যর্থ হলে সীমিত সংখ্যক পুনঃচেষ্টার কথা দলটি বলেছে। উদ্ধার প্রচেষ্টা ব্যর্থ হলে দক্ষতাটি কারণ জানিয়ে Astra-কে আরেকটি সিদ্ধান্ত নিতে বলে। হাঁটা ও হাত বাড়ানোর কাজে AMO নামের আগে থেকে প্রশিক্ষিত whole-body controller ব্যবহৃত হয়। প্রকল্প পাতায় বলা হয়েছে, হাত ও আঙুলের command চলে ২৫০ Hz-এ, আর AMO policy প্রতি সেকেন্ডে ৫০ বার হালনাগাদ হয়। Astra দূরবর্তী server-এ চলে; perception, motion planning ও দক্ষতাগুলো RTX 4090 GPU-যুক্ত laptop-এ চলে।

Astra ঠিক করে *কোন* পদক্ষেপ নেবে এবং *কোথায়*; skill library ও controller নির্ধারণ করে *কীভাবে* G1 চলবে। দলটির দাবি, রান্নাঘরের প্রদর্শনীর জন্য পরিবেশ-নির্দিষ্ট training data বা নতুন policy learning ব্যবহার করা হয়নি। তবু ব্যবস্থাটিতে আগে থেকে প্রশিক্ষিত control এবং ঘরের বিস্তৃত পুনর্গঠন রয়েছে।

## প্রদর্শনীগুলো কী দেখায়

প্রকল্প পাতায় আগে না-দেখা একটি রান্নাঘরে শারীরিক রোবটের দুটি ধারাবাহিক কাজের বিবরণ আছে। একটিতে কফির ব্যাগ এক জায়গায় জড়ো করে নির্দিষ্ট দুধ ও কমলার রসের carton ফেলে দেওয়া হয়। অন্যটিতে G1 অস্পষ্টভাবে বলা অনুরোধ থেকে ওষুধের বোতল খুঁজে drawer থেকে আনে, মানুষের হাতে দেয় এবং একটি carton ফেলে। দক্ষতার clip-এ আলাদা action ও রেকর্ড করা পুনঃচেষ্টা দেখা যায়; পাতায় বলা হয়েছে, বেশির ভাগ preview দ্রুত চালানো এবং একটি drawer থেকে তোলার sequence-এ পরপর আবার চেষ্টা করতে দেখা যায়।

প্রকাশনায় পরীক্ষার সংখ্যা, কাজের সাফল্যের হার, প্রশিক্ষিত vision-language-action policy-র সঙ্গে তুলনা, কিংবা রান্নাঘরের প্রতিটি সম্পন্ন কাজের সময় ও খরচ দেওয়া হয়নি। তাই এটি একটি স্থাপত্যগত প্রদর্শনীকে সমর্থন করে; অন্য রান্নাঘরে নকশাটি নির্ভরযোগ্যভাবে কাজ করে—এমন মাপা দাবি নয়। [প্রকাশ্য repository](https://github.com/Stanford-TML/homebody)-তে এখন “Code coming soon” লেখা আছে, আর প্রকল্প পাতার Paper লেবেলে কোনো গবেষণাপত্রের link নেই। repository-তে ওয়েবসাইট, illustration ও video আছে; রোবটের বাস্তবায়ন বা মূল্যায়নের file নেই। BIG CHANGE HomeBody চালায়নি বা কোনো রোবট পরীক্ষা করেনি।

BIG CHANGE-এর আগের [GPT-Policy প্রতিবেদনটি](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents) রোবটের কাজের প্রেক্ষাপট নিয়ে অন্য একটি দলের গবেষণাপত্র পরীক্ষা করেছিল। HomeBody-র উপকরণে ওই গবেষণাপত্রকে এই ব্যবস্থার অংশ বলা হয়নি।

দলটি ব্যবহারিক সীমাবদ্ধতার কথাও বলেছে: digital twin বানাতে প্রাথমিক setup-এর সময় ও API-তে খরচ লাগে; দূরবর্তী Astra-র যুক্তি করার সময় দক্ষতাগুলোর মাঝে বিরতি পড়ে; G1 কত দূর হাত বাড়াতে বা বস্তু ধরতে পারে তার সীমা আছে; আর দীর্ঘ সময় চললে আঙুলের servo অতিরিক্ত গরম হতে পারে। স্থানীয় software চালাতে RTX 4090-যুক্ত laptop লাগে; বেশি compute-নির্ভর দক্ষতায় আরও শক্তিশালী hardware দরকার হতে পারে।

## সূত্র ও আরও পড়ুন

- [Caltech ও Stanford গবেষকদের HomeBody প্রকল্প পাতা](https://tml.stanford.edu/homebody/) — ব্যবস্থা, রান্নাঘরের প্রদর্শনী, simulated replay, দক্ষতার interface, control stack এবং ঘোষিত সীমাবদ্ধতা সম্পর্কে গবেষক দলের প্রাথমিক বিবরণ। পাতাটি সেপ্টেম্বর ২০২৬ তারিখের। বাছাই করা video ও বর্ণনা দলের নিজস্ব প্রমাণ; স্বাধীন মূল্যায়ন নয়।
- [Stanford TML-এর প্রকাশ্য HomeBody repository](https://github.com/Stanford-TML/homebody) — প্রকল্পের পাতায় link করা। ২৭ সেপ্টেম্বর ২০২৬-এ পরীক্ষা করে দেখা হয়েছে, README-তে বলা আছে code আসছে; প্রকাশ্য repository-তে রোবটের বাস্তবায়ন বা পূর্ণাঙ্গ গবেষণাপত্রের বদলে ওয়েবসাইটের উপকরণ আছে।

## Sources

- [Caltech ও Stanford গবেষকদের HomeBody প্রকল্প পাতা](https://tml.stanford.edu/homebody/) — স্থাপত্য, বাস্তব রান্নাঘরের প্রদর্শনী, স্পষ্টভাবে illustrative বলে চিহ্নিত simulation, skill interface, compute setup ও ঘোষিত সীমাবদ্ধতার বিষয়ে গবেষক দলের প্রাথমিক বিবরণ। বাছাই করা footage ও বর্ণনা নিয়ন্ত্রিত স্বাধীন মূল্যায়ন নয়। পাতায় Paper লেখা থাকলেও তার সঙ্গে কোনো manuscript link নেই।
- [Stanford TML-এর সর্বসাধারণের জন্য উন্মুক্ত HomeBody repository](https://github.com/Stanford-TML/homebody) — README-তে বলা আছে, code শিগগির আসছে। প্রকাশ্য repository-তে প্রকল্পের website ও media আছে; রোবটের বাস্তবায়ন বা মূল্যায়নের file নেই। repository তৈরির তারিখ দিয়ে পরীক্ষা কখন হয়েছে তা প্রমাণ হয় না।
