দৃশ্যের পুনরাবৃত্ত নকশার কারণে stereo camera ও AI depth model কোনো বস্তুকে ভুল দূরত্বে দেখাতে পারে—এমনটাই জানিয়েছে ফ্লোরিডা বিশ্ববিদ্যালয়-নেতৃত্বাধীন এক দল। নিয়ন্ত্রিত পরীক্ষায় চলমান স্থলরোবট ও গাড়িতে বসানো camera মিথ্যা বাধার হিসাব দিয়েছে। গবেষকেরা স্বয়ংচালিত যানবাহনের software-এ প্রতিক্রিয়া শুরুর জন্য যে সময়সীমার কথা বলেছেন, ভুলটি তার চেয়ে বেশিক্ষণ স্থায়ী হয়েছে।
১৪ সেপ্টেম্বর arXiv-এ প্রকাশিত গবেষণাটি camera-র আলোকে pixel-এ রূপান্তর এবং দুই view সারিবদ্ধ করার প্রক্রিয়ার সঙ্গে এসব ভুলকে যুক্ত করেছে। এতে software-ভিত্তিক একটি প্রতিরক্ষাও পরীক্ষা করা হয়েছে। স্বয়ংচালিত ব্যবস্থা তৈরি বা মূল্যায়নকারীদের জন্য গুরুত্বপূর্ণ ফলটি হলো, নির্দিষ্ট এই ব্যর্থতার প্রক্রিয়া শেখানো depth model-এও থাকে; পাশাপাশি সেটি কমানোর উপায়ের প্রমাণও আছে।
বড় পরিবর্তন
- কী বদলেছে: গবেষকেরা পুনরাবৃত্ত দৃশ্য-নকশার অস্পষ্টতাকে মাপা যায় এমন camera artifact-এর সঙ্গে যুক্ত করেছেন; এরপর প্রচলিত stereo matching ও শেখানো model-এ depth-এর ভুল দেখিয়েছেন। পরীক্ষিত ব্যবস্থায় matching algorithm-কে AI দিয়ে বদলালেও এই দুর্বলতা দূর হয়নি।
- কেন গুরুত্বপূর্ণ: দূরত্বের হিসাব থেকে বাধা শনাক্ত করা হয়। এই পরীক্ষায় চলার পথের পাশে থাকা একটি van-কে এমনভাবে দেখা যেতে পারে যেন সেটি পথের মধ্যেই বাধা। ফলে depth-এর হিসাব কতটা নির্ভরযোগ্য, তা যানবাহনের পরের সিদ্ধান্তে প্রভাব ফেলতে পারে।
- কী লক্ষ করবেন: প্রস্তাবিত প্রতিরক্ষাব্যবস্থা matching প্রক্রিয়ায় পুনরাবৃত্তি আছে কি না যাচাই করে। সীমিত কিছু ছবিতে ফল আশাব্যঞ্জক; অন্য camera, model ও পরিচালন-পরিস্থিতিতেও নির্ভরযোগ্য কি না, তা বাস্তবে ব্যবহারের আগে দেখা দরকার।
পুনরাবৃত্তি দূরত্বের হিসাব কীভাবে বদলায়
stereo camera একই দৃশ্য দুই দিক থেকে দেখে। software প্রতিটি ছবিতে একটি বৈশিষ্ট্য খুঁজে তার আড়াআড়ি সরণ মাপে; এই সরণকে disparity বলা হয়। camera-র জ্যামিতি ব্যবহার করে সেই সরণকে দূরত্বে রূপান্তর করা হয়।
পুনরাবৃত্ত নকশায় একাধিক সম্ভাব্য মিল তৈরি হয়। গবেষণাপত্রের বিশ্লেষণে ভুল মিলটি জিতে যাওয়ার দুটি কারণ দেখানো হয়েছে। প্রথমত, প্রতিটি camera দৃশ্যকে pixel-এর জালে নমুনা করে। গাঢ় আকৃতি ও উজ্জ্বল পটভূমির সীমানা দুই জালে আলাদা জায়গায় পড়তে পারে; তাতে pixel-এর তীব্রতা সামান্য ভিন্ন হয়। দ্বিতীয়ত, calibration-এর অবশিষ্ট ভুল দুই ছবির মধ্যকার মিলকে বিকৃত করে।
দুই প্রভাব মিলে অন্য একটি পুনরাবৃত্ত অংশকে সঠিকটির চেয়ে reference-এর সঙ্গে বেশি মিলে গেছে বলে দেখাতে পারে। তখন সরণের হিসাব পৃষ্ঠটিকে ভুল দূরত্বে বসায়। ছবিগুলো থেকে বৈশিষ্ট্য বের করে তুলনা করা শেখানো stereo model-এও দলটি এই সংবেদনশীলতা পেয়েছে।
নকশাগুলো ইচ্ছাকৃতভাবে বেছে নেওয়া হয়েছিল। গবেষণার threat model-এ camera ও সংশ্লিষ্ট processing setting সম্পর্কে জানা থাকা, অথবা মূল্যায়নের জন্য কাছাকাছি কোনো ব্যবস্থায় প্রবেশাধিকার থাকার কথা ধরা হয়েছে। ২২ সেপ্টেম্বর তারিখে প্রকাশিত UF-এর গবেষণা-বিবরণে গবেষণার প্রধান Sara Rampazzi স্বাভাবিকভাবে দেখা দেওয়া পুনরাবৃত্ত নকশাকেও নিরাপত্তার উদ্বেগ হিসেবে উল্লেখ করেছেন। চালু থাকা যানবাহনে রাস্তার পাশের সাধারণ texture কত ঘন ঘন বিপজ্জনক ভুল ঘটায়, গবেষণাটি তা মাপেনি।
পরীক্ষায় perception ব্যবস্থার বিভিন্ন অংশ দেখা হয়েছে
গবেষকেরা রেকর্ড করা ছবি, বাস্তব camera-র পরিমাপ ও simulation নিয়ে পরীক্ষা করেছেন।
পরীক্ষা | ব্যবস্থা ও শর্ত | যা মাপা হয়েছে |
|---|---|---|
পরিবর্তিত driving image | ৭,৫১৮টি KITTI stereo image pair-এ নকশা বসানো; BM ও SGBM matching algorithm এবং PSMNet, MoCha-Stereo ও UniMatch | প্রচলিত ও শেখানো পদ্ধতিতে depth-এর হিসাব কীভাবে বদলায় |
stereo ও LiDAR-এর সমন্বয় | সমতল দেয়াল দেখানো synthetic LiDAR point cloud-সহ SGM-DDC | নকশার কারণে হওয়া ভুল থেকে এই সমন্বয়-পদ্ধতিটি কতটা রক্ষা পায় |
বাস্তব camera-র পরীক্ষা | ঘরের ভেতর ও বাইরে ZED2 এবং RealSense camera | দেখানো বা প্রক্ষেপিত নকশায় depth-এর ভুল |
বাস্তব গতির পরীক্ষা | ঘণ্টায় ১০ কিলোমিটার বেগে AgileX Hunter 2.0 স্থলযান এবং প্রায় ১৫ কিলোমিটার বেগে একটি গাড়িতে বসানো camera | চলার সময় মিথ্যা depth-এর হিসাব কতক্ষণ স্থায়ী হয় |
বেশি গতির simulation | ঘণ্টায় ১০, ২০, ৩০ ও ৪০ কিলোমিটারে CARLA; BM পদ্ধতিতে প্রক্রিয়াকৃত stereo image | simulation-এ গাড়ি চালানোর সময় depth-এর ভুল কতক্ষণ থাকে |
গবেষণাপত্র ও artifact-এর পরিশিষ্টে RealSense sensor-টিকে D435 বলা হয়েছে। লেখকদের demonstration পাতায় এর নাম D435i; উৎসগুলোর এই বর্ণনা থেকে ঠিক কোন variant ব্যবহৃত হয়েছে, তা একভাবে নিশ্চিত হয় না।
ঘরের ভেতরের একটি পরীক্ষায় নির্বাচিত নকশা ব্যবহারে camera থেকে তিন মিটার দূরের একটি পৃষ্ঠকে ZED2 ০.৮ মিটার এবং RealSense ০.৬ মিটার দূরে বলে হিসাব করে।
LiDAR-এর দূরত্ব দিয়ে stereo matching সীমিত করা SGM-DDC, fusion ছাড়া ব্যবহৃত পদ্ধতির তুলনায় নকশা বদলের প্রভাবে কম ভুল করেছে; তবে পরীক্ষিত বিন্যাসে তাতেও ভুল ছিল। LiDAR-এর synthetic input থাকায় এই ফল একটি fusion পদ্ধতি ও নির্মিত পরীক্ষার শর্তেই সীমিত।
গাড়ি চালানোর পরীক্ষায় মিথ্যা বাধা দেখা গেছে
গাড়ির বাস্তব পরীক্ষায় গবেষকেরা চলার পথের পাশে রাখা একটি van-এ নকশা প্রক্ষেপণ করেন। depth-এর মিথ্যা হিসাব পৃষ্ঠটির কিছু অংশকে গাড়ির অনুমিত চলার পথের ভেতরে বসায়। গবেষণাপত্রের ফলের সারণিতে দুই camera ও আলোর শর্ত মিলিয়ে এই ভুল প্রায় ০.৭ থেকে ১.২ সেকেন্ড স্থায়ী হওয়ার কথা আছে।
পরবর্তী মূল্যায়নে গবেষকেরা Autoware-এর Euclidean clustering ব্যবহার করেছেন। এটি depth map-এর কাছাকাছি point-গুলোকে সম্ভাব্য বাধার দলে ভাগ করে। মিথ্যা point-গুলো বাধা হিসেবে ধরা পড়লে তাঁরা সেই পরীক্ষা সফল বলে গণনা করেন; জরুরি ব্রেকের মতো স্বয়ংক্রিয় প্রতিক্রিয়ার জন্য ০.৫ সেকেন্ড স্থায়িত্ব যথেষ্ট বলে উল্লেখ করেন। artifact-এর পরিশিষ্টেও রেকর্ড করা point cloud এবং মিথ্যা depth-এর cluster কতক্ষণ থাকে, তা মূল্যায়নের বিবরণ আছে।
প্রতিবেদিত মূল্যায়নে বাস্তবে জরুরি ব্রেক করা, মন্দন মাপা বা সংঘর্ষের বিবরণ নেই। গবেষণার কারণে সম্ভাব্য সংঘর্ষ ও হঠাৎ ব্রেকের ঝুঁকির কথা UF বলেছে। প্রকাশিত পরীক্ষায় এসব ফল ঘটেছে বলে দেখানো হয়নি।
বাস্তব পরীক্ষা নিয়ন্ত্রিত পরিবেশে ঘণ্টায় সর্বোচ্চ ১৫ কিলোমিটার গতিতে হয়েছিল। ঘণ্টায় ৪০ কিলোমিটারের ফলটি CARLA simulation থেকে এসেছে: সেখানে depth বদলে দেওয়ার প্রভাব ২.১ সেকেন্ড স্থায়ী হয়। আলাদা simulation-এ আরও শর্ত পরীক্ষা হলেও ওই গতিতে বাস্তব পরীক্ষা হয়েছিল, তা প্রমাণিত হয় না।
প্রতিরক্ষায় সম্ভাব্য পুনরাবৃত্ত মিল যাচাই করা হয়
প্রস্তাবিত প্রতিরক্ষাব্যবস্থা দুই ছবির মিল তুলতে ব্যবহৃত score পরীক্ষা করে। পুনরাবৃত্ত কাঠামোয় সম্ভাব্য মিলের একটি ছন্দময় ধারা তৈরি হয়। পদ্ধতিটি সেই নিয়মিততা শনাক্ত করে এবং প্রভাবিত অঞ্চলকে বড় একক হিসেবে মেলায়; তাতে ভুল পুনরাবৃত্ত অংশ বেছে নেওয়ার সম্ভাবনা কমে।
বাস্তব পরীক্ষার শর্তে সংগৃহীত ২০০টি stereo image pair-এ, মূল্যায়ন করা ৯৬.৫ শতাংশ ক্ষেত্রে depth-এর ভুল অর্ধ মিটারের নিচে নামানোর কথা লেখকেরা জানিয়েছেন। তাঁরা PSMNet-এর ভেতরের মধ্যবর্তী matching তথ্যেও পদ্ধতিটি মানিয়ে নেন। নকশা বসানো ২০০টি KITTI pair-এ ওই সংস্করণটি মূল্যায়ন করা প্রতিটি ক্ষেত্রে ভুল ০.১ মিটারের নিচে নামায়।
শেখানো model-এ প্রতিরক্ষার ফলটি PSMNet-এর; MoCha-Stereo বা UniMatch-এর ক্ষেত্রেও একই ফল হবে, তা প্রতিষ্ঠিত নয়। গবেষণার বাস্তব পরীক্ষা সমতল বা প্রায় সমতল প্রক্ষেপণ-পৃষ্ঠে সীমিত, আর চলমান পরীক্ষায় একই নকশা ব্যবহার করা হয়েছে। আলোচনায় দেখানো হয়েছে, training data বদলালে model কোন নকশায় প্রভাবিত হয় এবং কতটা হয়, সেটিও বদলাতে পারে।
camera processing এবং শেখানো depth estimate—দুই ক্ষেত্রেই পুনরাবৃত্ত নকশার আচরণ পরীক্ষা করার কারণ গবেষণাটি ব্যবস্থার নির্মাতাদের সামনে আনে। বাস্তবে ব্যবহৃত ব্যবস্থার সব পরিচালন-পরিস্থিতিতে প্রতিরক্ষাটি কেমন কাজ করবে, তা এখনও প্রতিষ্ঠিত নয়।
লেখকেরা জানিয়েছেন, গবেষণাপত্রটি ACM CCS 2026-এ প্রকাশের অপেক্ষায়। সম্মেলনের সরকারি ওয়েবসাইটে হেগে ১৫–১৯ নভেম্বর তারিখ দেওয়া হয়েছে এবং চূড়ান্ত কর্মসূচি তৈরির কাজ চলছে বলা হয়েছে। সেখানে গবেষণাটি এখনও উপস্থাপিত হয়নি।
সূত্র ও আরও পড়ুন
- Illusion of Depth: Revealing Hidden Stereo Vision Vulnerabilities in Depth Estimation—১৪ সেপ্টেম্বর ২০২৬। পূর্ণ গবেষণাপত্রে কারণ, মূল্যায়িত algorithm ও camera, বাস্তব ও simulation-এর শর্ত, প্রতিরক্ষার ফল এবং সীমা আছে। যানবাহন-সংক্রান্ত ফল হিসেবে এতে মিথ্যা বাধা শনাক্ত ও উল্লিখিত প্রতিক্রিয়া-সময়সীমার কথা বলা হয়েছে; পদ্ধতিতে বাস্তব ব্রেক করা বা সংঘর্ষের বিবরণ নেই।
- ফ্লোরিডা বিশ্ববিদ্যালয়ের গবেষণা-বিবরণ—২২ সেপ্টেম্বর ২০২৬। গবেষক দলের ব্যাখ্যা ও তাঁদের নামে বলা নিরাপত্তা-ঝুঁকি তুলে ধরে। সংঘর্ষ বা হঠাৎ ব্রেকের দৃশ্য সম্ভাব্য পরিণতি, দেখা-যাওয়া ঘটনা নয়।
- লেখকদের demonstration পাতা এবং গবেষণার artifact—২৪ সেপ্টেম্বর ২০২৬-এ পরীক্ষা করা হয়েছে। artifact-এর পরিশিষ্টে ছবি, point cloud, simulation ও প্রতিরক্ষা মূল্যায়নের বিবরণ আছে। demonstration-এর caption-এ D435i বলা হলেও গবেষণাপত্র ও পরিশিষ্টে D435 লেখা। BIG CHANGE পরীক্ষাগুলো পুনরায় চালায়নি।
- ACM CCS 2026—২৪ সেপ্টেম্বর ২০২৬-এ পরীক্ষা করা হয়েছে। সম্মেলনের তারিখ ও স্থান নিশ্চিত করে। গবেষণাপত্রটি শিগগির প্রকাশিত হবে—লেখকেরা এমনটি বলেছেন; এই নিবন্ধের জন্য দেখা সম্মেলনের পাতায় উপস্থাপনার নির্দিষ্ট সময় জানানো হয়নি।



