Waymo বলছে, পূর্ণ autonomy-এর জন্য শুধু ক্যামেরা যথেষ্ট নয়

কেবল vision-ভিত্তিক self-driving-এর বিরুদ্ধে Waymo সম্প্রতি তাদের সবচেয়ে পরিষ্কার যুক্তি তুলে ধরেছে। সাম্প্রতিক একটি Y Combinator উপস্থাপনায় আলোচিত মন্তব্যে Waymo সহ-সিইও Dmitri Dolgov বলেন, camera-only সিস্টেম driver assistance-এর জন্য বা মানুষের পারফরম্যান্সের কাছাকাছি পৌঁছানোর জন্য কাজে লাগতে পারে, কিন্তু যদি লক্ষ্য হয় নিরাপত্তার দিক থেকে মানুষের চেয়েও এগিয়ে থাকা পূর্ণ autonomy, তাহলে সেগুলি খুব তাড়াতাড়ি সীমায় পৌঁছে যায়।

এই যুক্তি গুরুত্বপূর্ণ, কারণ এটি automated driving-কে ঘিরে দীর্ঘতম প্রযুক্তিগত ও বাণিজ্যিক বিতর্কগুলির একটির কেন্দ্রে আঘাত করে: camera data-তে প্রশিক্ষিত software কি শেষ পর্যন্ত পুরো কাজটি করতে পারবে, নাকি শক্তিশালী autonomy-এর জন্য একাধিক sensor একসঙ্গে কাজ করা দরকার? Dolgov-এর মন্তব্য Waymo-কে দ্বিতীয় শিবিরে দৃঢ়ভাবে দাঁড় করায় এবং এই মতভেদকে engineering taste-এর প্রশ্ন নয়, বরং শিল্প আসলে কোন safety target অর্জন করতে চাইছে সেই প্রশ্নে পরিণত করে।

উদ্ধৃত মন্তব্য অনুযায়ী, Dolgov tradeoff-টি সরাসরি ব্যাখ্যা করেন। বেশি sensor performance বাড়াতে পারে, তবে system complexity-ও বাড়ায়। উদ্দেশ্য যদি কেবল মানুষের মতো মোটামুটি চালানো হয়, বা একটি assistance product বানানো হয়, তাহলে cameras-এর ওপর নির্ভর করা যুক্তিযুক্ত হতে পারে। কিন্তু যদি লক্ষ্য হয় সম্পূর্ণ autonomous driving এবং, তাঁর কথায়, strongly superhuman performance, তাহলে দুর্বল sensing-এর কারণে safety curve খুব দ্রুত সমতল হয়ে যায়।

এই বাক্যটি গুরুত্বপূর্ণ, কারণ এটি benchmark-টিকেই নতুনভাবে সংজ্ঞায়িত করে। এই যুক্তিতে মানুষের driving ceiling নয়। মানুষের driving baseline, এবং technical stack-কে বিচার করতে হবে এটি কি edge case এবং কঠিন পরিবেশে যথেষ্ট আত্মবিশ্বাস নিয়ে সেই সীমা ছাড়িয়ে আরও উন্নতি করতে পারে কি না।

Waymo কেন তিন ধরনের sensor-এ বাজি রাখছে

উৎস উপাদানে Dolgov-এর ব্যাখ্যা অনুযায়ী, Waymo cameras, lidar এবং radar ব্যবহার করে কারণ প্রতিটি অন্যগুলির দুর্বলতা পূরণ করে। Cameras উচ্চ resolution এবং color information দেয়, ফলে system দৃশ্যকে আরও সমৃদ্ধভাবে বুঝতে পারে। কিন্তু cameras passive sensors, আর তিনি বলেছেন, darkness এবং glare-এ এগুলি দুর্বল হয়ে পড়ে।

অন্যদিকে lidar সরাসরি গাড়ির চারপাশের জগতের তিন-মাত্রিক গঠন পরিমাপ করে। Radar আরেকটি শক্তি যোগ করে: fog, rain, snow-এর মতো পরিবেশে এটি ভালো কাজ করে, এবং Doppler effects-এর মাধ্যমে velocity সরাসরি মাপতে পারে। Dolgov এটিও জোর দিয়ে বলেছেন যে lidar ও radar active sensors, অর্থাৎ তারা ঘোর অন্ধকারেও এবং চোখ ধাঁধানো sunset-এর মতো দৃশ্যগতভাবে কঠিন পরিস্থিতিতেও কার্যকরভাবে কাজ করতে পারে।

সব মিলিয়ে এটিই Waymo-এর মূল প্রযুক্তিগত যুক্তি। human fallback ছাড়া চলার জন্য তৈরি একটি self-driving system-কে perception-এর একটিমাত্র channel-এর ওপর অতিরিক্ত নির্ভর করা উচিত নয়, বিশেষ করে যখন সেই channel বাস্তব জগতের সাধারণ ব্যর্থতার প্রতি সংবেদনশীল। কোম্পানির অবস্থান হলো sensor diversity ঐচ্ছিক redundancy নয়। একটি sensing mode অবিশ্বস্ত হয়ে গেলে গাড়ির সচেতনতা বজায় রাখার mechanism-ই এটি।

এটি অনুকূল অবস্থায় lane, vehicle এবং pedestrian শনাক্ত করার চেয়ে বেশি কঠোর মানদণ্ড। এটি ধরে নেয় এমন এক messy বিশ্ব, যেখানে lighting দ্রুত বদলায়, weather visibility-কে প্রভাবিত করে, road user-রা অনির্দেশ্য আচরণ করে, এবং বিরল কিন্তু গুরুতর পরিস্থিতিগুলিও দৈনন্দিন অবস্থার মতোই গুরুত্বপূর্ণ।

শিল্পের গভীর বিভাজন আসলে product category নিয়ে

Dolgov-এর মন্তব্য আরও ইঙ্গিত দেয় যে self-driving নিয়ে অনেক মতভেদ আসলে product category-কে ঘিরে মতভেদ। Driver-assistance system এবং fully autonomous system বাইরে থেকে একই রকম দেখাতে পারে, কিন্তু failure, responsibility এবং acceptable performance margins সম্পর্কে খুব আলাদা অনুমানের ওপর সেগুলি তৈরি হতে পারে।

যদি human driver দায়িত্বশীল ও সতর্ক থাকে, তাহলে system uncertainty এলে সমস্যাটি ফিরিয়ে দিতে পারে। যদি vehicle-ই পুরো কাজ সামলাতে হয়, তাহলে uncertainty-কে machine-এর নিজের sensing ও decision-making stack-এর মধ্যেই সমাধান করতে হবে। এখানেই Waymo মনে করে camera-first বা camera-only approach যথেষ্ট নয়।

এই বিভাজনের commercial দিকটিও সমান গুরুত্বপূর্ণ। বেশি hardware মানে সাধারণত বেশি খরচ, বেশি integration work, এবং সম্ভাব্যভাবে বেশি maintenance complexity। Vision-only সমর্থকেরা দীর্ঘদিন ধরে বলে আসছেন, সরল hardware আরও দক্ষভাবে scale করতে পারে। দেওয়া source text-এর ভিত্তিতে Dolgov-এর উত্তর হলো, cost এবং complexity-এর প্রশ্নকে safety target থেকে আলাদা করা যায় না। সস্তা sensing approach আকর্ষণীয় হতে পারে, কিন্তু তা কেবল তখনই যখন এটি অভীষ্ট autonomy level-কে সত্যিই সমর্থন করে।

এটি তাই কোন sensor সুন্দর দেখায় সেই প্রযুক্তিগত বিতর্কের চেয়েও বেশি কিছু। এটি একটি কৌশলগত যুক্তি, যে কম খরচের perception stack কি তখনও উন্নতি করতে পারবে, যখন বাকি সমস্যাগুলি বিরল, কঠিন বা safety critical হয়ে ওঠে।

এই মন্তব্য self-driving race-এর জন্য কী ইঙ্গিত দেয়

Source text Dolgov-এর মন্তব্যকে Tesla-এর approach-এর সরাসরি চ্যালেঞ্জ হিসেবে দেখায়, যদিও সরবরাহিত উপাদান থেকে সবচেয়ে রক্ষাযোগ্য takeaway আরও বিস্তৃত। Waymo multimodal sensing-কে autonomous driving-এর পরবর্তী পর্যায়ের জন্য অপরিহার্য মনে করছে এবং বিশ্বাস করছে যে dependable driverless performance-এর পথ complementary perception-এর মধ্য দিয়েই যায়, minimal hardware-এর মধ্য দিয়ে নয়।

এটি শিল্পের বিতর্ক শেষ করে না, তবে সেটিকে আরও স্পষ্ট করে। প্রশ্ন আর শুধু এই নয় যে একটি গাড়ি অনেক পরিস্থিতিতে নিজে চলতে পারে কি না। প্রশ্ন হলো, সহজ লাভগুলি শেষ হওয়ার পরও এবং বাকি ভুলগুলি darkness, glare, weather, ambiguous motion, বা সড়কের অস্বাভাবিক geometry থেকে এলে, কোনো architecture কি উন্নতি করতে থাকত পারে।

Safety curve খুব তাড়াতাড়ি সমতল হয়ে যায় এই ধারণার ওপর জোর দিয়ে Waymo বলছে, দুর্বল sensing-এর সমস্যা শুধু আজকের সিস্টেমকে খারাপ করা নয়। তাদের দৃষ্টিতে আরও গভীর সমস্যা হলো, এটি আগামী দিনের system improvement-এর সীমা বেঁধে দিতে পারে।

বৃহত্তর transportation ও energy ecosystem-এর জন্য এই পার্থক্য গুরুত্বপূর্ণ। Autonomous vehicles-কে প্রায়ই software breakthroughs হিসেবে দেখা হয়, কিন্তু বড় পরিসরে deployment নির্ভর করে stress-এর মধ্যে machine কতটা নির্ভরযোগ্যভাবে perceive করতে পারে তার ওপরও। Dolgov-এর মন্তব্য autonomy-এর business ও safety case-এ hardware choices এখনও কেন্দ্রীয়—এই ধারণাকে জোরদার করে।

সেই অর্থে Waymo-এর বার্তা সোজা: শিল্প যদি সত্যিকারের driverless systems চায়, advanced assistance নয়, তাহলে sensing stack-কে এমন পরিস্থিতির জন্য তৈরি করতে হবে যেখানে human vision, এবং সেই সূত্রে camera-only perception, একা যথেষ্ট নয়।

এই নিবন্ধটি CleanTechnica-এর প্রতিবেদনভিত্তিক। মূল নিবন্ধ পড়ুন.

Originally published on cleantechnica.com