আরও বিস্তৃত control model দিয়ে Google তার robotics stack বাড়াচ্ছে

Google DeepMind Gemini Robotics 2 উন্মোচন করেছে, যা একটি নতুন vision-language-action model; কোম্পানির দাবি, এটি খুব ভিন্ন ধরনের robots-এর জন্য একটি common control layer হিসেবে কাজ করতে পারে। উৎস উপকরণে বর্ণিত ঘোষণার অনুযায়ী, modelটি tabletop arms থেকে full-body humanoid robots পর্যন্ত বিভিন্ন systems-এ কাজ করার জন্য তৈরি, যা physical world-এ কাজ করতে সক্ষম software-এ বড় multimodal models-কে রূপান্তর করার Google-এর প্রচেষ্টাকে আরও এগিয়ে নিয়ে যাচ্ছে।

এই release গুরুত্বপূর্ণ, কারণ robotics developers দীর্ঘদিন ধরে fragmentation সমস্যার মুখোমুখি। যে models একটি machine type বা task-এ ভালো কাজ করে, সেগুলোকে প্রায়ই অন্য body plan, sensor setup, বা environment সামলানোর আগে উল্লেখযোগ্য adaptation দরকার হয়। DeepMind Gemini Robotics 2-কে আরও general foundation-এর দিকে একটি ধাপ হিসেবে উপস্থাপন করছে: এমন একটি model family যা images ব্যাখ্যা করতে, language process করতে, এবং সেই inputs-কে আরও বিস্তৃত hardware জুড়ে actions-এ রূপান্তর করতে পারে।

এই positioning technical দাবির বাইরেও গুরুত্বপূর্ণ। বাস্তবে, robots-এর জন্য একটি “intelligence layer” এমন একটি market-এর ইঙ্গিত দেয় যেখানে core perception, reasoning, এবং control software বহু platform জুড়ে পুনঃব্যবহার করা যায়, আর hardware makers mechanics, reliability, cost, এবং deployment-এর মাধ্যমে আলাদা হয়। যদি এই approach বাস্তব বিশ্বের testing-এ টিকে যায়, তাহলে logistics, industrial handling, research, এবং service applications-এর জন্য adaptive robots তৈরির বাধা কমাতে পারে।

নতুন model কী করতে পারে বলে DeepMind জানাচ্ছে

source text Gemini Robotics 2-কে DeepMind-এর এখন পর্যন্ত সবচেয়ে advanced vision-language-action model হিসেবে বর্ণনা করেছে। Vision-language-action systems visual understanding, natural-language interpretation, এবং motor control একত্র করে, যাতে robot যা দেখছে, যা করতে বলা হয়েছে, এবং এরপর physical response কীভাবে দেবে তা সংযুক্ত করতে পারে।

DeepMind বলছে, নতুন model full-body movement পরিচালনা করতে, fine motor tasks সম্পাদন করতে, এবং multiple robots coordinate করতে পারে। এগুলো তিনটি খুব আলাদা চাহিদা। Full-body motion-এর জন্য বিস্তৃত spatial planning এবং balance-related control দরকার। Fine motor work আরও সুনির্দিষ্ট manipulation-এর ওপর নির্ভরশীল। Multi-robot coordination timing এবং shared-task complexity যোগ করে। এই ক্ষমতাগুলোকে এক platform-এ গুছিয়ে দেওয়াই কোম্পানির সেই যুক্তির কেন্দ্র, যে Gemini Robotics 2 কেবল incremental upgrade নয়, বরং আরও বিস্তৃত control architecture।

source আরও বলছে, developers early access-এর জন্য waitlist-এর মাধ্যমে আবেদন করতে পারেন। এটি advanced AI systems-এ একটি পরিচিত rollout pattern নির্দেশ করে: প্রথমে public announcement, তারপর controlled access, এবং performance ও safety গ্রহণযোগ্য প্রমাণিত হলে পরে wider deployment। Developers-এর জন্য near-term implication তাৎক্ষণিক production deployment-এর চেয়ে evaluation, prototyping, এবং modelটি বিদ্যমান robotics stacks-এ কোথায় ফিট করে তা বোঝার সঙ্গে বেশি সম্পর্কিত।

দ্বিতীয় model embodied reasoning-এ মনোযোগ দেয়

Gemini Robotics 2-এর পাশাপাশি Google DeepMind Gemini Robotics ER 2-ও উন্মোচন করেছে। “ER” label embodied reasoning বোঝায়, যা source text-এ physical world বুঝে সেই বোঝাপড়ার ভিত্তিতে কী action নেওয়া উচিত তা নির্ধারণ করার ক্ষমতা হিসেবে বর্ণিত। অন্য কথায়, modelটি low-level execution-এর চেয়ে robotic systems-এর higher-level interpretation এবং decision support-এ বেশি মনোযোগী।

DeepMind বলছে, ER 2 Gemini Robotics ER 1.6-কে প্রতিস্থাপন করছে, যা April-এ প্রকাশিত হয়েছিল। এই দ্রুত succession দেখায়, এমন একটি ক্ষেত্রে কোম্পানি দ্রুত iteration করছে যেখানে model usefulness general AI capability এবং robotics-specific tuning-এর মিশ্রণের ওপর নির্ভরশীল। উল্লেখযোগ্য distribution detail হলো ER 2 Google AI Studio-তে উপলব্ধ, যা developers-কে stack-এর reasoning side পরীক্ষা করার আরও সরাসরি পথ দেয়; broader Robotics 2 control modelটি early access-এর মাধ্যমে gated।

একটি general control model এবং একটি reasoning model-এ বিভাজন robotics AI-র একটি broader design trend-ও প্রতিফলিত করে। Companies increasingly “robot কী করা উচিত?” এবং “robot সেটি physically কীভাবে করবে?” - এই সমস্যাগুলো আলাদা করছে। একটি reasoning system task ভাঙতে, scene interpret করতে, এবং sequence plan করতে সাহায্য করতে পারে, আর control model সেই plans-কে movement-এ রূপান্তর করে। DeepMind-এর product structure এই বিভাজনের সঙ্গেই মেলে।

লঞ্চটি কেন গুরুত্বপূর্ণ

এই ঘোষণা পরবর্তী প্রজন্মের robots-এর software foundation নির্ধারণে বাড়তে থাকা প্রতিযোগিতায় আরও যোগ করেছে। Industry কঠোরভাবে scripted automation থেকে এমন systems-এর দিকে যাচ্ছে যা কম predictable settings-এর সঙ্গে মানিয়ে নিতে পারে। Warehouses, factories, labs, এবং শেষ পর্যন্ত public-facing environments এমন robots-কে পুরস্কৃত করে যারা প্রতিটি edge case-এর জন্য exhaustive manual programming ছাড়াই variation সামলাতে পারে।

DeepMind-এর framing ইঙ্গিত দেয় যে তারা multimodal foundation models-কে সেই adaptability-র পথ হিসেবে দেখে। যদি একটি robot language instructions ব্যাখ্যা করতে পারে, visual scene parse করতে পারে, এবং tasks across actions generalize করতে পারে, তবে developers কম custom code দিয়ে আরও flexible products তৈরি করতে পারেন। এটি safety, latency, calibration, hardware integration, এবং evaluation-এর মতো কঠিন engineering কাজ দূর করে না। তবে এটি stack-এর সবচেয়ে কঠিন সমস্যাগুলো কোথায় থাকে তা বদলে দিতে পারে।

Google-এর জন্য এখানেও একটি strategic point আছে। Software side generalize করতে না পারায় robotics অতীতে কখনও দ্রুত এগিয়েছে, কখনও থেমে গেছে। Robotics-কে কোম্পানির flagship AI model ecosystem-এর সঙ্গে আরও সরাসরি যুক্ত করে, Google DeepMind কার্যত বলছে যে general multimodal AI-তে অগ্রগতি এখন embodied systems-এ অগ্রগতিতে রূপান্তর করা যায়। Robotics-কে আলাদা research track হিসেবে দেখার চেয়ে এটি বেশি শক্তিশালী commercial story।

এরপর কী দেখার আছে

  • Early-access developers নির্দিষ্ট robots-এ সীমাবদ্ধ demos নয়, বরং শক্তিশালী cross-platform performance রিপোর্ট করেন কি না।
  • বিভিন্ন embodiments এবং safety constraints-এর জন্য Gemini Robotics 2 অভিযোজিত করতে এখনও কতটা integration work প্রয়োজন।
  • Google AI Studio-তে ER 2, DeepMind-এর immediate ecosystem-এর বাইরে থাকা robotics developers-এর জন্য practical planning tool হয়ে ওঠে কি না।
  • General-purpose robot software platforms তৈরির প্রতিযোগিতা তীব্র হলে rivals কীভাবে প্রতিক্রিয়া জানায়।

এখনকার জন্য, এই launch-কে সর্বত্র ব্যাপক সক্ষম robots প্রস্তুত হওয়ার প্রমাণ না ভেবে একটি গুরুত্বপূর্ণ product এবং platform signal হিসেবে দেখা ভালো। তবে এটি দেখায়, শীর্ষ AI labs-এর একটি বাজার কোন দিকে যাচ্ছে বলে মনে করছে: reusable, multimodal intelligence layers-এর দিকে, যা বিভিন্ন ধরনের machines-এর ওপর বসতে পারে এবং বাস্তব দুনিয়ায় সেগুলোকে আরও adaptable করে তুলতে পারে।

এই article The Decoder-এর reporting-এর ওপর ভিত্তি করে। মূল article পড়ুন.

Originally published on the-decoder.com