Google अधिक व्यापक control model सह आपला robotics stack विस्तारत आहे

Google DeepMind ने Gemini Robotics 2 सादर केले आहे, जे एक नवे vision-language-action model आहे आणि कंपनीच्या म्हणण्यानुसार ते खूप वेगवेगळ्या प्रकारच्या robots साठी एक common control layer म्हणून काम करू शकते. स्रोत सामग्रीत वर्णन केलेल्या घोषणेनुसार, हे model tabletop arms पासून full-body humanoid robots पर्यंतच्या systems वर काम करण्यासाठी तयार केले आहे, ज्यामुळे physical world मध्ये काम करू शकणाऱ्या software मध्ये मोठ्या multimodal models चे रूपांतर करण्याचा Google चा प्रयत्न पुढे जातो.

हे release महत्त्वाचे आहे, कारण robotics developers ना बराच काळ fragmentation समस्येला सामोरे जावे लागले आहे. जी models एका machine type किंवा task वर चांगले काम करतात, त्यांना अनेकदा दुसऱ्या body plan, sensor setup, किंवा environment हाताळण्यापूर्वी मोठ्या प्रमाणात adaptation ची गरज असते. DeepMind Gemini Robotics 2 ला अधिक general foundation कडे नेणारे पाऊल म्हणून मांडत आहे: एक model family जी images समजू शकते, language process करू शकते, आणि त्या inputs ना hardware च्या विस्तृत श्रेणीत actions मध्ये रूपांतरित करू शकते.

हे positioning technical दाव्यापलीकडेही महत्त्वाचे आहे. प्रत्यक्षात, robots साठी एक “intelligence layer” असा market सूचित करतो जिथे core perception, reasoning, आणि control software अनेक platforms वर पुन्हा वापरता येऊ शकते, तर hardware makers mechanics, reliability, cost, आणि deployment यांद्वारे वेगळेपण आणतात. हा approach प्रत्यक्ष जगातील testing मध्ये टिकून राहिला, तर logistics, industrial handling, research, आणि service applications साठी adaptive robots तयार करण्यातील अडथळा कमी होऊ शकतो.

नवीन model काय करू शकते असे DeepMind म्हणते

source text Gemini Robotics 2 ला आतापर्यंतचे DeepMind चे सर्वात advanced vision-language-action model असे वर्णन करते. Vision-language-action systems visual understanding, natural-language interpretation, आणि motor control एकत्र करतात, ज्यामुळे robot तो काय पाहतो, त्याला काय करायला सांगितले आहे, आणि मग physical response कसा द्यायचा हे जोडू शकतो.

DeepMind चे म्हणणे आहे की नवीन model full-body movement हाताळू शकते, fine motor tasks पार पाडू शकते, आणि multiple robots coordinate करू शकते. या तीन खूप वेगळ्या गरजा आहेत. Full-body motion साठी व्यापक spatial planning आणि balance-related control आवश्यक असते. Fine motor work अधिक अचूक manipulation वर अवलंबून असते. Multi-robot coordination timing आणि shared-task complexity आणते. या क्षमतांना एका platform मध्ये एकत्र करणे हे Gemini Robotics 2 फक्त incremental upgrade नाही, तर अधिक व्यापक control architecture आहे या कंपनीच्या युक्तिवादाचा केंद्रबिंदू आहे.

source असेही सांगते की developers early access साठी waitlist द्वारे अर्ज करू शकतात. हे advanced AI systems मध्ये एक परिचित rollout pattern सूचित करते: आधी public announcement, नंतर controlled access, आणि performance व safety स्वीकारार्ह सिद्ध झाल्यावर wider deployment. Developers साठी near-term implication हे लगेच production deployment पेक्षा evaluation, prototyping, आणि model सध्याच्या robotics stacks मध्ये कुठे बसते हे समजून घेण्याशी अधिक संबंधित आहे.

दुसरे model embodied reasoning वर लक्ष केंद्रित करते

Gemini Robotics 2 सोबत, Google DeepMind ने Gemini Robotics ER 2 देखील सादर केले आहे. “ER” हे embodied reasoning कडे निर्देश करते, ज्याचे वर्णन source text मध्ये physical world समजून घेणे आणि त्या समजुतीच्या आधारे कोणती actions घ्यायची ते ठरवणे असे केले आहे. दुसऱ्या शब्दांत, हे model low-level execution पेक्षा robotic systems साठी higher-level interpretation आणि decision support वर अधिक केंद्रित आहे.

DeepMind चे म्हणणे आहे की ER 2, Gemini Robotics ER 1.6 ची जागा घेत आहे, जो April मध्ये प्रसिद्ध झाला होता. ही जलद succession सूचित करते की ज्या क्षेत्रात model usefulness general AI capability आणि robotics-specific tuning यांच्या मिश्रणावर अवलंबून असते, तिथे कंपनी वेगाने iterate करत आहे. महत्त्वाचा distribution तपशील असा की ER 2 Google AI Studio मध्ये उपलब्ध आहे, ज्यामुळे developers ना stack च्या reasoning side ची चाचणी घेण्यासाठी अधिक थेट मार्ग मिळतो, तर व्यापक Robotics 2 control model early access द्वारे gated आहे.

एक general control model आणि एक reasoning model अशा विभाजनात robotics AI मधील व्यापक design trend देखील दिसतो. Companies increasingly “robot ने काय करायला हवे?” आणि “robot ने ते physically कसे करायला हवे?” या समस्यांना वेगळे करत आहेत. एक reasoning system tasks चे decomposition, scenes चे interpretation, आणि sequences चे planning करण्यात मदत करू शकतो, तर control model त्या plans ना movement मध्ये रूपांतरित करू शकतो. DeepMind ची product structure या विभागणीशी सुसंगत दिसते.

Launch का महत्त्वाचा आहे

ही घोषणा पुढील पिढीच्या robots साठी software foundation ठरवण्याच्या वाढत्या स्पर्धेत भर घालते. उद्योग कठोरपणे scripted automation मधून अशा systems कडे जात आहे जे कमी predictable settings मध्ये स्वतःला adapt करू शकतात. Warehouses, factories, labs, आणि शेवटी public-facing environments अशा robots ना प्राधान्य देतात जे प्रत्येक edge case साठी exhaustive manual programming शिवाय variation हाताळू शकतात.

DeepMind ची framing सूचित करते की ते multimodal foundation models ना त्या adaptability चा मार्ग मानते. जर एखादा robot language instructions समजू शकत असेल, visual scene parse करू शकत असेल, आणि tasks across actions generalize करू शकत असेल, तर developers कमी custom code सह अधिक flexible products तयार करू शकतात. यामुळे safety, latency, calibration, hardware integration, आणि evaluation भोवतीचे कठीण engineering work नाहीसे होत नाही. पण त्यामुळे stack मधील सर्वात कठीण समस्या कुठे आहेत ते बदलू शकते.

Google साठी येथे एक strategic point देखील आहे. Software बाजू generalize करण्यात अडचणी आल्यामुळे robotics कधी वेगाने वाढले, तर कधी थांबले. Robotics ला कंपनीच्या flagship AI model ecosystem शी अधिक थेट जोडून, Google DeepMind प्रत्यक्षात असा युक्तिवाद करत आहे की general multimodal AI मधील प्रगती आता embodied systems मधील प्रगतीमध्ये रूपांतरित केली जाऊ शकते. Robotics ला स्वतंत्र research track म्हणून पाहण्यापेक्षा ही अधिक मजबूत commercial story आहे.

पुढे काय पाहायचे

  • Early-access developers विशिष्ट robots शी जोडलेल्या narrow demos ऐवजी मजबूत cross-platform performance नोंदवतात का.
  • विविध embodiments आणि safety constraints साठी Gemini Robotics 2 adapt करण्यासाठी अजून किती integration work लागते.
  • Google AI Studio मधील ER 2, DeepMind च्या तात्काळ ecosystem बाहेरील robotics developers साठी practical planning tool बनते का.
  • General-purpose robot software platforms तयार करण्याची शर्यत वेग घेत असताना rivals कशी प्रतिक्रिया देतात.

सध्या, या launch कडे सर्वत्र broadly capable robots तयार आहेत याचा पुरावा म्हणून न पाहता, एक महत्त्वाचा product आणि platform signal म्हणून पाहणे योग्य ठरेल. पण हे दाखवते की मोठ्या AI labs पैकी एक market कोणत्या दिशेने जात आहे असे मानते: reusable, multimodal intelligence layers कडे, जे अनेक प्रकारच्या machines च्या वर बसू शकतात आणि त्यांना प्रत्यक्ष जगात अधिक adaptable बनवू शकतात.

हा लेख The Decoder च्या reporting वर आधारित आहे. मूळ लेख वाचा.

Originally published on the-decoder.com