Google broader control model के साथ अपने robotics stack का विस्तार करता है
Google DeepMind ने Gemini Robotics 2 पेश किया है, एक नया vision-language-action model जिसे कंपनी का कहना है कि यह बहुत अलग प्रकार के robots के लिए एक सामान्य control layer के रूप में काम कर सकता है। स्रोत सामग्री में दिए गए announcement के अनुसार, यह model tabletop arms से लेकर full-body humanoid robots तक के systems पर काम करने के लिए बनाया गया है, और Google के उस प्रयास को आगे बढ़ाता है जिसमें बड़े multimodal models को ऐसे software में बदला जा रहा है जो physical world में काम कर सके।
यह release महत्वपूर्ण है क्योंकि robotics developers लंबे समय से fragmentation problem का सामना कर रहे हैं। जो models एक machine type या task पर अच्छा प्रदर्शन करते हैं, उन्हें अक्सर किसी अलग body plan, sensor setup, या environment को संभालने से पहले पर्याप्त adaptation की जरूरत होती है। DeepMind Gemini Robotics 2 को एक अधिक general foundation की ओर कदम के रूप में प्रस्तुत कर रहा है: एक ऐसा model family जो images की व्याख्या कर सके, language process कर सके, और इन inputs को hardware की अधिक विस्तृत variety में actions में बदल सके।
यह positioning तकनीकी दावे से भी आगे महत्वपूर्ण है। व्यावहारिक रूप से, robots के लिए एक “intelligence layer” ऐसे market का संकेत देती है जिसमें core perception, reasoning, और control software कई platforms में फिर से उपयोग किया जा सकता है, जबकि hardware makers mechanics, reliability, cost, और deployment के आधार पर अलग पहचान बनाते हैं। यदि यह approach वास्तविक दुनिया के परीक्षणों में टिकती है, तो यह logistics, industrial handling, research, और service applications के लिए adaptive robots बनाने की बाधा कम कर सकती है।
DeepMind का कहना है कि नया model क्या कर सकता है
Source text Gemini Robotics 2 को अब तक का DeepMind का सबसे advanced vision-language-action model बताता है। Vision-language-action systems visual understanding, natural-language interpretation, और motor control को जोड़ते हैं, जिससे robot यह समझ सकता है कि वह क्या देख रहा है, उसे क्या करने को कहा गया है, और फिर एक physical response दे सकता है।
DeepMind का कहना है कि नया model full-body movement संभाल सकता है, fine motor tasks कर सकता है, और multiple robots का coordination कर सकता है। ये तीनों बहुत अलग मांगें हैं। Full-body motion के लिए व्यापक spatial planning और balance-related control चाहिए। Fine motor work अधिक precise manipulation पर निर्भर करता है। Multi-robot coordination timing और shared-task complexity जोड़ता है। इन capabilities को एक platform में पैक करना कंपनी के इस तर्क का केंद्र है कि Gemini Robotics 2 सिर्फ एक incremental upgrade नहीं, बल्कि एक व्यापक control architecture है।
Source यह भी कहता है कि developers early access के लिए waitlist के माध्यम से आवेदन कर सकते हैं। यह advanced AI systems में एक परिचित rollout pattern का संकेत है: पहले public announcement, फिर controlled access, और performance तथा safety पर्याप्त होने पर बाद में व्यापक deployment। Developers के लिए निकट-कालीन implication तत्काल production deployment से कम और evaluation, prototyping, तथा यह समझने से अधिक जुड़ा है कि model मौजूदा robotics stacks में कहां फिट बैठता है।
एक दूसरा model embodied reasoning पर केंद्रित है
Gemini Robotics 2 के साथ-साथ, Google DeepMind ने Gemini Robotics ER 2 भी पेश किया है। “ER” label embodied reasoning को संदर्भित करता है, जिसे source text physical world को समझने और उस समझ के आधार पर क्या actions लेने हैं, यह तय करने के रूप में वर्णित करता है। दूसरे शब्दों में, यह model low-level execution से कम और robotic systems के लिए higher-level interpretation तथा decision support से अधिक जुड़ा है।
DeepMind का कहना है कि ER 2, Gemini Robotics ER 1.6 की जगह लेता है, जिसे April में जारी किया गया था। यह तेज़ succession दिखाता है कि कंपनी एक ऐसे क्षेत्र में तेज़ी से iteration कर रही है जहां model usefulness सामान्य AI capability और robotics-specific tuning के मिश्रण पर निर्भर करती है। एक उल्लेखनीय distribution detail यह है कि ER 2 Google AI Studio में उपलब्ध है, जिससे developers को broader Robotics 2 control model की तुलना में stack के reasoning side को test करने का अधिक प्रत्यक्ष मार्ग मिलता है, जिसे early access के माध्यम से gate किया जा रहा है।
एक general control model और एक reasoning model के बीच का split robotics AI में एक व्यापक design trend को भी दर्शाता है। कंपनियां increasingly इस समस्या को अलग कर रही हैं कि “robot को क्या करना चाहिए?” और “robot को वह physically कैसे करना चाहिए?” एक reasoning system tasks को तोड़ने, scenes की व्याख्या करने, और sequences की planning में मदद कर सकता है, जबकि एक control model उन plans को movement में बदल सकता है। DeepMind की product structure इसी division के अनुरूप दिखती है।
यह लॉन्च क्यों महत्वपूर्ण है
यह announcement next-generation robots के लिए software foundation को परिभाषित करने की बढ़ती प्रतिस्पर्धा में और इज़ाफ़ा करता है। उद्योग tightly scripted automation से आगे बढ़कर ऐसे systems की ओर जा रहा है जो कम predictable settings के अनुकूल हो सकें। Warehouses, factories, labs, और अंततः public-facing environments उन robots को पुरस्कृत करते हैं जो हर edge case के लिए exhaustive manual programming के बिना variation संभाल सकें।
DeepMind की framing से लगता है कि वह multimodal foundation models को इसी adaptability का रास्ता मानता है। यदि कोई robot language instructions की व्याख्या कर सकता है, visual scene parse कर सकता है, और tasks के बीच actions को generalize कर सकता है, तो developers कम custom code के साथ अधिक flexible products बना सकते हैं। इससे safety, latency, calibration, hardware integration, और evaluation से जुड़ा कठिन engineering work खत्म नहीं होता। लेकिन यह stack में सबसे कठिन समस्याएं कहां स्थित हैं, यह बदल सकता है।
Google के लिए यहां एक strategic point भी है। Robotics समय-समय पर तेज़ी से बढ़ी और रुकी है क्योंकि software side generalize करने में संघर्ष करती रही। Robotics को कंपनी के flagship AI model ecosystem से अधिक सीधे जोड़कर Google DeepMind प्रभावी रूप से यह तर्क दे रहा है कि general multimodal AI में प्रगति को अब embodied systems में प्रगति में बदला जा सकता है। यह robotics को एक largely अलग research track मानने की तुलना में एक मजबूत commercial story है।
आगे क्या देखें
- क्या early-access developers specific robots से जुड़े narrow demos के बजाय मजबूत cross-platform performance रिपोर्ट करते हैं।
- Gemini Robotics 2 को अलग-अलग embodiments और safety constraints के अनुसार ढालने के लिए अभी कितना integration work चाहिए।
- क्या Google AI Studio में ER 2, DeepMind के immediate ecosystem के बाहर robotics developers के लिए एक practical planning tool बनता है।
- General-purpose robot software platforms बनाने की दौड़ तेज़ होने पर rivals कैसे प्रतिक्रिया देते हैं।
फिलहाल, इस लॉन्च को इस रूप में पढ़ना सबसे उचित है कि यह एक महत्वपूर्ण product और platform signal है, न कि यह प्रमाण कि व्यापक रूप से सक्षम robots हर जगह scale करने के लिए तैयार हैं। लेकिन यह दिखाता है कि प्रमुख AI labs में से एक बाजार को किस दिशा में जाता हुआ देख रहा है: reusable, multimodal intelligence layers की ओर, जो कई प्रकार की machines के ऊपर बैठ सकें और उन्हें वास्तविक दुनिया में अधिक adaptable बना सकें।
यह लेख The Decoder की reporting पर आधारित है। मूल लेख पढ़ें.
Originally published on the-decoder.com


