DeepMind ने अपनी रोबोटिक्स पेशकश का दायरा बढ़ाया
Google DeepMind ने Gemini Robotics 2 पेश किया है, जिसे उसने ऐसे रोबोटिक सिस्टमों से एक कदम आगे बताया है जो केवल बाहों या टेबलटॉप मैनिपुलेशन तक सीमित हैं, और व्यापक पूरे-शरीर स्वायत्तता की दिशा में बढ़ते हैं। The Robot Report के अनुसार, यह अपडेटेड vision-language-action मॉडल बुद्धिमान पूरे-शरीर नियंत्रण, अधिक निपुणता और कई रोबोटों के साथ मिलकर काम करने के समर्थन को जोड़ता है।
यह घोषणा इसलिए महत्वपूर्ण है क्योंकि यह रोबोटिक्स में लंबे समय से मौजूद एक अंतर को लक्ष्य बनाती है। कई सिस्टम नियंत्रित परिवेशों में सावधानी से चरणबद्ध मैनिपुलेशन कार्य कर सकते हैं, लेकिन बहुत कम सिस्टम ऐसे हैं जो धारणा, भाषा समझ और समन्वित गति को एक पूरे humanoid शरीर में जोड़ सकें। DeepMind का दावा है कि Gemini Robotics 2 रोबोटों को चलने, झुकने, खिंचने और वस्तुओं को संभालने जैसी गतियों के बारे में एक ही कार्य के हिस्से के रूप में तर्क करने की अनुमति देकर उस सीमा के करीब पहुंचता है।
इसका यह मतलब नहीं है कि सामान्य-उद्देश्य humanoids आ चुके हैं। रिपोर्ट यह स्पष्ट करती है कि गति की रफ्तार में अभी सुधार की जरूरत है। लेकिन यह इस रिलीज़ को multimodal AI को टेबलटॉप डेमो स्तर से आगे बढ़ाकर अधिक यथार्थवादी भौतिक काम के लिए एक नियंत्रक में बदलने की दिशा में एक महत्वपूर्ण कदम के रूप में प्रस्तुत करती है।
ऊपरी शरीर के डेमो से पूरे-शरीर की क्रिया तक
DeepMind के पहले के मॉडल टेबलटॉप कार्यों के लिए ऊपरी शरीर के नियंत्रण पर केंद्रित थे। इसके विपरीत, Gemini Robotics 2 को पूरे रोबोट शरीर को प्रबंधित करने वाला बताया गया है। The Robot Report के अनुसार, यह सिस्टम उपयोगकर्ता की मंशा को समन्वित पूरे-शरीर गति में बदल सकता है, जिससे humanoid को स्थान नेविगेट करने और ऐसे कार्य पूरे करने में मदद मिलती है जिनमें locomotion और manipulation दोनों शामिल हों।
रिपोर्ट में एक उदाहरण Apptronik के Apollo 2 humanoid robot का उपयोग करता है। जब उसे निर्देश दिया गया कि पानी देने वाले कैन को नीचे वाली शेल्फ पर हरे bin में रखा जाए, तो कहा गया कि रोबोट ने अनुरोध को समझा, एक टेबल तक चला, वस्तु उठाई, कमरे के पार गया और उसे तय जगह पर रख दिया। यह क्रम इसलिए उल्लेखनीय है क्योंकि कोई भी एकल कदम अभूतपूर्व नहीं है, बल्कि इसलिए कि यह प्राकृतिक भाषा निर्देश, वस्तु संभालने, चलने और सटीक स्थान-निर्धारण को एक सतत व्यवहार में जोड़ता है।
यदि ये क्षमताएं नियंत्रित डेमो के बाहर भी मजबूत साबित होती हैं, तो वे इस बात का व्यावहारिक विस्तार होंगी कि humanoid platforms क्या करने का प्रयास कर सकते हैं। गोदाम, प्रयोगशालाएं और सेवा-आधारित वातावरण अक्सर एक स्थिर वर्कस्टेशन में अलग-थलग बांह आंदोलनों के बजाय mobility और manipulation के इसी मिश्रण की मांग करते हैं।
निपुणता और सहयोग अन्य प्रमुख विशेषताएं हैं
DeepMind अधिक सूक्ष्म मोटर नियंत्रण पर भी जोर दे रहा है। The Robot Report के अनुसार, Gemini Robotics 2 Apollo 2 पर मौजूद पांच उंगलियों वाले, 22-degree-of-freedom SharpaWave hand को नियंत्रित कर सकता है। यह संकेत देता है कि कंपनी केवल gross motor movement पर ही नहीं, बल्कि उपयोगी grasping और placement के लिए जरूरी अधिक सूक्ष्म उंगली और हाथ के व्यवहार पर भी काम कर रही है।
वास्तविक दुनिया की रोबोटिक्स में dexterity अब भी सबसे कठिन हिस्सों में से एक है। जो रोबोट कमरे में चल सकता है, उसका मूल्य सीमित होगा यदि वह मिश्रित वस्तुओं को भरोसेमंद ढंग से पकड़ न सके, उन्हें सही दिशा में न रख सके और अव्यवस्थित वातावरण के साथ बातचीत न कर सके। उन्नत hand control को प्रमुखता देकर DeepMind यह संकेत दे रहा है कि वह अपने robotics stack को केवल navigation और language interpretation ही नहीं, बल्कि manipulation समस्या के बड़े हिस्से को भी कवर करने लायक बनाना चाहता है।
कंपनी multi-robot collaboration भी पेश कर रही है। रिपोर्ट के अनुसार, Gemini Robotics ER 2, जो vision-language model agent के रूप में बनाया गया एक embodied reasoning model है, रोबोटों को लोगों से संवाद करने, भौतिक दुनिया को समझने और कई मिनट तक चलने वाले बहु-चरणीय कार्यों की योजना बनाने में मदद करने के लिए डिजाइन किया गया है। DeepMind उस reasoning layer को ऐसे रोबोट समूहों की आधारशिला के रूप में पेश कर रहा है जो अलग-अलग मशीनों की तरह काम करने के बजाय एक साथ मिलकर काम करें।
यह बिंदु रणनीतिक रूप से महत्वपूर्ण है। औद्योगिक स्वचालन में, किसी robotics system का मूल्य अक्सर कई मशीनों और workflows के बीच orchestration पर निर्भर करता है। यदि AI मॉडल handoffs का समन्वय कर सकें या रोबोटों के बीच काम बांट सकें, तो deployment economics अधिक लचीले automation के पक्ष में बदल सकती है।
ऑन-डिवाइस निष्पादन deployment को व्यापक बना सकता है
एक और उल्लेखनीय तत्व local execution है। The Robot Report के अनुसार, Gemini Robotics 2 on-device चल सकता है और कुछ ही घंटों में पूरी तरह नए robot bodies के अनुसार खुद को अनुकूलित कर सकता है। DeepMind ने अलग से Gemini Robotics On-Device 2 पेश किया है, जिसके बारे में वह कहता है कि यह robotic hardware पर स्थानीय रूप से चलने के लिए अनुकूलित है और कुछ घंटों के डेटा के साथ नए embodiments के अनुसार ढल सकता है।
यह दावा रोबोटिक्स deployment की दो वास्तविक बाधाओं को संबोधित करता है। पहला, cloud पर निर्भरता latency, reliability संबंधी चिंताएं और operational complexity बढ़ा सकती है। दूसरा, robotics developers हर नए platform के लिए सिस्टम को शुरू से retrain नहीं करना चाहते। ऐसा model जिसे अलग-अलग embodiments के लिए जल्दी retarget किया जा सके, hardware makers और enterprise customers के लिए अधिक आकर्षक होगा जो integration cycles को छोटा करना चाहते हैं।
हालांकि, उपलब्धता अभी भी सीमित है। The Robot Report के अनुसार, Gemini Robotics ER 2 Google AI Studio पर और Gemini Enterprise Agent Platform में private preview के रूप में उपलब्ध है, जबकि VLA और on-device models early-access partners को दिए जा रहे हैं। इसका मतलब है कि यह घोषणा अभी भी व्यापक product release के बजाय एक नियंत्रित rollout के करीब है।
भौतिक AI के लिए यह रिलीज़ क्या संकेत देती है
बड़ा संदेश यह है कि प्रमुख AI कंपनियां केवल डिजिटल assistants ही नहीं, बल्कि भौतिक प्रणालियों में भी अधिक आक्रामक रूप से प्रवेश कर रही हैं। DeepMind की framing से लगता है कि वह robotics को अगला ऐसा क्षेत्र मानता है जहां multimodal models को समझ को action से जोड़ने की क्षमता साबित करनी होगी। Language, vision और planning उपयोगी हैं, लेकिन robotics में उनका महत्व तभी है जब वे वास्तविक, अव्यवस्थित जगहों में भरोसेमंद गति पैदा करें।
Gemini Robotics 2 यह तय नहीं करता कि humanoids ही सही form factor हैं या नहीं, और न ही यह साबित करता है कि foundation-model-style control ने reliability समस्या हल कर दी है। लेकिन यह यह जरूर दिखाता है कि क्षेत्र किस दिशा में जा रहा है: ऐसे models की ओर जो अलग-अलग robot bodies में सामान्यीकरण कर सकें, स्थानीय रूप से निष्पादित हो सकें, locomotion और dexterity दोनों का उपयोग कर सकें, और multi-step tasks पर दूसरे robots के साथ समन्वय कर सकें।
यह क्यों मायने रखता है
- यह रिलीज़ AI नियंत्रण को tabletop manipulation से आगे बढ़ाकर पूरे-शरीर की रोबोटिक गति तक ले जाती है।
- DeepMind locomotion को dexterous hand control के साथ जोड़ रहा है, जो व्यावहारिक काम के लिए एक प्रमुख आवश्यकता है।
- On-device operation और तेज़ adaptation नए hardware के लिए integration बाधाओं को कम कर सकते हैं।
- Multi-robot collaboration एकल-उद्देश्य मशीनों के बजाय व्यापक automation systems की ओर इशारा करती है।
तुरंत परीक्षण यह होगा कि क्या early-access partners इन क्षमताओं को शोकेस परिदृश्यों से बाहर भी दोहरा सकते हैं। यदि वे ऐसा कर पाते हैं, तो Gemini Robotics 2 multimodal AI demonstrations से अधिक सक्षम भौतिक automation की ओर संक्रमण में एक महत्वपूर्ण संकेतक बन सकता है।
यह लेख The Robot Report की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें.
Originally published on therobotreport.com



