மேலும் பரந்த control model மூலம் Google தனது robotics stack-ஐ விரிவாக்குகிறது
Google DeepMind, Gemini Robotics 2-ஐ அறிமுகப்படுத்தியுள்ளது; இது ஒரு புதிய vision-language-action model, மற்றும் பல்வேறு வகையான robots-க்கு ஒரு பொதுவான control layer ஆக செயல்பட முடியும் என்று நிறுவனம் கூறுகிறது. மூலப் பொருளில் விவரிக்கப்பட்ட அறிவிப்பின்படி, இந்த model tabletop arms முதல் full-body humanoid robots வரை உள்ள systems-இல் வேலை செய்யும் நோக்கத்துடன் உருவாக்கப்பட்டுள்ளது; இது physical world-இல் செயல்படக்கூடிய software-ஆக பெரிய multimodal models-ஐ மாற்றும் Google-ன் முயற்சியை மேலும் விரிவாக்குகிறது.
இந்த release முக்கியமானது, ஏனெனில் robotics developers நீண்ட காலமாக fragmentation பிரச்சினையை எதிர்கொண்டு வருகின்றனர். ஒரு machine type அல்லது task-இல் சிறப்பாக செயல்படும் models, வேறொரு body plan, sensor setup, அல்லது environment-ஐ கையாளுவதற்கு முன் பெரும்பாலும் கணிசமான adaptation தேவைப்படுகிறது. Gemini Robotics 2-ஐ ஒரு மேலும் general foundation-ஐ நோக்கிய படியாக DeepMind முன்வைக்கிறது: images-ஐ புரிந்துகொள்ள, language-ஐ process செய்ய, மற்றும் அந்த inputs-ஐ பல்வேறு hardware-களில் actions-ஆக மாற்றக்கூடிய ஒரு model family.
இந்த positioning technical claim-ஐத் தாண்டியும் முக்கியமானது. நடைமுறையில், robots-க்கான ஒரு “intelligence layer” என்பது core perception, reasoning, மற்றும் control software-ஐ பல platforms-இல் மீண்டும் பயன்படுத்த முடியும் ஒரு market-ஐ குறிக்கிறது, அதேசமயம் hardware makers mechanics, reliability, cost, மற்றும் deployment மூலம் வேறுபடுகின்றனர். இந்த approach உண்மை உலக testing-இல் உறுதியாக இருந்தால், logistics, industrial handling, research, மற்றும் service applications-க்கான adaptive robots உருவாக்குவதற்கான தடையை குறைக்கலாம்.
புதிய model என்ன செய்ய முடியும் என்று DeepMind கூறுகிறது
மூல உரை Gemini Robotics 2-ஐ இதுவரை உள்ள DeepMind-ன் மிக முன்னேறிய vision-language-action model என விவரிக்கிறது. Vision-language-action systems visual understanding, natural-language interpretation, மற்றும் motor control-ஐ ஒன்றிணைக்கின்றன; இதனால் ஒரு robot அது என்ன பார்க்கிறது, அதற்கு என்ன செய்ய சொல்லப்படுகிறது, மற்றும் பின்னர் physical response-ஐ செயல்படுத்துவது ஆகியவற்றை இணைக்க முடிகிறது.
புதிய model full-body movement-ஐ நிர்வகிக்க, fine motor tasks-ஐ செய்ய, மற்றும் பல robots-ஐ coordinate செய்ய முடியும் என்று DeepMind கூறுகிறது. இவை மூன்றும் முற்றிலும் வேறுபட்ட தேவைகள். Full-body motion-க்கு விரிவான spatial planning மற்றும் balance-related control தேவை. Fine motor work துல்லியமான manipulation-ஐ சார்ந்தது. Multi-robot coordination timing மற்றும் shared-task complexity-ஐ அறிமுகப்படுத்துகிறது. இந்த திறன்களை ஒரே platform-இல் தொகுப்பது Gemini Robotics 2 ஒரு incremental upgrade மட்டும் அல்ல, ஒரு broader control architecture என்பதற்கான நிறுவனத்தின் வாதத்தின் மையமாக உள்ளது.
மேலும், developers early access-க்கு waitlist மூலம் விண்ணப்பிக்கலாம் என்றும் மூலத்தில் குறிப்பிடப்பட்டுள்ளது. இது advanced AI systems-இல் ஒரு பரிச்சயமான rollout pattern-ஐ குறிக்கிறது: முதலில் public announcement, பின்னர் controlled access, அதன் பின் performance மற்றும் safety ஏற்றுக்கொள்ளத்தக்கவையாக இருந்தால் wider deployment. Developers-க்கு உடனடி விளைவு production deployment-ஐ விட evaluation, prototyping, மற்றும் model தற்போதுள்ள robotics stacks-இல் எங்கு பொருந்துகிறது என்பதைப் புரிந்துகொள்வதோடு அதிகம் தொடர்புடையது.
இரண்டாவது model embodied reasoning-இல் கவனம் செலுத்துகிறது
Gemini Robotics 2-க்குடன், Google DeepMind Gemini Robotics ER 2-ஐயும் அறிமுகப்படுத்தியுள்ளது. “ER” என்பது embodied reasoning-ஐ குறிக்கிறது; இது physical world-ஐப் புரிந்துகொண்டு, அந்த புரிதலின் அடிப்படையில் எந்த actions எடுக்க வேண்டும் என்பதை தீர்மானிப்பதாக மூல உரை விளக்குகிறது. வேறு வார்த்தைகளில், இந்த model குறைந்த நிலை execution-ஐ விட, robotic systems-க்கான உயர்நிலை interpretation மற்றும் decision support-இல் அதிகம் கவனம் செலுத்துகிறது.
ER 2, April மாதத்தில் வெளியிடப்பட்ட Gemini Robotics ER 1.6-ஐ மாற்றுகிறது என்று DeepMind கூறுகிறது. இந்த விரைவான மாற்றம், general AI capability மற்றும் robotics-specific tuning ஆகியவற்றின் சேர்க்கையை சார்ந்திருக்கும் ஒரு துறையில் நிறுவனம் வேகமாக iterate செய்து வருவதை சுட்டுகிறது. குறிப்பிடத்தக்க distribution விவரம் என்னவெனில் ER 2 Google AI Studio-வில் கிடைக்கிறது; இதனால் developers-க்கு broader Robotics 2 control model early access வழியாக கட்டுப்படுத்தப்பட்டிருப்பதை விட stack-ன் reasoning side-ஐ சோதிக்க நேரடியான வழி கிடைக்கிறது.
ஒரு general control model மற்றும் ஒரு reasoning model எனப் பிரிப்பது robotics AI-இல் காணப்படும் broader design trend-ஐயும் பிரதிபலிக்கிறது. Companies increasingly “robot என்ன செய்ய வேண்டும்?” என்பதையும் “robot அதை physical-ஆக எப்படி செய்ய வேண்டும்?” என்பதையும் தனித்தனியாக பார்க்கின்றன. ஒரு reasoning system tasks-ஐ உடைத்துப் பார்க்க, scenes-ஐ interpret செய்ய, மற்றும் sequences-ஐ plan செய்ய உதவலாம்; control model அந்த plans-ஐ movement-ஆக மாற்றுகிறது. DeepMind-ன் product structure இந்த division-க்கு இணையாகத் தோன்றுகிறது.
Launch ஏன் முக்கியம்
இந்த அறிவிப்பு அடுத்த தலைமுறை robots-க்கான software foundation-ஐ வரையறுப்பதில் அதிகரித்து வரும் போட்டிக்கு மேலும் சேர்க்கிறது. தொழில் கடுமையாக script செய்யப்பட்ட automation-ஐத் தாண்டி, குறைவாக predictable environments-க்கு ஏற்ப தங்களை மாற்றிக்கொள்ளக்கூடிய systems-ஐ நோக்கி நகர்கிறது. Warehouses, factories, labs, மற்றும் இறுதியில் public-facing environments ஆகியவை, ஒவ்வொரு edge case-க்கும் exhaustive manual programming தேவையில்லாமல் variation-ஐ கையாளக்கூடிய robots-ஐ விரும்புகின்றன.
DeepMind-ன் framing, multimodal foundation models-ஐ அந்த adaptability-க்கான பாதையாகப் பார்க்கிறது என்பதைக் காட்டுகிறது. ஒரு robot மொழி அறிவுறுத்தல்களைப் புரிந்துகொள்ள, visual scene-ஐ parse செய்ய, மற்றும் tasks across actions-ஐ generalize செய்ய முடிந்தால், developers குறைந்த custom code-உடன் அதிக flexible products-ஐ உருவாக்க முடியும். இது safety, latency, calibration, hardware integration, மற்றும் evaluation தொடர்பான கடின engineering work-ஐ நீக்கவில்லை. ஆனால் stack-இல் கடினமான பிரச்சினைகள் எங்கு இருக்கின்றன என்பதை மாற்ற முடியும்.
Google-க்கான ஒரு strategic point-உம் இங்கே உள்ளது. Software பக்கம் generalize செய்ய முடியாமல் இருந்ததால் robotics காலப்போக்கில் சில நேரங்களில் வேகமாக வளர்ந்து பின்னர் மந்தமானது. Robotics-ஐ நிறுவனத்தின் flagship AI model ecosystem-உடன் நேரடியாக இணைப்பதன் மூலம், Google DeepMind பொதுவான multimodal AI-இல் ஏற்பட்ட முன்னேற்றத்தை embodied systems-இல் முன்னேற்றமாக மாற்றலாம் என்று வாதிடுகிறது. Robotics-ஐ பெரும்பாலும் தனியான research track-ஆகப் பார்ப்பதை விட இது வலுவான commercial story ஆகும்.
அடுத்து என்னைக் கவனிக்க வேண்டும்
- Early-access developers குறிப்பிட்ட robots-க்கு மட்டும் கட்டுப்பட்ட demos-ஐ விட வலுவான cross-platform performance-ஐ தெரிவிக்கிறார்களா என்பதை.
- விவித embodiments மற்றும் safety constraints-க்கு Gemini Robotics 2-ஐ ஏற்படுத்த இன்னும் எவ்வளவு integration work தேவைப்படுகிறது என்பதை.
- Google AI Studio-வில் ER 2, DeepMind-ன் உடனடி ecosystem-க்கு வெளியே உள்ள robotics developers-க்கு ஒரு நடைமுறை planning tool ஆக மாறுகிறதா என்பதை.
- General-purpose robot software platforms உருவாக்கும் போட்டி வேகமடையும் நிலையில் rivals எப்படி பதிலளிக்கிறார்கள் என்பதை.
தற்போது, இந்த launch-ஐ எல்லா இடங்களிலும் அளவிடத் தயாரான broadly capable robots-ன் சான்றாக அல்ல, ஒரு முக்கிய product மற்றும் platform signal ஆகப் பார்க்குவது சிறந்தது. ஆனால், பெரிய AI labs-இல் ஒன்றானது market எந்த திசையில் செல்கிறது என்று நம்புகிறது என்பதையும் இது காட்டுகிறது: பல வகை machines-க்கு மேலாக அமையக்கூடிய, மீண்டும் பயன்படுத்தக்கூடிய, multimodal intelligence layers நோக்கி, அவற்றை உண்மை உலகில் மேலும் adaptable ஆக்குவது.
இந்தக் கட்டுரை The Decoder-இன் செய்தியறிக்கையை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.
Originally published on the-decoder.com

