ரோபோ மாடல்களை பெரிதாக்குவதற்கு முன் ரோபோ தரவைப் பெருக்க வேண்டும் என Xiaomi வலியுறுத்துகிறது
Xiaomi, Xiaomi-Robotics-1 என்ற புதிய ரோபோட்டிக்ஸ் மாடலை வெளியிட்டுள்ளது; இது அடுத்த கட்ட ரோபோ அமைப்புகளை பயிற்றுப்பதில் தாக்கம் செலுத்தக்கூடிய ஒரு கருத்தை முன்வைக்கிறது: நிஜ உலகில் பொருட்களை கையாளும் இயந்திரங்களுக்கு, பெரிய மாடல்களைக் காட்டிலும் அதிக தரவு முக்கியமாக இருக்கலாம்.
இந்த முடிவு, பயிற்சி தரவு மற்றும் கணிப்பொறி வளம் அதிகரிக்கும் போது செயல்திறன் பெரும்பாலும் மேம்படும் பெரிய மொழி மாடல்களின் பழக்கமான முறையை நினைவூட்டுகிறது. ஆனால் ரோபோட்டிக்ஸில் வேறொரு தடையுள்ளது. உரை மாடல்கள் பொதுவான இணையத்தைப் பயன்படுத்தலாம். ரோபோ மாடல்கள் முடியாது. பிடித்தல், தூக்குதல், இடமாற்றம் செய்தல், அறிமுகமில்லாத சூழல்களுக்கு தழுவுதல் ஆகியவற்றுக்கான பயனுள்ள தரவைச் சேகரிப்பது கடினம், லேபிள் செய்வது செலவானது, மேலும் பொதுவாக குறுகிய வன்பொருள் அமைப்புகளுடன் கட்டுப்பட்டதாக இருக்கும்.
Xiaomi-யின் அணுகுமுறை குறிப்பிடத்தக்கது, ஏனெனில் அது பெரும்பாலும் விலையுயர்ந்த உடல் ரோபோப் படைகளில் சார்ந்து இல்லாமல் அந்த bottleneck-ஐ உடைக்க முயல்கிறது. அதற்கு பதிலாக, கேமராக்களுடன் கூடிய எடுத்துச் செல்லக்கூடிய கையடக்க gripper-களைப் பயன்படுத்தி தனது pretraining தரவின் பெரும்பகுதியை சேகரித்ததாக நிறுவனம் கூறுகிறது. மக்கள் அந்த கருவிகளை நேரடியாகக் கையால் நிஜ சூழல்களில் இயக்கி, சமையலறைகள், அலுவலகங்கள், கடைகள், தொழிற்சாலை தளங்கள், வெளிப்புற இடங்கள் போன்றவற்றில் உள்ள manipulation பணிகளைப் பதிவு செய்தனர்.
இதன் விளைவாக, 1,700-க்கும் அதிகமான பல்வேறு சூழல்களிலிருந்து சேகரிக்கப்பட்ட 1,00,000 மணி நேரத்திற்கும் அதிகமான இயக்கப் பதிவுகள் கொண்ட dataset உருவானது என்று நிறுவனம் கூறுகிறது. ரோபோ learning systems பொதுவாக குறுகிய சேகரிப்பு ஓட்டங்களில் பார்க்கும் அமைப்புகள், பொருட்கள், நடைமுறைகளைத் தாண்டி பொதுமைப்படுத்துவதில் சிரமப்படுவதால் இந்த அளவு முக்கியமானது. ஆரம்ப தரவு சேகரிப்பு கட்டத்தில் முழு ரோபோ தளங்களுக்கு பதிலாக கையடக்க உபகரணங்களைப் பயன்படுத்துவதன் மூலம், Xiaomi அதிகமான அனுபவத்தை வேகமாகவும் குறைந்த செலவிலும் சேகரிக்க முடியும் என வாதிடுகிறது.
ரோபோட்டிக்ஸின் தரவு பற்றாக்குறைக்கு வேறொரு தீர்வு
ரோபோ பொருள்-கையாளல் தரவைச் சேகரிக்கும் வழக்கமான முறை மெதுவானது. ஒரு மனிதர் தொலைநிலையிலிருந்து ரோபோவை பணிகளில் நகர்வடியாக வழிநடத்துகிறார்; அந்த இயந்திரத்தின் சென்சார்கள், மூட்டுகள், gripper ஆகியவற்றுக்கு ஏற்ப தனிப்பயனாக்கப்பட்ட உதாரணங்கள் உருவாகின்றன. இந்த முறை வேலை செய்யலாம், ஆனால் அது எளிதில் பெரிதாக்க முடியாது; மேலும் பெரும்பாலும் ஒத்த சூழல்களில் இருந்து மீண்டும் மீண்டும் கிடைக்கும் மாதிரிகளையே வழங்குகிறது.

Xiaomi-யின் கையடக்க அமைப்பு அந்த வரம்பைக் கடக்கவே வடிவமைக்கப்பட்டுள்ளது. ஒருவர் gripper-ஐ பல்வேறு இடங்களுக்கு எடுத்துச் சென்று நேரடியாகப் பயன்படுத்த முடிவதால், ஒரு ரோபோப் படை பொதுவாக எட்டாத பல சூழல்களில் இருந்து எடுத்துக்காட்டுகளை நிறுவனம் சேகரிக்க முடிகிறது. எனினும், இது transfer சிக்கலை முற்றிலும் நீக்காது. கையடக்க gripper, சக்கரங்களுள்ள ரோபோவோ அல்லது இரண்டு கை கொண்ட அமைப்போ ஒன்றல்ல. மனிதர் இயக்கிய கருவியின் இயக்கப் படிமங்கள் உண்மையான ரோபோக்களின் உடல் கட்டுப்பாடுகள் மற்றும் control systems-க்கு எப்படி பொருந்துகின்றன என்பதை மாடல் இன்னும் கற்றுக்கொள்ள வேண்டும்.
பின்னர் கட்டங்களில் இந்த pretrained system-ஐ wheel-based platforms மற்றும் dual-arm systems உள்ளிட்ட உடல் ரோபோக்களுக்கு மாற்றி அந்தச் சிக்கலை சமாளித்ததாக Xiaomi கூறுகிறது. post-training-க்காக, நிறுவனம் தன் சொந்த உண்மையான அபார்ட்மென்ட் பதிவுகளை open-source robot datasets மற்றும் annotated UMI data-வுடன் இணைத்தது. இதனால் உருவாகும் படம் ஒரு அடுக்கான pipeline: பரந்த அளவில் மற்றும் குறைந்த செலவில் manipulation அனுபவத்தை சேகரிக்கவும், அதை scale-இல் label செய்யவும், பின்னர் உண்மையில் பணியைச் செய்யும் hardware-க்கு அது பொருந்தும்படி மாற்றவும்.
இதனால் ரோபோட்டிக்ஸ் துறைக்கு முக்கியமான தாக்கம் இருக்கலாம், ஏனெனில் இந்தத் துறை நீண்ட காலமாக ஒரு சிக்கலான பொருத்தமின்மையைச் சந்தித்து வந்தது. ஆராய்ச்சியாளர்கள் பொதுப் பயன்பாட்டு ரோபோ நடத்தை வேண்டுகிறார்கள், ஆனால் அதை பயிற்றுவிக்க வேண்டிய தரவு கட்டமைப்பு பெரும்பாலும் உள்ளூர், தனிப்பயன், மற்றும் செலவானதாகவே இருந்துள்ளது. ரோபோ AI-யின் முன்னேற்றம் பாரம்பரிய ரோபோட்டிக்ஸ் பொறியியலைவிட foundation model development போல அதிகமாக இருக்கலாம்; அதில் pretraining corpora-வின் தரம், அளவு, பல்வகைமை ஆகியவை மூலதன சொத்தாக மாறுகின்றன என்று Xiaomi அடிப்படையில் வாதிடுகிறது.
தானியங்கி லேபிளிங் பெரிய அளவிலான சேகரிப்பை நடைமுறையாக மாற்றுகிறது
1,00,000 மணி நேர manipulation data-ஐ சேகரிப்பது பாதி பிரச்சினை மட்டுமே. அந்த பதிவுகளுக்கு மாடல் கற்றுக்கொள்ளக்கூடிய விளக்கங்களும் தேவை. அந்த அளவில் கையேடு லேபிளிங் நடைமுறையில் சாத்தியமில்லை என Xiaomi கூறுகிறது; எனவே ஒவ்வொரு இயக்கப் பகுதியுக்கும் உரை விளக்கங்களை உருவாக்க மற்றொரு AI அமைப்பை பயன்படுத்தியது. சுமார் இரண்டு வாரங்களில் முழு dataset-ஐ லேபிள் செய்ததாக நிறுவனம் கூறுகிறது.
இந்த படி முக்கியமானது, ஏனெனில் பேசப்பட்ட அல்லது எழுதப்பட்ட கட்டளைகளைப் பின்பற்ற உருவாக்கப்பட்ட ரோபோ மாடல்களுக்கு இயக்கம் மற்றும் மொழிக்கிடையே ஒரு பாலம் தேவை. லேபிள் தரம் உயர்ந்தால், உரை இலக்குகளை உடலியல் செயல்கள் மற்றும் காட்சிப் மாற்றங்களுடன் இணைக்க மாடல் தொடங்கலாம். லேபிள்கள் பலவீனமாக அல்லது முரணாக இருந்தால், அளவு மட்டும் செயல்திறனை காப்பாற்றாது. Xiaomi-யின் தெரிவிக்கப்பட்ட காலக்கெடு, robotics-இல் automated annotation ஒரு வசதியாக மட்டுமல்ல, பரந்த பொதுமைப்படுத்தலை ஆதரிக்கப் போதுமான பெரிய dataset-களை உருவாக்குவதற்கான முன் நிபந்தனையாகவும் மாறி வருவதாகக் காட்டுகிறது.
அந்த மாடல் அறிமுகமில்லாத சூழல்களில் முன் அனுபவமின்றி பேசப்பட்ட அல்லது எழுதப்பட்ட கட்டளைகளைப் பின்பற்றி, குறைந்த கூடுதல் பயிற்சியுடன் புதிய பணிகளுக்கு தழுவும் வகையில் வடிவமைக்கப்பட்டுள்ளது. இது உயர்ந்த இலக்காக இருந்தாலும், இது தொழில்துறையில் ஒரு பரந்த முயற்சியுடன் பொருந்துகிறது: task-specific robot policies-இலிருந்து பல்வேறு சூழல்கள் மற்றும் கட்டளைகளுக்கிடையில் அறிவைப் பரிமாறக்கூடிய systems-ஐ நோக்கிச் செல்லும் முயற்சி.

Xiaomi-யின் முடிவு ஏன் ஒரே ஒரு model release-ஐ விட அதிகம் முக்கியம்
Xiaomi-யின் சோதனைகளில், model size-ஐ அதிகரிப்பதால் செயல்திறன் மேம்பட்டது; ஆனால் training data-வை அதிகரித்தது மிகப் பெரிய பலன்களைத் தந்தது. இதுவே முக்கிய takeaway. இது Xiaomi-யின் உள்மதிப்பீட்டிற்கும் அப்பால் நிலைத்தால், சிறந்த robot manipulation-க்கு விரைவான வழி மிகப்பெரிய architectures மட்டும் அல்ல என்பதைச் சுட்டிக்காட்டும். அது மேலும் செறிவான, மேலும் பல்வகைமையான physical experience-ஐ சேகரித்து, அதை மொழியுடன் scale-இல் இணைப்பதற்கான திறனாக இருக்கலாம்.
இதற்கு நிறுவனங்கள் மூலதனத்தை எப்படி ஒதுக்குகின்றன என்பதில் நடைமுறை விளைவுகள் உள்ளன. பெரிய மாடல்கள் அதிக compute-ஐ தேவைப்படுத்தும்; ஆனால் பெரிய மற்றும் பல்வகையான dataset-கள் collection systems, annotation pipelines, storage, curation, transfer methods ஆகியவற்றை தேவைப்படுத்தும், அவை நிஜ உலகின் குழப்பமான வேறுபாடுகளை ஏற்றுக்கொள்ளக் கூடியவை. அந்த செயல்பாட்டு பிரச்சினைகளைத் தீர்க்கும் நிறுவனம், மாடல் scaling மட்டும் மூலம் நகலெடுக்க கடினமான ஒரு முன்னிலை பெறலாம்.
இது ரோபோட்டிக்ஸில் ஒரு முக்கியக் கேள்வியையும் மறுபரிசீலிக்கிறது: ஒரு மாடல் எவ்வளவு அறிவார்ந்தது என்பதல்ல, அது physical world-இன் எவ்வளவு பகுதியைப் பார்த்திருக்கிறது என்பதுதான். மொழி மாடல்களுக்கு இணையம் அந்த பரப்பை வழங்கியது. ரோபோக்களுக்கு அத்தகைய off-the-shelf corpus இல்லை. Xiaomi-யின் வேலை, அத்தகைய corpus-ஐ தானாகக் கிடைக்கக் காத்திருப்பதற்குப் பதிலாக புதிய கருவிகள் மற்றும் பணிச்சூழல்களால் துறையே உருவாக்க வேண்டியிருக்கலாம் என்பதைக் காட்டுகிறது.
இன்னும் சில திறந்த கேள்விகள் உள்ளன. வழங்கப்பட்ட பொருட்களில் independent benchmarking விவரங்கள், deployment முடிவுகள், அல்லது குறிப்பிட்ட பணிகளில் failure rates இல்லை. மிகவும் வேறுபட்ட robot வடிவங்களுக்கு மாற்றும்போது மாடல் எவ்வளவு நன்றாக செயல்திறனைத் தக்கவைக்கிறது என்பதும் காட்டப்படவில்லை. இருப்பினும், இந்த release தலைப்புச் செய்திகளில் வரும் model size-இலிருந்து attention-ஐ data generation என்ற குறைவான glamor கொண்ட பிரச்சினைக்குத் திருப்புவதால் தனித்துப் பிரிகிறது.
வீடுகள், வேலை இடங்கள், மற்றும் பொதுவிடங்களில் இயங்கக்கூடிய இயந்திரங்களை உருவாக்க ஆவலாக உள்ள துறைக்கு, அதுவே அதிக முக்கியத்துவம் வாய்ந்த மாற்றமாக இருக்கலாம். Xiaomi ஒரு robot model-ஐ மட்டும் முன்வைக்கவில்லை. அது robot AI-யில் அடுத்த முன்னேற்றம் எங்கிருந்து வரும் என்பதற்கான ஒரு வாதத்தை முன்வைக்கிறது: physical world-உடன் விரிவான தொடர்பு, போதுமான அளவு மற்றும் பல்வகைமையில் பதிவு செய்யப்பட்டு, ரோபோக்கள் நவீன AI-க்கு நெருக்கமான அளவில் அனுபவத்திலிருந்து கற்றுக்கொள்ளத் தொடங்க முடியும் வகையில்.
இந்தக் கட்டுரை The Decoder செய்தியை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.
Originally published on the-decoder.com

