ரோபோ மாடல்களை பெரிதாக்குவதற்கு முன் ரோபோ தரவைப் பெருக்க வேண்டும் என Xiaomi வலியுறுத்துகிறது

Xiaomi, Xiaomi-Robotics-1 என்ற புதிய ரோபோட்டிக்ஸ் மாடலை வெளியிட்டுள்ளது; இது அடுத்த கட்ட ரோபோ அமைப்புகளை பயிற்றுப்பதில் தாக்கம் செலுத்தக்கூடிய ஒரு கருத்தை முன்வைக்கிறது: நிஜ உலகில் பொருட்களை கையாளும் இயந்திரங்களுக்கு, பெரிய மாடல்களைக் காட்டிலும் அதிக தரவு முக்கியமாக இருக்கலாம்.

இந்த முடிவு, பயிற்சி தரவு மற்றும் கணிப்பொறி வளம் அதிகரிக்கும் போது செயல்திறன் பெரும்பாலும் மேம்படும் பெரிய மொழி மாடல்களின் பழக்கமான முறையை நினைவூட்டுகிறது. ஆனால் ரோபோட்டிக்ஸில் வேறொரு தடையுள்ளது. உரை மாடல்கள் பொதுவான இணையத்தைப் பயன்படுத்தலாம். ரோபோ மாடல்கள் முடியாது. பிடித்தல், தூக்குதல், இடமாற்றம் செய்தல், அறிமுகமில்லாத சூழல்களுக்கு தழுவுதல் ஆகியவற்றுக்கான பயனுள்ள தரவைச் சேகரிப்பது கடினம், லேபிள் செய்வது செலவானது, மேலும் பொதுவாக குறுகிய வன்பொருள் அமைப்புகளுடன் கட்டுப்பட்டதாக இருக்கும்.

Xiaomi-யின் அணுகுமுறை குறிப்பிடத்தக்கது, ஏனெனில் அது பெரும்பாலும் விலையுயர்ந்த உடல் ரோபோப் படைகளில் சார்ந்து இல்லாமல் அந்த bottleneck-ஐ உடைக்க முயல்கிறது. அதற்கு பதிலாக, கேமராக்களுடன் கூடிய எடுத்துச் செல்லக்கூடிய கையடக்க gripper-களைப் பயன்படுத்தி தனது pretraining தரவின் பெரும்பகுதியை சேகரித்ததாக நிறுவனம் கூறுகிறது. மக்கள் அந்த கருவிகளை நேரடியாகக் கையால் நிஜ சூழல்களில் இயக்கி, சமையலறைகள், அலுவலகங்கள், கடைகள், தொழிற்சாலை தளங்கள், வெளிப்புற இடங்கள் போன்றவற்றில் உள்ள manipulation பணிகளைப் பதிவு செய்தனர்.

இதன் விளைவாக, 1,700-க்கும் அதிகமான பல்வேறு சூழல்களிலிருந்து சேகரிக்கப்பட்ட 1,00,000 மணி நேரத்திற்கும் அதிகமான இயக்கப் பதிவுகள் கொண்ட dataset உருவானது என்று நிறுவனம் கூறுகிறது. ரோபோ learning systems பொதுவாக குறுகிய சேகரிப்பு ஓட்டங்களில் பார்க்கும் அமைப்புகள், பொருட்கள், நடைமுறைகளைத் தாண்டி பொதுமைப்படுத்துவதில் சிரமப்படுவதால் இந்த அளவு முக்கியமானது. ஆரம்ப தரவு சேகரிப்பு கட்டத்தில் முழு ரோபோ தளங்களுக்கு பதிலாக கையடக்க உபகரணங்களைப் பயன்படுத்துவதன் மூலம், Xiaomi அதிகமான அனுபவத்தை வேகமாகவும் குறைந்த செலவிலும் சேகரிக்க முடியும் என வாதிடுகிறது.

ரோபோட்டிக்ஸின் தரவு பற்றாக்குறைக்கு வேறொரு தீர்வு

ரோபோ பொருள்-கையாளல் தரவைச் சேகரிக்கும் வழக்கமான முறை மெதுவானது. ஒரு மனிதர் தொலைநிலையிலிருந்து ரோபோவை பணிகளில் நகர்வடியாக வழிநடத்துகிறார்; அந்த இயந்திரத்தின் சென்சார்கள், மூட்டுகள், gripper ஆகியவற்றுக்கு ஏற்ப தனிப்பயனாக்கப்பட்ட உதாரணங்கள் உருவாகின்றன. இந்த முறை வேலை செய்யலாம், ஆனால் அது எளிதில் பெரிதாக்க முடியாது; மேலும் பெரும்பாலும் ஒத்த சூழல்களில் இருந்து மீண்டும் மீண்டும் கிடைக்கும் மாதிரிகளையே வழங்குகிறது.

முன்பயிற்சி தரவுத்தொகுப்பின் கண்ணோட்டம், இதில் வீடுகள், அலுவலகங்கள், தொழில்துறை தளங்கள், உணவகங்கள், வணிக இடங்கள், வெளிப்புற சூழல்கள் ஆகியவற்றின் கேமரா காட்சிகள், 100K hours, 1.7K scenarios, 2.4M episodes, 260+ tasks என்ற முக்கிய எண்ணிக்கைகள் மற்றும் பொருட்கள், வினைகளுக்கான word clouds ஆகியவை காட்டப்படுகின்றன.
முன்பயிற்சி தரவு சுமார் 100,000 மணி நேர UMI பதிவுகளிலிருந்து வருகிறது, இது 1,700-க்கும் அதிகமான வெவ்வேறு சூழல்களில் சேகரிக்கப்பட்டது. | Image: Xiaomi

Xiaomi-யின் கையடக்க அமைப்பு அந்த வரம்பைக் கடக்கவே வடிவமைக்கப்பட்டுள்ளது. ஒருவர் gripper-ஐ பல்வேறு இடங்களுக்கு எடுத்துச் சென்று நேரடியாகப் பயன்படுத்த முடிவதால், ஒரு ரோபோப் படை பொதுவாக எட்டாத பல சூழல்களில் இருந்து எடுத்துக்காட்டுகளை நிறுவனம் சேகரிக்க முடிகிறது. எனினும், இது transfer சிக்கலை முற்றிலும் நீக்காது. கையடக்க gripper, சக்கரங்களுள்ள ரோபோவோ அல்லது இரண்டு கை கொண்ட அமைப்போ ஒன்றல்ல. மனிதர் இயக்கிய கருவியின் இயக்கப் படிமங்கள் உண்மையான ரோபோக்களின் உடல் கட்டுப்பாடுகள் மற்றும் control systems-க்கு எப்படி பொருந்துகின்றன என்பதை மாடல் இன்னும் கற்றுக்கொள்ள வேண்டும்.

பின்னர் கட்டங்களில் இந்த pretrained system-ஐ wheel-based platforms மற்றும் dual-arm systems உள்ளிட்ட உடல் ரோபோக்களுக்கு மாற்றி அந்தச் சிக்கலை சமாளித்ததாக Xiaomi கூறுகிறது. post-training-க்காக, நிறுவனம் தன் சொந்த உண்மையான அபார்ட்மென்ட் பதிவுகளை open-source robot datasets மற்றும் annotated UMI data-வுடன் இணைத்தது. இதனால் உருவாகும் படம் ஒரு அடுக்கான pipeline: பரந்த அளவில் மற்றும் குறைந்த செலவில் manipulation அனுபவத்தை சேகரிக்கவும், அதை scale-இல் label செய்யவும், பின்னர் உண்மையில் பணியைச் செய்யும் hardware-க்கு அது பொருந்தும்படி மாற்றவும்.

இதனால் ரோபோட்டிக்ஸ் துறைக்கு முக்கியமான தாக்கம் இருக்கலாம், ஏனெனில் இந்தத் துறை நீண்ட காலமாக ஒரு சிக்கலான பொருத்தமின்மையைச் சந்தித்து வந்தது. ஆராய்ச்சியாளர்கள் பொதுப் பயன்பாட்டு ரோபோ நடத்தை வேண்டுகிறார்கள், ஆனால் அதை பயிற்றுவிக்க வேண்டிய தரவு கட்டமைப்பு பெரும்பாலும் உள்ளூர், தனிப்பயன், மற்றும் செலவானதாகவே இருந்துள்ளது. ரோபோ AI-யின் முன்னேற்றம் பாரம்பரிய ரோபோட்டிக்ஸ் பொறியியலைவிட foundation model development போல அதிகமாக இருக்கலாம்; அதில் pretraining corpora-வின் தரம், அளவு, பல்வகைமை ஆகியவை மூலதன சொத்தாக மாறுகின்றன என்று Xiaomi அடிப்படையில் வாதிடுகிறது.

தானியங்கி லேபிளிங் பெரிய அளவிலான சேகரிப்பை நடைமுறையாக மாற்றுகிறது

1,00,000 மணி நேர manipulation data-ஐ சேகரிப்பது பாதி பிரச்சினை மட்டுமே. அந்த பதிவுகளுக்கு மாடல் கற்றுக்கொள்ளக்கூடிய விளக்கங்களும் தேவை. அந்த அளவில் கையேடு லேபிளிங் நடைமுறையில் சாத்தியமில்லை என Xiaomi கூறுகிறது; எனவே ஒவ்வொரு இயக்கப் பகுதியுக்கும் உரை விளக்கங்களை உருவாக்க மற்றொரு AI அமைப்பை பயன்படுத்தியது. சுமார் இரண்டு வாரங்களில் முழு dataset-ஐ லேபிள் செய்ததாக நிறுவனம் கூறுகிறது.

இந்த படி முக்கியமானது, ஏனெனில் பேசப்பட்ட அல்லது எழுதப்பட்ட கட்டளைகளைப் பின்பற்ற உருவாக்கப்பட்ட ரோபோ மாடல்களுக்கு இயக்கம் மற்றும் மொழிக்கிடையே ஒரு பாலம் தேவை. லேபிள் தரம் உயர்ந்தால், உரை இலக்குகளை உடலியல் செயல்கள் மற்றும் காட்சிப் மாற்றங்களுடன் இணைக்க மாடல் தொடங்கலாம். லேபிள்கள் பலவீனமாக அல்லது முரணாக இருந்தால், அளவு மட்டும் செயல்திறனை காப்பாற்றாது. Xiaomi-யின் தெரிவிக்கப்பட்ட காலக்கெடு, robotics-இல் automated annotation ஒரு வசதியாக மட்டுமல்ல, பரந்த பொதுமைப்படுத்தலை ஆதரிக்கப் போதுமான பெரிய dataset-களை உருவாக்குவதற்கான முன் நிபந்தனையாகவும் மாறி வருவதாகக் காட்டுகிறது.

அந்த மாடல் அறிமுகமில்லாத சூழல்களில் முன் அனுபவமின்றி பேசப்பட்ட அல்லது எழுதப்பட்ட கட்டளைகளைப் பின்பற்றி, குறைந்த கூடுதல் பயிற்சியுடன் புதிய பணிகளுக்கு தழுவும் வகையில் வடிவமைக்கப்பட்டுள்ளது. இது உயர்ந்த இலக்காக இருந்தாலும், இது தொழில்துறையில் ஒரு பரந்த முயற்சியுடன் பொருந்துகிறது: task-specific robot policies-இலிருந்து பல்வேறு சூழல்கள் மற்றும் கட்டளைகளுக்கிடையில் அறிவைப் பரிமாறக்கூடிய systems-ஐ நோக்கிச் செல்லும் முயற்சி.

post-training தரவின் மூன்று பகுதிகளைக் காட்டும் கண்ணோட்டம்; இதில் நிறுவனம் சேகரித்த ரோபோ பதிவுகள், mobile manipulator மற்றும் dual-arm robot காட்சிப்படுத்தல்கள், open-source robot data, instruction labels உடன் UMI data ஆகியவை இடம்பெற்றுள்ளன.
Post-training-க்காக Xiaomi உண்மையான அபார்ட்மென்ட்களில் இருந்து தனது பதிவுகளை open-source robot datasets மற்றும் annotated UMI data-வுடன் இணைக்கிறது. | Image: Xiaomi

Xiaomi-யின் முடிவு ஏன் ஒரே ஒரு model release-ஐ விட அதிகம் முக்கியம்

Xiaomi-யின் சோதனைகளில், model size-ஐ அதிகரிப்பதால் செயல்திறன் மேம்பட்டது; ஆனால் training data-வை அதிகரித்தது மிகப் பெரிய பலன்களைத் தந்தது. இதுவே முக்கிய takeaway. இது Xiaomi-யின் உள்மதிப்பீட்டிற்கும் அப்பால் நிலைத்தால், சிறந்த robot manipulation-க்கு விரைவான வழி மிகப்பெரிய architectures மட்டும் அல்ல என்பதைச் சுட்டிக்காட்டும். அது மேலும் செறிவான, மேலும் பல்வகைமையான physical experience-ஐ சேகரித்து, அதை மொழியுடன் scale-இல் இணைப்பதற்கான திறனாக இருக்கலாம்.

இதற்கு நிறுவனங்கள் மூலதனத்தை எப்படி ஒதுக்குகின்றன என்பதில் நடைமுறை விளைவுகள் உள்ளன. பெரிய மாடல்கள் அதிக compute-ஐ தேவைப்படுத்தும்; ஆனால் பெரிய மற்றும் பல்வகையான dataset-கள் collection systems, annotation pipelines, storage, curation, transfer methods ஆகியவற்றை தேவைப்படுத்தும், அவை நிஜ உலகின் குழப்பமான வேறுபாடுகளை ஏற்றுக்கொள்ளக் கூடியவை. அந்த செயல்பாட்டு பிரச்சினைகளைத் தீர்க்கும் நிறுவனம், மாடல் scaling மட்டும் மூலம் நகலெடுக்க கடினமான ஒரு முன்னிலை பெறலாம்.

இது ரோபோட்டிக்ஸில் ஒரு முக்கியக் கேள்வியையும் மறுபரிசீலிக்கிறது: ஒரு மாடல் எவ்வளவு அறிவார்ந்தது என்பதல்ல, அது physical world-இன் எவ்வளவு பகுதியைப் பார்த்திருக்கிறது என்பதுதான். மொழி மாடல்களுக்கு இணையம் அந்த பரப்பை வழங்கியது. ரோபோக்களுக்கு அத்தகைய off-the-shelf corpus இல்லை. Xiaomi-யின் வேலை, அத்தகைய corpus-ஐ தானாகக் கிடைக்கக் காத்திருப்பதற்குப் பதிலாக புதிய கருவிகள் மற்றும் பணிச்சூழல்களால் துறையே உருவாக்க வேண்டியிருக்கலாம் என்பதைக் காட்டுகிறது.

இன்னும் சில திறந்த கேள்விகள் உள்ளன. வழங்கப்பட்ட பொருட்களில் independent benchmarking விவரங்கள், deployment முடிவுகள், அல்லது குறிப்பிட்ட பணிகளில் failure rates இல்லை. மிகவும் வேறுபட்ட robot வடிவங்களுக்கு மாற்றும்போது மாடல் எவ்வளவு நன்றாக செயல்திறனைத் தக்கவைக்கிறது என்பதும் காட்டப்படவில்லை. இருப்பினும், இந்த release தலைப்புச் செய்திகளில் வரும் model size-இலிருந்து attention-ஐ data generation என்ற குறைவான glamor கொண்ட பிரச்சினைக்குத் திருப்புவதால் தனித்துப் பிரிகிறது.

வீடுகள், வேலை இடங்கள், மற்றும் பொதுவிடங்களில் இயங்கக்கூடிய இயந்திரங்களை உருவாக்க ஆவலாக உள்ள துறைக்கு, அதுவே அதிக முக்கியத்துவம் வாய்ந்த மாற்றமாக இருக்கலாம். Xiaomi ஒரு robot model-ஐ மட்டும் முன்வைக்கவில்லை. அது robot AI-யில் அடுத்த முன்னேற்றம் எங்கிருந்து வரும் என்பதற்கான ஒரு வாதத்தை முன்வைக்கிறது: physical world-உடன் விரிவான தொடர்பு, போதுமான அளவு மற்றும் பல்வகைமையில் பதிவு செய்யப்பட்டு, ரோபோக்கள் நவீன AI-க்கு நெருக்கமான அளவில் அனுபவத்திலிருந்து கற்றுக்கொள்ளத் தொடங்க முடியும் வகையில்.

இந்தக் கட்டுரை The Decoder செய்தியை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.

Originally published on the-decoder.com