రోబో మోడళ్లను పెద్దవిగా చేయకముందు రోబో డేటాను విస్తరించాలని Xiaomi వాదిస్తోంది

Xiaomi కొత్త robotics model అయిన Xiaomi-Robotics-1‌ను విడుదల చేసింది. ఇది తదుపరి తరం robot systems శిక్షణను తీర్చిదిద్దగల ఒక వాదనపై ఆధారపడింది: వాస్తవ ప్రపంచంలో వస్తువులను నిర్వహించే యంత్రాల విషయంలో, పెద్ద మోడళ్లకన్నా ఎక్కువ data ముఖ్యం కావచ్చు.

ఈ తుది అభిప్రాయం పెద్ద language models‌లో కనిపించే పరిచిత నమూనాను గుర్తు చేస్తుంది; training data మరియు compute పెరిగే కొద్దీ performance సాధారణంగా మెరుగవుతుంది. కానీ robotics‌లో వేరే bottleneck ఉంది. text models‌కి విస్తృత public internet అందుబాటులో ఉంటుంది. robot models‌కి కాదు. grasping, lifting, placing, unfamiliar spaces‌కు adapt అవడం కోసం ఉపయోగకరమైన data సేకరించడం చాలా కష్టం, label చేయడం మరింత ఖరీదు, మరియు సాధారణంగా narrow hardware setups‌కు మాత్రమే పరిమితం అవుతుంది.

Xiaomi విధానం గమనించదగ్గది, ఎందుకంటే అది ప్రధానంగా ఖరీదైన physical robot fleets‌పై ఆధారపడకుండా ఈ bottleneck‌ను అధిగమించడానికి ప్రయత్నిస్తోంది. బదులుగా, cameras‌తో కూడిన portable handheld grippers ఉపయోగించి pretraining dataలో ఎక్కువ భాగాన్ని సేకరించినట్లు కంపెనీ చెబుతోంది. ప్రజలు వాటిని నేరుగా చేతితో నిజ జీవిత పరిసరాల్లో ఉపయోగించి, kitchens, offices, stores, factory floors, outdoor settings వంటి ప్రదేశాల్లో manipulation tasks‌ను capture చేశారు.

దీని ఫలితంగా, 1,700 కంటే ఎక్కువ వేర్వేరు environments‌లో సేకరించిన 1,00,000 గంటలకుపైగా motion recordings ఉన్న dataset ఏర్పడిందని కంపెనీ చెబుతోంది. ఈ scale ముఖ్యమైంది, ఎందుకంటే robot learning systems సాధారణంగా పరిమిత collection runs‌లో చూసిన layouts, objects, routines‌లకు మించి generalize కావడంలో ఇబ్బంది పడతాయి. ప్రారంభ data-gathering దశలో full robot platforms‌కు బదులుగా handheld equipment ఉపయోగించడం ద్వారా, Xiaomi విస్తృత అనుభవాన్ని వేగంగా, తక్కువ ఖర్చుతో సేకరించగలమని వాదిస్తోంది.

రోబోటిక్స్‌లో data shortage‌కు భిన్నమైన సమాధానం

robot manipulation data సేకరించడానికి standard method నెమ్మదైనది. ఒక వ్యక్తి రోబోట్‌ను రిమోట్‌గా task-by-task movements ద్వారా నడిపిస్తాడు, దాంతో ఆ machine sensors, joints, grippers‌కు అనుకూలమైన demonstrations రూపొందుతాయి. ఈ method పని చేయగలదు, కానీ పెద్ద స్థాయికి సులభంగా విస్తరించదు, మరియు తరచూ ఒకే తరహా environments‌ నుంచి పునరావృత samples‌ను ఇస్తుంది.

pretraining dataset యొక్క అవలోకనం, ఇందులో households, offices, industrial sites, restaurants, commercial spaces, outdoor settings‌ల నుంచి camera footage, అలాగే 100K hours, 1.7K scenarios, 2.4M episodes, 260+ tasks వంటి ముఖ్య గణాంకాలు, objects మరియు verbs కోసం word clouds చూపబడ్డాయి.
pretraining data సుమారు 100,000 గంటల UMI recordings నుండి వస్తుంది, 1,700 కంటే ఎక్కువ వేర్వేరు environments‌లో సేకరించబడింది. | Image: Xiaomi

Xiaomi handheld setup ఈ పరిమితిని దాటేందుకు ఉద్దేశించబడింది. వ్యక్తి gripper‌ను వేర్వేరు spaces‌లోకి తీసుకెళ్లి నేరుగా ఉపయోగించగలడు కాబట్టి, robot fleet సాధారణంగా చేరుకోలేని అనేక settings నుంచి ఉదాహరణలను కంపెనీ సేకరించగలదు. అయితే ఇది transfer సమస్యను పూర్తిగా తొలగించదు. handheld gripper, wheeled robot లేదా dual-arm system‌తో సమానం కాదు. human-operated tool‌లో రికార్డ్ అయిన motion patterns actual robots భౌతిక పరిమితులు మరియు control systems‌కు ఎలా మ్యాప్ అవుతాయో model ఇంకా నేర్చుకోవాలి.

తరువాతి దశల్లో pretrained system‌ను wheeled platforms, dual-arm systems సహా physical robots‌పైకి transfer చేసి ఆ సమస్యను పరిష్కరించామని Xiaomi చెబుతోంది. post-training కోసం, real apartments నుండి తమ recordings‌ను open-source robot datasets మరియు annotated UMI data‌తో కలిపింది. దాంతో ఒక layered pipeline కనిపిస్తుంది: manipulation experience‌ను విస్తృతంగా, తక్కువ ఖర్చుతో సేకరించండి, scale‌లో label చేయండి, తర్వాత నిజంగా పనులను అమలు చేసే hardware‌కు సరిపోయేలా adjust చేయండి.

ఇది robotics sector‌కు ముఖ్యమైనది, ఎందుకంటే ఈ field‌లో long-standing mismatch ఉంది. researchers general-purpose robot behavior కోరుకుంటున్నారు, కానీ దానికి అవసరమైన data infrastructure మాత్రం తరచూ local, custom, ఖరీదైనదిగానే ఉంది. robot AI classical robotics engineering కన్నా foundation-model development‌లా ముందుకు సాగే అవకాశముందని Xiaomi essentially వాదిస్తోంది; అక్కడ pretraining corpora నాణ్యత, పరిమాణం, వైవిధ్యం వ్యూహాత్మక assets‌గా మారతాయి.

automated labeling పెద్ద scale collection‌ను సాధ్యమవుతుంది

1,00,000 గంటల manipulation data సేకరించడం కేవలం సగం సమస్య మాత్రమే. ఆ recordings‌కు model నేర్చుకోగల descriptions కూడా అవసరం. ఆ scale‌లో manual labeling practically సాధ్యం కాదని Xiaomi చెబుతోంది, అందుకే ప్రతి motion segment‌కు text descriptions తయారు చేయడానికి మరో AI system‌ను ఉపయోగించింది. మొత్తం dataset‌ను సుమారు రెండు వారాల్లో label చేసినట్లు కంపెనీ చెబుతోంది.

ఈ దశ ముఖ్యమైనది, ఎందుకంటే spoken లేదా written instructions‌ను అనుసరించే robot models‌కు motion మరియు language మధ్య bridge అవసరం. labeling quality తగినంతగా ఉంటే, model textual goals‌ను physical actions మరియు scene changes‌తో associate చేయడం ప్రారంభిస్తుంది. labels బలహీనంగా లేదా inconsistent‌గా ఉంటే, scale alone performance‌ను కాపాడదు. Xiaomi పేర్కొన్న timeline, robotics‌లో automated annotation కేవలం convenience కాకుండా, broad generalization‌కు మద్దతు ఇచ్చేంత పెద్ద datasets నిర్మించడానికి prerequisite‌గా మారుతోందని సూచిస్తోంది.

ఈ model unfamiliar environments‌లో prior exposure లేకుండా spoken లేదా written commands‌ను follow చేయడానికి, మరియు limited extra training‌తో కొత్త tasks‌కు adapt అవడానికి రూపొందించబడింది. ఇది పెద్ద లక్ష్యమే, కానీ industryలో task-specific robot policies నుంచి settings మరియు instructions across knowledge transfer చేయగల systems వైపు వెళ్తున్న broader push‌తో ఇది సరిపోతుంది.

post-training data యొక్క మూడు భాగాల అవలోకనం, ఇందులో in-house robot recordings, mobile manipulator మరియు dual-arm robot renderings, open-source robot data, instruction labels‌తో UMI data చూపబడ్డాయి.
post-training కోసం Xiaomi real apartments నుండి తన recordings‌ను open-source robot datasets మరియు annotated UMI data‌తో కలుపుతోంది. | Image: Xiaomi

ఒక model release‌కన్నా ఎక్కువగా Xiaomi ఫలితం ఎందుకు ముఖ్యం

Xiaomi tests‌లో, model size పెరగడం performance‌ను మెరుగుపరిచింది, కానీ training data పెరగడం చాలా పెద్ద gains ఇచ్చింది. ఇదే ప్రధాన takeaway. ఇది Xiaomi internal evaluation‌ను మించి కూడా నిలిస్తే, better robot manipulation‌కు వేగవంతమైన మార్గం ever-larger architectures మాత్రమే కాదని సూచిస్తుంది. richer, more varied physical experience సేకరించి, దాన్ని scale‌లో language‌కు అనుసంధానించే సామర్థ్యమే కావచ్చు.

దీంతో కంపెనీలు capital‌ను ఎలా కేటాయిస్తాయో practical implications ఉన్నాయి. bigger models‌కు ఎక్కువ compute అవసరం, కానీ larger and more diverse datasets‌కు collection systems, annotation pipelines, storage, curation, transfer methods అవసరం, ఇవి messy real-world variation‌ను అర్థం చేసుకోగలగాలి. ఈ operational problems‌ను పరిష్కరించిన కంపెనీ, model scaling alone‌తో replicate చేయడం కష్టమైన advantage పొందవచ్చు.

ఇది robotics‌లో కీలక ప్రశ్నను కూడా మరోలా framing చేస్తోంది: model ఎంత intelligent అనే దానికన్నా, అది physical world‌ను ఎంతవరకు చూసింది అన్నదే ముఖ్యం. language models కోసం internet ఆ breadth‌ను ఇచ్చింది. robots కోసం అలాంటి off-the-shelf corpus లేదు. Xiaomi పని, ఆ corpus‌ను కొత్త tools, workflows‌తో పరిశ్రమే తయారు చేయాల్సి ఉంటుందని, అది స్వయంగా వచ్చేదాకా వేచి ఉండకూడదని సూచిస్తోంది.

ఇంకా కొన్ని open questions ఉన్నాయి. అందించిన material‌లో independent benchmarking details, deployment results, specific tasks across failure rates లేవు. substantial different robot forms‌కు transfer చేసినప్పుడు model performance ఎంతవరకు నిలుపుకుంటుందో కూడా చూపించలేదు. కానీ ఈ caveats ఉన్నప్పటికీ, headline model size నుంచి data generation అనే తక్కువ glamor ఉన్న సమస్య వైపు దృష్టిని మళ్లించడంతో ఈ release ప్రత్యేకంగా నిలుస్తోంది.

ఇళ్లలో, workplaces‌లో, public spaces‌లో పనిచేయగల machines తయారు చేయాలని ఉత్సాహంగా ఉన్న industryకి, ఇదే మరింత కీలకమైన మార్పు కావొచ్చు. Xiaomi ఒక robot model‌ను మాత్రమే ప్రవేశపెట్టడం లేదు. robot AIలో తదుపరి పురోగతి ఎక్కడి నుంచి వస్తుందో గురించి ఒక వాదనను ముందుకు తెస్తోంది: physical world‌తో విస్తృత సంబంధం, enough volume, variety‌తో రికార్డ్ చేయబడితే, robots modern AIకి దగ్గరగా ఉన్న scale‌లో అనుభవం నుంచి నేర్చుకోవడం ప్రారంభించగలవు.

ఈ వ్యాసం The Decoder నివేదికపై ఆధారపడింది. మూల వ్యాసాన్ని చదవండి.

Originally published on the-decoder.com