రోబో మోడళ్లను పెద్దవిగా చేయకముందు రోబో డేటాను విస్తరించాలని Xiaomi వాదిస్తోంది
Xiaomi కొత్త robotics model అయిన Xiaomi-Robotics-1ను విడుదల చేసింది. ఇది తదుపరి తరం robot systems శిక్షణను తీర్చిదిద్దగల ఒక వాదనపై ఆధారపడింది: వాస్తవ ప్రపంచంలో వస్తువులను నిర్వహించే యంత్రాల విషయంలో, పెద్ద మోడళ్లకన్నా ఎక్కువ data ముఖ్యం కావచ్చు.
ఈ తుది అభిప్రాయం పెద్ద language modelsలో కనిపించే పరిచిత నమూనాను గుర్తు చేస్తుంది; training data మరియు compute పెరిగే కొద్దీ performance సాధారణంగా మెరుగవుతుంది. కానీ roboticsలో వేరే bottleneck ఉంది. text modelsకి విస్తృత public internet అందుబాటులో ఉంటుంది. robot modelsకి కాదు. grasping, lifting, placing, unfamiliar spacesకు adapt అవడం కోసం ఉపయోగకరమైన data సేకరించడం చాలా కష్టం, label చేయడం మరింత ఖరీదు, మరియు సాధారణంగా narrow hardware setupsకు మాత్రమే పరిమితం అవుతుంది.
Xiaomi విధానం గమనించదగ్గది, ఎందుకంటే అది ప్రధానంగా ఖరీదైన physical robot fleetsపై ఆధారపడకుండా ఈ bottleneckను అధిగమించడానికి ప్రయత్నిస్తోంది. బదులుగా, camerasతో కూడిన portable handheld grippers ఉపయోగించి pretraining dataలో ఎక్కువ భాగాన్ని సేకరించినట్లు కంపెనీ చెబుతోంది. ప్రజలు వాటిని నేరుగా చేతితో నిజ జీవిత పరిసరాల్లో ఉపయోగించి, kitchens, offices, stores, factory floors, outdoor settings వంటి ప్రదేశాల్లో manipulation tasksను capture చేశారు.
దీని ఫలితంగా, 1,700 కంటే ఎక్కువ వేర్వేరు environmentsలో సేకరించిన 1,00,000 గంటలకుపైగా motion recordings ఉన్న dataset ఏర్పడిందని కంపెనీ చెబుతోంది. ఈ scale ముఖ్యమైంది, ఎందుకంటే robot learning systems సాధారణంగా పరిమిత collection runsలో చూసిన layouts, objects, routinesలకు మించి generalize కావడంలో ఇబ్బంది పడతాయి. ప్రారంభ data-gathering దశలో full robot platformsకు బదులుగా handheld equipment ఉపయోగించడం ద్వారా, Xiaomi విస్తృత అనుభవాన్ని వేగంగా, తక్కువ ఖర్చుతో సేకరించగలమని వాదిస్తోంది.
రోబోటిక్స్లో data shortageకు భిన్నమైన సమాధానం
robot manipulation data సేకరించడానికి standard method నెమ్మదైనది. ఒక వ్యక్తి రోబోట్ను రిమోట్గా task-by-task movements ద్వారా నడిపిస్తాడు, దాంతో ఆ machine sensors, joints, grippersకు అనుకూలమైన demonstrations రూపొందుతాయి. ఈ method పని చేయగలదు, కానీ పెద్ద స్థాయికి సులభంగా విస్తరించదు, మరియు తరచూ ఒకే తరహా environments నుంచి పునరావృత samplesను ఇస్తుంది.

Xiaomi handheld setup ఈ పరిమితిని దాటేందుకు ఉద్దేశించబడింది. వ్యక్తి gripperను వేర్వేరు spacesలోకి తీసుకెళ్లి నేరుగా ఉపయోగించగలడు కాబట్టి, robot fleet సాధారణంగా చేరుకోలేని అనేక settings నుంచి ఉదాహరణలను కంపెనీ సేకరించగలదు. అయితే ఇది transfer సమస్యను పూర్తిగా తొలగించదు. handheld gripper, wheeled robot లేదా dual-arm systemతో సమానం కాదు. human-operated toolలో రికార్డ్ అయిన motion patterns actual robots భౌతిక పరిమితులు మరియు control systemsకు ఎలా మ్యాప్ అవుతాయో model ఇంకా నేర్చుకోవాలి.
తరువాతి దశల్లో pretrained systemను wheeled platforms, dual-arm systems సహా physical robotsపైకి transfer చేసి ఆ సమస్యను పరిష్కరించామని Xiaomi చెబుతోంది. post-training కోసం, real apartments నుండి తమ recordingsను open-source robot datasets మరియు annotated UMI dataతో కలిపింది. దాంతో ఒక layered pipeline కనిపిస్తుంది: manipulation experienceను విస్తృతంగా, తక్కువ ఖర్చుతో సేకరించండి, scaleలో label చేయండి, తర్వాత నిజంగా పనులను అమలు చేసే hardwareకు సరిపోయేలా adjust చేయండి.
ఇది robotics sectorకు ముఖ్యమైనది, ఎందుకంటే ఈ fieldలో long-standing mismatch ఉంది. researchers general-purpose robot behavior కోరుకుంటున్నారు, కానీ దానికి అవసరమైన data infrastructure మాత్రం తరచూ local, custom, ఖరీదైనదిగానే ఉంది. robot AI classical robotics engineering కన్నా foundation-model developmentలా ముందుకు సాగే అవకాశముందని Xiaomi essentially వాదిస్తోంది; అక్కడ pretraining corpora నాణ్యత, పరిమాణం, వైవిధ్యం వ్యూహాత్మక assetsగా మారతాయి.
automated labeling పెద్ద scale collectionను సాధ్యమవుతుంది
1,00,000 గంటల manipulation data సేకరించడం కేవలం సగం సమస్య మాత్రమే. ఆ recordingsకు model నేర్చుకోగల descriptions కూడా అవసరం. ఆ scaleలో manual labeling practically సాధ్యం కాదని Xiaomi చెబుతోంది, అందుకే ప్రతి motion segmentకు text descriptions తయారు చేయడానికి మరో AI systemను ఉపయోగించింది. మొత్తం datasetను సుమారు రెండు వారాల్లో label చేసినట్లు కంపెనీ చెబుతోంది.
ఈ దశ ముఖ్యమైనది, ఎందుకంటే spoken లేదా written instructionsను అనుసరించే robot modelsకు motion మరియు language మధ్య bridge అవసరం. labeling quality తగినంతగా ఉంటే, model textual goalsను physical actions మరియు scene changesతో associate చేయడం ప్రారంభిస్తుంది. labels బలహీనంగా లేదా inconsistentగా ఉంటే, scale alone performanceను కాపాడదు. Xiaomi పేర్కొన్న timeline, roboticsలో automated annotation కేవలం convenience కాకుండా, broad generalizationకు మద్దతు ఇచ్చేంత పెద్ద datasets నిర్మించడానికి prerequisiteగా మారుతోందని సూచిస్తోంది.
ఈ model unfamiliar environmentsలో prior exposure లేకుండా spoken లేదా written commandsను follow చేయడానికి, మరియు limited extra trainingతో కొత్త tasksకు adapt అవడానికి రూపొందించబడింది. ఇది పెద్ద లక్ష్యమే, కానీ industryలో task-specific robot policies నుంచి settings మరియు instructions across knowledge transfer చేయగల systems వైపు వెళ్తున్న broader pushతో ఇది సరిపోతుంది.

ఒక model releaseకన్నా ఎక్కువగా Xiaomi ఫలితం ఎందుకు ముఖ్యం
Xiaomi testsలో, model size పెరగడం performanceను మెరుగుపరిచింది, కానీ training data పెరగడం చాలా పెద్ద gains ఇచ్చింది. ఇదే ప్రధాన takeaway. ఇది Xiaomi internal evaluationను మించి కూడా నిలిస్తే, better robot manipulationకు వేగవంతమైన మార్గం ever-larger architectures మాత్రమే కాదని సూచిస్తుంది. richer, more varied physical experience సేకరించి, దాన్ని scaleలో languageకు అనుసంధానించే సామర్థ్యమే కావచ్చు.
దీంతో కంపెనీలు capitalను ఎలా కేటాయిస్తాయో practical implications ఉన్నాయి. bigger modelsకు ఎక్కువ compute అవసరం, కానీ larger and more diverse datasetsకు collection systems, annotation pipelines, storage, curation, transfer methods అవసరం, ఇవి messy real-world variationను అర్థం చేసుకోగలగాలి. ఈ operational problemsను పరిష్కరించిన కంపెనీ, model scaling aloneతో replicate చేయడం కష్టమైన advantage పొందవచ్చు.
ఇది roboticsలో కీలక ప్రశ్నను కూడా మరోలా framing చేస్తోంది: model ఎంత intelligent అనే దానికన్నా, అది physical worldను ఎంతవరకు చూసింది అన్నదే ముఖ్యం. language models కోసం internet ఆ breadthను ఇచ్చింది. robots కోసం అలాంటి off-the-shelf corpus లేదు. Xiaomi పని, ఆ corpusను కొత్త tools, workflowsతో పరిశ్రమే తయారు చేయాల్సి ఉంటుందని, అది స్వయంగా వచ్చేదాకా వేచి ఉండకూడదని సూచిస్తోంది.
ఇంకా కొన్ని open questions ఉన్నాయి. అందించిన materialలో independent benchmarking details, deployment results, specific tasks across failure rates లేవు. substantial different robot formsకు transfer చేసినప్పుడు model performance ఎంతవరకు నిలుపుకుంటుందో కూడా చూపించలేదు. కానీ ఈ caveats ఉన్నప్పటికీ, headline model size నుంచి data generation అనే తక్కువ glamor ఉన్న సమస్య వైపు దృష్టిని మళ్లించడంతో ఈ release ప్రత్యేకంగా నిలుస్తోంది.
ఇళ్లలో, workplacesలో, public spacesలో పనిచేయగల machines తయారు చేయాలని ఉత్సాహంగా ఉన్న industryకి, ఇదే మరింత కీలకమైన మార్పు కావొచ్చు. Xiaomi ఒక robot modelను మాత్రమే ప్రవేశపెట్టడం లేదు. robot AIలో తదుపరి పురోగతి ఎక్కడి నుంచి వస్తుందో గురించి ఒక వాదనను ముందుకు తెస్తోంది: physical worldతో విస్తృత సంబంధం, enough volume, varietyతో రికార్డ్ చేయబడితే, robots modern AIకి దగ్గరగా ఉన్న scaleలో అనుభవం నుంచి నేర్చుకోవడం ప్రారంభించగలవు.
ఈ వ్యాసం The Decoder నివేదికపై ఆధారపడింది. మూల వ్యాసాన్ని చదవండి.
Originally published on the-decoder.com

