রোবট মডেল বড় করার আগে রোবট ডেটা বড় করার পক্ষে Xiaomi-এর যুক্তি
Xiaomi একটি নতুন robotics model, Xiaomi-Robotics-1, প্রকাশ করেছে, যা পরবর্তী প্রজন্মের robot systems প্রশিক্ষণকে প্রভাবিত করতে পারে এমন এক দাবির ওপর দাঁড়িয়ে আছে: বাস্তব দুনিয়ায় বস্তু পরিচালনার ক্ষেত্রে বড় model-এর চেয়ে data বেশি গুরুত্বপূর্ণ হতে পারে.
এই উপসংহার large language model-এর পরিচিত ধারা মনে করিয়ে দেয়, যেখানে training data ও compute বাড়লে performance প্রায়ই উন্নত হয়। কিন্তু robotics-এ একটি আলাদা bottleneck আছে। text models বিশাল public internet থেকে টানতে পারে। robot models পারে না। grasping, lifting, placing, unfamiliar spaces-এ মানিয়ে নেওয়ার মতো দরকারি data সংগ্রহ করা অনেক কঠিন, label করা অনেক ব্যয়বহুল, এবং সাধারণত narrow hardware setups-এর সঙ্গে বাঁধা থাকে.
Xiaomi-এর পদ্ধতিটি উল্লেখযোগ্য, কারণ এটি মূলত ব্যয়বহুল physical robot fleets-এর ওপর নির্ভর না করে এই bottleneck ভাঙতে চায়। বরং company বলছে, camera-যুক্ত portable handheld gripper ব্যবহার করে pretraining data-র বড় অংশ সংগ্রহ করা হয়েছে। মানুষ সরাসরি হাতে সেই tools চালিয়ে kitchens, offices, stores, factory floors, outdoor settings-এর মতো জায়গায় manipulation task capture করেছে.
ফলাফল হিসেবে ১,৭০০-এরও বেশি ভিন্ন পরিবেশ থেকে সংগৃহীত ১,০০,০০০ ঘণ্টার বেশি motion recordings-সহ একটি dataset তৈরি হয়েছে বলে company জানায়। এই scale গুরুত্বপূর্ণ, কারণ robot learning systems সাধারণত limited collection run-এ দেখা layout, object, routine-এর বাইরে generalize করতে হিমশিম খায়। প্রাথমিক data-gathering ধাপে full robot platform-এর বদলে handheld equipment ব্যবহার করে Xiaomi বলছে, কম খরচে এবং দ্রুত আরও বিস্তৃত experience সংগ্রহ করা যায়.
রোবোটিক্সের data shortage-এর ভিন্ন সমাধান
robot manipulation data সংগ্রহের standard পদ্ধতি ধীর। একজন মানুষ দূর থেকে একটি robot-কে task-by-task movement দিয়ে চালায়, ফলে সেই machine-এর sensor, joint, gripper অনুযায়ী demonstrations তৈরি হয়। পদ্ধতিটি কাজ করতে পারে, কিন্তু এটি সহজে scale হয় না, এবং প্রায়ই একই ধরনের পরিবেশ থেকে পুনরাবৃত্ত sample দেয়.

Xiaomi-এর handheld setup সেই সীমাবদ্ধতা এড়াতে তৈরি। কারণ একজন ব্যক্তি gripper-টি বিভিন্ন স্থানে নিয়ে গিয়ে সরাসরি ব্যবহার করতে পারেন, তাই company অনেক বেশি পরিবেশ থেকে উদাহরণ সংগ্রহ করতে পারে, যা সাধারণত robot fleet-এর পক্ষে কভার করা কঠিন। তবে এতে transfer সমস্যা পুরোপুরি মেটে না। handheld gripper wheel-চালিত robot বা dual-arm system-এর মতো নয়। human-operated tool-এ রেকর্ড হওয়া movement pattern-গুলো actual robot-এর physical constraint ও control system-এর সঙ্গে কীভাবে মেলে, model-কে তা এখনো শিখতে হয়.
পরবর্তী ধাপে real robot-এ pretrained system transfer করে, যার মধ্যে wheeled platform এবং dual-arm system ছিল, Xiaomi সেই সমস্যা সমাধান করেছে বলে জানায়। post-training-এর জন্য company নিজস্ব real apartment recording-কে open-source robot dataset এবং annotated UMI data-এর সঙ্গে মিলিয়েছে। এর ফলে একটি layered pipeline দেখা যায়: manipulation experience বড় পরিসরে ও কম খরচে সংগ্রহ করুন, তারপর scale-এ label করুন, এবং শেষে বাস্তবে কাজ চালানো hardware-এর সঙ্গে মানানসই করে নিন.
এটি wider robotics sector-এর জন্য গুরুত্বপূর্ণ, কারণ এই field বহুদিন ধরে এক অস্বস্তিকর অমিলের সঙ্গে লড়ছে। গবেষকেরা general-purpose robot behavior চান, কিন্তু তার training-এর data infrastructure প্রায়ই local, custom, এবং ব্যয়বহুল রয়ে গেছে। Xiaomi কার্যত বলছে, robot AI হয়তো classical robotics engineering-এর চেয়ে foundation-model development-এর মতো এগোবে, যেখানে pretraining corpus-এর quality, size, diversity strategic asset হয়ে ওঠে.
স্বয়ংক্রিয় labeling বড় scale collection-কে সম্ভব করে
১,০০,০০০ ঘণ্টার manipulation data সংগ্রহ করা সমস্যার অর্ধেক মাত্র। সেই recording-গুলোর জন্য model-কে শেখার মতো descriptionও দরকার। এত বড় scale-এ manual labeling বাস্তবসম্মত ছিল না বলে Xiaomi জানায়, তাই প্রতিটি motion segment-এর জন্য text description তৈরি করতে আরেকটি AI system ব্যবহার করা হয়েছে। company বলছে, পুরো dataset প্রায় দুই সপ্তাহে label করা হয়েছে.
এই ধাপটি গুরুত্বপূর্ণ, কারণ spoken বা written instruction অনুসরণ করার জন্য তৈরি robot model-গুলোর motion ও language-এর মধ্যে একটি bridge দরকার। labeling quality যথেষ্ট ভালো হলে model text লক্ষ্যকে physical action ও scene change-এর সঙ্গে যুক্ত করতে শুরু করতে পারে। labels দুর্বল বা অসঙ্গত হলে scale alone performance উদ্ধার করতে পারবে না। Xiaomi-এর reported timeline ইঙ্গিত দেয়, robotics-এ automated annotation এখন শুধু সুবিধা নয়, বরং broad generalization সমর্থন করতে যথেষ্ট বড় dataset তৈরির পূর্বশর্ত হয়ে উঠছে.
মডেলটি অপরিচিত পরিবেশে পূর্ব অভিজ্ঞতা ছাড়াই spoken বা written command অনুসরণ করতে এবং সীমিত অতিরিক্ত training-এ নতুন task-এ মানিয়ে নিতে তৈরি। এটি উচ্চাভিলাষী লক্ষ্য, তবে industry-জুড়ে task-specific robot policy থেকে settings ও instruction জুড়ে knowledge transfer করতে পারে এমন system-এর দিকে যে বৃহত্তর অগ্রযাত্রা চলছে, তার সঙ্গে এটি মিলে যায়.

একটি model release-এর চেয়েও Xiaomi-এর ফল কেন বেশি গুরুত্বপূর্ণ
Xiaomi-এর পরীক্ষায় model size বাড়ালে performance উন্নত হয়েছে, কিন্তু training data বাড়ালে আরও বড় লাভ হয়েছে। এটাই মূল takeaway। যদি এটি Xiaomi-এর internal evaluation-এর বাইরে টিকে যায়, তাহলে বোঝাবে যে আরও ভালো robot manipulation-এর দ্রুততম পথ কেবল ever-larger architecture নয়। বরং richer, more varied physical experience সংগ্রহ করে সেটিকে scale-এ language-এর সঙ্গে যুক্ত করার ক্ষমতাই হতে পারে.
এর বাস্তব প্রভাব আছে কোম্পানিগুলি কীভাবে capital বরাদ্দ করবে তার ওপর। বড় model বেশি compute চায়, কিন্তু বড় ও বৈচিত্র্যময় dataset-এর জন্য collection system, annotation pipeline, storage, curation, transfer method দরকার, যা messy real-world variation সামলাতে পারে। যে company এই operational problem গুলো সমাধান করবে, সে model scaling alone দিয়ে অনুকরণ করা কঠিন এমন advantage পেতে পারে.
এটি robotics-এ একটি মূল প্রশ্ন নতুন করে তোলে: model কতটা intelligent, তার চেয়ে বেশি গুরুত্বপূর্ণ হলো সে বাস্তব দুনিয়ার কতটা দেখেছে। language model-এর জন্য internet সেই বিস্তার দিয়েছে। robot-এর জন্য তেমন off-the-shelf corpus নেই। Xiaomi-এর কাজ ইঙ্গিত দেয়, industry-কে নতুন tool ও workflow-এর মাধ্যমে সেই corpus তৈরি করতে হতে পারে, তার নিজের থেকে এসে পড়ার অপেক্ষা না করে.
এখনও কিছু প্রশ্ন খোলা আছে। দেওয়া উপকরণে independent benchmarking detail, deployment result, বা নির্দিষ্ট task-এ failure rate নেই। ভিন্ন ধরনের robot form-এ transfer করলে model performance কতটা ধরে রাখতে পারে, সেটিও দেখানো হয়নি। কিন্তু এসব সতর্কতা সত্ত্বেও release-টি আলাদা, কারণ এটি headline model size থেকে data generation-এর কম ঝলমলে সমস্যার দিকে নজর সরিয়ে দেয়.
যে industry বাড়িতে, কর্মক্ষেত্রে, এবং জনসমক্ষে কাজ করতে পারে এমন machine বানাতে চায়, তার কাছে এটিই হতে পারে বেশি গুরুত্বপূর্ণ পরিবর্তন। Xiaomi কেবল একটি robot model সামনে আনছে না। তারা robot AI-তে পরবর্তী অগ্রগতি কোথা থেকে আসতে পারে সে বিষয়ে একটি যুক্তি দিচ্ছে: physical world-এর সঙ্গে বিস্তৃত সংযোগ, যথেষ্ট পরিমাণ ও বৈচিত্র্যে ধারণ করা, যাতে robot আধুনিক AI-এর কাছাকাছি scale-এ অভিজ্ঞতা থেকে শিখতে শুরু করতে পারে.
এই প্রবন্ধটি The Decoder-এর রিপোর্টিং-এর ভিত্তিতে। মূল প্রবন্ধ পড়ুন.
Originally published on the-decoder.com


