Xiaomiは、ロボットモデルを大きくする前にロボットデータを大きくすべきだと主張する
Xiaomiは、新しいロボティクスモデル Xiaomi-Robotics-1 を公開した。これは、次世代のロボットシステムの学習方法を左右しうる主張に基づいている。現実世界で機械に物体を操作させるには、より大きなモデルよりも、より多くのデータのほうが重要かもしれないというものだ。
この結論は、大規模言語モデルでおなじみの傾向を思い起こさせる。訓練データと計算資源が増えるほど性能が向上することが多いからだ。しかしロボティクスには別のボトルネックがある。テキストモデルは膨大な公開インターネットを利用できるが、ロボットモデルはそうはいかない。物をつかみ、持ち上げ、置き、未知の空間に適応するための有用なデータは、はるかに収集が難しく、ラベル付けにはさらに費用がかかり、しかも通常は限られたハードウェア構成に縛られている。
Xiaomiのアプローチが注目されるのは、このボトルネックを、高価な実機ロボットの大規模フリートに主として依存せずに打ち破ろうとしている点にある。代わりに同社は、カメラを備えた携帯型のハンドヘルド・グリッパーを使って、事前学習データの大半を収集したという。人がこれらの道具を実際の環境で手に持って直接操作し、キッチン、オフィス、店舗、工場の床、屋外などでのマニピュレーション作業を記録した。
同社によると、その結果、10万時間超の動作記録からなるデータセットが、1,700以上の異なる環境で収集された。こうした規模が重要なのは、ロボット学習システムは、狭く台本化された収集実験で見た配置、物体、手順を超えて一般化するのに苦労しがちだからだ。初期のデータ収集段階で完全なロボットプラットフォームではなくハンドヘルド機器を使うことで、Xiaomiは、より広い経験をより速く、より低コストで集められると主張している。
ロボティクスのデータ不足に対する別解
ロボットのマニピュレーションデータを収集する標準的な方法は遅い。人がロボットを遠隔操作し、1動作ずつタスクを進めることで、その機械のセンサー、関節、グリッパーに合わせたデモンストレーションを作る。この方法は機能するが、拡張しにくく、似たような環境からの反復的なサンプルになりやすい。

Xiaomiのハンドヘルド構成は、この制約を回避することを狙っている。人がグリッパーをさまざまな場所に持ち込み、そのまま使えるため、通常のロボットフリートよりはるかに多様な環境から例を収集できるからだ。ただし、これは移転の問題を解消するわけではない。ハンドヘルドのグリッパーは、車輪付きロボットや両腕システムとは同じではない。モデルはなお、人が操作した道具の動作パターンを、実際のロボットの物理制約や制御システムにどう対応させるかを学習する必要がある。
Xiaomiは、事前学習済みシステムを後段で実機ロボットへ移し替えることでこれに対処したとしており、車輪付きプラットフォームや両腕システムも含まれる。後学習では、自社の実際のアパートでの記録に、オープンソースのロボットデータセットや注釈付き UMI データを組み合わせた。そこから見えてくるのは、広く安価にマニピュレーション経験を集め、大規模にラベル付けし、その後で実際にタスクを実行するハードウェアに適応させる多層的なパイプラインだ。
これはロボティクス業界全体にとって重要かもしれない。というのも、この分野は長年、不快なズレに悩まされてきたからだ。研究者は汎用的なロボット行動を望むが、それを学習させるためのデータ基盤は、依然として局所的で、個別設計で、高価なままである。Xiaomiは実質的に、ロボットAIの進展は従来のロボット工学よりも、基盤モデル開発に近い形で進むかもしれないと主張している。そこでは、事前学習コーパスの質・量・多様性が戦略資産になる。
自動ラベリングが大規模収集を現実的にする
10万時間のマニピュレーションデータを集めるのは、問題の半分にすぎない。これらの記録には、モデルが学習できる説明も必要だ。Xiaomiは、この規模での手作業ラベリングは現実的ではなかったため、別のAIシステムを使って各動作セグメントのテキスト説明を生成したという。同社は、データセット全体のラベル付けを約2週間で完了したとしている。
この工程が重要なのは、音声や文章の指示に従うよう設計されたロボットモデルには、動作と言語の橋渡しが必要だからだ。ラベルの質が十分に高ければ、モデルはテキスト上の目標を物理的な行動やシーン変化と結びつけ始められる。ラベルが弱い、あるいは一貫性がないなら、規模を拡大するだけでは性能は救えない。Xiaomiの公表されたスケジュールは、自動アノテーションがロボティクスで中心的になりつつあることを示唆している。単なる便利機能ではなく、広い一般化を支えるのに十分な大規模データセットを作るための前提条件としてだ。
モデル自体は、未知の環境で事前の接触なしに音声または書面のコマンドに従い、少ない追加学習で新しいタスクに適応するよう設計されている。野心的な目標だが、タスク固有のロボット方策から、環境や指示をまたいで知識を移転できるシステムへ移行しようとする業界全体の流れと一致している。

なぜXiaomiの結果は1つのモデル発表以上の意味を持つのか
Xiaomiのテストでは、モデルサイズを増やすことでも性能は向上したが、訓練データを増やしたほうがはるかに大きな改善が得られた。これが核心だ。もしこれがXiaomi内部の評価を超えて成り立つなら、ロボットのマニピュレーションを最短で改善する道は、より大きなアーキテクチャを作り続けることではなく、より豊かで多様な物理経験を集め、それを大規模に言語へ結びつける能力にあることを示すだろう。
これは、企業が資本をどう配分するかに実務上の意味を持つ。大きなモデルはより多くの計算資源を要求するが、より大規模で多様なデータセットは、収集システム、アノテーションのパイプライン、保存、キュレーション、そして雑多な現実の変動を受け止める転移手法を必要とする。そうした運用上の問題を解決した企業は、モデルのスケーリングだけでは再現しにくい優位性を得るかもしれない。
またこれは、ロボティクスにおける重要な問いを言い換える。抽象的にどれだけ賢いかだけでなく、そのモデルが物理世界をどれだけ実際に見てきたか、という問いだ。言語モデルにとっては、インターネットがその広がりを提供した。ロボットには、それに相当する既製のコーパスはない。Xiaomiの取り組みは、そのコーパスは新しいツールとワークフローで作り出す必要があり、自然に現れるのを待つべきではないことを示唆している。
なお、未解決の点は残っている。提供された資料には、独立したベンチマークの詳細、実運用の結果、特定タスクでの失敗率は含まれていない。また、かなり異なるロボット形態間で移したときに性能がどの程度維持されるかも示されていない。それでも、この発表が目を引くのは、見出しになりやすいモデルサイズから、より地味なデータ生成の問題へと焦点を移しているからだ。
家庭、職場、公共空間で動く機械を作りたい業界にとって、それはより重要な変化かもしれない。Xiaomiは単にロボットモデルを示したのではない。ロボットAIの次の進歩がどこから来るかについての議論を提示しているのだ。それは、物理世界とのより広い接触を、ロボットが経験から学び始められるほど十分な量と多様性で記録することだ。そうした規模は、現代AIに近い学習を可能にする。
この記事は The Decoder の報道に基づいています。元記事を読む。
Originally published on the-decoder.com

