Skild AI、ロボット学習について大胆な主張を行う
Skild AIは、自社の旗艦ロボット基盤モデルS1を発表し、より汎用的なロボティクスへ向かう重要な一歩として位置づけている。中心的な主張は野心的だ。新しいタスクごとにロボットを再学習させるのではなく、S1は人間がそのタスクを実行する1本の動画をプロンプトの一部として受け取り、その振る舞いをロボット上で再現できるという。システムが説明どおりに動作するなら、ロボティクスの大規模展開を妨げてきた、タスクごとの遅い適応からの顕著な転換を意味するだろう。
2023年設立の同社は、汎用ロボット脳と呼ぶものを実現するために、約17億ドルを調達している。この規模の資金調達は、ロボティクスがソフトウェア分野で大規模言語モデルがたどった道を追う可能性を、投資家が非常に真剣に受け止めていることを示している。つまり、大規模で多様なデータで汎用モデルを学習し、その後はプロンプトと文脈によって多様な下流用途へ適応させるという道筋だ。S1は、その枠組みを物理機械に適用できることを示す、Skild AIにとって現時点で最も明確な試みである。
S1が変えようとしていること
現在のロボティクスのワークフローでは、新しいタスクには後学習が必要になることが多い。これは、特定の動作に関するデータを集め、モデルを調整し、挙動を検証し、タスクが変わるたびに同じ工程を繰り返すことを意味する。コストは計算資源だけではない。導入を遅らせ、実用的なユースケースの幅を狭め、構造化されていない環境へのロボット展開を難しくする。
Skild AIは、S1がこのボトルネックをインコンテキスト学習で解消すると述べている。CEO 兼共同創業者の Deepak Pathak 氏は、システムの動作を簡潔に説明した。人間が動作をしている動画をプロンプトの一部として与えれば、ロボットはそれに従えるという。会社によれば、対象としているのは短いデモ断片ではなく、より複雑で長期的な振る舞いだ。
この能力が実際に機能するなら、明示的な再学習から解釈への重心移動を意味するため重要だ。ロボットは、新しい指示に遭遇するたびに個別のファインチューニングを行う必要がなくなる。代わりに、行動、知覚、制御について広範な事前知識をすでに内部化した基盤モデルを使い、示された例をもとに実行時に適応する。
Skild が4種類のデータを組み合わせる理由
Skild AI の主張の重要な部分は、ロボティクスに単一の最良の学習ソースはないという点だ。Pathak 氏は、同社が事前学習に使う4つのカテゴリとして、遠隔操作データ、人間の動画、シミュレーション、データ収集用グローブを挙げた。それぞれに利点と欠点がある。遠隔操作は関連性の高いロボットデータを生むが、収集は遅く高価だ。人間の動画は豊富で多様だが、ロボットの身体性と直接は一致しない。シミュレーションはスケールしやすいが、現実の条件と乖離することがある。グローブによる取得はその中間にあり、遠隔操作ほど直接的な転移はないものの、より拡張可能な人間デモを提供できる。
Skild の立場は、この分野はしばしばこれらのパイプラインのどれか1つに過度に依存してきたというものだ。それらを組み合わせることで、あるデータの強みを別の弱みで補えると同社は述べる。人間の動画は広がりを与える。遠隔操作とグローブ取得は物理的な基盤を強化する。シミュレーションは低コストでカバレッジを広げる。狙いは、純粋なデータソースを選ぶことよりも、不完全なソースをまたいで一般化できるほど堅牢なモデルを作ることにある。
このアプローチは、学習データの規模と多様性が驚くべき汎化を生みうるという、AI全体の大きな流れを反映している。ただしロボティクスにはより厳しい制約がある。モデル出力は物理世界と相互作用しなければならない。ソフトウェアの誤りは不便で済むかもしれないが、ロボットの誤りは物損やタスク失敗、安全上のリスクにつながりうる。そのため、データ戦略は付随的ではなく中心的な課題になる。
単一市場ではなく、多数のロボットを対象にしたモデル
Skild AI の発表で注目すべきもう1つの点は、同社が何をしていないかだ。S1 を単一業界や厳密に定義された1つのロボット作業に絞っていない。代わりに、さまざまな形態や用途を支える横断的な基盤として位置づけている。これは大胆なポジショニングだ。垂直型のロボット企業は、対象を絞り、環境を管理し、1つのワークフローに最適化することで成功することが多い。Skild は、より汎用的なシステムが複数のカテゴリで有用になりうると賭けている。
その約束は明確だ。共通の基盤モデルがあれば、ロボティクス開発の断片化を減らし、開発者やメーカーは各デバイスごとに知覚や行動のスタックを一から作り直すのではなく、共有能力の上に構築できる。特に、タスクが頻繁に変わる場面や事前に完全には台本化できない場面では、デモから導入までの道のりを短縮できる可能性もある。
リスクも同様に明白だ。汎用性は約束しやすいが、証明するのは難しい。The Robot Report の記事は、Skild の学習設計と推論手法の説明をもとにこの発表を伝えているが、提供された本文には独立したベンチマークは示されていない。つまり、最も重要な未解決の問いは、異なるロボット本体、変化する環境、エッジケース、障害回復など、多様な実世界条件での性能だ。
この発表が今重要な理由
こうした未解決の問いが残るとしても、S1 はロボティクス分野が向かう方向を示す重要な発表だ。この分野は、限定的な自動化から、タスクや機械をまたいで学習を移転しようとするモデル中心のシステムへ移行している。企業は今や、ソフトウェアエージェントのように指示でき、手作業の設計負担の多くをデモと文脈で置き換えられるロボットを求めている。
Skild AI の発表は、ロボティクスが主流の AI 開発とどれほど近づいているかも示している。基盤モデル、プロンプト、多モーダルデータ、インコンテキスト学習は、もはやソフトウェアだけの概念ではない。物理的知能を組織する考え方にもなりつつある。S1 が画期的なプラットフォームになるにせよ、通過点にとどまるにせよ、この発表は、先進的なロボティクス企業が進歩の起こり方をどう考えているかの実際の変化を示している。
率直に言えば、ロボットが汎用学習を解決したわけではない。だが、業界で最も資金調達の進んだスタートアップの1つが、ロボティクスのスケーリング問題に対する具体的な答えを提示している。広く学習し、複数のデータソースを組み合わせ、プロンプト内の例により多くの適応作業を担わせる。これは重要な賭けであり、S1 がその理論を現実世界で信頼できる挙動へ変えられるのか、業界は注意深く見守ることになる。
この記事は The Robot Report の報道をもとにしています。元記事を読む。
Originally published on therobotreport.com


